Saltar al contenido

Open this page in English? ¿Abrir esta página en inglés?

Open in English

Diese Seite auf Deutsch öffnen? ¿Abrir esta página en alemán?

Auf Deutsch öffnen

Ouvrir cette page en français ? ¿Abrir esta página en francés?

Ouvrir en français

Vuoi aprire questa pagina in italiano? ¿Abrir esta página en italiano?

Apri in italiano

Deze pagina in het Nederlands openen? ¿Abrir esta página en neerlandés?

Openen in het Nederlands

Otworzyć tę stronę po polsku? ¿Abrir esta página en polaco?

Otwórz po polsku

Abrir esta página em português? ¿Abrir esta página en portugués?

Abrir em português

Открыть эту страницу на русском? ¿Abrir esta página en ruso?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? ¿Abrir esta página en turco?

Türkçe aç

Відкрити цю сторінку українською? ¿Abrir esta página en ucraniano?

Відкрити українською

Extraer texto de un PDF

Obtén el texto de un PDF como archivo .txt en UTF-8, en orden de lectura y sin subir el documento.

Solo en el navegador

Sin subir al servidor · Gratis · Sin uso para entrenar IA

Formatos y límites

Formatos y límites

Formatos admitidos
PDF
Resultado
TXT
En un ordenador En un móvil o tableta
Tamaño máx. por archivo 300 MB 100 MB
Máx. de páginas 2000 300

Los límites en tu dispositivo dependen de su memoria. Los archivos más grandes pueden funcionar igualmente; la herramienta te avisa antes.

Cómo funciona

  1. 01 Elige el PDF del que quieres extraer el texto.
  2. 02 Si quieres, indica las páginas o activa «Marcar dónde empieza cada página» en «Más opciones».
  3. 03 Pulsa «Extraer texto».
  4. 04 Copia el texto de la vista previa o descarga el archivo .txt.

Sobre esta herramienta

Copiar texto desde un visor de PDF suele dar líneas revueltas: dos columnas entrelazadas o un encabezado en mitad de una frase. Hushdesk mira la posición de cada carácter y reconstruye el orden de lectura, así que un artículo a dos columnas sale columna a columna y los títulos y los números de página se quedan en su sitio. Obtienes un archivo de texto UTF-8 que se abre en cualquier editor y puede ir directo a un traductor, a un índice de búsqueda o a un chatbot. Los textos en español, en ruso y en casi cualquier otro alfabeto llegan intactos. Las páginas que son solo imágenes escaneadas no contienen letras que extraer: la herramienta te dice cuáles son y te propone usar OCR.

  • Orden de lectura real

    Las columnas se detectan en cada página: un artículo a dos columnas se lee primero por la izquierda y luego por la derecha, en vez de saltar de una a otra en cada línea.

  • Cualquier alfabeto

    El archivo se guarda en UTF-8: el cirílico, las letras con tilde, la ñ, los símbolos de moneda y otros signos llegan tal como aparecen en el documento.

  • Escaneos señalados

    Cuando una página es una foto de texto, te enteras de cuál es en lugar de recibir sin más un resultado vacío.

  • Privado por diseño

    El texto lo lee un motor que funciona en la pestaña de tu navegador. Informes, contratos o documentos médicos no se envían a nadie.

Preguntas frecuentes

¿Por qué falta parte del texto en el archivo extraído?

Lo más probable es que esas páginas sean escaneos: el PDF guarda una foto de la página, no las letras. El resultado te avisa de esas páginas. Pasa primero el documento por OCR y luego extrae el texto.

¿El archivo de texto conserva las tablas y el formato?

No. Un .txt no tiene fuentes, negritas ni celdas; cada fila de una tabla se convierte en una línea con las celdas separadas por espacios. Para un documento editable que conserve el formato, usa PDF a Word.

¿Cómo se tratan las páginas a dos columnas?

La herramienta busca un hueco blanco vertical que recorra la página entre bloques de texto y lee por turnos los bloques de cada lado. Los títulos y pies que ocupan todo el ancho hacen de separadores, así que el orden resulta natural.

¿Puedo extraer el texto de solo unas pocas páginas?

Sí. Escribe páginas y rangos como 3, 7-9 en el campo «Páginas»; el resto se omite.

¿Funciona con textos en español, ruso u otros idiomas?

Sí: cualquier alfabeto que el PDF guarde como texto se extrae en UTF-8. La excepción son los idiomas que se escriben de derecha a izquierda, como el árabe o el hebreo: sus palabras pueden salir en orden inverso.

¿Se vuelven a unir las palabras cortadas con guion?

No. El guion que corta una palabra al final de una línea se queda como está en el PDF, porque la herramienta no siempre puede distinguir un guion de salto de línea de uno real.

¿Se sube el PDF para extraer su texto?

No. La lectura de los caracteres y la creación del archivo de texto se hacen en tu dispositivo, dentro de un marco que tu navegador aísla de la red.