Saltar al contenido
PDFlora

Extraer el texto de un PDF a un archivo .txt

Obtén cada palabra de un PDF como texto sin formato, página a página. Elige si mantener los espacios horizontales y marcar los cambios de página. El archivo se lee en el navegador y no se sube.

En tu navegador
Cargando la herramienta…

Cómo funciona

  1. Paso 1: Elige o suelta un PDF que contenga texto.

  2. Paso 2: Decide si conservar el diseño y si añadir separadores de página.

  3. Paso 3: Pulsa Extraer texto.

  4. Paso 4: Descarga el archivo .txt, o ábrelo y copia lo que necesites.

Qué te da la extracción de texto

La mayoría de PDF creados desde Word, una página web o un informe llevan una capa de texto: los caracteres reales, colocados en cada página. Esta herramienta lee esa capa con PDF.js y la escribe en orden de lectura, página tras página, en un archivo .txt en UTF-8 que abre cualquier editor.

Dos opciones dan forma al resultado. Conservar el diseño mantiene los espacios horizontales, así que columnas y cifras alineadas siguen alineadas con una fuente monoespaciada. Añadir separadores de página inserta una marca clara entre páginas para saber dónde empieza cada una. Sin ellas obtienes un texto continuo, más fácil de pegar en otro sitio.

Por qué usar esta herramienta

El resultado más ligero y portátil

El texto sin formato se abre en cualquier parte, pesa casi nada y funciona con buscadores, scripts y aplicaciones de notas.

Diseño cuando lo necesitas

Conserva los espacios para datos en columnas, o quítalos para obtener párrafos limpios que pegar en un correo.

Marcas de página a demanda

Los separadores permiten citar o localizar un pasaje por número de página cuando el texto ya ha salido del PDF.

Privado e inmediato

El PDF se procesa en tu navegador sin subirse, sin cuenta y sin marca de agua.

Usos habituales

  • Buscar en un montón de PDF

    Convierte manuales o artículos a texto y búscalos con el buscador de tu ordenador o una herramienta de línea de comandos.

  • Pasar texto a otra herramienta

    Pega un informe en un traductor, un resumidor, un corrector o un script de análisis sin los saltos de línea del PDF.

  • Contar palabras

    Comprueba el número de palabras de una tesis o un artículo extrayéndolo y abriendo el texto en tu editor.

  • Revisar un archivo escaneado y reconocido

    Tras usar OCR PDF, extrae el texto reconocido para corregirlo en un editor de texto.

  • Archivar las palabras de un documento

    Guarda una copia de texto ligera de material legal o académico junto al original, para poder buscar en ella dentro de años.

¿Conservar el diseño o no?

La elección depende de lo que vayas a hacer con el texto. Sin diseño, las líneas de un párrafo se unen para que el texto fluya y se pegue limpio. Con diseño se mantienen los espacios entre palabras, lo que conserva la forma de la página.

  • Sin diseño: artículos, cartas, contratos y todo lo que vayas a editar, traducir o pasar a otro programa.
  • Con diseño: listas de precios, horarios, extractos y formularios donde la alineación tiene significado. Abre el archivo con una fuente monoespaciada para que las columnas cuadren.
  • Con separadores de página: documentos largos en los que quieras poder citar el número de página.

Formatos admitidos

Entrada
Archivos PDF (.pdf) con capa de texto, sin contraseña.
Salida
Un archivo de texto sin formato (.txt).

Los PDF escaneados no tienen capa de texto: usa antes OCR PDF.

Conviene saber

  • Solo se lee la capa de texto. Las imágenes, los gráficos y el texto dibujado como imagen no se incluyen.
  • Los PDF escaneados o fotografiados devuelven poco o nada hasta que uses OCR PDF.
  • El orden de lectura sigue la posición en la página, así que los diseños a varias columnas, los recuadros y las notas al pie pueden mezclarse.
  • Las tablas pasan a ser líneas de texto; usa PDF a Excel si necesitas filas y columnas.

Tus archivos nunca salen de tu navegador

Esta herramienta se ejecuta por completo en tu dispositivo, dentro del navegador. Tus archivos no se suben a nuestros servidores ni se guardan en ningún sitio. Al cerrar la pestaña se descarta todo.

Preguntas frecuentes

¿Por qué el archivo de texto sale vacío o con huecos?

Lo más probable es que el PDF esté escaneado y sus páginas sean imágenes sin capa de texto. Usa OCR PDF para reconocer el texto y vuelve a extraerlo.

¿Se sube el PDF a un servidor?

No. El texto se lee en tu navegador y el archivo .txt se crea allí, por lo que no se sube nada.

¿Qué hace la opción de conservar el diseño?

Mantiene los espacios horizontales para que las columnas y los números alineados sigan alineados. Sin ella, el texto fluye en párrafos normales, más cómodos para pegar en otros programas.

¿Se incluyen las imágenes y las tablas?

Las imágenes no, porque no son texto. Las tablas salen como líneas de texto, sin bordes. Para una hoja de cálculo usa PDF a Excel.

¿En qué se diferencia de PDF a Word?

PDF a Word crea un documento con formato, con títulos y párrafos; aquí solo obtienes los caracteres en bruto dentro de un .txt. Elige texto cuando quieras las palabras sin ningún formato.

Siguiente pasoContinuar con OCR PDFReconoce el texto de PDF escaneados e imágenes y obtén un PDF buscable o un .txt.