Saltar al contenido
PDFlora

OCR y herramientas de texto para PDF escaneados

Un PDF escaneado parece un documento, pero en realidad es un montón de imágenes: no puedes buscar palabras, seleccionar texto ni convertirlo a Word. El OCR lee esas imágenes y genera texto real. Aquí verás cómo saber si lo necesitas y qué herramientas usar antes y después.

1 herramientas

PDF escaneado o PDF de texto: cómo distinguirlos

Abre el archivo e intenta seleccionar una frase con el ratón, o busca una palabra que veas en la página. Si las palabras se resaltan y la búsqueda las encuentra, el PDF ya tiene capa de texto y no necesita OCR. Si solo puedes seleccionar toda la página como un bloque, o no se encuentra nada, es un escaneo formado por imágenes.

Los documentos de escáner, las fotos hechas con el móvil y los archivos guardados como imágenes y convertidos después a PDF son escaneos. Las exportaciones de Word o de páginas web suelen ser PDF de texto. Algunos archivos mezclan ambos, con unas pocas páginas escaneadas dentro de un documento de texto; por eso OCR PDF ofrece omitir las páginas que ya contienen texto.

Qué produce OCR PDF y cómo lograr buenos resultados

OCR PDF representa cada página como imagen, reconoce los caracteres con Tesseract.js en tu navegador y genera un PDF con búsqueda (la imagen de la página con una capa de texto invisible) y, si quieres, un archivo de texto plano. Lee inglés, francés, español, árabe, alemán, italiano, portugués, neerlandés, turco y ruso, y puedes elegir varios a la vez para documentos mixtos. También acepta imágenes JPG y PNG directamente.

La precisión depende sobre todo del escaneo. Procura 300 DPI, páginas rectas, buen contraste e iluminación limpia: una foto torcida o con sombras dará más errores. La escritura a mano no se reconoce de forma fiable. En árabe y ruso, la herramienta entrega el texto reconocido como descarga .txt porque la capa de PDF con búsqueda no está disponible para esas escrituras. Calcula unos segundos por página en un portátil y más en un móvil.

  • Elige todos los idiomas que aparezcan en el documento, no solo el principal.
  • Usa 300 DPI para letra pequeña y 200 DPI para páginas limpias y rápidas.
  • Vuelve a escanear una página mala en lugar de esperar que el OCR la arregle.
  • Revisa nombres, cifras y fechas, donde un solo carácter erróneo importa.

Herramientas para usar antes y después del OCR

Antes del OCR, Escanear a PDF o Imágenes a PDF pueden reunir fotografías en un solo PDF, y Rotar PDF endereza las páginas escaneadas de lado, porque el OCR lee mejor el texto derecho. Después del OCR, PDF a texto extrae la capa de texto a un archivo .txt, PDF a Word reconstruye un documento editable y PDF a Markdown ofrece texto plano estructurado. Comparar PDF encuentra diferencias entre dos versiones, pero, como las demás, trabaja con texto real: los archivos escaneados necesitan OCR antes.

OCR PDF se ejecuta en tu navegador y tus documentos nunca se suben. El motor de OCR y los datos de idioma, unos pocos MB, se descargan una sola vez desde una CDN pública (jsDelivr) la primera vez que lo usas; la CDN ve tu dirección IP pero no tus documentos.

Preguntas frecuentes

¿Cómo sé si mi PDF necesita OCR?

Intenta seleccionar texto o buscar una palabra que veas. Si nada se resalta o la búsqueda no encuentra nada, el PDF es un escaneo y necesita OCR. Si el texto se selecciona con normalidad, ya tiene capa de texto.

¿Se suben mis documentos al ejecutar el OCR?

No. El reconocimiento se ejecuta en tu navegador. La primera vez que lo usas, el motor de OCR y los archivos de idioma se descargan desde una CDN pública (jsDelivr), que ve tu dirección IP pero nunca tus documentos.

¿Funciona el OCR con árabe y con escritura a mano?

El árabe se reconoce, pero el resultado se entrega como descarga .txt porque la capa de texto del PDF con búsqueda no está disponible para árabe ni ruso. La escritura a mano no se reconoce de forma fiable; el OCR rinde mejor con texto impreso limpio.

¿Por qué el OCR va lento con mi archivo?

Cada página se representa como imagen y se analiza en tu propio dispositivo, lo que tarda unos segundos por página en un portátil y más en un móvil. Para un documento grande usa un ordenador, elige 200 DPI si la impresión es nítida y mantén abierta la pestaña.

¿Qué hago tras el OCR para editar el texto?

Usa PDF a Word para un documento editable, o PDF a texto para texto plano. Revisa antes el resultado, porque el OCR puede leer mal algunos caracteres, sobre todo en escaneos de mala calidad.