Saltar al contenido
PDFlora

Convertir un PDF escaneado en texto buscable

Un escaneo es solo una foto de la página: no puedes buscar en él ni copiar una palabra. El OCR lee la imagen y descargas un PDF con texto buscable, un archivo de texto o ambos.

En tu navegador
Cargando la herramienta…

Cómo funciona

  1. Paso 1: Elige o suelta un PDF escaneado, o una imagen JPG o PNG.

  2. Paso 2: Selecciona uno o varios idiomas que coincidan con el texto y la salida: PDF buscable, archivo de texto o ambos.

  3. Paso 3: Decide si se omiten las páginas que ya tienen texto y elige 200 o 300 DPI.

  4. Paso 4: Pulsa OCR PDF, espera a que se procese cada página y descarga el resultado.

Qué hace el OCR con un documento escaneado

OCR significa reconocimiento óptico de caracteres. Cada página se dibuja como imagen, el motor de reconocimiento (Tesseract.js, que se ejecuta como WebAssembly en tu navegador) lee las letras y el texto se guarda junto con la posición de cada palabra en la página. En un PDF buscable, ese texto queda invisible detrás de la imagen original: la página se ve igual, pero puedes buscar en ella, seleccionarla y copiar fragmentos.

También puedes descargar el texto reconocido como archivo .txt, útil para pegarlo en un editor o pasarlo a otra herramienta. Primero eliges los idiomas, luego si se omiten las páginas que ya tienen texto y la resolución con la que se dibujan las páginas (200 o 300 DPI). Además de PDF, la herramienta acepta imágenes JPG y PNG como entrada.

Los documentos nunca se suben. Lo único que se descarga de la red es el motor OCR y los datos de idioma, desde un CDN público (jsDelivr) la primera vez que usas la herramienta, unos pocos megabytes en total. El CDN ve tu dirección IP y las cabeceras habituales de la petición, pero no tus documentos.

Por qué usar esta herramienta

Documentos sin subir

El reconocimiento se hace en tu navegador. Solo se descargan, una vez, el motor y los archivos de idioma desde un CDN público; tus páginas no salen de tu dispositivo.

Buscable y seleccionable

Con idiomas de alfabeto latino obtienes un PDF donde Ctrl+F funciona y puedes resaltar y copiar un párrafo, manteniendo el aspecto original de la página.

Diez idiomas, combinables

Hay inglés, francés, español, árabe, alemán, italiano, portugués, neerlandés, turco y ruso, y puedes marcar varios para páginas bilingües.

Omite lo que ya es texto

En un archivo que mezcla escaneos y páginas digitales, puedes dejar aparte las páginas que ya tienen texto y ahorrar tiempo.

Usos habituales

  • Buscar en un archivo de cartas antiguas escaneadas

    Un archivo familiar o una pequeña oficina tiene cientos de escaneos nombrados solo por fecha. Tras el OCR, buscas un apellido en todos los resultados en lugar de abrir cada archivo.

  • Copiar un pasaje de un capítulo escaneado

    Una estudiante fotografía un capítulo en la biblioteca y necesita una cita. El OCR lo convierte en texto que puede pegar en su trabajo y revisar después.

  • Extraer el texto de un documento en árabe o ruso

    Para estos alfabetos la herramienta entrega el texto reconocido como descarga .txt, de modo que un contrato o aviso escaneado se pueda llevar a un editor o traducir.

  • Preparar un escaneo para otra herramienta

    PDF a Word, PDF a Excel, PDF a texto y Comparar PDF leen texto y no encuentran nada en un escaneo. Pasa primero por OCR PDF para darles algo con lo que trabajar.

  • Digitalizar tickets y facturas

    Un autónomo con la foto de un ticket en el móvil usa el JPG como entrada y obtiene texto del que copiar importes y fechas.

Páginas escaneadas o páginas que ya tienen texto

No todos los PDF necesitan OCR. Un archivo exportado desde un procesador de textos ya contiene texto real, y aplicarle OCR solo añadiría trabajo y pequeños errores. Un escaneo, en cambio, contiene solo imágenes. Prueba rápida: abre el archivo e intenta seleccionar una palabra con el cursor. Si no se resalta nada, o Ctrl+F no encuentra nada, las páginas son imágenes.

Los archivos mixtos son habituales, por ejemplo un contrato digital con unas páginas de firma escaneadas. La opción de omitir las páginas que ya tienen texto lo resuelve: las páginas digitales quedan intactas y solo se procesan las escaneadas. Después, el PDF buscable funciona con todas las herramientas de texto, así que puedes seguir con Comprimir PDF, PDF a Word o PDF a texto con resultados útiles.

  • Prueba primero: si puedes seleccionar texto, la página no es un escaneo.
  • Usa la opción de omitir en documentos mixtos.
  • Busca después una palabra característica para confirmar el resultado.

Elegir idiomas y entender los alfabetos

El motor lee mejor cuando sabe qué esperar: selecciona el idioma del texto, no solo el que tú hablas. Si una página mezcla francés e inglés, marca ambos; el reconocimiento tarda algo más, pero deja de confundir los acentos de un idioma con ruido. Marcar muchos idiomas que no necesitas ralentiza el proceso y puede causar lecturas erróneas, así que elige solo los que aparecen en la página.

Hay una diferencia importante entre alfabetos. Para los idiomas de alfabeto latino (inglés, francés, español, alemán, italiano, portugués, neerlandés y turco), la herramienta puede crear un PDF buscable cuya capa de texto invisible queda detrás de la imagen de la página. Para árabe y ruso, que usan otros alfabetos, esa capa buscable no está disponible en esta herramienta. Los reconoce, pero entrega el resultado como archivo .txt. Si necesitas un PDF árabe buscable, esta herramienta no lo generará.

  • Página bilingüe: marca los dos idiomas.
  • Árabe o ruso: usa la descarga .txt.
  • Cifras, fechas y nombres latinos dentro de una página árabe conviene revisarlos a ojo.

Cómo conseguir el resultado más preciso

La calidad de la imagen importa más que cualquier ajuste. La entrada más fiable es una página escaneada a 300 DPI, bien recta sobre el cristal, con luz uniforme y texto oscuro sobre fondo claro. Las fotos torcidas, las sombras, los pliegues, la tinta desvaída y la letra muy pequeña reducen la precisión. Si fotografías una página con el móvil, sostenlo paralelo al papel, evita tu propia sombra y llena el encuadre con la página.

Usa 300 DPI para letra pequeña, notas al pie y páginas densas, y 200 DPI cuando el texto es grande y quieres ir más rápido. Una resolución mayor también implica más memoria y más tiempo por página. Las tablas y los diseños a varias columnas se leen línea a línea, por lo que el orden del texto puede no coincidir con el diseño visual; revisa esas zonas a ojo.

  • Escanea a 300 DPI o más siempre que puedas.
  • Endereza y recorta las páginas inclinadas antes del OCR.
  • No esperes un reconocimiento fiable de la escritura a mano.
  • Revisa nombres, cifras y fechas comparándolos con la página original.

Formatos admitidos

Entrada
Archivos PDF (.pdf) e imágenes (.jpg, .jpeg, .png).
Salida
Un PDF buscable (imagen de la página más texto invisible) y/o un archivo de texto .txt.

La capa de texto del PDF buscable cubre idiomas de alfabeto latino. Para árabe y ruso, el texto reconocido se entrega como .txt.

Conviene saber

  • La capa de texto invisible del PDF buscable solo admite idiomas de alfabeto latino. Para árabe y ruso obtienes el texto reconocido en un archivo .txt, no un PDF buscable.
  • La precisión depende del escaneo: páginas a 300 DPI, rectas, bien iluminadas y con buen contraste dan los mejores resultados. La escritura a mano no se reconoce de forma fiable.
  • El OCR es lento en documentos grandes: unos segundos por página en un portátil y más en un móvil.
  • El primer uso descarga el motor y los datos de idioma desde un CDN público (jsDelivr), así que en ese momento hace falta conexión a internet.
  • El reconocimiento puede equivocarse, sobre todo con letra pequeña, tablas y tipos de letra poco comunes; revisa todo lo importante.

Tus archivos nunca salen de tu navegador

Esta herramienta se ejecuta por completo en tu dispositivo, dentro del navegador. Tus archivos no se suben a nuestros servidores ni se guardan en ningún sitio. Al cerrar la pestaña se descarta todo.

El motor de OCR y los datos de idioma se descargan una sola vez desde una CDN pública la primera vez que usas OCR. Tus documentos nunca se suben.

Preguntas frecuentes

¿Se suben mis documentos para reconocerlos?

No. El reconocimiento se ejecuta en tu navegador y tus páginas nunca se suben. El motor OCR y los archivos de idioma se descargan una vez desde un CDN público (jsDelivr), que ve tu dirección IP y las cabeceras habituales de la petición, pero no tus documentos.

¿Qué idiomas admite OCR PDF?

Inglés, francés, español, árabe, alemán, italiano, portugués, neerlandés, turco y ruso. Puedes elegir uno o varios, por ejemplo cuando una página mezcla dos idiomas.

¿Puedo obtener un PDF buscable en árabe?

No. La capa de texto del PDF buscable funciona con idiomas de alfabeto latino. Para árabe y ruso, la herramienta reconoce el texto pero solo lo entrega como archivo .txt.

¿Cuánto tarda el OCR?

Calcula unos segundos por página en un portátil y más en un móvil, así que un documento largo puede tardar varios minutos. La primera vez además se invierte tiempo en descargar los datos de idioma.

¿Reconoce la escritura a mano?

No de forma fiable. El OCR funciona mejor con texto impreso; la escritura a mano suele salir con muchos errores o se pasa por alto.

¿Por qué el resultado tiene errores en algunos sitios?

Normalmente por la calidad de la imagen: poca resolución, inclinación, sombras, tinta desvaída o una tipografía que el motor no conoce. Vuelve a escanear a 300 DPI, elige el idioma correcto e inténtalo de nuevo.

Siguiente pasoContinuar con PDF a textoExtrae la capa de texto de un PDF a un .txt, con diseño y separadores opcionales.

Guías relacionadas