OCR et outils de texte pour PDF scannés
Un PDF scanné ressemble à un document mais n'est en réalité qu'une pile d'images : impossible d'y chercher un mot, de sélectionner du texte ou de le convertir en Word. L'OCR lit ces images et produit du vrai texte. Voici comment savoir si vous en avez besoin, et quels outils utiliser avant et après.
1 outils
PDF scanné ou PDF texte : comment faire la différence
Ouvrez le fichier et essayez de sélectionner une phrase à la souris, ou de chercher un mot visible sur la page. Si les mots se surlignent et que la recherche les trouve, le PDF a déjà une couche de texte et n'a pas besoin d'OCR. Si vous ne pouvez sélectionner que la page entière d'un bloc, ou si rien n'est trouvé, c'est un scan composé d'images.
Les documents issus d'un scanner, les photos prises au téléphone et les fichiers enregistrés comme images puis transformés en PDF sont tous des scans. Les exports de Word ou de pages web sont en général des PDF texte. Certains fichiers mêlent les deux, avec quelques pages scannées dans un document texte ; c'est pourquoi OCR PDF propose d'ignorer les pages qui contiennent déjà du texte.
Ce que produit OCR PDF et comment obtenir de bons résultats
OCR PDF restitue chaque page en image, reconnaît les caractères avec Tesseract.js dans votre navigateur et produit un PDF interrogeable (l'image de la page avec une couche de texte invisible) et, si vous le souhaitez, un fichier texte brut. Il lit l'anglais, le français, l'espagnol, l'arabe, l'allemand, l'italien, le portugais, le néerlandais, le turc et le russe, et vous pouvez en choisir plusieurs à la fois pour les documents mixtes. Il accepte aussi directement des images JPG et PNG.
La précision dépend surtout du scan. Visez 300 DPI, des pages droites, un bon contraste et un éclairage propre : une photo de travers ou ombrée donnera plus d'erreurs. L'écriture manuscrite n'est pas reconnue de façon fiable. Pour l'arabe et le russe, l'outil fournit le texte reconnu en téléchargement .txt, car la couche de PDF interrogeable n'est pas disponible pour ces écritures. Comptez quelques secondes par page sur un ordinateur portable, davantage sur un téléphone.
- Choisissez toutes les langues présentes dans le document, pas seulement la principale.
- Utilisez 300 DPI pour les petits caractères et 200 DPI pour des pages nettes et rapides.
- Rescannez une page de mauvaise qualité plutôt que d'attendre de l'OCR qu'il la corrige.
- Relisez noms, chiffres et dates, là où un seul caractère faux compte.
Les outils à utiliser avant et après l'OCR
Avant l'OCR, Scanner en PDF ou Images en PDF peuvent assembler des photos en un seul PDF, et Pivoter PDF redresse les pages scannées de côté, car l'OCR lit mieux un texte droit. Après l'OCR, PDF en texte extrait la couche de texte vers un fichier .txt, PDF en Word reconstruit un document modifiable et PDF en Markdown donne un texte brut structuré. Comparer PDF repère les différences entre deux versions, mais comme les autres il travaille sur du vrai texte : les fichiers scannés passent d'abord par l'OCR.
OCR PDF s'exécute dans votre navigateur et vos documents ne sont jamais envoyés. Le moteur d'OCR et les données de langue, quelques Mo, sont téléchargés une seule fois depuis un CDN public (jsDelivr) à la première utilisation ; le CDN voit votre adresse IP mais pas vos documents.
Questions fréquentes
Comment savoir si mon PDF a besoin d'OCR ?
Essayez de sélectionner du texte ou de chercher un mot visible. Si rien ne se surligne ou si la recherche ne trouve rien, le PDF est un scan et il lui faut l'OCR. Si le texte se sélectionne normalement, il a déjà une couche de texte.
Mes documents sont-ils envoyés quand je lance l'OCR ?
Non. La reconnaissance s'exécute dans votre navigateur. À la première utilisation, le moteur d'OCR et les fichiers de langue sont téléchargés depuis un CDN public (jsDelivr), qui voit votre adresse IP mais jamais vos documents.
L'OCR fonctionne-t-il pour l'arabe et l'écriture manuscrite ?
L'arabe est reconnu, mais le résultat est fourni en téléchargement .txt car la couche de texte du PDF interrogeable n'est pas disponible pour l'arabe ni le russe. L'écriture manuscrite n'est pas reconnue de façon fiable ; l'OCR donne ses meilleurs résultats sur du texte imprimé net.
Pourquoi l'OCR est-il lent sur mon fichier ?
Chaque page est restituée en image et analysée sur votre appareil, ce qui prend quelques secondes par page sur un ordinateur portable et davantage sur un téléphone. Pour un gros document, utilisez un ordinateur, choisissez 200 DPI si l'impression est nette et gardez l'onglet ouvert.
Que faire après l'OCR pour modifier le texte ?
Utilisez PDF en Word pour un document modifiable, ou PDF en texte pour du texte brut. Relisez d'abord le résultat, car l'OCR peut mal lire des caractères, surtout sur de mauvais scans.