À propos de la reconnaissance de texte
Un scan ou une photo de page n’est qu’une image : impossible d’y faire une recherche, d’en copier une phrase ou de la faire lire par un lecteur d’écran. La reconnaissance optique de caractères (OCR) repère les lettres dans l’image et les transforme en vrai texte.
Deux outils, pour deux types de fichiers :
- OCR PDF ajoute une couche de texte invisible à un PDF scanné. Les pages gardent le même aspect, mais la recherche et le copier-coller fonctionnent. Idéal pour les contrats, factures, courriers archivés et tout ce que vous voudrez retrouver plus tard.
- Image en texte lit une photo ou une capture d’écran et vous donne du texte brut à copier ou à enregistrer.
La reconnaissance s’exécute dans votre navigateur avec Tesseract, le moteur OCR open source, et lit l’anglais et le russe. Une page prend quelques secondes sur un ordinateur portable, davantage sur un téléphone. Pour les scans longs ou de très mauvaise qualité, OCR PDF propose un mode serveur qui s’appuie sur OCRmyPDF. Le nettoyage est prévu 60 min après la création de la tâche. Des incidents techniques peuvent retarder la suppression.
Pour un meilleur résultat, photographiez la page à plat, sous une lumière uniforme et entièrement dans le cadre. Un scan net fait gagner plus de temps que de corriger le texte après coup.
Questions fréquentes
Quelles langues sont reconnues ?
L’anglais et le russe, y compris sur les pages qui mélangent les deux. Les autres langues ne sont pas encore prises en charge : leur texte ressortirait truffé d’erreurs.
La reconnaissance est-elle fiable ?
Le texte imprimé net est reconnu avec une grande précision. L’écriture manuscrite, les photos floues, les pages de travers et les polices décoratives font baisser la qualité : vérifiez les noms et les chiffres dans le résultat.
L’OCR change-t-il l’aspect de mon PDF ?
Non. OCR PDF conserve l’image de chaque page telle quelle et place le texte reconnu dans une couche invisible, en dessous.
Mes scans sont-ils envoyés ?
Non, sauf si vous choisissez le mode serveur d’OCR PDF. Par défaut, la reconnaissance s’exécute sur votre appareil, dans un cadre sans accès au réseau.