OCR PDF : reconnaître le texte des documents scannés
Des scans dans lesquels chercher et copier du texte. Par défaut, la reconnaissance a lieu dans votre navigateur.
France · Nettoyage prévu : 60 min après création de la tâche · Gratuit
Formats et limites
Formats et limites
- Formats acceptés
- Résultat
| Sur ordinateur | Sur téléphone ou tablette | Dans le cloud | |
|---|---|---|---|
| Taille max. par fichier | 200 Mo | 50 Mo | 100 Mo |
| Nombre de pages max. | 50 | 10 | 200 |
| Taille d’image max. | 30 Mpx | 16 Mpx | Sans limite |
Nettoyage prévu : 60 min après création de la tâche · Généralement environ 20 s
Sur votre appareil, les limites dépendent de sa mémoire. Des fichiers plus gros peuvent aussi passer ; l’outil vous prévient d’abord.
Comment ça marche
- 01 Choisissez ou déposez un PDF scanné.
- 02 Choisissez la langue du texte : russe, anglais ou les deux.
- 03 Gardez « Sur cet appareil », ou passez au mode cloud pour les scans longs ou difficiles.
- 04 Cliquez sur Reconnaître le texte et téléchargez le PDF interrogeable.
À propos de cet outil
Un contrat scanné ou un rapport photographié n’est qu’une image : impossible d’y chercher un mot, d’en copier une citation ou de le faire lire par un lecteur d’écran. Hushdesk exécute Tesseract, le moteur d’OCR open source, directement dans cet onglet. Il reconnaît le texte russe et anglais de chaque page scannée et le place en couche invisible sous l’image. Les pages gardent exactement leur aspect, rien n’est recompressé, et pourtant Ctrl+F et le copier-coller fonctionnent. L’OCR sur l’appareil est en bêta : une page prend quelques secondes sur un portable, nettement plus sur un téléphone. Pour les scans longs ou de mauvaise qualité, passez au mode cloud, qui exécute OCRmyPDF sur notre serveur (France).
-
Couche de texte invisible
Chaque mot reconnu se superpose exactement à son image : la recherche surligne le bon endroit, et la page garde son aspect.
-
Russe et anglais
Les données des deux langues sont intégrées. N’en choisir qu’une limite les confusions entre lettres latines et cyrilliques qui se ressemblent.
-
Une confiance honnête
Chaque page reçoit un indice de confiance, et les pages difficiles à lire sont nommées dans le résultat pour que vous sachiez quoi vérifier.
-
Privé par défaut
En mode appareil, le PDF est traité dans un cadre isolé que votre navigateur tient à l’écart du réseau.
Quelle est la précision de l’OCR sur l’appareil ?
Sur un scan propre à 300 dpi, le moteur lit correctement presque tous les caractères. L’inclinaison, le flou, les taches et les très petits caractères font baisser ce taux. Les pages dont la confiance moyenne est inférieure à 75 % sont listées dans le résultat, et des symboles comme № ou les guillemets méritent un coup d’œil.
Questions fréquentes
Combien de temps prend l’OCR sur l’appareil ?
Environ 2–5 secondes par page sur un portable récent, davantage sur téléphone. Chaque page dispose de 60 secondes au maximum : une page qui demande plus est ignorée et signalée dans le résultat, si bien qu’une page difficile ne bloque jamais les autres.
Pourquoi le mode sur l’appareil est-il en bêta ?
Il fonctionne bien sur des scans propres, mais il utilise les modèles rapides de Tesseract dans votre navigateur, et les téléphones ont peu de mémoire. C’est pourquoi il est limité à 50 pages sur ordinateur et 10 sur téléphone ; les fichiers plus gros ou plus difficiles gagnent à passer par le mode cloud.
Que deviennent les pages qui contiennent déjà du texte ?
Par défaut, elles restent intactes et seules les pages composées uniquement d’images sont reconnues. Si une page mêle du vrai texte et une zone scannée, désactivez « Ignorer les pages qui contiennent déjà du texte ».
L’OCR modifie-t-il l’aspect de mon PDF ?
Non. Le contenu des pages et leurs images restent tels quels ; seule une couche de texte invisible est ajoutée. Signets, liens et champs de formulaire sont conservés.
Quelles langues l’OCR PDF reconnaît-il ?
Le russe et l’anglais, seuls ou ensemble. Les autres langues, français compris, ainsi que l’écriture manuscrite ne sont pas reconnues de façon fiable.
Quand mon PDF est-il envoyé pour l’OCR ?
Uniquement si vous choisissez le mode cloud et confirmez l’envoi. OCRmyPDF le traite alors sur notre serveur (France), et le fichier est supprimé automatiquement. En mode appareil, rien ne quitte votre navigateur.