Aller au contenu

Open this page in English? Ouvrir cette page en anglais ?

Open in English

Diese Seite auf Deutsch öffnen? Ouvrir cette page en allemand ?

Auf Deutsch öffnen

¿Abrir esta página en español? Ouvrir cette page en espagnol ?

Abrir en español

Vuoi aprire questa pagina in italiano? Ouvrir cette page en italien ?

Apri in italiano

Deze pagina in het Nederlands openen? Ouvrir cette page en néerlandais ?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Ouvrir cette page en polonais ?

Otwórz po polsku

Abrir esta página em português? Ouvrir cette page en portugais ?

Abrir em português

Открыть эту страницу на русском? Ouvrir cette page en russe ?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Ouvrir cette page en turc ?

Türkçe aç

Відкрити цю сторінку українською? Ouvrir cette page en ukrainien ?

Відкрити українською

OCR PDF : reconnaître le texte des documents scannés

Des scans dans lesquels chercher et copier du texte. Par défaut, la reconnaissance a lieu dans votre navigateur.

En local par défaut

Envoi uniquement avec accord · Gratuit · Aucun usage pour entraîner une IA

Formats et limites

Formats et limites

Formats acceptés
PDF
Résultat
PDF
Sur ordinateur Sur téléphone ou tablette Dans le cloud
Taille max. par fichier 200 Mo 50 Mo 100 Mo
Nombre de pages max. 50 10 200
Taille d’image max. 30 Mpx 16 Mpx Sans limite

Nettoyage prévu : 60 min après création de la tâche · Généralement environ 20 s

Sur votre appareil, les limites dépendent de sa mémoire. Des fichiers plus gros peuvent aussi passer ; l’outil vous prévient d’abord.

Comment ça marche

  1. 01 Choisissez ou déposez un PDF scanné.
  2. 02 Choisissez la langue du texte : russe, anglais ou les deux.
  3. 03 Gardez « Sur cet appareil », ou passez au mode cloud pour les scans longs ou difficiles.
  4. 04 Cliquez sur Reconnaître le texte et téléchargez le PDF interrogeable.

À propos de cet outil

Un contrat scanné ou un rapport photographié n’est qu’une image : impossible d’y chercher un mot, d’en copier une citation ou de le faire lire par un lecteur d’écran. Hushdesk exécute Tesseract, le moteur d’OCR open source, directement dans cet onglet. Il reconnaît le texte russe et anglais de chaque page scannée et le place en couche invisible sous l’image. Les pages gardent exactement leur aspect, rien n’est recompressé, et pourtant Ctrl+F et le copier-coller fonctionnent. L’OCR sur l’appareil est en bêta : une page prend quelques secondes sur un portable, nettement plus sur un téléphone. Pour les scans longs ou de mauvaise qualité, passez au mode cloud, qui exécute OCRmyPDF sur notre serveur (France).

  • Couche de texte invisible

    Chaque mot reconnu se superpose exactement à son image : la recherche surligne le bon endroit, et la page garde son aspect.

  • Russe et anglais

    Les données des deux langues sont intégrées. N’en choisir qu’une limite les confusions entre lettres latines et cyrilliques qui se ressemblent.

  • Une confiance honnête

    Chaque page reçoit un indice de confiance, et les pages difficiles à lire sont nommées dans le résultat pour que vous sachiez quoi vérifier.

  • Privé par défaut

    En mode appareil, le PDF est traité dans un cadre isolé que votre navigateur tient à l’écart du réseau.

Quelle est la précision de l’OCR sur l’appareil ?

Sur un scan propre à 300 dpi, le moteur lit correctement presque tous les caractères. L’inclinaison, le flou, les taches et les très petits caractères font baisser ce taux. Les pages dont la confiance moyenne est inférieure à 75 % sont listées dans le résultat, et des symboles comme № ou les guillemets méritent un coup d’œil.

Questions fréquentes

Combien de temps prend l’OCR sur l’appareil ?

Environ 2–5 secondes par page sur un portable récent, davantage sur téléphone. Chaque page dispose de 60 secondes au maximum : une page qui demande plus est ignorée et signalée dans le résultat, si bien qu’une page difficile ne bloque jamais les autres.

Pourquoi le mode sur l’appareil est-il en bêta ?

Il fonctionne bien sur des scans propres, mais il utilise les modèles rapides de Tesseract dans votre navigateur, et les téléphones ont peu de mémoire. C’est pourquoi il est limité à 50 pages sur ordinateur et 10 sur téléphone ; les fichiers plus gros ou plus difficiles gagnent à passer par le mode cloud.

Que deviennent les pages qui contiennent déjà du texte ?

Par défaut, elles restent intactes et seules les pages composées uniquement d’images sont reconnues. Si une page mêle du vrai texte et une zone scannée, désactivez « Ignorer les pages qui contiennent déjà du texte ».

L’OCR modifie-t-il l’aspect de mon PDF ?

Non. Le contenu des pages et leurs images restent tels quels ; seule une couche de texte invisible est ajoutée. Signets, liens et champs de formulaire sont conservés.

Quelles langues l’OCR PDF reconnaît-il ?

Le russe et l’anglais, seuls ou ensemble. Les autres langues, français compris, ainsi que l’écriture manuscrite ne sont pas reconnues de façon fiable.

Quand mon PDF est-il envoyé pour l’OCR ?

Uniquement si vous choisissez le mode cloud et confirmez l’envoi. OCRmyPDF le traite alors sur notre serveur (France), et le fichier est supprimé automatiquement. En mode appareil, rien ne quitte votre navigateur.

OCR PDF : autres utilisations