Extraire le texte d’un PDF
Le texte d’un PDF dans un fichier .txt UTF-8, dans l’ordre de lecture, sans envoyer le document.
Formats et limites
Formats et limites
- Formats acceptés
- Résultat
- TXT
| Sur ordinateur | Sur téléphone ou tablette | |
|---|---|---|
| Taille max. par fichier | 300 Mo | 100 Mo |
| Nombre de pages max. | 2000 | 300 |
Sur votre appareil, les limites dépendent de sa mémoire. Des fichiers plus gros peuvent aussi passer ; l’outil vous prévient d’abord.
Comment ça marche
- 01 Choisissez le PDF dont vous voulez extraire le texte.
- 02 Si besoin, indiquez les pages ou activez « Marquer le début de chaque page » dans Plus d’options.
- 03 Appuyez sur Extraire le texte.
- 04 Copiez le texte depuis l’aperçu ou téléchargez le fichier .txt.
À propos de cet outil
Copier le texte depuis une visionneuse PDF donne souvent des lignes en vrac : deux colonnes entremêlées, un en-tête courant au milieu d’une phrase. Hushdesk examine la position de chaque caractère et reconstitue l’ordre de lecture : un article sur deux colonnes sort colonne par colonne, tandis que titres et numéros de page restent à leur place. Vous obtenez un fichier texte UTF-8 qui s’ouvre dans n’importe quel éditeur et peut aller directement dans un traducteur, un index de recherche ou un chatbot. Le français, l’anglais, le russe et la plupart des autres écritures passent sans dommage. Les pages qui ne sont que des images scannées ne contiennent aucune lettre à extraire : l’outil les signale et vous oriente vers la reconnaissance de texte (OCR).
-
Un vrai ordre de lecture
Les colonnes sont détectées sur chaque page : un article sur deux colonnes se lit d’abord à gauche, puis à droite, au lieu de ligne par ligne à travers les deux.
-
Tous les alphabets
Le fichier est enregistré en UTF-8 : accents, cyrillique, symboles monétaires et autres signes arrivent exactement comme dans le document.
-
Scans signalés
Quand une page est une photo de texte, vous savez de quelle page il s’agit, au lieu de recevoir sans explication un résultat vide.
-
Confidentiel par conception
Le texte est lu par un moteur qui tourne dans l’onglet de votre navigateur. Rapports, contrats et courriers médicaux ne sont transmis à personne.
Questions fréquentes
Pourquoi manque-t-il du texte dans le fichier extrait ?
Le plus souvent, ces pages sont des scans : le PDF contient une photo de la page, pas les lettres elles-mêmes. Le résultat signale ces pages. Passez d’abord le document à l’OCR, puis extrayez le texte.
Le fichier texte conserve-t-il les tableaux et la mise en forme ?
Non. Un fichier .txt n’a ni polices, ni gras, ni cellules : chaque ligne de tableau devient une ligne de texte dont les cellules sont séparées par des espaces. Pour un document modifiable qui garde la mise en forme, utilisez PDF en Word.
Comment les pages à deux colonnes sont-elles traitées ?
L’outil cherche un espace blanc vertical qui descend le long de la page entre des blocs de texte, puis lit tour à tour les blocs de chaque côté. Les titres et pieds de page pleine largeur servent de séparateurs : l’ordre reste naturel.
Puis-je extraire le texte de quelques pages seulement ?
Oui. Saisissez des pages et des plages comme 3, 7-9 dans le champ Pages ; tout le reste est ignoré.
Cela fonctionne-t-il avec les accents et les autres langues ?
Oui : toute écriture que le PDF stocke sous forme de texte est extraite en UTF-8. Exception : les langues qui s’écrivent de droite à gauche, comme l’arabe ou l’hébreu, dont les mots peuvent sortir dans l’ordre inverse.
Les mots coupés par un trait d’union sont-ils recollés ?
Non. Un trait d’union qui coupe un mot en fin de ligne reste tel qu’il apparaît dans le PDF, car l’outil ne sait pas toujours distinguer une césure d’un vrai trait d’union.
Le PDF est-il envoyé pour en extraire le texte ?
Non. La lecture des caractères et la création du fichier texte se font sur votre appareil, dans un cadre que votre navigateur coupe du réseau.