Aller au contenu

Open this page in English? Ouvrir cette page en anglais ?

Open in English

Diese Seite auf Deutsch öffnen? Ouvrir cette page en allemand ?

Auf Deutsch öffnen

¿Abrir esta página en español? Ouvrir cette page en espagnol ?

Abrir en español

Vuoi aprire questa pagina in italiano? Ouvrir cette page en italien ?

Apri in italiano

Deze pagina in het Nederlands openen? Ouvrir cette page en néerlandais ?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Ouvrir cette page en polonais ?

Otwórz po polsku

Abrir esta página em português? Ouvrir cette page en portugais ?

Abrir em português

Открыть эту страницу на русском? Ouvrir cette page en russe ?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Ouvrir cette page en turc ?

Türkçe aç

Відкрити цю сторінку українською? Ouvrir cette page en ukrainien ?

Відкрити українською

Extraire le texte d’un PDF

Le texte d’un PDF dans un fichier .txt UTF-8, dans l’ordre de lecture, sans envoyer le document.

Uniquement dans le navigateur

Aucun envoi au serveur · Gratuit · Aucun usage pour entraîner une IA

Formats et limites

Formats et limites

Formats acceptés
PDF
Résultat
TXT
Sur ordinateur Sur téléphone ou tablette
Taille max. par fichier 300 Mo 100 Mo
Nombre de pages max. 2000 300

Sur votre appareil, les limites dépendent de sa mémoire. Des fichiers plus gros peuvent aussi passer ; l’outil vous prévient d’abord.

Comment ça marche

  1. 01 Choisissez le PDF dont vous voulez extraire le texte.
  2. 02 Si besoin, indiquez les pages ou activez « Marquer le début de chaque page » dans Plus d’options.
  3. 03 Appuyez sur Extraire le texte.
  4. 04 Copiez le texte depuis l’aperçu ou téléchargez le fichier .txt.

À propos de cet outil

Copier le texte depuis une visionneuse PDF donne souvent des lignes en vrac : deux colonnes entremêlées, un en-tête courant au milieu d’une phrase. Hushdesk examine la position de chaque caractère et reconstitue l’ordre de lecture : un article sur deux colonnes sort colonne par colonne, tandis que titres et numéros de page restent à leur place. Vous obtenez un fichier texte UTF-8 qui s’ouvre dans n’importe quel éditeur et peut aller directement dans un traducteur, un index de recherche ou un chatbot. Le français, l’anglais, le russe et la plupart des autres écritures passent sans dommage. Les pages qui ne sont que des images scannées ne contiennent aucune lettre à extraire : l’outil les signale et vous oriente vers la reconnaissance de texte (OCR).

  • Un vrai ordre de lecture

    Les colonnes sont détectées sur chaque page : un article sur deux colonnes se lit d’abord à gauche, puis à droite, au lieu de ligne par ligne à travers les deux.

  • Tous les alphabets

    Le fichier est enregistré en UTF-8 : accents, cyrillique, symboles monétaires et autres signes arrivent exactement comme dans le document.

  • Scans signalés

    Quand une page est une photo de texte, vous savez de quelle page il s’agit, au lieu de recevoir sans explication un résultat vide.

  • Confidentiel par conception

    Le texte est lu par un moteur qui tourne dans l’onglet de votre navigateur. Rapports, contrats et courriers médicaux ne sont transmis à personne.

Questions fréquentes

Pourquoi manque-t-il du texte dans le fichier extrait ?

Le plus souvent, ces pages sont des scans : le PDF contient une photo de la page, pas les lettres elles-mêmes. Le résultat signale ces pages. Passez d’abord le document à l’OCR, puis extrayez le texte.

Le fichier texte conserve-t-il les tableaux et la mise en forme ?

Non. Un fichier .txt n’a ni polices, ni gras, ni cellules : chaque ligne de tableau devient une ligne de texte dont les cellules sont séparées par des espaces. Pour un document modifiable qui garde la mise en forme, utilisez PDF en Word.

Comment les pages à deux colonnes sont-elles traitées ?

L’outil cherche un espace blanc vertical qui descend le long de la page entre des blocs de texte, puis lit tour à tour les blocs de chaque côté. Les titres et pieds de page pleine largeur servent de séparateurs : l’ordre reste naturel.

Puis-je extraire le texte de quelques pages seulement ?

Oui. Saisissez des pages et des plages comme 3, 7-9 dans le champ Pages ; tout le reste est ignoré.

Cela fonctionne-t-il avec les accents et les autres langues ?

Oui : toute écriture que le PDF stocke sous forme de texte est extraite en UTF-8. Exception : les langues qui s’écrivent de droite à gauche, comme l’arabe ou l’hébreu, dont les mots peuvent sortir dans l’ordre inverse.

Les mots coupés par un trait d’union sont-ils recollés ?

Non. Un trait d’union qui coupe un mot en fin de ligne reste tel qu’il apparaît dans le PDF, car l’outil ne sait pas toujours distinguer une césure d’un vrai trait d’union.

Le PDF est-il envoyé pour en extraire le texte ?

Non. La lecture des caractères et la création du fichier texte se font sur votre appareil, dans un cadre que votre navigateur coupe du réseau.