Naar de inhoud

Open this page in English? Deze pagina in het Engels openen?

Open in English

Diese Seite auf Deutsch öffnen? Deze pagina in het Duits openen?

Auf Deutsch öffnen

¿Abrir esta página en español? Deze pagina in het Spaans openen?

Abrir en español

Ouvrir cette page en français ? Deze pagina in het Frans openen?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Deze pagina in het Italiaans openen?

Apri in italiano

Otworzyć tę stronę po polsku? Deze pagina in het Pools openen?

Otwórz po polsku

Abrir esta página em português? Deze pagina in het Portugees openen?

Abrir em português

Открыть эту страницу на русском? Deze pagina in het Russisch openen?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Deze pagina in het Turks openen?

Türkçe aç

Відкрити цю сторінку українською? Deze pagina in het Oekraïens openen?

Відкрити українською

Tekst uit PDF halen

Krijg de tekst van een PDF als gewoon UTF-8 .txt-bestand, in leesvolgorde, zonder het document te uploaden.

Alleen in de browser

Geen upload naar een server · Gratis te gebruiken · Nooit gebruikt voor AI-training

Formaten en limieten

Formaten en limieten

Ondersteunde formaten
PDF
Resultaat
TXT
Op een computer Op een telefoon of tablet
Max. bestandsgrootte 300 MB 100 MB
Max. aantal pagina’s 2000 300

De limieten op je apparaat hangen af van het geheugen. Grotere bestanden kunnen ook werken; de tool waarschuwt je eerst.

Zo werkt het

  1. 01 Kies de PDF waar je de tekst uit wilt halen.
  2. 02 Geef eventueel de pagina’s op, of zet onder Meer opties ‘Begin van elke pagina markeren’ aan.
  3. 03 Druk op Tekst ophalen.
  4. 04 Kopieer de tekst uit het voorbeeld of download het .txt-bestand.

Over deze tool

Tekst kopiëren uit een PDF-viewer levert vaak door elkaar gehusselde regels op: twee kolommen door elkaar geweven, een kopregel midden in een zin. Hushdesk kijkt naar de positie van elk teken en bouwt de leesvolgorde opnieuw op. Een artikel in twee kolommen komt er dus kolom voor kolom uit, terwijl titels en paginanummers op hun plek blijven. Je krijgt een gewoon UTF-8-tekstbestand dat in elke editor opent en zo door kan naar een vertaaltool, een zoekindex of een chatbot. Nederlands, Engels, Russisch en de meeste andere schriften komen er heel uit. Pagina’s die alleen gescande afbeeldingen zijn, bevatten geen letters om op te halen: de tool noemt ze en raadt OCR aan.

  • Echte leesvolgorde

    Op elke pagina worden kolommen herkend. Een artikel met twee kolommen lees je dus eerst links en dan rechts, in plaats van regel voor regel dwars over beide.

  • Elk alfabet

    Het bestand wordt als UTF-8 opgeslagen: Cyrillisch, letters met accenten, valutatekens en symbolen komen precies zo aan als ze in het document staan.

  • Scans worden gemeld

    Is een pagina een afbeelding van tekst, dan hoor je om welke pagina het gaat, in plaats van stilletjes een leeg resultaat te krijgen.

  • Privé door het ontwerp

    De tekst wordt gelezen door een engine die in je browsertabblad draait. Rapporten, contracten en medische brieven gaan nooit naar iemand toe.

Vragen en antwoorden

Waarom ontbreekt er tekst in het bestand dat ik kreeg?

Waarschijnlijk zijn die pagina’s scans: de PDF bevat een foto van de pagina, niet de letters zelf. Het resultaat waarschuwt voor zulke pagina’s. Haal het document eerst door OCR en haal daarna de tekst eruit.

Blijven tabellen en opmaak in het tekstbestand behouden?

Nee. Een .txt-bestand kent geen lettertypen, vette tekst of tabelcellen; elke tabelrij wordt een regel met de cellen gescheiden door spaties. Wil je een bewerkbaar document met opmaak, gebruik dan PDF naar Word.

Hoe gaat de tool om met pagina’s in twee kolommen?

De tool zoekt een verticale witte strook die tussen de tekstblokken van boven naar beneden over de pagina loopt, en leest de blokken aan weerszijden na elkaar. Koppen en voetteksten over de volle breedte werken als scheiding, zodat de volgorde natuurlijk blijft.

Kan ik tekst uit maar een paar pagina’s halen?

Ja. Zet pagina’s en bereiken als 3, 7-9 in het veld Pagina’s; de rest wordt overgeslagen.

Werkt het ook met andere talen en schriften?

Ja, elk schrift dat de PDF als tekst opslaat, komt in UTF-8 mee. Talen die van rechts naar links worden geschreven, zoals Arabisch of Hebreeuws, vormen een uitzondering: hun woorden kunnen in omgekeerde volgorde uitkomen.

Worden woorden die met een streepje zijn afgebroken weer aan elkaar gezet?

Nee. Een afbreekstreepje aan het eind van een regel blijft staan zoals in de PDF, omdat de tool niet altijd kan zien of het om een afbreking gaat of om een echt koppelteken.

Wordt de PDF geüpload om de tekst eruit te halen?

Nee. De tekens lezen en het tekstbestand samenstellen gebeuren allebei op je apparaat, in een frame dat je browser van het netwerk afsluit.