Tekst uit PDF halen
Krijg de tekst van een PDF als gewoon UTF-8 .txt-bestand, in leesvolgorde, zonder het document te uploaden.
Formaten en limieten
Formaten en limieten
- Ondersteunde formaten
- Resultaat
- TXT
| Op een computer | Op een telefoon of tablet | |
|---|---|---|
| Max. bestandsgrootte | 300 MB | 100 MB |
| Max. aantal pagina’s | 2000 | 300 |
De limieten op je apparaat hangen af van het geheugen. Grotere bestanden kunnen ook werken; de tool waarschuwt je eerst.
Zo werkt het
- 01 Kies de PDF waar je de tekst uit wilt halen.
- 02 Geef eventueel de pagina’s op, of zet onder Meer opties ‘Begin van elke pagina markeren’ aan.
- 03 Druk op Tekst ophalen.
- 04 Kopieer de tekst uit het voorbeeld of download het .txt-bestand.
Over deze tool
Tekst kopiëren uit een PDF-viewer levert vaak door elkaar gehusselde regels op: twee kolommen door elkaar geweven, een kopregel midden in een zin. Hushdesk kijkt naar de positie van elk teken en bouwt de leesvolgorde opnieuw op. Een artikel in twee kolommen komt er dus kolom voor kolom uit, terwijl titels en paginanummers op hun plek blijven. Je krijgt een gewoon UTF-8-tekstbestand dat in elke editor opent en zo door kan naar een vertaaltool, een zoekindex of een chatbot. Nederlands, Engels, Russisch en de meeste andere schriften komen er heel uit. Pagina’s die alleen gescande afbeeldingen zijn, bevatten geen letters om op te halen: de tool noemt ze en raadt OCR aan.
-
Echte leesvolgorde
Op elke pagina worden kolommen herkend. Een artikel met twee kolommen lees je dus eerst links en dan rechts, in plaats van regel voor regel dwars over beide.
-
Elk alfabet
Het bestand wordt als UTF-8 opgeslagen: Cyrillisch, letters met accenten, valutatekens en symbolen komen precies zo aan als ze in het document staan.
-
Scans worden gemeld
Is een pagina een afbeelding van tekst, dan hoor je om welke pagina het gaat, in plaats van stilletjes een leeg resultaat te krijgen.
-
Privé door het ontwerp
De tekst wordt gelezen door een engine die in je browsertabblad draait. Rapporten, contracten en medische brieven gaan nooit naar iemand toe.
Vragen en antwoorden
Waarom ontbreekt er tekst in het bestand dat ik kreeg?
Waarschijnlijk zijn die pagina’s scans: de PDF bevat een foto van de pagina, niet de letters zelf. Het resultaat waarschuwt voor zulke pagina’s. Haal het document eerst door OCR en haal daarna de tekst eruit.
Blijven tabellen en opmaak in het tekstbestand behouden?
Nee. Een .txt-bestand kent geen lettertypen, vette tekst of tabelcellen; elke tabelrij wordt een regel met de cellen gescheiden door spaties. Wil je een bewerkbaar document met opmaak, gebruik dan PDF naar Word.
Hoe gaat de tool om met pagina’s in twee kolommen?
De tool zoekt een verticale witte strook die tussen de tekstblokken van boven naar beneden over de pagina loopt, en leest de blokken aan weerszijden na elkaar. Koppen en voetteksten over de volle breedte werken als scheiding, zodat de volgorde natuurlijk blijft.
Kan ik tekst uit maar een paar pagina’s halen?
Ja. Zet pagina’s en bereiken als 3, 7-9 in het veld Pagina’s; de rest wordt overgeslagen.
Werkt het ook met andere talen en schriften?
Ja, elk schrift dat de PDF als tekst opslaat, komt in UTF-8 mee. Talen die van rechts naar links worden geschreven, zoals Arabisch of Hebreeuws, vormen een uitzondering: hun woorden kunnen in omgekeerde volgorde uitkomen.
Worden woorden die met een streepje zijn afgebroken weer aan elkaar gezet?
Nee. Een afbreekstreepje aan het eind van een regel blijft staan zoals in de PDF, omdat de tool niet altijd kan zien of het om een afbreking gaat of om een echt koppelteken.
Wordt de PDF geüpload om de tekst eruit te halen?
Nee. De tekens lezen en het tekstbestand samenstellen gebeuren allebei op je apparaat, in een frame dat je browser van het netwerk afsluit.