Over tekstherkenning
Een scan of foto van een pagina is alleen een plaatje: je kunt er niet in zoeken, je kunt er geen zin uit kopiëren en een schermlezer kan het niet voorlezen. Optische tekenherkenning (OCR) vindt de letters in de afbeelding en zet ze om in echte tekst.
Er zijn twee tools, voor twee soorten bestanden:
- PDF OCR voegt een onzichtbare tekstlaag toe aan een gescande PDF. De pagina’s zien er hetzelfde uit, maar zoeken, kopiëren en plakken werken nu wel. Gebruik het voor contracten, facturen, gearchiveerde brieven en alles wat je later terug wilt vinden.
- Afbeelding naar tekst leest een foto of screenshot en geeft je platte tekst om te kopiëren of op te slaan.
De herkenning draait in je browser met Tesseract, de opensource-OCR-engine, en leest Engels en Russisch. Een pagina kost een paar seconden op een laptop en langer op een telefoon. Voor lange of erg slechte scans biedt PDF OCR een servermodus met OCRmyPDF. Opschoning is gepland 60 min na het aanmaken van de taak. Technische storingen kunnen verwijdering vertragen.
Voor het beste resultaat fotografeer je de pagina plat, bij gelijkmatig licht en helemaal in beeld. Een scherpe scan bespaart meer tijd dan achteraf de tekst verbeteren.
Vragen en antwoorden
Welke talen worden herkend?
Engels en Russisch, ook op pagina’s waarin die twee door elkaar staan. Andere talen worden nog niet ondersteund: die tekst zou er verminkt uitkomen.
Hoe nauwkeurig is de herkenning?
Schone gedrukte tekst wordt zeer nauwkeurig herkend. Handschrift, onscherpe foto’s, scheve pagina’s en sierlettertypen verlagen de kwaliteit, dus controleer namen en getallen in het resultaat.
Verandert OCR hoe mijn PDF eruitziet?
Nee. PDF OCR laat de afbeelding van elke pagina zoals die is en plaatst de herkende tekst in een onzichtbare laag eronder.
Worden mijn scans geüpload?
Alleen als je zelf de servermodus van PDF OCR kiest. Standaard draait de herkenning op je apparaat, in een frame zonder netwerktoegang.