PDF OCR: tekst herkennen in gescande documenten
Maak van scans PDF’s waarin je kunt zoeken en kopiëren. De herkenning draait standaard in je browser.
Upload alleen met toestemming · Gratis te gebruiken · Nooit gebruikt voor AI-training
Frankrijk · Geplande opschoning: 60 min na aanmaken taak · Gratis te gebruiken
Formaten en limieten
Formaten en limieten
- Ondersteunde formaten
- Resultaat
| Op een computer | Op een telefoon of tablet | In de cloud | |
|---|---|---|---|
| Max. bestandsgrootte | 200 MB | 50 MB | 100 MB |
| Max. aantal pagina’s | 50 | 10 | 200 |
| Max. afbeeldingsgrootte | 30 MP | 16 MP | Geen limiet |
Geplande opschoning: 60 min na aanmaken taak · Meestal ongeveer 20 s
De limieten op je apparaat hangen af van het geheugen. Grotere bestanden kunnen ook werken; de tool waarschuwt je eerst.
Zo werkt het
- 01 Kies of sleep een gescande PDF.
- 02 Kies de taal van de tekst: Russisch, Engels of allebei.
- 03 Laat ‘Op dit apparaat’ staan, of kies de cloudmodus voor lange of slechte scans.
- 04 Klik op ‘Tekst herkennen’ en download de doorzoekbare PDF.
Over deze tool
Een gescand contract of een gefotografeerd rapport is gewoon een afbeelding: je kunt er niet in zoeken, er geen citaat uit kopiëren en een schermlezer kan het niet voorlezen. Hushdesk draait Tesseract, de opensource-OCR-engine, direct in dit tabblad. Die herkent de Russische en Engelse tekst op elke gescande pagina en legt die als onzichtbare laag onder de afbeelding. De pagina’s zien er precies zo uit als eerst en er wordt niets opnieuw gecomprimeerd, maar Ctrl+F, kopiëren en plakken werken nu wel. OCR op je apparaat is in bèta: een pagina kost een paar seconden op een laptop en merkbaar langer op een telefoon. Voor lange of erg slechte scans kun je overstappen op de cloudmodus, die OCRmyPDF draait op onze server (Frankrijk).
-
Onzichtbare tekstlaag
Elk herkend woord ligt precies over zijn beeld, dus zoeken markeert de juiste plek terwijl de pagina onveranderd oogt.
-
Russisch en Engels
Taalgegevens voor allebei zijn ingebouwd. Kies je maar één taal, dan worden Latijnse en Cyrillische letters die op elkaar lijken minder vaak verwisseld.
-
Eerlijke betrouwbaarheid
Elke pagina krijgt een betrouwbaarheidsscore, en pagina’s die moeilijk te lezen waren, worden in het resultaat genoemd zodat je weet wat je moet controleren.
-
Privé, tenzij jij kiest
In de apparaatmodus wordt de PDF verwerkt in een geïsoleerd frame dat je browser van het netwerk weghoudt.
Hoe nauwkeurig is OCR op je apparaat?
Op een schone scan van 300 dpi leest de engine bijna elk teken goed. Scheefstand, onscherpte, spikkels en heel kleine letters verlagen dat. Pagina’s met een gemiddelde betrouwbaarheid onder 75% worden in het resultaat vermeld, en tekens als № of «guillemets» zijn een snelle controle waard.
Vragen en antwoorden
Hoe lang duurt OCR op je apparaat?
Ongeveer 2–5 seconden per pagina op een moderne laptop, langer op telefoons. Elke pagina heeft een limiet van 60 seconden: een pagina die meer nodig heeft, wordt overgeslagen en in het resultaat genoemd, zodat één slechte pagina de rest nooit ophoudt.
Waarom is de apparaatmodus als bèta gemarkeerd?
Hij werkt goed op schone scans, maar gebruikt de snelle Tesseract-modellen in je browser, en telefoons hebben weinig geheugen. Daarom is hij beperkt tot 50 pagina’s op computers en 10 op telefoons; grotere of lastigere bestanden kun je beter naar de cloudmodus sturen.
Wat gebeurt er met pagina’s die al tekst bevatten?
Standaard blijven die onaangeroerd en worden alleen pagina’s zonder tekst herkend. Combineert een pagina echte tekst met een gescand deel, zet dan ‘Pagina’s met tekst overslaan’ uit.
Verandert OCR hoe mijn PDF eruitziet?
Nee. De pagina-inhoud en de afbeeldingen blijven zoals ze zijn; er komt alleen een onzichtbare tekstlaag bij. Bladwijzers, links en formuliervelden blijven behouden.
Welke talen kan PDF OCR herkennen?
Russisch en Engels, apart of samen. Andere talen en handschrift worden niet betrouwbaar herkend.
Wanneer wordt mijn PDF geüpload voor OCR?
Alleen als je de cloudmodus kiest en de upload bevestigt. OCRmyPDF verwerkt het bestand dan op onze server (Frankrijk), waarna het automatisch wordt verwijderd. In de apparaatmodus verlaat niets je browser.