PDF-Texterkennung: Text in gescannten Dokumenten erkennen
Scans in PDFs verwandeln, die sich durchsuchen und kopieren lassen. Die Erkennung läuft standardmäßig in Ihrem Browser.
Frankreich · Geplante Bereinigung: 60 Min. nach Auftragserstellung · Kostenlos
Formate und Limits
Formate und Limits
- Unterstützte Formate
- Ergebnis
| Am Computer | Auf Smartphone oder Tablet | In der Cloud | |
|---|---|---|---|
| Max. Dateigröße | 200 MB | 50 MB | 100 MB |
| Max. Seitenzahl | 50 | 10 | 200 |
| Max. Bildgröße | 30 MP | 16 MP | Kein Limit |
Geplante Bereinigung: 60 Min. nach Auftragserstellung · Meist etwa 20 Sek.
Die Limits auf Ihrem Gerät hängen von seinem Arbeitsspeicher ab. Größere Dateien können trotzdem funktionieren; das Werkzeug warnt Sie vorher.
So funktioniert’s
- 01 Wählen Sie ein gescanntes PDF aus oder ziehen Sie es hierher.
- 02 Wählen Sie die Sprache des Textes: Russisch, Englisch oder beides.
- 03 Behalten Sie „Auf diesem Gerät“ oder wechseln Sie bei langen oder schlechten Scans in den Cloud-Modus.
- 04 Klicken Sie auf „Text erkennen“ und laden Sie das durchsuchbare PDF herunter.
Über dieses Werkzeug
Ein gescannter Vertrag oder ein abfotografierter Bericht ist nur ein Bild: Sie können ihn nicht durchsuchen, kein Zitat daraus kopieren und ihn sich nicht von einem Screenreader vorlesen lassen. Hushdesk führt Tesseract, die Open-Source-OCR-Engine, direkt in diesem Tab aus. Die Engine erkennt den russischen und englischen Text auf jeder gescannten Seite und legt ihn als unsichtbare Ebene unter das Bild. Die Seiten sehen genau aus wie vorher, nichts wird neu komprimiert, und doch funktionieren jetzt Strg+F, Kopieren und Einfügen. Die OCR auf dem Gerät ist in der Beta: Eine Seite dauert auf einem Laptop einige Sekunden, auf einem Smartphone spürbar länger. Für lange oder sehr schlechte Scans können Sie in den Cloud-Modus wechseln, der OCRmyPDF auf unserem Server (Frankreich) ausführt.
-
Unsichtbare Textebene
Jedes erkannte Wort liegt genau über seinem Bild, sodass die Suche die richtige Stelle markiert, während die Seite unverändert aussieht.
-
Russisch und Englisch
Die Sprachdaten für beide sind eingebaut. Wählen Sie nur eine Sprache, werden ähnlich aussehende lateinische und kyrillische Buchstaben seltener verwechselt.
-
Ehrliche Konfidenz
Jede Seite erhält einen Konfidenzwert, und schwer lesbare Seiten werden im Ergebnis genannt, damit klar ist, wo sich eine Kontrolle lohnt.
-
Standardmäßig privat
Im Gerätemodus wird das PDF in einem isolierten Frame verarbeitet, den Ihr Browser vom Netzwerk fernhält.
Wie genau ist die OCR auf dem Gerät?
Bei einem sauberen Scan mit 300 dpi liest die Engine fast jedes Zeichen richtig. Schräglage, Unschärfe, Flecken und winzige Schrift verschlechtern das. Seiten mit einer durchschnittlichen Konfidenz unter 75 % werden im Ergebnis aufgeführt, und Zeichen wie № oder «Guillemets» verdienen einen kurzen Blick.
Fragen und Antworten
Wie lange dauert die OCR auf dem Gerät?
Etwa 2–5 Sekunden pro Seite auf einem modernen Laptop, auf Smartphones länger. Jede Seite hat ein Limit von 60 Sekunden: Eine Seite, die mehr braucht, wird übersprungen und im Ergebnis genannt, damit eine einzige schlechte Seite nie den Rest aufhält.
Warum ist der Gerätemodus als Beta gekennzeichnet?
Er funktioniert gut bei sauberen Scans, nutzt aber die schnellen Tesseract-Modelle in Ihrem Browser, und Smartphones haben wenig Arbeitsspeicher. Deshalb ist er auf 50 Seiten am Computer und 10 am Smartphone begrenzt; größere oder schwierigere Dateien sind im Cloud-Modus besser aufgehoben.
Was passiert mit Seiten, die bereits Text enthalten?
Standardmäßig bleiben sie unberührt, und nur reine Bildseiten werden erkannt. Mischt eine Seite echten Text mit einem gescannten Bereich, schalten Sie „Seiten mit vorhandenem Text überspringen“ aus.
Verändert die OCR das Aussehen meines PDFs?
Nein. Seiteninhalt und Bilder bleiben, wie sie sind; nur eine unsichtbare Textebene kommt hinzu. Lesezeichen, Links und Formularfelder bleiben erhalten.
Welche Sprachen erkennt die PDF-Texterkennung?
Russisch und Englisch, einzeln oder zusammen. Andere Sprachen, auch Deutsch, sowie Handschrift werden nicht zuverlässig erkannt.
Wann wird mein PDF für die OCR hochgeladen?
Nur wenn Sie den Cloud-Modus wählen und das Hochladen bestätigen. Dann verarbeitet OCRmyPDF die Datei auf unserem Server (Frankreich), und sie wird automatisch gelöscht. Im Gerätemodus verlässt nichts Ihren Browser.