Über die Texterkennung
Ein Scan oder ein Foto einer Seite ist nur ein Bild: Sie können darin nicht suchen, keinen Satz daraus kopieren, und ein Screenreader kann es nicht vorlesen. Die optische Zeichenerkennung (OCR) findet die Buchstaben im Bild und macht daraus echten Text.
Es gibt zwei Werkzeuge für zwei Arten von Dateien:
- PDF-Texterkennung fügt einem gescannten PDF eine unsichtbare Textebene hinzu. Die Seiten sehen gleich aus, aber Suchen, Kopieren und Einfügen funktionieren nun. Ideal für Verträge, Rechnungen, archivierte Briefe und alles, was Sie später wiederfinden möchten.
- Bild in Text liest ein Foto oder einen Screenshot und liefert reinen Text zum Kopieren oder Speichern.
Die Erkennung läuft in Ihrem Browser mit Tesseract, der Open-Source-OCR-Engine, und sie liest Englisch und Russisch. Eine Seite dauert auf einem Laptop einige Sekunden, auf einem Smartphone länger. Für lange oder sehr schlechte Scans bietet die PDF-Texterkennung einen Cloud-Modus mit OCRmyPDF. Die Bereinigung ist 60 Min. nach Auftragserstellung geplant. Technische Fehler können die Löschung verzögern.
Das beste Ergebnis erhalten Sie, wenn Sie die Seite flach, bei gleichmäßigem Licht und vollständig im Bild fotografieren. Ein scharfer Scan spart mehr Zeit, als den Text hinterher zu korrigieren.
Fragen und Antworten
Welche Sprachen werden erkannt?
Englisch und Russisch, auch auf Seiten, die beide mischen. Andere Sprachen werden noch nicht unterstützt: Der Text käme verstümmelt heraus.
Wie genau ist die Erkennung?
Sauber gedruckter Text wird sehr genau erkannt. Handschrift, unscharfe Fotos, schiefe Seiten und Zierschriften mindern die Qualität, prüfen Sie im Ergebnis also Namen und Zahlen.
Verändert OCR das Aussehen meines PDFs?
Nein. PDF-Texterkennung lässt jedes Seitenbild unverändert und legt den erkannten Text als unsichtbare Ebene darunter.
Werden meine Scans hochgeladen?
Nur wenn Sie den Cloud-Modus der PDF-Texterkennung wählen. Standardmäßig läuft die Erkennung auf Ihrem Gerät, in einem Frame ohne Netzwerkzugriff.