Zum Inhalt springen

Open this page in English? Diese Seite auf Englisch öffnen?

Open in English

¿Abrir esta página en español? Diese Seite auf Spanisch öffnen?

Abrir en español

Ouvrir cette page en français ? Diese Seite auf Französisch öffnen?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Diese Seite auf Italienisch öffnen?

Apri in italiano

Deze pagina in het Nederlands openen? Diese Seite auf Niederländisch öffnen?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Diese Seite auf Polnisch öffnen?

Otwórz po polsku

Abrir esta página em português? Diese Seite auf Portugiesisch öffnen?

Abrir em português

Открыть эту страницу на русском? Diese Seite auf Russisch öffnen?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Diese Seite auf Türkisch öffnen?

Türkçe aç

Відкрити цю сторінку українською? Diese Seite auf Ukrainisch öffnen?

Відкрити українською

PDF-Texterkennung: Text in gescannten Dokumenten erkennen

Scans in PDFs verwandeln, die sich durchsuchen und kopieren lassen. Die Erkennung läuft standardmäßig in Ihrem Browser.

Standardmäßig lokal

Upload nur mit Zustimmung · Kostenlos · Keine Nutzung für KI-Training

Formate und Limits

Formate und Limits

Unterstützte Formate
PDF
Ergebnis
PDF
Am Computer Auf Smartphone oder Tablet In der Cloud
Max. Dateigröße 200 MB 50 MB 100 MB
Max. Seitenzahl 50 10 200
Max. Bildgröße 30 MP 16 MP Kein Limit

Geplante Bereinigung: 60 Min. nach Auftragserstellung · Meist etwa 20 Sek.

Die Limits auf Ihrem Gerät hängen von seinem Arbeitsspeicher ab. Größere Dateien können trotzdem funktionieren; das Werkzeug warnt Sie vorher.

So funktioniert’s

  1. 01 Wählen Sie ein gescanntes PDF aus oder ziehen Sie es hierher.
  2. 02 Wählen Sie die Sprache des Textes: Russisch, Englisch oder beides.
  3. 03 Behalten Sie „Auf diesem Gerät“ oder wechseln Sie bei langen oder schlechten Scans in den Cloud-Modus.
  4. 04 Klicken Sie auf „Text erkennen“ und laden Sie das durchsuchbare PDF herunter.

Über dieses Werkzeug

Ein gescannter Vertrag oder ein abfotografierter Bericht ist nur ein Bild: Sie können ihn nicht durchsuchen, kein Zitat daraus kopieren und ihn sich nicht von einem Screenreader vorlesen lassen. Hushdesk führt Tesseract, die Open-Source-OCR-Engine, direkt in diesem Tab aus. Die Engine erkennt den russischen und englischen Text auf jeder gescannten Seite und legt ihn als unsichtbare Ebene unter das Bild. Die Seiten sehen genau aus wie vorher, nichts wird neu komprimiert, und doch funktionieren jetzt Strg+F, Kopieren und Einfügen. Die OCR auf dem Gerät ist in der Beta: Eine Seite dauert auf einem Laptop einige Sekunden, auf einem Smartphone spürbar länger. Für lange oder sehr schlechte Scans können Sie in den Cloud-Modus wechseln, der OCRmyPDF auf unserem Server (Frankreich) ausführt.

  • Unsichtbare Textebene

    Jedes erkannte Wort liegt genau über seinem Bild, sodass die Suche die richtige Stelle markiert, während die Seite unverändert aussieht.

  • Russisch und Englisch

    Die Sprachdaten für beide sind eingebaut. Wählen Sie nur eine Sprache, werden ähnlich aussehende lateinische und kyrillische Buchstaben seltener verwechselt.

  • Ehrliche Konfidenz

    Jede Seite erhält einen Konfidenzwert, und schwer lesbare Seiten werden im Ergebnis genannt, damit klar ist, wo sich eine Kontrolle lohnt.

  • Standardmäßig privat

    Im Gerätemodus wird das PDF in einem isolierten Frame verarbeitet, den Ihr Browser vom Netzwerk fernhält.

Wie genau ist die OCR auf dem Gerät?

Bei einem sauberen Scan mit 300 dpi liest die Engine fast jedes Zeichen richtig. Schräglage, Unschärfe, Flecken und winzige Schrift verschlechtern das. Seiten mit einer durchschnittlichen Konfidenz unter 75 % werden im Ergebnis aufgeführt, und Zeichen wie № oder «Guillemets» verdienen einen kurzen Blick.

Fragen und Antworten

Wie lange dauert die OCR auf dem Gerät?

Etwa 2–5 Sekunden pro Seite auf einem modernen Laptop, auf Smartphones länger. Jede Seite hat ein Limit von 60 Sekunden: Eine Seite, die mehr braucht, wird übersprungen und im Ergebnis genannt, damit eine einzige schlechte Seite nie den Rest aufhält.

Warum ist der Gerätemodus als Beta gekennzeichnet?

Er funktioniert gut bei sauberen Scans, nutzt aber die schnellen Tesseract-Modelle in Ihrem Browser, und Smartphones haben wenig Arbeitsspeicher. Deshalb ist er auf 50 Seiten am Computer und 10 am Smartphone begrenzt; größere oder schwierigere Dateien sind im Cloud-Modus besser aufgehoben.

Was passiert mit Seiten, die bereits Text enthalten?

Standardmäßig bleiben sie unberührt, und nur reine Bildseiten werden erkannt. Mischt eine Seite echten Text mit einem gescannten Bereich, schalten Sie „Seiten mit vorhandenem Text überspringen“ aus.

Verändert die OCR das Aussehen meines PDFs?

Nein. Seiteninhalt und Bilder bleiben, wie sie sind; nur eine unsichtbare Textebene kommt hinzu. Lesezeichen, Links und Formularfelder bleiben erhalten.

Welche Sprachen erkennt die PDF-Texterkennung?

Russisch und Englisch, einzeln oder zusammen. Andere Sprachen, auch Deutsch, sowie Handschrift werden nicht zuverlässig erkannt.

Wann wird mein PDF für die OCR hochgeladen?

Nur wenn Sie den Cloud-Modus wählen und das Hochladen bestätigen. Dann verarbeitet OCRmyPDF die Datei auf unserem Server (Frankreich), und sie wird automatisch gelöscht. Im Gerätemodus verlässt nichts Ihren Browser.

Weitere Möglichkeiten mit „PDF-Texterkennung“