Text aus PDF extrahieren
Der Text eines PDFs als einfache UTF-8-Datei (.txt), in Lesereihenfolge und ohne das Dokument hochzuladen.
Formate und Limits
Formate und Limits
- Unterstützte Formate
- Ergebnis
- TXT
| Am Computer | Auf Smartphone oder Tablet | |
|---|---|---|
| Max. Dateigröße | 300 MB | 100 MB |
| Max. Seitenzahl | 2000 | 300 |
Die Limits auf Ihrem Gerät hängen von seinem Arbeitsspeicher ab. Größere Dateien können trotzdem funktionieren; das Werkzeug warnt Sie vorher.
So funktioniert’s
- 01 Wählen Sie das PDF aus, aus dem Sie Text extrahieren möchten.
- 02 Geben Sie bei Bedarf die Seiten an oder schalten Sie unter „Weitere Optionen“ „Seitenanfänge markieren“ ein.
- 03 Klicken Sie auf „Text extrahieren“.
- 04 Kopieren Sie den Text aus der Vorschau oder laden Sie die .txt-Datei herunter.
Über dieses Werkzeug
Wer Text aus einem PDF-Viewer kopiert, bekommt oft durcheinandergeratene Zeilen: zwei Spalten ineinander verwoben, eine Kopfzeile mitten im Satz. Hushdesk betrachtet die Position jedes Zeichens und stellt die Lesereihenfolge wieder her: Ein zweispaltiger Artikel kommt Spalte für Spalte heraus, Titel und Seitenzahlen bleiben, wo sie hingehören. Sie erhalten eine einfache UTF-8-Textdatei, die sich in jedem Editor öffnet und direkt in ein Übersetzungsprogramm, einen Suchindex oder einen Chatbot wandern kann. Deutsch, Englisch, Russisch und die meisten anderen Schriften kommen unversehrt an. Seiten, die nur gescannte Bilder sind, enthalten keine Buchstaben zum Extrahieren: Das Werkzeug nennt sie und schlägt stattdessen OCR vor.
-
Echte Lesereihenfolge
Spalten werden auf jeder Seite erkannt: Ein zweispaltiger Aufsatz wird erst links, dann rechts gelesen statt Zeile für Zeile quer über beide.
-
Jedes Alphabet
Die Datei wird als UTF-8 gespeichert: Umlaute, Kyrillisch, Akzente, Währungs- und andere Sonderzeichen kommen genau so an, wie sie im Dokument stehen.
-
Scans werden gemeldet
Ist eine Seite ein Bild von Text, erfahren Sie, um welche Seite es geht, statt stillschweigend ein leeres Ergebnis zu bekommen.
-
Vertrauliches bleibt vertraulich
Den Text liest eine Engine in Ihrem Browser-Tab. Berichte, Verträge und Arztbriefe werden an niemanden gesendet.
Fragen und Antworten
Warum fehlt in der extrahierten Datei ein Teil des Textes?
Höchstwahrscheinlich sind diese Seiten Scans: Das PDF enthält ein Foto der Seite, nicht die Buchstaben selbst. Das Ergebnis warnt vor solchen Seiten. Lassen Sie das Dokument zuerst durch die OCR laufen und extrahieren Sie dann den Text.
Bleiben Tabellen und Formatierung in der Textdatei erhalten?
Nein. Eine .txt-Datei kennt keine Schriften, keinen Fettdruck und keine Tabellenzellen; jede Tabellenzeile wird zu einer Textzeile mit durch Leerzeichen getrennten Zellen. Für ein bearbeitbares Dokument mit Formatierung nutzen Sie PDF in Word.
Wie werden zweispaltige Seiten behandelt?
Das Werkzeug sucht nach einer senkrechten weißen Lücke, die zwischen Textblöcken über die Seite verläuft, und liest die Blöcke links und rechts davon nacheinander. Überschriften und Fußzeilen über die ganze Breite wirken als Trenner, sodass die Reihenfolge natürlich bleibt.
Kann ich Text nur aus einigen Seiten extrahieren?
Ja. Tragen Sie Seiten und Bereiche wie 3, 7-9 in das Feld „Seiten“ ein; alles andere wird übersprungen.
Funktioniert das auch mit Umlauten und anderen Sprachen?
Ja, jede Schrift, die das PDF als Text speichert, wird in UTF-8 extrahiert, Umlaute ebenso wie Kyrillisch. Eine Ausnahme sind Sprachen, die von rechts nach links geschrieben werden, etwa Arabisch oder Hebräisch: Ihre Wörter können in umgekehrter Reihenfolge herauskommen.
Werden am Zeilenende getrennte Wörter wieder zusammengefügt?
Nein. Ein Trennstrich am Zeilenende bleibt so, wie er im PDF steht, weil das Werkzeug einen Trennstrich nicht immer von einem echten Bindestrich unterscheiden kann.
Wird das PDF hochgeladen, um den Text zu lesen?
Nein. Das Auslesen der Zeichen und das Erstellen der Textdatei passieren beide auf Ihrem Gerät, in einem Frame, den Ihr Browser vom Netzwerk abschneidet.