Zum Inhalt springen

Open this page in English? Diese Seite auf Englisch öffnen?

Open in English

¿Abrir esta página en español? Diese Seite auf Spanisch öffnen?

Abrir en español

Ouvrir cette page en français ? Diese Seite auf Französisch öffnen?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Diese Seite auf Italienisch öffnen?

Apri in italiano

Deze pagina in het Nederlands openen? Diese Seite auf Niederländisch öffnen?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Diese Seite auf Polnisch öffnen?

Otwórz po polsku

Abrir esta página em português? Diese Seite auf Portugiesisch öffnen?

Abrir em português

Открыть эту страницу на русском? Diese Seite auf Russisch öffnen?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Diese Seite auf Türkisch öffnen?

Türkçe aç

Відкрити цю сторінку українською? Diese Seite auf Ukrainisch öffnen?

Відкрити українською

Text aus PDF extrahieren

Der Text eines PDFs als einfache UTF-8-Datei (.txt), in Lesereihenfolge und ohne das Dokument hochzuladen.

Nur im Browser

Kein Server-Upload · Kostenlos · Keine Nutzung für KI-Training

Formate und Limits

Formate und Limits

Unterstützte Formate
PDF
Ergebnis
TXT
Am Computer Auf Smartphone oder Tablet
Max. Dateigröße 300 MB 100 MB
Max. Seitenzahl 2000 300

Die Limits auf Ihrem Gerät hängen von seinem Arbeitsspeicher ab. Größere Dateien können trotzdem funktionieren; das Werkzeug warnt Sie vorher.

So funktioniert’s

  1. 01 Wählen Sie das PDF aus, aus dem Sie Text extrahieren möchten.
  2. 02 Geben Sie bei Bedarf die Seiten an oder schalten Sie unter „Weitere Optionen“ „Seitenanfänge markieren“ ein.
  3. 03 Klicken Sie auf „Text extrahieren“.
  4. 04 Kopieren Sie den Text aus der Vorschau oder laden Sie die .txt-Datei herunter.

Über dieses Werkzeug

Wer Text aus einem PDF-Viewer kopiert, bekommt oft durcheinandergeratene Zeilen: zwei Spalten ineinander verwoben, eine Kopfzeile mitten im Satz. Hushdesk betrachtet die Position jedes Zeichens und stellt die Lesereihenfolge wieder her: Ein zweispaltiger Artikel kommt Spalte für Spalte heraus, Titel und Seitenzahlen bleiben, wo sie hingehören. Sie erhalten eine einfache UTF-8-Textdatei, die sich in jedem Editor öffnet und direkt in ein Übersetzungsprogramm, einen Suchindex oder einen Chatbot wandern kann. Deutsch, Englisch, Russisch und die meisten anderen Schriften kommen unversehrt an. Seiten, die nur gescannte Bilder sind, enthalten keine Buchstaben zum Extrahieren: Das Werkzeug nennt sie und schlägt stattdessen OCR vor.

  • Echte Lesereihenfolge

    Spalten werden auf jeder Seite erkannt: Ein zweispaltiger Aufsatz wird erst links, dann rechts gelesen statt Zeile für Zeile quer über beide.

  • Jedes Alphabet

    Die Datei wird als UTF-8 gespeichert: Umlaute, Kyrillisch, Akzente, Währungs- und andere Sonderzeichen kommen genau so an, wie sie im Dokument stehen.

  • Scans werden gemeldet

    Ist eine Seite ein Bild von Text, erfahren Sie, um welche Seite es geht, statt stillschweigend ein leeres Ergebnis zu bekommen.

  • Vertrauliches bleibt vertraulich

    Den Text liest eine Engine in Ihrem Browser-Tab. Berichte, Verträge und Arztbriefe werden an niemanden gesendet.

Fragen und Antworten

Warum fehlt in der extrahierten Datei ein Teil des Textes?

Höchstwahrscheinlich sind diese Seiten Scans: Das PDF enthält ein Foto der Seite, nicht die Buchstaben selbst. Das Ergebnis warnt vor solchen Seiten. Lassen Sie das Dokument zuerst durch die OCR laufen und extrahieren Sie dann den Text.

Bleiben Tabellen und Formatierung in der Textdatei erhalten?

Nein. Eine .txt-Datei kennt keine Schriften, keinen Fettdruck und keine Tabellenzellen; jede Tabellenzeile wird zu einer Textzeile mit durch Leerzeichen getrennten Zellen. Für ein bearbeitbares Dokument mit Formatierung nutzen Sie PDF in Word.

Wie werden zweispaltige Seiten behandelt?

Das Werkzeug sucht nach einer senkrechten weißen Lücke, die zwischen Textblöcken über die Seite verläuft, und liest die Blöcke links und rechts davon nacheinander. Überschriften und Fußzeilen über die ganze Breite wirken als Trenner, sodass die Reihenfolge natürlich bleibt.

Kann ich Text nur aus einigen Seiten extrahieren?

Ja. Tragen Sie Seiten und Bereiche wie 3, 7-9 in das Feld „Seiten“ ein; alles andere wird übersprungen.

Funktioniert das auch mit Umlauten und anderen Sprachen?

Ja, jede Schrift, die das PDF als Text speichert, wird in UTF-8 extrahiert, Umlaute ebenso wie Kyrillisch. Eine Ausnahme sind Sprachen, die von rechts nach links geschrieben werden, etwa Arabisch oder Hebräisch: Ihre Wörter können in umgekehrter Reihenfolge herauskommen.

Werden am Zeilenende getrennte Wörter wieder zusammengefügt?

Nein. Ein Trennstrich am Zeilenende bleibt so, wie er im PDF steht, weil das Werkzeug einen Trennstrich nicht immer von einem echten Bindestrich unterscheiden kann.

Wird das PDF hochgeladen, um den Text zu lesen?

Nein. Das Auslesen der Zeichen und das Erstellen der Textdatei passieren beide auf Ihrem Gerät, in einem Frame, den Ihr Browser vom Netzwerk abschneidet.