Przejdź do treści

Open this page in English? Otworzyć tę stronę po angielsku?

Open in English

Diese Seite auf Deutsch öffnen? Otworzyć tę stronę po niemiecku?

Auf Deutsch öffnen

¿Abrir esta página en español? Otworzyć tę stronę po hiszpańsku?

Abrir en español

Ouvrir cette page en français ? Otworzyć tę stronę po francusku?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Otworzyć tę stronę po włosku?

Apri in italiano

Deze pagina in het Nederlands openen? Otworzyć tę stronę po niderlandzku?

Openen in het Nederlands

Abrir esta página em português? Otworzyć tę stronę po portugalsku?

Abrir em português

Открыть эту страницу на русском? Otworzyć tę stronę po rosyjsku?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Otworzyć tę stronę po turecku?

Türkçe aç

Відкрити цю сторінку українською? Otworzyć tę stronę po ukraińsku?

Відкрити українською

Wyodrębnij tekst z PDF

Pobierz tekst PDF jako zwykły plik .txt w UTF-8, w kolejności czytania, bez przesyłania dokumentu.

Tylko w przeglądarce

Bez przesyłania na serwer · Bezpłatnie · Bez użycia do trenowania AI

Formaty i limity

Formaty i limity

Obsługiwane formaty
PDF
Wynik
TXT
Na komputerze Na telefonie lub tablecie
Maks. rozmiar pliku 300 MB 100 MB
Maks. liczba stron 2000 300

Limity na urządzeniu zależą od jego pamięci. Większe pliki też mogą zadziałać – narzędzie najpierw Cię ostrzeże.

Jak to działa

  1. 01 Wybierz plik PDF, z którego chcesz wyodrębnić tekst.
  2. 02 Opcjonalnie podaj strony albo włącz „Zaznacz początek każdej strony” w sekcji „Więcej opcji”.
  3. 03 Kliknij „Wyodrębnij tekst”.
  4. 04 Skopiuj tekst z podglądu lub pobierz plik .txt.

O tym narzędziu

Kopiowanie tekstu z przeglądarki PDF często daje pomieszane wiersze: dwie kolumny splecione ze sobą, nagłówek strony w środku zdania. Hushdesk sprawdza położenie każdego znaku i odtwarza kolejność czytania, więc artykuł w dwóch kolumnach wychodzi kolumna po kolumnie, a tytuły i numery stron zostają na swoich miejscach. Dostajesz zwykły plik tekstowy UTF-8, który otworzysz w dowolnym edytorze i od razu przekażesz do tłumacza, indeksu wyszukiwania lub czatbota. Polskie znaki, cyrylica i większość innych pism przechodzą bez strat. Strony, które są tylko zeskanowanymi obrazami, nie zawierają liter do wyodrębnienia: narzędzie je wskaże i zaproponuje OCR.

  • Prawdziwa kolejność czytania

    Kolumny są wykrywane na każdej stronie, więc publikację naukową w dwóch kolumnach czytasz najpierw lewą kolumną, potem prawą, a nie wierszami w poprzek obu.

  • Dowolny alfabet

    Plik jest zapisywany w UTF-8: polskie litery, cyrylica, znaki z akcentami, symbole walut i inne znaki trafiają do niego dokładnie takie, jak w dokumencie.

  • Skany są oznaczane

    Gdy strona jest zdjęciem tekstu, dowiesz się, o którą stronę chodzi, zamiast po cichu dostać pusty wynik.

  • Prywatność w standardzie

    Tekst odczytuje silnik działający w karcie przeglądarki. Raporty, umowy i dokumentacja medyczna nigdy do nikogo nie trafiają.

Pytania i odpowiedzi

Dlaczego w wyodrębnionym pliku brakuje części tekstu?

Najpewniej te strony to skany: PDF zawiera zdjęcie strony, a nie same litery. Wynik ostrzega o takich stronach. Najpierw przepuść dokument przez OCR, a potem wyodrębnij tekst.

Czy plik tekstowy zachowuje tabele i formatowanie?

Nie. Plik .txt nie ma czcionek, pogrubień ani komórek tabel; każdy wiersz tabeli staje się linijką z komórkami oddzielonymi spacjami. Jeśli potrzebujesz edytowalnego dokumentu z formatowaniem, użyj narzędzia PDF na Word.

Jak obsługiwane są strony z dwiema kolumnami?

Narzędzie szuka pionowego pustego pasa biegnącego w dół strony między blokami tekstu i odczytuje bloki po obu jego stronach po kolei. Nagłówki i stopki na całą szerokość działają jak separatory, więc kolejność pozostaje naturalna.

Czy mogę wyodrębnić tekst tylko z kilku stron?

Tak. Wpisz strony i zakresy, np. 3, 7-9, w polu „Strony”; pozostałe zostaną pominięte.

Czy to działa z językiem polskim i innymi językami?

Tak, każde pismo, które PDF przechowuje jako tekst, jest wyodrębniane w UTF-8. Wyjątkiem są języki pisane od prawej do lewej, jak arabski czy hebrajski: ich słowa mogą wyjść w odwrotnej kolejności.

Czy słowa przeniesione do nowego wiersza są z powrotem łączone?

Nie. Dywiz dzielący słowo na końcu wiersza zostaje taki, jak w PDF, bo narzędzie nie zawsze odróżni dywiz przeniesienia od prawdziwego łącznika.

Czy PDF jest przesyłany, żeby wyodrębnić tekst?

Nie. Odczyt znaków i budowanie pliku tekstowego odbywają się na Twoim urządzeniu, w ramce odciętej przez przeglądarkę od sieci.