Wyodrębnij tekst z PDF
Pobierz tekst PDF jako zwykły plik .txt w UTF-8, w kolejności czytania, bez przesyłania dokumentu.
Formaty i limity
Formaty i limity
- Obsługiwane formaty
- Wynik
- TXT
| Na komputerze | Na telefonie lub tablecie | |
|---|---|---|
| Maks. rozmiar pliku | 300 MB | 100 MB |
| Maks. liczba stron | 2000 | 300 |
Limity na urządzeniu zależą od jego pamięci. Większe pliki też mogą zadziałać – narzędzie najpierw Cię ostrzeże.
Jak to działa
- 01 Wybierz plik PDF, z którego chcesz wyodrębnić tekst.
- 02 Opcjonalnie podaj strony albo włącz „Zaznacz początek każdej strony” w sekcji „Więcej opcji”.
- 03 Kliknij „Wyodrębnij tekst”.
- 04 Skopiuj tekst z podglądu lub pobierz plik .txt.
O tym narzędziu
Kopiowanie tekstu z przeglądarki PDF często daje pomieszane wiersze: dwie kolumny splecione ze sobą, nagłówek strony w środku zdania. Hushdesk sprawdza położenie każdego znaku i odtwarza kolejność czytania, więc artykuł w dwóch kolumnach wychodzi kolumna po kolumnie, a tytuły i numery stron zostają na swoich miejscach. Dostajesz zwykły plik tekstowy UTF-8, który otworzysz w dowolnym edytorze i od razu przekażesz do tłumacza, indeksu wyszukiwania lub czatbota. Polskie znaki, cyrylica i większość innych pism przechodzą bez strat. Strony, które są tylko zeskanowanymi obrazami, nie zawierają liter do wyodrębnienia: narzędzie je wskaże i zaproponuje OCR.
-
Prawdziwa kolejność czytania
Kolumny są wykrywane na każdej stronie, więc publikację naukową w dwóch kolumnach czytasz najpierw lewą kolumną, potem prawą, a nie wierszami w poprzek obu.
-
Dowolny alfabet
Plik jest zapisywany w UTF-8: polskie litery, cyrylica, znaki z akcentami, symbole walut i inne znaki trafiają do niego dokładnie takie, jak w dokumencie.
-
Skany są oznaczane
Gdy strona jest zdjęciem tekstu, dowiesz się, o którą stronę chodzi, zamiast po cichu dostać pusty wynik.
-
Prywatność w standardzie
Tekst odczytuje silnik działający w karcie przeglądarki. Raporty, umowy i dokumentacja medyczna nigdy do nikogo nie trafiają.
Pytania i odpowiedzi
Dlaczego w wyodrębnionym pliku brakuje części tekstu?
Najpewniej te strony to skany: PDF zawiera zdjęcie strony, a nie same litery. Wynik ostrzega o takich stronach. Najpierw przepuść dokument przez OCR, a potem wyodrębnij tekst.
Czy plik tekstowy zachowuje tabele i formatowanie?
Nie. Plik .txt nie ma czcionek, pogrubień ani komórek tabel; każdy wiersz tabeli staje się linijką z komórkami oddzielonymi spacjami. Jeśli potrzebujesz edytowalnego dokumentu z formatowaniem, użyj narzędzia PDF na Word.
Jak obsługiwane są strony z dwiema kolumnami?
Narzędzie szuka pionowego pustego pasa biegnącego w dół strony między blokami tekstu i odczytuje bloki po obu jego stronach po kolei. Nagłówki i stopki na całą szerokość działają jak separatory, więc kolejność pozostaje naturalna.
Czy mogę wyodrębnić tekst tylko z kilku stron?
Tak. Wpisz strony i zakresy, np. 3, 7-9, w polu „Strony”; pozostałe zostaną pominięte.
Czy to działa z językiem polskim i innymi językami?
Tak, każde pismo, które PDF przechowuje jako tekst, jest wyodrębniane w UTF-8. Wyjątkiem są języki pisane od prawej do lewej, jak arabski czy hebrajski: ich słowa mogą wyjść w odwrotnej kolejności.
Czy słowa przeniesione do nowego wiersza są z powrotem łączone?
Nie. Dywiz dzielący słowo na końcu wiersza zostaje taki, jak w PDF, bo narzędzie nie zawsze odróżni dywiz przeniesienia od prawdziwego łącznika.
Czy PDF jest przesyłany, żeby wyodrębnić tekst?
Nie. Odczyt znaków i budowanie pliku tekstowego odbywają się na Twoim urządzeniu, w ramce odciętej przez przeglądarkę od sieci.