OCR PDF: rozpoznaj tekst w zeskanowanych dokumentach
Zamień skany w pliki PDF, które można przeszukiwać i kopiować. Domyślnie rozpoznawanie działa w przeglądarce.
Francja · Planowane czyszczenie: 60 min po utworzeniu zadania · Bezpłatnie
Formaty i limity
Formaty i limity
- Obsługiwane formaty
- Wynik
| Na komputerze | Na telefonie lub tablecie | W chmurze | |
|---|---|---|---|
| Maks. rozmiar pliku | 200 MB | 50 MB | 100 MB |
| Maks. liczba stron | 50 | 10 | 200 |
| Maks. rozmiar obrazu | 30 Mpx | 16 Mpx | Bez limitu |
Planowane czyszczenie: 60 min po utworzeniu zadania · Zwykle ok. 20 s
Limity na urządzeniu zależą od jego pamięci. Większe pliki też mogą zadziałać – narzędzie najpierw Cię ostrzeże.
Jak to działa
- 01 Wybierz lub przeciągnij zeskanowany PDF.
- 02 Wybierz język tekstu: rosyjski, angielski lub oba.
- 03 Zostaw „Na tym urządzeniu” albo przełącz na chmurę przy długich lub słabych skanach.
- 04 Kliknij „Rozpoznaj tekst” i pobierz przeszukiwalny PDF.
O tym narzędziu
Zeskanowana umowa czy sfotografowany raport to tylko obraz: nie da się go przeszukać, skopiować z niego cytatu ani odczytać czytnikiem ekranu. Hushdesk uruchamia Tesseract, otwartoźródłowy silnik OCR, bezpośrednio w tej karcie. Rozpoznaje tekst rosyjski i angielski na każdej zeskanowanej stronie i umieszcza go jako niewidoczną warstwę pod obrazem. Strony wyglądają dokładnie jak wcześniej i nic nie jest ponownie kompresowane, a mimo to działają Ctrl+F oraz kopiowanie i wklejanie. OCR na urządzeniu jest w wersji beta: strona zajmuje kilka sekund na laptopie i zauważalnie dłużej na telefonie. Przy długich lub bardzo słabych skanach możesz przełączyć się na tryb w chmurze, który uruchamia OCRmyPDF na naszym serwerze (Francja).
-
Niewidoczna warstwa tekstowa
Każde rozpoznane słowo leży dokładnie nad swoim obrazem, więc wyszukiwanie podświetla właściwe miejsce, a strona wygląda bez zmian.
-
Rosyjski i angielski
Dane językowe dla obu są wbudowane. Wybór tylko jednego języka ogranicza pomyłki między podobnie wyglądającymi literami łacińskimi i cyrylicą.
-
Uczciwa ocena pewności
Każda strona dostaje ocenę pewności, a strony trudne do odczytania są wymienione w wyniku, więc wiesz, co sprawdzić.
-
Domyślnie prywatnie
W trybie urządzenia PDF jest przetwarzany w izolowanej ramce, którą przeglądarka trzyma z dala od sieci.
Jak dokładny jest OCR na urządzeniu?
Na czystym skanie 300 dpi silnik odczytuje poprawnie niemal każdy znak. Przekrzywienie, rozmycie, plamki i bardzo drobny druk obniżają ten wynik. Strony ze średnią pewnością poniżej 75% są wymienione w wyniku, a symbole takie jak № czy «cudzysłowy ostrokątne» warto szybko przejrzeć.
Pytania i odpowiedzi
Ile trwa OCR na urządzeniu?
Około 2–5 sekund na stronę na nowoczesnym laptopie, dłużej na telefonach. Każda strona ma limit 60 sekund: strona, która potrzebuje więcej, jest pomijana i wymieniana w wyniku, więc jedna zła strona nigdy nie wstrzymuje reszty.
Dlaczego tryb na urządzeniu jest oznaczony jako beta?
Dobrze działa na czystych skanach, ale korzysta z szybkich modeli Tesseract w przeglądarce, a telefony mają mało pamięci. Dlatego obowiązuje limit 50 stron na komputerach i 10 na telefonach; większe lub trudniejsze pliki lepiej wysłać do trybu w chmurze.
Co dzieje się ze stronami, które już zawierają tekst?
Domyślnie zostają nietknięte i rozpoznawane są tylko strony będące samym obrazem. Jeśli strona łączy prawdziwy tekst z zeskanowanym fragmentem, wyłącz opcję „Pomiń strony, które mają już tekst”.
Czy OCR zmienia wygląd mojego PDF?
Nie. Treść strony i jej obrazy zostają bez zmian; dodawana jest tylko niewidoczna warstwa tekstowa. Zakładki, linki i pola formularzy są zachowywane.
Jakie języki rozpoznaje OCR PDF?
Rosyjski i angielski, osobno lub razem. Inne języki, w tym polski, oraz pismo odręczne nie są rozpoznawane niezawodnie.
Kiedy mój PDF jest przesyłany do OCR?
Tylko jeśli wybierzesz tryb w chmurze i potwierdzisz przesłanie. Wtedy OCRmyPDF przetwarza go na naszym serwerze (Francja), a plik jest automatycznie usuwany. W trybie urządzenia nic nie opuszcza przeglądarki.