O rozpoznawaniu tekstu
Skan lub zdjęcie strony to tylko obraz: nie da się go przeszukać, skopiować z niego zdania ani odczytać na głos czytnikiem ekranu. Optyczne rozpoznawanie znaków (OCR) odnajduje litery na obrazie i zamienia je w prawdziwy tekst.
Są dwa narzędzia, dla dwóch rodzajów plików:
- OCR PDF dodaje do zeskanowanego PDF niewidoczną warstwę tekstową. Strony wyglądają tak samo, ale wyszukiwanie, kopiowanie i wklejanie zaczynają działać. Przydaje się do umów, faktur, archiwalnych pism i wszystkiego, co zechcesz później odnaleźć.
- Obraz na tekst odczytuje zdjęcie lub zrzut ekranu i daje zwykły tekst do skopiowania lub zapisania.
Rozpoznawanie działa w Twojej przeglądarce, korzysta z Tesseract, silnika OCR open source, i odczytuje angielski i rosyjski. Strona zajmuje kilka sekund na laptopie i dłużej na telefonie. Przy długich lub bardzo słabych skanach OCR PDF oferuje tryb serwerowy oparty na OCRmyPDF. Czyszczenie zaplanowano 60 min po utworzeniu zadania. Awarie techniczne mogą opóźnić usunięcie.
Aby uzyskać najlepszy wynik, fotografuj stronę płasko, przy równym świetle i w całości w kadrze. Ostry skan oszczędza więcej czasu niż późniejsze poprawianie tekstu.
Pytania i odpowiedzi
Jakie języki są rozpoznawane?
Angielski i rosyjski, także na stronach, na których oba się mieszają. Inne języki nie są jeszcze obsługiwane: ich tekst wyszedłby zniekształcony.
Jak dokładne jest rozpoznawanie?
Czysty tekst drukowany jest rozpoznawany bardzo dokładnie. Pismo odręczne, nieostre zdjęcia, krzywe strony i ozdobne czcionki obniżają jakość, więc sprawdź w wyniku nazwiska i liczby.
Czy OCR zmienia wygląd mojego PDF?
Nie. OCR PDF zostawia obraz każdej strony bez zmian i umieszcza rozpoznany tekst w niewidocznej warstwie pod nim.
Czy moje skany są przesyłane?
Nie, chyba że wybierzesz tryb serwerowy OCR PDF. Domyślnie rozpoznawanie działa na Twoim urządzeniu, w ramce bez dostępu do sieci.