Про розпізнавання тексту
Скан або фото сторінки — це просто зображення: у ньому не можна шукати, з нього не скопіювати речення, його не прочитає програма екранного читання. Оптичне розпізнавання символів (OCR) знаходить літери на зображенні й перетворює їх на справжній текст.
Інструментів два, для двох видів файлів:
- Розпізнати текст у PDF додає до сканованого PDF невидимий текстовий шар. Сторінки виглядають як раніше, але пошук, копіювання й вставлення тепер працюють. Підходить для договорів, рахунків, архівних листів і всього, що згодом знадобиться знайти.
- Зображення в текст читає фото чи скриншот і видає звичайний текст, який можна скопіювати або зберегти.
Розпізнавання працює у вашому браузері за допомогою Tesseract, відкритого рушія OCR, і читає англійську та російську. Сторінка обробляється за кілька секунд на ноутбуці й довше на телефоні. Для довгих або дуже поганих сканів у розпізнавання PDF є серверний режим на OCRmyPDF. Очищення завдання заплановано через 60 хв після його створення. Технічні збої можуть затримати видалення.
Для найкращого результату фотографуйте сторінку рівно, за рівномірного освітлення й повністю в кадрі. Чіткий скан заощаджує більше часу, ніж виправлення тексту потім.
Запитання й відповіді
Які мови розпізнаються?
Англійська та російська, зокрема на сторінках, де вони змішані. Інші мови, як-от українська, поки не підтримуються: їхній текст вийде з помилками.
Наскільки точне розпізнавання?
Чистий друкований текст розпізнається дуже точно. Рукописний текст, розмиті фото, перекошені сторінки й декоративні шрифти знижують якість, тому перевіряйте в результаті імена та числа.
Чи змінює OCR вигляд мого PDF?
Ні. Розпізнати текст у PDF залишає зображення кожної сторінки як є і розміщує розпізнаний текст невидимим шаром під ним.
Чи надсилаються мої скани?
Ні, якщо ви самі не виберете серверний режим розпізнавання PDF. Типово розпізнавання працює на вашому пристрої, у фреймі без доступу до мережі.