О распознавании текста
Скан или фотография страницы — это просто картинка: по ней нельзя искать, из неё не скопировать фразу, её не прочитает экранный диктор. Оптическое распознавание символов (OCR) находит буквы на изображении и превращает их в настоящий текст.
Инструментов два, для двух видов файлов:
- Распознать текст в PDF добавляет к отсканированному PDF невидимый текстовый слой. Страницы выглядят как прежде, но поиск, копирование и вставка начинают работать. Подходит для договоров, счетов, архивных писем и всего, что потом понадобится найти.
- Изображение в текст читает фото или скриншот и выдаёт обычный текст, который можно скопировать или сохранить.
Распознавание идёт в браузере с помощью Tesseract, открытого движка OCR, и понимает русский и английский. Страница обрабатывается за несколько секунд на ноутбуке и дольше на телефоне. Для длинных или очень плохих сканов у распознавания PDF есть серверный режим на OCRmyPDF. Очистка задания запланирована через 60 мин после его создания. Технические сбои могут задержать удаление.
Для лучшего результата фотографируйте страницу ровно, при равномерном свете и целиком в кадре. Чёткий скан экономит больше времени, чем исправление текста потом.
Вопросы и ответы
Какие языки распознаются?
Русский и английский, в том числе на страницах, где они смешаны. Другие языки пока не поддерживаются: их текст получится с ошибками.
Насколько точно распознавание?
Чистый печатный текст распознаётся очень точно. Рукописный текст, размытые фото, перекошенные страницы и декоративные шрифты снижают качество, поэтому проверяйте в результате имена и цифры.
Меняет ли распознавание внешний вид PDF?
Нет. Распознавание PDF оставляет изображение каждой страницы как есть и кладёт распознанный текст невидимым слоем под ним.
Загружаются ли мои сканы?
Нет, если вы сами не выберете серверный режим распознавания PDF. По умолчанию всё идёт на устройстве, в рамке без доступа к сети.