Распознать текст в PDF-скане
Превратите скан в PDF с поиском и копированием текста. Распознавание идёт прямо в вашем браузере.
Франция · Плановая очистка: через 60 мин после создания задания · Бесплатно
Форматы и ограничения
Форматы и ограничения
- Поддерживаемые форматы
- Результат
| На компьютере | На телефоне или планшете | В облаке | |
|---|---|---|---|
| Макс. размер файла | 200 МБ | 50 МБ | 100 МБ |
| Макс. число страниц | 50 | 10 | 200 |
| Макс. размер изображения | 30 Мп | 16 Мп | Без ограничения |
Плановая очистка: через 60 мин после создания задания · Обычно около 20 с
Лимиты на устройстве зависят от его памяти. Файлы побольше тоже могут сработать — инструмент заранее предупредит.
Как это работает
- 01 Выберите или перетащите PDF-скан.
- 02 Укажите язык текста: русский, английский или оба.
- 03 Оставьте режим «На устройстве» или переключитесь на облако для длинных и плохих сканов.
- 04 Нажмите «Распознать текст» и скачайте PDF с поиском.
Об инструменте
Отсканированный договор или сфотографированная справка — это просто картинка: в ней не работает поиск, из неё не скопировать цитату, её не прочитает экранный диктор. Hushdesk запускает прямо в этой вкладке Tesseract — открытый движок OCR. Он распознаёт русский и английский текст на каждой отсканированной странице и кладёт его невидимым слоем под изображение. Страницы выглядят как раньше, ничего не пережимается, но Ctrl+F, копирование и вставка уже работают. Распознавание на устройстве пока в статусе бета: на ноутбуке страница занимает несколько секунд, на телефоне заметно дольше. Для длинных и совсем плохих сканов есть облачный режим — OCRmyPDF на нашем сервере (Франция).
-
Невидимый текстовый слой
Каждое распознанное слово лежит точно над своим изображением: поиск подсвечивает нужное место, а страница выглядит как прежде.
-
Русский и английский
Языковые данные для обоих языков встроены. Если выбрать один язык, реже путаются похожие латинские и кириллические буквы.
-
Честная оценка качества
Для каждой страницы считается уверенность распознавания, а трудночитаемые страницы перечислены в результате — понятно, что проверить.
-
Конфиденциально по умолчанию
В режиме устройства PDF обрабатывается в изолированном фрейме, которому браузер запрещает выход в сеть.
Насколько точно распознавание на устройстве?
На чистом скане 300 dpi движок верно распознаёт почти все символы. Перекос, размытие, точки и мелкий шрифт снижают точность. Страницы со средней уверенностью ниже 75 % перечисляются в результате, а знаки вроде № и «ёлочек» стоит быстро проверить.
Вопросы и ответы
Сколько времени занимает распознавание на устройстве?
Около 2–5 секунд на страницу на современном ноутбуке, на телефоне дольше. На каждую страницу отводится 60 секунд: если она не успевает, её пропускают и называют в результате, чтобы одна плохая страница не задерживала остальные.
Почему режим на устройстве помечен как бета?
На чистых сканах он работает хорошо, но в браузере используются быстрые модели Tesseract, а памяти у телефонов мало. Поэтому лимит — 50 страниц на компьютере и 10 на телефоне; большие и сложные файлы лучше отправлять в облачный режим.
Что будет со страницами, где уже есть текст?
По умолчанию они не меняются, распознаются только страницы-картинки. Если на странице есть и настоящий текст, и отсканированный фрагмент, выключите «Пропускать страницы с текстом».
Меняется ли внешний вид PDF после распознавания?
Нет. Содержимое страниц и изображения остаются прежними, добавляется только невидимый текстовый слой. Закладки, ссылки и поля форм сохраняются.
Какие языки распознаются в PDF?
Русский и английский — по отдельности или вместе. Другие языки и рукописный текст надёжно не распознаются.
Когда PDF загружается на сервер?
Только если вы выбрали облачный режим и подтвердили загрузку. Тогда файл обрабатывает OCRmyPDF на нашем сервере (Франция), после чего он автоматически удаляется. В режиме устройства ничего не покидает браузер.