Перейти к содержимому

Open this page in English? Открыть эту страницу на английском?

Open in English

Diese Seite auf Deutsch öffnen? Открыть эту страницу на немецком?

Auf Deutsch öffnen

¿Abrir esta página en español? Открыть эту страницу на испанском?

Abrir en español

Ouvrir cette page en français ? Открыть эту страницу на французском?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Открыть эту страницу на итальянском?

Apri in italiano

Deze pagina in het Nederlands openen? Открыть эту страницу на нидерландском?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Открыть эту страницу на польском?

Otwórz po polsku

Abrir esta página em português? Открыть эту страницу на португальском?

Abrir em português

Bu sayfayı Türkçe açmak ister misiniz? Открыть эту страницу на турецком?

Türkçe aç

Відкрити цю сторінку українською? Открыть эту страницу на украинском?

Відкрити українською

Распознать текст в PDF-скане

Превратите скан в PDF с поиском и копированием текста. Распознавание идёт прямо в вашем браузере.

Локально по умолчанию

Загрузка только с согласия · Бесплатно · Без использования для обучения ИИ

Форматы и ограничения

Форматы и ограничения

Поддерживаемые форматы
PDF
Результат
PDF
На компьютере На телефоне или планшете В облаке
Макс. размер файла 200 МБ 50 МБ 100 МБ
Макс. число страниц 50 10 200
Макс. размер изображения 30 Мп 16 Мп Без ограничения

Плановая очистка: через 60 мин после создания задания · Обычно около 20 с

Лимиты на устройстве зависят от его памяти. Файлы побольше тоже могут сработать — инструмент заранее предупредит.

Как это работает

  1. 01 Выберите или перетащите PDF-скан.
  2. 02 Укажите язык текста: русский, английский или оба.
  3. 03 Оставьте режим «На устройстве» или переключитесь на облако для длинных и плохих сканов.
  4. 04 Нажмите «Распознать текст» и скачайте PDF с поиском.

Об инструменте

Отсканированный договор или сфотографированная справка — это просто картинка: в ней не работает поиск, из неё не скопировать цитату, её не прочитает экранный диктор. Hushdesk запускает прямо в этой вкладке Tesseract — открытый движок OCR. Он распознаёт русский и английский текст на каждой отсканированной странице и кладёт его невидимым слоем под изображение. Страницы выглядят как раньше, ничего не пережимается, но Ctrl+F, копирование и вставка уже работают. Распознавание на устройстве пока в статусе бета: на ноутбуке страница занимает несколько секунд, на телефоне заметно дольше. Для длинных и совсем плохих сканов есть облачный режим — OCRmyPDF на нашем сервере (Франция).

  • Невидимый текстовый слой

    Каждое распознанное слово лежит точно над своим изображением: поиск подсвечивает нужное место, а страница выглядит как прежде.

  • Русский и английский

    Языковые данные для обоих языков встроены. Если выбрать один язык, реже путаются похожие латинские и кириллические буквы.

  • Честная оценка качества

    Для каждой страницы считается уверенность распознавания, а трудночитаемые страницы перечислены в результате — понятно, что проверить.

  • Конфиденциально по умолчанию

    В режиме устройства PDF обрабатывается в изолированном фрейме, которому браузер запрещает выход в сеть.

Насколько точно распознавание на устройстве?

На чистом скане 300 dpi движок верно распознаёт почти все символы. Перекос, размытие, точки и мелкий шрифт снижают точность. Страницы со средней уверенностью ниже 75 % перечисляются в результате, а знаки вроде № и «ёлочек» стоит быстро проверить.

Вопросы и ответы

Сколько времени занимает распознавание на устройстве?

Около 2–5 секунд на страницу на современном ноутбуке, на телефоне дольше. На каждую страницу отводится 60 секунд: если она не успевает, её пропускают и называют в результате, чтобы одна плохая страница не задерживала остальные.

Почему режим на устройстве помечен как бета?

На чистых сканах он работает хорошо, но в браузере используются быстрые модели Tesseract, а памяти у телефонов мало. Поэтому лимит — 50 страниц на компьютере и 10 на телефоне; большие и сложные файлы лучше отправлять в облачный режим.

Что будет со страницами, где уже есть текст?

По умолчанию они не меняются, распознаются только страницы-картинки. Если на странице есть и настоящий текст, и отсканированный фрагмент, выключите «Пропускать страницы с текстом».

Меняется ли внешний вид PDF после распознавания?

Нет. Содержимое страниц и изображения остаются прежними, добавляется только невидимый текстовый слой. Закладки, ссылки и поля форм сохраняются.

Какие языки распознаются в PDF?

Русский и английский — по отдельности или вместе. Другие языки и рукописный текст надёжно не распознаются.

Когда PDF загружается на сервер?

Только если вы выбрали облачный режим и подтвердили загрузку. Тогда файл обрабатывает OCRmyPDF на нашем сервере (Франция), после чего он автоматически удаляется. В режиме устройства ничего не покидает браузер.

Распознать текст в PDF: другие варианты