Перейти до вмісту

Open this page in English? Відкрити цю сторінку англійською?

Open in English

Diese Seite auf Deutsch öffnen? Відкрити цю сторінку німецькою?

Auf Deutsch öffnen

¿Abrir esta página en español? Відкрити цю сторінку іспанською?

Abrir en español

Ouvrir cette page en français ? Відкрити цю сторінку французькою?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Відкрити цю сторінку італійською?

Apri in italiano

Deze pagina in het Nederlands openen? Відкрити цю сторінку нідерландською?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Відкрити цю сторінку польською?

Otwórz po polsku

Abrir esta página em português? Відкрити цю сторінку португальською?

Abrir em português

Открыть эту страницу на русском? Відкрити цю сторінку російською?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Відкрити цю сторінку турецькою?

Türkçe aç

OCR PDF: розпізнавання тексту в сканах документів

Перетворіть скани на PDF, у яких можна шукати й копіювати текст. За замовчуванням усе працює у браузері.

Типово локально

Завантаження лише за згодою · Безкоштовно · Без використання для навчання ШІ

Формати й обмеження

Формати й обмеження

Підтримувані формати
PDF
Результат
PDF
На комп’ютері На телефоні або планшеті У хмарі
Макс. розмір файлу 200 МБ 50 МБ 100 МБ
Макс. кількість сторінок 50 10 200
Макс. розмір зображення 30 Мп 16 Мп Без обмежень

Планове очищення: через 60 хв після створення завдання · Зазвичай близько 20 с

Ліміти на пристрої залежать від його пам’яті. Більші файли теж можуть спрацювати; інструмент попередить про це заздалегідь.

Як це працює

  1. 01 Виберіть або перетягніть відсканований PDF.
  2. 02 Укажіть мову тексту: російська, англійська або обидві.
  3. 03 Залиште режим «На цьому пристрої (бета)» або виберіть «Хмара» для довгих чи поганих сканів.
  4. 04 Натисніть «Розпізнати текст» і завантажте PDF з пошуком за текстом.

Про інструмент

Відсканований договір чи сфотографований звіт — це просто картинка: у ній не знайти слово, з неї не скопіювати цитату, її не прочитає екранний диктор. Hushdesk запускає Tesseract, відкритий рушій OCR, просто в цій вкладці. Він розпізнає російський та англійський текст на кожній відсканованій сторінці й кладе його невидимим шаром під зображення. Сторінки виглядають як раніше, нічого не перестискається, але Ctrl+F, копіювання й вставлення вже працюють. Українську рушій поки що не розпізнає надійно: літери і, ї, є, ґ та апостроф можуть читатися з помилками, тож перевіряйте результат. OCR на пристрої має статус бета: сторінка займає кілька секунд на ноутбуці й помітно довше на телефоні. Для довгих або дуже поганих сканів є хмарний режим з OCRmyPDF на нашому сервері (Франція).

  • Невидимий текстовий шар

    Кожне розпізнане слово лежить точно над своїм зображенням, тож пошук підсвічує правильне місце, а сторінка на вигляд не змінюється.

  • Російська та англійська

    Мовні дані для обох мов уже вбудовано. Якщо вибрати лише одну мову, схожі латинські й кириличні літери плутаються рідше.

  • Чесна впевненість

    Кожна сторінка отримує оцінку впевненості розпізнавання, а важкі для читання сторінки названо в результаті, тож ви знаєте, що перевірити.

  • Конфіденційно за замовчуванням

    У режимі пристрою PDF обробляється в ізольованому фреймі, якому браузер не дає доступу до мережі.

Наскільки точне розпізнавання на пристрої?

На чистому скані 300 dpi рушій правильно читає майже кожен символ. Перекіс, розмиття, цятки й дрібний шрифт погіршують результат. Сторінки із середньою впевненістю нижче 75 % перелічено в результаті, а символи на кшталт № чи «лапок-ялинок» варто швидко перевірити.

Запитання й відповіді

Скільки часу триває OCR на пристрої?

Близько 2–5 секунд на сторінку на сучасному ноутбуці, на телефонах довше. Для кожної сторінки є ліміт 60 секунд: сторінку, якій потрібно більше, пропускають і називають у результаті, тож одна погана сторінка не затримує решту.

Чому режим на пристрої позначено як бета?

Він добре працює на чистих сканах, але використовує в браузері швидкі моделі Tesseract, а пам’яті в телефонів мало. Тому діє ліміт 50 сторінок на комп’ютерах і 10 на телефонах; більші чи складніші файли краще надсилати в хмарний режим.

Що буде зі сторінками, де вже є текст?

За замовчуванням їх не змінюють, а розпізнають лише сторінки-зображення. Якщо на сторінці є і справжній текст, і відсканована ділянка, вимкніть «Пропускати сторінки з текстом».

Чи змінює OCR вигляд мого PDF?

Ні. Вміст сторінок і зображення лишаються як є, додається тільки невидимий текстовий шар. Закладки, посилання й поля форм зберігаються.

Які мови розпізнає OCR PDF і чи підходить він для української?

Російську та англійську, окремо чи разом. Української в рушія поки немає, тож у такому тексті літери і, ї, є, ґ та апостроф можуть читатися з помилками — обов’язково перевіряйте результат. Інші мови й рукописний текст також не розпізнаються надійно.

Коли мій PDF надсилається на сервер для OCR?

Лише якщо ви виберете хмарний режим і підтвердите надсилання. Тоді OCRmyPDF обробляє файл на нашому сервері (Франція), після чого файл автоматично видаляється. У режимі пристрою ніщо не залишає ваш браузер.

Розпізнати текст у PDF: інші варіанти