OCR PDF: розпізнавання тексту в сканах документів
Перетворіть скани на PDF, у яких можна шукати й копіювати текст. За замовчуванням усе працює у браузері.
Франція · Планове очищення: через 60 хв після створення завдання · Безкоштовно
Формати й обмеження
Формати й обмеження
- Підтримувані формати
- Результат
| На комп’ютері | На телефоні або планшеті | У хмарі | |
|---|---|---|---|
| Макс. розмір файлу | 200 МБ | 50 МБ | 100 МБ |
| Макс. кількість сторінок | 50 | 10 | 200 |
| Макс. розмір зображення | 30 Мп | 16 Мп | Без обмежень |
Планове очищення: через 60 хв після створення завдання · Зазвичай близько 20 с
Ліміти на пристрої залежать від його пам’яті. Більші файли теж можуть спрацювати; інструмент попередить про це заздалегідь.
Як це працює
- 01 Виберіть або перетягніть відсканований PDF.
- 02 Укажіть мову тексту: російська, англійська або обидві.
- 03 Залиште режим «На цьому пристрої (бета)» або виберіть «Хмара» для довгих чи поганих сканів.
- 04 Натисніть «Розпізнати текст» і завантажте PDF з пошуком за текстом.
Про інструмент
Відсканований договір чи сфотографований звіт — це просто картинка: у ній не знайти слово, з неї не скопіювати цитату, її не прочитає екранний диктор. Hushdesk запускає Tesseract, відкритий рушій OCR, просто в цій вкладці. Він розпізнає російський та англійський текст на кожній відсканованій сторінці й кладе його невидимим шаром під зображення. Сторінки виглядають як раніше, нічого не перестискається, але Ctrl+F, копіювання й вставлення вже працюють. Українську рушій поки що не розпізнає надійно: літери і, ї, є, ґ та апостроф можуть читатися з помилками, тож перевіряйте результат. OCR на пристрої має статус бета: сторінка займає кілька секунд на ноутбуці й помітно довше на телефоні. Для довгих або дуже поганих сканів є хмарний режим з OCRmyPDF на нашому сервері (Франція).
-
Невидимий текстовий шар
Кожне розпізнане слово лежить точно над своїм зображенням, тож пошук підсвічує правильне місце, а сторінка на вигляд не змінюється.
-
Російська та англійська
Мовні дані для обох мов уже вбудовано. Якщо вибрати лише одну мову, схожі латинські й кириличні літери плутаються рідше.
-
Чесна впевненість
Кожна сторінка отримує оцінку впевненості розпізнавання, а важкі для читання сторінки названо в результаті, тож ви знаєте, що перевірити.
-
Конфіденційно за замовчуванням
У режимі пристрою PDF обробляється в ізольованому фреймі, якому браузер не дає доступу до мережі.
Наскільки точне розпізнавання на пристрої?
На чистому скані 300 dpi рушій правильно читає майже кожен символ. Перекіс, розмиття, цятки й дрібний шрифт погіршують результат. Сторінки із середньою впевненістю нижче 75 % перелічено в результаті, а символи на кшталт № чи «лапок-ялинок» варто швидко перевірити.
Запитання й відповіді
Скільки часу триває OCR на пристрої?
Близько 2–5 секунд на сторінку на сучасному ноутбуці, на телефонах довше. Для кожної сторінки є ліміт 60 секунд: сторінку, якій потрібно більше, пропускають і називають у результаті, тож одна погана сторінка не затримує решту.
Чому режим на пристрої позначено як бета?
Він добре працює на чистих сканах, але використовує в браузері швидкі моделі Tesseract, а пам’яті в телефонів мало. Тому діє ліміт 50 сторінок на комп’ютерах і 10 на телефонах; більші чи складніші файли краще надсилати в хмарний режим.
Що буде зі сторінками, де вже є текст?
За замовчуванням їх не змінюють, а розпізнають лише сторінки-зображення. Якщо на сторінці є і справжній текст, і відсканована ділянка, вимкніть «Пропускати сторінки з текстом».
Чи змінює OCR вигляд мого PDF?
Ні. Вміст сторінок і зображення лишаються як є, додається тільки невидимий текстовий шар. Закладки, посилання й поля форм зберігаються.
Які мови розпізнає OCR PDF і чи підходить він для української?
Російську та англійську, окремо чи разом. Української в рушія поки немає, тож у такому тексті літери і, ї, є, ґ та апостроф можуть читатися з помилками — обов’язково перевіряйте результат. Інші мови й рукописний текст також не розпізнаються надійно.
Коли мій PDF надсилається на сервер для OCR?
Лише якщо ви виберете хмарний режим і підтвердите надсилання. Тоді OCRmyPDF обробляє файл на нашому сервері (Франція), після чого файл автоматично видаляється. У режимі пристрою ніщо не залишає ваш браузер.