Видобути текст із PDF
Отримайте текст PDF у звичайному файлі .txt (UTF-8), у порядку читання й без надсилання документа.
Формати й обмеження
Формати й обмеження
- Підтримувані формати
- Результат
- TXT
| На комп’ютері | На телефоні або планшеті | |
|---|---|---|
| Макс. розмір файлу | 300 МБ | 100 МБ |
| Макс. кількість сторінок | 2000 | 300 |
Ліміти на пристрої залежать від його пам’яті. Більші файли теж можуть спрацювати; інструмент попередить про це заздалегідь.
Як це працює
- 01 Виберіть PDF, з якого треба видобути текст.
- 02 За бажанням вкажіть сторінки або ввімкніть «Позначати початок кожної сторінки» в розділі «Більше параметрів».
- 03 Натисніть «Видобути текст».
- 04 Скопіюйте текст із попереднього перегляду або завантажте файл .txt.
Про інструмент
Якщо скопіювати текст із програми перегляду PDF, рядки часто перемішуються: дві колонки сплітаються в одну, колонтитул опиняється посеред речення. Hushdesk враховує розташування кожного символу й відновлює порядок читання, тож стаття у дві колонки виходить колонка за колонкою, а заголовки й номери сторінок лишаються на своїх місцях. Ви отримуєте звичайний текстовий файл UTF-8, який відкривається в будь-якому редакторі й одразу годиться для перекладача, пошукового індексу чи чат-бота. Українська, англійська, російська та більшість інших писемностей переносяться без спотворень. Сторінки, що є лише сканованими картинками, не містять літер для видобування: інструмент назве їх і запропонує розпізнавання тексту.
-
Справжній порядок читання
Колонки визначаються на кожній сторінці, тож наукова стаття у дві колонки читається спершу ліворуч, потім праворуч, а не рядок за рядком через обидві.
-
Будь-який алфавіт
Файл зберігається в UTF-8: кирилиця, літери з діакритикою, знаки валют і символи надходять точно такими, як у документі.
-
Скани позначено
Якщо сторінка — це фото тексту, ви дізнаєтеся, яка саме, а не отримаєте мовчки порожній результат.
-
Приватно від початку
Текст читає рушій у вкладці вашого браузера. Звіти, договори й медичні висновки нікому не надсилаються.
Запитання й відповіді
Чому у видобутому файлі бракує частини тексту?
Найімовірніше, ці сторінки — скани: PDF містить фото сторінки, а не самі літери. Результат попереджає про такі сторінки. Спершу пропустіть документ через розпізнавання тексту, а потім видобудьте текст.
Чи зберігає текстовий файл таблиці й форматування?
Ні. У файлі .txt немає шрифтів, жирного накреслення чи клітинок таблиць; кожен рядок таблиці стає рядком тексту, де вміст клітинок розділено пробілами. Щоб отримати редагований документ із форматуванням, скористайтеся PDF у Word.
Як обробляються сторінки у дві колонки?
Інструмент шукає вертикальний білий проміжок, що тягнеться сторінкою між блоками тексту, і читає блоки з обох боків по черзі. Заголовки й колонтитули на всю ширину слугують розділювачами, тож порядок лишається природним.
Чи можна видобути текст лише з кількох сторінок?
Так. Впишіть сторінки й діапазони, наприклад 3, 7-9, у поле «Сторінки»; решту буде пропущено.
Чи працює видобування тексту з українською та іншими мовами?
Так, будь-яка писемність, яку PDF зберігає як текст, видобувається в UTF-8. Виняток — мови з письмом справа наліво, як-от арабська чи іврит: їхні слова можуть вийти у зворотному порядку.
Чи з’єднуються слова, розірвані переносом?
Ні. Дефіс, що розриває слово в кінці рядка, лишається таким, як у PDF, бо інструмент не завжди може відрізнити перенос від справжнього дефіса.
Чи надсилається PDF на сервер, щоб видобути з нього текст?
Ні. Читання символів і збирання текстового файлу відбуваються на вашому пристрої, у фреймі, який браузер відрізає від мережі.