Перейти до вмісту

Open this page in English? Відкрити цю сторінку англійською?

Open in English

Diese Seite auf Deutsch öffnen? Відкрити цю сторінку німецькою?

Auf Deutsch öffnen

¿Abrir esta página en español? Відкрити цю сторінку іспанською?

Abrir en español

Ouvrir cette page en français ? Відкрити цю сторінку французькою?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Відкрити цю сторінку італійською?

Apri in italiano

Deze pagina in het Nederlands openen? Відкрити цю сторінку нідерландською?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Відкрити цю сторінку польською?

Otwórz po polsku

Abrir esta página em português? Відкрити цю сторінку португальською?

Abrir em português

Открыть эту страницу на русском? Відкрити цю сторінку російською?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Відкрити цю сторінку турецькою?

Türkçe aç

Видобути текст із PDF

Отримайте текст PDF у звичайному файлі .txt (UTF-8), у порядку читання й без надсилання документа.

Лише у браузері

Без завантаження на сервер · Безкоштовно · Без використання для навчання ШІ

Формати й обмеження

Формати й обмеження

Підтримувані формати
PDF
Результат
TXT
На комп’ютері На телефоні або планшеті
Макс. розмір файлу 300 МБ 100 МБ
Макс. кількість сторінок 2000 300

Ліміти на пристрої залежать від його пам’яті. Більші файли теж можуть спрацювати; інструмент попередить про це заздалегідь.

Як це працює

  1. 01 Виберіть PDF, з якого треба видобути текст.
  2. 02 За бажанням вкажіть сторінки або ввімкніть «Позначати початок кожної сторінки» в розділі «Більше параметрів».
  3. 03 Натисніть «Видобути текст».
  4. 04 Скопіюйте текст із попереднього перегляду або завантажте файл .txt.

Про інструмент

Якщо скопіювати текст із програми перегляду PDF, рядки часто перемішуються: дві колонки сплітаються в одну, колонтитул опиняється посеред речення. Hushdesk враховує розташування кожного символу й відновлює порядок читання, тож стаття у дві колонки виходить колонка за колонкою, а заголовки й номери сторінок лишаються на своїх місцях. Ви отримуєте звичайний текстовий файл UTF-8, який відкривається в будь-якому редакторі й одразу годиться для перекладача, пошукового індексу чи чат-бота. Українська, англійська, російська та більшість інших писемностей переносяться без спотворень. Сторінки, що є лише сканованими картинками, не містять літер для видобування: інструмент назве їх і запропонує розпізнавання тексту.

  • Справжній порядок читання

    Колонки визначаються на кожній сторінці, тож наукова стаття у дві колонки читається спершу ліворуч, потім праворуч, а не рядок за рядком через обидві.

  • Будь-який алфавіт

    Файл зберігається в UTF-8: кирилиця, літери з діакритикою, знаки валют і символи надходять точно такими, як у документі.

  • Скани позначено

    Якщо сторінка — це фото тексту, ви дізнаєтеся, яка саме, а не отримаєте мовчки порожній результат.

  • Приватно від початку

    Текст читає рушій у вкладці вашого браузера. Звіти, договори й медичні висновки нікому не надсилаються.

Запитання й відповіді

Чому у видобутому файлі бракує частини тексту?

Найімовірніше, ці сторінки — скани: PDF містить фото сторінки, а не самі літери. Результат попереджає про такі сторінки. Спершу пропустіть документ через розпізнавання тексту, а потім видобудьте текст.

Чи зберігає текстовий файл таблиці й форматування?

Ні. У файлі .txt немає шрифтів, жирного накреслення чи клітинок таблиць; кожен рядок таблиці стає рядком тексту, де вміст клітинок розділено пробілами. Щоб отримати редагований документ із форматуванням, скористайтеся PDF у Word.

Як обробляються сторінки у дві колонки?

Інструмент шукає вертикальний білий проміжок, що тягнеться сторінкою між блоками тексту, і читає блоки з обох боків по черзі. Заголовки й колонтитули на всю ширину слугують розділювачами, тож порядок лишається природним.

Чи можна видобути текст лише з кількох сторінок?

Так. Впишіть сторінки й діапазони, наприклад 3, 7-9, у поле «Сторінки»; решту буде пропущено.

Чи працює видобування тексту з українською та іншими мовами?

Так, будь-яка писемність, яку PDF зберігає як текст, видобувається в UTF-8. Виняток — мови з письмом справа наліво, як-от арабська чи іврит: їхні слова можуть вийти у зворотному порядку.

Чи з’єднуються слова, розірвані переносом?

Ні. Дефіс, що розриває слово в кінці рядка, лишається таким, як у PDF, бо інструмент не завжди може відрізнити перенос від справжнього дефіса.

Чи надсилається PDF на сервер, щоб видобути з нього текст?

Ні. Читання символів і збирання текстового файлу відбуваються на вашому пристрої, у фреймі, який браузер відрізає від мережі.