Извлечь текст из PDF
Весь текст PDF в обычном файле .txt (UTF-8) в порядке чтения — без загрузки документа на сервер.
Форматы и ограничения
Форматы и ограничения
- Поддерживаемые форматы
- Результат
- TXT
| На компьютере | На телефоне или планшете | |
|---|---|---|
| Макс. размер файла | 300 МБ | 100 МБ |
| Макс. число страниц | 2000 | 300 |
Лимиты на устройстве зависят от его памяти. Файлы побольше тоже могут сработать — инструмент заранее предупредит.
Как это работает
- 01 Выберите PDF, из которого нужно достать текст.
- 02 При необходимости укажите страницы или включите «Отмечать начало каждой страницы» в разделе «Дополнительные параметры».
- 03 Нажмите «Извлечь текст».
- 04 Скопируйте текст из окна предпросмотра или скачайте файл .txt.
Об инструменте
Если просто скопировать текст из программы просмотра PDF, строки часто перемешиваются: две колонки сливаются в одну, колонтитул оказывается посреди предложения. Hushdesk учитывает положение каждого символа на странице и восстанавливает порядок чтения: статья в две колонки выводится сначала левой колонкой, потом правой, заголовки и номера страниц остаются на своих местах. Результат — обычный текстовый файл в кодировке UTF-8. Он откроется в «Блокноте», Word или любом редакторе, его удобно вставить в переводчик или нейросеть. Кириллица и латиница сохраняются без искажений. Если страница — это скан без текстового слоя, инструмент подскажет, какие страницы сначала стоит распознать.
-
Правильный порядок строк
Колонки определяются на каждой странице: научная статья читается сначала по левой колонке, потом по правой, а не строка за строкой через обе.
-
Любой алфавит
Файл сохраняется в UTF-8: кириллица, буквы с диакритикой, знаки валют и символы остаются такими же, как в документе.
-
Сканы не пропустим
Если страница — это картинка с текстом, вы узнаете её номер, а не получите молча пустой результат.
-
Конфиденциально
Текст читает движок, работающий во вкладке вашего браузера. Отчёты, договоры и медицинские заключения никуда не отправляются.
Вопросы и ответы
Почему в файле не хватает части текста?
Скорее всего, эти страницы — сканы: в PDF лежит фотография листа, а не сами буквы. Результат предупредит о таких страницах. Сначала пропустите документ через распознавание текста, а затем извлеките текст.
Сохраняются ли таблицы и форматирование?
Нет. В файле .txt нет шрифтов, жирного начертания и ячеек: каждая строка таблицы превращается в строку текста, где содержимое ячеек разделено пробелами. Чтобы получить редактируемый документ с оформлением, воспользуйтесь PDF в Word.
Как обрабатываются страницы в две колонки?
Инструмент ищет вертикальную пустую полосу между блоками текста и читает блоки по обе стороны от неё по очереди. Заголовки и колонтитулы на всю ширину страницы служат разделителями, поэтому порядок остаётся естественным.
Можно извлечь текст только из нескольких страниц?
Да. Впишите номера и диапазоны, например 3, 7-9, в поле «Страницы» — остальные страницы будут пропущены.
Подходит ли инструмент для русского и других языков?
Да, любой текст, который хранится в PDF как текст, извлекается в UTF-8. Исключение — языки с письмом справа налево, например арабский или иврит: слова в них могут оказаться в обратном порядке.
Склеиваются ли слова, разорванные переносом?
Нет. Знак переноса в конце строки остаётся таким же, как в PDF: инструмент не всегда может отличить перенос от обычного дефиса.
Загружается ли PDF на сервер, чтобы достать из него текст?
Нет. Символы читаются и собираются в текстовый файл на вашем устройстве — во фрейме, который браузер отрезает от сети.