Перейти к содержимому

Open this page in English? Открыть эту страницу на английском?

Open in English

Diese Seite auf Deutsch öffnen? Открыть эту страницу на немецком?

Auf Deutsch öffnen

¿Abrir esta página en español? Открыть эту страницу на испанском?

Abrir en español

Ouvrir cette page en français ? Открыть эту страницу на французском?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Открыть эту страницу на итальянском?

Apri in italiano

Deze pagina in het Nederlands openen? Открыть эту страницу на нидерландском?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Открыть эту страницу на польском?

Otwórz po polsku

Abrir esta página em português? Открыть эту страницу на португальском?

Abrir em português

Bu sayfayı Türkçe açmak ister misiniz? Открыть эту страницу на турецком?

Türkçe aç

Відкрити цю сторінку українською? Открыть эту страницу на украинском?

Відкрити українською

Извлечь текст из PDF

Весь текст PDF в обычном файле .txt (UTF-8) в порядке чтения — без загрузки документа на сервер.

Только в браузере

Без загрузки на сервер · Бесплатно · Без использования для обучения ИИ

Форматы и ограничения

Форматы и ограничения

Поддерживаемые форматы
PDF
Результат
TXT
На компьютере На телефоне или планшете
Макс. размер файла 300 МБ 100 МБ
Макс. число страниц 2000 300

Лимиты на устройстве зависят от его памяти. Файлы побольше тоже могут сработать — инструмент заранее предупредит.

Как это работает

  1. 01 Выберите PDF, из которого нужно достать текст.
  2. 02 При необходимости укажите страницы или включите «Отмечать начало каждой страницы» в разделе «Дополнительные параметры».
  3. 03 Нажмите «Извлечь текст».
  4. 04 Скопируйте текст из окна предпросмотра или скачайте файл .txt.

Об инструменте

Если просто скопировать текст из программы просмотра PDF, строки часто перемешиваются: две колонки сливаются в одну, колонтитул оказывается посреди предложения. Hushdesk учитывает положение каждого символа на странице и восстанавливает порядок чтения: статья в две колонки выводится сначала левой колонкой, потом правой, заголовки и номера страниц остаются на своих местах. Результат — обычный текстовый файл в кодировке UTF-8. Он откроется в «Блокноте», Word или любом редакторе, его удобно вставить в переводчик или нейросеть. Кириллица и латиница сохраняются без искажений. Если страница — это скан без текстового слоя, инструмент подскажет, какие страницы сначала стоит распознать.

  • Правильный порядок строк

    Колонки определяются на каждой странице: научная статья читается сначала по левой колонке, потом по правой, а не строка за строкой через обе.

  • Любой алфавит

    Файл сохраняется в UTF-8: кириллица, буквы с диакритикой, знаки валют и символы остаются такими же, как в документе.

  • Сканы не пропустим

    Если страница — это картинка с текстом, вы узнаете её номер, а не получите молча пустой результат.

  • Конфиденциально

    Текст читает движок, работающий во вкладке вашего браузера. Отчёты, договоры и медицинские заключения никуда не отправляются.

Вопросы и ответы

Почему в файле не хватает части текста?

Скорее всего, эти страницы — сканы: в PDF лежит фотография листа, а не сами буквы. Результат предупредит о таких страницах. Сначала пропустите документ через распознавание текста, а затем извлеките текст.

Сохраняются ли таблицы и форматирование?

Нет. В файле .txt нет шрифтов, жирного начертания и ячеек: каждая строка таблицы превращается в строку текста, где содержимое ячеек разделено пробелами. Чтобы получить редактируемый документ с оформлением, воспользуйтесь PDF в Word.

Как обрабатываются страницы в две колонки?

Инструмент ищет вертикальную пустую полосу между блоками текста и читает блоки по обе стороны от неё по очереди. Заголовки и колонтитулы на всю ширину страницы служат разделителями, поэтому порядок остаётся естественным.

Можно извлечь текст только из нескольких страниц?

Да. Впишите номера и диапазоны, например 3, 7-9, в поле «Страницы» — остальные страницы будут пропущены.

Подходит ли инструмент для русского и других языков?

Да, любой текст, который хранится в PDF как текст, извлекается в UTF-8. Исключение — языки с письмом справа налево, например арабский или иврит: слова в них могут оказаться в обратном порядке.

Склеиваются ли слова, разорванные переносом?

Нет. Знак переноса в конце строки остаётся таким же, как в PDF: инструмент не всегда может отличить перенос от обычного дефиса.

Загружается ли PDF на сервер, чтобы достать из него текст?

Нет. Символы читаются и собираются в текстовый файл на вашем устройстве — во фрейме, который браузер отрезает от сети.