Pular para o conteúdo

Open this page in English? Abrir esta página em inglês?

Open in English

Diese Seite auf Deutsch öffnen? Abrir esta página em alemão?

Auf Deutsch öffnen

¿Abrir esta página en español? Abrir esta página em espanhol?

Abrir en español

Ouvrir cette page en français ? Abrir esta página em francês?

Ouvrir en français

Vuoi aprire questa pagina in italiano? Abrir esta página em italiano?

Apri in italiano

Deze pagina in het Nederlands openen? Abrir esta página em holandês?

Openen in het Nederlands

Otworzyć tę stronę po polsku? Abrir esta página em polonês?

Otwórz po polsku

Открыть эту страницу на русском? Abrir esta página em russo?

Открыть на русском

Bu sayfayı Türkçe açmak ister misiniz? Abrir esta página em turco?

Türkçe aç

Відкрити цю сторінку українською? Abrir esta página em ucraniano?

Відкрити українською

Extrair texto de PDF

Receba o texto de um PDF como arquivo .txt simples em UTF-8, na ordem de leitura, sem enviar o documento.

Somente no navegador

Sem envio ao servidor · Grátis · Sem uso para treinar IA

Formatos e limites

Formatos e limites

Formatos aceitos
PDF
Resultado
TXT
No computador No celular ou tablet
Tamanho máx. do arquivo 300 MB 100 MB
Máx. de páginas 2000 300

Os limites no seu dispositivo dependem da memória dele. Arquivos maiores ainda podem funcionar; a ferramenta avisa antes.

Como funciona

  1. 01 Escolha o PDF do qual você quer extrair o texto.
  2. 02 Se quiser, indique as páginas ou ative “Marcar onde cada página começa” em “Mais opções”.
  3. 03 Clique em “Extrair texto”.
  4. 04 Copie o texto da prévia ou baixe o arquivo .txt.

Sobre esta ferramenta

Copiar o texto de um leitor de PDF muitas vezes dá linhas embaralhadas: duas colunas misturadas, um cabeçalho no meio de uma frase. Hushdesk analisa a posição de cada caractere e reconstrói a ordem de leitura, então um artigo em duas colunas sai coluna por coluna, enquanto títulos e números de página ficam no lugar certo. Você recebe um arquivo de texto simples em UTF-8 que abre em qualquer editor e pode ir direto para um tradutor, um índice de busca ou um chatbot. Português, inglês, russo e a maioria dos outros alfabetos chegam intactos. Páginas que são só imagens digitalizadas não têm letras para extrair: a ferramenta indica quais são e sugere o OCR.

  • Ordem de leitura de verdade

    As colunas são detectadas em cada página, então um artigo em duas colunas é lido primeiro pela coluna da esquerda e depois pela da direita, em vez de linha por linha atravessando as duas.

  • Qualquer alfabeto

    O arquivo é salvo em UTF-8: acentos, cedilha, cirílico, símbolos de moeda e outros sinais chegam exatamente como aparecem no documento.

  • Digitalizações sinalizadas

    Quando uma página é uma foto de texto, você fica sabendo qual é, em vez de receber um resultado vazio sem explicação.

  • Privado por princípio

    O texto é lido por um mecanismo que roda na aba do seu navegador. Relatórios, contratos e laudos médicos nunca são enviados a ninguém.

Perguntas frequentes

Por que falta texto no arquivo extraído?

O mais provável é que essas páginas sejam digitalizações: o PDF guarda uma foto da página, não as letras. O resultado avisa sobre essas páginas. Passe o documento pelo OCR primeiro e depois extraia o texto.

O arquivo de texto mantém tabelas e formatação?

Não. Um .txt não tem fontes, negrito nem células de tabela; cada linha da tabela vira uma linha com as células separadas por espaços. Para um documento editável que mantém a formatação, use o PDF para Word.

Como são tratadas as páginas com duas colunas?

A ferramenta procura uma faixa branca vertical que desce pela página entre blocos de texto e lê os blocos de cada lado, um de cada vez. Títulos e rodapés de largura total servem de separadores, então a ordem continua natural.

Posso extrair o texto de só algumas páginas?

Sim. Coloque páginas e intervalos como 3, 7-9 no campo “Páginas”; o resto é ignorado.

Funciona com português e outros idiomas?

Sim, qualquer escrita que o PDF guarda como texto é extraída em UTF-8. Idiomas da direita para a esquerda, como árabe ou hebraico, são exceção: as palavras podem sair em ordem invertida.

Palavras separadas por hífen no fim da linha são juntadas de novo?

Não. O hífen que quebra uma palavra no fim da linha fica como está no PDF, porque a ferramenta nem sempre consegue distinguir um hífen de quebra de um hífen de verdade.

O PDF é enviado para extrair o texto?

Não. A leitura dos caracteres e a montagem do arquivo de texto acontecem no seu dispositivo, dentro de um frame que o navegador isola da rede.