Extrair texto de PDF
Receba o texto de um PDF como arquivo .txt simples em UTF-8, na ordem de leitura, sem enviar o documento.
Formatos e limites
Formatos e limites
- Formatos aceitos
- Resultado
- TXT
| No computador | No celular ou tablet | |
|---|---|---|
| Tamanho máx. do arquivo | 300 MB | 100 MB |
| Máx. de páginas | 2000 | 300 |
Os limites no seu dispositivo dependem da memória dele. Arquivos maiores ainda podem funcionar; a ferramenta avisa antes.
Como funciona
- 01 Escolha o PDF do qual você quer extrair o texto.
- 02 Se quiser, indique as páginas ou ative “Marcar onde cada página começa” em “Mais opções”.
- 03 Clique em “Extrair texto”.
- 04 Copie o texto da prévia ou baixe o arquivo .txt.
Sobre esta ferramenta
Copiar o texto de um leitor de PDF muitas vezes dá linhas embaralhadas: duas colunas misturadas, um cabeçalho no meio de uma frase. Hushdesk analisa a posição de cada caractere e reconstrói a ordem de leitura, então um artigo em duas colunas sai coluna por coluna, enquanto títulos e números de página ficam no lugar certo. Você recebe um arquivo de texto simples em UTF-8 que abre em qualquer editor e pode ir direto para um tradutor, um índice de busca ou um chatbot. Português, inglês, russo e a maioria dos outros alfabetos chegam intactos. Páginas que são só imagens digitalizadas não têm letras para extrair: a ferramenta indica quais são e sugere o OCR.
-
Ordem de leitura de verdade
As colunas são detectadas em cada página, então um artigo em duas colunas é lido primeiro pela coluna da esquerda e depois pela da direita, em vez de linha por linha atravessando as duas.
-
Qualquer alfabeto
O arquivo é salvo em UTF-8: acentos, cedilha, cirílico, símbolos de moeda e outros sinais chegam exatamente como aparecem no documento.
-
Digitalizações sinalizadas
Quando uma página é uma foto de texto, você fica sabendo qual é, em vez de receber um resultado vazio sem explicação.
-
Privado por princípio
O texto é lido por um mecanismo que roda na aba do seu navegador. Relatórios, contratos e laudos médicos nunca são enviados a ninguém.
Perguntas frequentes
Por que falta texto no arquivo extraído?
O mais provável é que essas páginas sejam digitalizações: o PDF guarda uma foto da página, não as letras. O resultado avisa sobre essas páginas. Passe o documento pelo OCR primeiro e depois extraia o texto.
O arquivo de texto mantém tabelas e formatação?
Não. Um .txt não tem fontes, negrito nem células de tabela; cada linha da tabela vira uma linha com as células separadas por espaços. Para um documento editável que mantém a formatação, use o PDF para Word.
Como são tratadas as páginas com duas colunas?
A ferramenta procura uma faixa branca vertical que desce pela página entre blocos de texto e lê os blocos de cada lado, um de cada vez. Títulos e rodapés de largura total servem de separadores, então a ordem continua natural.
Posso extrair o texto de só algumas páginas?
Sim. Coloque páginas e intervalos como 3, 7-9 no campo “Páginas”; o resto é ignorado.
Funciona com português e outros idiomas?
Sim, qualquer escrita que o PDF guarda como texto é extraída em UTF-8. Idiomas da direita para a esquerda, como árabe ou hebraico, são exceção: as palavras podem sair em ordem invertida.
Palavras separadas por hífen no fim da linha são juntadas de novo?
Não. O hífen que quebra uma palavra no fim da linha fica como está no PDF, porque a ferramenta nem sempre consegue distinguir um hífen de quebra de um hífen de verdade.
O PDF é enviado para extrair o texto?
Não. A leitura dos caracteres e a montagem do arquivo de texto acontecem no seu dispositivo, dentro de um frame que o navegador isola da rede.