OCR em PDF: reconheça o texto de documentos digitalizados
Transforme digitalizações em PDFs que você pode pesquisar e copiar. O reconhecimento roda no navegador por padrão.
França · Limpeza prevista: 60 min após criar a tarefa · Grátis
Formatos e limites
Formatos e limites
- Formatos aceitos
- Resultado
| No computador | No celular ou tablet | Na nuvem | |
|---|---|---|---|
| Tamanho máx. do arquivo | 200 MB | 50 MB | 100 MB |
| Máx. de páginas | 50 | 10 | 200 |
| Tamanho máx. da imagem | 30 MP | 16 MP | Sem limite |
Limpeza prevista: 60 min após criar a tarefa · Geralmente cerca de 20 s
Os limites no seu dispositivo dependem da memória dele. Arquivos maiores ainda podem funcionar; a ferramenta avisa antes.
Como funciona
- 01 Escolha ou arraste um PDF digitalizado.
- 02 Escolha o idioma do texto: russo, inglês ou os dois.
- 03 Mantenha “Neste dispositivo” ou mude para o modo na nuvem em digitalizações longas ou ruins.
- 04 Clique em “Reconhecer texto” e baixe o PDF pesquisável.
Sobre esta ferramenta
Um contrato digitalizado ou um relatório fotografado é só uma imagem: não dá para pesquisar, copiar um trecho nem pedir para um leitor de tela ler em voz alta. Hushdesk roda o Tesseract, o mecanismo de OCR de código aberto, direto nesta aba. Ele reconhece o texto em russo e inglês de cada página digitalizada e o coloca como uma camada invisível sob a imagem. As páginas continuam com a mesma aparência e nada é recomprimido, mas Ctrl+F, copiar e colar passam a funcionar. O OCR no dispositivo está em beta: uma página leva alguns segundos num notebook e bem mais num celular. Para digitalizações longas ou muito ruins, você pode mudar para o modo na nuvem, que roda o OCRmyPDF no nosso servidor (França).
-
Camada de texto invisível
Cada palavra reconhecida fica exatamente sobre a sua imagem, então a busca destaca o ponto certo enquanto a página continua igual.
-
Russo e inglês
Os dados dos dois idiomas já vêm embutidos. Escolher só um idioma reduz a confusão entre letras latinas e cirílicas parecidas.
-
Confiança sem maquiagem
Cada página recebe um índice de confiança, e as páginas difíceis de ler são indicadas no resultado para você saber o que conferir.
-
Privacidade como padrão
No modo dispositivo, o PDF é processado num frame isolado que o navegador mantém fora da rede.
Qual a precisão do OCR no dispositivo?
Numa digitalização limpa de 300 dpi, o mecanismo lê quase todos os caracteres corretamente. Inclinação, desfoque, sujeira e letras muito pequenas pioram o resultado. Páginas com confiança média abaixo de 75% aparecem listadas no resultado, e símbolos como № ou «aspas angulares» merecem uma olhada rápida.
Perguntas frequentes
Quanto tempo leva o OCR no dispositivo?
Cerca de 2–5 segundos por página num notebook moderno, mais em celulares. Cada página tem um limite de 60 segundos: a página que precisar de mais é pulada e indicada no resultado, então uma página ruim nunca trava as outras.
Por que o modo no dispositivo está marcado como beta?
Ele funciona bem em digitalizações limpas, mas usa os modelos rápidos do Tesseract dentro do navegador, e celulares têm pouca memória. Por isso ele é limitado a 50 páginas no computador e 10 no celular; arquivos maiores ou mais difíceis vão melhor no modo na nuvem.
O que acontece com páginas que já têm texto?
Por padrão, elas ficam intactas e só as páginas que são apenas imagem passam pelo reconhecimento. Se uma página mistura texto real com uma área digitalizada, desative “Pular páginas que já têm texto”.
O OCR muda a aparência do meu PDF?
Não. O conteúdo da página e as imagens ficam como estão; só uma camada de texto invisível é adicionada. Marcadores, links e campos de formulário são mantidos.
Que idiomas o OCR em PDF reconhece?
Russo e inglês, separados ou juntos. Outros idiomas e textos manuscritos não são reconhecidos de forma confiável.
Quando meu PDF é enviado para o OCR?
Só se você escolher o modo na nuvem e confirmar o envio. Aí o OCRmyPDF processa o arquivo no nosso servidor (França), e ele é excluído automaticamente. No modo dispositivo, nada sai do seu navegador.