Sobre o reconhecimento de texto
Uma digitalização ou foto de uma página é só uma imagem: não dá para pesquisar nela, copiar uma frase nem pedir que um leitor de tela a leia em voz alta. O reconhecimento óptico de caracteres (OCR) encontra as letras na imagem e as transforma em texto de verdade.
São duas ferramentas, para dois tipos de arquivo:
- OCR em PDF adiciona uma camada de texto invisível a um PDF digitalizado. As páginas continuam iguais, mas a busca e o copiar e colar passam a funcionar. Use para contratos, notas fiscais, cartas arquivadas e tudo o que você vai querer encontrar de novo.
- Imagem para texto lê uma foto ou captura de tela e entrega texto simples para copiar ou salvar.
O reconhecimento roda no seu navegador com o Tesseract, o mecanismo de OCR de código aberto, e lê inglês e russo. Uma página leva alguns segundos em um notebook e mais tempo no celular. Para digitalizações longas ou de qualidade muito ruim, o OCR em PDF oferece um modo de servidor com o OCRmyPDF. A limpeza é programada para 60 min após a criação da tarefa. Falhas técnicas podem atrasar a exclusão.
Para o melhor resultado, fotografe a página bem plana, com luz uniforme e inteira no enquadramento. Uma digitalização nítida economiza mais tempo do que corrigir o texto depois.
Perguntas frequentes
Quais idiomas são reconhecidos?
Inglês e russo, inclusive em páginas que misturam os dois. Outros idiomas ainda não são compatíveis: o texto sairia embaralhado.
Qual é a precisão do reconhecimento?
Texto impresso e limpo é reconhecido com muita precisão. Letra à mão, fotos borradas, páginas tortas e fontes decorativas reduzem a qualidade, então confira nomes e números no resultado.
O OCR muda a aparência do meu PDF?
Não. O OCR em PDF mantém a imagem de cada página como está e coloca o texto reconhecido em uma camada invisível por baixo dela.
Minhas digitalizações são enviadas?
Só se você escolher o modo de servidor do OCR em PDF. Por padrão, o reconhecimento roda no seu dispositivo, em um frame sem acesso à rede.