Sobre el reconocimiento de texto
Un escaneo o una foto de una página no es más que una imagen: no puedes buscar en ella, copiar una frase ni hacer que un lector de pantalla la lea en voz alta. El reconocimiento óptico de caracteres (OCR) encuentra las letras en la imagen y las convierte en texto de verdad.
Hay dos herramientas, para dos tipos de archivo:
- OCR de PDF añade una capa de texto invisible a un PDF escaneado. Las páginas se ven igual, pero ya puedes buscar, copiar y pegar. Úsala para contratos, facturas, cartas archivadas y todo lo que quieras volver a encontrar.
- Imagen a texto lee una foto o una captura de pantalla y te da texto sin formato para copiar o guardar.
El reconocimiento se hace en tu navegador con Tesseract, el motor OCR de código abierto, y lee inglés y ruso. Una página tarda unos segundos en un portátil y algo más en un móvil. Para escaneos largos o de muy mala calidad, OCR de PDF ofrece un modo de servidor que usa OCRmyPDF. La limpieza se programa 60 min después de crear la tarea. Los fallos técnicos pueden retrasar la eliminación.
Para obtener el mejor resultado, fotografía la página plana, con luz uniforme y entera dentro del encuadre. Un escaneo nítido ahorra más tiempo que corregir el texto después.
Preguntas frecuentes
¿Qué idiomas se pueden reconocer?
Inglés y ruso, incluidas las páginas que mezclan los dos. Otros idiomas todavía no son compatibles: su texto saldría ilegible.
¿Qué precisión tiene el reconocimiento?
El texto impreso y limpio se reconoce con mucha precisión. La escritura a mano, las fotos borrosas, las páginas torcidas y las fuentes decorativas reducen la calidad, así que revisa los nombres y las cifras del resultado.
¿El OCR cambia el aspecto de mi PDF?
No. OCR de PDF conserva tal cual la imagen de cada página y coloca el texto reconocido en una capa invisible debajo.
¿Se suben mis escaneos?
Solo si eliges el modo de servidor de OCR de PDF. De forma predeterminada, el reconocimiento se hace en tu dispositivo, en un marco sin acceso a la red.