OCR de PDF: reconoce el texto de documentos escaneados
Convierte escaneos en PDF en los que puedes buscar y copiar. Por defecto, el reconocimiento se hace en tu navegador.
Francia · Limpieza prevista: 60 min tras crear la tarea · Gratis
Formatos y límites
Formatos y límites
- Formatos admitidos
- Resultado
| En un ordenador | En un móvil o tableta | En la nube | |
|---|---|---|---|
| Tamaño máx. por archivo | 200 MB | 50 MB | 100 MB |
| Máx. de páginas | 50 | 10 | 200 |
| Tamaño máx. de imagen | 30 MP | 16 MP | Sin límite |
Limpieza prevista: 60 min tras crear la tarea · Normalmente, aprox. 20 s
Los límites en tu dispositivo dependen de su memoria. Los archivos más grandes pueden funcionar igualmente; la herramienta te avisa antes.
Cómo funciona
- 01 Elige o suelta un PDF escaneado.
- 02 Escoge el idioma del texto: ruso, inglés o los dos.
- 03 Deja «En este dispositivo (beta)» o cambia a «Nube» para escaneos largos o de mala calidad.
- 04 Pulsa «Reconocer texto» y descarga el PDF en el que ya se puede buscar.
Sobre esta herramienta
Un contrato escaneado o un informe fotografiado no es más que una imagen: no puedes buscar en él, copiar una cita ni hacer que un lector de pantalla lo lea en voz alta. Hushdesk ejecuta Tesseract, el motor de OCR de código abierto, en esta misma pestaña. Reconoce el texto en ruso y en inglés de cada página escaneada y lo coloca como una capa invisible bajo la imagen. Las páginas se ven exactamente igual y no se recomprime nada, pero Ctrl+F, copiar y pegar ya funcionan. El OCR en el dispositivo está en beta: una página tarda unos segundos en un portátil y bastante más en un móvil. Para escaneos largos o muy malos puedes cambiar al modo en la nube, que ejecuta OCRmyPDF en nuestro servidor (Francia).
-
Capa de texto invisible
Cada palabra reconocida queda exactamente sobre su imagen, así que la búsqueda resalta el lugar correcto mientras la página se ve igual.
-
Ruso e inglés
Los datos de ambos idiomas vienen incluidos. Elegir uno solo reduce las confusiones entre letras latinas y cirílicas que se parecen.
-
Confianza sin trampas
Cada página recibe una puntuación de confianza, y las que costaron de leer se nombran en el resultado para que sepas qué revisar.
-
Privado por defecto
En el modo en el dispositivo, el PDF se procesa en un marco aislado que tu navegador mantiene sin acceso a la red.
¿Qué precisión tiene el OCR en el dispositivo?
Con un escaneo limpio a 300 dpi, el motor lee bien casi todos los caracteres. La inclinación, el desenfoque, las motas y la letra diminuta bajan esa cifra. Las páginas con una confianza media inferior al 75 % aparecen en el resultado, y conviene echar un vistazo a símbolos como № o las «comillas latinas».
Preguntas frecuentes
¿Cuánto tarda el OCR en el dispositivo?
Unos 2–5 segundos por página en un portátil moderno, más en los móviles. Cada página tiene un límite de 60 segundos: la que necesita más se omite y se nombra en el resultado, así que una página difícil nunca retrasa al resto.
¿Por qué el modo en el dispositivo está en beta?
Funciona bien con escaneos limpios, pero usa los modelos rápidos de Tesseract dentro de tu navegador, y los móviles tienen poca memoria. Por eso se limita a 50 páginas en ordenadores y 10 en móviles; los archivos más grandes o difíciles es mejor enviarlos al modo en la nube.
¿Qué pasa con las páginas que ya tienen texto?
Por defecto se dejan intactas y solo se reconocen las páginas que son solo imagen. Si una página mezcla texto real con una zona escaneada, desactiva «Omitir las páginas que ya tienen texto».
¿El OCR cambia el aspecto de mi PDF?
No. El contenido de la página y sus imágenes se quedan como están; solo se añade una capa de texto invisible. Se conservan los marcadores, los enlaces y los campos de formulario.
¿Qué idiomas reconoce el OCR de PDF?
Ruso e inglés, por separado o juntos. Otros idiomas, el español incluido, y la escritura a mano no se reconocen de forma fiable.
¿Cuándo se sube mi PDF para el OCR?
Solo si eliges el modo en la nube y confirmas la subida. Entonces OCRmyPDF lo procesa en nuestro servidor (Francia) y el archivo se elimina automáticamente. En el modo en el dispositivo, nada sale de tu navegador.