OCR PDF: riconoscere il testo nei documenti scansionati
Trasforma le scansioni in PDF in cui puoi cercare e da cui puoi copiare. Di base il riconoscimento avviene nel browser.
Caricamento solo con consenso · Gratis · Nessun uso per addestrare l’IA
Francia · Pulizia prevista: 60 min dalla creazione dell’attività · Gratis
Formati e limiti
Formati e limiti
- Formati accettati
- Risultato
| Su computer | Su smartphone o tablet | Nel cloud | |
|---|---|---|---|
| Dimensione massima del file | 200 MB | 50 MB | 100 MB |
| Numero massimo di pagine | 50 | 10 | 200 |
| Dimensione massima dell’immagine | 30 MP | 16 MP | Nessun limite |
Pulizia prevista: 60 min dalla creazione dell’attività · Di solito circa 20 s
I limiti sul dispositivo dipendono dalla sua memoria. Anche file più grandi possono funzionare: lo strumento ti avvisa prima.
Come funziona
- 01 Scegli o trascina qui un PDF scansionato.
- 02 Scegli la lingua del testo: russo, inglese o entrambe.
- 03 Lascia «Su questo dispositivo» oppure passa alla modalità cloud per scansioni lunghe o scadenti.
- 04 Premi «Riconosci il testo» e scarica il PDF ricercabile.
Informazioni sullo strumento
Un contratto scansionato o un report fotografato è solo un’immagine: non puoi cercarci dentro, copiarne una frase o farlo leggere ad alta voce da uno screen reader. Hushdesk esegue Tesseract, il motore OCR open source, direttamente in questa scheda. Riconosce il testo inglese e russo di ogni pagina scansionata e lo colloca come livello invisibile sotto l’immagine. Le pagine appaiono esattamente come prima e nulla viene ricompresso, eppure ora funzionano Ctrl+F, copia e incolla. L’OCR sul dispositivo è in beta: una pagina richiede qualche secondo su un portatile e parecchio di più su un telefono. Per scansioni lunghe o molto scadenti puoi passare alla modalità cloud, che esegue OCRmyPDF sul nostro server (Francia).
-
Livello di testo invisibile
Ogni parola riconosciuta si trova esattamente sopra la sua immagine, quindi la ricerca evidenzia il punto giusto mentre la pagina resta invariata.
-
Russo e inglese
I dati linguistici di entrambe le lingue sono integrati. Sceglierne una sola riduce la confusione tra lettere latine e cirilliche dall’aspetto simile.
-
Affidabilità onesta
Ogni pagina riceve un punteggio di affidabilità e quelle difficili da leggere vengono indicate nel risultato, così sai cosa controllare.
-
Privato di base
In modalità dispositivo il PDF viene elaborato in un riquadro isolato che il browser tiene fuori dalla rete.
Quanto è preciso l’OCR sul dispositivo?
Su una scansione pulita a 300 dpi il motore legge correttamente quasi ogni carattere. Inclinazione, sfocatura, puntini e caratteri minuscoli peggiorano il risultato. Le pagine con affidabilità media sotto il 75% vengono elencate nel risultato, e simboli come № o le «virgolette caporali» meritano un rapido controllo.
Domande e risposte
Quanto tempo richiede l’OCR sul dispositivo?
Circa 2–5 secondi per pagina su un portatile moderno, di più sui telefoni. Ogni pagina ha un limite di 60 secondi: una pagina che ne richiede di più viene saltata e indicata nel risultato, così una pagina difficile non blocca mai le altre.
Perché la modalità sul dispositivo è segnata come beta?
Funziona bene sulle scansioni pulite, ma usa i modelli rapidi di Tesseract dentro il browser e i telefoni hanno poca memoria. Per questo è limitata a 50 pagine sui computer e 10 sui telefoni; i file più grandi o difficili è meglio mandarli alla modalità cloud.
Cosa succede alle pagine che contengono già testo?
Per impostazione predefinita restano intatte e vengono riconosciute solo le pagine fatte di sola immagine. Se una pagina mescola testo vero e un’area scansionata, disattiva «Salta le pagine che hanno già testo».
L’OCR cambia l’aspetto del mio PDF?
No. Il contenuto della pagina e le sue immagini restano come sono; viene aggiunto solo un livello di testo invisibile. Segnalibri, link e campi dei moduli vengono mantenuti.
Quali lingue riconosce «OCR PDF»?
Russo e inglese, da sole o insieme. Altre lingue e la scrittura a mano non vengono riconosciute in modo affidabile: un documento in italiano letto con «Inglese» va ricontrollato, soprattutto nelle vocali accentate.
Quando viene caricato il mio PDF per l’OCR?
Solo se scegli la modalità cloud e confermi il caricamento. In quel caso OCRmyPDF lo elabora sul nostro server (Francia) e il file viene eliminato automaticamente. In modalità dispositivo nulla lascia il browser.