Estrai il testo da un PDF
Ottieni il testo di un PDF come semplice file .txt UTF-8, nell’ordine di lettura, senza caricare il documento.
Formati e limiti
Formati e limiti
- Formati accettati
- Risultato
- TXT
| Su computer | Su smartphone o tablet | |
|---|---|---|
| Dimensione massima del file | 300 MB | 100 MB |
| Numero massimo di pagine | 2000 | 300 |
I limiti sul dispositivo dipendono dalla sua memoria. Anche file più grandi possono funzionare: lo strumento ti avvisa prima.
Come funziona
- 01 Scegli il PDF da cui estrarre il testo.
- 02 Se vuoi, indica le pagine o attiva «Segna l’inizio di ogni pagina» in «Altre opzioni».
- 03 Premi «Estrai il testo».
- 04 Copia il testo dall’anteprima o scarica il file .txt.
Informazioni sullo strumento
Copiare il testo da un visualizzatore PDF spesso restituisce righe confuse: due colonne intrecciate, un’intestazione ripetuta in mezzo a una frase. Hushdesk guarda la posizione di ogni carattere e ricostruisce l’ordine di lettura, così un articolo a due colonne esce colonna per colonna, mentre titoli e numeri di pagina restano al loro posto. Ottieni un semplice file di testo UTF-8 che si apre in qualsiasi editor e può andare dritto in un traduttore, in un indice di ricerca o in un chatbot. Italiano, inglese, russo e la maggior parte degli altri alfabeti arrivano intatti. Le pagine che sono solo immagini scansionate non contengono lettere da estrarre: lo strumento le indica e ti suggerisce l’OCR.
-
Il vero ordine di lettura
Le colonne vengono rilevate su ogni pagina: un articolo scientifico a due colonne si legge prima a sinistra, poi a destra, invece che riga per riga attraverso entrambe.
-
Qualsiasi alfabeto
Il file viene salvato in UTF-8: cirillico, lettere accentate, simboli di valuta e altri segni arrivano esattamente come appaiono nel documento.
-
Scansioni segnalate
Quando una pagina è una foto di testo, scopri di quale pagina si tratta invece di ricevere in silenzio un risultato vuoto.
-
Privato per natura
Il testo viene letto da un motore che gira nella scheda del browser. Report, contratti e referti medici non vengono mai inviati a nessuno.
Domande e risposte
Perché nel file estratto manca una parte del testo?
Molto probabilmente quelle pagine sono scansioni: il PDF contiene una foto della pagina, non le lettere vere e proprie. Il risultato segnala queste pagine. Passa prima il documento nell’OCR, poi estrai il testo.
Il file di testo mantiene tabelle e formattazione?
No. Un file .txt non ha font, grassetto o celle di tabella; ogni riga di una tabella diventa una riga con le celle separate da spazi. Per un documento modificabile che conserva la formattazione usa PDF in Word.
Come vengono gestite le pagine a due colonne?
Lo strumento cerca uno spazio bianco verticale che scende lungo la pagina tra i blocchi di testo e legge a turno i blocchi su ciascun lato. Titoli e piè di pagina a tutta larghezza fanno da separatori, quindi l’ordine resta naturale.
Posso estrarre il testo solo da alcune pagine?
Sì. Inserisci pagine e intervalli come 3, 7-9 nel campo Pagine; il resto viene saltato.
Funziona con l’italiano, il russo e altre lingue?
Sì, qualsiasi alfabeto che il PDF memorizza come testo viene estratto in UTF-8. Fanno eccezione le lingue che si scrivono da destra a sinistra, come l’arabo o l’ebraico: le loro parole possono uscire in ordine inverso.
Le parole spezzate da un trattino vengono riunite?
No. Un trattino che divide una parola a fine riga resta com’è nel PDF, perché lo strumento non sempre riesce a distinguere un trattino di a capo da uno vero.
Il PDF viene caricato per estrarne il testo?
No. La lettura dei caratteri e la creazione del file di testo avvengono entrambe sul tuo dispositivo, in un riquadro che il browser tiene isolato dalla rete.