Vai al contenuto

OCR PDF: estrarre testo da PDF scansionati

xFormat.space esegue l'OCR sui PDF scansionati dentro il browser, renderizzando ogni pagina e leggendola con un modello di riconoscimento sul dispositivo, così ottieni il testo pagina per pagina senza caricare il documento.

Funziona nel browser: i file non lasciano mai il dispositivo.

Come funziona

Se in un PDF non riesci a selezionare o copiare il testo, probabilmente è una scansione, cioè semplici immagini delle pagine. Questo strumento renderizza ogni pagina, ne riconosce il testo in locale sul tuo dispositivo e ti restituisce testo semplice da copiare o salvare. Il PDF non lascia mai il computer.

  1. 1

    Trascina un PDF scansionato nella pagina e apri l'OCR.

  2. 2

    Scegli la lingua del documento.

  3. 3

    Clicca su Avvia riconoscimento, aspetta che tutte le pagine siano completate, poi copia il testo o scaricalo come file TXT.

Cosa ottieni e cosa no

Il risultato è testo semplice, con ogni pagina segnata da una riga "--- Page N ---", più un punteggio di affidabilità e il numero di aree di testo. Non è un PDF ricercabile: lo strumento non scrive un livello di testo nascosto nel file, quindi il PDF originale resta com'era. Se nel tuo PDF puoi già selezionare il testo, l'OCR non ti serve: copialo direttamente.

Consigli per la precisione sui PDF scansionati

Le pagine vengono renderizzate a scala 2x prima del riconoscimento, quindi la qualità della scansione fissa il limite massimo. Una scansione intorno ai 300 dpi, dritta e ben contrastata, si legge molto meglio di una storta, grigia o a bassa risoluzione. Scegli la lingua giusta: cinese e inglese, inglese, giapponese, coreano, francese e tedesco sono opzioni separate e puoi usarne una sola per volta. Tabelle, colonne e note a piè di pagina vengono lette come righe di testo, quindi l'impaginazione non viene conservata e potresti dover riordinare il testo.

L'elaborazione avviene sul tuo dispositivo, una pagina alla volta, quindi i documenti lunghi richiedono un po' di tempo, che dipende dal tuo hardware e dal numero di pagine. Tieni la scheda aperta finché non finisce. Al primo utilizzo si scarica il modello, circa 15 MB, che poi resta in cache. Ricontrolla nomi, numeri e tutto ciò che è importante.

Domande frequenti

Come estraggo il testo da un PDF scansionato?

Trascina il PDF nella pagina, seleziona la lingua del documento e clicca su Avvia riconoscimento. Con xFormat.space il testo compare pagina per pagina e puoi copiarlo o scaricare un file TXT.

Crea un PDF ricercabile?

No. Produce solo testo semplice e non aggiunge un livello di testo al PDF. Il file originale resta invariato.

Il mio PDF scansionato viene caricato su un server?

No. Le pagine vengono renderizzate e riconosciute nel browser. Si scarica solo il modello di riconoscimento del testo, circa 15 MB la prima volta, e il PDF resta sul tuo dispositivo.

Quali lingue funzionano per l'OCR dei PDF?

Cinese e inglese (compreso il cinese tradizionale), inglese, giapponese, coreano, francese e tedesco, una per ogni riconoscimento.

Posso usarlo per un PDF scansionato in italiano?

Non c'è un'opzione dedicata all'italiano: le lingue selezionabili sono cinese e inglese, inglese, giapponese, coreano, francese e tedesco, una per volta.

Perché il risultato dell'OCR è impreciso?

Di solito dipende dalla scansione: bassa risoluzione, pagine storte, ombre o lingua sbagliata. Usa una scansione nitida di circa 300 dpi, assicurati che la lingua corrisponda e ricontrolla il testo ottenuto.