ToolGenie

OCR su PDF

Rendi ricercabili i PDF scansionati con l'OCR.

Loading tool…

Come usare OCR su PDF

  1. Carica il PDF scansionato o composto solo da immagini.

  2. Scegli la lingua del testo del documento.

  3. Clicca su Esegui OCR per riconoscere il testo di tutte le pagine.

  4. Scarica il PDF con il testo ricercabile.

OCR PDF: cosa fa davvero il riconoscimento del testo

Un PDF uscito da uno scanner o dalla fotocamera del telefono sembra un documento ma è un album di fotografie: prova a selezionare una frase con il cursore e non si evidenzierà nulla, perché nel file non c'è testo — ci sono solo pixel. L'OCR (riconoscimento ottico dei caratteri) legge quelle immagini, riconosce le lettere e aggiunge sotto di esse un livello di testo invisibile. Le pagine restano identiche a vedersi, ma da quel momento il documento si può cercare, selezionare e copiare.

È il passaggio che trasforma un archivio di scansioni in un archivio utilizzabile: una ricerca trova la fattura giusta in un secondo invece di costringerti a sfogliare, e il testo riconosciuto si può incollare altrove o dare in pasto ad altre conversioni — da PDF a Word o a Excel — che senza testo non avrebbero nulla da estrarre.

Scannerizzare in PDF e rendere il file ricercabile: il flusso completo

Il flusso tipico parte dalla carta: scansioni o fotografi il documento, lo salvi come PDF e poi lo passi dall'OCR scegliendo la lingua del testo — indicarla correttamente migliora sensibilmente il riconoscimento, perché il motore sa quali caratteri e quali parole aspettarsi. Il risultato è lo stesso PDF di prima, con in più il livello di testo ricercabile.

La qualità della scansione decide la qualità del riconoscimento. Un originale dritto, ben illuminato e a risoluzione decente (200-300 DPI) si riconosce quasi perfettamente; una foto storta e in penombra produce errori. Se puoi rifare la scansione, farla bene rende più di qualsiasi correzione a posteriori.

OCR nel browser, senza caricare il documento

Il motore di riconoscimento è Tesseract — lo stesso progetto open source usato da innumerevoli strumenti di scansione — compilato in WebAssembly per girare dentro la scheda del browser. Il motore e i dati della lingua vengono scaricati alla prima esecuzione e restano in cache; da lì in poi il riconoscimento gira interamente sulla tua macchina.

I documenti che passano dall'OCR sono quelli delicati per definizione: contratti firmati, referti, documenti d'identità, pratiche. Riconoscerli in locale significa che né le immagini né il testo estratto raggiungono mai il server di qualcun altro.

Domande frequenti

Cosa significa fare l'OCR di un PDF?

Significa riconoscere il testo contenuto nelle immagini di un PDF scansionato e aggiungere un livello di testo invisibile sotto le pagine: l'aspetto non cambia, ma il documento diventa ricercabile, selezionabile e copiabile.

Come capisco se il mio PDF ha bisogno dell'OCR?

Prova a selezionare una frase con il cursore. Se non si evidenzia nulla, le pagine sono immagini e serve l'OCR; se il testo si seleziona, il file ne è già provvisto.

L'OCR funziona con documenti in italiano?

Sì. Scegli l'italiano come lingua del documento prima di avviare il riconoscimento: il motore saprà quali caratteri e parole aspettarsi e la precisione migliora sensibilmente.

Il documento scansionato viene caricato su un server?

No. Il motore OCR (Tesseract compilato in WebAssembly) viene scaricato una volta e poi gira nel tuo browser: le scansioni e il testo riconosciuto non lasciano il tuo dispositivo.

Strumenti correlati

Cerchi altro? Esplora tutti gli strumenti pdf.