Come rendere ricercabile un PDF scansionato (OCR)

Ultimo aggiornamento: 7 luglio 2026

Premi Ctrl+F, digiti il numero di fattura che sai essere lì da qualche parte e non esce nulla. Il documento è davanti a te, il numero si vede benissimo a pagina 3, ma per il computer quel PDF non contiene alcun testo. È la frustrazione quotidiana dei PDF scansionati: sembrano documenti, ma si comportano come fotografie.

Il rimedio è l'OCR e ormai per usarlo non servono Acrobat, la suite dello scanner o un abbonamento. Puoi farlo nel browser in un paio di minuti e, con lo strumento giusto, senza che il documento lasci mai il tuo computer. Ecco come fare, e anche che cosa l'OCR può e non può fare realisticamente.

Perché i PDF scansionati sono documenti morti

Un PDF creato da un file Word o da una pagina web contiene testo vero: ogni lettera è memorizzata come carattere, ed è per questo che puoi cercarlo, selezionarlo e copiarlo. Un PDF prodotto da uno scanner o dalla fotocamera del telefono non contiene nemmeno un carattere. Ogni pagina è un'unica grande immagine, una foto del testo anziché il testo stesso. La ricerca non trova nulla, il copia-incolla non prende nulla, i lettori di schermo non leggono nulla e gli indicizzatori di file come Windows Search o Spotlight tirano dritto.

L'OCR, sigla di riconoscimento ottico dei caratteri, è la tecnologia che colma questo divario. Un motore OCR esamina l'immagine, riconosce le forme di lettere e parole e produce testo davvero leggibile dalla macchina, con la posizione di ogni parola sulla pagina. I motori moderni sono notevolmente bravi sulle pagine stampate pulite: il motore open source Tesseract, nato in HP e in seguito mantenuto da Google, sta dietro a molte applicazioni OCR per desktop e legge abitualmente una scansione da ufficio decente con pochissimi errori.

Rendere ricercabile un PDF scansionato, passo dopo passo

Lo strumento OCR di robinpdf esegue una versione WebAssembly dello stesso motore Tesseract direttamente nel tuo browser. Il procedimento richiede pochi clic:

  1. Apri la pagina OCR PDF.
  2. Fai clic sul riquadro e scegli il tuo PDF scansionato, oppure trascina il file al suo interno.
  3. Scegli la lingua del documento: inglese, spagnolo o entrambe se il documento le mescola. Scegliere la lingua giusta conta, perché il motore la usa per sciogliere le forme di lettere ambigue.
  4. Premi Esegui OCR e lascia che elabori le pagine. Il riconoscimento avviene sul tuo processore, quindi un documento lungo richiede più tempo su un portatile datato, esattamente come farebbe un'applicazione OCR per desktop.
  5. Scarica il risultato. È identico pixel per pixel alla scansione originale, ma ora Ctrl+F funziona e puoi selezionare e copiare il testo.

Un dettaglio su cui vale la pena fermarsi: non viene caricato nulla. Il traffico, in realtà, scorre al contrario. È il motore OCR a scaricarsi nel tuo browser la prima volta che usi lo strumento, e poi legge il documento in locale. Per un contratto scansionato, un referto medico o uno scatolone di vecchi estratti conto, è una differenza sostanziale rispetto ai servizi che ti chiedono prima di consegnare il file. Se vuoi la discussione più ampia su che cosa succede ai file nei classici siti basati sul caricamento, l'abbiamo raccontata in Gli strumenti PDF online sono sicuri?

Come funziona il livello di testo invisibile

Un timore diffuso è che l'OCR rovini l'aspetto del documento e, con alcuni strumenti che ricostruiscono la pagina dal testo riconosciuto, può succedere davvero. Questo strumento segue la strada più sicura, quella dei software di archiviazione professionali: mantiene l'immagine scansionata originale esattamente com'è e colloca il testo riconosciuto sotto di essa, in modo invisibile, con ogni parola posizionata dove compare nell'immagine.

Il risultato viene spesso chiamato "PDF sandwich". Quello che vedi è ancora la scansione originale, con timbri, firme e macchie di caffè inclusi. Quello che vede il computer è un livello completo di testo allineato con l'immagine. Quando cerchi, la corrispondenza viene trovata nel livello nascosto ed evidenziata sull'immagine sovrastante. Quando selezioni e copi, stai copiando anche tu da quel livello. Nulla della pagina visibile cambia, il che significa anche che l'OCR non degrada mai la qualità della scansione: l'immagine passa intatta.

È anche il motivo per cui un file appena passato all'OCR può risultare un po' più grande dell'originale: ora contiene l'immagine più il testo. Se le dimensioni contano, passa poi il risultato in Comprimi PDF; le scansioni di solito si riducono parecchio.

Dove le scansioni ricercabili ripagano davvero

Come ottenere il meglio dalle tue scansioni

La precisione dell'OCR dipende molto più dal materiale di partenza che dal motore. Poche buone abitudini fanno una grande differenza:

Limiti onesti: che cosa l'OCR non farà

Vale la pena essere chiari sui confini. I motori OCR sono costruiti per il testo stampato, quindi la scrittura a mano resta in gran parte fuori portata: una lettera manoscritta o un campo di modulo compilato a mano usciranno come parole senza senso, o non usciranno affatto, e nessuna nuova scansione può rimediare. Scansioni di bassa qualità, documenti via fax, foto sfocate da telefono e caratteri minuscoli produrranno errori, a volte molti. E se le parole di una tabella vengono riconosciute, la sua struttura no: copia una tabella da una pagina passata all'OCR e otterrai un flusso di valori di celle, non righe e colonne da incollare in un foglio di calcolo.

Niente di tutto questo rende l'OCR meno utile per il suo compito principale. Anche un livello di testo imperfetto, con qualche carattere letto male, ti permette comunque di trovare in pochi secondi la pagina che ti serve, che di solito è proprio il punto.

Domande frequenti

Il mio PDF avrà un aspetto diverso dopo l'OCR?

No. Le pagine visibili sono le immagini della tua scansione originale, invariate. Il testo riconosciuto viene aggiunto come livello invisibile sotto di esse.

Il mio documento viene caricato da qualche parte?

No. Il riconoscimento avviene dentro il browser, sul tuo dispositivo. È il motore a essere scaricato da te; il tuo file non lascia mai il tuo computer.

Quali lingue sono supportate?

Inglese, spagnolo o entrambe insieme per i documenti che le mescolano.

Riesce a leggere la scrittura a mano?

Non in modo affidabile. I motori OCR sono addestrati sui caratteri di stampa. Uno stampatello molto ordinato a volte passa; il corsivo no.

Perché l'OCR è lento sul mio computer?

Perché il lavoro avviene sul tuo processore anziché su un server. Un portatile moderno gestisce rapidamente un documento tipico; una scansione lunga su una macchina datata richiede un po' di tempo. Va fatto una sola volta per file.

Il file risultante è più grande. È normale?

Sì, leggermente: ora contiene le immagini più il livello di testo. Passalo in Comprimi PDF se ti serve più piccolo.

Rendi ricercabile il tuo PDF scansionato →