Termine del glossario

PDF composto soltanto da immagini

Un PDF composto soltanto da immagini contiene immagini delle pagine senza testo leggibile dal computer: appare leggibile, ma non può essere cercato, selezionato o indicizzato.

PDF di sole immagini e PDF ricercabile

La differenza riguarda ciò che si trova nel file oltre a quello che vede l'occhio.

Un PDF di sole immagini conserva ogni pagina come immagine raster, cioè una griglia di pixel. Le parole visibili fanno parte dell'immagine come in una fotografia; nel file non esistono caratteri. Il lettore PDF mostra la pagina e una persona la legge, ma il software vede soltanto pixel.

Un PDF ricercabile contiene invece un livello di testo con caratteri posizionati in corrispondenza delle parole visibili. Può provenire dal documento digitale originale o dall'OCR applicato a una scansione. Questo livello consente ricerca, selezione, copia e accesso tramite screen reader.

L'aspetto può essere identico. La differenza è funzionale: uno è la fotografia di un testo, l'altro contiene dati testuali reali.

Come vengono creati

Di solito derivano da uno di questi procedimenti:

  • Scansione di documenti fisici — lo scanner fotografa le pagine e le raccoglie in un PDF. Senza un passaggio OCR, il risultato contiene soltanto immagini.
  • Esportazione di screenshot o immagini in PDF — se non si aggiunge testo, il documento resta una raccolta di immagini.
  • Stampa in PDF da alcune applicazioni — certi flussi rasterizzano il contenuto, eliminano i caratteri originali e producono un'immagine.
  • Fax e vecchi sistemi documentali — molte piattaforme archiviano i fax e le scansioni in questo formato.

Il punto comune è che il testo non è mai stato codificato come caratteri, ma soltanto acquisito nell'immagine.

Nei flussi da screenshot a PDF, accade spesso quando si dà priorità alla fedeltà visiva senza eseguire poi l'OCR. Il documento può essere curato e al tempo stesso invisibile a ricerca, copia e tecnologie assistive.

Come riconoscerli

Il controllo più rapido consiste nel tentare la selezione. Apri il PDF e trascina su una parola. Se il cursore evidenzia con precisione i singoli caratteri, esiste un livello di testo. Se viene selezionata tutta la pagina o non accade nulla, probabilmente no.

Puoi anche usare Cmd+F su Mac o Ctrl+F su Windows per cercare una parola chiaramente visibile. Nessun risultato indica l'assenza del livello.

Per un controllo tramite codice, strumenti come pdftotext di Poppler o le librerie PDF possono estrarre il contenuto. Se restituiscono soltanto spazi da pagine che mostrano parole, quelle pagine contengono immagini.

Errori comuni

  • Pensare che ogni PDF sia ricercabile. Se Cmd+F non trova nulla, il problema può essere il file e non il lettore.
  • Archiviare PDF di sole immagini. I sistemi documentali e i motori di ricerca non possono indicizzarli; con il tempo i contenuti diventano difficili da ritrovare.
  • Ignorare l'accessibilità. Gli screen reader non interpretano i pixel. Aggiungere un livello OCR rende disponibile il testo.
  • Eseguire l'OCR senza controllarlo. Scansioni piccole, font insoliti e layout complessi causano errori. Per documenti importanti, verifica sempre il testo riconosciuto.

Domande frequenti

Come capisco se un PDF contiene soltanto immagini?

Prova a selezionare il testo. Se non puoi evidenziare singole parole, oppure viene selezionata l'intera pagina come un blocco, probabilmente manca il livello di testo.

Perché i PDF scansionati contengono soltanto immagini?

Lo scanner fotografa ogni pagina. Il file risultante contiene pixel, non caratteri leggibili dal computer. Senza OCR, il testo resta soltanto parte dell'immagine.

Posso cercare in un PDF di sole immagini?

Non con la normale ricerca Cmd+F o Ctrl+F, che riconosce soltanto testo codificato. Serve aggiungere un livello di testo generato tramite OCR.

La conversione in PDF ricercabile ne cambia l'aspetto?

No. L'OCR aggiunge un livello invisibile dietro le immagini delle pagine. L'aspetto rimane uguale; il livello viene usato per ricerca, selezione e accessibilità.

Questi PDF sono accessibili agli screen reader?

No. Gli screen reader dipendono da testo leggibile dal computer e non possono interpretare pagine che contengono soltanto pixel.

Fonti

Risorse correlate

Che cos'è PDF composto soltanto da immagini? | Glossario | Shotomatic