Glossarbegriff

Reines Bild-PDF

Ein reines Bild-PDF enthält Seitenbilder, aber keinen maschinenlesbaren Text. Es sieht lesbar aus, lässt sich jedoch nicht durchsuchen, auswählen oder indexieren.

Bild-PDF und durchsuchbares PDF

Der Unterschied liegt in den unsichtbaren Daten der Datei.

Ein reines Bild-PDF speichert jede Seite als Rasterbild. Der sichtbare Text ist wie bei einem Foto Teil der Pixel; echte Zeichen sind nicht vorhanden. Für den PDF-Reader besteht die Seite nur aus einem Bild.

Ein durchsuchbares PDF besitzt zusätzlich eine Textebene mit Zeichen an den Positionen des sichtbaren Textes. Sie stammt entweder aus dem digitalen Original oder aus OCR eines Scans. Dadurch funktionieren Suche, Auswahl, Kopieren und Screenreader.

Beide Varianten können visuell identisch aussehen. Funktional ist eine nur ein Bild von Text, die andere enthält tatsächliche Textdaten.

So entstehen reine Bild-PDFs

  • Physische Dokumente scannen: Ohne anschließende OCR werden nur Fotos der Seiten in ein PDF gepackt.
  • Screenshots oder Bilder als PDF exportieren: Ohne zusätzliche Textebene bleibt die Datei bildbasiert.
  • Mit bestimmten Anwendungen als PDF drucken: Manche Abläufe rastern Inhalte und verwerfen den Originaltext.
  • Fax- und ältere Dokumentensysteme: Eingehende Seiten werden häufig nur als Bilder gespeichert.

Gemeinsam ist allen Fällen, dass Text nie als Zeichen in der Datei kodiert wurde.

Bei Screenshot-zu-PDF-Abläufen wird oft zunächst auf visuelle Genauigkeit optimiert und OCR vergessen. Das Ergebnis sieht sauber aus, bleibt für Suche, Kopieren und assistive Technik aber unsichtbar.

Bild-PDF erkennen

Versuche zuerst, ein Wort präzise auszuwählen. Gelingt das, ist eine Textebene vorhanden. Markiert der Viewer nur die ganze Seite oder nichts, handelt es sich wahrscheinlich um ein Bild.

Suche anschließend mit Cmd+F oder Strg+F nach einem deutlich sichtbaren Wort. Ohne Treffer fehlt möglicherweise die Textebene.

Programmatisch können pdftotext aus Poppler oder PDF-Bibliotheken Text extrahieren. Leere Ausgabe auf sichtbar textreichen Seiten weist auf reine Bilder hin.

Häufige Fehler

  • Jedes PDF für durchsuchbar halten. Wenn Strg+F nicht funktioniert, fehlt oft die Textebene; der Viewer ist nicht zwingend defekt.
  • Bild-PDFs archivieren. Dokumentenmanagement und Suchmaschinen können sie nicht indexieren; Inhalte verschwinden faktisch aus der Suche.
  • Barrierefreiheit ignorieren. Screenreader können Bildseiten nicht lesen. OCR schafft eine notwendige Textebene.
  • OCR ungeprüft übernehmen. Niedrige Auflösung, ungewöhnliche Schriften und komplexe Layouts führen zu Erkennungsfehlern. Prüfe kritische Dokumente manuell.

Häufig gestellte Fragen

Wie erkenne ich ein reines Bild-PDF?

Versuche, einzelne Wörter mit dem Cursor auszuwählen. Ist das nicht möglich oder wird nur die ganze Seite als Block markiert, fehlt wahrscheinlich die Textebene.

Warum sind gescannte PDFs reine Bilddateien?

Ein Scanner fotografiert jede Seite. Die Datei enthält Rasterbilder aus Pixeln statt maschinenlesbarer Zeichen. Ohne OCR bleibt der sichtbare Text nur Teil des Bildes.

Kann ich in einem reinen Bild-PDF suchen?

Nicht mit der normalen Suche per Strg+F oder Cmd+F. Ein PDF-Reader kann nur maschinenlesbaren Text durchsuchen. Dafür muss per OCR eine Textebene ergänzt werden.

Verändert ein durchsuchbares PDF das Aussehen?

Nein. OCR legt eine unsichtbare Textebene hinter die Seitenbilder. Die sichtbare Darstellung bleibt gleich; der Text dient Suche, Auswahl und Barrierefreiheit.

Sind reine Bild-PDFs für Screenreader zugänglich?

Nein. Screenreader brauchen maschinenlesbaren Text. Ohne diese Daten können sie den Seiteninhalt nicht interpretieren.

Quellen

Verwandte Inhalte

Reines Bild-PDF: Bedeutung und Anwendung | Glossar | Shotomatic