用語

画像のみのPDF

画像のみのPDFは、機械が読めるテキストを持たず、各ページの画像だけを含むPDFです。人には読めるように見えても、文字の検索、選択、索引化はできません。

画像のみのPDFと検索可能なPDF

違いは、目に見える内容のほかに、ファイル内へ何が入っているかです。

画像のみのPDFは、各ページをピクセルの格子であるラスター画像として保存します。ページ上の文字は、写真に写った文字と同じく画像の一部です。機械が読める文字情報はファイル内にありません。PDFビューアーには読める文字として見えても、ソフトウェアから見ればページはピクセルだけで構成されています。

検索可能なPDFには、見えている文字の位置に対応させた機械可読の文字、つまりテキストレイヤーがあります。デジタルで作成した書類なら元の文書から、スキャンした書類ならOCR処理からテキストレイヤーを得られます。これにより、検索、選択、コピーと貼り付け、スクリーンリーダーからの利用が可能になります。

両者の見た目は同じ場合があります。違うのは機能です。一方は文字の写真で、もう一方は実際の文字データを持っています。

画像のみのPDFが作られる経緯

主に次の処理から生まれます。

  • 紙の書類をスキャンする: スキャナーが各ページを写真として取り込み、画像をPDFへまとめます。そのあとOCRを実行しなければ、画像のみのPDFになります
  • スクリーンショットや画像をPDFへ書き出す: 画像と一緒にテキストを入れずPDFへ配置すると、画像のみのファイルになります
  • 一部のアプリからPDFへ印刷する: PDFへ印刷する処理で内容をラスター化し、元のテキストデータを捨てることがあります。その場合は画像だけが残ります
  • FAXや書類画像システムを使う: 古い書類管理システムでは、受信したFAXやスキャンを画像のみのPDFとして保存する場合があります

共通するのは、文字がファイル内で文字コードとして保存されず、画像の一部として取り込まれただけという点です。

スクリーンショットをPDFへまとめる工程では、最初に見た目を忠実に保つことだけを優先し、そのあとOCRを追加しない場合に起こります。仕上がりが整っていても、検索、コピーと貼り付け、支援技術からは内容が見えません。

PDFが画像のみか確認する方法

最も簡単なのは、文字を選択してみることです。PDFをビューアーで開き、単語をクリックしてドラッグします。文字用のポインターで単語ごとに正確に選べるなら、テキストレイヤーがあります。ページ全体が1つの領域として選ばれる場合や、何も選べない場合は、画像のみである可能性があります。

もう1つの方法は、MacではCmd+F、WindowsではCtrl+Fを使い、ページにはっきり見えている単語を検索することです。結果が見つからなければ、テキストレイヤーがない可能性があります。

プログラムから調べる場合は、Popplerに含まれるpdftotextやPDF解析ライブラリでテキストを抽出できます。文字が見えるページから空文字や空白しか返らなければ、そのページは画像のみです。

よくある失敗

  • すべてのPDFを検索できると思う: どのPDFでもCtrl+Fが使えると考える人は少なくありません。検索できないとき、テキストレイヤーがないのではなく、ビューアーの不具合だと思う場合があります
  • 保管用に画像のみのPDFを共有する: 書類管理システムや検索エンジンは、画像だけの内容を索引化できません。アーカイブ内にファイルがあっても、時間がたつと検索から事実上見つけられなくなります
  • アクセシビリティを考慮しない: スクリーンリーダーは画像だけのページをそのまま解釈できません。スクリーンリーダーを使う人を含む相手へ共有すると、内容へアクセスできなくなります。OCRでテキストレイヤーを加えると改善できますが、読み順やタグも確認してください
  • OCRの精度を確認しない: OCRは、低解像度のスキャン、珍しいフォント、複雑なレイアウトで誤認識することがあります。重要な書類では、テキストレイヤーを利用する前に結果を確認してください

よくある質問

PDFが画像のみかどうかを確認するには?

ポインターで文字を選んでみてください。単語ごとに選択できない場合や、ページ全体が1つの領域として選ばれる場合は、テキストレイヤーのない画像だけのPDFである可能性があります。

スキャンしたPDFが画像のみになるのはなぜですか?

スキャナーは各ページを写真として取り込みます。できあがったファイルに含まれるのは、機械が読める文字ではなく、ピクセルで構成されたラスター画像です。OCR処理をしない限り、画像内の文字は絵の一部として扱われます。

画像のみのPDF内を検索できますか?

標準の検索(Ctrl+FまたはCmd+F)では検索できません。PDFビューアーが検索できるのは、機械が読めるテキストです。検索可能にするには、OCRで生成したテキストレイヤーをPDFへ追加します。

画像のみのPDFを検索可能にすると見た目も変わりますか?

通常は変わりません。OCRではページ画像の背後に見えないテキストレイヤーを加えます。見た目にはページ画像を使い、テキストレイヤーは検索、選択、アクセシビリティに使われます。

画像のみのPDFをスクリーンリーダーで利用できますか?

機械が読めるテキストや適切な代替情報がなければ、ページ内容を読み上げられません。画像のみのPDFには文字データがないため、そのままではスクリーンリーダーが内容を解釈できません。

出典

関連資料

画像のみのPDFとは | 用語集 | Shotomatic