用語
画像のみのPDF
画像のみのPDFは、機械が読めるテキストを持たず、各ページの画像だけを含むPDFです。人には読めるように見えても、文字の検索、選択、索引化はできません。
画像のみのPDFと検索可能なPDF
違いは、目に見える内容のほかに、ファイル内へ何が入っているかです。
画像のみのPDFは、各ページをピクセルの格子であるラスター画像として保存します。ページ上の文字は、写真に写った文字と同じく画像の一部です。機械が読める文字情報はファイル内にありません。PDFビューアーには読める文字として見えても、ソフトウェアから見ればページはピクセルだけで構成されています。
検索可能なPDFには、見えている文字の位置に対応させた機械可読の文字、つまりテキストレイヤーがあります。デジタルで作成した書類なら元の文書から、スキャンした書類ならOCR処理からテキストレイヤーを得られます。これにより、検索、選択、コピーと貼り付け、スクリーンリーダーからの利用が可能になります。
両者の見た目は同じ場合があります。違うのは機能です。一方は文字の写真で、もう一方は実際の文字データを持っています。
画像のみのPDFが作られる経緯
主に次の処理から生まれます。
- 紙の書類をスキャンする: スキャナーが各ページを写真として取り込み、画像をPDFへまとめます。そのあとOCRを実行しなければ、画像のみのPDFになります
- スクリーンショットや画像をPDFへ書き出す: 画像と一緒にテキストを入れずPDFへ配置すると、画像のみのファイルになります
- 一部のアプリからPDFへ印刷する: PDFへ印刷する処理で内容をラスター化し、元のテキストデータを捨てることがあります。その場合は画像だけが残ります
- FAXや書類画像システムを使う: 古い書類管理システムでは、受信したFAXやスキャンを画像のみのPDFとして保存する場合があります
共通するのは、文字がファイル内で文字コードとして保存されず、画像の一部として取り込まれただけという点です。
スクリーンショットをPDFへまとめる工程では、最初に見た目を忠実に保つことだけを優先し、そのあとOCRを追加しない場合に起こります。仕上がりが整っていても、検索、コピーと貼り付け、支援技術からは内容が見えません。
PDFが画像のみか確認する方法
最も簡単なのは、文字を選択してみることです。PDFをビューアーで開き、単語をクリックしてドラッグします。文字用のポインターで単語ごとに正確に選べるなら、テキストレイヤーがあります。ページ全体が1つの領域として選ばれる場合や、何も選べない場合は、画像のみである可能性があります。
もう1つの方法は、MacではCmd+F、WindowsではCtrl+Fを使い、ページにはっきり見えている単語を検索することです。結果が見つからなければ、テキストレイヤーがない可能性があります。
プログラムから調べる場合は、Popplerに含まれるpdftotextやPDF解析ライブラリでテキストを抽出できます。文字が見えるページから空文字や空白しか返らなければ、そのページは画像のみです。
よくある失敗
- すべてのPDFを検索できると思う: どのPDFでもCtrl+Fが使えると考える人は少なくありません。検索できないとき、テキストレイヤーがないのではなく、ビューアーの不具合だと思う場合があります
- 保管用に画像のみのPDFを共有する: 書類管理システムや検索エンジンは、画像だけの内容を索引化できません。アーカイブ内にファイルがあっても、時間がたつと検索から事実上見つけられなくなります
- アクセシビリティを考慮しない: スクリーンリーダーは画像だけのページをそのまま解釈できません。スクリーンリーダーを使う人を含む相手へ共有すると、内容へアクセスできなくなります。OCRでテキストレイヤーを加えると改善できますが、読み順やタグも確認してください
- OCRの精度を確認しない: OCRは、低解像度のスキャン、珍しいフォント、複雑なレイアウトで誤認識することがあります。重要な書類では、テキストレイヤーを利用する前に結果を確認してください
よくある質問
PDFが画像のみかどうかを確認するには?
ポインターで文字を選んでみてください。単語ごとに選択できない場合や、ページ全体が1つの領域として選ばれる場合は、テキストレイヤーのない画像だけのPDFである可能性があります。
スキャンしたPDFが画像のみになるのはなぜですか?
スキャナーは各ページを写真として取り込みます。できあがったファイルに含まれるのは、機械が読める文字ではなく、ピクセルで構成されたラスター画像です。OCR処理をしない限り、画像内の文字は絵の一部として扱われます。
画像のみのPDF内を検索できますか?
標準の検索(Ctrl+FまたはCmd+F)では検索できません。PDFビューアーが検索できるのは、機械が読めるテキストです。検索可能にするには、OCRで生成したテキストレイヤーをPDFへ追加します。
画像のみのPDFを検索可能にすると見た目も変わりますか?
通常は変わりません。OCRではページ画像の背後に見えないテキストレイヤーを加えます。見た目にはページ画像を使い、テキストレイヤーは検索、選択、アクセシビリティに使われます。
画像のみのPDFをスクリーンリーダーで利用できますか?
機械が読めるテキストや適切な代替情報がなければ、ページ内容を読み上げられません。画像のみのPDFには文字データがないため、そのままではスクリーンリーダーが内容を解釈できません。
出典
- PDF7:スキャンPDFへOCRを実行し、実際のテキストを提供する — W3C
- スキャンした書類の文字を認識する — Adobe