ガイド
Shotomatic Team
読了まで約11分

保存した電子教科書PDFで文字を選択できない理由

PDFがページ画像だけでできている、テキストレイヤーがない、OCRが不正確、コピーが制限されている可能性があります。直す前に、どの状態かを見分けます。

保存した教科書PDFで文字選択を試す学生

見た目は普通の教科書PDFでも、選択できる文字がまったく含まれていない場合があります。ページ画像だけを集めたファイル、画像にOCRレイヤーを重ねたPDF、特殊なフォントエンコーディングを使うファイル、権限によってコピーが制限された文書などが考えられます。

短い答え: 検索、文字選択、文書の権限を確認します。OCRを使うのは、処理する許可があるページだけにしてください。コピーが制限されている場合は回避せず、承認されたファイルを依頼します。

PDFの種類を見分ける

テスト結果考えられる種類
単語をきれいに選択でき、正しくコピーできるネイティブテキストPDF
検索できるが、コピーした文字に誤りがあるOCR付き画像PDF、または不適切な文字コード
ページ全体が1つのオブジェクトとして選択される画像だけのPDF
選択できず、権限情報に制限が表示される保護されたPDF
選択できるページと、できないページがある混在型の文書

1ページだけで判断しないでください。表紙やスキャンした付録だけが画像で、本文はテキストになっているPDFもあります。

Macで検索と文字選択を試す

プレビュー、または信頼できるPDFリーダーでファイルを開きます。

  1. プレビューでツール > テキスト選択を選びます。長方形選択や注釈ツールが有効だと、文字を選べないように見えることがあります。
  2. Command-Fを押し、ページ上に見える特徴的な単語を検索します。
  3. 1文をドラッグして選びます。
  4. 一時的なプレーンテキストのメモへコピーします。
  5. 画面に見える文と1文字ずつ比べます。
  6. 表、脚注、数式があるページでも繰り返します。
  7. まだ選べない場合は、ツール > インスペクタを表示を選び、暗号化インスペクタを開いて、PDFがパスワードを必要とするか、コピーを制限しているかを確認します。

一時的にコピーした文章に、残しておく必要のないライセンス対象コンテンツが含まれる場合は削除してください。

Appleのプレビューのトラブルシューティングガイドには、テキスト選択の設定と暗号化インスペクタの両方が説明されています。自分のファイルで、正規にパスワードを受け取っている場合は、通常の入力画面からパスワードを入れます。変更する権限のない制限を解除しようとしないでください。

画像だけのPDF

画像だけのPDFは、各ページの写真を入れた容器です。スキャン書類や、スクリーンショットから作った文書によくあります。レイアウトはきれいに保てますが、コンピューターには文字ではなくピクセルとして見えます。

元資料を自分で作った、所有している、または処理する許可がある場合は、OCRで非表示のテキストレイヤーを追加できます。ページ画像を表示したまま、おおまかな検索とコピーができるようになります。

現在のMacでは、プレビューに標準の方法があります。

  1. 画像の原本を変更しないよう、ファイル > 複製を選びます。
  2. 複製を開いた状態で、ファイル > 書き出すを選びます。
  3. テキストを埋め込むを選びます。
  4. 新しいPDFを保存し、開き直します。
  5. 上の検索とコピーのテストを繰り返します。

Appleのテキストを埋め込む方法によると、この項目は、プレビューが文書内の文字をまだ認識していない場合にだけ表示されます。項目がなければ、すでにテキストレイヤーが存在する可能性があります。もう一度OCRをかけるのではなく、認識精度、文字コード、権限を調べてください。

スクリーンショットPDFとブラウザPDFの比較では、ブラウザが生成したネイティブテキストのほうが、一般にOCRより扱いやすい理由を説明しています。

OCR文字はあるが不正確

OCRは、ページの見た目から文字を推測します。よくある誤りは次のとおりです。

  • O0
  • lI1
  • rnm
  • 上付き文字と下付き文字
  • 複数段組みの読み順
  • 行末で分割された単語
  • 合字と装飾書体
  • 数式と化学式

OCRはページを見つける補助として使い、確認せずに引用文として扱わないでください。引用、数式、名前、数値は、必ずページ画像と照合します。

特殊な文字コードを使うネイティブテキスト

埋め込みフォントの文字を見た目どおり表示できても、コピーすると順番が崩れたり、無関係な記号になったりするPDFがあります。検索も不安定な場合があります。

標準に準拠した別のPDFリーダーでも同じか確認します。公式ファイルに不具合がある場合は、ページ番号と、機密性のない短い例を添えて提供元へ報告してください。二度目のOCRをかけるより、出版社がテキストレイヤーを作り直すほうが正確です。

コピーが制限されている

保護されたPDFは、読むことはできても、コピー、印刷、編集を制限している場合があります。その制限を回避するために、OCR、スクリーンショット、パスワード削除、別の変換ツールを使わないでください。

代わりに、次の方法を使います。

  • リーダー標準のノート機能や引用機能を使う
  • 公式に認められた範囲だけをコピーする
  • アクセシブルなファイルまたは研究用ファイルを依頼する
  • DRMのない代替資料を図書館へ相談する
  • アクセシビリティ上の不具合を出版社へ修正依頼する

問い合わせ時は、正確な書名、ISBN、ページ、使用リーダー、支援技術を伝えます。

混在型PDFはページ単位で確認する

教科書PDFには、ネイティブテキストの章と、スキャンした付録や画像ベースの図が混在する場合があります。1回検索できただけでは、全ページを検索できるとは限りません。

次の箇所を試します。

  • 前付け
  • 通常の本文ページ
  • 図の多いページ
  • 索引
  • 付録
  • 課題で重要なセクション

OCRが認められている場合は、必要なページだけを処理し、原本は見た目を確認する資料として残します。

今後保存するときに、よりよい出力を得る

公式のPDFまたはEPUBがあれば、それを使います。許可されたページには、リーダー標準の印刷機能を使います。印刷用表示が完全であれば、ブラウザのPDFはネイティブテキストを保てることがあります。

許可されたページ画像を検索できるPDFにしますか? Shotomaticで撮影順を保ち、PDF書き出し時に検索用のOCRレイヤーを追加できます。画像がすでにある場合は、ブラウザだけで無料で1つのPDFにまとめられます。OCRは誤認識することがあるため、画面に見えるページを基準にしてください。

よくある質問

PDFが画像だけでできているかを見分けるには?

ページ全体が1枚の画像のように扱われ、画面に見える単語を検索しても見つからない場合は、テキストレイヤーがない可能性が高いでしょう。

OCRを使えば完全に正確になりますか?

いいえ。数式、表、脚注、名前、数値は、画面に見えるページと照合してください。

検索できるのに、きれいな文字としてコピーできないのはなぜですか?

OCRの誤認識、文字コード、読み順、文書の権限などが原因です。

コピー制限を解除できますか?

この記事では、制限を回避する方法は扱いません。承認されたファイルを依頼するか、公式リーダーで認められた機能を使ってください。

保存が認められたページを扱っていますか?

Shotomaticなら、許可されたページのキャプチャを順番どおりに整理し、内容を確認して、Macで検索可能なPDFに書き出せます。ビューアーの制限や印刷上限を回避するものではありません。

保存した電子教科書PDFで文字を選択できない理由 | ブログ | Shotomatic