用語
OCR
OCRは**optical character recognition(光学文字認識)**の略です。画像ベースの書類、スキャン、スクリーンショット内の文字を検出し、検索、選択、コピー、索引化ができる機械可読テキストへ変換します。
OCRの仕組み
処理は3つの段階に分かれます。最初に元画像を前処理し、傾きを直し、ノイズを除き、コントラストを調整して、文字を検出しやすくします。次にOCRエンジンが文字または単語を識別します。現在のエンジンはこの段階でニューラルネットワークを使い、古いテンプレート照合方式より多様なフォントや複雑なレイアウトへ対応しやすくなっています。最後に、認識した文字を機械可読テキストへ組み立て、書類へ埋め込む、別ファイルへ書き出す、検索の索引へ使うなどの処理を行います。
精度へ最も大きく影響するのは、入力画像の品質です。コントラストがよく、鮮明で高解像度な画像なら非常に高い精度を得られる場合があります。ぼやけたり傾いたりした画像では、どのエンジンでも結果が悪くなります。
OCRが使われる場面
OCRは、画像として始まった書類を扱うときに使います。スキャンしたページ、撮影した書類、書き出したスクリーンショット、画像のみのPDFは、人には読めても、OCRをかけなければ検索、文字選択、自動処理の対象になりません。
主な用途は次のとおりです。
- スキャン書類: 紙のアーカイブを検索可能なデジタルファイルへ変換します
- スクリーンショット: アプリ画面、ダッシュボード、Webページから文字を抽出し、引用、検索、再利用できるようにします
- レシートと請求書: 撮影した書類から明細と合計を読み取り、帳簿や経費管理へ使います。金額は元画像と照合してください
- 身分証明書と申請書: オンボーディングや本人確認のため、画像ベースの書類から決まった項目を読み取ります。個人情報の取り扱い要件を守る必要があります
- 画像のみのPDF: ページ画像だけを含むPDFへ検索用のテキストレイヤーを加え、検索可能なPDFにします
スクリーンショットのOCR
スクリーンショットはOCRへの入力として一般的ですが、見落とされがちです。スキャンした紙と比べ、文字が鮮明で、フォントがそろい、コントラストも高い傾向があるため、認識に適しています。
ダッシュボード、エラーメッセージ、チャット、Webページ、アプリの画面は毎日のように撮影されます。OCRがなければ、文字は画像の中へ閉じ込められ、見ることはできても検索、コピー、索引化ができません。OCRを使うと同じ文字が機械可読になり、検索可能なPDFへ含められます。
一部のスクリーンショットツールにはOCRが組み込まれ、あとで別の認識処理をせず、初めから検索可能なファイルを書き出せます。
よくある失敗
- 完全な出力を期待する: OCRは認識処理であり、単純な形式変換ではありません。画像の品質、文字間隔、フォント、レイアウトの複雑さによって結果が変わります。確認せず完成した文字として扱うと、その後の書類へ誤りが入ります
- 低品質の画像へOCRを実行する: ぼやけ、低解像度、暗い画像では、エンジンが優れていても認識結果は悪くなります。コントラスト調整、傾き補正、ノイズ除去などの前処理で改善できます
- OCRがレイアウトも保つと思う: OCRが復元するのは文字で、視覚構造ではありません。複数段組み、表、サイドバーでは、レイアウトを認識するエンジンでなければ読み順が入れ替わることがあります
- OCRを書類形式だと思う: OCRは文字を認識する処理です。その結果として作れる、テキストレイヤー付きの検索可能なPDFなどが書類形式です
- 「文字認識」と「OCR」を別のものだと思う: 2つの意味は重なります。特にスキャン、スクリーンショット、画像ベースの素材から文字を得る場合は、OCRのほうが正確で定着した用語です
よくある質問
OCRと文字認識は同じですか?
日常ではどちらも広い意味で使われますが、スキャン、スクリーンショット、画像ベースの書類から文字を読み取る技術としては、OCRのほうが定着した用語です。
OCRは常に正しい文字を出力しますか?
いいえ。OCRで書類を検索、コピーできるようになりますが、認識の精度は画像の品質、言語、レイアウト、利用するOCRシステムによって変わります。重要な内容は必ず照合してください。
OCRで手書き文字を読めますか?
手書き文字を認識しようとするOCRエンジンもありますが、精度には大きな差があります。整った印刷文字のほうが認識しやすく、筆記体や崩れた手書き文字は多くのシステムで難しい対象です。
OCRで処理できるファイル形式は?
PNG、JPG、TIFF、画像のみのPDF、スクリーンショットなど、画像ベースの素材を処理できます。機械が読める文字ではなく、ピクセルとして見える文字が入力に含まれている必要があります。
現在のOCRはどの程度正確ですか?
画質がよく、整った印刷文字なら非常に高い文字認識率を得られる場合があります。解像度が低い、珍しいフォントを使う、レイアウトが複雑、コントラストが弱いといった条件では精度が下がります。
出典
- Adobe AcrobatでPDFをオンラインOCR — Adobe
- Tesseractユーザーマニュアル — Tesseract OCR
- PDF7:スキャンPDFへOCRを実行し、実際のテキストを提供する — W3C
- 光学文字認識とは — IBM
- OCRとは — Adobe