术语

OCR

OCR 是 **optical character recognition(光学字符识别)**的缩写,指检测图像型文档、扫描件或截图中的文字,并将其转换为可以搜索、选择、复制或建立索引的机器可读文本。

OCR 如何工作

OCR 流程分为三个步骤。首先预处理源图像,例如校正倾斜、去除噪点、调整对比度,让字符更容易检测。接下来,OCR 引擎识别单个字符或词语。现代引擎会在这一步使用神经网络,因此处理不同字体和复杂版式的能力远好于早期的模板匹配方法。最后,识别出的字符会组合成机器可读文本,可以嵌入文档、单独导出或用于搜索索引。

输入图像的质量对准确率影响最大。对比度良好、清晰且分辨率高的源图像,识别结果可以接近完全准确;图像模糊或倾斜时,无论使用哪种引擎,结果都会明显变差。

OCR 的使用场景

文档最初以图像形式产生时,往往就需要 OCR。扫描页、拍摄的纸质材料、导出的截图和纯图像 PDF,对人眼来说可能完全可读,但未经 OCR 处理,搜索、文字选择和任何自动化处理都无法理解其中的内容。

常见用途包括:

  • 扫描文档——把纸质档案转换为可搜索的数字文件;
  • 截图——从应用界面、仪表盘或网页截图中提取文字,以便引用、搜索或重复使用;
  • 收据和发票——从拍摄的票据中提取明细和总金额,用于记账或费用跟踪;
  • 身份证件和表单——从图像型文档中读取结构化字段,用于用户注册或验证流程;
  • 纯图像 PDF——为只包含页面图像的 PDF 添加可搜索文本层,将其变成可搜索 PDF

截图 OCR

截图是常见却容易被忽视的 OCR 输入。与纸质扫描件相比,截图通常文字清晰、字体统一、对比度高,特别适合识别。

人们每天都会截取仪表盘、错误消息、聊天记录、网页和应用界面。如果没有 OCR,截图中的文字就被锁在图像里,只能看,不能搜索、复制或建立索引。经过 OCR 后,同样的文字会变成机器可读文本,也可以加入可搜索的 PDF 导出文件。

部分截图工具已经内置 OCR,因此导出的文件从一开始就支持搜索,无需之后再单独执行识别。

OCR 的常见错误

  • 期待完全正确的输出。 OCR 是识别过程,不是格式转换。结果会随图像质量、字符间距、字体和版式复杂程度而变化。不经核对就把 OCR 输出当成最终文本,很容易给后续文档带来错误。
  • 对低质量图像运行 OCR。 源图像模糊、分辨率低或光线不均时,再好的引擎也难以正确识别。先调整对比度、校正倾斜和去除噪点,能够明显改善结果。
  • 以为 OCR 会保留版式。 OCR 恢复的是文字,而不是视觉结构。如果引擎不理解版式,多栏页面、表格和侧栏中的文字可能按错误顺序排列。
  • 把 OCR 当成一种文档格式。 OCR 是识别步骤,它可以生成带嵌入文本层的可搜索 PDF 等输出,而后者才是文档格式。
  • 把“文字识别”和“OCR”当成完全不同的概念。 两者有重叠。尤其是从扫描件、截图或其他图像来源恢复文字时,OCR 是更精确且更成熟的术语。

常见问题

OCR 和文字识别是一回事吗?

人们常会宽泛地使用这两个说法,但在识别扫描件、截图和其他图像型文档中的文字时,OCR 是更成熟、更明确的术语。

OCR 一定能生成完全正确的文字吗?

不能。OCR 可以让文档支持搜索和复制,但识别质量取决于图像质量、语言、版式和所用 OCR 系统。

OCR 能识别手写文字吗?

部分 OCR 引擎可以尝试识别手写文字,但准确率差异很大。OCR 最适合整齐的印刷体,连笔或潦草字迹对多数系统仍是难题。

OCR 可以处理哪些文件类型?

OCR 可以处理任何基于图像的来源,包括 PNG、JPG、TIFF、纯图像 PDF 和截图。输入内容只需包含以像素呈现的可见文字,而不是机器可读字符。

现代 OCR 的准确率如何?

对于图像质量良好、清晰的印刷文字,现代 OCR 引擎的字符识别准确率可以接近完全正确。分辨率较低、字体特殊、版式复杂或对比度不足时,结果会变差。

参考资料

相关资料

什么是 OCR? | 术语表 | Shotomatic