为什么 OCR 会漏掉公式、脚注、表格和图示
OCR 适合查找页面,但复杂教材版面仍需目视核对。了解常见错误和更稳妥的审核流程。

OCR 能把页面图片转换成可搜索文字,但教材中有许多结构并不是普通句子。即使画面很清晰,公式、脚注、表格、图示、多栏版面和小字号标签仍可能识别错误。
**简要结论:**用 OCR 找到可能的页面,再以可见页面或官方源文字核对公式、引文、人名和数字。
为什么教材页面难以识别
文字 OCR 通常假设内容按行阅读,而教材经常打破这个假设。
| 内容 | 常见 OCR 错误 |
|---|---|
| 公式 | 丢失分数、上下标或符号顺序 |
| 脚注 | 插进正文,或漏掉小字号内容 |
| 表格 | 读错行,或合并不同列 |
| 图示 | 识别标签,但丢失箭头或空间关系 |
| 双栏页面 | 在两栏之间错误跳转 |
| 化学符号 | 混淆化学键、电荷和元素符号 |
| 代码示例 | 改变标点、缩进或形似字符 |
| 扫描页面 | 因模糊、倾斜、阴影或压缩产生额外错误 |
因此,一份 PDF 的 OCR 文字层可以被搜索,却未必准确到足以直接引用。
公式是二维结构
以分子中带上标的分数为例,读者会根据垂直位置和分组理解它。普通 OCR 可能输出一串平铺字符,边界并不可靠。
需要留意:
- 减号变成连字符;
- 乘号变成
x; - 希腊字母变成拉丁字母;
- 上标落入普通行;
- 下标丢失;
- 分数线消失;
- 矩阵各行顺序错误;
- 公式编号混入公式。
把 OCR 公式粘贴进作业前,务必逐字符对照页面。
以下只是需要检查的典型错误,并不表示每种 OCR 引擎都会如此:
| 可见写法 | 有风险的 OCR 结果 | 影响 |
|---|---|---|
x² | x2 | 指数变成系数或相邻数字 |
H₂O | H20 | 下标 2 变成数字 20 |
5 × 10⁻³ | 5 x 10-3 | 乘法和指数结构被压平 |
−0.05 | -0.05 或 0.05 | 数学减号可能改变或消失 |
25 µg | 25 ug | 单位符号改变,可能被误读 |
脚注字号小,顺序也特殊
脚注通常字号较小,并位于正文阅读顺序之外。OCR 可能把它插到段落中间,把标记放到错误句子后,或完全漏掉注释。
引用脚注时,应目视核对标记、脚注文字、页面编号和版次,并让脚注编号与引文一起保留。
表格依赖行列结构
纯文字输出未必能保留网格。即使每个字符都识别正确,一个数值也可能跑到错误的列标题下。
请根据页面图片核对:
- 列标题;
- 单位;
- 小数位;
- 负号;
- 合并单元格;
- 行标题;
- 表格下方的注释。
必须复用数据时,只转录最小必要范围,再做第二次对照检查。
图示标签不等于图示本身
识别出“线粒体”“输入”或“北方”等文字,并不会保留箭头指向哪里。OCR 不能把视觉关系变成完整的语义模型。
保留图示图片、图注和图号。若出版商提供无障碍说明,应优先使用。W3C 的复杂图片指南说明,图示、图表和地图通常既需要简短标识,也需要较长说明来表达结构、数值和关系。OCR 识别出的标签列表不能等价替代这些内容。
如果缺少无障碍说明,请向出版商或无障碍支持部门提供书名、版次、图号、页码和所需的辅助技术。
一套实用的核对流程
对于获准处理的资料:
- 优先使用官方 PDF 或 EPUB 文字层。
- 原始页面图片保持不变。
- 把 OCR 作为搜索辅助层添加。
- 搜索有辨识度的词语,找到页面。
- 复制前,对照可见页面核实句子或符号。
- 各检查一页正文、一页公式、一张表格和一幅图。
- 随文档记录已知限制。
把可见页面当作依据,把 OCR 文字层当作索引。
抽查四类代表性页面
不要因为一段干净正文识别正确,就判断整本教材都没有问题。用小样本覆盖最容易失败的页面类型:
| 样本页面 | 对比内容 | 通过条件 |
|---|---|---|
| 普通正文 | 两句话、一个专有名词、一个页码 | 文字和阅读顺序与页面一致 |
| 公式页 | 运算符、分数、上下标、公式编号 | 每个符号和分组都与画面一致 |
| 表格页 | 两个行标题、两个列标题、四个交叉数值、单位 | 每个数值仍位于正确标题下 |
| 图示页 | 图注、标签文字、箭头目标、图例 | 搜索能找到标签;视觉关系另行目视核对 |
记录失败页面。对这些页面类型,只把 OCR 搜索结果当作导航提示。
采集前改善识别条件
当资料归你所有或你获准采集时:
- 在不裁切内容的前提下使用尽可能清晰的缩放比例;
- 保持页面端正;
- 如果来源允许,使用浅色模式,让深色文字显示在浅色背景上;
- 等字体和图片加载完;
- 避免半透明工具栏挡住文字;
- 保持采集尺寸一致;
- 长序列开始前先测试一张复杂页面。
提高分辨率无法修复原本已经模糊、被裁切或只加载一半的页面。
不要用 OCR 绕过复制限制
OCR 不能带来使用权限。不要用它绕过阅读器禁用复制、DRM、打印额度或禁止提取的规则。
需要无障碍文字时,请联系出版商、图书馆或学校无障碍支持部门。获准的源文件能比 OCR 更好地保留标题、阅读顺序、数学标记和替代文字。
纯图片 PDF 与可搜索 PDF 的区别进一步说明了文字层的实际限制。
随文件保留一条审核说明
OCR 仅用于搜索。
引用、公式、表格数值、脚注、图示标签和页码,
均应对照可见页面核实。
这条简单提示可以防止其他人把近似文字当成经过核验的转录。
常见问题
为什么 OCR 不擅长识别公式?
数学依赖二维位置和专用符号,普通文字 OCR 可能把这些结构压平。
OCR 能理解图示吗?
它可能找到标签,但通常不会保留标签之间的视觉关系。
OCR 用来搜索教材够准确吗?
清晰正文通常可以。先用它找页面,再目视核对重要细节。
怎样改善结果?
尽量使用官方源文件,让画面清晰端正,等待加载完成,并尽早测试复杂页面。
相关文章
查看更多文章正在处理允许保存的页面?
Shotomatic 会按顺序整理获准保存的页面截图,供你检查后在 Mac 上导出可搜索的 PDF。它不会绕过阅读器限制或打印上限。


