术语
纯图像 PDF
纯图像 PDF是只包含页面图像、没有任何机器可读文本的 PDF。它看起来可以阅读,却无法搜索、选择文字或建立索引。
纯图像 PDF 与可搜索 PDF 的区别
两者的区别在于,除了眼睛能看到的内容,文件内部还保存了什么。
纯图像 PDF 把每一页保存为栅格图像,也就是像素网格。页面上可见的文字只是图像的一部分,和照片中的文字一样;文件中并不存在机器可读的字符。PDF 阅读器显示图像,人眼看起来文字清晰可读,但对软件而言,页面上只有像素。
可搜索 PDF 则包含文本层,即与页面上可见文字位置相对应的机器可读字符。文本层可能来自原始数字文档,也可能由扫描后的 OCR 处理生成。有了文本层,就可以搜索、选择和复制粘贴文字,屏幕阅读器也能读取内容。
这两种 PDF 的外观可能完全相同,真正的差别在功能上:一种只是文字的图片,另一种保存了实际文本数据。
纯图像 PDF 是如何产生的
纯图像 PDF 通常由以下流程产生:
- 扫描纸质文档——扫描仪把每一页拍成图像,再将这些图像打包为 PDF。如果后续没有执行 OCR,得到的就是纯图像文件。
- 把截图或图像导出为 PDF——图像放入 PDF 时若没有附带任何文本,结果就是纯图像 PDF。
- 从部分应用中打印为 PDF——有些流程会在打印为 PDF 时把内容栅格化,丢弃原始文本数据,最终生成纯图像文件。
- 传真和文档成像系统——较早的文档管理系统通常会把收到的传真和扫描件保存为纯图像 PDF。
这些情况的共同点是:文字从未以字符形式编码进文件,只是被拍摄或截取为图像的一部分。
在截图转 PDF 的流程中,团队如果只重视视觉还原度,之后又没有添加 OCR,就容易得到这种文件。它看起来很精致,但搜索、复制粘贴和辅助技术都无法识别其中的文字。
如何判断 PDF 是否只有图像
最快的方法是尝试选择文字。用任意 PDF 阅读器打开文件,拖动光标高亮一个词。如果可以用文本光标准确选中单个词,PDF 就有文本层。如果整页被当成一个区块选中,或完全无法选择,PDF 很可能只有图像。
还可以使用 Cmd+F(Mac)或 Ctrl+F(Windows)搜索页面上清楚可见的词。如果搜索没有结果,说明文件没有文本层。
若要通过程序检测,可以使用 pdftotext(Poppler 的一部分)或 PDF 解析库提取文本。页面明明有可见文字,但提取结果为空或只有空白,就说明这些页面只有图像。
处理纯图像 PDF 时的常见错误
- 以为所有 PDF 都能搜索。 很多人认为任何 PDF 都应该支持 Ctrl+F。搜索失败时,他们可能误以为阅读器出了问题,而没有意识到文件缺少文本层。
- 用纯图像 PDF 做长期归档。 文档管理系统和搜索引擎无法为纯图像 PDF 建立内容索引。时间一长,这些内容虽然仍在归档中,却几乎无法通过搜索找到。
- 忽视无障碍访问。 屏幕阅读器无法理解纯图像页面。向包含屏幕阅读器用户的受众分享此类 PDF,会让他们完全无法获取其中的信息。使用 OCR 添加文本层可以解决这个问题。
- 运行 OCR 后不核对准确性。 OCR 并非绝对准确,低分辨率扫描件、特殊字体和复杂版式尤其容易出错。重要文档应始终核对 OCR 结果,在依赖文本层前找出识别错误的字符。
常见问题
如何判断 PDF 是否只有图像?
尝试用光标选择文字。如果无法逐字高亮,或者选择范围把整页当作一个区块,这份 PDF 很可能只包含图像,没有底层文本层。
为什么扫描版 PDF 往往是纯图像?
扫描仪会把每一页拍成图像。生成的文件保存的是栅格图像,也就是像素,而不是机器可读的字符。未经 OCR 处理时,图像中的文字只是画面的一部分。
可以在纯图像 PDF 中搜索吗?
不能使用普通搜索(Ctrl+F 或 Cmd+F)。PDF 阅读器只能搜索机器可读的文本。要让内容支持搜索,需要通过 OCR 添加文本层。
把纯图像 PDF 转为可搜索 PDF 会改变外观吗?
不会。OCR 会在页面图像后方添加一个不可见的文本层。视觉外观保持不变;文本层用于搜索、选择和无障碍访问,而不是显示。
屏幕阅读器可以读取纯图像 PDF 吗?
不可以。屏幕阅读器依赖机器可读的文本来朗读内容。纯图像 PDF 没有文本数据,因此屏幕阅读器无法理解页面内容。