术语
可搜索 PDF
可搜索 PDF 是文字能由软件查找、选择、复制或索引的 PDF 文件,通常除了可见的页面图像,还包含机器可读的文本层。
可搜索 PDF 与纯图像 PDF
两份 PDF 在屏幕上可能看起来完全相同,实际使用时却有很大差别。可搜索 PDF 会把文字提供给软件,因此可以在文档中查找,也能选择和复制文字,内容还可以编入索引以便日后检索。纯图像 PDF 保留了页面外观,但内容就像一张平面图片,搜索、选择、复制及多数无障碍功能都无法使用。
这种区别很重要,因为许多 PDF 只有图像,而创建者或接收者可能并未意识到这一点。扫描文档、拍摄的页面和某些由截图导出的 PDF,默认都会是纯图像文件,除非另行添加文本层。
可搜索 PDF 的应用场景
需要在截取的文档中查找、引用或重复使用文字时,通常会用到可搜索 PDF:
- 档案与记录——让存储的文档可以按关键词检索,而不仅仅依赖文件名或日期。
- 法律与合规——法院和监管机构通常要求提交的文档可以搜索文字,便于证据开示和审阅。
- 研究——在扫描论文、报告或历史文档的集合中进行搜索。
- 无障碍访问——屏幕阅读器需要文本层才能朗读文档内容。
- 截图导出——把截图导出成 PDF,便于日后搜索和引用其中内容。
PDF 如何变得可搜索
PDF 可以通过两种方式具备搜索能力。如果文档以数字形式创建,例如由文字处理软件或浏览器导出,文字通常已经嵌入,PDF 默认即可搜索。
如果文档源自图像,例如扫描件、照片或截图,就需要 OCR 才能搜索。OCR 会识别页面图像中的文字,并在可见内容后方嵌入文本层。结果看起来不变,但文字已经可以由机器读取。
因此,有些截图工具会在导出时运行 OCR,得到的 PDF 无需额外处理,立即就能搜索。
可搜索 PDF 的常见错误
- 以为所有 PDF 都能搜索。 PDF 即使看起来完全可读,也可能只有图像。只有尝试选择或搜索文字,才能确认。
- 以为可搜索就代表识别完全准确。 文本层取决于识别结果。图像质量差、字体特殊或布局复杂时,OCR 可能出错。即使识别不完美,搜索功能仍然有用,但文本层质量会影响搜索和复制结果。
- 把“可搜索 PDF”当作一种文件格式。 它不是单独的格式,而是 PDF 的一种属性。任何 PDF 都可能可搜索,也可能只有图像。
- 没有检查,就把纯图像 PDF 归档。 扫描或截取的文档如果以纯图像形式保存,日后可能很难找到。归档前运行 OCR,可以保证内容仍然能够检索。
常见问题
所有 PDF 都能搜索吗?
不能。有些 PDF 在屏幕上看起来可以正常阅读,实际上却只有图像,其中的文字无法搜索或选择。
可搜索 PDF 必须由数字文档生成吗?
不必。OCR 可以识别扫描或图像文档中的文字并写入文件,让这些文档也能搜索。
如何判断 PDF 是否可以搜索?
按 Cmd/Ctrl+F,搜索页面中可见的一个词。如果没有任何内容高亮,PDF 很可能只有图像,需要通过 OCR 才能搜索。
可以让现有 PDF 变得可搜索吗?
可以。OCR 工具能为纯图像 PDF 添加文本层,让现有文件也可搜索,而文档的视觉外观不会改变。
让 PDF 可搜索会改变它的外观吗?
不会。文本层会嵌入页面图像后方,文档看起来完全相同,区别只是软件现在可以查找、选择和复制其中的文字。
参考资料
- 使用 Adobe Acrobat 在线对 PDF 进行 OCR — Adobe
- PDF7:对扫描 PDF 文档执行 OCR 以提供实际文字 — W3C
- OCRmyPDF — OCRmyPDF