术语

可搜索 PDF

可搜索 PDF 是文字能由软件查找、选择、复制或索引的 PDF 文件,通常除了可见的页面图像,还包含机器可读的文本层

可搜索 PDF 与纯图像 PDF

两份 PDF 在屏幕上可能看起来完全相同,实际使用时却有很大差别。可搜索 PDF 会把文字提供给软件,因此可以在文档中查找,也能选择和复制文字,内容还可以编入索引以便日后检索。纯图像 PDF 保留了页面外观,但内容就像一张平面图片,搜索、选择、复制及多数无障碍功能都无法使用。

这种区别很重要,因为许多 PDF 只有图像,而创建者或接收者可能并未意识到这一点。扫描文档、拍摄的页面和某些由截图导出的 PDF,默认都会是纯图像文件,除非另行添加文本层。

可搜索 PDF 的应用场景

需要在截取的文档中查找、引用或重复使用文字时,通常会用到可搜索 PDF:

  • 档案与记录——让存储的文档可以按关键词检索,而不仅仅依赖文件名或日期。
  • 法律与合规——法院和监管机构通常要求提交的文档可以搜索文字,便于证据开示和审阅。
  • 研究——在扫描论文、报告或历史文档的集合中进行搜索。
  • 无障碍访问——屏幕阅读器需要文本层才能朗读文档内容。
  • 截图导出——把截图导出成 PDF,便于日后搜索和引用其中内容。

PDF 如何变得可搜索

PDF 可以通过两种方式具备搜索能力。如果文档以数字形式创建,例如由文字处理软件或浏览器导出,文字通常已经嵌入,PDF 默认即可搜索。

如果文档源自图像,例如扫描件、照片或截图,就需要 OCR 才能搜索。OCR 会识别页面图像中的文字,并在可见内容后方嵌入文本层。结果看起来不变,但文字已经可以由机器读取。

因此,有些截图工具会在导出时运行 OCR,得到的 PDF 无需额外处理,立即就能搜索。

可搜索 PDF 的常见错误

  • 以为所有 PDF 都能搜索。 PDF 即使看起来完全可读,也可能只有图像。只有尝试选择或搜索文字,才能确认。
  • 以为可搜索就代表识别完全准确。 文本层取决于识别结果。图像质量差、字体特殊或布局复杂时,OCR 可能出错。即使识别不完美,搜索功能仍然有用,但文本层质量会影响搜索和复制结果。
  • 把“可搜索 PDF”当作一种文件格式。 它不是单独的格式,而是 PDF 的一种属性。任何 PDF 都可能可搜索,也可能只有图像。
  • 没有检查,就把纯图像 PDF 归档。 扫描或截取的文档如果以纯图像形式保存,日后可能很难找到。归档前运行 OCR,可以保证内容仍然能够检索。

常见问题

所有 PDF 都能搜索吗?

不能。有些 PDF 在屏幕上看起来可以正常阅读,实际上却只有图像,其中的文字无法搜索或选择。

可搜索 PDF 必须由数字文档生成吗?

不必。OCR 可以识别扫描或图像文档中的文字并写入文件,让这些文档也能搜索。

如何判断 PDF 是否可以搜索?

按 Cmd/Ctrl+F,搜索页面中可见的一个词。如果没有任何内容高亮,PDF 很可能只有图像,需要通过 OCR 才能搜索。

可以让现有 PDF 变得可搜索吗?

可以。OCR 工具能为纯图像 PDF 添加文本层,让现有文件也可搜索,而文档的视觉外观不会改变。

让 PDF 可搜索会改变它的外观吗?

不会。文本层会嵌入页面图像后方,文档看起来完全相同,区别只是软件现在可以查找、选择和复制其中的文字。

参考资料

相关资料

什么是可搜索 PDF? | 术语表 | Shotomatic