术语

文本层

文本层是嵌入文档的机器可读文字,通常位于可见页面图像的后方。它让软件可以搜索、选择和访问文档内容。

文本层与可见文字

原生数字文档由文字处理软件、浏览器或设计工具创建,通常在原始文件结构中就包含文字。这些文字本来就能由机器读取。

扫描或图像文档中的文本层则不同。它通常由 OCR 在之后添加,让软件能够处理原本只以像素存在的文字。两份文档在屏幕上可能看起来完全相同,但一份包含原生数字文字,另一份则依赖 OCR 生成的文本层。

实际区别在于:原生数字文件可以直接选择和搜索文字;没有文本层的图像文件则不能,无论人眼看起来多么清楚。

哪些场景需要文本层

文档不能只靠视觉阅读时,就需要文本层:

  • 可搜索 PDF——文本层让 PDF 能够搜索。没有它,在文档中查找不会返回任何结果。
  • 无障碍访问——屏幕阅读器依赖文本层朗读内容。对于辅助技术而言,纯图像文档实际上不可见。
  • 文档索引——搜索引擎和文档管理系统索引的是文本层,而不是页面图像。
  • 复制和粘贴——扫描件或截图只有在包含文本层时,才能选择和复制其中的文字。
  • 截图 PDF 导出——把截图导出成 PDF 时,文本层可以让其中的文字日后能够引用和搜索。

如何创建文本层

有两种方式。原生数字文档会自动包含文本层,这是文件创建方式的一部分,无需额外处理。

扫描件、照片和截图等图像文档则必须另行添加文本层。最常见的方式是 OCR。识别引擎读取页面图像,找出字符和词语,再把结果作为隐藏文本层嵌入可见内容后方。

有些截图工具也通过这种方式生成可搜索的导出文件:在导出时运行 OCR 并嵌入文本层,无需用户日后再使用其他工具处理。

文本层的常见错误

  • 以为外观清楚的文档一定有文本层。 页面即使看起来十分清晰,也可能只有图像。只有尝试选择或搜索文字,才能确认。
  • 把文本层当作 OCR 的同义词。 两者联系紧密,但并不相同。OCR 是识别过程,文本层是嵌入文档的结果。
  • 期待文本层保留视觉布局。 文本层保存文字及其在页面上的大致位置,不保存格式、颜色或视觉结构。它用于搜索和选择,而不是重现布局。
  • OCR 后没有验证文本层准确性。 OCR 并不完美。图像质量差、字体特殊或多栏布局复杂时,文本层可能包含识别错误。

常见问题

页面看起来像图像,文档仍然可以包含文本层吗?

可以。文档看起来仍像扫描图像,但可以包含嵌入的文本层,以支持搜索和选择。

文本层与 OCR 是一回事吗?

不完全一样。OCR 是识别过程,文本层则是识别后在文档中生成的一种结果。

如何判断文档是否有文本层?

尝试选择页面上的文字。如果可以高亮单个词,文档就有文本层;如果无法选择,很可能只有图像。

PDF 中的文本层存储在哪里?

文本层嵌入 PDF 文件本身,位于页面图像后方。它不是单独的文件,而是文档结构的一部分。

文本层会包含错误吗?

会。如果文本层由 OCR 生成,就可能出现识别错误,尤其是在图像质量差、字体特殊或布局复杂时。

参考资料

相关资料

什么是文本层? | 术语表 | Shotomatic