指南
Shotomatic Team
约 8 分钟阅读

为什么保存的电子教材 PDF 无法选择文字?

PDF 可能只含页面图片、没有文字层、OCR 不准确,或限制复制。先判断属于哪种情况,再选择处理方法。

学生测试保存的教材 PDF 能否选择文字

PDF 看起来可以像普通教材,却仍然不包含可选择文字。它可能是一组页面图片、带 OCR 层的图片 PDF、采用特殊字体编码的文件,或因文档权限而限制复制。

简短答案: 测试搜索、文字选择和文档权限。只有在获准处理页面时才使用 OCR。如果文件限制复制,请申请获准文件,而不是绕过限制。

判断你拿到的是哪种 PDF

测试结果可能的类型
可以准确选择和复制文字原生文字 PDF
可以搜索,但复制的文字有错误带 OCR 的图片 PDF 或编码错误
整页会被当作一个对象选中纯图片 PDF
无法选择,而且权限显示有限制受保护 PDF
有些页面正常,有些不正常混合文档

请测试不止一页。封面和扫描附录可能是图片,而文档其他部分仍是原生文字。

在 Mac 上测试搜索和选择

用“预览”或可信的 PDF 阅读器打开文件。

  1. 在“预览”中选择工具 > 文本选择。如果当前选中矩形或标注工具,原本可选择的文字也可能看起来不可用。
  2. 按 Command-F,搜索页面上一个有辨识度的词。
  3. 拖动选择一个句子。
  4. 把它复制到临时纯文本笔记中。
  5. 逐字与可见句子比较。
  6. 再测试包含表格、脚注和公式的页面。
  7. 如果仍无法选择,请选择工具 > 显示检查器,打开“加密检查器”,查看 PDF 是否要求密码或限制复制。

如果临时复制的文字包含无须保留的授权材料,请及时删除。

Apple 的“预览”问题排查指南介绍了“文本选择”和“加密检查器”。如果文件属于你,而且你获得了密码,请通过正常提示输入。不要尝试移除未经授权更改的权限。

纯图片 PDF

纯图片 PDF 只是页面图片的容器,常见于扫描件和截图文档。它可以很好地保留版式,但电脑看到的是像素,不是文字。

如果源文件由你创建、归你所有,或你有权处理,OCR 可以添加不可见文字层。页面图片仍然可见,同时能够进行搜索和粗略复制。

当前 Mac 的“预览”提供内置方法:

  1. 选择文件 > 复制,保留未经改动的图片原件。
  2. 打开副本后,选择文件 > 导出
  3. 选择 Embed Text
  4. 保存新 PDF 并重新打开。
  5. 重复上面的搜索和复制测试。

Apple 的 Embed Text 指南指出,只有“预览”尚未在文档中识别出文字时,才会显示该选项。如果没有出现,PDF 可能已经有文字层。此时应检查 OCR 错误、编码或权限,不要再运行一次 OCR。

截图 PDF 与浏览器 PDF 对比解释了为什么浏览器生成的原生文字通常比 OCR 更可靠。

已有 OCR 文字,但不准确

OCR 会读取页面图像并猜测字符。常见错误包括:

  • O0
  • lI1
  • rnm
  • 上标和下标;
  • 多栏阅读顺序;
  • 断行连字符;
  • 连字和装饰字体;
  • 公式和化学符号。

可以用 OCR 查找页面,但不要未经核对就把结果当作引文。引语、公式、姓名和数字都应与图片对照。

原生文字使用特殊编码

有些 PDF 能通过嵌入字体正确显示字符,复制时却会顺序错误或变成无关符号,搜索也可能时好时坏。

用另一款符合标准的 PDF 阅读器测试,以确认问题。如果官方文件有缺陷,请把页码和一段不敏感的简短示例报告给提供方。由出版商重新生成文字层,通常比再次 OCR 更准确。

文件限制复制

受保护 PDF 可以允许阅读,同时限制复制、打印或编辑。不要把 OCR、截图、移除密码或其他转换器当作绕过限制的方法。

可以改用以下方式:

  • 使用阅读器的笔记或引用功能;
  • 只通过官方额度复制;
  • 申请无障碍版或研究副本;
  • 联系图书馆,询问无 DRM 替代文件;
  • 要求出版商修复无障碍缺陷。

申请帮助时,请提供准确书名、ISBN、页码、阅读器和辅助技术信息。

混合 PDF 需要逐页检查

教材 PDF 可能同时包含原生文字章节、扫描附录和图片式图表。某次搜索成功,并不能证明每页都可搜索。

请测试:

  • 前置部分;
  • 普通文字页;
  • 图表较多的页面;
  • 索引;
  • 附录;
  • 作业需要的重要部分。

如果允许 OCR,只处理确有需要的页面,并保留原文件作为视觉来源。

以后保存时选择更好的输出

有官方 PDF 或 EPUB 时,请直接使用。阅读器允许打印页面时,使用官方打印命令。只要打印视图完整,浏览器 PDF 可以保留原生文字。

要把获准保存的页面图片制作为可搜索 PDF?Shotomatic 可以保持截图顺序,并在导出 PDF 时添加可搜索的 OCR 文字层。如果图片已经准备好,可直接在浏览器中免费合并为 PDF。OCR 可能出错,因此仍应以可见页面为准。

常见问题

如何判断 PDF 是否只有图片?

如果整页像一张图片,而且搜索找不到页面上可见的词,它很可能没有文字层。

OCR 会完全准确吗?

不会。公式、表格、脚注、姓名和数字都应与可见页面对照。

为什么能搜索,却无法复制出正确文字?

OCR 错误、字体编码、阅读顺序或文档权限都可能造成这种结果。

可以移除复制限制吗?

本指南不介绍绕过限制。请申请获准文件,或使用官方阅读器允许的工具。

相关文章

查看更多文章

正在处理允许保存的页面?

Shotomatic 会按顺序整理获准保存的页面截图,供你检查后在 Mac 上导出可搜索的 PDF。它不会绕过阅读器限制或打印上限。

为什么保存的电子教材 PDF 无法选择文字? | 博客 | Shotomatic