新功能
v1.6.0
Shotomatic Team
约 2 分钟阅读

可搜索的 OCR PDF 导出

在 PDF 中嵌入 OCR 文本层,并按照版面定位,让导出的 PDF 可以搜索。

内置 OCR 可以把截图导出为可搜索的 PDF。

可搜索的 PDF 导出

  • 嵌入文本层,支持搜索与选择
  • 输出带标签的 PDF,改善无障碍访问
  • 根据版面定位 OCR 内容,适配多栏页面

PDF 导出中高亮的 OCR 文本层
示例:直接在导出的 PDF 中拖动选择 OCR 文本。

OCR 文本层的生成方式

导出 PDF 时会自动运行 OCR。你无需启用选项,也不用改变现有流程。

具体流程如下:

  • Tesseract.js 使用内置语言数据在本地运行。
  • 我们提取词语边界框、行和文本块,用于推断分栏与阅读顺序。
  • 每个词语会按最终 PDF 坐标缩放,并绘制为不可见文本层。
  • 开启带标签 PDF 模式后,我们会将词语组合成段落,并附加 ActualText 以改善无障碍访问。

更新至 Shotomatic v1.6.0,使用 OCR 导出可搜索的 PDF。

相关功能和更新

相关功能

其他更新

让截图流程更简单

自动执行重复截图,减少手动操作。

可搜索的 OCR PDF 导出 | 更新日志 | Shotomatic