书译
书译

翻译扫描版 PDF:OCR 问题与实用解决方案

了解如何对扫描版 PDF 进行 OCR 和翻译、诊断常见的识别失败,以及通过文档感知的的工作流程来保留排版。

BookTranslator

BookTranslator Team

14 min read

快速解答:扫描版 PDF 在翻译前需要进行 OCR

要翻译扫描版 PDF,请首先运行 OCR,将页面图像转换为可选择的文本。然后使用文档翻译器(例如 PDF Translator)翻译经过 OCR 处理的 PDF。如果跳过 OCR,许多翻译工具会原封不动地返回原始文件、漏掉页面,或者仅翻译已经包含文本层的部分。

请使用以下工作流程:

  1. 打开 PDF 并尝试选择一个句子。
  2. 如果无法选择文本,请运行 OCR。
  3. 在翻译前检查 OCR 文本。
  4. 将经过 OCR 处理的 PDF 上传到 PDF Translator
  5. 对照原始扫描件检查翻译后的输出。

如果你的 PDF 已经包含可选择的文本,且问题是保留排版,请参考在不丢失格式的情况下翻译 PDF 指南。

为什么扫描版 PDF 在翻译工具中会失败

扫描版 PDF 通常只是 PDF 容器内的一组页面图像。页面对人类而言可能显示文字,但文件可能不包含供软件提取的实际文本。

这就导致了一个简单的问题:

文件类型翻译器看到的内容会发生什么
基于文本的 PDF文本加排版数据可以立即开始翻译。
纯图像扫描版 PDF页面图片需要先进行 OCR。
文本叠加图像的 PDF扫描图像加隐藏的 OCR 文本层可以进行翻译,但 OCR 错误会影响质量。

最有用的测试方法不是技术性的:

  1. 打开 PDF。
  2. 尝试高亮显示单个单词。
  3. 复制一个句子。
  4. 将其粘贴到文本编辑器中。

如果句子正确粘贴,说明 PDF 具有文本层。如果什么也粘不出来,或者整个页面表现得像一张图片,则该 PDF 需要进行 OCR。

OCR 并非可有可无

OCR 意为光学字符识别。它从图像中读取文本并创建机器可读的文本。对于 PDF 翻译,OCR 通常会在扫描页上方创建一个不可见的文本层。

该文本层成为翻译的源头。如果 OCR 犯了错误,翻译就会继承这些错误。

常见的 OCR 错误:

OCR 错误翻译风险
rn 被识别为 m单词意思发生改变。
1 被识别为 l数字、引用或代码变得错误。
O 被识别为 0ID、公式和名称可能会损坏。
丢失重音符号名称和术语变得不准确。
合并了分栏句子以错误的顺序进行翻译。
表格单元格逐行读取错误数据标签与值不再匹配。
脚注被当作正文处理引用和注释移动到了错误的上下文中。

这就是 OCR 检查步骤至关重要的原因。在抽查完提取的文本之前,请勿翻译扫描文档。

OCR 优先的工作流程

第一步:识别 PDF 类型

尝试选择文本。如果选择成功,你可能不需要 OCR。如果选择失败,请将文件视为纯图像。

同时从视觉上检查页面:

  • 倾斜的页面暗示这是一份扫描件。
  • 灰色的纸张纹理暗示这是一份扫描件。
  • 书脊附近的阴影暗示这是一本翻拍的书籍。
  • kontrast 不均匀暗示这是一份影印件。
  • 搜索找不到可见文字暗示没有文本层。

第二步:尽可能改善扫描质量

OCR 质量始于图像质量。如果可以重新扫描,请在花时间修复 OCR 错误之前进行重新扫描。

使用此图像质量检查清单:

  • 以足够高的分辨率扫描小字。
  • 保持页面平整和笔直。
  • 避免书脊附近的阴影。
  • 裁剪掉表格边缘、手指或背景杂物。
  • 在文本和页面之间保持强烈的对比度。
  • 保持整行可见。
  • 使用正确的页面方向。
  • 不要将图像压缩得太厉害,以免字母模糊。

对于旧书和影印件,最大的提升通常来自于纠偏、对比度校正以及重新扫描对焦不准的页面。

第三步:运行 OCR

根据文档选择 OCR 工具,而不是根据品牌。

OCR 选项最适用于需要注意什么
Adobe Acrobat OCR一般商业扫描和 PDF 清理在依赖它之前检查当前套餐访问权限。
ABBYY FineReader复杂的扫描、表格、分栏和困难的排版仍需人工检查。
Tesseract 或 OCRmyPDF本地、技术性、可重复的 OCR 工作流程需要熟悉命令行工具。
在线 OCR 工具低风险的偶发文件隐私、文件限制和质量各不相同。
手机扫描应用快速捕获新扫描件透视变形会损害 OCR 质量。

对于保密合同、医疗记录、财务文件、未出版的手稿或审稿中的学术作品,请优先选择本地 OCR 工作流程或受信任的环境。不要将敏感的扫描件上传到随意的免费 OCR 网站。

第四步:检查 OCR 文本

在翻译前进行检查,而不是在翻译后。从几个困难的页面复制文本,并检查它是否可读。

需要检查的样本页面:

  • 标题页。
  • 密集的正文页。
  • 表格页。
  • 带有脚注的页。
  • 带有小字的页。
  • 带有印章、手写或批注的页。
  • 如果文档是多语言的,则每个语言包含一页。

寻找以下问题:

  • 丢失的段落。
  • 合并的分栏。
  • 损坏的单词。
  • 错误的字符。
  • 丢失的变音符号。
  • 与值分离的表格标签。
  • 插入正文中的页眉。
  • 混入句子中的页码。

如果 OCR 质量较差,请在翻译前修复它。翻译器无法可靠地恢复 OCR 从未捕获到的含义。

第五步:翻译经过 OCR 处理的 PDF

一旦 PDF 具有干净的文本层,将其上传到 PDF Translator。翻译步骤现在可以使用文本而不是页面图像。

翻译完成后,进行比较:

  • 原始扫描件
  • OCR 文本层
  • 翻译后的 PDF

这种三方检查可帮助你确定错误是来自 OCR 还是翻译。如果 OCR 文本错误,请重新运行 OCR。如果 OCR 文本正确但翻译错误,请修复翻译。

第六步:检查高风险内容

扫描文档通常包含恰好需要仔细检查的内容:旧合同、政府表格、学术论文、手册、历史文献和书页。

手动检查以下项目:

  • 姓名
  • 日期
  • 数字
  • 地址
  • 产品代码
  • 法律引用
  • 引用文献
  • 表格标签
  • 单位
  • 公式
  • 图片说明
  • 脚注

对于研究和学术文件,同时阅读翻译学术研究论文指南,因为扫描的学术 PDF 在 OCR 风险之上增加了引用和排版风险。

并排失败示例

在检查 OCR 输出时使用此表。

原始扫描件可能显示为糟糕的 OCR 输出为什么这很重要
modernmodem含义完全改变。
Section 10Section IO法律或技术引用可能会损坏。
20262O26日期和 ID 变得不可靠。
patientpatlent医疗或技术术语变得错误。
两个独立的分栏一个合并的段落翻译以错误的顺序读取句子。
带有标签和值的表格行混合文本的单行数据不再映射到正确的标签。
脚注标记 1字母 l注释可能会附加到错误的句子。

如果在 OCR 层中看到这些错误,请在翻译前修复 OCR。

你应该使用哪个工具?

根据文档难度进行选择。

文档推荐路径
干净的商业扫描件在 Acrobat 或其他可靠的 OCR 工具中进行 OCR,然后使用 PDF Translator
旧书扫描件纠偏并改善对比度,仔细 OCR,然后进行翻译。
学术论文扫描件OCR,检查公式/引用/表格,然后带着排版检查进行翻译。
手写笔记翻译前可能需要进行人工转录。
简单的个人文档如果隐私风险较低,在线 OCR 可能是可接受的。
敏感文档使用本地 OCR 或受信任的受控工作流程。

如果你想要更广泛的工具比较,请参阅最佳 PDF 翻译器指南

常见的扫描版 PDF 问题

低分辨率页面

低分辨率扫描会使字母模糊不清。OCR 可能会将 rnmcld,或者标点符号和灰尘混淆。

解决方法:如果可能,重新扫描。如果不能,增加对比度并再次尝试 OCR。

倾斜或弯曲的页面

书本扫描件通常在书脊附近弯曲。OCR 对弯曲线条的读取很差,并且可能会重新排序文本。

解决方法:展平页面、重新扫描,或者使用带有纠偏和去曲面功能的 OCR 工具。

多栏排版

OCR 可能会将左右分栏合并为一个句子流。

解决方法:在翻译前检查阅读顺序。学术论文在这里需要特别关注。

表格

表格很难处理,因为 OCR 必须同时检测文本和结构。表格在视觉上可能看起来正确,但文本层却是错误的。

解决方法:从表格中复制 OCR 文本,并确认标签仍然与值匹配。

手写和签名

打印文本的 OCR 比手写识别可靠得多。手写的页边批注、签名和填写的表格可能会被漏掉或识别成乱码。

解决方法:在翻译前手动转录核心手写内容。

混合语言

当 OCR 知道源语言时,其工作效果最好。如果 OCR 仅设置为一种语言,包含英语、法语和中文的扫描可能会失败。

解决方法:如果工具支持,请选择所有相关的 OCR 语言,然后抽查每个语言部分。

隐私和安全检查清单

在将扫描版 PDF 上传到任何地方之前,请询问:

  • 文档是否包含个人数据?
  • 其中是否包含医疗、法律、财务、学术或未出版的材料?
  • 它是否受客户协议或学校政策的约束?
  • 此文档是否允许使用在线 OCR 服务?
  • 相反,你是否需要本地工作流程?
  • 你可以删除不需要翻译的页面吗?

扫描版 PDF 通常很敏感,因为它们来自合同、ID、表格、研究草案和内部档案。对待 OCR 上传决策的方式应当与对待原始文档的方式相同。

相关文章

翻译扫描版 PDF:OCR 问题与实用解决方案