翻译扫描版 PDF:OCR 问题与实用解决方案
了解如何对扫描版 PDF 进行 OCR 和翻译、诊断常见的识别失败,以及通过文档感知的的工作流程来保留排版。

快速解答:扫描版 PDF 在翻译前需要进行 OCR
要翻译扫描版 PDF,请首先运行 OCR,将页面图像转换为可选择的文本。然后使用文档翻译器(例如 PDF Translator)翻译经过 OCR 处理的 PDF。如果跳过 OCR,许多翻译工具会原封不动地返回原始文件、漏掉页面,或者仅翻译已经包含文本层的部分。
请使用以下工作流程:
- 打开 PDF 并尝试选择一个句子。
- 如果无法选择文本,请运行 OCR。
- 在翻译前检查 OCR 文本。
- 将经过 OCR 处理的 PDF 上传到 PDF Translator。
- 对照原始扫描件检查翻译后的输出。
如果你的 PDF 已经包含可选择的文本,且问题是保留排版,请参考在不丢失格式的情况下翻译 PDF 指南。
为什么扫描版 PDF 在翻译工具中会失败
扫描版 PDF 通常只是 PDF 容器内的一组页面图像。页面对人类而言可能显示文字,但文件可能不包含供软件提取的实际文本。
这就导致了一个简单的问题:
| 文件类型 | 翻译器看到的内容 | 会发生什么 |
|---|---|---|
| 基于文本的 PDF | 文本加排版数据 | 可以立即开始翻译。 |
| 纯图像扫描版 PDF | 页面图片 | 需要先进行 OCR。 |
| 文本叠加图像的 PDF | 扫描图像加隐藏的 OCR 文本层 | 可以进行翻译,但 OCR 错误会影响质量。 |
最有用的测试方法不是技术性的:
- 打开 PDF。
- 尝试高亮显示单个单词。
- 复制一个句子。
- 将其粘贴到文本编辑器中。
如果句子正确粘贴,说明 PDF 具有文本层。如果什么也粘不出来,或者整个页面表现得像一张图片,则该 PDF 需要进行 OCR。
OCR 并非可有可无
OCR 意为光学字符识别。它从图像中读取文本并创建机器可读的文本。对于 PDF 翻译,OCR 通常会在扫描页上方创建一个不可见的文本层。
该文本层成为翻译的源头。如果 OCR 犯了错误,翻译就会继承这些错误。
常见的 OCR 错误:
| OCR 错误 | 翻译风险 |
|---|---|
rn 被识别为 m | 单词意思发生改变。 |
1 被识别为 l | 数字、引用或代码变得错误。 |
O 被识别为 0 | ID、公式和名称可能会损坏。 |
| 丢失重音符号 | 名称和术语变得不准确。 |
| 合并了分栏 | 句子以错误的顺序进行翻译。 |
| 表格单元格逐行读取错误 | 数据标签与值不再匹配。 |
| 脚注被当作正文处理 | 引用和注释移动到了错误的上下文中。 |
这就是 OCR 检查步骤至关重要的原因。在抽查完提取的文本之前,请勿翻译扫描文档。
OCR 优先的工作流程
第一步:识别 PDF 类型
尝试选择文本。如果选择成功,你可能不需要 OCR。如果选择失败,请将文件视为纯图像。
同时从视觉上检查页面:
- 倾斜的页面暗示这是一份扫描件。
- 灰色的纸张纹理暗示这是一份扫描件。
- 书脊附近的阴影暗示这是一本翻拍的书籍。
- kontrast 不均匀暗示这是一份影印件。
- 搜索找不到可见文字暗示没有文本层。
第二步:尽可能改善扫描质量
OCR 质量始于图像质量。如果可以重新扫描,请在花时间修复 OCR 错误之前进行重新扫描。
使用此图像质量检查清单:
- 以足够高的分辨率扫描小字。
- 保持页面平整和笔直。
- 避免书脊附近的阴影。
- 裁剪掉表格边缘、手指或背景杂物。
- 在文本和页面之间保持强烈的对比度。
- 保持整行可见。
- 使用正确的页面方向。
- 不要将图像压缩得太厉害,以免字母模糊。
对于旧书和影印件,最大的提升通常来自于纠偏、对比度校正以及重新扫描对焦不准的页面。
第三步:运行 OCR
根据文档选择 OCR 工具,而不是根据品牌。
| OCR 选项 | 最适用于 | 需要注意什么 |
|---|---|---|
| Adobe Acrobat OCR | 一般商业扫描和 PDF 清理 | 在依赖它之前检查当前套餐访问权限。 |
| ABBYY FineReader | 复杂的扫描、表格、分栏和困难的排版 | 仍需人工检查。 |
| Tesseract 或 OCRmyPDF | 本地、技术性、可重复的 OCR 工作流程 | 需要熟悉命令行工具。 |
| 在线 OCR 工具 | 低风险的偶发文件 | 隐私、文件限制和质量各不相同。 |
| 手机扫描应用 | 快速捕获新扫描件 | 透视变形会损害 OCR 质量。 |
对于保密合同、医疗记录、财务文件、未出版的手稿或审稿中的学术作品,请优先选择本地 OCR 工作流程或受信任的环境。不要将敏感的扫描件上传到随意的免费 OCR 网站。
第四步:检查 OCR 文本
在翻译前进行检查,而不是在翻译后。从几个困难的页面复制文本,并检查它是否可读。
需要检查的样本页面:
- 标题页。
- 密集的正文页。
- 表格页。
- 带有脚注的页。
- 带有小字的页。
- 带有印章、手写或批注的页。
- 如果文档是多语言的,则每个语言包含一页。
寻找以下问题:
- 丢失的段落。
- 合并的分栏。
- 损坏的单词。
- 错误的字符。
- 丢失的变音符号。
- 与值分离的表格标签。
- 插入正文中的页眉。
- 混入句子中的页码。
如果 OCR 质量较差,请在翻译前修复它。翻译器无法可靠地恢复 OCR 从未捕获到的含义。
第五步:翻译经过 OCR 处理的 PDF
一旦 PDF 具有干净的文本层,将其上传到 PDF Translator。翻译步骤现在可以使用文本而不是页面图像。
翻译完成后,进行比较:
- 原始扫描件
- OCR 文本层
- 翻译后的 PDF
这种三方检查可帮助你确定错误是来自 OCR 还是翻译。如果 OCR 文本错误,请重新运行 OCR。如果 OCR 文本正确但翻译错误,请修复翻译。
第六步:检查高风险内容
扫描文档通常包含恰好需要仔细检查的内容:旧合同、政府表格、学术论文、手册、历史文献和书页。
手动检查以下项目:
- 姓名
- 日期
- 数字
- 地址
- 产品代码
- 法律引用
- 引用文献
- 表格标签
- 单位
- 公式
- 图片说明
- 脚注
对于研究和学术文件,同时阅读翻译学术研究论文指南,因为扫描的学术 PDF 在 OCR 风险之上增加了引用和排版风险。
并排失败示例
在检查 OCR 输出时使用此表。
| 原始扫描件可能显示为 | 糟糕的 OCR 输出 | 为什么这很重要 |
|---|---|---|
modern | modem | 含义完全改变。 |
Section 10 | Section IO | 法律或技术引用可能会损坏。 |
2026 | 2O26 | 日期和 ID 变得不可靠。 |
patient | patlent | 医疗或技术术语变得错误。 |
| 两个独立的分栏 | 一个合并的段落 | 翻译以错误的顺序读取句子。 |
| 带有标签和值的表格行 | 混合文本的单行 | 数据不再映射到正确的标签。 |
脚注标记 1 | 字母 l | 注释可能会附加到错误的句子。 |
如果在 OCR 层中看到这些错误,请在翻译前修复 OCR。
你应该使用哪个工具?
根据文档难度进行选择。
| 文档 | 推荐路径 |
|---|---|
| 干净的商业扫描件 | 在 Acrobat 或其他可靠的 OCR 工具中进行 OCR,然后使用 PDF Translator。 |
| 旧书扫描件 | 纠偏并改善对比度,仔细 OCR,然后进行翻译。 |
| 学术论文扫描件 | OCR,检查公式/引用/表格,然后带着排版检查进行翻译。 |
| 手写笔记 | 翻译前可能需要进行人工转录。 |
| 简单的个人文档 | 如果隐私风险较低,在线 OCR 可能是可接受的。 |
| 敏感文档 | 使用本地 OCR 或受信任的受控工作流程。 |
如果你想要更广泛的工具比较,请参阅最佳 PDF 翻译器指南。
常见的扫描版 PDF 问题
低分辨率页面
低分辨率扫描会使字母模糊不清。OCR 可能会将 rn 和 m、cl 和 d,或者标点符号和灰尘混淆。
解决方法:如果可能,重新扫描。如果不能,增加对比度并再次尝试 OCR。
倾斜或弯曲的页面
书本扫描件通常在书脊附近弯曲。OCR 对弯曲线条的读取很差,并且可能会重新排序文本。
解决方法:展平页面、重新扫描,或者使用带有纠偏和去曲面功能的 OCR 工具。
多栏排版
OCR 可能会将左右分栏合并为一个句子流。
解决方法:在翻译前检查阅读顺序。学术论文在这里需要特别关注。
表格
表格很难处理,因为 OCR 必须同时检测文本和结构。表格在视觉上可能看起来正确,但文本层却是错误的。
解决方法:从表格中复制 OCR 文本,并确认标签仍然与值匹配。
手写和签名
打印文本的 OCR 比手写识别可靠得多。手写的页边批注、签名和填写的表格可能会被漏掉或识别成乱码。
解决方法:在翻译前手动转录核心手写内容。
混合语言
当 OCR 知道源语言时,其工作效果最好。如果 OCR 仅设置为一种语言,包含英语、法语和中文的扫描可能会失败。
解决方法:如果工具支持,请选择所有相关的 OCR 语言,然后抽查每个语言部分。
隐私和安全检查清单
在将扫描版 PDF 上传到任何地方之前,请询问:
- 文档是否包含个人数据?
- 其中是否包含医疗、法律、财务、学术或未出版的材料?
- 它是否受客户协议或学校政策的约束?
- 此文档是否允许使用在线 OCR 服务?
- 相反,你是否需要本地工作流程?
- 你可以删除不需要翻译的页面吗?
扫描版 PDF 通常很敏感,因为它们来自合同、ID、表格、研究草案和内部档案。对待 OCR 上传决策的方式应当与对待原始文档的方式相同。





