书译
书译

EPUB 与 PDF:哪种格式更适合翻译?

EPUB 存储的是干净的段落。PDF 存储的是按位置排布的字符。本文从技术角度拆解,说明为什么同一个 AI 在这两种格式上会产生截然不同的结果。

BookTranslator

BookTranslator Team

18 min read

快速结论:对于图书,EPUB 通常翻译效果更好;当版式本身就是内容时,PDF 更胜一筹

如果同一本书同时提供 EPUB 和 PDF,翻译时优先选择 EPUB。EPUB 以一种翻译工具能够保留的结构来存储章节、段落、标题、链接、图片、CSS 和目录数据。PDF 存储的是固定页面版式,因此翻译器必须先重建阅读顺序,才能开始翻译。

这并不意味着 PDF 不好。凡是精确页面版式很重要的场景,PDF 就是正确的源文件:学术论文、表单、证书、扫描文档、报告、手册,以及包含复杂表格或图示的文档。

可以用下面这条判断规则:

  • 对于小说、非虚构作品、教材和电子阅读器阅读:从 EPUB 翻译 开始。
  • 对于固定版式文档、扫描件、表单和学术 PDF:从 PDF 翻译 开始。
  • 对于 Kindle 电子书:先把无 DRM 的 Kindle 文件转换为 EPUB,再翻译 EPUB。

如果你在决定使用 EPUB 后还需要工具清单,请阅读 最佳 EPUB 翻译器对比。如果你真正的问题是保留 PDF 版式,请阅读 如何在不丢失格式的情况下翻译 PDF

EPUB 与 PDF 翻译对比:决策表

翻译因素EPUBPDF默认更优选择
文本提取干净的章节与段落标记从定位文本中重建EPUB
阅读顺序通常在书籍 spine 中明确给出必须根据页面版式推断EPUB
目录结构化导航文件可选书签或页码引用EPUB
CSS 与样式可保留独立样式表样式绑定在固定页面位置上EPUB
图片与图注图片位于内容流中图片与文本共享同一扁平页面画布图书选 EPUB,固定页面选 PDF
脚注与尾注可保留内部链接注释可能依赖页面位置EPUB
文本扩展自然重排必须塞进固定页面区域EPUB
扫描页面不是常见源格式常见源格式,需要 OCRPDF
表单与证书不适合天生为固定版式设计PDF
电子阅读器体验可重排、可调节固定页面,小屏幕上通常更难阅读EPUB
转换风险如果本来就是 EPUB,通常较低PDF 转 EPUB 可能破坏版式取决于源文件

为什么 EPUB 通常能产出更干净的图书翻译

EPUB 更像一个小型网站,而不是一张印刷页面。在文件内部,一本书通常由 XHTML 章节文件、CSS 样式表、图片资源、元数据和导航文件组成。这种结构给翻译软件提供了一张干净的“地图”。

对翻译来说,这一点很重要,因为工具可以:

  • 提取完整段落,而不是猜测哪些行属于同一段。
  • 翻译章节标题和导航条目。
  • 保留 CSS,而不是从零重建版式。
  • 让图片继续留在阅读流中。
  • 保留脚注与其引用之间的链接。
  • 在翻译完成后将文件重新组装成真正的电子书。

这就是为什么对于小说、叙事类非虚构作品、教材、手册和长篇阅读内容,EPUB 通常是更好的源文件。工具可以专注于翻译质量,而不是先解决版式重建问题。

为什么 PDF 翻译更难

PDF 的设计目标是保留视觉外观。它回答的是另一个问题:“页面上的每个元素应该出现在哪里?” 这对印刷和精确版式文档很有用,但也带来了翻译上的挑战。

处理 PDF 时,翻译工具可能需要推断:

  • 哪些文字属于正文。
  • 哪些行属于同一段落。
  • 页面是一栏还是多栏。
  • 某个数字是脚注标记、列表编号、页码还是表格数值。
  • 文本是可选择的文字,还是扫描图像的一部分。
  • 当译文变长或变短时,应该放进哪里。

这些问题都能解决,但并不是“零成本”的。即使 AI 模型很强,如果输入文本提取顺序错误,或者和页眉、页脚、注释、相邻栏内容混在一起,输出结果也会变差。

真正造成翻译差异的是输入质量

AI 模型并不知道文本来自 EPUB 还是 PDF。它看到的只是文本。格式之所以重要,是因为它会改变送到模型面前的文本质量。

实际差别如下:

流程步骤EPUB 风险PDF 风险
识别段落低,因为段落有标签中,因为段落必须重建
保持阅读顺序低,因为章节顺序已定义中到高,尤其在多栏、侧栏和表格中
保留标题低,因为标题本身就是标记中,因为标题通常只是视觉样式
保留注释中,如果锚点被错误重写中到高,尤其是页下注释
处理图片普通内嵌图片风险低中,当文字与图片重叠时
处理更长的译文重排低,因为 EPUB 会自动重排高,因为 PDF 的文本框是固定的

如果你的 PDF 译文看起来比 EPUB 译文更差,原因往往不是“翻译质量差”,而是提取差、切分差,或固定版式带来的限制。

什么时候 EPUB 是更好的源文件

当内容主要用于连续阅读时,选择 EPUB。

适合用 EPUB 翻译的内容:

  • 小说和短篇小说集。
  • 叙事类非虚构作品。
  • 商业书籍。
  • 以连续正文为主的教材。
  • 语言学习类书籍。
  • 不依赖精确页面几何关系的手册。
  • 转换为 EPUB 后的无 DRM Kindle 电子书。
  • 计划在 Kindle、Kobo、Apple Books、Google Play Books 或手机上阅读的书籍。

当目标语言会改变文本长度时,EPUB 尤其有用。可重排文本会让译书自然适配,而不是强行把每一段塞回原始页面框里。

如果你的源文件本来就是 EPUB,请直接从专门的 EPUB 翻译器 开始。

什么时候 PDF 是更好的源文件

当页面版式本身承载含义时,选择 PDF。

适合用 PDF 翻译的内容:

  • 带有多栏、图表、公式、引文和页码引用的学术论文。
  • 需要 OCR 的扫描文档。
  • 政府表单和证书。
  • 页面版式很重要的法律文书。
  • 财务报告和年报。
  • 需要精确图示位置的手册。
  • 导出为 PDF 的演示文稿。
  • 读者期待页对页对应关系的文档。

对于这类文件,转换成 EPUB 反而可能破坏文档真正有价值的部分。应使用具备版式感知能力的 PDF 翻译器 直接翻译 PDF,然后检查表格、图表、脚注和页码引用。

翻译前是否应该先把 PDF 转成 EPUB?

有时应该。若 PDF 实际上只是一本被困在固定页面格式里的图书,先转 EPUB 可能改善翻译效果。但如果 PDF 依赖精确版式,这样做也可能让输出更差。

适合先转 PDF 为 EPUB 的情况:

  • PDF 是文本型,而不是扫描件。
  • 内容以连续散文为主。
  • 你打算在电子阅读器或手机上阅读。
  • 你不需要精确保留原始页码。
  • 表格、表单、多栏和图示很少。

不适合先转换的情况:

  • PDF 是扫描件,需要 OCR。
  • 文档采用多栏学术版式。
  • 页码、表单、印章或签名很重要。
  • 表格、公式或图示需要精确定位。
  • PDF 本身已经是用户期望的最终版式。

如果你要转换,请使用 Calibre 或其他电子书转换流程,然后在翻译前先检查 EPUB。不要因为生成了文件,就默认转换一定成功。

一个 10 分钟格式测试

如果你拿不准,先做这个小测试,再决定是否翻译整份文档。

  1. 选取 3 个有代表性的部分:一页普通页面、一页带图或表格的页面,以及一页带注释或链接的页面。
  2. 如果你同时有 EPUB 和 PDF 版本,就从两种格式中翻译相同的部分。
  3. 在电子阅读器或电子书 App 中打开 EPUB 输出。
  4. 在 PDF 查看器中打开 PDF 输出。
  5. 检查阅读顺序、标题、注释、图片和文本溢出情况。
  6. 选择那个在你的实际阅读设备上后续清理工作最少的格式。

对于图书,EPUB 的结果通常更好。对于“版式本身就是重点”的文档,PDF 的结果通常更好。

各格式常见的失败模式

EPUB 的失败模式

  • 工具只能翻译文本,却把 EPUB 包结构丢掉了。
  • 目录锚点被错误重写。
  • CSS 被剥离,章节看起来像纯文本。
  • 脚注链接无法再前后跳转。
  • 固定版式 EPUB 区段无法很好地适应更长的译文。
  • 图片中的文字没有被翻译,因为它属于图片本身。

PDF 的失败模式

  • 多栏文本按错误顺序读取。
  • 页眉或页脚被并入正文。
  • 脚注标记被挂到了错误的句子上。
  • 表格在翻译后失去对齐。
  • 更长的译文溢出固定文本框。
  • 扫描页面产生 OCR 错误。
  • 书签与翻译后的文档不匹配。

这些是完全不同的问题。这就是为什么在选择工具之前,应该先选对格式。

按使用场景选择 EPUB 还是 PDF

使用场景更好的源文件原因
用另一种语言阅读小说EPUB段落干净,阅读可重排
翻译 Kindle 电子书转换后的 EPUBKindle 文件通常需要无 DRM 的 EPUB 工作流
翻译学术文章PDF引文、图表和版式通常都很重要
翻译扫描版图书带 OCR 的 PDF必须先识别扫描内容,再进行翻译
在手机上阅读EPUB可重排文本更容易阅读
保留表单PDF固定字段和页面几何关系很重要
翻译教材有 EPUB 就选 EPUB,版式复杂则选 PDF取决于图示、表格和公式
自行出版翻译版本EPUB 或原始书稿你需要一个干净、可编辑的出版工作流

Kindle 文件还要多一步

Kindle 电子书通常不会被直接交给翻译工具。更实用的工作流是:

  1. 确认你拥有为预期用途翻译这本书的权利。
  2. 只处理无 DRM 文件,或你在法律上允许转换的文件。
  3. 用 Calibre 将 Kindle 文件转换为 EPUB。
  4. 检查 EPUB 的章节结构、目录、图片和注释。
  5. 翻译 EPUB。
  6. 将译后的文件发送回 Kindle,或在其他 EPUB 应用中阅读。

如果你的源文件是 AZW3、KFX、MOBI 或其他 Kindle 格式,请阅读完整的 Kindle 翻译工作流

先选格式,再选翻译器

一旦你确定了正确的源格式,再来选择工具:

常见问题

对于翻译来说,EPUB 一定比 PDF 更好吗?

不一定。对于图书和长篇阅读,EPUB 通常更好。当固定版式很重要时,比如表单、学术论文、扫描文档、证书和版式复杂的报告,PDF 更好。

为什么 EPUB 比 PDF 更适合翻译?

EPUB 给翻译工具提供的是结构化的章节和段落。PDF 给工具提供的是固定页面位置。使用 EPUB 时,工具可以直接翻译有意义的文本单元;使用 PDF 时,工具往往必须先重建文本,再开始翻译。

我可以把 PDF 当作 EPUB 来翻译吗?

可以,前提是你先把 PDF 转成 EPUB。对于以文字为主的图书,这通常效果不错;对于扫描件、表单、多栏、表格以及页面版式很重要的文档,则效果较差。翻译前一定要先检查转换后的 EPUB。

我可以把 EPUB 当作 PDF 来翻译吗?

如果你最终需要固定版式文件,可以在翻译完成后把 EPUB 转成 PDF,但 EPUB 通常更适合作为工作格式。先翻译 EPUB,检查结果,只有当最终流程确实需要时再导出为 PDF。

哪种格式更适合 Kindle 翻译?

EPUB 通常是更好的工作格式。无 DRM 的 Kindle 文件通常可以先转换为 EPUB,翻译后再发送回 Kindle。参见 Kindle 翻译指南

哪种格式更适合保留格式?

对于可重排的图书,EPUB 更能保留阅读结构。对于固定页面文档,PDF 更能保留原始页面设计。正确答案取决于你所说的“格式”到底是指图书结构,还是精确页面版式。

最终结论

如果目标是得到一本可读的译书,就选 EPUB。如果页面本身就是内容的一部分,就选 PDF。如果你两种格式都有,先翻译 EPUB。如果你手上只有 PDF,那就先判断它是一本可以转换的“图书型文本”,还是一个应该继续保留为 PDF 的重版式文件。

格式选择先于翻译工具选择。源格式选错了,即便 AI 模型再好,也得先和文件本身较劲。

相关文章