EPUB 与 PDF:哪种格式更适合翻译?
EPUB 存储的是干净的段落。PDF 存储的是按位置排布的字符。本文从技术角度拆解,说明为什么同一个 AI 在这两种格式上会产生截然不同的结果。

快速结论:对于图书,EPUB 通常翻译效果更好;当版式本身就是内容时,PDF 更胜一筹
如果同一本书同时提供 EPUB 和 PDF,翻译时优先选择 EPUB。EPUB 以一种翻译工具能够保留的结构来存储章节、段落、标题、链接、图片、CSS 和目录数据。PDF 存储的是固定页面版式,因此翻译器必须先重建阅读顺序,才能开始翻译。
这并不意味着 PDF 不好。凡是精确页面版式很重要的场景,PDF 就是正确的源文件:学术论文、表单、证书、扫描文档、报告、手册,以及包含复杂表格或图示的文档。
可以用下面这条判断规则:
- 对于小说、非虚构作品、教材和电子阅读器阅读:从 EPUB 翻译 开始。
- 对于固定版式文档、扫描件、表单和学术 PDF:从 PDF 翻译 开始。
- 对于 Kindle 电子书:先把无 DRM 的 Kindle 文件转换为 EPUB,再翻译 EPUB。
如果你在决定使用 EPUB 后还需要工具清单,请阅读 最佳 EPUB 翻译器对比。如果你真正的问题是保留 PDF 版式,请阅读 如何在不丢失格式的情况下翻译 PDF。
EPUB 与 PDF 翻译对比:决策表
| 翻译因素 | EPUB | 默认更优选择 | |
|---|---|---|---|
| 文本提取 | 干净的章节与段落标记 | 从定位文本中重建 | EPUB |
| 阅读顺序 | 通常在书籍 spine 中明确给出 | 必须根据页面版式推断 | EPUB |
| 目录 | 结构化导航文件 | 可选书签或页码引用 | EPUB |
| CSS 与样式 | 可保留独立样式表 | 样式绑定在固定页面位置上 | EPUB |
| 图片与图注 | 图片位于内容流中 | 图片与文本共享同一扁平页面画布 | 图书选 EPUB,固定页面选 PDF |
| 脚注与尾注 | 可保留内部链接 | 注释可能依赖页面位置 | EPUB |
| 文本扩展 | 自然重排 | 必须塞进固定页面区域 | EPUB |
| 扫描页面 | 不是常见源格式 | 常见源格式,需要 OCR | |
| 表单与证书 | 不适合 | 天生为固定版式设计 | |
| 电子阅读器体验 | 可重排、可调节 | 固定页面,小屏幕上通常更难阅读 | EPUB |
| 转换风险 | 如果本来就是 EPUB,通常较低 | PDF 转 EPUB 可能破坏版式 | 取决于源文件 |
为什么 EPUB 通常能产出更干净的图书翻译
EPUB 更像一个小型网站,而不是一张印刷页面。在文件内部,一本书通常由 XHTML 章节文件、CSS 样式表、图片资源、元数据和导航文件组成。这种结构给翻译软件提供了一张干净的“地图”。
对翻译来说,这一点很重要,因为工具可以:
- 提取完整段落,而不是猜测哪些行属于同一段。
- 翻译章节标题和导航条目。
- 保留 CSS,而不是从零重建版式。
- 让图片继续留在阅读流中。
- 保留脚注与其引用之间的链接。
- 在翻译完成后将文件重新组装成真正的电子书。
这就是为什么对于小说、叙事类非虚构作品、教材、手册和长篇阅读内容,EPUB 通常是更好的源文件。工具可以专注于翻译质量,而不是先解决版式重建问题。
为什么 PDF 翻译更难
PDF 的设计目标是保留视觉外观。它回答的是另一个问题:“页面上的每个元素应该出现在哪里?” 这对印刷和精确版式文档很有用,但也带来了翻译上的挑战。
处理 PDF 时,翻译工具可能需要推断:
- 哪些文字属于正文。
- 哪些行属于同一段落。
- 页面是一栏还是多栏。
- 某个数字是脚注标记、列表编号、页码还是表格数值。
- 文本是可选择的文字,还是扫描图像的一部分。
- 当译文变长或变短时,应该放进哪里。
这些问题都能解决,但并不是“零成本”的。即使 AI 模型很强,如果输入文本提取顺序错误,或者和页眉、页脚、注释、相邻栏内容混在一起,输出结果也会变差。
真正造成翻译差异的是输入质量
AI 模型并不知道文本来自 EPUB 还是 PDF。它看到的只是文本。格式之所以重要,是因为它会改变送到模型面前的文本质量。
实际差别如下:
| 流程步骤 | EPUB 风险 | PDF 风险 |
|---|---|---|
| 识别段落 | 低,因为段落有标签 | 中,因为段落必须重建 |
| 保持阅读顺序 | 低,因为章节顺序已定义 | 中到高,尤其在多栏、侧栏和表格中 |
| 保留标题 | 低,因为标题本身就是标记 | 中,因为标题通常只是视觉样式 |
| 保留注释 | 中,如果锚点被错误重写 | 中到高,尤其是页下注释 |
| 处理图片 | 普通内嵌图片风险低 | 中,当文字与图片重叠时 |
| 处理更长的译文重排 | 低,因为 EPUB 会自动重排 | 高,因为 PDF 的文本框是固定的 |
如果你的 PDF 译文看起来比 EPUB 译文更差,原因往往不是“翻译质量差”,而是提取差、切分差,或固定版式带来的限制。
什么时候 EPUB 是更好的源文件
当内容主要用于连续阅读时,选择 EPUB。
适合用 EPUB 翻译的内容:
- 小说和短篇小说集。
- 叙事类非虚构作品。
- 商业书籍。
- 以连续正文为主的教材。
- 语言学习类书籍。
- 不依赖精确页面几何关系的手册。
- 转换为 EPUB 后的无 DRM Kindle 电子书。
- 计划在 Kindle、Kobo、Apple Books、Google Play Books 或手机上阅读的书籍。
当目标语言会改变文本长度时,EPUB 尤其有用。可重排文本会让译书自然适配,而不是强行把每一段塞回原始页面框里。
如果你的源文件本来就是 EPUB,请直接从专门的 EPUB 翻译器 开始。
什么时候 PDF 是更好的源文件
当页面版式本身承载含义时,选择 PDF。
适合用 PDF 翻译的内容:
- 带有多栏、图表、公式、引文和页码引用的学术论文。
- 需要 OCR 的扫描文档。
- 政府表单和证书。
- 页面版式很重要的法律文书。
- 财务报告和年报。
- 需要精确图示位置的手册。
- 导出为 PDF 的演示文稿。
- 读者期待页对页对应关系的文档。
对于这类文件,转换成 EPUB 反而可能破坏文档真正有价值的部分。应使用具备版式感知能力的 PDF 翻译器 直接翻译 PDF,然后检查表格、图表、脚注和页码引用。
翻译前是否应该先把 PDF 转成 EPUB?
有时应该。若 PDF 实际上只是一本被困在固定页面格式里的图书,先转 EPUB 可能改善翻译效果。但如果 PDF 依赖精确版式,这样做也可能让输出更差。
适合先转 PDF 为 EPUB 的情况:
- PDF 是文本型,而不是扫描件。
- 内容以连续散文为主。
- 你打算在电子阅读器或手机上阅读。
- 你不需要精确保留原始页码。
- 表格、表单、多栏和图示很少。
不适合先转换的情况:
- PDF 是扫描件,需要 OCR。
- 文档采用多栏学术版式。
- 页码、表单、印章或签名很重要。
- 表格、公式或图示需要精确定位。
- PDF 本身已经是用户期望的最终版式。
如果你要转换,请使用 Calibre 或其他电子书转换流程,然后在翻译前先检查 EPUB。不要因为生成了文件,就默认转换一定成功。
一个 10 分钟格式测试
如果你拿不准,先做这个小测试,再决定是否翻译整份文档。
- 选取 3 个有代表性的部分:一页普通页面、一页带图或表格的页面,以及一页带注释或链接的页面。
- 如果你同时有 EPUB 和 PDF 版本,就从两种格式中翻译相同的部分。
- 在电子阅读器或电子书 App 中打开 EPUB 输出。
- 在 PDF 查看器中打开 PDF 输出。
- 检查阅读顺序、标题、注释、图片和文本溢出情况。
- 选择那个在你的实际阅读设备上后续清理工作最少的格式。
对于图书,EPUB 的结果通常更好。对于“版式本身就是重点”的文档,PDF 的结果通常更好。
各格式常见的失败模式
EPUB 的失败模式
- 工具只能翻译文本,却把 EPUB 包结构丢掉了。
- 目录锚点被错误重写。
- CSS 被剥离,章节看起来像纯文本。
- 脚注链接无法再前后跳转。
- 固定版式 EPUB 区段无法很好地适应更长的译文。
- 图片中的文字没有被翻译,因为它属于图片本身。
PDF 的失败模式
- 多栏文本按错误顺序读取。
- 页眉或页脚被并入正文。
- 脚注标记被挂到了错误的句子上。
- 表格在翻译后失去对齐。
- 更长的译文溢出固定文本框。
- 扫描页面产生 OCR 错误。
- 书签与翻译后的文档不匹配。
这些是完全不同的问题。这就是为什么在选择工具之前,应该先选对格式。
按使用场景选择 EPUB 还是 PDF
| 使用场景 | 更好的源文件 | 原因 |
|---|---|---|
| 用另一种语言阅读小说 | EPUB | 段落干净,阅读可重排 |
| 翻译 Kindle 电子书 | 转换后的 EPUB | Kindle 文件通常需要无 DRM 的 EPUB 工作流 |
| 翻译学术文章 | 引文、图表和版式通常都很重要 | |
| 翻译扫描版图书 | 带 OCR 的 PDF | 必须先识别扫描内容,再进行翻译 |
| 在手机上阅读 | EPUB | 可重排文本更容易阅读 |
| 保留表单 | 固定字段和页面几何关系很重要 | |
| 翻译教材 | 有 EPUB 就选 EPUB,版式复杂则选 PDF | 取决于图示、表格和公式 |
| 自行出版翻译版本 | EPUB 或原始书稿 | 你需要一个干净、可编辑的出版工作流 |
Kindle 文件还要多一步
Kindle 电子书通常不会被直接交给翻译工具。更实用的工作流是:
- 确认你拥有为预期用途翻译这本书的权利。
- 只处理无 DRM 文件,或你在法律上允许转换的文件。
- 用 Calibre 将 Kindle 文件转换为 EPUB。
- 检查 EPUB 的章节结构、目录、图片和注释。
- 翻译 EPUB。
- 将译后的文件发送回 Kindle,或在其他 EPUB 应用中阅读。
如果你的源文件是 AZW3、KFX、MOBI 或其他 Kindle 格式,请阅读完整的 Kindle 翻译工作流。
先选格式,再选翻译器
一旦你确定了正确的源格式,再来选择工具:
- 如果你的源文件是 EPUB,使用 书译的 EPUB 翻译器。
- 如果你的源文件是 PDF,使用 书译的 PDF 翻译器。
- 如果你在比较 EPUB 工具,请阅读 7 款最佳 EPUB 翻译工具。
- 如果你的 PDF 版式总是出问题,请阅读 翻译 PDF 时不丢失格式。
- 如果你的源文件是 Kindle,请遵循 Kindle 转 EPUB 工作流。
常见问题
对于翻译来说,EPUB 一定比 PDF 更好吗?
不一定。对于图书和长篇阅读,EPUB 通常更好。当固定版式很重要时,比如表单、学术论文、扫描文档、证书和版式复杂的报告,PDF 更好。
为什么 EPUB 比 PDF 更适合翻译?
EPUB 给翻译工具提供的是结构化的章节和段落。PDF 给工具提供的是固定页面位置。使用 EPUB 时,工具可以直接翻译有意义的文本单元;使用 PDF 时,工具往往必须先重建文本,再开始翻译。
我可以把 PDF 当作 EPUB 来翻译吗?
可以,前提是你先把 PDF 转成 EPUB。对于以文字为主的图书,这通常效果不错;对于扫描件、表单、多栏、表格以及页面版式很重要的文档,则效果较差。翻译前一定要先检查转换后的 EPUB。
我可以把 EPUB 当作 PDF 来翻译吗?
如果你最终需要固定版式文件,可以在翻译完成后把 EPUB 转成 PDF,但 EPUB 通常更适合作为工作格式。先翻译 EPUB,检查结果,只有当最终流程确实需要时再导出为 PDF。
哪种格式更适合 Kindle 翻译?
EPUB 通常是更好的工作格式。无 DRM 的 Kindle 文件通常可以先转换为 EPUB,翻译后再发送回 Kindle。参见 Kindle 翻译指南。
哪种格式更适合保留格式?
对于可重排的图书,EPUB 更能保留阅读结构。对于固定页面文档,PDF 更能保留原始页面设计。正确答案取决于你所说的“格式”到底是指图书结构,还是精确页面版式。
最终结论
如果目标是得到一本可读的译书,就选 EPUB。如果页面本身就是内容的一部分,就选 PDF。如果你两种格式都有,先翻译 EPUB。如果你手上只有 PDF,那就先判断它是一本可以转换的“图书型文本”,还是一个应该继续保留为 PDF 的重版式文件。
格式选择先于翻译工具选择。源格式选错了,即便 AI 模型再好,也得先和文件本身较劲。





