EPUB 与 PDF:格式、阅读体验与翻译
在选择图书格式之前,对比 EPUB 和 PDF 在重排、排版、无障碍访问、阅读设备、编辑和翻译方面的优劣。

快速解答:对于图书,EPUB 通常翻译效果更好,而当排版本身就是文档核心时,PDF 胜出
如果同一本书同时提供 EPUB 和 PDF 版本,建议选择 EPUB 进行翻译。EPUB 将章节、段落、标题、链接、图像、CSS 和目录数据存储在翻译工具能够完整保留的结构中。而 PDF 存储的是固定的页面布局,翻译工具必须先重建阅读顺序才能进行翻译。
但这并不意味着 PDF 不好。当确切的页面排版至关重要时,PDF 就是正确的源格式:学术论文、表单、证书、扫描文档、报告、手册以及包含复杂表格或图表的文档。
请遵循以下决策规则:
- 对于小说、非虚构类图书、教科书和电子书阅读:从 EPUB 翻译 开始。
- 对于固定布局文档、扫描件、表单和学术 PDF:从 PDF 翻译 开始。
- 对于 Kindle 图书:先将无 DRM 限制的 Kindle 文件转换为 EPUB,然后再翻译该 EPUB。
如果您在决定使用 EPUB 后需要工作流指导,请从免费 EPUB 翻译指南开始。如果您真正的痛点是保留 PDF 排版,请阅读如何在不丢失格式的情况下翻译 PDF。
翻译之外的 EPUB 与 PDF 对比
即使不涉及翻译,格式的选择也会改变日常的阅读体验。
| 读者需求 | EPUB | |
|---|---|---|
| 更改字体大小或字号 | 通常由阅读应用支持 | 通常缩放整个页面 |
| 在手机上舒适阅读 | 适应屏幕宽度进行重排 | 通常需要缩放和平移 |
| 保留精确的页面设计 | 不太适合可重排图书 | 强:每个读者看到的页面几何结构都完全相同 |
| 引用稳定的页码 | 位置可能会随字体和屏幕设置而改变 | 稳定的页码 |
| 使用屏幕阅读器导航 | 语义化标题和阅读顺序通常效果很好 | 很大程度上取决于标签和正确的阅读顺序 |
| 在各地打印相同的布局 | 不是首要目标 | 专为一致的打印设计 |
| 在文档工作流中进行批注 | 取决于电子书应用及其导出选项 | PDF 阅读器支持广泛 |
| 适应新脚本或更长的文本 | 重排可适应文本膨胀 | 固定的文本区域可能会溢出 |
请为适应性强的长篇阅读选择 EPUB。当页面本身就是内容的一部分时选择 PDF:例如表单、传真件、论文、带插图的手册、精心设计的报告或印刷就绪版本。没有哪种格式在所有情况下都更好;它们各自保留了不同的内容。
无障碍访问也取决于文件质量,而不是单纯取决于扩展名。结构良好的 EPUB 可以公开标题、地标、替代文本和逻辑阅读顺序。正确加标签的 PDF 也可以做到这一点,同时还能保持页面保真度。无论格式如何,生成糟糕的 EPUB 或未加标签的扫描件都无法实现良好的无障碍访问。
翻译中的 EPUB 与 PDF:决策表
| 翻译因素 | EPUB | 更好的默认选择 | |
|---|---|---|---|
| 文本提取 | 清洁的章节和段落标记 | 从定位文本中重建 | EPUB |
| 阅读顺序 | 通常在图书脊(spine)中明确定义 | 必须从页面布局中推断 | EPUB |
| 目录 | 结构化导航文件 | 可选书签或页码引用 | EPUB |
| CSS 与样式 | 可以保留单独的样式表 | 样式绑定到固定的页面位置 | EPUB |
| 图像和图注 | 图像位于内容流中 | 图像和文本共享扁平的页面画布 | 适合图书选 EPUB,适合固定页面选 PDF |
| 脚注和尾注 | 可以保留内部链接 | 注释可能依赖于页面位置 | EPUB |
| 文本膨胀 | 自然重排 | 必须放入固定的页面区域中 | EPUB |
| 扫描页面 | 通常不是源格式 | 常见的源格式,需要 OCR | |
| 表单和证书 | 不太适合 | 专为固定布局设计 | |
| 电子书阅读器体验 | 可重排且可调整 | 固定页面,在小屏幕上通常较困难 | EPUB |
| 转换风险 | 如果已经是 EPUB,通常风险很低 | PDF 转 EPUB 可能会破坏排版 | 取决于源文件 |
为什么 EPUB 通常能产生更干净的图书翻译
EPUB 更接近小型网站,而不是印刷页面。在文件内部,一书通常由 XHTML 章节文件、CSS 样式表、图像资产、元数据和导航文件组成。这种结构为翻译软件提供了清晰的图书地图。
对于翻译而言,这一点至关重要,因为工具有能力:
- 提取完整的段落,而不必猜测行属于哪里。
- 翻译章节标题和导航条目。
- 保留 CSS,而不是从头重建排版。
- 将图像保留在阅读流中。
- 保留脚注与其引用之间的链接。
- 翻译后将文件重新组装为真正的电子书。
这就是为什么 EPUB 通常是小说、叙事性非虚构作品、教科书、手册和长篇阅读的更好源格式。工具可以将精力集中在翻译质量上,而不必首先解决排版重建问题。
为什么 PDF 翻译更难
PDF 旨在保留视觉外观。它回答了一个不同的问题:“每个元素应该出现在页面的什么位置?”这对于打印和精确定位排版的文档很有用,但也带来了翻译挑战。
处理 PDF 的翻译工具可能需要推断:
- 哪些文本属于正文。
- 哪些行属于同一段落。
- 页面是单栏还是多栏。
- 某个数字是脚注标记、列表编号、页码还是表格值。
- 文本是可选中的还是扫描图像的一部分。
- 翻译后的文本变长或变短时应该放在哪里。
这些问题是可以解决的,但并非没有代价。如果输入的文本提取顺序错误,或者与页眉、页脚、注释或相邻列混合在一起,即使是强大的 AI 模型也会产生较弱的输出。
真正的翻译差异在于输入质量
AI 模型并不知道文本来自 EPUB 还是 PDF。它只看到文本。格式之所以重要,是因为它改变了到达模型的文本质量。
以下是实际的区别:
| 流水线步骤 | EPUB 风险 | PDF 风险 |
|---|---|---|
| 识别段落 | 低,因为段落带有标签 | 中,因为必须重建段落 |
| 保持阅读顺序 | 低,因为定义了章节顺序 | 在分栏、侧边栏和表格中风险中到高 |
| 保留标题 | 低,因为标题是标记 | 中,因为标题是视觉样式 |
| 保留注释 | 中(如果锚点重写不佳) | 中到高,特别是对于页面注释 |
| 处理图像 | 普通内联图像的风险低 | 当文本与图像重叠时风险中等 |
| 重排较长文本 | 低,因为 EPUB 会重排 | 高,因为 PDF 文本框是固定的 |
如果翻译后的 PDF 看起来比翻译后的 EPUB 糟糕,原因通常不是“翻译不好”,而是提取糟糕、分词(分割)糟糕或固定布局受到限制。
什么时候 EPUB 是更好的源格式
当内容主要用于连续阅读时,请选择 EPUB。
优秀的 EPUB 翻译候选对象:
- 小说和短篇小说集。
- 叙事性非虚构作品。
- 商业书籍。
- 大部分为流动文本的教科书。
- 语言学习书籍。
- 不依赖精确页面几何结构的手册。
- 转换为 EPUB 后的无 DRM 限制的 Kindle 图书。
- 专为 Kindle、Kobo、Apple Books、Google Play Books 或手机阅读而设计的书籍。
当目标语言改变文本长度时,EPUB 尤其有用。可重排的文本使翻译后的图书能够自然适应,而不会强迫每个段落塞回原始的页面框中。
如果您的源文件已经是 EPUB,请从专用的 EPUB 翻译器开始。
什么时候 PDF 是更好的源格式
当页面排版承载含义时,请选择 PDF。
优秀的 PDF 翻译候选对象:
- 包含分栏、图表、公式、引文和页码引用的学术论文。
- 需要 OCR 的扫描文档。
- 政府表单和证书。
- 页面布局至关重要的法律文件。
- 财务报告和年度报告。
- 依赖精确图表放置的手册。
- 导出为 PDF 的演示文稿。
- 读者期望实现逐页对应(page-for-page correspondence)的文档。
对于这些文件,转换为 EPUB 可能会破坏使文档有用的特性。使用具备排版感知能力的 PDF 翻译器直接翻译 PDF,然后检查表格、图表、脚注和页码引用。
翻译前应该将 PDF 转换为 EPUB 吗?
视情况而定。如果 PDF 实际上是一本被困在固定页面格式中的书,PDF 转 EPUB 的转换可以改善翻译。但如果 PDF 依赖于精确的排版,它也可能会使输出结果变得更糟。
在以下情况下,请先将 PDF 转换为 EPUB:
- PDF 是基于文本的,而不是扫描件。
- 内容主要是连续的散文。
- 您计划在电子书阅读器或手机上阅读。
- 您不需要完全精确的原始页码。
- 表格、表单、分栏和图表很少。
在以下情况下,请勿先进行转换:
- PDF 是扫描件且需要 OCR。
- 文档具有多栏学术排版。
- 页码、表单、印章或签名很重要。
- 表格、公式或图表需要精确定位。
- PDF 已经是用户期望的最终排版。
如果要转换,请使用 Calibre 或其他电子书转换工作流,然后在翻译前检查 EPUB。不要仅仅因为创建了一个文件就假定转换成功了。
10 分钟格式测试
如果不确定,请在翻译完整文档之前运行这个小测试。
- 挑选 3 个代表性部分:一个普通页面、一个带有图表或表格的页面,以及一个带有注释或链接的页面。
- 如果您同时拥有 EPUB 和 PDF 版本,请从这两种格式中翻译相同的分段。
- 在电子书阅读器或电子书应用中打开 EPUB 输出。
- 在 PDF 查看器中打开 PDF 输出。
- 检查阅读顺序、标题、注释、图像和文本溢出。
- 选择为您实际的阅读设备产生最少清理工作的格式。
对于图书,EPUB 结果通常胜出。对于以排版为重点的文档,PDF 结果通常胜出。
各格式特定的失败模式
EPUB 失败模式
- 功能薄弱的工具翻译了文本,但丢弃了 EPUB 包。
- 目录锚点重写不正确。
- CSS 被剥离,使各章节看起来像纯文本。
- 脚注链接无法正常来回跳转。
- 固定布局的 EPUB 部分无法很好地适应较长的翻译文本。
- 图像中的文本未被翻译,因为它是图像的一部分。
PDF 失败模式
- 多栏文本以错误的顺序被读取。
- 页眉或页脚被合并到正文中。
- 脚注标记附加到了错误的句子上。
- 翻译后表格失去对齐。
- 较长的翻译文本溢出固定文本框。
- 扫描页面产生 OCR 错误。
- 书签与翻译后的文档不匹配。
这些是不同的问题。这就是为什么正确的格式选择应该排在工具选择之前。
按用例分列的 EPUB 与 PDF 对比
| 用例 | 更好的源格式 | 原因 |
|---|---|---|
| 用另一种语言阅读小说 | EPUB | 干净的段落和可重排的阅读体验 |
| 翻译 Kindle 图书 | 转换后的 EPUB | Kindle 文件通常需要无 DRM 限制的 EPUB 工作流 |
| 翻译学术文章 | 引文、图表和排版通常非常重要 | |
| 翻译扫描书籍 | 带 OCR 的 PDF | 必须在翻译前识别扫描件 |
| 在手机上阅读 | EPUB | 可重排的文本更易于阅读 |
| 保留表单 | 固定字段和页面几何结构非常重要 | |
| 翻译教科书 | 如果有则选 EPUB,排版繁重则选 PDF | 取决于图表、表格和公式 |
| 自助出版翻译版本 | EPUB 或源手稿 | 您需要一个干净、可编辑的出版工作流 |
Kindle 文件多出的一个步骤
Kindle 图书通常不会直接交由翻译工具处理。实际的工作流是:
- 确保您有权为您的预期用途翻译该书。
- 仅使用无 DRM 限制的文件或您法律上允许转换的文件。
- 使用 Calibre 将 Kindle 文件转换为 EPUB。
- 检查 EPUB 的章节结构、目录、图像和注释。
- 翻译 EPUB。
- 将翻译后的文件传回 Kindle 或在其他 EPUB 应用中阅读。
如果您的源文件是 AZW3、KFX 或 MOBI 等 Kindle 格式,请首先确认您拥有无 DRM 限制的文件以及翻译权利。转换为 EPUB 是一个独立的准备步骤,而不是翻译功能。
选定格式后再选择翻译器
一旦您知道了正确的源格式,就可以选择相应的工具:
- 如果您的源文件是 EPUB,请使用 BookTranslator 的 EPUB 翻译器。
- 如果您的源文件是 PDF,请使用 BookTranslator 的 PDF 翻译器。
- 如果您在对比 EPUB 工具,请阅读7 款最佳 EPUB 翻译工具。
- 如果您的 PDF 排版不断崩溃,请阅读如何在不丢失格式的情况下翻译 PDF。
- 如果您的源文件是无 DRM 限制的 Kindle 文件,请在对比翻译工具之前准备一个有效的 EPUB。





