书译
书译

EPUB 与 PDF:格式、阅读体验与翻译

在选择图书格式之前,对比 EPUB 和 PDF 在重排、排版、无障碍访问、阅读设备、编辑和翻译方面的优劣。

BookTranslator

BookTranslator Team

18 min read

快速解答:对于图书,EPUB 通常翻译效果更好,而当排版本身就是文档核心时,PDF 胜出

如果同一本书同时提供 EPUB 和 PDF 版本,建议选择 EPUB 进行翻译。EPUB 将章节、段落、标题、链接、图像、CSS 和目录数据存储在翻译工具能够完整保留的结构中。而 PDF 存储的是固定的页面布局,翻译工具必须先重建阅读顺序才能进行翻译。

但这并不意味着 PDF 不好。当确切的页面排版至关重要时,PDF 就是正确的源格式:学术论文、表单、证书、扫描文档、报告、手册以及包含复杂表格或图表的文档。

请遵循以下决策规则:

  • 对于小说、非虚构类图书、教科书和电子书阅读:从 EPUB 翻译 开始。
  • 对于固定布局文档、扫描件、表单和学术 PDF:从 PDF 翻译 开始。
  • 对于 Kindle 图书:先将无 DRM 限制的 Kindle 文件转换为 EPUB,然后再翻译该 EPUB。

如果您在决定使用 EPUB 后需要工作流指导,请从免费 EPUB 翻译指南开始。如果您真正的痛点是保留 PDF 排版,请阅读如何在不丢失格式的情况下翻译 PDF

翻译之外的 EPUB 与 PDF 对比

即使不涉及翻译,格式的选择也会改变日常的阅读体验。

读者需求EPUBPDF
更改字体大小或字号通常由阅读应用支持通常缩放整个页面
在手机上舒适阅读适应屏幕宽度进行重排通常需要缩放和平移
保留精确的页面设计不太适合可重排图书强:每个读者看到的页面几何结构都完全相同
引用稳定的页码位置可能会随字体和屏幕设置而改变稳定的页码
使用屏幕阅读器导航语义化标题和阅读顺序通常效果很好很大程度上取决于标签和正确的阅读顺序
在各地打印相同的布局不是首要目标专为一致的打印设计
在文档工作流中进行批注取决于电子书应用及其导出选项PDF 阅读器支持广泛
适应新脚本或更长的文本重排可适应文本膨胀固定的文本区域可能会溢出

请为适应性强的长篇阅读选择 EPUB。当页面本身就是内容的一部分时选择 PDF:例如表单、传真件、论文、带插图的手册、精心设计的报告或印刷就绪版本。没有哪种格式在所有情况下都更好;它们各自保留了不同的内容。

无障碍访问也取决于文件质量,而不是单纯取决于扩展名。结构良好的 EPUB 可以公开标题、地标、替代文本和逻辑阅读顺序。正确加标签的 PDF 也可以做到这一点,同时还能保持页面保真度。无论格式如何,生成糟糕的 EPUB 或未加标签的扫描件都无法实现良好的无障碍访问。

翻译中的 EPUB 与 PDF:决策表

翻译因素EPUBPDF更好的默认选择
文本提取清洁的章节和段落标记从定位文本中重建EPUB
阅读顺序通常在图书脊(spine)中明确定义必须从页面布局中推断EPUB
目录结构化导航文件可选书签或页码引用EPUB
CSS 与样式可以保留单独的样式表样式绑定到固定的页面位置EPUB
图像和图注图像位于内容流中图像和文本共享扁平的页面画布适合图书选 EPUB,适合固定页面选 PDF
脚注和尾注可以保留内部链接注释可能依赖于页面位置EPUB
文本膨胀自然重排必须放入固定的页面区域中EPUB
扫描页面通常不是源格式常见的源格式,需要 OCRPDF
表单和证书不太适合专为固定布局设计PDF
电子书阅读器体验可重排且可调整固定页面,在小屏幕上通常较困难EPUB
转换风险如果已经是 EPUB,通常风险很低PDF 转 EPUB 可能会破坏排版取决于源文件

为什么 EPUB 通常能产生更干净的图书翻译

EPUB 更接近小型网站,而不是印刷页面。在文件内部,一书通常由 XHTML 章节文件、CSS 样式表、图像资产、元数据和导航文件组成。这种结构为翻译软件提供了清晰的图书地图。

对于翻译而言,这一点至关重要,因为工具有能力:

  • 提取完整的段落,而不必猜测行属于哪里。
  • 翻译章节标题和导航条目。
  • 保留 CSS,而不是从头重建排版。
  • 将图像保留在阅读流中。
  • 保留脚注与其引用之间的链接。
  • 翻译后将文件重新组装为真正的电子书。

这就是为什么 EPUB 通常是小说、叙事性非虚构作品、教科书、手册和长篇阅读的更好源格式。工具可以将精力集中在翻译质量上,而不必首先解决排版重建问题。

为什么 PDF 翻译更难

PDF 旨在保留视觉外观。它回答了一个不同的问题:“每个元素应该出现在页面的什么位置?”这对于打印和精确定位排版的文档很有用,但也带来了翻译挑战。

处理 PDF 的翻译工具可能需要推断:

  • 哪些文本属于正文。
  • 哪些行属于同一段落。
  • 页面是单栏还是多栏。
  • 某个数字是脚注标记、列表编号、页码还是表格值。
  • 文本是可选中的还是扫描图像的一部分。
  • 翻译后的文本变长或变短时应该放在哪里。

这些问题是可以解决的,但并非没有代价。如果输入的文本提取顺序错误,或者与页眉、页脚、注释或相邻列混合在一起,即使是强大的 AI 模型也会产生较弱的输出。

真正的翻译差异在于输入质量

AI 模型并不知道文本来自 EPUB 还是 PDF。它只看到文本。格式之所以重要,是因为它改变了到达模型的文本质量。

以下是实际的区别:

流水线步骤EPUB 风险PDF 风险
识别段落低,因为段落带有标签中,因为必须重建段落
保持阅读顺序低,因为定义了章节顺序在分栏、侧边栏和表格中风险中到高
保留标题低,因为标题是标记中,因为标题是视觉样式
保留注释中(如果锚点重写不佳)中到高,特别是对于页面注释
处理图像普通内联图像的风险低当文本与图像重叠时风险中等
重排较长文本低,因为 EPUB 会重排高,因为 PDF 文本框是固定的

如果翻译后的 PDF 看起来比翻译后的 EPUB 糟糕,原因通常不是“翻译不好”,而是提取糟糕、分词(分割)糟糕或固定布局受到限制。

什么时候 EPUB 是更好的源格式

当内容主要用于连续阅读时,请选择 EPUB。

优秀的 EPUB 翻译候选对象:

  • 小说和短篇小说集。
  • 叙事性非虚构作品。
  • 商业书籍。
  • 大部分为流动文本的教科书。
  • 语言学习书籍。
  • 不依赖精确页面几何结构的手册。
  • 转换为 EPUB 后的无 DRM 限制的 Kindle 图书。
  • 专为 Kindle、Kobo、Apple Books、Google Play Books 或手机阅读而设计的书籍。

当目标语言改变文本长度时,EPUB 尤其有用。可重排的文本使翻译后的图书能够自然适应,而不会强迫每个段落塞回原始的页面框中。

如果您的源文件已经是 EPUB,请从专用的 EPUB 翻译器开始。

什么时候 PDF 是更好的源格式

当页面排版承载含义时,请选择 PDF。

优秀的 PDF 翻译候选对象:

  • 包含分栏、图表、公式、引文和页码引用的学术论文。
  • 需要 OCR 的扫描文档。
  • 政府表单和证书。
  • 页面布局至关重要的法律文件。
  • 财务报告和年度报告。
  • 依赖精确图表放置的手册。
  • 导出为 PDF 的演示文稿。
  • 读者期望实现逐页对应(page-for-page correspondence)的文档。

对于这些文件,转换为 EPUB 可能会破坏使文档有用的特性。使用具备排版感知能力的 PDF 翻译器直接翻译 PDF,然后检查表格、图表、脚注和页码引用。

翻译前应该将 PDF 转换为 EPUB 吗?

视情况而定。如果 PDF 实际上是一本被困在固定页面格式中的书,PDF 转 EPUB 的转换可以改善翻译。但如果 PDF 依赖于精确的排版,它也可能会使输出结果变得更糟。

在以下情况下,请先将 PDF 转换为 EPUB:

  • PDF 是基于文本的,而不是扫描件。
  • 内容主要是连续的散文。
  • 您计划在电子书阅读器或手机上阅读。
  • 您不需要完全精确的原始页码。
  • 表格、表单、分栏和图表很少。

在以下情况下,请勿先进行转换:

  • PDF 是扫描件且需要 OCR。
  • 文档具有多栏学术排版。
  • 页码、表单、印章或签名很重要。
  • 表格、公式或图表需要精确定位。
  • PDF 已经是用户期望的最终排版。

如果要转换,请使用 Calibre 或其他电子书转换工作流,然后在翻译前检查 EPUB。不要仅仅因为创建了一个文件就假定转换成功了。

10 分钟格式测试

如果不确定,请在翻译完整文档之前运行这个小测试。

  1. 挑选 3 个代表性部分:一个普通页面、一个带有图表或表格的页面,以及一个带有注释或链接的页面。
  2. 如果您同时拥有 EPUB 和 PDF 版本,请从这两种格式中翻译相同的分段。
  3. 在电子书阅读器或电子书应用中打开 EPUB 输出。
  4. 在 PDF 查看器中打开 PDF 输出。
  5. 检查阅读顺序、标题、注释、图像和文本溢出。
  6. 选择为您实际的阅读设备产生最少清理工作的格式。

对于图书,EPUB 结果通常胜出。对于以排版为重点的文档,PDF 结果通常胜出。

各格式特定的失败模式

EPUB 失败模式

  • 功能薄弱的工具翻译了文本,但丢弃了 EPUB 包。
  • 目录锚点重写不正确。
  • CSS 被剥离,使各章节看起来像纯文本。
  • 脚注链接无法正常来回跳转。
  • 固定布局的 EPUB 部分无法很好地适应较长的翻译文本。
  • 图像中的文本未被翻译,因为它是图像的一部分。

PDF 失败模式

  • 多栏文本以错误的顺序被读取。
  • 页眉或页脚被合并到正文中。
  • 脚注标记附加到了错误的句子上。
  • 翻译后表格失去对齐。
  • 较长的翻译文本溢出固定文本框。
  • 扫描页面产生 OCR 错误。
  • 书签与翻译后的文档不匹配。

这些是不同的问题。这就是为什么正确的格式选择应该排在工具选择之前。

按用例分列的 EPUB 与 PDF 对比

用例更好的源格式原因
用另一种语言阅读小说EPUB干净的段落和可重排的阅读体验
翻译 Kindle 图书转换后的 EPUBKindle 文件通常需要无 DRM 限制的 EPUB 工作流
翻译学术文章PDF引文、图表和排版通常非常重要
翻译扫描书籍带 OCR 的 PDF必须在翻译前识别扫描件
在手机上阅读EPUB可重排的文本更易于阅读
保留表单PDF固定字段和页面几何结构非常重要
翻译教科书如果有则选 EPUB,排版繁重则选 PDF取决于图表、表格和公式
自助出版翻译版本EPUB 或源手稿您需要一个干净、可编辑的出版工作流

Kindle 文件多出的一个步骤

Kindle 图书通常不会直接交由翻译工具处理。实际的工作流是:

  1. 确保您有权为您的预期用途翻译该书。
  2. 仅使用无 DRM 限制的文件或您法律上允许转换的文件。
  3. 使用 Calibre 将 Kindle 文件转换为 EPUB。
  4. 检查 EPUB 的章节结构、目录、图像和注释。
  5. 翻译 EPUB。
  6. 将翻译后的文件传回 Kindle 或在其他 EPUB 应用中阅读。

如果您的源文件是 AZW3、KFX 或 MOBI 等 Kindle 格式,请首先确认您拥有无 DRM 限制的文件以及翻译权利。转换为 EPUB 是一个独立的准备步骤,而不是翻译功能。

选定格式后再选择翻译器

一旦您知道了正确的源格式,就可以选择相应的工具:

相关文章