如何为翻译准备图书文件
通过冻结源版本、清理修订、盘点资产、定义术语以及建立可验证的验收基准,为 EPUB、DOCX 或 PDF 的翻译做好准备。

通过创建一个冻结的、完整的源文件包和验收基准来为图书翻译做好准备。解决修订问题,明确哪些内容应该翻译、哪些不应该翻译,盘点章节和资产,定义名称和术语,并选择能够在目标语言中保留所需结构的源格式。
不要从名为 final-final-2.docx 的文件开始,然后在事后解释缺失的决策。翻译会将源文件的歧义放大到每一种目标语言中。
使用此行前检查清单:
- 冻结准确的源版本。
- 删除或刻意保留批注、修订以及隐藏内容。
- 选择最佳源格式。
- 盘点前言、正文、后记、注释、图片和表格。
- 标记可翻译内容和不可翻译内容。
- 建立初始术语和实体列表。
- 打包字体、图片源、参考文献和说明。
- 记录字数统计和具有代表性的测试段落。
- 定义使翻译文件合格的标准。
下载 图书翻译源文件行前检查模板并在上传完整文件或将其交给译者之前完成填写。
冻结一个权威的源版本
创建包含以下内容的源记录:
- 标题和副标题;
- 作者和版本;
- 源语言;
- 文件名和修订版;
- 日期已冻结;
- 章节和节数;
- 字数或其他稳定的内容基准;
- 包含的前言和后记;以及
- 有权批准源内容更改的负责人。
将后续的更正记录在变更日志中。每条记录都应指明源位置、旧内容、新内容、更改原因、日期以及受影响的目标版本。在翻译进行期间,请勿覆盖冻结的源内容。
如果您无法说明哪个文件具有权威性,请停止操作。翻译团队无法协调您尚未区分的不同版本。
解决批注、修订和隐藏内容
对于 DOCX 手稿,请决定是接受还是拒绝每一个修订插入或删除,以及批注是否应包含在翻译包中。隐藏标记并不等于移除。微软当前的 Word 指南指出,必须接受或拒绝修订以将其移除;“无标记”视图只是将其暂时隐藏。
当编辑历史有用时,请创建两个文件:
- 一个带有已解决文本的纯净翻译源文件;以及
- 一个保留了批注或修订历史的只读参考副本。
同时检查隐藏文本、文档属性、页眉、页脚、脚注、尾注、文本框、替代文本和嵌入对象。如果文件包含私密或未公开的材料,请在共享或上传前运行文档翻译隐私检查清单。
根据结构而非便利性来选择源格式
| 可用源 | 适用场景 | 翻译前准备 | 主要局限性 |
|---|---|---|---|
| EPUB | 书籍具有可重排性且章节结构很重要 | 验证包、目录、语言元数据、链接、注释和图像 | 固定排版或不寻常的 CSS 可能需要单独测试 |
| DOCX | 手稿可编辑且样式、表格或批注很重要 | 解决修订、规范化样式、检查文本框和页眉 | 它不是最终的电子书阅读器或印刷成品 |
| 基于文本的 PDF | PDF 是权威的固定排版源 | 验证可选择的文本、阅读顺序、字体和页面清单 | 编辑和图像文本可能很困难 |
| 扫描版 PDF | 不存在更好的源 | 在代表性页面上运行 OCR 并记录识别风险 | OCR 输出重构的是内容而不是确切的布局 |
使用您获权使用的最上游可编辑源,并保留显示预期外观的参考导出。在翻译之前将干净的 EPUB 或 DOCX 转换为 PDF 通常会丢弃有用的结构。
对于纯图像材料,请在将 OCR 文本视为源之前使用扫描版 PDF 翻译预检。
清点整本书,而不仅仅是正文章节
列出每个内容单元及其预期的处理方式:
- 封面文字;
- 书名页和版权页;
- 献词、题词和致谢;
- 目录;
- 引言与前言;
- 正文章节;
- 表格、图表、说明文字以及图片内部文本;
- 脚注与尾注;
- 参考书目与引用;
- 附录、术语表与索引;
- 作者简介与行动呼吁;以及
- 正文文件外部处理的元数据与商店描述。
为每个章节、图表、表格和注释分配一个稳定的 ID。记录它是可翻译的、保留的、替换的、重新创建的还是排除的。缺失的附录应该在资产清单中可见,以免在目标语言中变成无声的遗漏。
对于 EPUB,W3C 规范要求将出版物资源列在包清单中,并使用包元数据来提供标题和作者等信息。EPUB 3.3 规范 在这里非常有用,因为包是一个结构化的出版物,而不是一个可互换的文本文档文件夹。
标记不应翻译的内容
为以下项目创建一个不翻译列表:
- 保持批准形式不变的作者和贡献者姓名;
- 商标与产品名称;
- URL、电子邮箱地址、标识符与 ISBN;
- 代码、命令、文件路径与公式;
- 必须保留源形式的被引用标题;
- 等待编辑决定的自造词;以及
- 应使用现有授权译文的引文。
为每个项目添加原因和上下文。“DNT”(不翻译)如果没有解释,可能会保留错误的字符串或压制读者实际需要翻译的内容。
W3C 国际化标签集包含关于内容是否应被翻译、术语以及上下文信息的数据类别。其ITS 2.0 要求阐明了其核心原则:可译性和上下文是显式的元数据,而不是留给每个译者去猜测的内容。
建立最初的术语和实体清单
不要等到第 12 章才决定如何处理某个重复出现的名称或概念。从以下内容开始:
- 人物、地点、组织和产品名称;
- 头衔和尊称;
- 定义的专业或学术术语;
- 自创词汇;
- 缩写;
- 重复出现的界面或操作标签;
- 计量单位和度量规范;以及
- 根据上下文故意改变的术语。
对于每个条目,应包含源文形式、定义或上下文、已知的首选目标文形式、排除的变体、大写或变格规则、首次出现的位置以及决策负责人。
初始清单不需要预测每个术语,其目的是防止明显的词义漂移,并为记录后续决策提供一个地方。使用书籍术语一致性模板作为工作资产。
打包外部资源和版权信息
书籍文件可能会依赖未完全嵌入的材料:
- 高分辨率图像源文件;
- 可编辑的图表;
- 字体文件和许可记录;
- 封面艺术品和文本图层;
- 链接的媒体;
- 现有获批的译文;
- 引文、歌词或图片的授权许可;以及
- 样式指南或出版商规范。
不要假定发布源文件的权限自动涵盖每个市场的翻译版本。对于将要复制或改编的材料,请记录版权所有者和批准的授权范围。
对于字体,请在翻译前确定目标脚本。纯拉丁文字体在源文件中可能看起来很好,但对于阿拉伯语、日语或天城文输出则完全无法使用。提供授权字体或批准的备选字体,而不是让制作团队在翻译后临时拼凑。
建立一个能够使遗漏内容被检测出来的基准
在翻译前记录实际数量:
- 章节和小节;
- 按级别划分的标题;
- 当格式公开时,段落或文本块;
- 图表、表格、标题、注释和链接;
- 目录条目;
- 前言和后记组件;以及
- 源语言字数作为参考,而非目标语言的相等规则。
目标字数会因语言而异,因此不要仅仅因为翻译变长而拒绝它。利用字数统计来查找丢失、重复或意外为空的结构。
对于 EPUB,请在源文件上运行一致性检查。EPUBCheck由 DAISY 联盟代表 W3C 维护,用于检查 EPUB 一致性。在翻译前修复源包错误可以防止对翻译过程是否产生这些错误产生混淆。
在完整翻译之前选择具有代表性的段落
选择一小批测试包,以揭示该书真正的难点:
- 开篇散文;
- 对话或语气较重的段落;
- 专业术语密集的章节;
- 表格、图表、脚注或交叉引用;
- 长段落和简短的碎片化文本;
- 具有文化特定性或含糊不清的段落;以及
- 用于测试与早期决策连贯性的后期章节。
使用相同的样本包来对比工作流并建立风格指南。不要让供应商或工具仅凭最简单的第一页来证明质量。
这项测试并不是在断言整本书的表现会完全一致。而是在扩大规模之前,以低成本排除糟糕的源格式、术语表或审校流程的一种方法。
在翻译开始前定义验收标准
写明:
- 目标语言和区域设置;
- 预期用途:私人阅读、编辑草稿、内部研究或出版;
- 输出格式;
- 所需的双语版本或仅目标语言版本;
- 批准的名称和术语;
- 必须保持可用性的结构;
- 预期的的人工审校;
- 缺陷严重程度与升级规则;以及
- 谁来批准语言、主题内容和最终制作。
如果目标是公开发行,则需包含母语润色和最终格式校对。如果目标是个人阅读,完整性和可理解的含义可能就足够了。图书翻译质量保证检查清单 可以作为完成后的目标文档的验收日志。
BookTranslator 的适用场景
一旦源文件包稳定,通过 BookTranslator 工作流 上传完整且支持的文件。EPUB、PDF 和 DOCX 需要不同的检查,因此在投入完整的审校计划之前,请先翻译具代表性的测试样本包或检查困难的章节。使用自动术语表处理重复出现的名称和术语,并在支持的地方使用双语输出来检查重要段落。
BookTranslator 不会解决源文件中的歧义、批准版权、授权字体,也不会决定哪些修订应包含在书中。这些属于源文件准备阶段的决策。对于扫描版 PDF,OCR 模式优先保证可恢复的翻译内容,而不是完全复刻原始页面。
最终源文件包关卡
只有在满足以下条件时,图书才可以开始翻译:
- 确定一个权威的源版本并将其冻结;
- 解决修订、评论、隐藏内容和排除项;
- 选择最佳的可用 EPUB、DOCX、PDF 或 OCR 路径;
- 为每个章节、资产、注释和后记内容制定处理方案;
- 明确 DNT(不翻译)和术语决策的负责人;
- 打包源资源、字体、参考资料和版权信息;
- 记录结构计数和具代表性的段落;以及
- 明确目标语言区域、预期用途、输出、审查深度和验收标准。
良好的源文件准备并不能保证翻译质量完美。它消除了可避免的歧义,并在内容丢失时为审阅者提供依据。





