2026 年最佳图书翻译 LLM:我们测试了 8 个主流模型
覆盖 8 个 LLM、5 类文本和 3 个语言对的 120 次翻译测试。Claude 在中文文学文本上表现最佳,GPT-4.1 在西班牙语技术文本中并列第一。完整基准测试结果。

简短回答
最适合翻译的 LLM 取决于文本类型,而不只是模型名称。在我们的图书翻译基准测试中,Claude Sonnet 4.6 是文学散文、对话和商务语体场景下综合表现最强的选择。GPT-4.1 是技术和学术文本中最稳妥的选项。DeepSeek V3 和 Qwen3 在中文输出以及符合东亚文化语感的自然表达方面尤其强。
但这并不意味着你应该永远固定使用一个模型。随着提供商更新模型权重、路由策略、上下文限制、安全行为和解码设置,翻译质量也会发生变化。把任何“最佳翻译 LLM”的说法都视为带时间戳的基准结果,然后在做出工作流决策前,用同一套测试集重新跑一遍。
如果你想看真实的译文输出,而不是只看模型宣传,先从翻译示例库开始。如果你正在判断 LLM 翻译是否值得花这笔钱,请阅读AI 与人工图书翻译成本指南。如果你想了解完整的端到端流程,请查看图书翻译指南。
我们测试了什么
这个基准测试是为长篇文档翻译设计的,而不是短语翻译。一个在单句上表现出色的模型,在整本书上仍然可能失败,比如它会丢失人物名、在章节之间改变语气、漏掉脚注,或者加入你并未要求的译者注释。
这套测试集共覆盖 120 次翻译:
| 测试维度 | 我们纳入的内容 | 为什么重要 |
|---|---|---|
| 模型 | 8 个主流 LLM | 模型选择会改变语气、完整性和术语处理行为 |
| 文本类型 | 文学、技术、商务、日常、诗歌 | 书籍和 PDF 往往混合多种语体,而不是单一风格 |
| 语言对 | 英语翻译成中文、西班牙语和日语 | 这些语言对会暴露出语法、文化和文字系统上的不同失误模式 |
| 输出检查 | 准确性、流畅度、语气、文化适配、完整性 | 一份读起来顺畅的译文仍然可能不完整,或者过于自由 |
| 长篇检查 | 名称一致性、术语一致性、无额外注释 | 图书翻译需要文档级别的纪律性 |
下表中的模型标签反映的是本文所用基准测试快照。如果你要复现这套测试,请记录提供商、模型名称、可用时的模型版本或发布标签、API 路由、日期、提示词、temperature 以及任何系统级设置。
| 测试中的模型 | 纳入的主要原因 | 需要重点留意 |
|---|---|---|
| GPT-4.1 | 强技术类与通用翻译基线 | 在文学段落中可能偏保守 |
| Claude Sonnet 4.6 | 擅长 prose、语体和长上下文表现 | 如果提示不够谨慎,可能会把原文的粗粝风格抹平 |
| Gemini 2.5 Pro | 强势多语言通用模型 | 需要仔细检查长输出是否完整 |
| DeepSeek V3 | 中文输出能力强 | 注意是否会附加注释或额外说明 |
| Grok 3 | 广义通用 LLM 基线 | 验证长段落中的一致性 |
| Llama 4 Maverick | 开源模型对比点 | 检查术语处理和完整性 |
| Qwen3 235B | 东亚语言覆盖能力强 | 注意不同体裁下的风格漂移 |
| Mistral Large | 欧洲语言对比点 | 检查诗歌和混合文字系统段落 |
评分标准
我们评分时针对的是读者真正需要完成的翻译任务。对于图书翻译来说,仅靠 BLEU 这类相似度指标远远不够,因为一份直译输出即便和原文高度对应,也依然可能读起来很糟。
| 维度 | 1 分 | 3 分 | 5 分 |
|---|---|---|---|
| 语义准确性 | 改变或丢失原意 | 大体正确,但有轻微歧义 | 精准保留原意 |
| 流畅度 | 读起来像机器翻译 | 可以理解,但较生硬 | 在目标语言中读起来很自然 |
| 语气与语体 | 正式程度或情感层级错误 | 基本正确,但偶有不匹配 | 保留原声、体裁和目标读者定位 |
| 术语一致性 | 同一概念使用多个不同术语 | 大体一致 | 在整个片段中保持稳定 |
| 完整性 | 有遗漏、增补或截断 | 仅缺少少量细微信息 | 完整且无额外注释 |
| 格式感知 | 破坏列表、引用或对话提示 | 大体保留结构 | 保持读者的导航体验不受破坏 |
最重要的一条实务规则是:任何会加入解释、安全评论、译者注释或残留源语言内容的模型,即便译文本身很流畅,也要扣分。图书翻译流程需要的是干净输出。
按使用场景划分的结果
| 使用场景 | 本次基准测试中的最佳选择 | 次选 | 实际判断 |
|---|---|---|---|
| 文学小说 | Claude Sonnet 4.6 | DeepSeek V3 | Claude 在情感语气和可读性上的稳定性最好;DeepSeek 在译成中文时尤其强 |
| 技术与学术文本 | GPT-4.1 | Claude Sonnet 4.6 | GPT-4.1 在术语准确性上更稳,对事实性文本也更不容易过度润色 |
| 商务与正式写作 | Claude Sonnet 4.6 | GPT-4.1 | Claude 对礼貌语体和目标语言的商务表达习惯处理得很好 |
| 日常对话与社交语气 | Claude Sonnet 4.6 | Qwen3 235B | 这两者处理非正式表达的能力都优于偏直译的翻译引擎 |
| 诗歌与高度创意文本 | 中文用 DeepSeek V3,平衡性用 Claude | GPT-4.1 | 创意文本必须有人审,因为“最佳”取决于你更重视忠实翻译还是适配式翻译 |
| 整本书生产 | Claude Sonnet 4.6 或 GPT-4.1 | 取决于语言对 | 最佳生产选择,是那个能在多个章节中持续保持完整、一致且干净输出的模型 |
这不是一张放之四海而皆准的总排名表,而是一份工作流决策辅助。如果你的书是医学教材,那么诗歌场景的赢家就没有意义。如果你的书是对话密集型小说,那么一个技术上很精准但风格平板的模型,可能就是错误选择。
大多数 LLM 翻译基准测试遗漏了什么
大多数基准测试只测孤立句子。整本书会产生完全不同的问题:
- 人物名必须在各章节中保持一致。
- 虚构术语需要只有一个目标语言对应词,而不是每次都换一种译法。
- 对话必须准确体现年龄、身份和关系线索。
- 脚注、引用、图注和标题的处理方式,都应不同于正文。
- 当模型被要求翻译时,它不能总结、审查、解释或添加注释。
- 长输出必须做完成度检查,因为被截断的章节比略显生硬的句子更糟。
对于 PDF 和 EPUB 翻译来说,模型质量只是其中一层。文档处理流程还必须保留版式、阅读顺序、表格、图片、注释和导出文件结构。这就是为什么一个原始聊天窗口和一个专门的图书翻译工作流,即便底层模型相近,也会产生不同结果。
如何复现这套基准测试
如果你想为自己的翻译工作流测试模型,请使用这个方法。
1. 构建一个小型语料集
选择与你真实内容匹配的片段。一个合理的最小集合是:
| 片段类型 | 建议长度 | 应包含 |
|---|---|---|
| 文学叙述 | 500-800 词 | 场景描写、情绪、隐喻、人物声音 |
| 对话 | 300-500 词 | 打断、俚语、身份差异 |
| 技术文本 | 500-800 词 | 领域术语、单位、定义、缩写 |
| 学术 PDF 文本 | 500-800 词 | 引用、图表引用、公式引用 |
| 前置信息或销售文案 | 200-400 词 | 副标题、作者简介、图书描述 |
不要只用打磨过的营销示例。至少加入一个高难片段:密集段落、表格标题、文化特定笑点,或人名和术语反复出现的部分。
2. 固定提示词
每个模型都用同一条提示词。保持朴素:
You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.
如果一个模型需要大量提示词工程,才能避免加注释或跳过段落,这本身就是有价值的证据。生产级翻译不应该依赖脆弱的提示词。
3. 尽可能进行盲审
如果你有双语审校者,隐藏模型名称,让他们标记:
- 误译的含义
- 不自然的表达
- 术语不一致
- 语体不匹配
- 遗漏文本
- 臆造文本
- 格式或引用损坏
对于高风险项目,让领域审校者把技术术语与一般流畅度分开检查。
4. 增加长上下文检查
给短片段打分后,再测试一个完整章节或完整论文段落。检查输出里是否有:
- 重复出现的未翻译原文术语
- 前后不一致的人物名
- 缺失标题
- 重复段落
- 突然结束
- 译者评论
这一步能抓出单段基准测试发现不了的失败模式。
常见失败模式
| 失败模式 | 具体表现 | 如何发现它 |
|---|---|---|
| 过度直译 | 语法正确,但目标语言表达不自然 | 让母语审校者标出僵硬句子 |
| 过度意译 | 模型优化了风格,但改变了含义 | 将关键论点、笑点和隐喻与原文逐一对照 |
| 术语漂移 | 同一个术语被翻成多种说法 | 建立术语表并在输出中搜索 |
| 额外译者注释 | 输出中包含解释或评论 | 明确要求“只输出译文”,并拒绝带噪声的输出 |
| 截断 | 翻译在段落中途停止 | 对比章节数量和结尾文本 |
| 名称处理错误 | 人物名或作者名被翻译、本地化或改写 | 翻译后搜索每个主要名称 |
| 引用损坏 | 参考文献、日期或方括号引用发生变化 | 抽查引用和数字编号 |
最好的模型,不只是首段写得最漂亮的那个,而是后续昂贵审校问题最少的那个。
你该使用哪个模型?
使用这张决策表:
| 你的项目 | 默认模型策略 | 审校优先级 |
|---|---|---|
| 个人阅读 | 通过文档翻译器使用一个强势通用 LLM | 只检查不清楚的片段 |
| 类型小说 | 使用擅长 prose 的模型,然后抽查对话和人名 | 语感、人名、章节一致性 |
| 文学小说或诗歌 | 只把 AI 当作初稿或对照辅助 | 人工文学审读 |
| 技术手册 | 使用精确型模型,并配合术语检查清单 | 术语、警告、编号步骤 |
| 学术论文 | 使用技术精度强、且能保留 PDF 版式的模型 | 摘要、结论、公式、引用 |
| 自出版书籍 | 先用 AI,再在销售回报足以支撑的地方投入人工审校 | 开篇章节、元数据、头部评论 |
如果你正在为出版项目做预算,请把这份基准测试和图书翻译成本指南一起看。如果你想同时查看格式保留效果和翻译质量,请使用真实示例页面。
书译如何使用模型基准测试书译构建的核心,是完整翻译工作流,而不是对某个单一模型的宣传。它的实际目标,是在保留结构的同时,把 PDF 或 EPUB 转成可用的译本文档。
这意味着,模型选择只是系统中的一个环节:
- 文档必须在翻译前被正确解析。
- 章节、标题、表格、图注和脚注需要不同的处理方式。
- 必须管理长篇上下文,确保人名和术语保持一致。
- 输出必须被重建为可阅读的 PDF、EPUB、DOCX 或其他支持格式。
- 如果译文要被出版,或用于高风险场景,仍然需要人工审校。
当你需要整个流程时,请使用翻译图书。当难点在版式时,请使用PDF 翻译器。当章节结构和电子书输出更重要时,请使用EPUB 翻译器。
FAQ
什么是最适合翻译的 LLM?
在我们的图书翻译基准测试中,Claude Sonnet 4.6 是综合表现最好的模型,而 GPT-4.1 在技术与学术精度方面最强。DeepSeek V3 和 Qwen3 在中文及东亚语言输出方面也极具竞争力。不过,你的最佳选择仍然应该在你自己的内容上重新验证。
GPT 和 Claude,哪个更适合翻译?
在这套基准测试中,Claude 在文学语感、日常语气和商务语体方面更强。GPT-4.1 在技术段落中则更保守、也更精确。如果你翻译的是小说,先从 Claude 开始。如果你翻译的是技术文档或学术材料,请先用术语密集型样本对比 Claude 和 GPT-4.1,再做决定。
LLM 比 Google Translate 或 DeepL 更好吗?
对于简短、常见语言表达,传统翻译引擎依然可能很强。但对于长篇书籍、对话、文学散文和依赖上下文的段落,LLM 通常更灵活,因为它们可以利用更宽的上下文。代价是,你必须检查 LLM 输出里是否有遗漏、额外注释,以及前后一致性问题。
我可以用 ChatGPT 翻译整本书吗?
你可以在聊天界面里手动翻译一本书的部分内容,但这很容易丢失格式、上下文、章节一致性和输出组织。对于完整 PDF 或 EPUB,像 书译 这样的文档工作流更实用,因为它会处理文件解析、翻译和重建。
LLM 翻译基准测试应该多久更新一次?
每当主要模型发生变化、提供商调整路由,或你的项目类型发生变化时,都应该更新。至少也要在大额付费翻译、已出版图书上线,或高风险学术/技术使用场景之前,重新跑一次小型内部基准测试。
在信任一个模型之前,我应该测试什么?
测试一个具有代表性的片段、一个高难片段和一个长片段。检查语义、流畅度、语气、术语、完整性和格式标记。如果模型在高难片段上失败,就不要假设它在整本书里的表现会更好。





