书译
书译

2026 年最佳图书翻译 LLM:我们测试了 8 个主流模型

覆盖 8 个 LLM、5 类文本和 3 个语言对的 120 次翻译测试。Claude 在中文文学文本上表现最佳,GPT-4.1 在西班牙语技术文本中并列第一。完整基准测试结果。

BookTranslator

BookTranslator Team

19 min read

简短回答

最适合翻译的 LLM 取决于文本类型,而不只是模型名称。在我们的图书翻译基准测试中,Claude Sonnet 4.6 是文学散文、对话和商务语体场景下综合表现最强的选择。GPT-4.1 是技术和学术文本中最稳妥的选项。DeepSeek V3 和 Qwen3 在中文输出以及符合东亚文化语感的自然表达方面尤其强。

但这并不意味着你应该永远固定使用一个模型。随着提供商更新模型权重、路由策略、上下文限制、安全行为和解码设置,翻译质量也会发生变化。把任何“最佳翻译 LLM”的说法都视为带时间戳的基准结果,然后在做出工作流决策前,用同一套测试集重新跑一遍。

如果你想看真实的译文输出,而不是只看模型宣传,先从翻译示例库开始。如果你正在判断 LLM 翻译是否值得花这笔钱,请阅读AI 与人工图书翻译成本指南。如果你想了解完整的端到端流程,请查看图书翻译指南

我们测试了什么

这个基准测试是为长篇文档翻译设计的,而不是短语翻译。一个在单句上表现出色的模型,在整本书上仍然可能失败,比如它会丢失人物名、在章节之间改变语气、漏掉脚注,或者加入你并未要求的译者注释。

这套测试集共覆盖 120 次翻译:

测试维度我们纳入的内容为什么重要
模型8 个主流 LLM模型选择会改变语气、完整性和术语处理行为
文本类型文学、技术、商务、日常、诗歌书籍和 PDF 往往混合多种语体,而不是单一风格
语言对英语翻译成中文、西班牙语和日语这些语言对会暴露出语法、文化和文字系统上的不同失误模式
输出检查准确性、流畅度、语气、文化适配、完整性一份读起来顺畅的译文仍然可能不完整,或者过于自由
长篇检查名称一致性、术语一致性、无额外注释图书翻译需要文档级别的纪律性

下表中的模型标签反映的是本文所用基准测试快照。如果你要复现这套测试,请记录提供商、模型名称、可用时的模型版本或发布标签、API 路由、日期、提示词、temperature 以及任何系统级设置。

测试中的模型纳入的主要原因需要重点留意
GPT-4.1强技术类与通用翻译基线在文学段落中可能偏保守
Claude Sonnet 4.6擅长 prose、语体和长上下文表现如果提示不够谨慎,可能会把原文的粗粝风格抹平
Gemini 2.5 Pro强势多语言通用模型需要仔细检查长输出是否完整
DeepSeek V3中文输出能力强注意是否会附加注释或额外说明
Grok 3广义通用 LLM 基线验证长段落中的一致性
Llama 4 Maverick开源模型对比点检查术语处理和完整性
Qwen3 235B东亚语言覆盖能力强注意不同体裁下的风格漂移
Mistral Large欧洲语言对比点检查诗歌和混合文字系统段落

评分标准

我们评分时针对的是读者真正需要完成的翻译任务。对于图书翻译来说,仅靠 BLEU 这类相似度指标远远不够,因为一份直译输出即便和原文高度对应,也依然可能读起来很糟。

维度1 分3 分5 分
语义准确性改变或丢失原意大体正确,但有轻微歧义精准保留原意
流畅度读起来像机器翻译可以理解,但较生硬在目标语言中读起来很自然
语气与语体正式程度或情感层级错误基本正确,但偶有不匹配保留原声、体裁和目标读者定位
术语一致性同一概念使用多个不同术语大体一致在整个片段中保持稳定
完整性有遗漏、增补或截断仅缺少少量细微信息完整且无额外注释
格式感知破坏列表、引用或对话提示大体保留结构保持读者的导航体验不受破坏

最重要的一条实务规则是:任何会加入解释、安全评论、译者注释或残留源语言内容的模型,即便译文本身很流畅,也要扣分。图书翻译流程需要的是干净输出。

按使用场景划分的结果

使用场景本次基准测试中的最佳选择次选实际判断
文学小说Claude Sonnet 4.6DeepSeek V3Claude 在情感语气和可读性上的稳定性最好;DeepSeek 在译成中文时尤其强
技术与学术文本GPT-4.1Claude Sonnet 4.6GPT-4.1 在术语准确性上更稳,对事实性文本也更不容易过度润色
商务与正式写作Claude Sonnet 4.6GPT-4.1Claude 对礼貌语体和目标语言的商务表达习惯处理得很好
日常对话与社交语气Claude Sonnet 4.6Qwen3 235B这两者处理非正式表达的能力都优于偏直译的翻译引擎
诗歌与高度创意文本中文用 DeepSeek V3,平衡性用 ClaudeGPT-4.1创意文本必须有人审,因为“最佳”取决于你更重视忠实翻译还是适配式翻译
整本书生产Claude Sonnet 4.6 或 GPT-4.1取决于语言对最佳生产选择,是那个能在多个章节中持续保持完整、一致且干净输出的模型

这不是一张放之四海而皆准的总排名表,而是一份工作流决策辅助。如果你的书是医学教材,那么诗歌场景的赢家就没有意义。如果你的书是对话密集型小说,那么一个技术上很精准但风格平板的模型,可能就是错误选择。

大多数 LLM 翻译基准测试遗漏了什么

大多数基准测试只测孤立句子。整本书会产生完全不同的问题:

  • 人物名必须在各章节中保持一致。
  • 虚构术语需要只有一个目标语言对应词,而不是每次都换一种译法。
  • 对话必须准确体现年龄、身份和关系线索。
  • 脚注、引用、图注和标题的处理方式,都应不同于正文。
  • 当模型被要求翻译时,它不能总结、审查、解释或添加注释。
  • 长输出必须做完成度检查,因为被截断的章节比略显生硬的句子更糟。

对于 PDF 和 EPUB 翻译来说,模型质量只是其中一层。文档处理流程还必须保留版式、阅读顺序、表格、图片、注释和导出文件结构。这就是为什么一个原始聊天窗口和一个专门的图书翻译工作流,即便底层模型相近,也会产生不同结果。

如何复现这套基准测试

如果你想为自己的翻译工作流测试模型,请使用这个方法。

1. 构建一个小型语料集

选择与你真实内容匹配的片段。一个合理的最小集合是:

片段类型建议长度应包含
文学叙述500-800 词场景描写、情绪、隐喻、人物声音
对话300-500 词打断、俚语、身份差异
技术文本500-800 词领域术语、单位、定义、缩写
学术 PDF 文本500-800 词引用、图表引用、公式引用
前置信息或销售文案200-400 词副标题、作者简介、图书描述

不要只用打磨过的营销示例。至少加入一个高难片段:密集段落、表格标题、文化特定笑点,或人名和术语反复出现的部分。

2. 固定提示词

每个模型都用同一条提示词。保持朴素:

You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.

如果一个模型需要大量提示词工程,才能避免加注释或跳过段落,这本身就是有价值的证据。生产级翻译不应该依赖脆弱的提示词。

3. 尽可能进行盲审

如果你有双语审校者,隐藏模型名称,让他们标记:

  • 误译的含义
  • 不自然的表达
  • 术语不一致
  • 语体不匹配
  • 遗漏文本
  • 臆造文本
  • 格式或引用损坏

对于高风险项目,让领域审校者把技术术语与一般流畅度分开检查。

4. 增加长上下文检查

给短片段打分后,再测试一个完整章节或完整论文段落。检查输出里是否有:

  • 重复出现的未翻译原文术语
  • 前后不一致的人物名
  • 缺失标题
  • 重复段落
  • 突然结束
  • 译者评论

这一步能抓出单段基准测试发现不了的失败模式。

常见失败模式

失败模式具体表现如何发现它
过度直译语法正确,但目标语言表达不自然让母语审校者标出僵硬句子
过度意译模型优化了风格,但改变了含义将关键论点、笑点和隐喻与原文逐一对照
术语漂移同一个术语被翻成多种说法建立术语表并在输出中搜索
额外译者注释输出中包含解释或评论明确要求“只输出译文”,并拒绝带噪声的输出
截断翻译在段落中途停止对比章节数量和结尾文本
名称处理错误人物名或作者名被翻译、本地化或改写翻译后搜索每个主要名称
引用损坏参考文献、日期或方括号引用发生变化抽查引用和数字编号

最好的模型,不只是首段写得最漂亮的那个,而是后续昂贵审校问题最少的那个。

你该使用哪个模型?

使用这张决策表:

你的项目默认模型策略审校优先级
个人阅读通过文档翻译器使用一个强势通用 LLM只检查不清楚的片段
类型小说使用擅长 prose 的模型,然后抽查对话和人名语感、人名、章节一致性
文学小说或诗歌只把 AI 当作初稿或对照辅助人工文学审读
技术手册使用精确型模型,并配合术语检查清单术语、警告、编号步骤
学术论文使用技术精度强、且能保留 PDF 版式的模型摘要、结论、公式、引用
自出版书籍先用 AI,再在销售回报足以支撑的地方投入人工审校开篇章节、元数据、头部评论

如果你正在为出版项目做预算,请把这份基准测试和图书翻译成本指南一起看。如果你想同时查看格式保留效果和翻译质量,请使用真实示例页面

书译如何使用模型基准测试书译构建的核心,是完整翻译工作流,而不是对某个单一模型的宣传。它的实际目标,是在保留结构的同时,把 PDF 或 EPUB 转成可用的译本文档。

这意味着,模型选择只是系统中的一个环节:

  • 文档必须在翻译前被正确解析。
  • 章节、标题、表格、图注和脚注需要不同的处理方式。
  • 必须管理长篇上下文,确保人名和术语保持一致。
  • 输出必须被重建为可阅读的 PDF、EPUB、DOCX 或其他支持格式。
  • 如果译文要被出版,或用于高风险场景,仍然需要人工审校。

当你需要整个流程时,请使用翻译图书。当难点在版式时,请使用PDF 翻译器。当章节结构和电子书输出更重要时,请使用EPUB 翻译器

FAQ

什么是最适合翻译的 LLM?

在我们的图书翻译基准测试中,Claude Sonnet 4.6 是综合表现最好的模型,而 GPT-4.1 在技术与学术精度方面最强。DeepSeek V3 和 Qwen3 在中文及东亚语言输出方面也极具竞争力。不过,你的最佳选择仍然应该在你自己的内容上重新验证。

GPT 和 Claude,哪个更适合翻译?

在这套基准测试中,Claude 在文学语感、日常语气和商务语体方面更强。GPT-4.1 在技术段落中则更保守、也更精确。如果你翻译的是小说,先从 Claude 开始。如果你翻译的是技术文档或学术材料,请先用术语密集型样本对比 Claude 和 GPT-4.1,再做决定。

LLM 比 Google Translate 或 DeepL 更好吗?

对于简短、常见语言表达,传统翻译引擎依然可能很强。但对于长篇书籍、对话、文学散文和依赖上下文的段落,LLM 通常更灵活,因为它们可以利用更宽的上下文。代价是,你必须检查 LLM 输出里是否有遗漏、额外注释,以及前后一致性问题。

我可以用 ChatGPT 翻译整本书吗?

你可以在聊天界面里手动翻译一本书的部分内容,但这很容易丢失格式、上下文、章节一致性和输出组织。对于完整 PDF 或 EPUB,像 书译 这样的文档工作流更实用,因为它会处理文件解析、翻译和重建。

LLM 翻译基准测试应该多久更新一次?

每当主要模型发生变化、提供商调整路由,或你的项目类型发生变化时,都应该更新。至少也要在大额付费翻译、已出版图书上线,或高风险学术/技术使用场景之前,重新跑一次小型内部基准测试。

在信任一个模型之前,我应该测试什么?

测试一个具有代表性的片段、一个高难片段和一个长片段。检查语义、流畅度、语气、术语、完整性和格式标记。如果模型在高难片段上失败,就不要假设它在整本书里的表现会更好。

相关文章