書譯
書譯

2026 年最佳書籍翻譯 LLM:我們測試了 8 款領先模型

涵蓋 8 款 LLM、5 種文本類型與 3 組語言對的 120 次翻譯測試。Claude 在文學中文表現最佳,GPT-4.1 在技術西班牙文並列第一。完整基準結果如下。

BookTranslator

BookTranslator Team

19 min read

簡短答案

最適合翻譯的 LLM 取決於文本類型,不只是模型名稱而已。在我們的書籍翻譯基準測試中,Claude Sonnet 4.6 是文學散文、對話與商務語體最全面的選擇。GPT-4.1 則是技術與學術內容最穩妥的選項。DeepSeek V3 與 Qwen3 在中文輸出,以及符合東亞文化語感的自然表達上尤其出色。

但這不代表你應該永遠固定使用同一個模型。當供應商更新模型權重、路由方式、上下文限制、安全行為與解碼設定時,翻譯品質都可能改變。把任何「最佳翻譯 LLM」的說法都視為帶有時間戳記的基準結果,然後在做出工作流程決策前,用同一套測試集重新跑一次。

如果你想先看實際翻譯輸出,而不是模型宣稱,先從翻譯範例庫開始。如果你在判斷 LLM 翻譯是否值得這筆成本,請閱讀AI 與人工書籍翻譯成本指南。若想了解完整的端到端流程,請看書籍翻譯指南

我們測了什麼

這項基準測試是為了長篇文件翻譯而設計,不是短句翻譯。一個模型即使在單句上表現不錯,到了整本書仍可能失敗:它可能遺失角色名稱、在章節之間改變語氣、漏掉註腳,或加入你根本沒要求的譯者註解。

測試集共涵蓋 120 次翻譯:

測試維度我們納入的內容為何重要
模型8 款領先 LLM模型選擇會改變語氣、完整性與術語處理方式
文本類型文學、技術、商務、口語、詩歌書籍與 PDF 會混雜多種語體,不會只有單一風格
語言對英文譯為中文、西班牙文與日文這些語言對會暴露文法、文化與文字系統上的不同失誤模式
輸出檢查準確性、流暢度、語氣、文化調適、完整性可讀的譯文仍可能不完整,或改寫得過於自由
長文檢查名稱一致性、術語一致性、不得添加註解書籍翻譯需要文件層級的紀律

下方的模型標籤反映的是本文所用的基準快照。如果你要重做這個基準,請記錄供應商、模型名稱、模型版本或發布標籤(若有)、API 路徑、日期、提示詞、temperature,以及任何系統層級設定。

測試模型納入的主要原因需要注意的地方
GPT-4.1強勁的技術與通用翻譯基準在文學段落中可能偏保守
Claude Sonnet 4.6擅長散文、語體與長上下文表現若提示不夠謹慎,可能把原文較粗礪的風格修飾得太平順
Gemini 2.5 Pro強勁的多語通用模型請仔細檢查長輸出的完成度
DeepSeek V3強勁的中文輸出注意是否加入註解或額外評論
Grok 3廣泛的通用 LLM 基準驗證長段落的一致性
Llama 4 Maverick開放模型對照點檢查術語與完整性
Qwen3 235B東亞語言覆蓋強注意不同文類之間的風格漂移
Mistral Large歐洲語言對照點檢查詩歌與混合文字系統段落

評分標準

我們評分時,對照的是讀者真正需要完成的翻譯任務。對書籍翻譯而言,BLEU 類相似度並不足夠,因為過度直譯的輸出即使對得上原文,讀起來仍可能很糟。

評分項目1 分3 分5 分
意義準確度改變或遺失意思大致正確但有些微歧義精確保留原意
流暢度聽起來像機器翻譯可理解但生硬在目標語言中讀起來自然
語氣與語體正式程度或情感層級錯誤大致正確但偶有不符保留原文聲音、文類與讀者對象
術語一致性同一概念使用不同譯法大致一致在整段文本中穩定一致
完整性遺漏、增補或截斷內容僅缺少少量細微資訊完整且沒有額外註解
格式意識破壞列表、引文或對話提示大多保留結構保持讀者的閱讀導航完整

最重要的實務規則是:任何模型只要加入解釋、安全評論、譯者註解,或殘留來源語言內容,即使譯文本身流暢,也要扣分。書籍翻譯管線需要乾淨的輸出。

各使用情境結果

使用情境本次基準最適合的選擇次佳選擇實務判斷
文學小說Claude Sonnet 4.6DeepSeek V3Claude 在情感語氣與可讀風格上表現最穩定;DeepSeek 在譯入中文時尤其出色
技術與學術文本GPT-4.1Claude Sonnet 4.6GPT-4.1 的術語更精確,也較不容易過度修飾事實性散文
商務與正式寫作Claude Sonnet 4.6GPT-4.1Claude 對禮貌語體與目標語言的商務慣例處理良好
口語對話與社交語氣Claude Sonnet 4.6Qwen3 235B兩者處理非正式表達的能力都優於偏直譯的翻譯引擎
詩歌與高度創意文本中文選 DeepSeek V3,均衡性選 ClaudeGPT-4.1創意內容需要人工審閱,因為「最佳」取決於你更重視忠實還是改編式翻譯
全書生產Claude Sonnet 4.6 或 GPT-4.1取決於語言對最佳的實務選擇,是能在多個章節中持續保持完整、一致且乾淨的模型

這不是放諸四海皆準的排行榜,而是幫助你做工作流程決策的參考工具。如果你的書是醫學教科書,詩歌項目的優勝者就毫無意義。如果你的書是大量依賴對話的小說,那麼技術上精確但風格扁平的模型,可能就是錯的選擇。

多數 LLM 翻譯基準忽略了什麼

多數基準測的是孤立句子。整本書會產生完全不同的問題:

  • 角色名稱必須在各章之間保持一致。
  • 虛構術語需要固定的目標語言對應,不是每次都換一個譯法。
  • 對話必須帶出正確的年齡感、身分層級與關係線索。
  • 註腳、引文、圖說與標題,都需要與正文不同的處理方式。
  • 當要求模型翻譯時,它不應摘要、刪改、解釋或加入註解。
  • 較長輸出需要完成度檢查,因為被截斷的一章比稍微生硬的一句還糟糕。

對 PDF 與 EPUB 翻譯來說,模型品質只是其中一層。文件管線還必須保留版面、閱讀順序、表格、圖片、註解與匯出後的檔案結構。這也是為什麼單純的聊天視窗,和專用的書籍翻譯工作流程,即使底層用的是相近模型,結果仍會不同。

如何重現這份基準

如果你想為自己的翻譯工作流程測試模型,請使用這個方法。

1. 建立小型語料集

選擇與你真實內容相符的段落。最低限度可用以下組合:

段落類型建議長度包含內容
文學散文500-800 字描寫、情緒、隱喻、角色口吻
對話300-500 字插話、俚語、身分差異
技術文本500-800 字領域術語、單位、定義、縮寫
學術 PDF 文本500-800 字引文、圖表引用、公式引用
書前資料或銷售文案200-400 字副標題、作者簡介、書籍介紹

不要只用修飾過的行銷範例。至少加入一段難題文本:密集段落、表格圖說、具文化特定性的笑話,或一段名稱與術語反覆出現的內容。

2. 固定提示詞

每個模型都用同一個提示詞,越樸素越好:

You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.

如果某個模型需要大量提示工程,才能避免加註解或跳過段落,這本身就是有用證據。生產級翻譯不應依賴脆弱的提示詞。

3. 盡量做盲審

如果你有雙語審稿者,請把模型名稱遮住,請他們標記:

  • 意義誤譯
  • 不自然表述
  • 術語不一致
  • 語體不匹配
  • 遺漏文本
  • 憑空添加的文本
  • 格式或引文損壞

對高風險專案,請再找領域審稿者,把技術術語與整體流暢度分開檢查。

4. 加入長上下文檢查

在短段落評分之後,再測整章或整篇論文的一個完整章節。搜尋輸出中是否出現:

  • 重複出現未翻譯的來源語術語
  • 角色名稱不一致
  • 標題缺失
  • 段落重複
  • 突然結束
  • 譯者評論

這一步能抓到單段落基準看不見的失敗。

常見失敗模式

失敗模式典型表現如何抓出來
過度直譯文法正確,但目標語言表達不自然請母語審稿者標出僵硬句子
過度創作式翻譯模型改善了文風,但改變了意思將關鍵主張、笑點與隱喻和原文逐一對照
術語漂移同一術語被翻成多種說法建立術語表並搜尋輸出
添加譯者註解輸出包含解釋或評論要求「只輸出翻譯」,並拒收帶雜訊的輸出
截斷翻譯在段落中途停止比對章節數與結尾文本
名稱處理錯誤角色或作者姓名被翻譯、本地化或改動翻譯後搜尋每一個主要姓名
引文損壞參考文獻、日期或方括號引文被改動抽查引文與數字引用

最好的模型,不是開頭第一段最漂亮的那個,而是需要付出最少高成本審校問題的那個。

你該用哪個模型?

參考這張決策表:

你的專案預設模型策略審閱重點
個人閱讀透過文件翻譯器使用強勁的通用 LLM只檢查不清楚的段落
類型小說使用擅長散文的模型,再抽查對話與名稱口吻、名稱、章節一致性
文學小說或詩歌只把 AI 當作初稿或對照工具人工文學審校
技術手冊使用精確模型搭配術語清單術語、警示、編號步驟
學術論文使用技術精度強且能保留 PDF 版面的模型摘要、結論、公式、引文
自費出版書籍先用 AI,再在銷售足以支撐的地方投入人工審校開頭章節、後設資料、重點評論

如果你正在為出版專案編列預算,請把這份基準與書籍翻譯成本指南一起看。如果你想同時檢查排版與翻譯品質,請看真實範例頁面

書譯如何使用模型基準書譯的設計核心是完整翻譯工作流程,而不是單一模型的宣稱。實際目標是把 PDF 或 EPUB 轉成可用的翻譯文件,同時保留結構。

這代表模型選擇只是整個系統的一部分:

  • 文件必須在翻譯前先被正確解析。
  • 章節、標題、表格、圖說與註腳需要不同的處理方式。
  • 長文上下文必須妥善管理,名稱與術語才能保持一致。
  • 輸出必須被重建為可讀的 PDF、EPUB、DOCX 或其他支援格式。
  • 如果譯文要出版或用於高風險情境,仍然需要人工審閱。

如果你需要整套流程,請用翻譯書籍。如果難點在版面,請用PDF 翻譯器。如果章節結構與電子書輸出很重要,請用EPUB 翻譯器

FAQ

什麼是最適合翻譯的 LLM?

在我們的書籍翻譯基準測試中,Claude Sonnet 4.6 是最全面的模型,而 GPT-4.1 在技術與學術精準度上最強。DeepSeek V3 與 Qwen3 在中文與東亞語言輸出方面也特別有競爭力。不過,最適合你的選擇仍應該用你自己的內容來測試。

GPT 還是 Claude 比較適合翻譯?

在這份基準中,Claude 在文學聲音、口語語氣與商務語體方面更強。GPT-4.1 在技術段落上則更保守、更精確。如果是小說,先從 Claude 開始。如果是技術文件或學術材料,先用一段術語密集的樣本比較 Claude 與 GPT-4.1,再做選擇。

LLM 比 Google Translate 或 DeepL 更好嗎?

對短句與常見語言表達來說,傳統翻譯引擎仍可能很強。對長篇書籍、對話、文學散文與依賴上下文的段落而言,LLM 通常更有彈性,因為它能利用更廣的上下文。代價是,你必須檢查 LLM 輸出是否有遺漏、額外註解與一致性問題。

我可以用 ChatGPT 翻完整本書嗎?

你可以在聊天介面裡手動翻譯書的一部分,但很容易丟失格式、上下文、章節一致性與輸出整理。對完整的 PDF 或 EPUB 來說,像 書譯 這樣的文件工作流程更實際,因為它會處理檔案解析、翻譯與重建。

LLM 翻譯基準應該多久更新一次?

只要出現重大模型變更、供應商改變路由,或你的專案類型改變,就應該更新。至少在進行大型付費翻譯、已出版書籍上線,或高風險的學術與技術用途之前,先重跑一次小型內部基準。

在信任一個模型之前,我應該測什麼?

測一段具代表性的文本、一段困難文本,以及一段長文本。檢查意義、流暢度、語氣、術語、完整性與格式標記。如果模型在困難文本上失敗,不要假設它在整本書上會表現得更好。

相關文章