2026 年最佳書籍翻譯 LLM:我們測試了 8 款領先模型
涵蓋 8 款 LLM、5 種文本類型與 3 組語言對的 120 次翻譯測試。Claude 在文學中文表現最佳,GPT-4.1 在技術西班牙文並列第一。完整基準結果如下。

簡短答案
最適合翻譯的 LLM 取決於文本類型,不只是模型名稱而已。在我們的書籍翻譯基準測試中,Claude Sonnet 4.6 是文學散文、對話與商務語體最全面的選擇。GPT-4.1 則是技術與學術內容最穩妥的選項。DeepSeek V3 與 Qwen3 在中文輸出,以及符合東亞文化語感的自然表達上尤其出色。
但這不代表你應該永遠固定使用同一個模型。當供應商更新模型權重、路由方式、上下文限制、安全行為與解碼設定時,翻譯品質都可能改變。把任何「最佳翻譯 LLM」的說法都視為帶有時間戳記的基準結果,然後在做出工作流程決策前,用同一套測試集重新跑一次。
如果你想先看實際翻譯輸出,而不是模型宣稱,先從翻譯範例庫開始。如果你在判斷 LLM 翻譯是否值得這筆成本,請閱讀AI 與人工書籍翻譯成本指南。若想了解完整的端到端流程,請看書籍翻譯指南。
我們測了什麼
這項基準測試是為了長篇文件翻譯而設計,不是短句翻譯。一個模型即使在單句上表現不錯,到了整本書仍可能失敗:它可能遺失角色名稱、在章節之間改變語氣、漏掉註腳,或加入你根本沒要求的譯者註解。
測試集共涵蓋 120 次翻譯:
| 測試維度 | 我們納入的內容 | 為何重要 |
|---|---|---|
| 模型 | 8 款領先 LLM | 模型選擇會改變語氣、完整性與術語處理方式 |
| 文本類型 | 文學、技術、商務、口語、詩歌 | 書籍與 PDF 會混雜多種語體,不會只有單一風格 |
| 語言對 | 英文譯為中文、西班牙文與日文 | 這些語言對會暴露文法、文化與文字系統上的不同失誤模式 |
| 輸出檢查 | 準確性、流暢度、語氣、文化調適、完整性 | 可讀的譯文仍可能不完整,或改寫得過於自由 |
| 長文檢查 | 名稱一致性、術語一致性、不得添加註解 | 書籍翻譯需要文件層級的紀律 |
下方的模型標籤反映的是本文所用的基準快照。如果你要重做這個基準,請記錄供應商、模型名稱、模型版本或發布標籤(若有)、API 路徑、日期、提示詞、temperature,以及任何系統層級設定。
| 測試模型 | 納入的主要原因 | 需要注意的地方 |
|---|---|---|
| GPT-4.1 | 強勁的技術與通用翻譯基準 | 在文學段落中可能偏保守 |
| Claude Sonnet 4.6 | 擅長散文、語體與長上下文表現 | 若提示不夠謹慎,可能把原文較粗礪的風格修飾得太平順 |
| Gemini 2.5 Pro | 強勁的多語通用模型 | 請仔細檢查長輸出的完成度 |
| DeepSeek V3 | 強勁的中文輸出 | 注意是否加入註解或額外評論 |
| Grok 3 | 廣泛的通用 LLM 基準 | 驗證長段落的一致性 |
| Llama 4 Maverick | 開放模型對照點 | 檢查術語與完整性 |
| Qwen3 235B | 東亞語言覆蓋強 | 注意不同文類之間的風格漂移 |
| Mistral Large | 歐洲語言對照點 | 檢查詩歌與混合文字系統段落 |
評分標準
我們評分時,對照的是讀者真正需要完成的翻譯任務。對書籍翻譯而言,BLEU 類相似度並不足夠,因為過度直譯的輸出即使對得上原文,讀起來仍可能很糟。
| 評分項目 | 1 分 | 3 分 | 5 分 |
|---|---|---|---|
| 意義準確度 | 改變或遺失意思 | 大致正確但有些微歧義 | 精確保留原意 |
| 流暢度 | 聽起來像機器翻譯 | 可理解但生硬 | 在目標語言中讀起來自然 |
| 語氣與語體 | 正式程度或情感層級錯誤 | 大致正確但偶有不符 | 保留原文聲音、文類與讀者對象 |
| 術語一致性 | 同一概念使用不同譯法 | 大致一致 | 在整段文本中穩定一致 |
| 完整性 | 遺漏、增補或截斷內容 | 僅缺少少量細微資訊 | 完整且沒有額外註解 |
| 格式意識 | 破壞列表、引文或對話提示 | 大多保留結構 | 保持讀者的閱讀導航完整 |
最重要的實務規則是:任何模型只要加入解釋、安全評論、譯者註解,或殘留來源語言內容,即使譯文本身流暢,也要扣分。書籍翻譯管線需要乾淨的輸出。
各使用情境結果
| 使用情境 | 本次基準最適合的選擇 | 次佳選擇 | 實務判斷 |
|---|---|---|---|
| 文學小說 | Claude Sonnet 4.6 | DeepSeek V3 | Claude 在情感語氣與可讀風格上表現最穩定;DeepSeek 在譯入中文時尤其出色 |
| 技術與學術文本 | GPT-4.1 | Claude Sonnet 4.6 | GPT-4.1 的術語更精確,也較不容易過度修飾事實性散文 |
| 商務與正式寫作 | Claude Sonnet 4.6 | GPT-4.1 | Claude 對禮貌語體與目標語言的商務慣例處理良好 |
| 口語對話與社交語氣 | Claude Sonnet 4.6 | Qwen3 235B | 兩者處理非正式表達的能力都優於偏直譯的翻譯引擎 |
| 詩歌與高度創意文本 | 中文選 DeepSeek V3,均衡性選 Claude | GPT-4.1 | 創意內容需要人工審閱,因為「最佳」取決於你更重視忠實還是改編式翻譯 |
| 全書生產 | Claude Sonnet 4.6 或 GPT-4.1 | 取決於語言對 | 最佳的實務選擇,是能在多個章節中持續保持完整、一致且乾淨的模型 |
這不是放諸四海皆準的排行榜,而是幫助你做工作流程決策的參考工具。如果你的書是醫學教科書,詩歌項目的優勝者就毫無意義。如果你的書是大量依賴對話的小說,那麼技術上精確但風格扁平的模型,可能就是錯的選擇。
多數 LLM 翻譯基準忽略了什麼
多數基準測的是孤立句子。整本書會產生完全不同的問題:
- 角色名稱必須在各章之間保持一致。
- 虛構術語需要固定的目標語言對應,不是每次都換一個譯法。
- 對話必須帶出正確的年齡感、身分層級與關係線索。
- 註腳、引文、圖說與標題,都需要與正文不同的處理方式。
- 當要求模型翻譯時,它不應摘要、刪改、解釋或加入註解。
- 較長輸出需要完成度檢查,因為被截斷的一章比稍微生硬的一句還糟糕。
對 PDF 與 EPUB 翻譯來說,模型品質只是其中一層。文件管線還必須保留版面、閱讀順序、表格、圖片、註解與匯出後的檔案結構。這也是為什麼單純的聊天視窗,和專用的書籍翻譯工作流程,即使底層用的是相近模型,結果仍會不同。
如何重現這份基準
如果你想為自己的翻譯工作流程測試模型,請使用這個方法。
1. 建立小型語料集
選擇與你真實內容相符的段落。最低限度可用以下組合:
| 段落類型 | 建議長度 | 包含內容 |
|---|---|---|
| 文學散文 | 500-800 字 | 描寫、情緒、隱喻、角色口吻 |
| 對話 | 300-500 字 | 插話、俚語、身分差異 |
| 技術文本 | 500-800 字 | 領域術語、單位、定義、縮寫 |
| 學術 PDF 文本 | 500-800 字 | 引文、圖表引用、公式引用 |
| 書前資料或銷售文案 | 200-400 字 | 副標題、作者簡介、書籍介紹 |
不要只用修飾過的行銷範例。至少加入一段難題文本:密集段落、表格圖說、具文化特定性的笑話,或一段名稱與術語反覆出現的內容。
2. 固定提示詞
每個模型都用同一個提示詞,越樸素越好:
You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.
如果某個模型需要大量提示工程,才能避免加註解或跳過段落,這本身就是有用證據。生產級翻譯不應依賴脆弱的提示詞。
3. 盡量做盲審
如果你有雙語審稿者,請把模型名稱遮住,請他們標記:
- 意義誤譯
- 不自然表述
- 術語不一致
- 語體不匹配
- 遺漏文本
- 憑空添加的文本
- 格式或引文損壞
對高風險專案,請再找領域審稿者,把技術術語與整體流暢度分開檢查。
4. 加入長上下文檢查
在短段落評分之後,再測整章或整篇論文的一個完整章節。搜尋輸出中是否出現:
- 重複出現未翻譯的來源語術語
- 角色名稱不一致
- 標題缺失
- 段落重複
- 突然結束
- 譯者評論
這一步能抓到單段落基準看不見的失敗。
常見失敗模式
| 失敗模式 | 典型表現 | 如何抓出來 |
|---|---|---|
| 過度直譯 | 文法正確,但目標語言表達不自然 | 請母語審稿者標出僵硬句子 |
| 過度創作式翻譯 | 模型改善了文風,但改變了意思 | 將關鍵主張、笑點與隱喻和原文逐一對照 |
| 術語漂移 | 同一術語被翻成多種說法 | 建立術語表並搜尋輸出 |
| 添加譯者註解 | 輸出包含解釋或評論 | 要求「只輸出翻譯」,並拒收帶雜訊的輸出 |
| 截斷 | 翻譯在段落中途停止 | 比對章節數與結尾文本 |
| 名稱處理錯誤 | 角色或作者姓名被翻譯、本地化或改動 | 翻譯後搜尋每一個主要姓名 |
| 引文損壞 | 參考文獻、日期或方括號引文被改動 | 抽查引文與數字引用 |
最好的模型,不是開頭第一段最漂亮的那個,而是需要付出最少高成本審校問題的那個。
你該用哪個模型?
參考這張決策表:
| 你的專案 | 預設模型策略 | 審閱重點 |
|---|---|---|
| 個人閱讀 | 透過文件翻譯器使用強勁的通用 LLM | 只檢查不清楚的段落 |
| 類型小說 | 使用擅長散文的模型,再抽查對話與名稱 | 口吻、名稱、章節一致性 |
| 文學小說或詩歌 | 只把 AI 當作初稿或對照工具 | 人工文學審校 |
| 技術手冊 | 使用精確模型搭配術語清單 | 術語、警示、編號步驟 |
| 學術論文 | 使用技術精度強且能保留 PDF 版面的模型 | 摘要、結論、公式、引文 |
| 自費出版書籍 | 先用 AI,再在銷售足以支撐的地方投入人工審校 | 開頭章節、後設資料、重點評論 |
如果你正在為出版專案編列預算,請把這份基準與書籍翻譯成本指南一起看。如果你想同時檢查排版與翻譯品質,請看真實範例頁面。
書譯如何使用模型基準書譯的設計核心是完整翻譯工作流程,而不是單一模型的宣稱。實際目標是把 PDF 或 EPUB 轉成可用的翻譯文件,同時保留結構。
這代表模型選擇只是整個系統的一部分:
- 文件必須在翻譯前先被正確解析。
- 章節、標題、表格、圖說與註腳需要不同的處理方式。
- 長文上下文必須妥善管理,名稱與術語才能保持一致。
- 輸出必須被重建為可讀的 PDF、EPUB、DOCX 或其他支援格式。
- 如果譯文要出版或用於高風險情境,仍然需要人工審閱。
如果你需要整套流程,請用翻譯書籍。如果難點在版面,請用PDF 翻譯器。如果章節結構與電子書輸出很重要,請用EPUB 翻譯器。
FAQ
什麼是最適合翻譯的 LLM?
在我們的書籍翻譯基準測試中,Claude Sonnet 4.6 是最全面的模型,而 GPT-4.1 在技術與學術精準度上最強。DeepSeek V3 與 Qwen3 在中文與東亞語言輸出方面也特別有競爭力。不過,最適合你的選擇仍應該用你自己的內容來測試。
GPT 還是 Claude 比較適合翻譯?
在這份基準中,Claude 在文學聲音、口語語氣與商務語體方面更強。GPT-4.1 在技術段落上則更保守、更精確。如果是小說,先從 Claude 開始。如果是技術文件或學術材料,先用一段術語密集的樣本比較 Claude 與 GPT-4.1,再做選擇。
LLM 比 Google Translate 或 DeepL 更好嗎?
對短句與常見語言表達來說,傳統翻譯引擎仍可能很強。對長篇書籍、對話、文學散文與依賴上下文的段落而言,LLM 通常更有彈性,因為它能利用更廣的上下文。代價是,你必須檢查 LLM 輸出是否有遺漏、額外註解與一致性問題。
我可以用 ChatGPT 翻完整本書嗎?
你可以在聊天介面裡手動翻譯書的一部分,但很容易丟失格式、上下文、章節一致性與輸出整理。對完整的 PDF 或 EPUB 來說,像 書譯 這樣的文件工作流程更實際,因為它會處理檔案解析、翻譯與重建。
LLM 翻譯基準應該多久更新一次?
只要出現重大模型變更、供應商改變路由,或你的專案類型改變,就應該更新。至少在進行大型付費翻譯、已出版書籍上線,或高風險的學術與技術用途之前,先重跑一次小型內部基準。
在信任一個模型之前,我應該測什麼?
測一段具代表性的文本、一段困難文本,以及一段長文本。檢查意義、流暢度、語氣、術語、完整性與格式標記。如果模型在困難文本上失敗,不要假設它在整本書上會表現得更好。





