BookTranslator
BookTranslator

بهترین LLM برای ترجمه کتاب در 2026: 8 مدل پیشرو را آزمایش کردیم

120 ترجمه در 8 LLM، 5 نوع متن و 3 جفت زبانی. Claude در ترجمه ادبی به چینی بهترین بود و GPT-4.1 در ترجمه فنی به اسپانیایی به تساوی رسید. نتایج کامل بنچمارک.

BookTranslator

BookTranslator Team

14 min read

پاسخ کوتاه

بهترین LLM برای ترجمه به نوع متن بستگی دارد، نه فقط به نام مدل. در بنچمارک ترجمه کتاب ما، Claude Sonnet 4.6 بهترین انتخاب همه‌جانبه برای نثر ادبی، دیالوگ و لحن تجاری بود. GPT-4.1 امن‌ترین گزینه برای متون فنی و دانشگاهی بود. DeepSeek V3 و Qwen3 به‌ویژه برای خروجی چینی و جمله‌بندی شرق‌آسیاییِ طبیعی از نظر فرهنگی بسیار قوی بودند.

این به آن معنا نیست که باید برای همیشه یک مدل را انتخاب کنید. کیفیت ترجمه زمانی تغییر می‌کند که ارائه‌دهندگان وزن‌های مدل، routing، محدودیت‌های context، رفتار ایمنی و تنظیمات decoding را به‌روزرسانی می‌کنند. هر ادعایی درباره «بهترین LLM برای ترجمه» را یک بنچمارک تاریخ‌دار در نظر بگیرید، سپس پیش از تصمیم‌گیری برای workflow، همان مجموعه آزمون را دوباره اجرا کنید.

اگر می‌خواهید به‌جای ادعاهای مدل، خروجی واقعی ترجمه‌شده را بررسی کنید، از کتابخانه نمونه‌های ترجمه شروع کنید. اگر در حال تصمیم‌گیری هستید که آیا ترجمه با LLM از نظر هزینه می‌ارزد یا نه، راهنمای هزینه ترجمه کتاب با AI در برابر مترجم انسانی را بخوانید. برای workflow کامل از ابتدا تا انتها، از راهنمای ترجمه کتاب استفاده کنید.

چه چیزی را آزمایش کردیم

این بنچمارک برای ترجمه اسناد بلند طراحی شد، نه ترجمه عبارت‌های کوتاه. مدلی که روی یک جمله عملکرد خوبی دارد، هنوز هم ممکن است در مقیاس یک کتاب شکست بخورد؛ وقتی نام شخصیت‌ها را از دست می‌دهد، لحن را بین فصل‌ها عوض می‌کند، پاورقی‌ها را حذف می‌کند یا یادداشت مترجم اضافه می‌کند، در حالی که چنین چیزی از او خواسته نشده است.

مجموعه آزمون 120 ترجمه را پوشش می‌داد:

بعد آزمایشچه چیزهایی را گنجاندیمچرا مهم است
مدل‌ها8 LLM پیشروانتخاب مدل بر لحن، کامل بودن و رفتار اصطلاحات اثر می‌گذارد
نوع متنادبی، فنی، تجاری، محاوره‌ای، شعرکتاب‌ها و PDFها ترکیبی از لحن‌ها هستند، نه یک سبک یکنواخت
جفت‌های زبانیانگلیسی به چینی، اسپانیایی و ژاپنیاین جفت‌ها انواع متفاوتی از خطا در دستور زبان، فرهنگ و خط را آشکار می‌کنند
بررسی خروجیدقت، روانی، لحن، انطباق فرهنگی، کامل بودنیک ترجمه خوانا هنوز هم ممکن است ناقص یا بیش از حد آزاد باشد
بررسی متن بلندانسجام نام‌ها، انسجام اصطلاحات، بدون یادداشت اضافه‌شدهترجمه کتاب به انضباط در سطح سند نیاز دارد

برچسب‌های مدل در ادامه، بازتاب snapshot بنچمارکی هستند که برای این مقاله استفاده شد. اگر این بنچمارک را تکرار می‌کنید، ارائه‌دهنده، نام مدل، نسخه مدل یا برچسب انتشار در صورت وجود، مسیر API، تاریخ، prompt، temperature و هر تنظیم در سطح سیستم را ثبت کنید.

مدل در آزموندلیل اصلی برای گنجاندننکته‌ای که باید زیر نظر داشت
GPT-4.1baseline قوی برای ترجمه فنی و عمومیدر بخش‌های ادبی ممکن است محافظه‌کار باشد
Claude Sonnet 4.6نثر، لحن و رفتار context بلندِ قویاگر prompt دقیق نباشد ممکن است سبک زبر متن مبدأ را هموار کند
Gemini 2.5 Proمدل چندزبانه عمومیِ قویکامل شدن خروجی‌های بلند را با دقت بررسی کنید
DeepSeek V3خروجی قوی به زبان چینیمراقب یادداشت‌های اضافه یا توضیح اضافی باشید
Grok 3baseline عمومی برای LLMانسجام را در متن‌های بلند اعتبارسنجی کنید
Llama 4 Maverickنقطه مقایسه برای مدل‌های بازاصطلاحات و کامل بودن را بررسی کنید
Qwen3 235Bپوشش قوی زبان‌های شرق آسیامراقب تغییر سبک بسته به ژانر باشید
Mistral Largeنقطه مقایسه برای زبان‌های اروپاییشعر و متن‌های با خط‌های ترکیبی را بررسی کنید

معیار امتیازدهی

ما هر ترجمه را براساس کاری امتیاز دادیم که خواننده واقعاً نیاز دارد انجام شود. شباهت به سبک BLEU برای ترجمه کتاب کافی نیست، چون یک خروجی تحت‌اللفظی می‌تواند با متن مبدأ هم‌خوان باشد و همچنان بد خوانده شود.

معیارامتیاز 1امتیاز 3امتیاز 5
دقت معناییمعنا را تغییر می‌دهد یا از دست می‌دهدعمدتاً درست با کمی ابهاممعنا را با دقت حفظ می‌کند
روانیشبیه ترجمه ماشینی به نظر می‌رسدقابل فهم اما خشکدر زبان مقصد طبیعی خوانده می‌شود
لحن و سطح زبانیسطح رسمی بودن یا بار احساسی اشتباه استعمدتاً درست با چند ناهماهنگی گاه‌به‌گاهصدا، ژانر و مخاطب را حفظ می‌کند
انسجام اصطلاحاتبرای یک مفهوم از واژه‌های متفاوت استفاده می‌کندعمدتاً منسجمدر سراسر متن پایدار می‌ماند
کامل بودنمحتوا را حذف، اضافه یا ناقص می‌کنداندکی از ظرافت معنا جا می‌افتدکامل است و یادداشت اضافه ندارد
آگاهی از قالبفهرست‌ها، ارجاعات یا نشانه‌های دیالوگ را می‌شکندعمدتاً ساختار را حفظ می‌کندمسیر خواندن را برای مخاطب دست‌نخورده نگه می‌دارد

مهم‌ترین قاعده عملی این است: هر مدلی که توضیح، commentary ایمنی، یادداشت مترجم یا باقی‌مانده‌هایی از زبان مبدأ اضافه کند، حتی اگر خود ترجمه روان باشد، امتیاز از دست می‌دهد. یک pipeline ترجمه کتاب به خروجی تمیز نیاز دارد.

نتایج بر اساس کاربرد

کاربردبهترین گزینه در این بنچمارکگزینه بعدیجمع‌بندی عملی
داستان ادبیClaude Sonnet 4.6DeepSeek V3Claude لحن احساسی و سبک خوانا را از همه منسجم‌تر حفظ کرد؛ DeepSeek به‌ویژه در ترجمه به چینی بسیار قوی بود
متن فنی و دانشگاهیGPT-4.1Claude Sonnet 4.6GPT-4.1 در اصطلاحات دقیق بود و کمتر به نثر factual سبک‌پردازی اضافه می‌کرد
نوشتار تجاری و رسمیClaude Sonnet 4.6GPT-4.1Claude لحن مؤدبانه و عرف‌های نوشتار تجاری در زبان مقصد را خوب مدیریت کرد
دیالوگ محاوره‌ای و لحن اجتماعیClaude Sonnet 4.6Qwen3 235Bهر دو، جمله‌بندی غیررسمی را بهتر از موتورهای ترجمه تحت‌اللفظی مدیریت کردند
شعر و متن بسیار خلاقانهDeepSeek V3 برای چینی، Claude برای تعادلGPT-4.1کار خلاقانه به بازبینی انسانی نیاز دارد، چون «بهترین» به ترجمه وفادار در برابر ترجمه تطبیقی بستگی دارد
تولید کامل کتابClaude Sonnet 4.6 یا GPT-4.1بسته به جفت زبانیبهترین انتخاب برای تولید، مدلی است که در فصل‌های زیاد کامل، منسجم و تمیز بماند

این یک جدول رتبه‌بندی همگانی نیست. این یک ابزار کمک‌تصمیم برای workflow است. اگر کتاب شما یک کتاب درسی پزشکی است، برنده بخش شعر عملاً بی‌اهمیت است. اگر کتاب شما داستانی پُر از دیالوگ است، مدلی که از نظر فنی دقیق اما از نظر لحن تخت باشد، ممکن است انتخاب اشتباهی باشد.

آنچه بیشتر بنچمارک‌های ترجمه با LLM نادیده می‌گیرند

بیشتر بنچمارک‌ها جمله‌های جداافتاده را می‌سنجند. کتاب کامل مشکلات متفاوتی ایجاد می‌کند:

  • نام شخصیت‌ها باید در سراسر فصل‌ها یکسان بماند.
  • اصطلاحات ساخته‌شده باید یک معادل ثابت در زبان مقصد داشته باشند، نه اینکه هر بار به‌شکل دیگری ترجمه شوند.
  • دیالوگ باید نشانه‌های درست سن، جایگاه و رابطه را منتقل کند.
  • پاورقی‌ها، ارجاعات، کپشن شکل‌ها و تیترها به رفتاری متفاوت از متن اصلی نیاز دارند.
  • وقتی از مدل خواسته شده فقط ترجمه کند، نباید خلاصه‌سازی، سانسور، توضیح یا یادداشت اضافه کند.
  • خروجی‌های بلند به بررسی کامل شدن نیاز دارند، چون یک فصل ناقص از یک جمله کمی خشک بدتر است.

برای ترجمه PDF و EPUB، کیفیت مدل فقط یک لایه از ماجراست. pipeline سند باید layout، ترتیب خواندن، جدول‌ها، تصاویر، یادداشت‌ها و ساختار فایل خروجی را هم حفظ کند. به همین دلیل است که یک پنجره چت خام و یک workflow اختصاصی ترجمه کتاب حتی با استفاده از مدل‌های پایه مشابه، نتایج متفاوتی تولید می‌کنند.

چگونه این بنچمارک را بازتولید کنید

اگر می‌خواهید مدل‌ها را برای workflow ترجمه خودتان آزمایش کنید، از این روش استفاده کنید.

1. یک پیکره کوچک بسازید

بخش‌هایی را انتخاب کنید که با محتوای واقعی شما هم‌خوان باشند. یک مجموعه حداقلی خوب این است:

نوع متنطول پیشنهادیموارد لازم
نثر ادبی500-800 کلمهتوصیف، احساس، استعاره، صدای شخصیت
دیالوگ300-500 کلمهقطع‌کردن حرف، slang، تفاوت‌های جایگاه
متن فنی500-800 کلمهاصطلاحات حوزه، واحدها، تعریف‌ها، مخفف‌ها
متن PDF دانشگاهی500-800 کلمهارجاع‌ها، اشاره به شکل‌ها، اشاره به معادله‌ها
صفحات آغازین یا متن فروش200-400 کلمهزیرعنوان، بیوی نویسنده، توضیح کتاب

فقط از نمونه‌های بازاریابیِ صیقلی استفاده نکنید. یک بخش دشوار هم اضافه کنید: یک پاراگراف فشرده، یک کپشن جدول، یک شوخی وابسته به فرهنگ، یا بخشی که در آن نام‌ها و اصطلاحات تکرار می‌شوند.

2. پرامپت را ثابت نگه دارید

برای همه مدل‌ها از یک prompt یکسان استفاده کنید. آن را ساده و بی‌زرق‌وبرق نگه دارید:

You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.

اگر یک مدل برای اینکه یادداشت اضافه نکند یا بخش‌هایی را جا نیندازد به prompt engineering گسترده نیاز دارد، این خودش شواهد مفیدی است. ترجمه در محیط تولید نباید به promptهای شکننده وابسته باشد.

3. در صورت امکان، بازبینی کور انجام دهید

اگر یک بازبین دوزبانه دارید، نام مدل‌ها را مخفی کنید و از او بخواهید این موارد را علامت بزند:

  • ترجمه نادرست معنا
  • جمله‌بندی غیرطبیعی
  • ناهماهنگی در اصطلاحات
  • ناهماهنگی در لحن و سطح زبانی
  • متن حذف‌شده
  • متن ساختگی
  • آسیب به قالب‌بندی یا ارجاعات

برای پروژه‌های حساس، از یک بازبین حوزه‌ای بخواهید اصطلاحات فنی را جدا از روانی عمومی بررسی کند.

4. بررسی‌های متن بلند را اضافه کنید

پس از امتیازدهی بخش‌های کوتاه، یک فصل کامل یا یک بخش کامل از مقاله را آزمایش کنید. در خروجی به دنبال این موارد بگردید:

  • تکرار اصطلاحات ترجمه‌نشده از متن مبدأ
  • ناهماهنگی در نام شخصیت‌ها
  • تیترهای جاافتاده
  • پاراگراف‌های تکراری
  • پایان ناگهانی
  • commentary مترجم

این مرحله خطاهایی را آشکار می‌کند که بنچمارک‌های تک‌بخشی نمی‌بینند.

خطاهای رایج

نوع خطاظاهر آن چگونه استچگونه آن را پیدا کنید
ترجمه بیش از حد تحت‌اللفظیاز نظر دستوری درست است اما در زبان مقصد غیرطبیعی به نظر می‌رسداز یک بازبین بومی بخواهید جمله‌های خشک را علامت بزند
ترجمه بیش از حد خلاقانهمدل سبک را بهتر می‌کند اما معنا را جابه‌جا می‌کندادعاهای کلیدی، شوخی‌ها و استعاره‌ها را با متن مبدأ مقایسه کنید
رانش اصطلاحاتیک اصطلاح به چند شکل ترجمه می‌شودفهرست اصطلاحات بسازید و خروجی را جستجو کنید
یادداشت مترجم اضافه‌شدهخروجی شامل توضیح یا comment استعبارت «translation only» را الزامی کنید و خروجی پرسر‌وصدا را رد کنید
ناقص‌شدن خروجیترجمه در میانه بخش متوقف می‌شودتعداد بخش‌ها و متن پایانی را مقایسه کنید
خطا در مدیریت نام‌هانام شخصیت یا نویسنده ترجمه، بومی‌سازی یا تغییر داده می‌شودپس از ترجمه همه نام‌های اصلی را جستجو کنید
آسیب به ارجاعاتارجاع‌ها، تاریخ‌ها یا citationهای داخل براکت تغییر می‌کنندارجاع‌ها و اشاره‌های عددی را به‌صورت نمونه‌ای بررسی کنید

بهترین مدل فقط مدلی نیست که زیباترین پاراگراف اول را تولید می‌کند. بهترین مدل، مدلی است که کمترین مشکلات پرهزینه در بازبینی را ایجاد می‌کند.

از کدام مدل باید استفاده کنید؟

از این جدول تصمیم استفاده کنید:

پروژه شمااستراتژی پیش‌فرض مدلاولویت بازبینی
مطالعه شخصیاز یک LLM عمومیِ قوی از طریق مترجم اسناد استفاده کنیدفقط بخش‌های نامشخص را بررسی کنید
داستان ژانریاز مدلی قوی در نثر استفاده کنید، سپس دیالوگ و نام‌ها را نمونه‌ای بررسی کنیدصدا، نام‌ها، انسجام فصل‌ها
داستان ادبی یا شعراز AI فقط به‌عنوان پیش‌نویس یا ابزار مقایسه استفاده کنیدبازبینی ادبی انسانی
راهنمای فنیاز مدلی دقیق همراه با checklist اصطلاحات استفاده کنیداصطلاحات، هشدارها، مراحل شماره‌دار
مقاله دانشگاهیاز مدلی با دقت فنی بالا و حفظ layout در PDF استفاده کنیدچکیده، نتیجه‌گیری، معادلات، ارجاعات
کتاب خودانتشاریابتدا از AI استفاده کنید، سپس هرجا فروش توجیه می‌کند در بازبینی انسانی سرمایه‌گذاری کنیدفصل اول، metadata، نقدهای برتر

اگر برای یک پروژه نشر در حال بودجه‌بندی هستید، این بنچمارک را در کنار راهنمای هزینه ترجمه کتاب ببینید. اگر می‌خواهید کیفیت قالب‌بندی و ترجمه را در کنار هم بررسی کنید، از صفحه نمونه‌های واقعی استفاده کنید.

BookTranslator چگونه از بنچمارک‌های مدل استفاده می‌کند

BookTranslator حول workflow کامل ترجمه ساخته شده است، نه حول ادعای برتری یک مدل. هدف عملی این است که یک PDF یا EPUB را با حفظ ساختار به یک سند ترجمه‌شده قابل‌استفاده تبدیل کند.

این یعنی انتخاب مدل فقط یک بخش از سیستم است:

  • سند باید پیش از ترجمه به‌درستی parse شود.
  • فصل‌ها، تیترها، جدول‌ها، کپشن‌ها و پاورقی‌ها به رسیدگی متفاوتی نیاز دارند.
  • context متن بلند باید مدیریت شود تا نام‌ها و اصطلاحات یکدست بمانند.
  • خروجی باید به‌صورت یک PDF، EPUB، DOCX یا قالب پشتیبانی‌شده دیگرِ خوانا بازسازی شود.
  • اگر قرار است فایل ترجمه‌شده منتشر شود یا در موقعیتی حساس استفاده شود، همچنان به بازبینی انسانی نیاز دارد.

وقتی کل pipeline را می‌خواهید، از ترجمه کتاب استفاده کنید. وقتی سختی اصلی layout است، از مترجم PDF استفاده کنید. وقتی ساختار فصل‌ها و خروجی ebook اهمیت دارد، از مترجم EPUB استفاده کنید.

پرسش‌های متداول

بهترین LLM برای ترجمه چیست؟

در بنچمارک ترجمه کتاب ما، Claude Sonnet 4.6 بهترین مدل همه‌جانبه بود، در حالی که GPT-4.1 برای دقت فنی و دانشگاهی بهترین عملکرد را داشت. DeepSeek V3 و Qwen3 هم به‌ویژه برای خروجی چینی و زبان‌های شرق آسیا بسیار رقابتی بودند. با این حال، بهترین انتخاب شما باید همچنان روی محتوای واقعی خودتان آزمایش شود.

برای ترجمه، GPT بهتر است یا Claude؟

در این بنچمارک، Claude برای صدای ادبی، لحن محاوره‌ای و لحن تجاری قوی‌تر بود. GPT-4.1 برای بخش‌های فنی محافظه‌کارتر و دقیق‌تر عمل کرد. برای رمان، از Claude شروع کنید. برای مستندات فنی یا محتوای دانشگاهی، پیش از انتخاب، Claude و GPT-4.1 را روی یک نمونه پُر از اصطلاحات مقایسه کنید.

آیا LLMها از Google Translate یا DeepL بهترند؟

برای عبارت‌های کوتاه و رایج، موتورهای ترجمه سنتی هنوز هم می‌توانند قوی باشند. برای کتاب‌های بلند، دیالوگ، نثر ادبی و بخش‌های حساس به context، LLMها معمولاً انعطاف‌پذیرترند، چون می‌توانند از context گسترده‌تری استفاده کنند. نقطه ضعف این است که خروجی LLM باید از نظر حذف بخش‌ها، یادداشت‌های اضافه و انسجام بررسی شود.

آیا می‌توانم یک کتاب کامل را با ChatGPT ترجمه کنم؟

می‌توانید بخش‌هایی از یک کتاب را به‌صورت دستی در یک رابط چت ترجمه کنید، اما از دست رفتن قالب‌بندی، context، انسجام بین فصل‌ها و نظم خروجی بسیار آسان است. برای یک PDF یا EPUB کامل، یک workflow اسنادی مثل BookTranslator عملی‌تر است، چون parse فایل، ترجمه و بازسازی را مدیریت می‌کند.

هر چند وقت یک‌بار باید بنچمارک ترجمه با LLM را به‌روزرسانی کرد؟

هر زمان که یک مدل اصلی تغییر می‌کند، یک ارائه‌دهنده routing را عوض می‌کند یا نوع پروژه شما تغییر می‌کند، آن را به‌روزرسانی کنید. حداقل، پیش از یک ترجمه پولی بزرگ، انتشار یک کتاب یا یک کاربرد دانشگاهی یا فنی حساس، یک بنچمارک داخلی کوچک را دوباره اجرا کنید.

پیش از اعتماد به یک مدل، چه چیزی را باید آزمایش کنم؟

یک بخش نماینده، یک بخش دشوار و یک بخش بلند را آزمایش کنید. معنا، روانی، لحن، اصطلاحات، کامل بودن و نشانه‌های قالب‌بندی را بررسی کنید. اگر مدل در بخش دشوار شکست می‌خورد، فرض نکنید که در سراسر یک کتاب کامل بهتر رفتار خواهد کرد.

مطالب مرتبط