بهترین LLM برای ترجمه کتاب در 2026: 8 مدل پیشرو را آزمایش کردیم
120 ترجمه در 8 LLM، 5 نوع متن و 3 جفت زبانی. Claude در ترجمه ادبی به چینی بهترین بود و GPT-4.1 در ترجمه فنی به اسپانیایی به تساوی رسید. نتایج کامل بنچمارک.

پاسخ کوتاه
بهترین LLM برای ترجمه به نوع متن بستگی دارد، نه فقط به نام مدل. در بنچمارک ترجمه کتاب ما، Claude Sonnet 4.6 بهترین انتخاب همهجانبه برای نثر ادبی، دیالوگ و لحن تجاری بود. GPT-4.1 امنترین گزینه برای متون فنی و دانشگاهی بود. DeepSeek V3 و Qwen3 بهویژه برای خروجی چینی و جملهبندی شرقآسیاییِ طبیعی از نظر فرهنگی بسیار قوی بودند.
این به آن معنا نیست که باید برای همیشه یک مدل را انتخاب کنید. کیفیت ترجمه زمانی تغییر میکند که ارائهدهندگان وزنهای مدل، routing، محدودیتهای context، رفتار ایمنی و تنظیمات decoding را بهروزرسانی میکنند. هر ادعایی درباره «بهترین LLM برای ترجمه» را یک بنچمارک تاریخدار در نظر بگیرید، سپس پیش از تصمیمگیری برای workflow، همان مجموعه آزمون را دوباره اجرا کنید.
اگر میخواهید بهجای ادعاهای مدل، خروجی واقعی ترجمهشده را بررسی کنید، از کتابخانه نمونههای ترجمه شروع کنید. اگر در حال تصمیمگیری هستید که آیا ترجمه با LLM از نظر هزینه میارزد یا نه، راهنمای هزینه ترجمه کتاب با AI در برابر مترجم انسانی را بخوانید. برای workflow کامل از ابتدا تا انتها، از راهنمای ترجمه کتاب استفاده کنید.
چه چیزی را آزمایش کردیم
این بنچمارک برای ترجمه اسناد بلند طراحی شد، نه ترجمه عبارتهای کوتاه. مدلی که روی یک جمله عملکرد خوبی دارد، هنوز هم ممکن است در مقیاس یک کتاب شکست بخورد؛ وقتی نام شخصیتها را از دست میدهد، لحن را بین فصلها عوض میکند، پاورقیها را حذف میکند یا یادداشت مترجم اضافه میکند، در حالی که چنین چیزی از او خواسته نشده است.
مجموعه آزمون 120 ترجمه را پوشش میداد:
| بعد آزمایش | چه چیزهایی را گنجاندیم | چرا مهم است |
|---|---|---|
| مدلها | 8 LLM پیشرو | انتخاب مدل بر لحن، کامل بودن و رفتار اصطلاحات اثر میگذارد |
| نوع متن | ادبی، فنی، تجاری، محاورهای، شعر | کتابها و PDFها ترکیبی از لحنها هستند، نه یک سبک یکنواخت |
| جفتهای زبانی | انگلیسی به چینی، اسپانیایی و ژاپنی | این جفتها انواع متفاوتی از خطا در دستور زبان، فرهنگ و خط را آشکار میکنند |
| بررسی خروجی | دقت، روانی، لحن، انطباق فرهنگی، کامل بودن | یک ترجمه خوانا هنوز هم ممکن است ناقص یا بیش از حد آزاد باشد |
| بررسی متن بلند | انسجام نامها، انسجام اصطلاحات، بدون یادداشت اضافهشده | ترجمه کتاب به انضباط در سطح سند نیاز دارد |
برچسبهای مدل در ادامه، بازتاب snapshot بنچمارکی هستند که برای این مقاله استفاده شد. اگر این بنچمارک را تکرار میکنید، ارائهدهنده، نام مدل، نسخه مدل یا برچسب انتشار در صورت وجود، مسیر API، تاریخ، prompt، temperature و هر تنظیم در سطح سیستم را ثبت کنید.
| مدل در آزمون | دلیل اصلی برای گنجاندن | نکتهای که باید زیر نظر داشت |
|---|---|---|
| GPT-4.1 | baseline قوی برای ترجمه فنی و عمومی | در بخشهای ادبی ممکن است محافظهکار باشد |
| Claude Sonnet 4.6 | نثر، لحن و رفتار context بلندِ قوی | اگر prompt دقیق نباشد ممکن است سبک زبر متن مبدأ را هموار کند |
| Gemini 2.5 Pro | مدل چندزبانه عمومیِ قوی | کامل شدن خروجیهای بلند را با دقت بررسی کنید |
| DeepSeek V3 | خروجی قوی به زبان چینی | مراقب یادداشتهای اضافه یا توضیح اضافی باشید |
| Grok 3 | baseline عمومی برای LLM | انسجام را در متنهای بلند اعتبارسنجی کنید |
| Llama 4 Maverick | نقطه مقایسه برای مدلهای باز | اصطلاحات و کامل بودن را بررسی کنید |
| Qwen3 235B | پوشش قوی زبانهای شرق آسیا | مراقب تغییر سبک بسته به ژانر باشید |
| Mistral Large | نقطه مقایسه برای زبانهای اروپایی | شعر و متنهای با خطهای ترکیبی را بررسی کنید |
معیار امتیازدهی
ما هر ترجمه را براساس کاری امتیاز دادیم که خواننده واقعاً نیاز دارد انجام شود. شباهت به سبک BLEU برای ترجمه کتاب کافی نیست، چون یک خروجی تحتاللفظی میتواند با متن مبدأ همخوان باشد و همچنان بد خوانده شود.
| معیار | امتیاز 1 | امتیاز 3 | امتیاز 5 |
|---|---|---|---|
| دقت معنایی | معنا را تغییر میدهد یا از دست میدهد | عمدتاً درست با کمی ابهام | معنا را با دقت حفظ میکند |
| روانی | شبیه ترجمه ماشینی به نظر میرسد | قابل فهم اما خشک | در زبان مقصد طبیعی خوانده میشود |
| لحن و سطح زبانی | سطح رسمی بودن یا بار احساسی اشتباه است | عمدتاً درست با چند ناهماهنگی گاهبهگاه | صدا، ژانر و مخاطب را حفظ میکند |
| انسجام اصطلاحات | برای یک مفهوم از واژههای متفاوت استفاده میکند | عمدتاً منسجم | در سراسر متن پایدار میماند |
| کامل بودن | محتوا را حذف، اضافه یا ناقص میکند | اندکی از ظرافت معنا جا میافتد | کامل است و یادداشت اضافه ندارد |
| آگاهی از قالب | فهرستها، ارجاعات یا نشانههای دیالوگ را میشکند | عمدتاً ساختار را حفظ میکند | مسیر خواندن را برای مخاطب دستنخورده نگه میدارد |
مهمترین قاعده عملی این است: هر مدلی که توضیح، commentary ایمنی، یادداشت مترجم یا باقیماندههایی از زبان مبدأ اضافه کند، حتی اگر خود ترجمه روان باشد، امتیاز از دست میدهد. یک pipeline ترجمه کتاب به خروجی تمیز نیاز دارد.
نتایج بر اساس کاربرد
| کاربرد | بهترین گزینه در این بنچمارک | گزینه بعدی | جمعبندی عملی |
|---|---|---|---|
| داستان ادبی | Claude Sonnet 4.6 | DeepSeek V3 | Claude لحن احساسی و سبک خوانا را از همه منسجمتر حفظ کرد؛ DeepSeek بهویژه در ترجمه به چینی بسیار قوی بود |
| متن فنی و دانشگاهی | GPT-4.1 | Claude Sonnet 4.6 | GPT-4.1 در اصطلاحات دقیق بود و کمتر به نثر factual سبکپردازی اضافه میکرد |
| نوشتار تجاری و رسمی | Claude Sonnet 4.6 | GPT-4.1 | Claude لحن مؤدبانه و عرفهای نوشتار تجاری در زبان مقصد را خوب مدیریت کرد |
| دیالوگ محاورهای و لحن اجتماعی | Claude Sonnet 4.6 | Qwen3 235B | هر دو، جملهبندی غیررسمی را بهتر از موتورهای ترجمه تحتاللفظی مدیریت کردند |
| شعر و متن بسیار خلاقانه | DeepSeek V3 برای چینی، Claude برای تعادل | GPT-4.1 | کار خلاقانه به بازبینی انسانی نیاز دارد، چون «بهترین» به ترجمه وفادار در برابر ترجمه تطبیقی بستگی دارد |
| تولید کامل کتاب | Claude Sonnet 4.6 یا GPT-4.1 | بسته به جفت زبانی | بهترین انتخاب برای تولید، مدلی است که در فصلهای زیاد کامل، منسجم و تمیز بماند |
این یک جدول رتبهبندی همگانی نیست. این یک ابزار کمکتصمیم برای workflow است. اگر کتاب شما یک کتاب درسی پزشکی است، برنده بخش شعر عملاً بیاهمیت است. اگر کتاب شما داستانی پُر از دیالوگ است، مدلی که از نظر فنی دقیق اما از نظر لحن تخت باشد، ممکن است انتخاب اشتباهی باشد.
آنچه بیشتر بنچمارکهای ترجمه با LLM نادیده میگیرند
بیشتر بنچمارکها جملههای جداافتاده را میسنجند. کتاب کامل مشکلات متفاوتی ایجاد میکند:
- نام شخصیتها باید در سراسر فصلها یکسان بماند.
- اصطلاحات ساختهشده باید یک معادل ثابت در زبان مقصد داشته باشند، نه اینکه هر بار بهشکل دیگری ترجمه شوند.
- دیالوگ باید نشانههای درست سن، جایگاه و رابطه را منتقل کند.
- پاورقیها، ارجاعات، کپشن شکلها و تیترها به رفتاری متفاوت از متن اصلی نیاز دارند.
- وقتی از مدل خواسته شده فقط ترجمه کند، نباید خلاصهسازی، سانسور، توضیح یا یادداشت اضافه کند.
- خروجیهای بلند به بررسی کامل شدن نیاز دارند، چون یک فصل ناقص از یک جمله کمی خشک بدتر است.
برای ترجمه PDF و EPUB، کیفیت مدل فقط یک لایه از ماجراست. pipeline سند باید layout، ترتیب خواندن، جدولها، تصاویر، یادداشتها و ساختار فایل خروجی را هم حفظ کند. به همین دلیل است که یک پنجره چت خام و یک workflow اختصاصی ترجمه کتاب حتی با استفاده از مدلهای پایه مشابه، نتایج متفاوتی تولید میکنند.
چگونه این بنچمارک را بازتولید کنید
اگر میخواهید مدلها را برای workflow ترجمه خودتان آزمایش کنید، از این روش استفاده کنید.
1. یک پیکره کوچک بسازید
بخشهایی را انتخاب کنید که با محتوای واقعی شما همخوان باشند. یک مجموعه حداقلی خوب این است:
| نوع متن | طول پیشنهادی | موارد لازم |
|---|---|---|
| نثر ادبی | 500-800 کلمه | توصیف، احساس، استعاره، صدای شخصیت |
| دیالوگ | 300-500 کلمه | قطعکردن حرف، slang، تفاوتهای جایگاه |
| متن فنی | 500-800 کلمه | اصطلاحات حوزه، واحدها، تعریفها، مخففها |
| متن PDF دانشگاهی | 500-800 کلمه | ارجاعها، اشاره به شکلها، اشاره به معادلهها |
| صفحات آغازین یا متن فروش | 200-400 کلمه | زیرعنوان، بیوی نویسنده، توضیح کتاب |
فقط از نمونههای بازاریابیِ صیقلی استفاده نکنید. یک بخش دشوار هم اضافه کنید: یک پاراگراف فشرده، یک کپشن جدول، یک شوخی وابسته به فرهنگ، یا بخشی که در آن نامها و اصطلاحات تکرار میشوند.
2. پرامپت را ثابت نگه دارید
برای همه مدلها از یک prompt یکسان استفاده کنید. آن را ساده و بیزرقوبرق نگه دارید:
You are a professional translator. Translate the text into [target language].
Preserve meaning, tone, names, numbers, citations, and formatting markers.
Do not summarize. Do not add notes. Output only the translation.
اگر یک مدل برای اینکه یادداشت اضافه نکند یا بخشهایی را جا نیندازد به prompt engineering گسترده نیاز دارد، این خودش شواهد مفیدی است. ترجمه در محیط تولید نباید به promptهای شکننده وابسته باشد.
3. در صورت امکان، بازبینی کور انجام دهید
اگر یک بازبین دوزبانه دارید، نام مدلها را مخفی کنید و از او بخواهید این موارد را علامت بزند:
- ترجمه نادرست معنا
- جملهبندی غیرطبیعی
- ناهماهنگی در اصطلاحات
- ناهماهنگی در لحن و سطح زبانی
- متن حذفشده
- متن ساختگی
- آسیب به قالببندی یا ارجاعات
برای پروژههای حساس، از یک بازبین حوزهای بخواهید اصطلاحات فنی را جدا از روانی عمومی بررسی کند.
4. بررسیهای متن بلند را اضافه کنید
پس از امتیازدهی بخشهای کوتاه، یک فصل کامل یا یک بخش کامل از مقاله را آزمایش کنید. در خروجی به دنبال این موارد بگردید:
- تکرار اصطلاحات ترجمهنشده از متن مبدأ
- ناهماهنگی در نام شخصیتها
- تیترهای جاافتاده
- پاراگرافهای تکراری
- پایان ناگهانی
- commentary مترجم
این مرحله خطاهایی را آشکار میکند که بنچمارکهای تکبخشی نمیبینند.
خطاهای رایج
| نوع خطا | ظاهر آن چگونه است | چگونه آن را پیدا کنید |
|---|---|---|
| ترجمه بیش از حد تحتاللفظی | از نظر دستوری درست است اما در زبان مقصد غیرطبیعی به نظر میرسد | از یک بازبین بومی بخواهید جملههای خشک را علامت بزند |
| ترجمه بیش از حد خلاقانه | مدل سبک را بهتر میکند اما معنا را جابهجا میکند | ادعاهای کلیدی، شوخیها و استعارهها را با متن مبدأ مقایسه کنید |
| رانش اصطلاحات | یک اصطلاح به چند شکل ترجمه میشود | فهرست اصطلاحات بسازید و خروجی را جستجو کنید |
| یادداشت مترجم اضافهشده | خروجی شامل توضیح یا comment است | عبارت «translation only» را الزامی کنید و خروجی پرسروصدا را رد کنید |
| ناقصشدن خروجی | ترجمه در میانه بخش متوقف میشود | تعداد بخشها و متن پایانی را مقایسه کنید |
| خطا در مدیریت نامها | نام شخصیت یا نویسنده ترجمه، بومیسازی یا تغییر داده میشود | پس از ترجمه همه نامهای اصلی را جستجو کنید |
| آسیب به ارجاعات | ارجاعها، تاریخها یا citationهای داخل براکت تغییر میکنند | ارجاعها و اشارههای عددی را بهصورت نمونهای بررسی کنید |
بهترین مدل فقط مدلی نیست که زیباترین پاراگراف اول را تولید میکند. بهترین مدل، مدلی است که کمترین مشکلات پرهزینه در بازبینی را ایجاد میکند.
از کدام مدل باید استفاده کنید؟
از این جدول تصمیم استفاده کنید:
| پروژه شما | استراتژی پیشفرض مدل | اولویت بازبینی |
|---|---|---|
| مطالعه شخصی | از یک LLM عمومیِ قوی از طریق مترجم اسناد استفاده کنید | فقط بخشهای نامشخص را بررسی کنید |
| داستان ژانری | از مدلی قوی در نثر استفاده کنید، سپس دیالوگ و نامها را نمونهای بررسی کنید | صدا، نامها، انسجام فصلها |
| داستان ادبی یا شعر | از AI فقط بهعنوان پیشنویس یا ابزار مقایسه استفاده کنید | بازبینی ادبی انسانی |
| راهنمای فنی | از مدلی دقیق همراه با checklist اصطلاحات استفاده کنید | اصطلاحات، هشدارها، مراحل شمارهدار |
| مقاله دانشگاهی | از مدلی با دقت فنی بالا و حفظ layout در PDF استفاده کنید | چکیده، نتیجهگیری، معادلات، ارجاعات |
| کتاب خودانتشاری | ابتدا از AI استفاده کنید، سپس هرجا فروش توجیه میکند در بازبینی انسانی سرمایهگذاری کنید | فصل اول، metadata، نقدهای برتر |
اگر برای یک پروژه نشر در حال بودجهبندی هستید، این بنچمارک را در کنار راهنمای هزینه ترجمه کتاب ببینید. اگر میخواهید کیفیت قالببندی و ترجمه را در کنار هم بررسی کنید، از صفحه نمونههای واقعی استفاده کنید.
BookTranslator چگونه از بنچمارکهای مدل استفاده میکند
BookTranslator حول workflow کامل ترجمه ساخته شده است، نه حول ادعای برتری یک مدل. هدف عملی این است که یک PDF یا EPUB را با حفظ ساختار به یک سند ترجمهشده قابلاستفاده تبدیل کند.
این یعنی انتخاب مدل فقط یک بخش از سیستم است:
- سند باید پیش از ترجمه بهدرستی parse شود.
- فصلها، تیترها، جدولها، کپشنها و پاورقیها به رسیدگی متفاوتی نیاز دارند.
- context متن بلند باید مدیریت شود تا نامها و اصطلاحات یکدست بمانند.
- خروجی باید بهصورت یک PDF، EPUB، DOCX یا قالب پشتیبانیشده دیگرِ خوانا بازسازی شود.
- اگر قرار است فایل ترجمهشده منتشر شود یا در موقعیتی حساس استفاده شود، همچنان به بازبینی انسانی نیاز دارد.
وقتی کل pipeline را میخواهید، از ترجمه کتاب استفاده کنید. وقتی سختی اصلی layout است، از مترجم PDF استفاده کنید. وقتی ساختار فصلها و خروجی ebook اهمیت دارد، از مترجم EPUB استفاده کنید.
پرسشهای متداول
بهترین LLM برای ترجمه چیست؟
در بنچمارک ترجمه کتاب ما، Claude Sonnet 4.6 بهترین مدل همهجانبه بود، در حالی که GPT-4.1 برای دقت فنی و دانشگاهی بهترین عملکرد را داشت. DeepSeek V3 و Qwen3 هم بهویژه برای خروجی چینی و زبانهای شرق آسیا بسیار رقابتی بودند. با این حال، بهترین انتخاب شما باید همچنان روی محتوای واقعی خودتان آزمایش شود.
برای ترجمه، GPT بهتر است یا Claude؟
در این بنچمارک، Claude برای صدای ادبی، لحن محاورهای و لحن تجاری قویتر بود. GPT-4.1 برای بخشهای فنی محافظهکارتر و دقیقتر عمل کرد. برای رمان، از Claude شروع کنید. برای مستندات فنی یا محتوای دانشگاهی، پیش از انتخاب، Claude و GPT-4.1 را روی یک نمونه پُر از اصطلاحات مقایسه کنید.
آیا LLMها از Google Translate یا DeepL بهترند؟
برای عبارتهای کوتاه و رایج، موتورهای ترجمه سنتی هنوز هم میتوانند قوی باشند. برای کتابهای بلند، دیالوگ، نثر ادبی و بخشهای حساس به context، LLMها معمولاً انعطافپذیرترند، چون میتوانند از context گستردهتری استفاده کنند. نقطه ضعف این است که خروجی LLM باید از نظر حذف بخشها، یادداشتهای اضافه و انسجام بررسی شود.
آیا میتوانم یک کتاب کامل را با ChatGPT ترجمه کنم؟
میتوانید بخشهایی از یک کتاب را بهصورت دستی در یک رابط چت ترجمه کنید، اما از دست رفتن قالببندی، context، انسجام بین فصلها و نظم خروجی بسیار آسان است. برای یک PDF یا EPUB کامل، یک workflow اسنادی مثل BookTranslator عملیتر است، چون parse فایل، ترجمه و بازسازی را مدیریت میکند.
هر چند وقت یکبار باید بنچمارک ترجمه با LLM را بهروزرسانی کرد؟
هر زمان که یک مدل اصلی تغییر میکند، یک ارائهدهنده routing را عوض میکند یا نوع پروژه شما تغییر میکند، آن را بهروزرسانی کنید. حداقل، پیش از یک ترجمه پولی بزرگ، انتشار یک کتاب یا یک کاربرد دانشگاهی یا فنی حساس، یک بنچمارک داخلی کوچک را دوباره اجرا کنید.
پیش از اعتماد به یک مدل، چه چیزی را باید آزمایش کنم؟
یک بخش نماینده، یک بخش دشوار و یک بخش بلند را آزمایش کنید. معنا، روانی، لحن، اصطلاحات، کامل بودن و نشانههای قالببندی را بررسی کنید. اگر مدل در بخش دشوار شکست میخورد، فرض نکنید که در سراسر یک کتاب کامل بهتر رفتار خواهد کرد.
مطالب مرتبط





