ترجمه PDF اسکنشده: مشکلات OCR و راهحلهای عملی
بیاموزید چگونه PDFهای اسکنشده را OCR و ترجمه کنید، خطاهای رایج تشخیص را عیبیابی کنید و صفحهآرایی را با یک جریان کاری آگاه از سند حفظ کنید.

پاسخ سریع: یک PDF اسکنشده قبل از ترجمه به OCR نیاز دارد
برای ترجمه یک PDF اسکنشده، ابتدا OCR را اجرا کنید تا تصاویر صفحه به متن قابل انتخاب تبدیل شوند. سپس PDF پردازششده با OCR را با یک مترجم سند مانند مترجم PDF ترجمه کنید. اگر OCR را رد کنید، بسیاری از ابزارهای ترجمه فایل اصلی را بدون تغییر برمیگردانند، صفحاتی را از دست میدهند یا فقط بخشهایی را که از قبل دارای لایه متنی هستند ترجمه میکنند.
از این جریان کاری استفاده کنید:
- PDF را باز کنید و سعی کنید یک جمله را انتخاب کنید.
- اگر نمیتوانید متن را انتخاب کنید، OCR را اجرا کنید.
- متن OCR را قبل از ترجمه بررسی کنید.
- PDF پردازششده با OCR را در مترجم PDF آپلود کنید.
- خروجی ترجمه شده را با اسکن اصلی مقایسه کنید.
اگر PDF شما از قبل دارای متن قابل انتخاب است و مشکل حفظ صفحهآرایی است، از راهنمای ترجمه PDF بدون از دست دادن قالببندی استفاده کنید.
چرا PDFهای اسکنشده در ابزارهای ترجمه با شکست مواجه میشوند
یک PDF اسکنشده اغلب فقط مجموعهای از تصاویر صفحه در داخل یک کانتینر PDF است. صفحه ممکن است کلمات را به یک انسان نشان دهد، اما فایل ممکن است حاوی متن واقعی برای استخراج توسط نرمافزار نباشد.
این یک شکست ساده ایجاد میکند:
| نوع فایل | آنچه مترجم میبیند | چه اتفاقی میافتد |
|---|---|---|
| PDF مبتنی بر متن | متن به اضافه دادههای صفحهآرایی | ترجمه میتواند بلافاصله شروع شود. |
| PDF اسکنشده فقط تصویر | تصاویر صفحات | ابتدا OCR مورد نیاز است. |
| PDF متن روی تصویر | تصویر اسکن به اضافه لایه متنی پنهان OCR | ترجمه میتواند کار کند، اما خطاهای OCR بر کیفیت تأثیر میگذارند. |
مفیدترین آزمایش فنی نیست:
- PDF را باز کنید.
- سعی کنید کلمات فردی را برجسته کنید.
- یک جمله را کپی کنید.
- آن را در یک ویرایشگر متن قرار دهید.
اگر جمله به درستی جایذاری (Paste) شود، PDF دارای لایه متنی است. اگر چیزی جایگذاری نشود، یا کل صفحه مانند یک تصویر عمل کند، PDF به OCR نیاز دارد.
OCR اختیاری نیست
OCR به معنای تشخیص نوری کاراکترها است. متن را از روی تصویر میخواند و متن قابل خواندن توسط ماشین ایجاد میکند. برای ترجمه PDF، OCR معمولاً یک لایه متنی نامرئی روی صفحه اسکنشده ایجاد میکند.
آن لایه متنی به منبعی برای ترجمه تبدیل میشود. اگر OCR اشتباه کند، ترجمه آن اشتباهات را به ارث میبرد.
خطاهای رایج OCR:
| خطای OCR | خطر ترجمه |
|---|---|
rn به صورت m خوانده میشود | معنی کلمات تغییر میکند. |
1 به صورت l خوانده میشود | اعداد، ارجاعات یا کدها اشتباه میشوند. |
O به صورت 0 خوانده میشود | شناسهها، فرمولها و اسامی ممکن است خراب شوند. |
| اعرابها حذف میشوند | اسامی و اصطلاحات نادرست میشوند. |
| ستونها ادغام میشوند | جملات به ترتیب اشتباه ترجمه میشوند. |
| سلولهای جدول سطر به سطر به طور نادرست خوانده میشوند | برچسبهای داده دیگر با مقادیر مطابقت ندارند. |
| پانویسها به عنوان متن بدنه در نظر گرفته میشوند | استنادها و یادداشتها به زمینه اشتباه منتقل میشوند. |
به همین دلیل است که مرحله بررسی OCR اهمیت دارد. تا زمانی که متن استخراجشده را به صورت موردی بررسی نکردهاید، یک سند اسکنشده را ترجمه نکنید.
جریان کاری اولویتدار OCR
گام ۱: شناسایی نوع PDF
تلاش کنید متن را انتخاب کنید. اگر انتخاب کار میکند، ممکن است به OCR نیاز نداشته باشید. اگر انتخاب با شکست مواجه شد، فایل را به عنوان فقط تصویر در نظر بگیرید.
همچنین صفحه را به صورت بصری بررسی کنید:
- صفحات کج نشاندهنده یک اسکن هستند.
- بافت کاغذ خاکستری نشاندهنده یک اسکن است.
- سایهها در نزدیکی عطف کتاب نشاندهنده یک کتاب عکسبرداریشده است.
- کنتراست ناهموار نشاندهنده یک کپی است.
- عدم یافتن کلمات قابل مشاهده توسط جستجو نشاندهنده این است که هیچ لایه متنی وجود ندارد.
گام ۲: بهبود اسکن در صورت امکان
کیفیت OCR با کیفیت تصویر شروع میشود. اگر میتوانید دوباره اسکن کنید، قبل از صرف وقت برای تعمیر خطاهای OCR این کار را انجام دهید.
از این چکلیست کیفیت تصویر استفاده کنید:
- با وضوح کافی برای متن کوچک اسکن کنید.
- صفحات را صاف و مستقیم نگه دارید.
- از ایجاد سایه در نزدیکی عطف خودداری کنید.
- لبههای جدول، انگشتان یا شلوغیهای پسزمینه را برش دهید.
- از کنتراست قوی بین متن و صفحه استفاده کنید.
- کل خط را قابل مشاهده نگه دارید.
- از جهتگیری صحیح صفحه استفاده کنید.
- تصویر را به قدری فشرده نکنید که حروف تار شوند.
برای کتابهای قدیمی و کپیها، بیشترین دستاوردها معمولاً از صاف کردن، اصلاح کنتراست و اسکن مجدد صفحات خارج از فوکوس حاصل میشود.
گام ۳: اجرای OCR
یک ابزار OCR را بر اساس سند انتخاب کنید، نه برند.
| گزینهی OCR | مناسب برای | مراقب باشید در مورد |
|---|---|---|
| Adobe Acrobat OCR | اسکنهای تجاری عمومی و پاکسازی PDF | قبل از تکیه بر آن، دسترسی طرح فعلی را بررسی کنید. |
| ABBYY FineReader | اسکنهای پیچیده، جداول، ستونها و قالبهای دشوار | همچنان به بررسی دستی نیاز دارد. |
| Tesseract یا OCRmyPDF | جریانهای کاری محلی، فنی و قابل تکرار OCR | به راحتی با ابزارهای خط فرمان نیاز دارد. |
| ابزارهای آنلاین OCR | فایلهای گاه به گاه کمخطر | حریم خصوصی، محدودیتهای فایل و کیفیت متفاوت است. |
| برنامههای اسکن تلفن همراه | ثبت سریع یک اسکن جدید | اعوجاج پرسپکتیو میتواند به OCR آسیب برساند. |
برای قراردادهای خصوصی، سوابق پزشکی، اسناد مالی، دستنوشتههای منتشرنشده، یا کارهای آکادمیک تحت بررسی، یک جریان کاری محلی OCR یا یک محیط مطمئن را ترجیح دهید. اسکنهای حساس را در سایتهای رایگان تصادفی OCR آپلود نکنید.
گام ۴: بررسی متن OCR
قبل از ترجمه بررسی کنید، نه بعد از آن. متن را از چند صفحه دشوار کپی کنید و بررسی کنید که آیا قابل خواندن است یا خیر.
صفحات نمونه برای بازرسی:
- صفحه عنوان.
- یک صفحه بدنه متراکم.
- یک صفحه جدول.
- یک صفحه با پانویس.
- یک صفحه با متن کوچک.
- یک صفحه با مهر، دستخط یا یادداشتهای حاشیهای.
- یک صفحه در هر زبان اگر سند چندزبانه است.
به دنبال موارد زیر باشید:
- پاراگرافهای گمشده.
- ستونهای ادغامشده.
- کلمات شکسته.
- کاراکترهای اشتباه.
- دیاکریتیکهای از دست رفته.
- برچسبهای جدول جدا شده از مقادیر.
- سرصفحههای درج شده در متن بدنه.
- شماره صفحات مخلوط شده در جملات.
اگر کیفیت OCR ضعیف است، آن را قبل از ترجمه اصلاح کنید. یک مترجم نمیتواند معنایی را که OCR هرگز ثبت نکرده است به طور قابل اعتماد بازیابی کند.
گام ۵: ترجمه PDF پردازششده با OCR
هنگامی که PDF دارای یک لایه متنی تمیز شد، آن را در مترجم PDF آپلود کنید. مرحله ترجمه اکنون میتواند به جای تصاویر صفحه، با متن کار کند.
پس از ترجمه، مقایسه کنید:
- اسکن اصلی
- لایه متنی OCR
- PDF ترجمه شده
این بررسی سهجانبه به شما کمک میکند تشخیص دهید که آیا یک خطا از OCR ناشی شده است یا ترجمه. اگر متن OCR اشتباه است، OCR را دوباره اجرا کنید. اگر متن OCR درست است اما ترجمه اشتباه است، ترجمه را اصلاح کنید.
گام ۶: بررسی محتوای پرخطر
اسناد اسکنشده اغلب حاوی دقیقاً همان محتوایی هستند که نیاز به بررسی دقیق دارند: قراردادهای قدیمی، فرمهای دولتی، مقالات آکادمیک، کتابچههای راهنما، اسناد تاریخی و صفحات کتاب.
این موارد را به صورت دستی بررسی کنید:
- اسامی
- تاریخها
- اعداد
- آدرسها
- کدهای محصول
- ارجاعات قانونی
- استنادها
- برچسبهای جدول
- واحدها
- معادلات
- زیرنویسها
- پانویسها
برای فایلهای پژوهشی و آکادمیک، راهنمای ترجمه مقالات پژوهشی آکادمیک را نیز مطالعه کنید، زیرا PDFهای آکادمیک اسکنشده خطرات استناد و صفحهآرایی را به خطرات OCR اضافه میکنند.
مثالهای شکست سهبعدی (پهلو به پهلو)
هنگام بررسی خروجی OCR از این جدول استفاده کنید.
| اسکن اصلی احتمالاً نشان میدهد | خروجی بد OCR | چرا اهمیت دارد |
|---|---|---|
modern | modem | معنی به طور کامل تغییر میکند. |
Section 10 | Section IO | ارجاعات قانونی یا فنی میتوانند خراب شوند. |
2026 | 2O26 | تاریخها و شناسهها غیرقابل اعتماد میشوند. |
patient | patlent | اصطلاحات پزشکی یا فنی اشتباه میشوند. |
| دو ستون مجزا | یک پاراگراف ادغامشده | ترجمه جملات را به ترتیب اشتباه میخواند. |
| سطر جدول با برچسبها و مقادیر | یک خط واحد از متن مخلوط | داده دیگر با برچسب سمت راست مطابقت ندارد. |
نشانگر پانویس 1 | حرف l | یادداشتها ممکن است به جمله اشتباه متصل شوند. |
اگر این خطاها را در لایه OCR دیدید، OCR را قبل از ترجمه اصلاح کنید.
از چه ابزاری باید استفاده کنید؟
بر اساس دشواری سند انتخاب کنید.
| سند | مسیر پیشنهادی |
|---|---|
| اسکن تجاری تمیز | OCR در Acrobat یا یک ابزار OCR قابل اعتماد دیگر، سپس مترجم PDF. |
| اسکن کتاب قدیمی | صاف کردن و بهبود کنتراست، OCR با دقت، سپس ترجمه. |
| اسکن مقاله آکادمیک | OCR، بررسی معادلات/استنادها/جداول، سپس ترجمه با بررسی صفحهآرایی. |
| یادداشتهای دستنویس | ممکن است قبل از ترجمه به رونویسی دستی نیاز باشد. |
| سند شخصی ساده | اگر خطر حریم خصوصی کم باشد، OCR آنلاین ممکن است قابل قبول باشد. |
| سند حساس | از OCR محلی یا یک جریان کاری کنترلشده مورد اعتماد استفاده کنید. |
اگر مقایسه ابزار گستردهتری میخواهید، راهنمای بهترین مترجم PDF را ببینید.
مشکلات رایج PDF اسکنشده
صفحات با وضوح پایین
اسکنهای با وضوح پایین حروف را در هم ادغام میکنند. OCR ممکن است rn را با m، cl را با d، یا علائم نگارشی را با گرد و غبار اشتباه بگیرد.
راهحل: در صورت امکان دوباره اسکن کنید. اگر امکانپذیر نیست، کنتراست را افزایش دهید و OCR را دوباره امتحان کنید.
صفحات کج یا منحنی
اسکن کتابها اغلب در نزدیکی عطف منحنی میشوند. OCR خطوط منحنی را به خوبی نمیخواند و ممکن است متن را مرتبسازی مجدد کند.
راهحل: صفحه را صاف کنید، دوباره اسکن کنید، یا از یک ابزار OCR با قابلیت صاف کردن (Deskew) و رفع انحنا (Dewarping) استفاده کنید.
طرحبندی چندستونی
OCR میتواند ستونهای چپ و راست را در یک جریان جمله واحد ادغام کند.
راهحل: ترتیب خواندن را قبل از ترجمه بررسی کنید. مقالات آکادمیک در اینجا نیاز به توجه ویژه دارند.
جداول
جداول دشوار هستند زیرا OCR باید هم متن و هم ساختار را تشخیص دهد. یک جدول میتواند از نظر بصری درست به نظر برسد در حالی که لایه متنی آن اشتباه است.
راهحل: متن OCR را از جدول کپی کنید و تأیید کنید که برچسبها همچنان با مقادیر مطابقت دارند.
دستخط و امضاها
OCR متن چاپی بسیار قابل اعتمادتر از تشخیص دستخط است. یادداشتهای حاشیهای دستنویس، امضاها و فرمهای پر شده ممکن است نادیده گرفته شوند یا مخدوش شوند.
راهحل: دستخطهای ضروری را قبل از ترجمه به صورت دستی رونویسی کنید.
زبانهای مختلط
OCR زمانی بهترین عملکرد را دارد که زبان مبدأ را بداند. یک اسکن با زبانهای انگلیسی، فرانسوی و چینی اگر OCR فقط روی یک زبان تنظیم شده باشد، ممکن است با شکست مواجه شود.
راهحل: اگر ابزار پشتیبانی میکند، تمام زبانهای مرتبط OCR را انتخاب کنید، سپس هر بخش زبان را به صورت موردی بررسی کنید.
چکلیست حریم خصوصی و امنیت
قبل از آپلود یک PDF اسکنشده در هر جایی، بپرسید:
- آیا سند حاوی دادههای شخصی است؟
- آیا شامل مطالب پزشکی، حقوقی، مالی، آکادمیک یا منتشرنشده است؟
- آیا مشمول توافقنامه مشتری یا خطمشی مدرسه است؟
- آیا سرویس OCR آنلاین برای این سند مجاز است؟
- آیا به جای آن به یک جریان کاری محلی نیاز دارید؟
- آیا میتوانید صفحاتی را که نیازی به ترجمه ندارند حذف کنید؟
PDFهای اسکنشده اغلب حساس هستند زیرا از قراردادها، شناسهها، فرمها، پیشنویسهای پژوهشی و آرشیوهای داخلی میآیند. تصمیمات مربوط به آپلود OCR را دقیقاً مانند سند اصلی مدیریت کنید.
مطالب مرتبط





