BookTranslator
BookTranslator

ترجمه PDF اسکن‌شده: مشکلات OCR و راه‌حل‌های عملی

بیاموزید چگونه PDFهای اسکن‌شده را OCR و ترجمه کنید، خطاهای رایج تشخیص را عیب‌یابی کنید و صفحه‌آرایی را با یک جریان کاری آگاه از سند حفظ کنید.

BookTranslator

BookTranslator Team

11 min read

پاسخ سریع: یک PDF اسکن‌شده قبل از ترجمه به OCR نیاز دارد

برای ترجمه یک PDF اسکن‌شده، ابتدا OCR را اجرا کنید تا تصاویر صفحه به متن قابل انتخاب تبدیل شوند. سپس PDF پردازش‌شده با OCR را با یک مترجم سند مانند مترجم PDF ترجمه کنید. اگر OCR را رد کنید، بسیاری از ابزارهای ترجمه فایل اصلی را بدون تغییر برمی‌گردانند، صفحاتی را از دست می‌دهند یا فقط بخش‌هایی را که از قبل دارای لایه متنی هستند ترجمه می‌کنند.

از این جریان کاری استفاده کنید:

  1. PDF را باز کنید و سعی کنید یک جمله را انتخاب کنید.
  2. اگر نمی‌توانید متن را انتخاب کنید، OCR را اجرا کنید.
  3. متن OCR را قبل از ترجمه بررسی کنید.
  4. PDF پردازش‌شده با OCR را در مترجم PDF آپلود کنید.
  5. خروجی ترجمه شده را با اسکن اصلی مقایسه کنید.

اگر PDF شما از قبل دارای متن قابل انتخاب است و مشکل حفظ صفحه‌آرایی است، از راهنمای ترجمه PDF بدون از دست دادن قالب‌بندی استفاده کنید.

چرا PDFهای اسکن‌شده در ابزارهای ترجمه با شکست مواجه می‌شوند

یک PDF اسکن‌شده اغلب فقط مجموعه‌ای از تصاویر صفحه در داخل یک کانتینر PDF است. صفحه ممکن است کلمات را به یک انسان نشان دهد، اما فایل ممکن است حاوی متن واقعی برای استخراج توسط نرم‌افزار نباشد.

این یک شکست ساده ایجاد می‌کند:

نوع فایلآنچه مترجم می‌بیندچه اتفاقی می‌افتد
PDF مبتنی بر متنمتن به اضافه داده‌های صفحه‌آراییترجمه می‌تواند بلافاصله شروع شود.
PDF اسکن‌شده فقط تصویرتصاویر صفحاتابتدا OCR مورد نیاز است.
PDF متن روی تصویرتصویر اسکن به اضافه لایه متنی پنهان OCRترجمه می‌تواند کار کند، اما خطاهای OCR بر کیفیت تأثیر می‌گذارند.

مفیدترین آزمایش فنی نیست:

  1. PDF را باز کنید.
  2. سعی کنید کلمات فردی را برجسته کنید.
  3. یک جمله را کپی کنید.
  4. آن را در یک ویرایشگر متن قرار دهید.

اگر جمله به درستی جایذاری (Paste) شود، PDF دارای لایه متنی است. اگر چیزی جایگذاری نشود، یا کل صفحه مانند یک تصویر عمل کند، PDF به OCR نیاز دارد.

OCR اختیاری نیست

OCR به معنای تشخیص نوری کاراکترها است. متن را از روی تصویر می‌خواند و متن قابل خواندن توسط ماشین ایجاد می‌کند. برای ترجمه PDF، OCR معمولاً یک لایه متنی نامرئی روی صفحه اسکن‌شده ایجاد می‌کند.

آن لایه متنی به منبعی برای ترجمه تبدیل می‌شود. اگر OCR اشتباه کند، ترجمه آن اشتباهات را به ارث می‌برد.

خطاهای رایج OCR:

خطای OCRخطر ترجمه
rn به صورت m خوانده می‌شودمعنی کلمات تغییر می‌کند.
1 به صورت l خوانده می‌شوداعداد، ارجاعات یا کدها اشتباه می‌شوند.
O به صورت 0 خوانده می‌شودشناسه‌ها، فرمول‌ها و اسامی ممکن است خراب شوند.
اعراب‌ها حذف می‌شونداسامی و اصطلاحات نادرست می‌شوند.
ستون‌ها ادغام می‌شوندجملات به ترتیب اشتباه ترجمه می‌شوند.
سلول‌های جدول سطر به سطر به طور نادرست خوانده می‌شوندبرچسب‌های داده دیگر با مقادیر مطابقت ندارند.
پانویس‌ها به عنوان متن بدنه در نظر گرفته می‌شونداستنادها و یادداشت‌ها به زمینه اشتباه منتقل می‌شوند.

به همین دلیل است که مرحله بررسی OCR اهمیت دارد. تا زمانی که متن استخراج‌شده را به صورت موردی بررسی نکرده‌اید، یک سند اسکن‌شده را ترجمه نکنید.

جریان کاری اولویت‌دار OCR

گام ۱: شناسایی نوع PDF

تلاش کنید متن را انتخاب کنید. اگر انتخاب کار می‌کند، ممکن است به OCR نیاز نداشته باشید. اگر انتخاب با شکست مواجه شد، فایل را به عنوان فقط تصویر در نظر بگیرید.

همچنین صفحه را به صورت بصری بررسی کنید:

  • صفحات کج نشان‌دهنده یک اسکن هستند.
  • بافت کاغذ خاکستری نشان‌دهنده یک اسکن است.
  • سایه‌ها در نزدیکی عطف کتاب نشان‌دهنده یک کتاب عکس‌برداری‌شده است.
  • کنتراست ناهموار نشان‌دهنده یک کپی است.
  • عدم یافتن کلمات قابل مشاهده توسط جستجو نشان‌دهنده این است که هیچ لایه متنی وجود ندارد.

گام ۲: بهبود اسکن در صورت امکان

کیفیت OCR با کیفیت تصویر شروع می‌شود. اگر می‌توانید دوباره اسکن کنید، قبل از صرف وقت برای تعمیر خطاهای OCR این کار را انجام دهید.

از این چک‌لیست کیفیت تصویر استفاده کنید:

  • با وضوح کافی برای متن کوچک اسکن کنید.
  • صفحات را صاف و مستقیم نگه دارید.
  • از ایجاد سایه در نزدیکی عطف خودداری کنید.
  • لبه‌های جدول، انگشتان یا شلوغی‌های پس‌زمینه را برش دهید.
  • از کنتراست قوی بین متن و صفحه استفاده کنید.
  • کل خط را قابل مشاهده نگه دارید.
  • از جهت‌گیری صحیح صفحه استفاده کنید.
  • تصویر را به قدری فشرده نکنید که حروف تار شوند.

برای کتاب‌های قدیمی و کپی‌ها، بیشترین دستاوردها معمولاً از صاف کردن، اصلاح کنتراست و اسکن مجدد صفحات خارج از فوکوس حاصل می‌شود.

گام ۳: اجرای OCR

یک ابزار OCR را بر اساس سند انتخاب کنید، نه برند.

گزینه‌ی OCRمناسب برایمراقب باشید در مورد
Adobe Acrobat OCRاسکن‌های تجاری عمومی و پاک‌سازی PDFقبل از تکیه بر آن، دسترسی طرح فعلی را بررسی کنید.
ABBYY FineReaderاسکن‌های پیچیده، جداول، ستون‌ها و قالب‌های دشوارهمچنان به بررسی دستی نیاز دارد.
Tesseract یا OCRmyPDFجریان‌های کاری محلی، فنی و قابل تکرار OCRبه راحتی با ابزارهای خط فرمان نیاز دارد.
ابزارهای آنلاین OCRفایل‌های گاه به گاه کم‌خطرحریم خصوصی، محدودیت‌های فایل و کیفیت متفاوت است.
برنامه‌های اسکن تلفن همراهثبت سریع یک اسکن جدیداعوجاج پرسپکتیو می‌تواند به OCR آسیب برساند.

برای قراردادهای خصوصی، سوابق پزشکی، اسناد مالی، دست‌نوشته‌های منتشرنشده، یا کارهای آکادمیک تحت بررسی، یک جریان کاری محلی OCR یا یک محیط مطمئن را ترجیح دهید. اسکن‌های حساس را در سایت‌های رایگان تصادفی OCR آپلود نکنید.

گام ۴: بررسی متن OCR

قبل از ترجمه بررسی کنید، نه بعد از آن. متن را از چند صفحه دشوار کپی کنید و بررسی کنید که آیا قابل خواندن است یا خیر.

صفحات نمونه برای بازرسی:

  • صفحه عنوان.
  • یک صفحه بدنه متراکم.
  • یک صفحه جدول.
  • یک صفحه با پانویس.
  • یک صفحه با متن کوچک.
  • یک صفحه با مهر، دست‌خط یا یادداشت‌های حاشیه‌ای.
  • یک صفحه در هر زبان اگر سند چندزبانه است.

به دنبال موارد زیر باشید:

  • پاراگراف‌های گم‌شده.
  • ستون‌های ادغام‌شده.
  • کلمات شکسته.
  • کاراکترهای اشتباه.
  • دی‌اکریتیک‌های از دست رفته.
  • برچسب‌های جدول جدا شده از مقادیر.
  • سرصفحه‌های درج شده در متن بدنه.
  • شماره صفحات مخلوط شده در جملات.

اگر کیفیت OCR ضعیف است، آن را قبل از ترجمه اصلاح کنید. یک مترجم نمی‌تواند معنایی را که OCR هرگز ثبت نکرده است به طور قابل اعتماد بازیابی کند.

گام ۵: ترجمه PDF پردازش‌شده با OCR

هنگامی که PDF دارای یک لایه متنی تمیز شد، آن را در مترجم PDF آپلود کنید. مرحله ترجمه اکنون می‌تواند به جای تصاویر صفحه، با متن کار کند.

پس از ترجمه، مقایسه کنید:

  • اسکن اصلی
  • لایه متنی OCR
  • PDF ترجمه شده

این بررسی سه‌جانبه به شما کمک می‌کند تشخیص دهید که آیا یک خطا از OCR ناشی شده است یا ترجمه. اگر متن OCR اشتباه است، OCR را دوباره اجرا کنید. اگر متن OCR درست است اما ترجمه اشتباه است، ترجمه را اصلاح کنید.

گام ۶: بررسی محتوای پرخطر

اسناد اسکن‌شده اغلب حاوی دقیقاً همان محتوایی هستند که نیاز به بررسی دقیق دارند: قراردادهای قدیمی، فرم‌های دولتی، مقالات آکادمیک، کتابچه‌های راهنما، اسناد تاریخی و صفحات کتاب.

این موارد را به صورت دستی بررسی کنید:

  • اسامی
  • تاریخ‌ها
  • اعداد
  • آدرس‌ها
  • کدهای محصول
  • ارجاعات قانونی
  • استنادها
  • برچسب‌های جدول
  • واحدها
  • معادلات
  • زیرنویس‌ها
  • پانویس‌ها

برای فایل‌های پژوهشی و آکادمیک، راهنمای ترجمه مقالات پژوهشی آکادمیک را نیز مطالعه کنید، زیرا PDFهای آکادمیک اسکن‌شده خطرات استناد و صفحه‌آرایی را به خطرات OCR اضافه می‌کنند.

مثال‌های شکست سه‌بعدی (پهلو به پهلو)

هنگام بررسی خروجی OCR از این جدول استفاده کنید.

اسکن اصلی احتمالاً نشان می‌دهدخروجی بد OCRچرا اهمیت دارد
modernmodemمعنی به طور کامل تغییر می‌کند.
Section 10Section IOارجاعات قانونی یا فنی می‌توانند خراب شوند.
20262O26تاریخ‌ها و شناسه‌ها غیرقابل اعتماد می‌شوند.
patientpatlentاصطلاحات پزشکی یا فنی اشتباه می‌شوند.
دو ستون مجزایک پاراگراف ادغام‌شدهترجمه جملات را به ترتیب اشتباه می‌خواند.
سطر جدول با برچسب‌ها و مقادیریک خط واحد از متن مخلوطداده دیگر با برچسب سمت راست مطابقت ندارد.
نشانگر پانویس 1حرف lیادداشت‌ها ممکن است به جمله اشتباه متصل شوند.

اگر این خطاها را در لایه OCR دیدید، OCR را قبل از ترجمه اصلاح کنید.

از چه ابزاری باید استفاده کنید؟

بر اساس دشواری سند انتخاب کنید.

سندمسیر پیشنهادی
اسکن تجاری تمیزOCR در Acrobat یا یک ابزار OCR قابل اعتماد دیگر، سپس مترجم PDF.
اسکن کتاب قدیمیصاف کردن و بهبود کنتراست، OCR با دقت، سپس ترجمه.
اسکن مقاله آکادمیکOCR، بررسی معادلات/استنادها/جداول، سپس ترجمه با بررسی صفحه‌آرایی.
یادداشت‌های دست‌نویسممکن است قبل از ترجمه به رونویسی دستی نیاز باشد.
سند شخصی سادهاگر خطر حریم خصوصی کم باشد، OCR آنلاین ممکن است قابل قبول باشد.
سند حساساز OCR محلی یا یک جریان کاری کنترل‌شده مورد اعتماد استفاده کنید.

اگر مقایسه ابزار گسترده‌تری می‌خواهید، راهنمای بهترین مترجم PDF را ببینید.

مشکلات رایج PDF اسکن‌شده

صفحات با وضوح پایین

اسکن‌های با وضوح پایین حروف را در هم ادغام می‌کنند. OCR ممکن است rn را با m، cl را با d، یا علائم نگارشی را با گرد و غبار اشتباه بگیرد.

راه‌حل: در صورت امکان دوباره اسکن کنید. اگر امکان‌پذیر نیست، کنتراست را افزایش دهید و OCR را دوباره امتحان کنید.

صفحات کج یا منحنی

اسکن کتاب‌ها اغلب در نزدیکی عطف منحنی می‌شوند. OCR خطوط منحنی را به خوبی نمی‌خواند و ممکن است متن را مرتب‌سازی مجدد کند.

راه‌حل: صفحه را صاف کنید، دوباره اسکن کنید، یا از یک ابزار OCR با قابلیت صاف کردن (Deskew) و رفع انحنا (Dewarping) استفاده کنید.

طرح‌بندی چندستونی

OCR می‌تواند ستون‌های چپ و راست را در یک جریان جمله واحد ادغام کند.

راه‌حل: ترتیب خواندن را قبل از ترجمه بررسی کنید. مقالات آکادمیک در اینجا نیاز به توجه ویژه دارند.

جداول

جداول دشوار هستند زیرا OCR باید هم متن و هم ساختار را تشخیص دهد. یک جدول می‌تواند از نظر بصری درست به نظر برسد در حالی که لایه متنی آن اشتباه است.

راه‌حل: متن OCR را از جدول کپی کنید و تأیید کنید که برچسب‌ها همچنان با مقادیر مطابقت دارند.

دست‌خط و امضاها

OCR متن چاپی بسیار قابل اعتمادتر از تشخیص دست‌خط است. یادداشت‌های حاشیه‌ای دست‌نویس، امضاها و فرم‌های پر شده ممکن است نادیده گرفته شوند یا مخدوش شوند.

راه‌حل: دست‌خط‌های ضروری را قبل از ترجمه به صورت دستی رونویسی کنید.

زبان‌های مختلط

OCR زمانی بهترین عملکرد را دارد که زبان مبدأ را بداند. یک اسکن با زبان‌های انگلیسی، فرانسوی و چینی اگر OCR فقط روی یک زبان تنظیم شده باشد، ممکن است با شکست مواجه شود.

راه‌حل: اگر ابزار پشتیبانی می‌کند، تمام زبان‌های مرتبط OCR را انتخاب کنید، سپس هر بخش زبان را به صورت موردی بررسی کنید.

چک‌لیست حریم خصوصی و امنیت

قبل از آپلود یک PDF اسکن‌شده در هر جایی، بپرسید:

  • آیا سند حاوی داده‌های شخصی است؟
  • آیا شامل مطالب پزشکی، حقوقی، مالی، آکادمیک یا منتشرنشده است؟
  • آیا مشمول توافق‌نامه مشتری یا خط‌مشی مدرسه است؟
  • آیا سرویس OCR آنلاین برای این سند مجاز است؟
  • آیا به جای آن به یک جریان کاری محلی نیاز دارید؟
  • آیا می‌توانید صفحاتی را که نیازی به ترجمه ندارند حذف کنید؟

PDFهای اسکن‌شده اغلب حساس هستند زیرا از قراردادها، شناسه‌ها، فرم‌ها، پیش‌نویس‌های پژوهشی و آرشیوهای داخلی می‌آیند. تصمیمات مربوط به آپلود OCR را دقیقاً مانند سند اصلی مدیریت کنید.

مطالب مرتبط