BookTranslator
BookTranslator

स्कैन किए गए PDF का अनुवाद करें: OCR समस्याएं और व्यावहारिक समाधान

स्कैन किए गए PDF का OCR और अनुवाद करना सीखें, सामान्य पहचान विफलताओं का निदान करें, और दस्तावेज़-जागरूक वर्कफ़्लो के साथ लेआउट को सुरक्षित रखें।

BookTranslator

BookTranslator Team

11 min read

त्वरित उत्तर: स्कैन किए गए PDF को अनुवाद से पहले OCR की आवश्यकता होती है

स्कैन किए गए PDF का अनुवाद करने के लिए, पहले पेज की इमेज को चयन योग्य टेक्स्ट में बदलने के लिए OCR चलाएं। फिर PDF Translator जैसे दस्तावेज़ अनुवादक के साथ OCR-प्रोसेस्ड PDF का अनुवाद करें। यदि आप OCR छोड़ देते हैं, तो कई अनुवाद उपकरण मूल फ़ाइल को अपरिवर्तित लौटा देंगे, पृष्ठों को छोड़ देंगे, या केवल उन भागों का अनुवाद करेंगे जिनमें पहले से ही टेक्स्ट लेयर मौजूद है।

इस वर्कफ़्लो का उपयोग करें:

  1. PDF खोलें और एक वाक्य का चयन करने का प्रयास करें।
  2. यदि आप टेक्स्ट का चयन नहीं कर सकते हैं, तो OCR चलाएं।
  3. अनुवाद करने से पहले OCR टेक्स्ट की समीक्षा करें।
  4. OCR-प्रोसेस्ड PDF को PDF Translator पर अपलोड करें।
  5. मूल स्कैन के मुकाबले अनुवादित आउटपुट की समीक्षा करें।

यदि आपके PDF में पहले से ही चयन योग्य टेक्स्ट है और समस्या लेआउट को सुरक्षित रखने की है, तो बिना फॉर्मेट खोए PDF का अनुवाद करें गाइड का उपयोग करें।

अनुवाद उपकरणों में स्कैन किए गए PDF क्यों विफल होते हैं

स्कैन किया गया PDF अक्सर एक PDF कंटेनर के भीतर केवल पृष्ठ इमेज का एक सेट होता है। पृष्ठ किसी इंसान को शब्द दिखा सकता है, लेकिन फ़ाइल में सॉफ़्टवेयर द्वारा निकालने के लिए वास्तविक टेक्स्ट नहीं हो सकता है।

यह एक साधारण विफलता पैदा करता है:

फ़ाइल प्रकारअनुवादक क्या देखता हैक्या होता है
टेक्स्ट-आधारित PDFटेक्स्ट और लेआउट डेटाअनुवाद तुरंत शुरू हो सकता है।
केवल-इमेज स्कैन किया गया PDFपृष्ठों की तस्वीरेंपहले OCR आवश्यक है।
टेक्स्ट-ओवर-इमेज PDFस्कैन इमेज और छिपी हुई OCR टेक्स्ट लेयरअनुवाद काम कर सकता है, लेकिन OCR त्रुटियां गुणवत्ता को प्रभावित करती हैं।

सबसे उपयोगी परीक्षण तकनीकी नहीं है:

  1. PDF खोलें।
  2. व्यक्तिगत शब्दों को हाइलाइट करने का प्रयास करें।
  3. एक वाक्य कॉपी करें।
  4. इसे टेक्स्ट एडिटर में पेस्ट करें।

यदि वाक्य सही ढंग से पेस्ट हो जाता है, तो PDF में एक टेक्स्ट लेयर है। यदि कुछ भी पेस्ट नहीं होता है, या पूरा पृष्ठ एक इमेज की तरह व्यवहार करता है, तो PDF को OCR की आवश्यकता है।

OCR वैकल्पिक नहीं है

OCR का मतलब ऑप्टिकल कैरेक्टर रिकग्निशन है। यह एक इमेज से टेक्स्ट पढ़ता है और मशीन-पठनीय टेक्स्ट बनाता है। PDF अनुवाद के लिए, OCR आमतौर पर स्कैन किए गए पृष्ठ पर एक अदृश्य टेक्स्ट लेयर बनाता है।

वह टेक्स्ट लेयर अनुवाद का स्रोत बन जाती है। यदि OCR गलतियां करता है, तो अनुवाद उन गलतियों को विरासत में ले लेता है।

सामान्य OCR गलतियां:

OCR गलतीअनुवाद जोखिम
rn को m पढ़ा गयाशब्दों का अर्थ बदल जाता है।
1 को l पढ़ा गयानंबर, संदर्भ या कोड गलत हो जाते हैं।
O को 0 पढ़ा गयाआईडी, फॉर्म और नाम टूट सकते हैं।
एक्सेंट हटा दिए गएनाम और शर्तें अशुद्ध हो जाती हैं।
कॉलम मर्ज किए गएवाक्य गलत क्रम में अनुवादित होते हैं।
टेबल सेल को गलत तरीके से पंक्ति दर पंक्ति पढ़ा गयाडेटा लेबल अब मानों से मेल नहीं खाते हैं।
फ़ुटनोट को बॉडी टेक्स्ट के रूप में माना गयाउद्धरण और नोट्स गलत संदर्भ में चले जाते हैं।

इसीलिए OCR समीक्षा चरण महत्वपूर्ण है। किसी स्कैन किए गए दस्तावेज़ का तब तक अनुवाद न करें जब तक आपने निकाले गए टेक्स्ट की स्पॉट-चेक न कर ली हो।

OCR-पहला वर्कफ़्लो

चरण 1: PDF प्रकार की पहचान करें

टेक्स्ट चुनने का प्रयास करें। यदि चयन काम करता है, तो आपको OCR की आवश्यकता नहीं हो सकती है। यदि चयन विफल रहता है, तो फ़ाइल को केवल-इमेज मानें।

पृष्ठ का दृश्य रूप से भी निरीक्षण करें:

  • तिरछे पृष्ठ स्कैन का सुझाव देते हैं।
  • ग्रे पेपर टेक्सचर स्कैन का सुझाव देता है।
  • रीढ़ के पास की छाया एक फोटोग्राफ की गई किताब का सुझाव देती है।
  • असमान कंट्रास्ट फोटोकॉपी का सुझाव देता है।
  • खोज से दृश्य शब्द न मिलना यह सुझाव देता है कि कोई टेक्स्ट लेयर नहीं है।

चरण 2: यदि संभव हो तो स्कैन में सुधार करें

OCR की गुणवत्ता इमेज की गुणवत्ता से शुरू होती है। यदि आप फिर से स्कैन कर सकते हैं, तो OCR त्रुटियों को सुधारने में समय बिताने से पहले ऐसा करें।

इस इमेज-गुणवत्ता चेकलिस्ट का उपयोग करें:

  • छोटे टेक्स्ट के लिए पर्याप्त उच्च रिज़ॉल्यूशन पर स्कैन करें।
  • पृष्ठों को सपाट और सीधा रखें।
  • रीढ़ के पास छाया से बचें।
  • टेबल के किनारों, उंगलियों या पृष्ठभूमि के कचरे को क्रॉप करें।
  • टेक्स्ट और पेज के बीच मजबूत कंट्रास्ट का उपयोग करें।
  • पूरी लाइन दिखाई देनी चाहिए।
  • सही पृष्ठ ओरिएंटेशन का उपयोग करें।
  • इमेज को इतना भारी संपीड़ित न करें कि अक्षर धुंधले हो जाएं।

पुरानी किताबों और फोटोकॉपी के लिए, सबसे बड़ा फायदा आमतौर पर डेस्क्यूइंग, कंट्रास्ट करेक्शन और आउट-ऑफ-फोकस पृष्ठों को फिर से स्कैन करने से मिलता है।

चरण 3: OCR चलाएं

ब्रांड के बजाय दस्तावेज़ के आधार पर OCR टूल चुनें।

OCR विकल्पकिसके लिए सबसे अच्छा हैसावधान रहें
Adobe Acrobat OCRसामान्य व्यावसायिक स्कैन और PDF सफाईइस पर भरोसा करने से पहले वर्तमान योजना एक्सेस की जांच करें।
ABBYY FineReaderजटिल स्कैन, टेबल, कॉलम और कठिन लेआउटअभी भी मैन्युअल समीक्षा की आवश्यकता है।
Tesseract या OCRmyPDFस्थानीय, तकनीकी, दोहराए जाने वाले OCR वर्कफ़्लोकमांड-लाइन टूल के साथ सहजता की आवश्यकता होती है।
ऑनलाइन OCR टूलकम जोखिम वाली कभी-कभार की फाइलेंगोपनीयता, फ़ाइल सीमाएं और गुणवत्ता भिन्न होती हैं।
फोन स्कैनिंग ऐपएक नया स्कैन जल्दी से कैप्चर करनापरिप्रेक्ष्य विरूपण OCR को नुकसान पहुंचा सकता है।

निजी अनुबंधों, चिकित्सा रिकॉर्ड, वित्तीय दस्तावेजों, अप्रकाशित पांडुलिपियों या समीक्षा के तहत शैक्षणिक कार्य के लिए, स्थानीय OCR वर्कफ़्लो या एक विश्वसनीय वातावरण पसंद करें। संवेदनशील स्कैन को यादृच्छिक मुफ्त OCR साइटों पर अपलोड न करें।

चरण 4: OCR टेक्स्ट की समीक्षा करें

अनुवाद के बाद नहीं, अनुवाद से पहले समीक्षा करें। कई कठिन पृष्ठों से टेक्स्ट कॉपी करें और जांचें कि क्या यह पठनीय है।

निरीक्षण करने के लिए नमूना पृष्ठ:

  • शीर्षक पृष्ठ।
  • एक सघन बॉडी पेज।
  • एक टेबल पेज।
  • फ़ुटनोट वाला एक पृष्ठ।
  • छोटे टेक्स्ट वाला एक पृष्ठ।
  • स्टाम्प, हस्तलेखन या हाशिये के नोट वाला एक पृष्ठ।
  • यदि दस्तावेज़ बहुभाषी है तो प्रत्येक भाषा में एक पृष्ठ।

इनकी तलाश करें:

  • छूटे हुए पैराग्राफ।
  • मर्ज किए गए कॉलम।
  • टूटे हुए शब्द।
  • गलत वर्ण।
  • खोए हुए डायसिटिक्स।
  • मानों से अलग किए गए टेबल लेबल।
  • बॉडी टेक्स्ट में डाले गए हेडर।
  • वाक्यों में मिश्रित पृष्ठ संख्याएं।

यदि OCR की गुणवत्ता खराब है, तो अनुवाद से पहले इसे ठीक करें। एक अनुवादक उस अर्थ को मज़बूती से पुनर्प्राप्त नहीं कर सकता है जिसे OCR ने कभी कैप्चर नहीं किया था।

चरण 5: OCR-प्रोसेस्ड PDF का अनुवाद करें

एक बार जब PDF में एक साफ टेक्स्ट लेयर आ जाती है, तो इसे PDF Translator पर अपलोड करें। अनुवाद चरण अब पृष्ठ इमेज के बजाय टेक्स्ट के साथ काम कर सकता है।

अनुवाद के बाद, तुलना करें:

  • मूल स्कैन
  • OCR टेक्स्ट लेयर
  • अनुवादित PDF

यह तीन-तरफा समीक्षा आपको यह पहचानने में मदद करती है कि त्रुटि OCR से आई है या अनुवाद से। यदि OCR टेक्स्ट गलत है, तो OCR को फिर से चलाएं। यदि OCR टेक्स्ट सही है लेकिन अनुवाद गलत है, तो अनुवाद को ठीक करें।

चरण 6: उच्च-जोखिम वाली सामग्री की समीक्षा करें

स्कैन किए गए दस्तावेजों में अक्सर ऐसी सामग्री होती है जिसे सावधानीपूर्वक समीक्षा की आवश्यकता होती है: पुराने अनुबंध, सरकारी फॉर्म, अकादमिक पेपर, मैनुअल, ऐतिहासिक दस्तावेज और पुस्तक पृष्ठ।

इन मदों की मैन्युअल रूप से समीक्षा करें:

  • नाम
  • तिथियां
  • नंबर
  • पते
  • उत्पाद कोड
  • कानूनी संदर्भ
  • उद्धरण
  • टेबल लेबल
  • इकाइयां
  • समीकरण
  • कैप्शन
  • फ़ुटनोट

शोध और अकादमिक फाइलों के लिए, अकादमिक शोध पत्रों का अनुवाद करें गाइड भी पढ़ें, क्योंकि स्कैन किए गए अकादमिक PDF OCR जोखिम के ऊपर उद्धरण और लेआउट जोखिम जोड़ते हैं।

साइड-बाय-साइड विफलता के उदाहरण

OCR आउटपुट की समीक्षा करते समय इस तालिका का उपयोग करें।

मूल स्कैन संभवतः दिखाता हैखराब OCR आउटपुटयह क्यों महत्वपूर्ण है
modernmodemअर्थ पूरी तरह से बदल जाता है।
Section 10Section IOकानूनी या तकनीकी संदर्भ टूट सकते हैं।
20262O26तिथियां और आईडी अविश्वसनीय हो जाती हैं।
patientpatlentचिकित्सा या तकनीकी शब्द गलत हो जाते हैं।
दो अलग-अलग कॉलमएक मर्ज किया गया पैराग्राफअनुवाद वाक्यों को गलत क्रम में पढ़ता है।
लेबल और मानों के साथ टेबल पंक्तिमिश्रित टेक्स्ट की एक ही पंक्तिडेटा अब सही लेबल से मेल नहीं खाता है।
फ़ुटनोट मार्कर 1अक्षर lनोट्स गलत वाक्य से जुड़ सकते हैं।

यदि आप OCR लेयर में इन त्रुटियों को देखते हैं, तो अनुवाद करने से पहले OCR को ठीक करें।

आपको किस टूल का उपयोग करना चाहिए?

दस्तावेज़ की कठिनाई के आधार पर चुनें।

दस्तावेज़अनुशंसित मार्ग
साफ व्यावसायिक स्कैनAcrobat या किसी अन्य विश्वसनीय OCR टूल में OCR, फिर PDF Translator
पुरानी किताब का स्कैनडेस्क्यू करें और कंट्रास्ट में सुधार करें, सावधानी से OCR करें, फिर अनुवाद करें।
अकादमिक पेपर स्कैनOCR, समीकरणों/उद्धरणों/टेबल की समीक्षा करें, फिर लेआउट समीक्षा के साथ अनुवाद करें।
हस्तलिखित नोट्सअनुवाद से पहले मैन्युअल ट्रांसक्रिप्शन की आवश्यकता हो सकती है।
साधारण व्यक्तिगत दस्तावेज़यदि गोपनीयता का जोखिम कम है तो ऑनलाइन OCR स्वीकार्य हो सकता है।
संवेदनशील दस्तावेज़स्थानीय OCR या एक विश्वसनीय नियंत्रित वर्कफ़्लो का उपयोग करें।

यदि आप व्यापक टूल तुलना चाहते हैं, तो सर्वश्रेष्ठ PDF अनुवादक गाइड देखें।

सामान्य स्कैन की गई PDF समस्याएं

निम्न-रिज़ॉल्यूशन पृष्ठ

कम-रिज़ॉल्यूशन स्कैन अक्षरों को एक साथ धुंधला कर देते हैं। OCR rn और m, cl और d, या विराम चिह्न और धूल को भ्रमित कर सकता है।

समाधान: यदि संभव हो तो फिर से स्कैन करें। यदि नहीं, तो कंट्रास्ट बढ़ाएं और फिर से OCR का प्रयास करें।

तिरछे या मुड़े हुए पृष्ठ

पुस्तक के स्कैन अक्सर रीढ़ के पास मुड़ जाते हैं। OCR मुड़ी हुई लाइनों को खराब तरीके से पढ़ता है और टेक्स्ट को पुनर्व्यवस्थित कर सकता है।

समाधान: पृष्ठ को समतल करें, पुनः स्कैन करें, या डेस्क्यू और डीवार्पिंग के साथ OCR टूल का उपयोग करें।

बहु-कॉलम लेआउट

OCR बाएं और दाएं कॉलम को एक वाक्य स्ट्रीम में मर्ज कर सकता है।

समाधान: अनुवाद से पहले पढ़ने के क्रम का निरीक्षण करें। अकादमिक पत्रों को यहां विशेष ध्यान देने की आवश्यकता है।

टेबल

टेबल कठिन हैं क्योंकि OCR को टेक्स्ट और संरचना दोनों का पता लगाना होता है। एक टेबल दृश्य रूप से सही दिख सकती है जबकि टेक्स्ट लेयर गलत है।

समाधान: टेबल से OCR टेक्स्ट को कॉपी करें और पुष्टि करें कि लेबल अभी भी मानों से मेल खाते हैं।

हस्तलेखन और हस्ताक्षर

मुद्रित टेक्स्ट OCR हस्तलेखन पहचान की तुलना में बहुत अधिक विश्वसनीय है। हस्तलिखित मार्जिन नोट्स, हस्ताक्षर और भरे हुए फॉर्म छूट सकते हैं या गड़बड़ हो सकते हैं।

समाधान: अनुवाद से पहले आवश्यक हस्तलेखन को मैन्युअल रूप से ट्रांसक्राइब करें।

मिश्रित भाषाएं

OCR तब सबसे अच्छा काम करता है जब वह स्रोत भाषा को जानता है। अंग्रेजी, फ्रेंच और चीनी वाला स्कैन विफल हो सकता है यदि OCR केवल एक भाषा पर सेट है।

समाधान: यदि टूल इसका समर्थन करता है तो सभी प्रासंगिक OCR भाषाओं को चुनें, फिर प्रत्येक भाषा अनुभाग की स्पॉट-चेक करें।

गोपनीयता और सुरक्षा चेकलिस्ट

कहीं भी स्कैन किया गया PDF अपलोड करने से पहले, पूछें:

  • क्या दस्तावेज़ में व्यक्तिगत डेटा है?
  • क्या इसमें चिकित्सा, कानूनी, वित्तीय, अकादमिक या अप्रकाशित सामग्री शामिल है?
  • क्या यह क्लाइंट समझौते या स्कूल नीति द्वारा कवर किया गया है?
  • क्या इस दस्तावेज़ के लिए ऑनलाइन OCR सेवा की अनुमति है?
  • क्या आपको इसके बजाय स्थानीय वर्कफ़्लो की आवश्यकता है?
  • क्या आप उन पृष्ठों को हटा सकते हैं जिन्हें अनुवाद की आवश्यकता नहीं है?

स्कैन किए गए PDF अक्सर संवेदनशील होते हैं क्योंकि वे अनुबंधों, आईडी, फॉर्म, शोध ड्राफ्ट और आंतरिक अभिलेखागार से आते हैं। OCR अपलोड निर्णयों के साथ उसी तरह व्यवहार करें जैसे आप मूल दस्तावेज़ के साथ करेंगे।

संबंधित लेख