BookTranslator
BookTranslator

PDF ကူးထည့်သောအခါ စာသားများ မှားယောင်နေပါသလား။ စာသားအလွှာ (Text Layer) ကို ဦးစွာ စစ်ဆေးပါ

PDF တစ်ခုသည် ကြည့်ကောင်းနေသော်လည်း မှားယောင်နေသော စာလုံး သို့မဟုတ် နံပါတ်များကို ကူးထည့်မိတတ်သည်။ စာသားအလွှာဆိုင်ရာ ပြဿနာများကို ဖော်ထုတ်ရန်နှင့် သင်ကိုယ်တိုင် စစ်ဆေးအတည်ပြုနိုင်သော ပြုပြင်မှုကို ရွေးချယ်ရန် နမူနာဖိုင်လေးခုကို အသုံးပြုပါ။

PDF တစ်ခုသည် ကြည့်ရသည်မှာ မှန်ကန်နေသော်လည်း ကူးထည့်လိုက်သောအခါ စာသားမှားနေပါက ကူးထည့်ထားသော ဗားရှင်းကို မူရင်းအရင်းအမြစ်အဖြစ် ဆက်မသုံးပါနှင့်။ ဦးစွာ စာသားတိုလေးတစ်ခုကို မြင်နေရာ စာမျက်နှာနှင့် နှိုင်းယှဉ်ကြည့်ပါ- အမည်တစ်ခု၊ ဝါကျတစ်ကြောင်းနှင့် နံပါတ်တစ်ခုတို့ ဖြစ်သည်။ နောက်တစ်ဆင့်မှာ ဖိုင်တွင် ထုတ်ယူ၍ရသော စာသား လုံးဝမရှိခြင်း၊ စာလုံးပုံဖော်မှု (character mapping) မှားယောင်နေခြင်း၊ တိကျမှုမရှိသော လျှို့ဝှက် OCR အလွှာ ပါရှိနေခြင်း သို့မဟုတ် ဖတ်ရှုသည့်အစဉ်လိုက် (reading-order) ပြဿနာ ရှိနေခြင်းတို့အပေါ် မူတည်ပါသည်။ စာရွက်စာတမ်းတစ်ခုလုံးကို OCR ပြုလုပ်ခြင်းသည် အဆိုပါ အခြေအနေလေးခုစလုံးအတွက် ပထမဆုံးလုပ်ရမည့် မှန်ကန်သော အလုပ်မဟုတ်ပါ။

အန္တရာယ်အရှိဆုံး အမှားမှာ အဓိပ္ပာယ်မရှိသော စာသားများ ဖြစ်နေခြင်း မဟုတ်ပါ။ ၎င်းသည် ယုံကြည်လောက်ဖွယ်ရာ ရှိနေသော စာသားဖြစ်သည်- ဥပမာ- စာမျက်နှာတွင် ပါရှိသည်က မှတ်စုစာအုပ် ၁၈ အုပ် ဖြစ်သော်လည်း ထုတ်ယူထားသော စာသားတွင် ပါရှိသည်မှာ မှတ်စုစာအုပ် ၁၃ အုပ်ဖြစ်နေခြင်းပင်တည်း။ မည်သူ့ရဲ့ ကိုယ်ရေးကိုယ်တာ စာရွက်စာတမ်းများကိုမျှ အသုံးမပြုဘဲ ထိုကွာခြားချက်ကို သိရှိနိုင်စေရန်အတွက် ဒေါင်းလုပ်လုပ်ယူနိုင်သော PDF ဖိုင်လေးခုကို ကျွန်ုပ်တို့ ဖန်တီးထားပါသည်။

ကူးယူပြီး နှိုင်းယှဉ်စစ်ဆေးသည့် နည်းလမ်းငယ်ဖြင့် စတင်ပါ

မူရင်းဖိုင်ကို မပြောင်းလဲဘဲ ထားရှိပြီး လုပ်ငန်းသုံး မိတ္တူတစ်ခုကို ဖွင့်ပါ။ ရွေးချယ်မှုတိုတိုတစ်ခုကို ပုံမှန်စာသား တည်းဖြတ်သူ (plain-text editor) ထဲသို့ ကူးထည့်ပါ၊ ထို့နောက် စာမျက်နှာနှင့် တစ်လုံးချင်း နှိုင်းယှဉ်စစ်ဆေးပါ။ အခြားစာမျက်နှာတစ်ခုတွင် ထပ်လုပ်ပါ၊ ဖြစ်နိုင်ပါက ဒုတိယမြောက် PDF ဖတ်ရှုသည့် ပရိုแกรม (reader) တစ်ခုတွင်လည်း ထပ်လုပ်ပါ။ ဤသည်မှာ စာရွက်စာတမ်း၏ ကျန်ရှိသောအပိုင်းများ မှန်ကန်ကြောင်း သက်သေပြချက်မဟုတ်ဘဲ ရောဂါရှာဖွေစစ်ဆေးခြင်း (diagnostic check) တစ်ခုသာ ဖြစ်ပါသည်။

ဖြစ်ပျက်နေသည့်အရာစုံစမ်းစစ်ဆေးရမည့်အရာပထမဆုံး လုပ်ဆောင်သင့်သည့်အချက်
ဘာမှ ရွေးချယ်၍မရပါ၊ သို့မဟုတ် ကူးထည့်ထားသည်မှာ အလွတ်ဖြစ်နေသည်စာမျက်နှာတွင် ပုံရိပ် (image) သက်သက်သာ ပါရှိနိုင်သည်စာဖတ်သူသည် စာသားကို ရွေးချယ်နေခြင်းလား သို့မဟုတ် စာမျက်နှာပုံကို ရွေးချယ်နေခြင်းလား ဆိုသည်ကို စစ်ဆေးပါ
စာမျက်နှာပေါ်တွင် ပုံမှန်အတိုင်း မြင်ရသော်လည်း စာလုံးများသည် တစ်သမတ်တည်း ပြောင်းလဲနေသည်စာလုံး ကုဒ်ဝှက်ခြင်း (encoding) သို့မဟုတ် ထုတ်ယူမှု ပုံဖော်ခြင်း (extraction mapping)အခြား ဖတ်ရှုသည့်ပရိုဂရမ်တစ်ခု၏ ရလဒ်ကို နှိုင်းယှဉ်ကြည့်ပါ၊ မူရင်းရင်းမြစ်ဖိုင် သို့မဟုတ် ပိုမိုကောင်းမွန်သော ပို့ကုန် (export) တစ်ခုကို ရှာဖွေပါ
စကားလုံးအများစုကို ဖတ်၍ရသော်လည်း အမည်များ သို့မဟုတ် နံပါတ်များ မှားယောင်နေသည်ဟောင်းနွမ်းနေသော OCR အပါအဝင် တိကျမှုမရှိသော စာသားအလွှာထုတ်ယူထားသော စာသား अंश ကို မြင်ရသော စကင်န်နှင့် နှိုင်းယှဉ်ကြည့်ပါ
စာလုံးများ မှန်ကန်သော်လည်း ကော်လံများ၊ စာပုံစာမျက်နှာခေါင်းစဉ်များ (captions) သို့မဟုတ် အောက်ခြေမှတ်စုများသည် အစဉ်လိုက် မမှန်ဘဲ ဖြစ်နေသည်အပြင်အဆင်နှင့် ဖတ်ရှုသည့်အစဉ်လိုက် ထုတ်ယူခြင်း (Layout and reading-order extraction)ကော်လံတစ်ခုချင်း သို့မဟုတ် စာပိုဒ်တစ်ခုချင်းစီ သီးခြားစီ စမ်းသပ်ပါ
ကူးယူခြင်းကို ပိတ်ထားသည်စာရွက်စာတမ်း ခွင့်ပြုချက်များ သို့မဟုတ် စာဖတ်သူ၏ အပြုအမူဖိုင်၏ ခွင့်ပြုချက်များကို စစ်ဆေးပြီး အသုံးဝင်သော မိတ္တူတစ်ခုအတွက် မူရင်းပိုင်ရှင်ကို တောင်းဆိုပါ

ဤအချက်များသည် လက္ခဏာရပ်များသာ ဖြစ်ကြပြီး လက္ခဏာတစ်ခုတည်းမှနေ၍ PDF တစ်ခုချင်းစီ၏ အတွင်းပိုင်းကို အပြည့်အစုံ သိရှိနိုင်စေရန် နည်းလမ်းများ မဟုတ်ပါ။ Adobe ၏ ပါဝင်သည့်အရာများကို ပြန်လည်အသုံးပြုခြင်းဆိုင်ရာ လမ်းညွှန်ချက် က ပုံစံသက်သက်ပါဝင်သည့် အရာများကို ကူးယူခွင့် ကန့်သတ်ချက်များမှ ခွဲခြားပြသထားသည်။ ၎င်းတို့အနက် တစ်ခုကိုမျှ ပျက်စီးနေသော စာသားအလွှာတစ်ခုအဖြစ် အလိုအလျောက် သတ်မှတ်မထားသင့်ပါ။ pypdf ထုတ်ယူခြင်း လမ်းညွှန် က ပုံများ၊ စာသားထုတ်ယူခြင်းနှင့် စာရင်းဇယားများ၊ ကွာဟချက်များဆိုင်ရာ အခက်အခဲများကို သီးခြားစီ ဖော်ပြထားသည်။

စာအုပ်ရှည်ကြီးများ သို့မဟုတ် အစီရင်ခံစာများအတွက် ပြဿနာတစ်ခုစီ ဖြစ်ပေါ်သည့် PDF စာမျက်နှာနံပါတ်ကို မှတ်သားထားပါ။ သန့်ရှင်းသော စာမျက်နှာခေါင်းစဉ်သည် နောက်ဆက်တွဲ၊ စကင်ဖတ်ထားသော ထည့်သွင်းချက် သို့မဟုတ် နှစ်ကော်လံပါ အခန်းတစ်ခန်းက ကူးယူခြင်းကို မှန်ကန်စွာ လုပ်ဆောင်နိုင်ခြင်း ရှိမရှိကို မပြသနိုင်ပါ။

PDF လေးခု - စာမျက်နှာတွင် ပြသနေသည်နှင့် ထုတ်ယူမှုမှ ပြန်ပေးသည်တို့၏ ကွာခြားချက်

ကျွန်ုပ်တို့၏ စမ်းသပ်စာမျက်နှာတွင် အောက်ပါတို့အပါအဝင် မူရင်းစာကြောင်းလေးကြောင်း ပါဝင်သည်-

မော်ကွန်းတိုက်တွင် မှတ်စုစာအုပ် ၁၈ အုပ် ပါရှိသည်။

ပစ္စည်း B-204 သည် မေလ ၆ ရက်နေ့တွင် ရောက်ရှိလာခဲ့သည်။

ကျွန်ုပ်တို့သည် ပုံမှန် ဒစ်ဂျစ်တယ် PDF တစ်ခုကို ပြုလုပ်ခဲ့ပြီး အခြားရွေးချယ်စရာ သုံးခုကို ရည်ရွယ်ချက်ရှိရှိ ဖန်တီးခဲ့သည်။ ထို့နောက် ၎င်းတို့၏ စာသားများကို Poppler နှင့် pypdf တို့ကို အသုံးပြု၍ ထုတ်ယူခဲ့သည်။ ထုတ်ယူသူ နှစ်ခုစလုံးသည် ဤစမ်းသပ်မှုရှိ ဖိုင်တစ်ခုချင်းစီအတွက် တူညီသောစာသားများကို ပြန်လည်ပေးပို့ခဲ့ကြသည်။

PDF ကို ဒေါင်းလုဒ်လုပ်ပါကျွန်ုပ်တို့ မည်သို့ ဖန်တီးခဲ့ပုံလက်တွေ့ ထုတ်ယူရရှိလာသော ရလဒ်
မှန်ကန်သော ဒစ်ဂျစ်တယ် စာသားဖောင့်တစ်ခု ထည့်သွင်းထားသော ပုံမှန်မြင်ရသည့် စာသား18 notebooks; B-204; 6 May
မှားယွင်းနေသော ယူနီကုဒ် မြေပုံချခြင်းမြင်ရသော ရုပ်ပုံသွင်ပြင်များကို မပြောင်းလဲဘဲ ထုတ်ယူသည့် မြေပုံချခြင်းကို ပြောင်းလဲခဲ့သည်13 notebooks; စာလုံးအသေးအချို့ a သည် ဤသို့ ဖြစ်လာခဲ့သည် x
မှားယွင်းနေသော ဖျောက်ထားသော စာသားစာမျက်နှာ ရုပ်ပုံပေါ်တွင် တမင်တကာ မှားယွင်းနေသော မမြင်ရသည့် စာသားကို ထည့်သွင်းထားသည်13 notebooks; B-2O4; 8 May
ရုပ်ပုံသာပါရှိသော စာမျက်နှာစာသားအလွှာ မပါရှိဘဲ တူညီသော စာမျက်နှာ ရုပ်ပုံကို အသုံးပြုထားသည်စာသား အထွက် အလွတ်

ပုံမှန်ကြည့်ရုံဖြင့် ကောင်းမွန်နေသော ဒစ်ဂျစ်တယ် စာမျက်နှာတစ်ခုသည် ကူးယူသည့်အခါ မှားယွင်းသွားနိုင်သည်

ကျွန်ုပ်တို့၏ နှိုင်းယှဥ်စစ်ဆေးမှုတွင် ပထမ PDF နှစ်ခုစလုံးသည် တူညီသော ပစ်ဇယ်များဖြင့် ထွက်ပေါ်လာသော်လည်း ၎င်းတို့၏ ထုတ်ယူထားသော စာသားများ ကွာခြားနေပါသည်။ ဒုတိယဖိုင်တွင် ကျွန်ုပ်တို့သည် အောက်ပါအတိုင်း တမင်တကာ ပြောင်းလဲခဲ့သည် - ToUnicode မြေပုံဆွဲခြင်း (mapping): သိမ်းဆည်းထားသော အက္ခရာ ကုဒ်များကို Unicode စာသားသို့ မြေပုံဆွဲရန် အသုံးပြုသည့် အချက်အလက်။ မြင်ရသော ဂဏန်းသည် ဆက်လက်တည်ရှိနေပြီး 8၊ ထုတ်ယူမှုကမူ အောက်ပါအတိုင်း ပြန်ပေးသည် 3။ ယင်း pypdf CMap စာရွက်စာတမ်း က ဤမြေပုံဆွဲခြင်း စက်ယန္တရားကို ရှင်းပြထားပါသည်။

၎င်းသည် ချို့ယွင်းချက် ဖြစ်ပေါ်သည့် နည်းလမ်းတစ်ခုကို ပြသနေခြင်းဖြစ်ပြီး ပုံပျက်နေသော PDF တိုင်းတွင် တူညီသော အပြစ်အနာအဆာ ရှိသည်ဟု ဆိုလိုခြင်း မဟုတ်ပါ။ ပျောက်ဆုံးနေသော ToUnicode ထည့်သွင်းမှုတစ်ခုတည်းသည် ကျွန်ုပ်တို့၏ ရောဂါရှာဖွေမှု မဟုတ်သလို၊ မြေပုံများကို လက်ဖြင့် တည်းဖြတ်ခြင်းသည် စာဖတ်သူများအတွက် ယေဘုယျ ပြုပြင်သည့်နည်းလမ်း မဟုတ်ပါ။

ရှာဖွေနိုင်သော စကင်န်ဖတ်ဖိုင်တစ်ခုတွင် မှားယွင်းနေသော စကားလုံးများ ပါဝင်နိုင်သည်

တတိယနှင့် စတုတ္ထ PDF များသည်လည်း တစ်ခုနှင့်တစ်ခု တူညီစွာ ထွက်ပေါ်လာခဲ့သည်။ တစ်ခုတွင် မှားယွင်းနေသော မမြင်ရသည့် စာသားပါရှိပြီး အခြားတစ်ခုတွင် လုံးဝမပါရှိပါ။ တတိယဖိုင်တွင် ထုတ်ယူမှုသည် ပမာဏနှင့် ရက်စွဲ နှစ်ခုစလုံးကို တိတ်တဆိတ် ပြောင်းလဲပစ်ခဲ့သည်။ ကုဒ် B-2O4 တွင် ပါဝင်သည်မှာ အောက်ပါအတိုင်း ဖြစ်သည် - O၊ ပြထားသော ရုပ်ပုံထဲက ဂဏန်း 0 မဟုတ်ပါ။

ဖုံးကွယ်ထားသော စာသားအလွှာတစ်ခုတွင် ရှိနိုင်သည့် မကိုက်ညီမှုမျိုးကို ကိုယ်စားပြုရန်အတွက် ဤအမှားများကို ကျွန်ုပ်တို့ကိုယ်တိုင် ထည့်သွင်းခဲ့ခြင်း ဖြစ်သည်။ OCR အင်ဂျင်တစ်ခုက မဟုတ်ပါ ၎င်းတို့ကို ဖန်တီးခဲ့ခြင်း။ စတုတ္ထဖိုင်က ဆန့်ကျင်ဘက် အခြေအနေကို ပြသနေသည် - ၎င်းသည် ဤစာသား ထုတ်ယူမှုများအတွက် ပြန်ပေးရန် မည်သည့်အရာမှ မပါရှိသော ဖတ်ရှုနိုင်သည့် စာမျက်နှာ ရုပ်ပုံတစ်ခု ဖြစ်သည်။ ၎င်းသည် pypdf ၏ မှတ်တမ်းတင်ထားသော ကန့်သတ်ချက်နှင့် ကိုက်ညီနေပါသည် - ၎င်းသည် ရှိပြီးသား PDF စာသားများကိုသာ ထုတ်ယူပေးပြီး ရုပ်ပုံများအတွင်းရှိ စကားလုံးများကို အသိအမှတ်မပြုပါ။

ဤစမ်းသပ်မှုက အဘယ်အရာကို အတည်ပြုပေးသနည်း၊ မည်သည့်အရာကို မအတည်ပြုပေးသနည်း

၂၀၂၆ ခုနှစ်၊ စက်တင်ဘာလ ၁၀ ရက်နေ့တွင် ကျွန်ုပ်တို့သည် Poppler 26.08.0 နှင့် pypdf 6.10.0 တို့ကို အသုံးပြု၍ စာမျက်နှာတစ်မျက်နှာပါ ဖိုင်လေးခုကို စစ်ဆေးခဲ့သည်။ အမြင်အာရုံဆိုင်ရာ နှိုင်းယှဉ်မှုများအတွက် Poppler ကို 144 dpi ဖြင့် အသုံးပြုခဲ့သည်။ Pixel တူညီမှုသည် အတွဲနှစ်တွဲအတွင်း၌သာ ရှိခဲ့ပြီး၊ ဖိုင်လေးခုလုံးတွင် တူညီခြင်းမရှိပါ - ပုံရိပ်အခြေပြုအတွဲသည် နောက်ထပ် rendering အဆင့်တစ်ခုကို ဖြတ်သန်းခဲ့ရသောကြောင့်ဖြစ်သည်။

ဤသည်မှာ ထိန်းချုပ်ထားသော သရုပ်ပြမှုတစ်ခုသာဖြစ်ပြီး OCR တိကျမှုဆိုင်ရာ စံနှုန်းသတ်မှတ်ချက် (benchmark) မဟုတ်ပါ။ ၎င်းသည် ဘာသာစကားမျိုးစုံ အသိအမှတ်ပြုခြင်း၊ ရှုပ်ထွေးသော အပြင်အဆင်များ၊ Acrobat ပြုပြင်ခြင်း၊ OCRmyPDF ပြုပြင်ခြင်း သို့မဟုတ် BookTranslator သို့ တင်ခြင်း (uploads) တို့ကို စမ်းသပ်ထားခြင်း မဟုတ်ပါ။ ဤအရာများသည် သိသာထင်ရှားသော ချို့ယွင်းချက်များဖြင့် တည်ဆောက်ထားသော ဥပမာများသာဖြစ်ပြီး ဘက်လိုက်မှုမရှိသော ဆန်းစစ်ချက် (blinded assessment) မဟုတ်ပါ။

၎င်း မူရင်းစာသားနှင့် pixel ရလဒ်များ, ပြန်လည်ထုတ်လုပ်ခြင်းဆိုင်ရာ ညွှန်ကြားချက်များ၊ နှင့် ထုတ်လုပ်ပေးသည့်စနစ် (generator) တို့ကို ဖိုင်များနှင့်အတူ ရရှိနိုင်ပါသည်။ ၎င်းတို့သည် ပြုပြင်မွမ်းမံထားခြင်းမရှိသော Noto Sans ဖောင့်ကို ၎င်း၏ open font license နှင့်အတူ အသုံးပြုထားပါသည်။

အနှောင့်အယှက် အနည်းဆုံးဖြစ်စေမည့် နောက်ထပ်အဆင့်ကို ရွေးချယ်ပါ

အောက်ပါ ပြုပြင်ရေးနည်းလမ်းများသည် တရားဝင်စာရွက်စာတမ်းများနှင့် လက်တွေ့ကျသော ရောဂါရှာဖွေမှုများမှ လာခြင်းဖြစ်သည်။ ၎င်းတို့သည် ကျွန်ုပ်တို့၏ ဖိုင်လေးခုစမ်းသပ်ချက်မှ ရရှိလာသော ပြုပြင်မှုရလဒ်များ မဟုတ်ပါ။ သင်အမှန်တကယ် အသုံးပြုမည့်အရာတစ်ခုခုကို အစားမထိုးမီ မိတ္တူတစ်ခုပေါ်တွင် အရင်လုပ်ဆောင်ပြီး ရလဒ်ကို စစ်ဆေးပါ။

သင့်တွင် မူရင်းစာရွက်စာတမ်းရှိပါက၊ အသစ်ပြန်ထုတ် (export) ကြည့်ရန် အရင်ကြိုးစားပါ

မူရင်း word-processing၊ ထုတ်ဝေခြင်း သို့မဟုတ် စာစီစာကုံးဖိုင်မှ အသစ်ထုတ်ယူထားသော PDF သည် အသုံးဝင်သော ပထမဆုံးရွေးချယ်စရာဖြစ်သည်။ အမှားဖြစ်နေသော စာပိုဒ်ကို အတိအကျ နှိုင်းယှဉ်ကြည့်ပါ။ ဖိုင်အမည်အသစ်ဖြစ်သွားခြင်း သို့မဟုတ် export အောင်မြင်ခြင်းသည် စာသားများ မှန်ကန်သွားပြီဟု မယူဆပါနှင့်။

မော်ကွန်းတိုက် သို့မဟုတ် ထုတ်ဝေသူထံမှ ရရှိသော အကြောင်းအရာများအတွက် အခြားစာသားပါဝင်သော ဗားရှင်းရှိမရှိ စစ်ဆေးပါ။ ထုတ်ဝေသည့်အကြိမ် (edition) နှင့် စာမျက်နှာညွှန်းဆိုချက်များကို ကိုက်ညီအောင်ထားပါ - အခြား edition တစ်ခုမှ ပိုမိုကြည်လင်သောဖိုင်သည် သင်လိုအပ်သော စာပိုဒ်ကို ထိန်းသိမ်းထားနိုင်မည် မဟုတ်ပါ။

စကင်န်ဖတ်ထားသောဖိုင်တွင် အသိအမှတ်ပြုမှုအမှား (recognition errors) အနည်းငယ်ရှိပါက ထိုစကားလုံးများကို ပြန်လည်သုံးသပ်ပါ

Acrobat တွင် လုပ်ငန်းစဉ်တစ်ခုကို Scan & OCR → Correct recognized textအောက်တွင် ဖော်ပြထားပါသည်။ ၎င်းသည် သံသယဖြစ်ဖွယ်အဖြစ် အမှတ်အသားပြုထားသော စကားလုံးများကို စကင်န်ဖတ်ထားသော ပုံရိပ်နှင့် နှိုင်းယှဉ်သုံးသပ်ရန်နှင့် အသိအမှတ်ပြုထားသော စာသားကို ပြင်ဆင်ရန် ခွင့်ပြုသည်။ Adobe ၏ လက်ရှိပြင်ဆင်မှုဆိုင်ရာ ညွှန်ကြားချက်များ ကို သင့်ဗားရှင်းရှိ interface အတွက် လိုက်နာဆောင်ရွက်ပါ။

သံသယဖြစ်ဖွယ်စာရင်း (suspect list) အလွတ်ဖြစ်နေခြင်းကို အားလုံးပြည့်စုံပြီဟု မယူဆပါနှင့်။ သင်ကိုးကားမည့် သို့မဟုတ် ဘာသာပြန်မည့် အမည်များ၊ ရက်စွဲများ၊ အမှတ်အသားများနှင့် ပမာဏများကို သီးခြားစီ နှိုင်းယှဉ်စစ်ဆေးပါ။ ကျွန်ုပ်တို့၏ တမင်တကာ မှားယွင်းထားသော 13 notebooks ဥပမာက ဖတ်ရှုနိုင်သော ရလဒ်တခုတည်းနဲ့ ဘာကြောင့် မလုံလောက်တာလဲဆိုတာကို ပြသနေပါတယ်။

ဝှက်ထားသော စာသားသည် ကျယ်ကျယ်ပြန့်ပြန့် မှားယွင်းနေပါက၊ redo နှင့် force ကို ခွဲခြားသတ်မှတ်ပါ

command-line ကိရိယာများကို အသုံးပြုသော စာဖတ်သူများအတွက်၊ OCRmyPDF သည် စာသားများ အပါအဝင်ဖြစ်ပြီးသား စာမျက်နှာများအတွက် မတူညီသော လမ်းကြောင်းများကို ဖော်ပြပေးသည် -

  • --redo-ocr သည် ပုံနှိပ်၍မရသော လက်ရှိ OCR စာသားကို ဖယ်ရှားပေးပြီး ပုံနှိပ်နိုင်သော စာသားကို OCR မှ ဖယ်ထုတ်ထားစဉ်တွင် ထပ်မံအသိအမှတ်ပြုပေးပါသည်။
  • --skip-text သည် စာသားပါရှိသော စာမျက်နှာများကို ကျော်သွားပါသည်။ ၎င်းသည် လက်ရှိမှားယွင်းနေသော စာသားအလွှာတစ်ခုအတွက် ပြုပြင်မှုမဟုတ်ပါ။
  • --force-ocr သည် စာမျက်နှာပါအဝင်အထွက်များကို ပုံရိပ်ဖော်ပေးပြီး ရလာသည့် ပုံများပေါ်တွင် OCR ကို လုပ်ဆောင်ပေးပါသည်။

ဤအပြုအမူများကို တွင် ဖော်ပြထားပါသည်။ OCRmyPDF ၏ လက်ရှိစာသား အမှားပြင်ဆင်မှုဆိုင်ရာ စာရွက်စာတမ်းများ။ ဗားရှင်း 17 တွင်၊ သက်ဆိုင်ရာ ရွေးချယ်မှုများကို လည်း ရရှိနိုင်ပါသည်။ --mode; ပိုဟောင်းသော ဖလက်ဂ်များသည် အစားထိုးနာမည်များ (aliases) အဖြစ် ဆက်လက်တည်ရှိနေပါသည်။

ကုန်ကျစရိတ်များနှင့် ခြွင်းချက်များ ရှိပါသည်။ Redo သည် သမိုင်းကြောင်းဆိုင်ရာ OCR အစီအစဉ်တိုင်းကို ဖော်ထုတ်နိုင်သည်မဟုတ်ပါ။ အချို့သောဖိုင်များသည် နည်းပညာအရ ပုံနှိပ်နိုင်သော စာသားပေါ်တွင် အလင်းမပေါက်သော ပုံတစ်ပုံကို တင်ထားတတ်သည်။ Force သည် ပုံနှိပ်နိုင်သော စာသားနှင့် ဗက်တာ အကြောင်းအရာများကို ပစ်ဇယ်များအဖြစ်သို့ ပြောင်းလဲပေးပြီး အပြန်အလှန်အကျိုးသက်ရောက်မှုရှိသော အကြောင်းအရာများကို ပြားသွားစေသည်။ Redo နှင့် force တို့သည် ရှိပြီးသား တည်ဆောက်ပုံသစ်ပင် (structure tree) ကို ပြန်လည်တည်ဆောက်သည်ထက် စွန့်ပစ်လိုက်ကြသည်။ ပြန်လည်သုံးသပ်ပါ OCRmyPDF ၏ အဆင့်မြင့် စာရွက်စာတမ်းများ တစ်ခုခုကို မရွေးချယ်မီတွင် ဖြစ်သည်။

ထို့ကြောင့် ပြုပြင်ထားသော ထုတ်ယူမှုသည် ဝင်ရောက်အသုံးပြုနိုင်မှု (accessibility) အဆင့် စစ်ဆေးမှုမဟုတ်ပါ။ အကယ်၍ စာတမ်းတွင် ခေါင်းစဉ်များ၊ ဖတ်ရှုသည့် အစဉ်လိုက် သို့မဟုတ် အသုံးပြုနိုင်သော ပုံများ လိုအပ်ပါက သီးသန့် အသုံးပြုပါ ဘာသာပြန်ထားသော PDF ဝင်ရောက်အသုံးပြုနိုင်မှု စစ်ဆေးချက်များ.

စာမျက်နှာများ သို့မဟုတ် ဘာသာစကားများ ကွာခြားပါက၊ ဆက်တင်တစ်ခုတည်းက အားလုံးအတွက် သင့်လျော်သည်ဟု မယူဆပါနှင့်

မည်သည့်စာမျက်နှာများတွင် ယုံကြည်စိတ်ချရသော ဒစ်ဂျစ်တယ်စာသားများ ပါဝင်ပြီး မည်သည့်စာမျက်နှာများတွင် အသိအမှတ်ပြုမှု လိုအပ်သည်ကို စာရင်းပြုစုပါ။ OCR ကို မသတ်မှတ်မီ ထိခိုက်ခံရသော စာမျက်နှာများရှိ ဘာသာစကားများကို စစ်ဆေးပါ။ ကျွန်ုပ်တို့၏ ဘာသာစကားစုံ PDF OCR လမ်းညွှန် သည် ဘာသာစကား ရွေးချယ်မှုကို လွှမ်းခြုံထားသည်။ ၎င်းသည် ဟောင်းနွမ်းနေသော စာသားအလွှာတစ်ခု မှားယွင်းနေခြင်း ရှိ၊ မရှိ ဆုံးဖြတ်ခြင်းနှင့် ကွဲပြားသော ဆုံးဖြတ်ချက်တစ်ခု ဖြစ်ပါသည်။

စာသားအလွှာ လုံးဝ မရှိပါက၊ သို့ ပြောင်းရွှေ့ပါ စကင်န်ဖတ်ထားသော PDF လုပ်ငန်းစဉ်။ အခြားသော ပုံမှန်စာသား ထုတ်ယူသည့်ကိရိယာတစ်ခုကို ထပ်ခါတလဲလဲ ကြိုးစားခြင်းဖြင့် pypdf က ပုံတစ်ပုံထဲရှိ စာလုံးများကို အသိအမှတ်ပြုလာစေမည် မဟုတ်ပါ။

အစားထိုးစာသားကို အသုံးမပြုမီ အတည်ပြုပါ

ကို အသုံးပြုပါ ဒေါင်းလုပ်လုပ်နိုင်သော စာသားအလွှာ စစ်ဆေးသည့်စာရွက် မြင်သာသော ရည်ညွှန်းချက်၊ ယခင် ထုတ်ယူမှုနှင့် အစားထိုး ထုတ်ယူမှုတို့ကို ဘေးချင်းယှဉ် ထားရှိရန် ဖြစ်သည်။ သိရှိပြီးသား ချို့ယွင်းချက်ဖြင့် စတင်ပါ၊ ထို့နောက် အခြားသော အပိုင်းနှင့် ကွဲပြားခြားနားသော စာမျက်နှာ အပြင်အဆင် မှန်သမျှကို စမ်းသပ်ပါ။

  1. စကားလုံးများ - အမည်များနှင့် ရင်းနှီးကျွမ်းဝင်မှုမရှိသော ဝေါဟာရများကို စာလုံးချင်း နှိုင်းယှဉ်ပါ။
  2. နံပါတ်များ - ပမာဏများ၊ ဒဿသမအစက်များ၊ ရက်စွဲများနှင့် သတ်မှတ်ချက်များကို စစ်ဆေးပါ၊ ဥပမာ - B-204.
  3. အစဉ်လိုက် - စာကြောင်းပြတ်များကို ကျော်လွန်၍ ပြီးပြည့်စုံသော စာပိုဒ်တစ်ပိုဒ်ကို ဖတ်ပါ၊ ကော်လံများနှင့် အနီးနားရှိ ခေါင်းစဉ်တိုများကို သီးခြားစီ စစ်ဆေးပါ။
  4. လွှမ်းခြုံမှု - သင့်တွင် လိုအပ်သော စာမျက်နှာများနှင့် အပိုင်းများကို ချန်လှပ်ထားခြင်း မရှိကြောင်း အတည်ပြုပါ။
  5. ဖိုင်၏ လုပ်ဆောင်ပုံ - သိမ်းဆည်းထားသော အစားထိုးဖိုင်ကို ပြန်ဖွင့်ပြီး ကူးယူမှု စမ်းသပ်မှုကို ပြန်လုပ်ပါ။ မှတ်စုများ၊ လင့်ခ်များ သို့မဟုတ် ဝင်ရောက်အသုံးပြုနိုင်သည့် ဖွဲ့စည်းပုံအပေါ် မူတည်ပါက ၎င်းတို့ကိုလည်း စစ်ဆေးပါ။

ရွေးချယ်ထားသော အပိုင်းများကို ဖြတ်သန်းခြင်းက ၎င်းအပိုင်းများနှင့် ပတ်သက်သည့် အထောက်အထားကို ပေးစွမ်းသည်။ ဖိုင်တစ်ခုလုံးကို အာမခံချက်မပေးပါ။ ကိုးကားချက် သို့မဟုတ် ရင်းနှီးကျွမ်းဝင်မှုမရှိသော ဘာသာစကားကို ပြင်ဆင်သည့်အခါ မူရင်းစာမျက်နှာ ရုပ်ပုံကို ရည်ညွှန်းချက်အဖြစ် ထိန်းသိမ်းပါ။

ရင်းမြစ်ကို ယုံကြည်နိုင်မှသာ ဘာသာပြန်ပါ

သင်၏ ရည်မှန်းချက်မှာ စာပိုဒ်တစ်ခုကို ကိုးကားရန် သို့မဟုတ် မှတ်စုယူရန်ဖြစ်ပါက အတည်ပြုပြီးသား ထုတ်ယူမှုသည် နောက်ဆုံးပန်းတိုင် ဖြစ်လာနိုင်ပါသည်။ ထိုတာဝန်ကို ဖြေရှင်းရန် ဘာသာပြန်ဝန်ဆောင်မှု မလိုအပ်ပါ။

စာရွက်စာတမ်း တစ်ခုလုံးကို အခြားဘာသာစကားဖြင့် ဖတ်ရန် လိုအပ်ပါက၊ အတည်ပြုပြီးသား ဖိုင်ကို သင်၏ အစပြုရာနေရာအဖြစ် အသုံးပြုပါ - PDF ဘာသာပြန်ဆိုခြင်း. BookTranslator ၏ OCR မုဒ်သည် အသိအမှတ်ပြုထားသော အကြောင်းအရာမှ ဘာသာပြန်ထားသော PDF တစ်ခုကို ပြန်လည်တည်ဆောက်ပေးသည်၊ ၎င်းသည် ရှိပြီးသား စာသားအလွှာကို ပြုပြင်ပေးရန် သို့မဟုတ် မူရင်းစာမျက်နှာ အပြင်အဆင်ကို အတိအကျ ပြန်လည်ဖန်တီးပေးရန် ကတိပြုခြင်း မဟုတ်ပါ။

ဘာသာပြန်သည့် အဆင့်တစ်လျှောက်တွင် ရည်ညွှန်းစာမျက်နှာများကို ထိန်းသိမ်းထားပါ။ ဤနေရာတွင် စစ်ဆေးထားသော တူညီသော ပမာဏများနှင့် သတ်မှတ်ချက်များသည် အောက်ပါတို့တွင် ပါဝင်သည် - နောက်ဆုံး PDF ဘာသာပြန် QA အဆင့်. ကျွမ်းကျင်ပိုင်နိုင်သော ဘာသာပြန်ဆိုမှုတစ်ခုက ၎င်း၏ရင်းမြစ်သည် အောက်ပါအတိုင်း ဖြစ်သင့်သည်ဟု ကိုယ်တိုင် မပြောနိုင်ပါ - 18 အစား 13.

ဆက်စပ် ဆောင်းပါးများ