BookTranslator
BookTranslator

Egy beolvasott PDF fordítása: OCR-problémák és gyakorlati megoldások

Ismerje meg, hogyan végezhet OCR-t és fordíthat le beolvasott PDF-eket, hogyan azonosíthatja a gyakori felismerési hibákat, és hogyan őrizheti meg a tördelést egy dokumentum-alapú munkafolyamattal.

BookTranslator

BookTranslator Team

9 min read

Gyors válasz: A beolvasott PDF-nek OCR-re van szüksége a fordítás előtt

A beolvasott PDF fordításához először végezzen el egy OCR-t (optikai karakterfelismerést), hogy az oldal képeit kijelölhető szöveggé alakítsa. Ezután fordítsa le az OCR-feldolgozott PDF-et egy dokumentumfordítóval, például a PDF Translator segítségével. Ha kihagyja az OCR-t, számos fordítóeszköz változatlanul visszaadja az eredeti fájlt, hiányozni fogjanak oldalak, vagy csak azokat a részeket fordítják le, amelyek már tartalmaznak szövegréteget.

Használja ezt a munkafolyamatot:

  1. Nyissa meg a PDF-et, és próbáljon meg kijelölni egy mondatot.
  2. Ha nem tud szöveget kijelölni, futtassa az OCR-t.
  3. A fordítás előtt ellenőrizze az OCR által felismert szöveget.
  4. Töltse fel az OCR-rel feldolgozott PDF-et a PDF Translator oldalára.
  5. Hasonlítsa össze a lefordított kimenetet az eredeti beolvasott dokumentummal.

Ha a PDF már tartalmaz kijelölhető szöveget, és a probléma a tördelés megőrzése, használja a PDF fordítása formázásvesztés nélkül útmutatót.

Miért buknak el a beolvasott PDF-ek a fordítóeszközökben?

A beolvasott PDF gyakran csak egy PDF-tárolóba ágyazott oldaloldalkép-halmaz. Előfordulhat, hogy az oldal megjelenít szavakat egy ember számára, de a fájl nem tartalmaz valós szöveget, amelyet a szoftver ki tudna nyerni.

Ez egy egyszerű hibához vezet:

FájltípusMit lát a fordítóMi történik
Szövegalapú PDFSzöveg plusz tördelési adatokA fordítás azonnal elkezdethető.
Csak képet tartalmazó beolvasott PDFOldalak képeiElőször OCR szükséges.
Szöveg a kép felett PDFBeolvasott kép plusz rejtett OCR szövegrétegA fordítás működhet, de az OCR-hibák befolyásolják a minőséget.

A leghasznosabb teszt nem technikai jellegű:

  1. Nyissa meg a PDF-et.
  2. Próbáljon meg kijelölni egyes szavakat.
  3. Másoljon ki egy mondatot.
  4. Illessze be egy szövegszerkesztőbe.

Ha a mondat helyesen illeszkedik be, a PDF rendelkezik szövegréteggel. Ha semmi sem illeszkedik be, vagy az egész oldal egyetlen képként viselkedik, a PDF-nek OCR-re van szüksége.

Az OCR nem opcionális

Az OCR az optikai karakterfelismerést jelenti. Szöveget olvas ki egy képből, és géppel olvasható szöveget hoz létre. PDF-fordításhoz az OCR általában egy láthatatlan szövegréteget hoz létre a beolvasott oldal felett.

Ez a szövegréteg lesz a fordítás forrása. Ha az OCR hibákat vét, a fordítás örökli ezeket a hibákat.

Gyakori OCR-hibák:

OCR-hibaFordítási kockázat
Az rn-t m-ként olvassaA szavak megváltoztatják a jelentésüket.
Az 1-et l-ként olvassaA számok, hivatkozások vagy kódok hibássá válnak.
A O-t 0-ként olvassaAz azonosítók, képletek és nevek elromolhatnak.
Elhagyott ékezetekA nevek és kifejezések pontatlanná válnak.
Összevont oszlopokA mondatok rossz sorrendben fordítódnak le.
A táblázat celláit helytelenül, soronként olvassaAz adatszimbólumok már não egyeznek meg az értékekkel.
A lábjegyzeteket törzsszövegként kezeliA hivatkozások és megjegyzések rossz kontextusba kerülnek.

Ezért fontos az OCR-ellenőrzési lépés. Ne fordítson le beolvasott dokumentumot addig, amíg nem ellenőrizte szúrópróbaszerűen a kinyert szöveget.

Az OCR-központú munkafolyamat

1. lépés: A PDF típusának azonosítása

Próbáljon meg szöveget kijelölni. Ha a kijelölés működik, lehet, hogy nincs szükség OCR-re. Ha a kijelölés nem sikerül, kezelje a fájlt csak képként.

Vizsgálja meg az oldalt vizuálisan is:

  • Az elforgatott oldalak beolvasásra utalnak.
  • A szürke papírtextúra beolvasásra utal.
  • A gerinc közeli árnyékok lefotózott könyvre utalnak.
  • Az egyenetlen kontraszt fénymásolásra utal.
  • Az, hogy a keresés nem talál látható szavakat, azt jelenti, hogy nincs szövegréteg.

2. lépés: A beolvasás javítása, ha lehetséges

Az OCR minősége a képminőséggel kezdődik. Ha újra be tudja olvasni, tegye meg, mielőtt az OCR-hibák javításával töltené az idejét.

Használja ezt a képminőség-ellenőrző listát:

  • Olvasson be olyan felbontással, ami elég a kis szöveghez is.
  • Tartsa az oldalakat laposan és egyenesen.
  • Kerülje az árnyékokat a gerinc közelében.
  • Vágja ki a táblázatszéleket, ujjakat vagy háttérzajokat.
  • Használjon erős kontrasztot a szöveg és az oldal között.
  • Tartsa láthatóvá az egész sort.
  • Használja a helyes oldalirányt.
  • Ne tömörítse a képet annyira, hogy a betűk elmosódjanak.

Régi könyvek és fénymásolatok esetén a legnagyobb javulást általában a ferdeség-korrekció (deskew), a kontrasztbeállítás és a rosszul fókuszált oldalak újbóli beolvasása jelenti.

3. lépés: Az OCR futtatása

Válasszon OCR-eszközt a dokumentum, és ne a márka alapján.

OCR-opcióLegjobb ehhez:Figyeljen erre:
Adobe Acrobat OCRÁltalános üzleti beolvasások és PDF-tisztításHasználat előtt ellenőrizze az aktuális előfizetést.
ABBYY FineReaderÖsszetett beolvasások, táblázatok, oszlopok és nehéz tördelésekMég mindig manuális ellenőrzést igényel.
Tesseract vagy OCRmyPDFHelyi, technikai, megismételhető OCR-munkafolyamatokParancssori eszközök ismeretét igényli.
Online OCR-eszközökKockázatmentes, alkalmi fájlokAz adatvédelem, a fájlkorlátok és a minőség változó.
Telefono szkennelő alkalmazásokÚj beolvasás gyors rögzítéseA perspektivikus torzítás ronthatja az OCR-t.

Bizalmas szerződések, orvosi leletek, pénzügyi dokumentumok, kiadatlan kéziratok vagy bírálat alatt álló akadémiai munkák esetén részesítse előnyben a helyi OCR-munkafolyamatot vagy egy megbízható környezetet. Ne töltsön fel érzékeny beolvasásokat véletlenszerű ingyenes OCR-oldalakra.

4. lépés: Az OCR-szöveg ellenőrzése

Fordítás előtt ellenőrizzen, ne utána. Másoljon ki szöveget több nehéz oldalról, és ellenőrizze, hogy olvasható-e.

Mintaként ellenőrizendő oldalak:

  • A címlap.
  • Sűrű törzsszöveget tartalmazó oldal.
  • Táblázatot tartalmazó oldal.
  • Lábjegyzeteket tartalmazó oldal.
  • Kisméretű szöveget tartalmazó oldal.
  • Pecétekkel, kézírással vagy margójegyzetekkel ellátott oldal.
  • Minden nyelven egy oldal, ha a dokumentum többnyelvű.

Keresse a következőket:

  • Hiányzó bekezdések.
  • Összevont oszlopok.
  • Megszakadt szavak.
  • Rossz karakterek.
  • Elveszett diakritikus jelek.
  • Az értékektől elválasztott táblázatcímkék.
  • A törzsszövegbe beszúrt fejlécek.
  • Mondatokba keveredett oldalszámok.

Ha az OCR minősége gyenge, javítsa ki a fordítás előtt. Egy fordító nem tud megbízhatóan helyreállítani olyan jelentést, amelyet az OCR soha nem rögzített.

5. lépés: Az OCR-feldolgozott PDF lefordítása

Miután a PDF tiszta szövegréteggel rendelkezik, töltse fel a PDF Translator oldalára. A fordítási lépés mostantól az oldalképek helyett a szöveggel tud dolgozni.

A fordítás után hasonlítsa össze:

  • Az eredeti beolvasást
  • Az OCR szövegréteget
  • A lefordított PDF-et

Ez a háromirányú ellenőrzés segít kideríteni, hogy egy hiba az OCR-ből vagy a fordításból származik-e. Ha az OCR szövege hibás, futtassa újra az OCR-t. Ha az OCR szövege helyes, de a fordítás hibás, javítsa ki a fordítást.

6. lépés: A magas kockázatú tartalom ellenőrzése

A beolvasott dokumentumok gyakran pontosan azt a tartalmat tartalmazzák, amely gondos ellenőrzést igényel: régi szerződések, hivatalos nyomtatványok, akadémiai cikkek, kézikönyvek, történelmi dokumentumok és könyvoldalak.

Tekintse át manuálisan ezeket az elemeket:

  • Nevek
  • Dátumok
  • Számok
  • Címek
  • Termékkódok
  • Jogi hivatkozások
  • Idézetek
  • Táblázatcímkék
  • Egységek
  • Egyenletek
  • Képaláírások
  • Lábjegyzetek

Kutatási és akadémiai fájlok esetén olvassa el a tudományos kutatási cikkek fordításáról szóló útmutatót is, mivel a beolvasott akadémiai PDF-ek az OCR-kockázaton felül hivatkozási és tördelési kockázatokat is hordoznak.

Egymás melletti hibapéldák

Használja ezt a táblázatot az OCR kimenetének ellenőrzése közben.

Az eredeti beolvasás valószínűleg ezt mutatjaRossz OCR-kimenetMiért fontos?
modernmodemA jelentés teljesen megváltozik.
Section 10Section IOA jogi vagy technikai hivatkozások elromolhatnak.
20262O26A dátumok és azonosítók megbízhatatlanná válnak.
patientpatlentAz orvosi vagy műszaki kifejezések helytelenek lesznek.
Két külön oszlopEgyetlen összevont bekezdésA fordítás a mondatokat rossz sorrendben olvassa.
Táblázatsor címkékkel és értékekkelVegyes szövegből álló egységes sorAz adatok már nem képezhetők le a megfelelő címkére.
1-es lábjegyzet-jelölől betűA megjegyzések a rossz mondathoz kapcsolódhatnak.

Ha ilyen hibákat lát az OCR-rétegben, a fordítás előtt javítsa ki az OCR-t.

Melyik eszközt érdemes használnia?

Válasszon a dokumentum nehézsége alapján.

DokumentumAjánlott útvonal
Tiszta üzleti beolvasásOCR az Acrobatban vagy más megbízható OCR-eszközben, majd PDF Translator.
Régi könyv beolvasásaA ferdeség korrigálása és a kontraszt javítása, óvatos OCR, majd fordítás.
Akadémiai cikk beolvasásaOCR, egyenletek/idézetek/táblázatok ellenőrzése, majd fordítás tördelési ellenőrzéssel.
Kézzel írt jegyzetekElőfordulhat, hogy a fordítás előtt manuális átírás szükséges.
Egyszerű személyes dokumentumAz online OCR elfogadható lehet, ha az adatvédelmi kockázat alacsony.
Érzékeny dokumentumHasználjon helyi OCR-t vagy megbízható, felügyelt munkafolyamatot.

Ha a szélesebb körű eszköz-összehasonlítást keresi, tekintse meg a legjobb PDF-fordító útmutatót.

Gyakoribb beolvasott PDF-problémák

Alacsony felbontású oldalak

Az alacsony felbontású beolvasások összemosják a betűket. Az OCR összetévesztheti az rn-t az m-mel, a cl-t a d-vel, vagy a írásjeleket a porral.

Megoldás: ha lehetséges, olvassa be újra. Ha nem, növelje a kontrasztot, és próbálja meg újra az OCR-t.

Elforgatott vagy ívelt oldalak

A könyvek beolvasásai gyakran meghajlanak a gerinc közelében. Az OCR rosszul olvassa a görbe vonalakat, és átrendezheti a szöveget.

Megoldás: simítsa ki az oldalt, olvassa be újra, vagy használjon ferdeség-korrekcióval és torzításmentesítéssel ellátott OCR-eszközt.

Többoszlopos tördelés

Az OCR összevonhatja a bal és a jobb oldali oszlopot egyetlen mondatfolyammá.

Megoldás: fordítás előtt ellenőrizze az olvasási sorrendet. Az akadémiai cikkek különös figyelmet igényelnek ezen a téren.

Táblázatok

A táblázatok nehezek, mert az OCR-nek egyszerre kell felismernie a szöveget és a szerkezetet. Egy táblázat vizuálisan helyesnek tűnhet, miközben a szövegréteg hibás.

Megoldás: másolja ki az OCR szövegét a táblázatból, és győződjön meg arról, hogy a címkék továbbra is megegyeznek az értékekkel.

Kézírás és aláírások

A nyomtatott szöveg OCR-je sokkal megbízhatóbb, mint a kézírás-felismerés. Előfordulhat, hogy a kézzel írt margójegyzetek, aláírások és kitöltött űrlapok kimaradnak vagy torzulnak.

Megoldás: a fordítás előtt manuálisan írja át az alapvető kézírást.

Kevert nyelvek

Az OCR akkor működik a legjobban, ha ismeri a forrásnyelvet. Az angol, francia és kínai nyelvet tartalmazó beolvasás meghiúsulhat, ha az OCR csak egy nyelvre van beállítva.

Megoldás: válassza ki az összes releváns OCR-nyelvet, ha az eszköz támogatja, majd szúrópróbaszerűen ellenőrizze az egyes nyelvi szakaszokat.

Adatvédelmi és biztonsági ellenőrzőlista

Mielőtt bárhová feltöltene egy beolvasott PDF-et, tegye fel a következő kérdéseket:

  • Tartalmaz a dokumentum személyes adatokat?
  • Tartalmaz orvosi, jogi, pénzügyi, akadémiai vagy kiadatlan anyagot?
  • Ügyfélszerállapodás vagy iskolai szabályzat hatálya alá tartozik?
  • Engedélyezett az online OCR-szolgáltatás ehhez a dokumentumhoz?
  • Szüksége van helyi munkafolyamatra helyette?
  • Eltávolíthatja azokat az oldalakat, amelyek nem igényelnek fordítást?

A beolvasott PDF-ek gyakran érzékenyek, mivel szerződésektől, igazolványoktól, űrlapoktól, kutatási vázlatoktól és belső archívumokból származnak. Az OCR feltöltési döntéseit ugyanúgy kezelje, mint az eredeti dokumentumot.

Kapcsolódó bejegyzések