BookTranslator
BookTranslator

Prevođenje skeniranog PDF-a: problemi s OCR-om i praktična rješenja

Naučite kako pokrenuti OCR i prevesti skenirane PDF-ove, dijagnosticirati uobičajene pogreške prepoznavanja i očuvati prijelom uz radni proces prilagođen dokumentima.

BookTranslator

BookTranslator Team

9 min read

Brzi odgovor: Skeniranom PDF-u potreban je OCR prije prevođenja

Za prijevod skeniranog PDF-a prvo pokrenite OCR kako biste slike stranica pretvorili u tekst koji se može odabrati. Zatim prevedite PDF obrađen OCR-om pomoću prevoditelja dokumenata kao što je PDF Translator. Ako preskočite OCR, mnogi će alati za prevođenje vratiti izvornu datoteku nepromijenjenu, propustiti stranice ili prevesti samo one dijelove koji već sadrže tekstualni sloj.

Koristite ovaj radni proces:

  1. Otvorite PDF i pokušajte odabrati rečenicu.
  2. Ako ne možete odabrati tekst, pokrenite OCR.
  3. Pregledajte OCR tekst prije prevođenja.
  4. Učitajte PDF obrađen OCR-om u PDF Translator.
  5. Pregledajte prevedeni ispis u usporedbi s izvornim skenom.

Ako vaš PDF već ima tekst koji se može odabrati, a problem je očuvanje prijeloma, upotrijebite vodič za prevođenje PDF-a bez gubitka oblikovanja.

Zašto skenirani PDF-ovi ne uspijevaju u alatima za prevođenje

Skenirani PDF često je samo skup slika stranica unutar PDF spremnika. Stranica možda prikazuje riječi čovjeku, ali datoteka možda ne sadrži stvarni tekst koji softver može izdvojiti.

To stvara jednostavan problem:

Vrsta datotekeŠto prevoditelj vidiŠto se događa
PDF na temelju tekstaTekst plus podaci o prijelomuPrijevod može započeti odmah.
Skenirani PDF samo sa slikamaSlike stranicaNajprije je potreban OCR.
PDF s tekstom preko slikeSlika skena plus sloj skrivenog OCR tekstaPrijevod može raditi, ali pogreške OCR-a utječu na kvalitetu.

Najkorisniji test nije tehnički:

  1. Otvorite PDF.
  2. Pokupšajte označiti pojedinačne riječi.
  3. Kopirajte rečenicu.
  4. Zalijepite je u uređivač teksta.

Ako se rečenica ispravno zalijepi, PDF ima tekstualni sloj. Ako se ništa ne zalijepi ili se cijela stranica ponaša kao jedna slika, PDF treba OCR.

OCR nije opcija

OCR označava optičko prepoznavanje znakova (Optical Character Recognition). On čita tekst sa slike i stvara tekst čitljiv stroju. Za prevođenje PDF-a, OCR obično stvara nevidljivi tekstualni sloj preko skenirane stranice.

Taj tekstualni sloj postaje izvor za prijevod. Ako OCR napravi pogreške, prijevod nasljeđuje te pogreške.

Uobičajene pogreške OCR-a:

Pogreška OCR-aRizik pri prevođenju
rn pročitano kao mRiječi mijenjaju značenje.
1 pročitano kao lBrojevi, reference ili kodovi postaju netočni.
O pročitano kao 0ID-ovi, formule i imena mogu se pokvariti.
Izostavljeni naglasciImena i termini postaju netočni.
Spojeni stupciRečenice se prevode pogrešnim redoslijedom.
Ćelije tablice pročitane pogrešno red po redOznake podataka više se ne podudaraju s vrijednostima.
Fusnote tretirane kao glavni tekstCitati i bilješke prelaze u krivi kontekst.

Zato je važan korak pregleda OCR-a. Nemojte prevoditi skenirani dokument dok niste nasumično provjerili izvučeni tekst.

Radni proces s OCR-om na prvom mjestu

1. korak: Identificirajte vrstu PDF-a

Pokušajte odabrati tekst. Ako odabir radi, možda vam ne treba OCR. Ako odabir ne uspije, tretirajte datoteku kao onu koja sadrži samo slike.

Također vizualno pregledajte stranicu:

  • Nakošene stranice upućuju na sken.
  • Tekstura sivog papira upućuje na sken.
  • Sjene u blizini hrpta upućuju na fotografiranu knjigu.
  • Neravnomjeran kontrast upućuje na fotokopiju.
  • Pretraživanje koje ne pronalazi vidljive riječi upućuje na to da nema tekstualnog sloja.

2. korak: Poboljšajte sken ako je moguće

Kvaliteta OCR-a počinje kvalitetom slike. Ako možete ponovno skenirati, učinite to prije nego što potrošite vrijeme na ispravljanje pogrešaka OCR-a.

Koristite ovaj kontrolni popis kvalitete slike:

  • Skenirajte pri dovoljnoj razlučljivosti za mali tekst.
  • Držite stranice ravno.
  • Izbjegavajte sjene u blizini hrpta.
  • Izrežite rubove tablica, prste ili pozadinski nered.
  • Koristite snažan kontrast između teksta i stranice.
  • Držite cijeli red vidljivim.
  • Koristite ispravnu orijentaciju stranice.
  • Nemojte komprimirati sliku toliko jako da se slova zamute.

Za stare knjige i fotokopije, najveći se pomaci obično postižu ispravljanjem nagiba (deskewing), korekcijom kontrasta i ponovnim skeniranjem stranica koje nisu u fokusu.

3. korak: Pokrenite OCR

Odaberite OCR alat na temelju dokumenta, a ne marke.

OCR opcijaNajbolje zaNa što treba pripaziti
Adobe Acrobat OCROpći poslovni skenovi i čišćenje PDF-aProvjerite pristup trenutnom planu prije oslanjanja na njega.
ABBYY FineReaderSloženi skenovi, tablice, stupci i teški prijelomiJoš uvijek zahtijeva ručni pregled.
Tesseract ili OCRmyPDFLokalni, tehnički, ponovljivi OCR radni procesiZahtijeva snalaženje s alatima naredbenog retka.
Mrežni OCR alatiPovremene datoteke niskog rizikaPrivatnost, ograničenja datoteka i kvaliteta variraju.
Aplikacije za skeniranje telefonomBrzo snimanje novog skenaIzobličenje perspektive može štetiti OCR-u.

Za privatne ugovore, medicinsku dokumentaciju, financijske dokumente, neobjavljene rukopise ili akademski rad u recenziji, preferirajte lokalni OCR radni proces ili pouzdano okruženje. Nemojte učitavati osjetljive skenove na nasumična besplatna OCR web-mjesta.

4. korak: Pregledajte OCR tekst

Pregledajte prije prevođenja, a ne poslije. Kopirajte tekst s nekoliko teških stranica i provjerite je li čitljiv.

Uzorci stranica za pregled:

  • Naslovna stranica.
  • Gusta stranica s tekstom.
  • Stranica s tablicom.
  • Stranica s fusnotama.
  • Stranica s malim tekstom.
  • Stranica s pečatima, rukopisom ili rubnim bilješkama.
  • Stranica na svakom jeziku ako je dokument višejezičan.

Potražite:

  • Nedostajuće odlomke.
  • Spojene stupce.
  • Slomljene riječi.
  • Krive znakove.
  • Izgubljene dijakritičke znakove.
  • Oznake tablica odvojene od vrijednosti.
  • Zaglavlja umetnuta u glavni tekst.
  • Brojeve stranica pomiješane s rečenicama.

Ako je kvaliteta OCR-a loša, popravite je prije prevođenja. Prevoditelj ne može pouzdano vratiti značenje koje OCR nikada nije uhvatio.

5. korak: Prevedite PDF obrađen OCR-om

Jednom kada PDF ima čist tekstualni sloj, učitajte ga u PDF Translator. Korak prevođenja sada može raditi s tekstom umjesto sa slikama stranica.

Nakon prevođenja, usporedite:

  • Izvorni sken
  • OCR tekstualni sloj
  • Prevedeni PDF

Ova trostruka provjera pomaže vam utvrditi je li pogreška došla iz OCR-a ili prijevoda. Ako je OCR tekst krivi, ponovno pokrenite OCR. Ako je OCR tekst ispravan, ali je prijevod krivi, popravite prijevod.

6. korak: Pregledajte sadržaj visokog rizika

Skenirani dokumenti često sadrže upravo onaj sadržaj koji zahtijeva pažljiv pregled: stare ugovore, vladine obrasce, akademske radove, priručnike, povijesne dokumente i stranice knjiga.

Ručno pregledajte ove stavke:

  • Imena
  • Datume
  • Brojeve
  • Adrese
  • Šifre proizvoda
  • Pravne reference
  • Citate
  • Oznake tablica
  • Jedinice
  • Jednadžbe
  • Natpise
  • Fusnote

Za istraživačke i akademske datoteke također pročitajte vodič za prevođenje akademskih istraživačkih radova, jer skenirani akademski PDF-ovi dodaju rizike citiranja i prijeloma povrh OCR rizika.

Primjeri neuspjeha jedan pored drugog

Koristite ovu tablicu tijekom pregleda OCR ispisa.

Izvorni sken vjerojatno prikazujeLoš OCR ispisZašto je to važno
modernmodemZnačenje se u potpunosti mijenja.
Section 10Section IOPravne ili tehničke reference mogu se pokvariti.
20262O26Datumi i ID-ovi postaju neupotrebljivi.
patientpatlentMedicinski ili tehnički termini postaju krivi.
Dva odvojena stupcaJedan spojeni odlomakPrijevod čita rečenice pogrešnim redoslijedom.
Red tablice s oznakama i vrijednostimaJedan red miješanog tekstaPodaci se više ne mapiraju na pravu oznaku.
Oznaka fusnote 1Slovo lBilješke se mogu prikačiti na krivu rečenicu.

Ako vidite ove pogreške u OCR sloju, popravite OCR prije prevođenja.

Koji alat biste trebali koristiti?

Odaberite prema težini dokumenta.

DokumentPreporučeni put
Čist poslovni skenOCR u Acrobat-u ili drugom pouzdanom OCR alatu, zatim PDF Translator.
Sken stare knjigeIspravite nagib i kontrast, pažljivo pokrenite OCR, a zatim prevedite.
Sken akademskog radaPokrenite OCR, pregledajte jednadžbe/cite/tablice, zatim prevedite s pregledom prijeloma.
Rukopisne bilješkePrije prevođenja možda će biti potrebna ručna transkripcija.
Jednostavan osobni dokumentMrežni OCR može biti prihvatljiv ako je rizik privatnosti nizak.
Osjetljivi dokumentKoristite lokalni OCR ili pouzdani kontrolirani radni proces.

Ako želite širu usporedbu alata, pogledajte vodič za najbolje PDF prevoditelje.

Uobičajeni problemi sa skeniranim PDF-ovima

Stranice niske razlučljivosti

Skenovi niske razlučljivosti zamućuju slova zajedno. OCR može zamijeniti rn i m, cl i d ili interpunkciju i prašinu.

Rješenje: ponovno skenirajte ako je moguće. Ako nije, povećajte kontrast i ponovno pokušajte OCR.

Nakošene ili zakrivljene stranice

Skenovi knjiga često se zakrivljuju u blizini hrpta. OCR loše čita zakrivljene linije i može promijeniti redoslijed teksta.

Rješenje: poravnajte stranicu, ponovno skenirajte ili koristite OCR alat s opcijama ispravljanja nagiba i izobličenja.

Višestupčasti prijelom

OCR može spojiti lijevi i desni stupac u jedan tok rečenica.

Rješenje: pregledajte redoslijed čitanja prije prevođenja. Akademski radovi ovdje zahtijevaju posebnu pozornost.

Tablice

Tablice su teške jer OCR mora otkriti i tekst i strukturu. Tablica vizualno može izgledati ispravno dok je tekstualni sloj krivi.

Rješenje: kopirajte OCR tekst iz tablice i potvrdite da se oznake još uvijek podudaraju s vrijednostima.

Rukopis i potpisi

OCR tiskanog teksta puno je pouzdaniji od prepoznavanja rukopisa. Rukopisne rubne bilješke, potpisi i ispunjeni obrasci mogu biti propušteni ili iskrivljeni.

Rješenje: ručno prepisite bitan rukopis prije prevođenja.

Miješani jezici

OCR najbolje radi kada zna izvorni jezik. Sken s engleskim, francuskim i kineskim može ne uspjeti ako je OCR postavljen samo na jedan jezik.

Rješenje: odaberite sve relevantne OCR jezike ako alat to podržava, a zatim nasumično provjerite svaki odsječak jezika.

Kontrolni popis za privatnost i sigurnost

Prije nego što bilo gdje učitate skenirani PDF, pitajte:

  • Sadrži li dokument osobne podatke?
  • Uključuje li medicinski, pravni, financijski, akademski ili neobjavljeni materijal?
  • Je li obuhvaćen ugovorom s klijentom ili školskom politikom?
  • Je li mrežna OCR usluga dopuštena za ovaj dokument?
  • Trebate li umjesto toga lokalni radni proces?
  • Možete li ukloniti stranice koje ne trebaju prijevod?

Skenirani PDF-ovi često su osjetljivi jer dolaze iz ugovora, osobnih iskaznica, obrazaca, nacrta istraživanja i internih arhiva. Odluke o učitavanju OCR-a tretirajte na isti način kao što biste trebali tretirati izvorni dokument.

Povezane objave