BookTranslator
BookTranslator

Traducerea unui PDF scanat: probleme OCR și soluții practice

Aflați cum să rulați OCR și să traduceți PDF-uri scanate, să diagnosticați eșecurile comune de recunoaștere și să păstrați aspectul cu un flux de lucru orientat spre documente.

BookTranslator

BookTranslator Team

10 min read

Răspuns rapid: Un PDF scanat necesită OCR înainte de traducere

Pentru a traduce un PDF scanat, rulați mai întâi OCR pentru a transforma imaginile paginilor în text selectabil. Apoi, traduceți PDF-ul procesat prin OCR cu un traducător de documente, cum ar fi PDF Translator. Dacă săriți peste OCR, multe instrumente de traducere vor returna fișierul original neschimbat, vor pierde pagini sau vor traduce doar părțile care conțin deja un strat de text.

Utilizați acest flux de lucru:

  1. Deschideți PDF-ul și încercați să selectați o propoziție.
  2. Dacă nu puteți selecta textul, rulați OCR.
  3. Examinați textul OCR înainte de traducere.
  4. Încărcați PDF-ul procesat prin OCR în PDF Translator.
  5. Examinați rezultatul tradus comparativ cu scanarea originală.

Dacă PDF-ul dvs. are deja text selectabil și problema este reprezentată de păstrarea aspectului, utilizați ghidul pentru a traduce un PDF fără a pierde formatarea.

De ce eșuează PDF-urile scanate în instrumentele de traducere

Un PDF scanat este adesea doar un set de imagini de pagini în interiorul unui container PDF. Pagina poate afișa cuvinte unui om, dar fișierul este posibil să nu conțină text real pe care un software să îl poată extrage.

Acest lucru creează un eșec simplu:

Tip de fișierCe vede traducătorulCe se întâmplă
PDF bazat pe textText plus date despre aspectTraducerea poate începe imediat.
PDF scanat doar cu imaginiImagini ale paginilorOCR este necesar mai întâi.
PDF cu text peste imagineImagine scanată plus strat de text OCR ascunsTraducerea poate funcționa, dar erorile OCR afectează calitatea.

Cel mai util test nu este unul tehnic:

  1. Deschideți PDF-ul.
  2. Încercați să evidențiați cuvinte individuale.
  3. Copiați o propoziție.
  4. Lipește-o într-un editor de text.

Dacă propoziția se lipește corect, PDF-ul are un strat de text. Dacă nu se lipește nimic sau întreaga pagină se comportă ca o singură imagine, PDF-ul are nevoie de OCR.

OCR-ul nu este opțional

OCR înseamnă recunoaștere optică a caracterelor. Acesta citește textul dintr-o imagine și creează text care poate fi citit de mașină. Pentru traducerea PDF-urilor, OCR creează de obicei un strat de text invizibil deasupra paginii scanate.

Acest strat de text devine sursa pentru traducere. Dacă OCR face greșeli, traducerea moștenește acele greșeli.

Greșeli comune OCR:

Greșeală OCRRisc de traducere
rn citit ca mCuvintele își schimbă sensul.
1 citit ca lNumerele, referințele sau codurile devin greșite.
O citit ca 0ID-urile, formulele și numele se pot defecta.
Accente eliminateNumele și termenii devin inexacte.
Coloane fuzionatePropozițiile se traduc în ordinea greșită.
Celule de tabel citite incorect rând cu rândEtichetele datelor nu mai corespund valorilor.
Note de subsol tratate ca text de corpCitațiile și notele se mută în contextul greșit.

Acesta este motivul pentru care etapa de revizuire OCR contează. Nu traduceți un document scanat până când nu ați verificat prin eșantion textul extras.

Fluxul de lucru axat pe OCR

Pasul 1: Identificați tipul de PDF

Încercați să selectați textul. Dacă selecția funcționează, este posibil să nu aveți nevoie de OCR. Dacă selecția eșuează, tratați fișierul ca fiind doar cu imagini.

De asemenea, inspectați vizual pagina:

  • Paginile înclinate sugerează o scanare.
  • Textura de hârtie gri sugerează o scanare.
  • Umbrele din apropierea cotorului sugerează o carte fotografiată.
  • Contrastul neuniform sugerează o fotocopie.
  • Faptul că căutarea nu găsește cuvinte vizibile sugerează că nu există un strat de text.

Pasul 2: Îmbunătățiți scanarea dacă este posibil

Calitatea OCR începe cu calitatea imaginii. Dacă puteți rescana, faceți-o înainte de a pierde timpul reparând erorile OCR.

Utilizați această listă de verificare a calității imaginii:

  • Scanați la o rezoluție suficient de mare pentru textul mic.
  • Țineți paginile drepte și la nivel.
  • Evitați umbrele din apropierea cotorului.
  • Decupați marginile mesei, degetele sau elementele de fundal.
  • Utilizați un contrast puternic între text și pagină.
  • Păstrați întreaga linie vizibilă.
  • Utilizați orientarea corectă a paginii.
  • Nu comprimați imaginea atât de puternic încât literele să se estompeze.

Pentru cărțile vechi și fotocopii, cele mai mari avantaje provin de obicei din îndreptarea paginilor, corectarea contrastului și rescanarea paginilor neclare.

Pasul 3: Rulați OCR

Alegeți un instrument OCR în funcție de document, nu de marcă.

Opțiune OCRCel mai bun pentruAtenție la
Adobe Acrobat OCRScanări de afaceri generale și curățare PDFVerificați accesul la planul curent înainte de a vă baza pe el.
ABBYY FineReaderScanări complexe, tabele, coloane și machete dificileNecesită în continuare revizuire manuală.
Tesseract sau OCRmyPDFFluxuri de lucru OCR locale, tehnice, repetabileNecesită familiaritate cu instrumentele de înregistrare în linie de comandă.
Instrumente OCR onlineFișiere ocazionale cu riscuri reduseConfidențialitatea, limitele fișierelor și calitatea variază.
Aplicații de scanare pentru telefonCapturarea rapidă a unei noi scanăriDistorsiunea perspectivei poate afecta OCR-ul.

Pentru contracte private, dosare medicale, documente financiare, manuscrise nepublicate sau lucrări academice aflate în curs de evaluare, preferați un flux de lucru OCR local sau un mediu de încredere. Nu încărcați scanări sensibile pe site-uri OCR gratuite aleatorii.

Pasul 4: Examinați textul OCR

Examinați înainte de traducere, nu după. Copiați textul din mai multe pagini dificile și verificați dacă poate fi citit.

Pagini eșantion de inspectat:

  • Pagina de titlu.
  • O pagină de corp densă.
  • O pagină cu tabele.
  • O pagină cu note de subsol.
  • O pagină cu text mic.
  • O pagină cu ștampile, scriere de mână sau note marginale.
  • O pagină în fiecare limbă dacă documentul este multilingv.

Căutați:

  • Paragrafe lipsă.
  • Coloane fuzionate.
  • Cuvinte rupte.
  • Caractere greșite.
  • Diacritice pierdute.
  • Etichete de tabel separate de valori.
  • Antete introduse în textul corpului.
  • Numere de pagină amestecate în propoziții.

Dacă calitatea OCR este slabă, remediați-o înainte de traducere. Un traducător nu poate recupera în mod fiabil un sens pe care OCR nu l-a capturat niciodată.

Pasul 5: Traduceți PDF-ul procesat prin OCR

Odată ce PDF-ul are un strat de text curat, încărcați-l în PDF Translator. Pasul de traducere poate acum să funcționeze cu text în loc de imagini de pagini.

După traducere, comparați:

  • Scanarea originală
  • Stratul de text OCR
  • PDF-ul tradus

Această revizuire în trei direcții vă ajută să identificați dacă o eroare provine din OCR sau din traducere. Dacă textul OCR este greșit, rulați din nou OCR. Dacă textul OCR este corect, dar traducerea este greșită, remediați traducerea.

Pasul 6: Examinați conținutul cu risc ridicat

Documentele scanate conțin adesea exact conținutul care necesită o revizuire atentă: contracte vechi, formulare guvernamentale, lucrări academice, manuale, documente istorice și pagini de cărți.

Examinați manual aceste elemente:

  • Nume
  • Date
  • Numere
  • Adrese
  • Coduri de produse
  • Referințe legale
  • Citații
  • Etichete de tabele
  • Unități
  • Ecuații
  • Legende
  • Note de subsol

Pentru fișiere de cercetare și academice, citiți și ghidul pentru traducerea lucrărilor de cercetare academică, deoarece PDF-urile academice scanate adaugă riscuri de citare și aspect pe lângă riscul OCR.

Exemple de eșecuri paralele

Utilizați acest tabel în timp ce examinați rezultatul OCR.

Scanarea originală arată probabilIeșire OCR defectuoasăDe ce contează
modernmodemSensul se schimbă complet.
Section 10Section IOReferințele legale sau tehnice se pot defecta.
20262O26Datele și ID-urile devin nesigure.
patientpatlentTermenii medicali sau tehnici devin greșiți.
Două coloane separateUn singur paragraf fuzionatTraducerea citește propozițiile în ordinea greșită.
Rând de tabel cu etichete și valoriO singură linie de text mixtDatele nu mai corespund etichetei corecte.
Marcator de notă de subsol 1Litera lNotele se pot atașa la propoziția greșită.

Dacă vedeți aceste erori în stratul OCR, remediați OCR înainte de traducere.

Ce instrument ar trebui să utilizați?

Alegeți în funcție de dificultatea documentului.

DocumentCale recomandată
Scanare de afaceri curatăOCR în Acrobat sau alt instrument OCR de încredere, apoi PDF Translator.
Scanare de carte vecheÎndreptați și îmbunătățiți contrastul, rulați OCR cu atenție, apoi traduceți.
Scanare de lucrare academicăOCR, revizuiți ecuațiile/citațiile/tabelele, apoi traduceți cu revizuirea aspectului.
Note scrise de mânăEste posibil să fie necesară transcrierea manuală înainte de traducere.
Document personal simpluOCR-ul online poate fi acceptabil dacă riscul privind confidențialitatea este scăzut.
Document sensibilUtilizați OCR local sau un flux de lucru controlat de încredere.

Dacă doriți o comparație mai amplă a instrumentelor, consultați ghidul pentru cel mai bun traducător PDF.

Probleme comune cu PDF-urile scanate

Pagini de rezoluție joasă

Scanările cu rezoluție joasă estompează literele împreună. OCR poate confunda rn și m, cl și d sau punctuația și praful.

Soluție: rescanare dacă este posibil. Dacă nu, creșteți contrastul și încercați din nou OCR.

Pagini înclinate sau curbate

Scanările cărților se curbază adesea în apropierea cotorului. OCR citește liniile curbate slab și poate reordona textul.

Soluție: aplatizați pagina, rescanați sau utilizați un instrument OCR cu funcție de îndreptare și corectare a curbării.

Aspect cu mai multe coloane

OCR poate fuziona coloanele din stânga și din dreapta într-un singur flux de propoziții.

Soluție: inspectați ordinea de citire înainte de traducere. Lucrările academice necesită o atenție deosebită aici.

Tabele

Tabelele sunt dificile deoarece OCR trebuie să detecteze atât textul, cât și structura. Un tabel poate arăta corect din punct de vedere vizual în timp ce stratul de text este greșit.

Soluție: copiați textul OCR din tabel și confirmați că etichetele se potrivesc în continuare cu valorile.

Scriere de mână și semnături

OCR-ul pentru text tipărit este mult mai fiabil decât recunoașterea scrisului de mână. Notele marginale scrise de mână, semnăturile și formularele completate pot fi omise sau distorsionate.

Soluție: transcrieți manual scrierea de mână esențială înainte de traducere.

Limbi mixte

OCR funcționează cel mai bine atunci când cunoaște limba sursă. O scanare cu engleză, franceză și chineză poate eșua dacă OCR este setat la o singură limbă.

Soluție: alegeți toate limbile OCR relevante dacă instrumentul le acceptă, apoi verificați prin eșantion fiecare secțiune lingvistică.

Lista de verificare pentru confidențialitate și securitate

Înainte de a încărca un PDF scanat undeva, întrebați-vă:

  • Conține documentul date personale?
  • Include material medical, juridic, financiar, academic sau nepublicat?
  • Este acoperit de un acord cu clientul sau de o politică școlară?
  • Este permis un serviciu OCR online pentru acest document?
  • Aveți nevoie de un flux de lucru local în schimb?
  • Puteți elimina paginile care nu au nevoie de traducere?

PDF-urile scanate sunt adesea sensibile deoarece provin din contracte, ID-uri, formulare, ciorne de cercetare și arhive interne. Tratați deciziile de încărcare OCR în același mod în care ați trata documentul original.

Articole asociate