BookTranslator
BookTranslator

Překlad naskenovaného PDF: Problémy s OCR a praktická řešení

Zjistěte, jak provést OCR a přeložit naskenovaná PDF, diagnostikovat běžné chyby rozpoznávání a zachovat rozvržení pomocí pracovního postupu zohledňujícího dokument.

BookTranslator

BookTranslator Team

9 min read

Rychlá odpověď: Naskenované PDF potřebuje před překladem OCR

Chcete-li přeložit naskenované PDF, nejprve spusťte OCR, abyste obrázky stránek převedli na vybratelný text. Poté přeložte PDF zpracované pomocí OCR pomocí nástroje pro překlad dokumentů, jako je PDF Translator. Pokud OCR vynecháte, mnoho překladových nástrojů vrátí původní soubor beze změny, vynechá stránky nebo přeloží pouze ty části, které již textovou vrstvu obsahují.

Použijte tento pracovní postup:

  1. Otevřete PDF a zkuste vybrat větu.
  2. Pokud nemůžete vybrat text, spusťte OCR.
  3. Před překladem zkontrolujte text z OCR.
  4. Nahrajte PDF zpracované pomocí OCR do PDF Translatoru.
  5. Porovnejte přeložený výstup s původním skenem.

Pokud vaše PDF již obsahuje vybratelný text a problémem je zachování rozvržení, použijte návod jak přeložit PDF bez ztráty formátování.

Proč naskenovaná PDF v překladových nástrojích selhávají

Naskenované PDF je často pouze sadou obrázků stránek uvnitř kontejneru PDF. Stránka může člověku zobrazovat slova, ale soubor nemusí obsahovat skutečný text, který by software mohl extrahovat.

To vede k jednoduchému problému:

Typ souboruCo vidí překladačCo se stane
PDF založené na textuText plus data o rozvrženíPřeklad může začít okamžitě.
Naskenované PDF pouze s obrázkyObrázky stránekNejprve je vyžadováno OCR.
PDF ve vrstvě text-nad-obrázkemObrázek skenu plus skrytá vrstva textu OCRPřeklad může fungovat, ale chyby OCR ovlivňují kvalitu.

Nejužitečnější test není technický:

  1. Otevřete PDF.
  2. Zkuste zvýraznit jednotlivá slova.
  3. Zkopírujte větu.
  4. Vložte ji do textového editoru.

Pokud se věta vloží správně, PDF má textovou vrstvu. Pokud se nevloží nic nebo se celá stránka chová jako jeden obrázek, PDF potřebuje OCR.

OCR není volitelné

OCR znamená optické rozpoznávání znaků. Čte text z obrázku a vytváří text čitelný strojem. Pro překlad PDF vytváří OCR obvykle neviditelnou textovou vrstvu přes naskenovanou stránku.

Tato textová vrstva se stává zdrojem pro překlad. Pokud OCR dělá chyby, překlad tyto chyby zdědí.

Běžné chyby OCR:

Chyba OCRRiziko pro překlad
rn čteno jako mSlova mění význam.
1 čteno jako lČísla, odkazy nebo kódy se stávají nesprávnými.
O čteno jako 0ID, vzorce a jména se mohou rozbít.
Odstraněná diakritikaJména a termíny se stávají nepřesnými.
Sloučené sloupceVěty se překládají v nesprávném pořadí.
Buňky tabulky čtené řádek po řádku nesprávněŠtítky dat již neodpovídají hodnotám.
Poznámky pod čarou považované za text těla dokumentuCitace a poznámky se přesunou do nesprávného kontextu.

Proto je krok kontroly OCR důležitý. Nepřekládejte naskenovaný dokument, dokud zběžně zkontrolujete extrahovaný text.

Pracovní postup s OCR na prvním místě

Krok 1: Identifikujte typ PDF

Zkuste vybrat text. Pokud výběr funguje, možná OCR nepotřebujete. Pokud výběr selže, považujte soubor za soubor pouze s obrázky.

Stránku také vizuálně zkontrolujte:

  • Zkosené stránky naznačují sken.
  • Šedá textura papíru naznačuje sken.
  • Stíny v blízkosti hřbetu naznačují vyfotografovanou knihu.
  • Nerovnoměrný kontrast naznačuje fotokopii.
  • Pokud vyhledávání nenachází viditelná slova, znamená to, že zde není žádná textová vrstva.

Krok 2: Vylepšete sken, pokud je to možné

Kvalita OCR začíná kvalitou obrázku. Pokud můžete provést nový sken, udělejte to předtím, než strávíte čas opravováním chyb OCR.

Použijte tento kontrolní seznam kvality obrázku:

  • Skenujte v dostatečně vysokém rozlišení pro malý text.
  • Udržujte stránky rovné.
  • Vyhněte se stínům v blízkosti hřbetu.
  • Ořízněte okraje tabulek, prsty nebo nepořádek v pozadí.
  • Použijte silný kontrast mezi textem a stránkou.
  • Udržujte celý řádek viditelný.
  • Použijte správnou orientaci stránky.
  • Komprimujte obrázek tak silně, aby se písmena nerozostřila.

U starých knih a fotokopií přinášejí největší zlepšení obvykle narovnání zkosení, korekce kontrastu a nové naskenování stránek, které jsou mimo zaostření.

Krok 3: Spusťte OCR

Zvolte nástroj OCR na základě dokumentu, nikoli značky.

Možnost OCRNejlepší proNa co si dát pozor
Adobe Acrobat OCRBěžné firemní skeny a čištění PDFPřed spoléháním se zkontrolujte přístup k aktuálnímu tarifu.
ABBYY FineReaderSložité skeny, tabulky, sloupce a obtížná rozvrženíStále vyžaduje ruční kontrolu.
Tesseract nebo OCRmyPDFMístní, technické, opakovatelné pracovní postupy OCRVyžaduje obeznámenost s nástroji příkazové řádky.
Online nástroje OCRSoubory s nízkým rizikem a občasné použitíSoukromí, limity souborů a kvalita se liší.
Aplikace pro skenování v telefonuRychlé pořízení nového skenuZkreslení perspektivy může poškodit OCR.

U soukromých smluv, lékařských záznamů, finančních dokumentů, nezveřejněných rukopisů nebo akademických prací v recenzním řízení upřednostněte místní pracovní postup OCR nebo důvěryhodné prostředí. Nenahrávejte citlivé skeny na náhodné bezplatné weby pro OCR.

Krok 4: Zkontrolujte text z OCR

Zkontrolujte text před překladem, ne po něm. Zkopírujte text z několika obtížných stránek a ověřte, zda je čitelný.

Ukázkové stránky ke kontrole:

  • Titulní stránka.
  • Hustě popsaná stránka těla dokumentu.
  • Stránka s tabulkou.
  • Stránka s poznámkami pod čarou.
  • Stránka s malým textem.
  • Stránka s razítky, rukopisem nebo poznámkami na okraji.
  • Stránka v každém jazyce, pokud je dokument vícejazyčný.

Hledejte:

  • Chybějící odstavce.
  • Sloučené sloupce.
  • Rozdělená slova.
  • Nesprávné znaky.
  • Ztracenou diakritiku.
  • Štítky tabulek oddělené od hodnot.
  • Záhlaví vložená do textu těla dokumentu.
  • Čísla stránek smíchaná ve větách.

Pokud je kvalita OCR špatná, opravte ji před překladem. Překladač nedokáže spolehlivě obnovit význam, který OCR nikdy nezaznamenalo.

Krok 5: Přeložte PDF zpracované pomocí OCR

Jakmile má PDF čistou textovou vrstvu, nahrajte ji do PDF Translatoru. Krok překladu nyní může pracovat s textem namísto obrázků stránek.

Po překladu porovnejte:

  • Původní sken
  • Textovou vrstvu OCR
  • Přeložené PDF

Toto třícestné posouzení vám pomůže určit, zda chyba pochází z OCR nebo z překladu. Pokud je text OCR nesprávný, spusťte OCR znovu. Pokud je text OCR správný, ale překlad je nesprávný, opravte překlad.

Krok 6: Zkontrolujte vysoce rizikový obsah

Naskenované dokumenty často obsahují přesně ten obsah, který vyžaduje pečlivou kontrolu: staré smlouvy, vládní formuláře, akademické práce, příručky, historické dokumenty a stránky knih.

Ručně zkontrolujte tyto položky:

  • Jména
  • Data
  • Čísla
  • Adresy
  • Kódy produktů
  • Právní odkazy
  • Citace
  • Štítky tabulek
  • Jednotky
  • Rovnice
  • Popisky
  • Poznámky pod čarou

Pro výzkumné a akademické soubory si také přečtěte průvodce překladem akademických výzkumných prací, protože naskenovaná akademická PDF přidávají k rizikům OCR také rizika týkající se citací a rozvržení.

Příklady chyb vedle sebe

Tuto tabulku použijte při kontrole výstupu OCR.

Původní sken pravděpodobně ukazujeŠpatný výstup OCRProč na tom záleží
modernmodemVýznam se úplně změní.
Section 10Section IOPrávní nebo technické odkazy se mohou rozbít.
20262O26Data a ID se stávají nespolehlivými.
patientpatlentLékařské nebo technické termíny se stávají nesprávnými.
Dva samostatné sloupceJeden sloučený odstavcePřeklad čte věty v nesprávném pořadí.
Řádek tabulky s popisky a hodnotamiJeden řádek smíchaného textuData se již nemapují na správný štítek.
Značka poznámky pod čarou 1Písmeno lPoznámky se mohou připojit k nesprávné větě.

Pokud tyto chyby uvidíte ve vrstvě OCR, opravte OCR před překladem.

Který nástroj byste měli použít?

Vybírejte podle obtížnosti dokumentu.

DokumentDoporučená cesta
Čistý firemní skenOCR v Acrobatu nebo jiném spolehlivém nástroji OCR, poté PDF Translator.
Sken staré knihyNarovnat zkosení a vylepšit kontrast, provést pečlivé OCR a poté přeložit.
Sken akademické práceProvést OCR, zkontrolovat rovnice/citace/tabulky a poté přeložit s kontrolou rozvržení.
Ručně psané poznámkyPřed překladem může být nutný ruční přepis.
Jednoduchý osobní dokumentOnline OCR může být přijatelné, pokud je riziko soukromí nízké.
Citlivý dokumentPoužijte místní OCR nebo důvěryhodný řízený pracovní postup.

Pokud chcete širší srovnání nástrojů, podívejte se na průvodce nejlepšími překladači PDF.

Běžné problémy naskenovaných PDF

Stránky s nízkým rozlišením

Skenování v nízkém rozlišení rozostřuje písmena dohromady. OCR si může splést rn a m, cl a d nebo interpunkci a prach.

Řešení: pokud možno provést nový sken. Pokud to není možné, zvyšte kontrast a zkuste OCR znovu.

Zkosené nebo zakřivené stránky

Skenování knih se často v blízkosti hřbetu kroutí. OCR čte zakřivené řádky špatně a může přeřídit pořadí textu.

Řešení: vyrovnat stránku, naskenovat znovu nebo použít nástroj OCR s funkcí narovnání zkosení a odstranění zakřivení.

Vícesloupcové rozvržení

OCR může sloučit levý a pravý sloupec do jednoho proudu vět.

Řešení: před překladem zkontrolujte pořadí čtení. Akademické práce vyžadují v tomto ohledu zvláštní pozornost.

Tabulky

Tabulky jsou obtížné, protože OCR musí detekovat text i strukturu. Tabulka může vypadat vizuálně správně, zatímco textová vrstva je špatná.

Řešení: zkopírujte text OCR z tabulky a ověřte, zda štítky stále odpovídají hodnotám.

Rukopis a podpisy

OCR pro tištěný text je mnohem spolehlivější než rozpoznávání rukopisu. Ručně psané poznámky na okraji, podpisy a vyplněné formuláře mohou být vynechány nebo zkomoleny.

Řešení: před překladem ručně přepsat důležitý rukopis.

Smíšené jazyky

OCR funguje nejlépe, když zná zdrojový jazyk. Sken s angličtinou, francouzštinou a čínštinou může selhat, pokud je OCR nastaveno pouze na jeden jazyk.

Řešení: vyberte všechny relevantní jazyky OCR, pokud to nástroj podporuje, a poté zběžně zkontrolujte každou jazykovou sekci.

Kontrolní seznam pro soukromí a zabezpečení

Než naskenované PDF kamkoli nahrát, zeptejte se:

  • Obsahuje dokument osobní údaje?
  • Obsahuje lékařský, právní, finanční, akademický nebo nezveřejněný materiál?
  • Vztahuje se na něj smlouva s klientem nebo školní předpis?
  • Je pro tento dokument povolena online služba OCR?
  • Potřebujete místo toho místní pracovní postup?
  • Můžete odstranit stránky, které nevyžadují překlad?

Naskenovaná PDF jsou často citlivá, protože pocházejí ze smluv, občanských průkazů, formulářů, návrhů výzkumů a interních archivů. S rozhodnutími o nahrání OCR zacházejte stejně, jako byste zacházeli s původním dokumentem.

Související příspěvky