Překlad naskenovaného PDF: Problémy s OCR a praktická řešení
Zjistěte, jak provést OCR a přeložit naskenovaná PDF, diagnostikovat běžné chyby rozpoznávání a zachovat rozvržení pomocí pracovního postupu zohledňujícího dokument.

Rychlá odpověď: Naskenované PDF potřebuje před překladem OCR
Chcete-li přeložit naskenované PDF, nejprve spusťte OCR, abyste obrázky stránek převedli na vybratelný text. Poté přeložte PDF zpracované pomocí OCR pomocí nástroje pro překlad dokumentů, jako je PDF Translator. Pokud OCR vynecháte, mnoho překladových nástrojů vrátí původní soubor beze změny, vynechá stránky nebo přeloží pouze ty části, které již textovou vrstvu obsahují.
Použijte tento pracovní postup:
- Otevřete PDF a zkuste vybrat větu.
- Pokud nemůžete vybrat text, spusťte OCR.
- Před překladem zkontrolujte text z OCR.
- Nahrajte PDF zpracované pomocí OCR do PDF Translatoru.
- Porovnejte přeložený výstup s původním skenem.
Pokud vaše PDF již obsahuje vybratelný text a problémem je zachování rozvržení, použijte návod jak přeložit PDF bez ztráty formátování.
Proč naskenovaná PDF v překladových nástrojích selhávají
Naskenované PDF je často pouze sadou obrázků stránek uvnitř kontejneru PDF. Stránka může člověku zobrazovat slova, ale soubor nemusí obsahovat skutečný text, který by software mohl extrahovat.
To vede k jednoduchému problému:
| Typ souboru | Co vidí překladač | Co se stane |
|---|---|---|
| PDF založené na textu | Text plus data o rozvržení | Překlad může začít okamžitě. |
| Naskenované PDF pouze s obrázky | Obrázky stránek | Nejprve je vyžadováno OCR. |
| PDF ve vrstvě text-nad-obrázkem | Obrázek skenu plus skrytá vrstva textu OCR | Překlad může fungovat, ale chyby OCR ovlivňují kvalitu. |
Nejužitečnější test není technický:
- Otevřete PDF.
- Zkuste zvýraznit jednotlivá slova.
- Zkopírujte větu.
- Vložte ji do textového editoru.
Pokud se věta vloží správně, PDF má textovou vrstvu. Pokud se nevloží nic nebo se celá stránka chová jako jeden obrázek, PDF potřebuje OCR.
OCR není volitelné
OCR znamená optické rozpoznávání znaků. Čte text z obrázku a vytváří text čitelný strojem. Pro překlad PDF vytváří OCR obvykle neviditelnou textovou vrstvu přes naskenovanou stránku.
Tato textová vrstva se stává zdrojem pro překlad. Pokud OCR dělá chyby, překlad tyto chyby zdědí.
Běžné chyby OCR:
| Chyba OCR | Riziko pro překlad |
|---|---|
rn čteno jako m | Slova mění význam. |
1 čteno jako l | Čísla, odkazy nebo kódy se stávají nesprávnými. |
O čteno jako 0 | ID, vzorce a jména se mohou rozbít. |
| Odstraněná diakritika | Jména a termíny se stávají nepřesnými. |
| Sloučené sloupce | Věty se překládají v nesprávném pořadí. |
| Buňky tabulky čtené řádek po řádku nesprávně | Štítky dat již neodpovídají hodnotám. |
| Poznámky pod čarou považované za text těla dokumentu | Citace a poznámky se přesunou do nesprávného kontextu. |
Proto je krok kontroly OCR důležitý. Nepřekládejte naskenovaný dokument, dokud zběžně zkontrolujete extrahovaný text.
Pracovní postup s OCR na prvním místě
Krok 1: Identifikujte typ PDF
Zkuste vybrat text. Pokud výběr funguje, možná OCR nepotřebujete. Pokud výběr selže, považujte soubor za soubor pouze s obrázky.
Stránku také vizuálně zkontrolujte:
- Zkosené stránky naznačují sken.
- Šedá textura papíru naznačuje sken.
- Stíny v blízkosti hřbetu naznačují vyfotografovanou knihu.
- Nerovnoměrný kontrast naznačuje fotokopii.
- Pokud vyhledávání nenachází viditelná slova, znamená to, že zde není žádná textová vrstva.
Krok 2: Vylepšete sken, pokud je to možné
Kvalita OCR začíná kvalitou obrázku. Pokud můžete provést nový sken, udělejte to předtím, než strávíte čas opravováním chyb OCR.
Použijte tento kontrolní seznam kvality obrázku:
- Skenujte v dostatečně vysokém rozlišení pro malý text.
- Udržujte stránky rovné.
- Vyhněte se stínům v blízkosti hřbetu.
- Ořízněte okraje tabulek, prsty nebo nepořádek v pozadí.
- Použijte silný kontrast mezi textem a stránkou.
- Udržujte celý řádek viditelný.
- Použijte správnou orientaci stránky.
- Komprimujte obrázek tak silně, aby se písmena nerozostřila.
U starých knih a fotokopií přinášejí největší zlepšení obvykle narovnání zkosení, korekce kontrastu a nové naskenování stránek, které jsou mimo zaostření.
Krok 3: Spusťte OCR
Zvolte nástroj OCR na základě dokumentu, nikoli značky.
| Možnost OCR | Nejlepší pro | Na co si dát pozor |
|---|---|---|
| Adobe Acrobat OCR | Běžné firemní skeny a čištění PDF | Před spoléháním se zkontrolujte přístup k aktuálnímu tarifu. |
| ABBYY FineReader | Složité skeny, tabulky, sloupce a obtížná rozvržení | Stále vyžaduje ruční kontrolu. |
| Tesseract nebo OCRmyPDF | Místní, technické, opakovatelné pracovní postupy OCR | Vyžaduje obeznámenost s nástroji příkazové řádky. |
| Online nástroje OCR | Soubory s nízkým rizikem a občasné použití | Soukromí, limity souborů a kvalita se liší. |
| Aplikace pro skenování v telefonu | Rychlé pořízení nového skenu | Zkreslení perspektivy může poškodit OCR. |
U soukromých smluv, lékařských záznamů, finančních dokumentů, nezveřejněných rukopisů nebo akademických prací v recenzním řízení upřednostněte místní pracovní postup OCR nebo důvěryhodné prostředí. Nenahrávejte citlivé skeny na náhodné bezplatné weby pro OCR.
Krok 4: Zkontrolujte text z OCR
Zkontrolujte text před překladem, ne po něm. Zkopírujte text z několika obtížných stránek a ověřte, zda je čitelný.
Ukázkové stránky ke kontrole:
- Titulní stránka.
- Hustě popsaná stránka těla dokumentu.
- Stránka s tabulkou.
- Stránka s poznámkami pod čarou.
- Stránka s malým textem.
- Stránka s razítky, rukopisem nebo poznámkami na okraji.
- Stránka v každém jazyce, pokud je dokument vícejazyčný.
Hledejte:
- Chybějící odstavce.
- Sloučené sloupce.
- Rozdělená slova.
- Nesprávné znaky.
- Ztracenou diakritiku.
- Štítky tabulek oddělené od hodnot.
- Záhlaví vložená do textu těla dokumentu.
- Čísla stránek smíchaná ve větách.
Pokud je kvalita OCR špatná, opravte ji před překladem. Překladač nedokáže spolehlivě obnovit význam, který OCR nikdy nezaznamenalo.
Krok 5: Přeložte PDF zpracované pomocí OCR
Jakmile má PDF čistou textovou vrstvu, nahrajte ji do PDF Translatoru. Krok překladu nyní může pracovat s textem namísto obrázků stránek.
Po překladu porovnejte:
- Původní sken
- Textovou vrstvu OCR
- Přeložené PDF
Toto třícestné posouzení vám pomůže určit, zda chyba pochází z OCR nebo z překladu. Pokud je text OCR nesprávný, spusťte OCR znovu. Pokud je text OCR správný, ale překlad je nesprávný, opravte překlad.
Krok 6: Zkontrolujte vysoce rizikový obsah
Naskenované dokumenty často obsahují přesně ten obsah, který vyžaduje pečlivou kontrolu: staré smlouvy, vládní formuláře, akademické práce, příručky, historické dokumenty a stránky knih.
Ručně zkontrolujte tyto položky:
- Jména
- Data
- Čísla
- Adresy
- Kódy produktů
- Právní odkazy
- Citace
- Štítky tabulek
- Jednotky
- Rovnice
- Popisky
- Poznámky pod čarou
Pro výzkumné a akademické soubory si také přečtěte průvodce překladem akademických výzkumných prací, protože naskenovaná akademická PDF přidávají k rizikům OCR také rizika týkající se citací a rozvržení.
Příklady chyb vedle sebe
Tuto tabulku použijte při kontrole výstupu OCR.
| Původní sken pravděpodobně ukazuje | Špatný výstup OCR | Proč na tom záleží |
|---|---|---|
modern | modem | Význam se úplně změní. |
Section 10 | Section IO | Právní nebo technické odkazy se mohou rozbít. |
2026 | 2O26 | Data a ID se stávají nespolehlivými. |
patient | patlent | Lékařské nebo technické termíny se stávají nesprávnými. |
| Dva samostatné sloupce | Jeden sloučený odstavce | Překlad čte věty v nesprávném pořadí. |
| Řádek tabulky s popisky a hodnotami | Jeden řádek smíchaného textu | Data se již nemapují na správný štítek. |
Značka poznámky pod čarou 1 | Písmeno l | Poznámky se mohou připojit k nesprávné větě. |
Pokud tyto chyby uvidíte ve vrstvě OCR, opravte OCR před překladem.
Který nástroj byste měli použít?
Vybírejte podle obtížnosti dokumentu.
| Dokument | Doporučená cesta |
|---|---|
| Čistý firemní sken | OCR v Acrobatu nebo jiném spolehlivém nástroji OCR, poté PDF Translator. |
| Sken staré knihy | Narovnat zkosení a vylepšit kontrast, provést pečlivé OCR a poté přeložit. |
| Sken akademické práce | Provést OCR, zkontrolovat rovnice/citace/tabulky a poté přeložit s kontrolou rozvržení. |
| Ručně psané poznámky | Před překladem může být nutný ruční přepis. |
| Jednoduchý osobní dokument | Online OCR může být přijatelné, pokud je riziko soukromí nízké. |
| Citlivý dokument | Použijte místní OCR nebo důvěryhodný řízený pracovní postup. |
Pokud chcete širší srovnání nástrojů, podívejte se na průvodce nejlepšími překladači PDF.
Běžné problémy naskenovaných PDF
Stránky s nízkým rozlišením
Skenování v nízkém rozlišení rozostřuje písmena dohromady. OCR si může splést rn a m, cl a d nebo interpunkci a prach.
Řešení: pokud možno provést nový sken. Pokud to není možné, zvyšte kontrast a zkuste OCR znovu.
Zkosené nebo zakřivené stránky
Skenování knih se často v blízkosti hřbetu kroutí. OCR čte zakřivené řádky špatně a může přeřídit pořadí textu.
Řešení: vyrovnat stránku, naskenovat znovu nebo použít nástroj OCR s funkcí narovnání zkosení a odstranění zakřivení.
Vícesloupcové rozvržení
OCR může sloučit levý a pravý sloupec do jednoho proudu vět.
Řešení: před překladem zkontrolujte pořadí čtení. Akademické práce vyžadují v tomto ohledu zvláštní pozornost.
Tabulky
Tabulky jsou obtížné, protože OCR musí detekovat text i strukturu. Tabulka může vypadat vizuálně správně, zatímco textová vrstva je špatná.
Řešení: zkopírujte text OCR z tabulky a ověřte, zda štítky stále odpovídají hodnotám.
Rukopis a podpisy
OCR pro tištěný text je mnohem spolehlivější než rozpoznávání rukopisu. Ručně psané poznámky na okraji, podpisy a vyplněné formuláře mohou být vynechány nebo zkomoleny.
Řešení: před překladem ručně přepsat důležitý rukopis.
Smíšené jazyky
OCR funguje nejlépe, když zná zdrojový jazyk. Sken s angličtinou, francouzštinou a čínštinou může selhat, pokud je OCR nastaveno pouze na jeden jazyk.
Řešení: vyberte všechny relevantní jazyky OCR, pokud to nástroj podporuje, a poté zběžně zkontrolujte každou jazykovou sekci.
Kontrolní seznam pro soukromí a zabezpečení
Než naskenované PDF kamkoli nahrát, zeptejte se:
- Obsahuje dokument osobní údaje?
- Obsahuje lékařský, právní, finanční, akademický nebo nezveřejněný materiál?
- Vztahuje se na něj smlouva s klientem nebo školní předpis?
- Je pro tento dokument povolena online služba OCR?
- Potřebujete místo toho místní pracovní postup?
- Můžete odstranit stránky, které nevyžadují překlad?
Naskenovaná PDF jsou často citlivá, protože pocházejí ze smluv, občanských průkazů, formulářů, návrhů výzkumů a interních archivů. S rozhodnutími o nahrání OCR zacházejte stejně, jako byste zacházeli s původním dokumentem.
Související příspěvky





