Jak přeložit PDF a zachovat jeho formátování
Použijte reprodukovatelný postup pro PDF, abyste při překladu zachovali směr čtení, tabulky, grafy, fonty, text zprava doleva a rozvržení stránky.

Rychlá odpověď: Zachovejte smysluplnou strukturu dokumentu, ne každou souřadnici
Chcete-li přeložit PDF bez ztráty formátování, nejprve zjistěte, zda obsahuje vybratelný text, naskenované obrázky, nebo obojí. Poté otestujte nejtěžší reprezentativní stránku pomocí překladače PDF, který rozumí rozvržení, ještě před zpracováním celého souboru. Samostatně zkontrolujte směr čtení, přetečení textu, tabulky, popisky grafů, poznámky pod čarou, fonty a text psaný zprava doleva.
Cílem není dosáhnout shody pixel po pixelu. Překlad může posunout konec řádku nebo přidat stránku a přesto dokument správně zachovat. Selhává ve chvíli, kdy informace zmizí, přesunou se do špatného řádku tabulky, stanou se nečitelnými nebo ztratí vztah k popisku, poznámce pod čarou či vizuálnímu prvku.
Jako výchozí bod použijte tuto rozhodovací tabulku:
| Máte toto PDF | První krok | Hlavní riziko formátování |
|---|---|---|
| Vyčístitelné digitální PDF | Přeložit přímo jednu obtížnou stránku | Směr čtení a přetečení textových polí |
| Naskenované nebo vyfocené PDF | Spustit OCR, zkontrolovat textovou vrstvu a poté přeložit | Chyby OCR se stanou chybami překladu |
| PDF s hustými tabulkami nebo grafy | Otestovat stránku se sloučenými buňkami, čísly a popisky | Vizuálně správné rozvržení s nesprávnými datovými vztahy |
| Dvou sloupcová zpráva nebo dokument | Před posouzením plynulosti zkontrolovat extrakci a směr čtení | Sloučení sloupců nebo překlad odstavců mimo pořadí |
| Formulář, certifikát nebo pevná šablona | Rozhodnout, které souřadnice a odkazy na stránky jsou právně či provozně pevné | Oříznutí způsobené pevnými textovými oblastmi |
| Dvojjazyčná recenzní kopie | Zvolit soubory vedle sebe, proložené, na protějších stránkách nebo synchronizované | Úzké sloupce a nestabilní zarovnání zdroje a cíle |
Toto je hlavní pracovní postup pro kategorii překladu PDF. Pokud vybíráte mezi produkty namísto diagnostiky souboru, začněte srovnáním překladačů PDF. Pokud nemůžete vybrat žádný text, přejděte přímo na pracovní postup pro naskenovaná PDF a OCR.
Co by mělo „zachování formátování“ ve skutečnosti znamenat
Zachování formátování není jednorázová funkce typu uspěl/neuspěl. Má nejméně pět vrstev:
- Úplnost obsahu: každý smysluplný odstavec, popisek, varování, číslo a poznámka zůstávají zachovány.
- Logická struktura: nadpisy, seznamy, buňky tabulek, popisky, poznámky pod čarou a směr čtení stále vyjadřují stejné vztahy.
- Vizuální hierarchie: nadpisy stále vypadají jako nadpisy, popisky zůstávají podřízené a související objekty zůstávají seskupené.
- Podpora písem: vybraná písma obsahují cílové glyfy a směr psaní a interpunkce se vykreslují správně.
- Použitelnost stránky: výsledek zůstává čitelný v normální velikosti bez oříznutí, překrývání nebo nespoutaného zmenšování písma.
Dokumentace k formátu PDF od společnosti Adobe popisuje viditelný obsah stránky jako seznam objektů a operací značkování, nikoli jako posloupnost upravitelných odstavců podobnou programu Word. Rovněž rozlišuje logickou strukturu dokumentu od jeho vizuálního umístění. Toto rozlišení vysvětluje, proč může PDF vypadat správně, zatímco zkopírovaný text, pořadí pro přístupnost nebo pořadí překladu jsou nesprávné. Podívejte se na dokumentaci Adobe k obsahu stránek PDF a logické struktuře v tagovaných PDF.
Praktické pravidlo je jednoduché: porovnávejte přeložený dokument na úrovni vztahů, nikoli pouze podle snímků obrazovky.
Stresový test reprodukovatelného rozvržení PDF
Vytvořili jsme dvoustránkový syntetický stresový test překladu rozvržení PDF, aby bylo možné testovat obtížné části PDF bez zákaznických dokumentů. Jde o tagované PDF ve formátu A4 s vymyšlenými jmény a údaji. Je to zkušební vzorek, nikoli dodavatelský benchmark a nikoli důkaz, že jakýkoliv nástroj vytváří přesný překlad.
Strana 1 testuje:
- dvoupapírový směr čtení ve dvou sloupcích;
- tabulku se sloučenou buňkou;
- celé číslo, peněžní částku, podepsané procento a vzorec;
- popisky grafů, jejichž pozice nese význam;
- úmyslně úzkou pevnou textovou oblast;
- poznámku pod čarou, která musí zůstat spojena se svou značkou.

Strana 2 umísťuje anglický, německý, čínský a arabský text do stejně velkých polí. Odhaluje čtyři různé problémy: lokální expanzi, zalamování řádků, chybějící glyfy a obousměrné rozvržení.

Pokyny W3C ohledně velikosti textu při překladu vysvětlují, proč se krátké popisky a úzce vymezené oblasti mohou nepřiměřeně zvětšit, zatímco jiné překlady se mohou zmenšit. Obousměrný algoritmus standardu Unicode určuje, jak se řeší smíšené znaky zleva doprava a zprava doleva. Ani jeden problém nelze spolehlivě vyřešit pouhým počítáním zdrojových znaků.
Stáhněte si vzorek a prožeňte jej jakýmkoli pracovním postupem, který zvažujete. Zaznamenejte nástroj, datum, nastavení, zdrojový jazyk, cílový jazyk a výstupní soubor. Tím se „formátování vypadá v pořádku“ změní v opakovatelný test.
Diagnostikujte své PDF před jeho překladem
1. Otestujte, zda je text vybratelný
Zkuste vybrat jednu větu a jednu buňku tabulky.
- Pokud lze obojí vybrat čistě, PDF má pravděpodobně použitelnou textovou vrstvu.
- Pokud se celá stránka vybírá jako jeden obrázek, vyžaduje OCR.
- Pokud se text vybírá v drobných fragmentech nebo zkopírované řádky přicházejí v nesprávném pořadí, vizuální umístění se neshoduje s logickou strukturou.
Společnost Adobe uvádí, že naskenované PDF zpočátku obsahuje obrazová data namísto prohledávatelného textu. OCR přidává vybratelnou, prohledávatelnou vrstvu, ale Adobe také doporučuje po zpracování zkontrolovat chyby rozpoznávání. Viz Rozpoznávání textu v naskenovaných PDF.
2. Zkopírujte obtížnou sekci do editoru prostého textu
Udělejte to u dvousloupcového odstavce, jednoho celého řádku tabulky a popisku. Pokud je vložené pořadí před překladem nesprávné, překladová vrstva vychází z nesprávné sekvence.
Dokumentace k nástroji pro pořadí čtení od společnosti Adobe ukazuje, že složité tabulky, obrázky, těsně uspořádané sloupce a prvky stránky mohou vyžadovat explicitní opravu pořadí a tagování. Plynulost nedokáže opravit odstavce sestavené ze špatných fragmentů.
3. Vyberte nejtěžší reprezentativní stránku
Netestujte titulní stránku. Vyberte stránku, u které je největší pravděpodobnost selhání:
- nejhustší tabulku;
- nejužší boční panel nebo výzvu;
- dvousloupcovou stránku s poznámkou pod čarou;
- graf s krátkými popisky;
- stránku obsahující čínštinu, japonštinu, korejštinu (CJK), arabštinu, dévanágarí nebo smíšená písma;
- sken s nízkým kontrastem nebo zkreslením.
Pokud selže nejtěžší stránka, překlad 200 jednodušších stránek předem vytvoří pouze více práce s úklidem.
4. Zaznamenejte si povinná omezení
Různé dokumenty vyžadují odlišné definice „zachování“.
| Typ dokumentu | Obvykle povinné | Obvykle flexibilní |
|---|---|---|
| Smlouva nebo formulář | Úplnost doložek, popisky, podpisy, odkazy na stránky | Místní zalamování a mírné změny mezer |
| Akademický článek | Rovnice, citace, vztahy mezi obrázky, směr čtení | Počet stránek a zalomení řádků odstavců |
| Výroční zpráva | Čísla, jednotky, řádky tabulek, přiřazení grafů | Zalamování popisků a velikost lokální oblasti |
| Manuál | Varování, pořadí kroků, výzvy, odkazy na obrázky | Číslování stránek a řízený přetok |
| Kniha nebo dlouhá zpráva | Pořadí kapitol, nadpisy, poznámky, umístění obrázků | Počet stránek a tok odstavců |
Zapište si tato omezení předtím, než zvolíte opravu. Recenzenti mají jinak tendenci chránit vizuální podobnost, i když to poškozuje význam.
Nejbezpečnější komplexní pracovní postup
Krok 1: Zachovejte zdroj a stanovte výchozí stav
Ponechte si nedotčený zdrojový soubor. Zaznamenejte počet stránek, typ souboru, jazyk, zda je PDF tagované a zda je text vybratelný. Pokud bude dokument později aktualizován, uchovejte původní zdrojový dokument i PDF.
Krok 2: Spusťte OCR pouze v případě potřeby
Pro stránky obsahující pouze obrázky spusťte OCR ve správném zdrojovém jazyce. Před překladem zkontrolujte jména, čísla, interpunkci, tabulky, poznámky pod čarou a oblasti s nízkým kontrastem. Chyby OCR jsou vstupní chyby: překladatelský systém může vytvořit plynulý výstup z textu, který byl rozpoznán nesprávně.
Specializovaný průvodce naskenovaným PDF podrobněji popisuje čištění skenů, výběr jazyka OCR, podezřelé znaky a kontroly soukromí.
Krok 3: Přeložte reprezentativní stránku
Použijte pracovní postup navržený tak, aby vrátil dokument, nejen přeložený text. Pro většinu formátovaných PDF to znamená nahrát testovací soubor do BookTranslator PDF Translator, vybrat jazykový pár a zkontrolovat vrácené PDF.
Nehodnoťte pouze nejjednodušší odstavec. Porovnejte přesné prvky uvedené ve vašem výchozím stavu.
Krok 4: Zkontrolujte strukturu před slovním zněním
Zkontrolujte v tomto pořadí:
- Byly zahrnuty všechny zdrojové oblasti?
- Je směr čtení správný?
- Odkazují řádky tabulek, popisky grafů, nadpisy a poznámky pod čarou stále na správné objekty?
- Jsou čísla, jména, jednotky a vzorce neporušené?
- Vykresluje se cílové písmo správně?
- Až potom: je překlad plynulý a přesný?
Leštěný překlad špatného pořadí textu je stále selháním dokumentu.
Krok 5: Přeložte celý soubor a vyzkoušejte rizikové stránky
Poté, co reprezentativní stránka projde, přeložte kompletní PDF. Zkontrolujte první, prostřední a poslední výskyt každé rizikové struktury namísto kontroly pouze první stránky.
U dlouhé zprávy to může znamenat:
- první a poslední dvousloupcovou stránku;
- nejjednodušší a nejhustší tabulku;
- graf na začátku a na konci;
- každou stránku s varováním;
- každou stránku, kde se mění cílové písmo nebo font.
Krok 6: Aplikujte nejméně destruktivní opravu
Opravte lokální problém lokálně. Nezkensujte globálně celý dokument jen proto, že jeden nadpis je dlouhý.
Vyřešte přetečení textu bez zmenšování všeho
Přeložený text přeteče, když cílová formulace již neodpovídá geometrii zdrojové oblasti. Bezprostřední příčinou může být expanze textu, ale omezujícím faktorem je obvykle jedno konkrétní pole, sloupec, řádek, font nebo pravidlo pro zalamování řádků.
Aplikujte opravy v tomto pořadí:
| Pořadí | Oprava | Použít, když | Hlavní riziko |
|---|---|---|---|
| 1 | Povolit přirozené zalamování | Oblast má nevyužitý svislý prostor | Odsazení seznamu nebo výška řádku se mohou změnit |
| 2 | Upravit místní řádkování nebo mezery mezi odstavci | Přetečení je malé | Hustý text může být hůře čitelný |
| 3 | Rozšířit nebo zvětšit dotčenou oblast | Okolní prázdné místo je skutečně nevyužité | Sousední objekty se mohou posunout |
| 4 | Přeformátovat sousední prvky | O prostor soupeří několik bloků | Hierarchie stránek a odkazy se mohou posunout |
| 5 | Použít schválený kratší cílový výraz | Existuje standardní stručný termín | Význam vyžaduje dvojjazyčnou recenzi |
| 6 | Přidat pokračovací stránku | Obsah se vejde nečitelně | Změny číslování stránek |
| 7 | Snížit velikost písma lokálně | Malé zmenšení zůstává čitelné | Přístupnost a vizuální konzistence |
Nespoléhejte na jediné procento jazykové expanze. Německý odstavec může vyhovět, zatímco složený nadpis selže. Čínský text se může zkrátit, zatímco nepřeložená adresa URL stále přetéká buňku. Arabština může vyhovět počtem znaků, ale selhat, protože font, tvarování, interpunkce nebo směr jsou nesprávné.
Použijte tuto diagnostiku:
- Oříznuto v jednom poli: změňte velikost nebo přeformátujte danou oblast.
- Čtverečky nebo chybějící znaky: nahraďte nebo vložte font s požadovanými glyfy.
- Dlouhá slova nebo adresy URL odmítají zalamovat: opravte pravidla pro zalamování řádků nebo dělení slov.
- Selhávají pouze záhlaví tabulek: použijte opravu specifickou pro tabulky.
- Opakovaná záhlaví se kolidují na každé stránce: upravte šablonu stránky namísto každého odstavce.
- Dva fragmenty se stanou jedním předimenzovaným odstavcem: opravte směr čtení před úpravou typografie.
Pokud zdrojové rozvržení nemá prostor pro věrnou verzi v cílovém jazyce, jsou identické souřadnice nesprávným kritériem přijetí. Místo toho zachovejte úplnost, hierarchii a čitelnost.
Zachovejte tabulky, grafy, čísla a poznámky pod čarou
Tabulka PDF není vždy uložena jako tabulka. Může jít o upravitelný text nad mřížkou čar, mnoho umístěných fragmentů nebo jediný obrázek. Popisek grafu může být samostatný text nebo zapečený do grafiky.
To vytváří čtyři nezávislé třídy selhání:
| Třída selhání | Příklad | Proč to vizuální kontrola sama o sobě přehlédne |
|---|---|---|
| Strukturní | Sloučená buňka se rozpadne nebo se dvě buňky stanou jednou větou | Výsledek může stále vypadat zarovnaný |
| Číselná | -3.2% ztratí znaménko mínus nebo se přesune do jiného řádku | Plynulý text odvádí pozornost od hodnoty |
| Vizuální | Přeložené záhlaví překračuje ohraničení | Text může být stále kompletní |
| Referenční | Značka poznámky pod čarou ztratí svou poznámku | Obě části se mohou stále objevovat jinde |
Procházení chráněných tokenů použijte pro:
- celá čísla a desetinné hodnoty;
- kladná a záporná znaménka;
- procenta, měny, data a čísla verzí;
- jednotky a vzorce;
- čísla tabulek a obrázků;
- značky poznámek pod čarou a jejich kvalifikační text.
Jazykové konvence mohou změnit oddělovače desetinných míst nebo umístění měny. Otázkou není, zda je každý znak totožný; jde o to, zda cíl představuje stejné množství a zůstává připojen ke správnému popisku.
U každé tabulky ověřte:
- Počet řádků a sloupců stále odpovídá.
- Sloučené buňky pokrývají stejné záznamy.
- Každé číslo zůstává spárováno se svým zdrojovým popiskem.
- Jednotky, znaménka a přesnost jsou správné.
- Poznámky pod čarou stále kvalifikují zamýšlenou hodnotu.
- Zalamování záhlaví nezakrylo obsah.
U každého grafu ověřte, že geometrie a data zůstávají beze změny, popisky stále identifikují správné vizuální značky a popisky zůstávají připojeny. Pokud jsou popisky vloženy do obrázku, použijte OCR s podporou obrázků a nakreslete je znovu, nebo ponechte původní graf s přeloženým popiskem či legendou. Graf kvůli delším popiskům neroztahujte ani neořezávejte.
Pokud finanční, vědecká nebo právní tabulka obsahuje byť jen jeden špatný datový vztah, dokument selhává bez ohledu na to, jak vyleštěně vypadá.
Zvolte dvoujazyčné rozvržení PDF
Dvoujazyčné PDF je užitečné, když někdo musí ověřit cíl oproti zdroji. Není to automaticky ten nejlepší konečný výsledek.
| Úkol recenze | Nejlepší počáteční rozvržení | Kompromis |
|---|---|---|
| Úprava odstavce po odstavci | Zdroj vlevo, cíl vpravo | Úzké sloupce zesilují přetečení |
| Studium na mobilu nebo tabletu | Zdrojový odstavec následovaný cílovým odstavcem | Počet stránek se zvyšuje |
| Právní nebo archivní reference | Stránky zdroje a cíle proti sobě | Dokument se zhruba zdvojnásobí v délce |
| Husté tabulky a pevné stránky | Oddělené synchronizované zdrojové a cílové PDF | Vyžaduje prohlížeč nebo proces recenze, který udržuje stránky zarovnané |
| Doručení klientovi | PDF pouze s cílem plus kopie pro samostatnou dvojjazyčnou recenzi | Je nutné udržovat dva kontrolované soubory |
Nezarovnávejte podle vizuálních konců řádků. Překlad může rozdělit jednu zdrojovou větu na dvě cílové věty nebo spojit dvě krátké věty. Jako stabilní kotvy použijte nadpisy, posloupnost odstavců, čísla tabulek, čísla obrázků, položky seznamu a značky poznámek pod čarou.
Vedle sebe je špatnou výchozí volbou, pokud zdroj již má více sloupců, husté tabulky, okrajové poznámky nebo velkou lokální expanzi. V takových případech protější stránky nebo synchronizované jednojazyčné soubory zachovávají normální šířku čtení a usnadňují izolaci chyb.
Oba jazyky by měly zůstat prohledávatelné a vybratelné, kdykoli je to možné. Zkontrolujte pořadí zkopíorovaného textu, metadata jazyka dokumentu, nadpisy, tagy tabulek a popisy obrázků. Pokud je přístupnost přísným požadavkem, oddělené jednojazyčné soubory jsou často bezpečnější než složitá struktura se střídajícími se sloupci.
Zvolte správný nástroj pro danou práci
Specializovaný překladač PDF
Pro dlouhá, formátovaná nebo klientská PDF použijte specializovaný překladač. Je to správný výchozí bod, když požadovaným výstupem je jiné použitelné PDF namísto textového přepisu.
Google Translate
Pro rychlé pochopení krátkých, jednoduchých dokumentů, kdy rozvržení není předmětem dodávky, použijte Google Translate. Vícesloupcové stránky, skeny, husté tabulky a závěrečná publikační činnost vyžadují kontrolovanější pracovní postup. Průvodce Google Translate PDF popisuje jeho dokumentový pracovní postup a příznaky selhání.
ChatGPT
Pro krátké pasáže, přípravu glosáře, rozhodování o tónu a dvojjazyčnou recenzi použijte ChatGPT. Nechovejte se k chatovému rozhraní jako k publikačnímu stroji pro rozvržení dlouhého PDF. Pracovní postup ChatGPT pro PDF obsahuje výzvy, které zakazují shrnování a přidávání obsahu.
Konverze PDF do DOCX
Konvertujte nejdříve pouze tehdy, když máte v úmyslu dokument upravit nebo ručně sestavit. Konverze může před zahájením překladu rozdělit tabulky, změnit pořadí fragmentů a proměnit popisky grafů v plovoucí pole. Před odevzdáním otestujte nejtěžší stránku. Pokud je konvertovaný DOCX struktrálně čistý, pokračujte překladačem DOCX; pokud je již rozbitý, překlad konverzi neopraví.
Lidský nebo dvojjazyčný recenzent
Pro právní, lékařské, finanční, bezpečnostně kritické, akademické nebo publikované obsahy použijte kvalifikovaného recenzenta. Rozvržení pracovního postupu může zachovat každé pole, zatímco význam je stále špatný. Pomocí skutečných vzorků překladů zjistíte, jak oddělujeme jazykovou recenzi od recenze rozvržení.
Kontrolní seznam pro přijetí překladu PDF
Blokátory
- Chybějící nebo oříznutý text
- Nesprávný směr čtení
- Se překrývající odstavce nebo popisky
- Čísla přiřazená ke špatnému řádku nebo prvku grafu
- Změněné vzorce, znaménka, jednotky nebo odkazy
- Nečitelná velikost písma
- Chybějící glyfy cílového jazyka
- Porušený směr a interpunkce v arabštině nebo hebrejštině
- Skrytá varování, nadpisy nebo poznámky pod čarou
Závažné vady
- Nepohodlné, ale čitelné zalamování
- Popisky oddělené od obrázků
- Velký nevysvětlitelný posun stránek
- Nekonzistentní zacházení s nadpisy
- Opakované lokální změny velikosti písma
- Dvojjazyčné bloky zarovnané ke špatné zdrojové pasáži
Kosmetické rozdíly
- Různé konce řádků
- Malé změny bílých míst
- Mírná změna počtu stránek s opravenými odkazy
- Mírně odlišné výšky řádků tabulky se vším viditelným obsahem
U každé selhané stránky zaznamenejte zdrojovou stránku, typ prvku, příznak, závazné omezení, opravu a to, zda je vyžadována recenze dvojjazyčného významu. Tento auditní záznam je užitečnější než prohlášení „formátování upraveno“.
Doporučený pracovní postup pro většinu PDF
- Uchovejte nedotčené zdrojové PDF.
- Zkontrolujte, zda jsou text a buňky tabulky vybratelné.
- Spusťte OCR pouze pro obsah obsahující výhradně obrázky a poté zkontrolujte chyby rozpoznávání.
- Stáhněte si stresový test PDF nebo vyberte nejtěžší stránku z vašeho vlastního souboru.
- Přeložte tuto reprezentativní stránku pomocí PDF Translator.
- Před plynulostí jazyka zkontrolujte směr čtení, tabulky, čísla, popisky, poznámky pod čarou, fonty a směr.
- Celý soubor přeložte až poté, co reprezentativní stránka projde.
- Opravte lokální omezení lokálně; nezmenšujte dokument globálně.
- Uchovejte zdroj, přeložené PDF, nastavení, glosář a poznámky k recenzi pohromadě pro budoucí revize.
Pro rovnice, citace a výzkumná rozvržení pokračujte pracovním postupem překladu akademických článků. Pokud se stále rozhodujete, zda by zdrojem mělo být PDF nebo EPUB, použijte rozhodovacího průvodce EPUB vs PDF.
Související příspěvky





