BookTranslator
BookTranslator

Jak přeložit PDF a zachovat jeho formátování

Použijte reprodukovatelný postup pro PDF, abyste při překladu zachovali směr čtení, tabulky, grafy, fonty, text zprava doleva a rozvržení stránky.

BookTranslator

BookTranslator Team

15 min read

Rychlá odpověď: Zachovejte smysluplnou strukturu dokumentu, ne každou souřadnici

Chcete-li přeložit PDF bez ztráty formátování, nejprve zjistěte, zda obsahuje vybratelný text, naskenované obrázky, nebo obojí. Poté otestujte nejtěžší reprezentativní stránku pomocí překladače PDF, který rozumí rozvržení, ještě před zpracováním celého souboru. Samostatně zkontrolujte směr čtení, přetečení textu, tabulky, popisky grafů, poznámky pod čarou, fonty a text psaný zprava doleva.

Cílem není dosáhnout shody pixel po pixelu. Překlad může posunout konec řádku nebo přidat stránku a přesto dokument správně zachovat. Selhává ve chvíli, kdy informace zmizí, přesunou se do špatného řádku tabulky, stanou se nečitelnými nebo ztratí vztah k popisku, poznámce pod čarou či vizuálnímu prvku.

Jako výchozí bod použijte tuto rozhodovací tabulku:

Máte toto PDFPrvní krokHlavní riziko formátování
Vyčístitelné digitální PDFPřeložit přímo jednu obtížnou stránkuSměr čtení a přetečení textových polí
Naskenované nebo vyfocené PDFSpustit OCR, zkontrolovat textovou vrstvu a poté přeložitChyby OCR se stanou chybami překladu
PDF s hustými tabulkami nebo grafyOtestovat stránku se sloučenými buňkami, čísly a popiskyVizuálně správné rozvržení s nesprávnými datovými vztahy
Dvou sloupcová zpráva nebo dokumentPřed posouzením plynulosti zkontrolovat extrakci a směr čteníSloučení sloupců nebo překlad odstavců mimo pořadí
Formulář, certifikát nebo pevná šablonaRozhodnout, které souřadnice a odkazy na stránky jsou právně či provozně pevnéOříznutí způsobené pevnými textovými oblastmi
Dvojjazyčná recenzní kopieZvolit soubory vedle sebe, proložené, na protějších stránkách nebo synchronizovanéÚzké sloupce a nestabilní zarovnání zdroje a cíle

Toto je hlavní pracovní postup pro kategorii překladu PDF. Pokud vybíráte mezi produkty namísto diagnostiky souboru, začněte srovnáním překladačů PDF. Pokud nemůžete vybrat žádný text, přejděte přímo na pracovní postup pro naskenovaná PDF a OCR.

Co by mělo „zachování formátování“ ve skutečnosti znamenat

Zachování formátování není jednorázová funkce typu uspěl/neuspěl. Má nejméně pět vrstev:

  1. Úplnost obsahu: každý smysluplný odstavec, popisek, varování, číslo a poznámka zůstávají zachovány.
  2. Logická struktura: nadpisy, seznamy, buňky tabulek, popisky, poznámky pod čarou a směr čtení stále vyjadřují stejné vztahy.
  3. Vizuální hierarchie: nadpisy stále vypadají jako nadpisy, popisky zůstávají podřízené a související objekty zůstávají seskupené.
  4. Podpora písem: vybraná písma obsahují cílové glyfy a směr psaní a interpunkce se vykreslují správně.
  5. Použitelnost stránky: výsledek zůstává čitelný v normální velikosti bez oříznutí, překrývání nebo nespoutaného zmenšování písma.

Dokumentace k formátu PDF od společnosti Adobe popisuje viditelný obsah stránky jako seznam objektů a operací značkování, nikoli jako posloupnost upravitelných odstavců podobnou programu Word. Rovněž rozlišuje logickou strukturu dokumentu od jeho vizuálního umístění. Toto rozlišení vysvětluje, proč může PDF vypadat správně, zatímco zkopírovaný text, pořadí pro přístupnost nebo pořadí překladu jsou nesprávné. Podívejte se na dokumentaci Adobe k obsahu stránek PDF a logické struktuře v tagovaných PDF.

Praktické pravidlo je jednoduché: porovnávejte přeložený dokument na úrovni vztahů, nikoli pouze podle snímků obrazovky.

Stresový test reprodukovatelného rozvržení PDF

Vytvořili jsme dvoustránkový syntetický stresový test překladu rozvržení PDF, aby bylo možné testovat obtížné části PDF bez zákaznických dokumentů. Jde o tagované PDF ve formátu A4 s vymyšlenými jmény a údaji. Je to zkušební vzorek, nikoli dodavatelský benchmark a nikoli důkaz, že jakýkoliv nástroj vytváří přesný překlad.

Strana 1 testuje:

  • dvoupapírový směr čtení ve dvou sloupcích;
  • tabulku se sloučenou buňkou;
  • celé číslo, peněžní částku, podepsané procento a vzorec;
  • popisky grafů, jejichž pozice nese význam;
  • úmyslně úzkou pevnou textovou oblast;
  • poznámku pod čarou, která musí zůstat spojena se svou značkou.

Syntetický stresový test PDF se dvěma sloupci, tabulkou se sloučenými buňkami, popisky grafů, úzkou textovou oblastí a poznámkou pod čarou

Strana 2 umísťuje anglický, německý, čínský a arabský text do stejně velkých polí. Odhaluje čtyři různé problémy: lokální expanzi, zalamování řádků, chybějící glyfy a obousměrné rozvržení.

Stejně velká textová pole PDF obsahující anglický, německý, čínský a arabský text pro testování expanze a písem

Pokyny W3C ohledně velikosti textu při překladu vysvětlují, proč se krátké popisky a úzce vymezené oblasti mohou nepřiměřeně zvětšit, zatímco jiné překlady se mohou zmenšit. Obousměrný algoritmus standardu Unicode určuje, jak se řeší smíšené znaky zleva doprava a zprava doleva. Ani jeden problém nelze spolehlivě vyřešit pouhým počítáním zdrojových znaků.

Stáhněte si vzorek a prožeňte jej jakýmkoli pracovním postupem, který zvažujete. Zaznamenejte nástroj, datum, nastavení, zdrojový jazyk, cílový jazyk a výstupní soubor. Tím se „formátování vypadá v pořádku“ změní v opakovatelný test.

Diagnostikujte své PDF před jeho překladem

1. Otestujte, zda je text vybratelný

Zkuste vybrat jednu větu a jednu buňku tabulky.

  • Pokud lze obojí vybrat čistě, PDF má pravděpodobně použitelnou textovou vrstvu.
  • Pokud se celá stránka vybírá jako jeden obrázek, vyžaduje OCR.
  • Pokud se text vybírá v drobných fragmentech nebo zkopírované řádky přicházejí v nesprávném pořadí, vizuální umístění se neshoduje s logickou strukturou.

Společnost Adobe uvádí, že naskenované PDF zpočátku obsahuje obrazová data namísto prohledávatelného textu. OCR přidává vybratelnou, prohledávatelnou vrstvu, ale Adobe také doporučuje po zpracování zkontrolovat chyby rozpoznávání. Viz Rozpoznávání textu v naskenovaných PDF.

2. Zkopírujte obtížnou sekci do editoru prostého textu

Udělejte to u dvousloupcového odstavce, jednoho celého řádku tabulky a popisku. Pokud je vložené pořadí před překladem nesprávné, překladová vrstva vychází z nesprávné sekvence.

Dokumentace k nástroji pro pořadí čtení od společnosti Adobe ukazuje, že složité tabulky, obrázky, těsně uspořádané sloupce a prvky stránky mohou vyžadovat explicitní opravu pořadí a tagování. Plynulost nedokáže opravit odstavce sestavené ze špatných fragmentů.

3. Vyberte nejtěžší reprezentativní stránku

Netestujte titulní stránku. Vyberte stránku, u které je největší pravděpodobnost selhání:

  • nejhustší tabulku;
  • nejužší boční panel nebo výzvu;
  • dvousloupcovou stránku s poznámkou pod čarou;
  • graf s krátkými popisky;
  • stránku obsahující čínštinu, japonštinu, korejštinu (CJK), arabštinu, dévanágarí nebo smíšená písma;
  • sken s nízkým kontrastem nebo zkreslením.

Pokud selže nejtěžší stránka, překlad 200 jednodušších stránek předem vytvoří pouze více práce s úklidem.

4. Zaznamenejte si povinná omezení

Různé dokumenty vyžadují odlišné definice „zachování“.

Typ dokumentuObvykle povinnéObvykle flexibilní
Smlouva nebo formulářÚplnost doložek, popisky, podpisy, odkazy na stránkyMístní zalamování a mírné změny mezer
Akademický článekRovnice, citace, vztahy mezi obrázky, směr čteníPočet stránek a zalomení řádků odstavců
Výroční zprávaČísla, jednotky, řádky tabulek, přiřazení grafůZalamování popisků a velikost lokální oblasti
ManuálVarování, pořadí kroků, výzvy, odkazy na obrázkyČíslování stránek a řízený přetok
Kniha nebo dlouhá zprávaPořadí kapitol, nadpisy, poznámky, umístění obrázkůPočet stránek a tok odstavců

Zapište si tato omezení předtím, než zvolíte opravu. Recenzenti mají jinak tendenci chránit vizuální podobnost, i když to poškozuje význam.

Nejbezpečnější komplexní pracovní postup

Krok 1: Zachovejte zdroj a stanovte výchozí stav

Ponechte si nedotčený zdrojový soubor. Zaznamenejte počet stránek, typ souboru, jazyk, zda je PDF tagované a zda je text vybratelný. Pokud bude dokument později aktualizován, uchovejte původní zdrojový dokument i PDF.

Krok 2: Spusťte OCR pouze v případě potřeby

Pro stránky obsahující pouze obrázky spusťte OCR ve správném zdrojovém jazyce. Před překladem zkontrolujte jména, čísla, interpunkci, tabulky, poznámky pod čarou a oblasti s nízkým kontrastem. Chyby OCR jsou vstupní chyby: překladatelský systém může vytvořit plynulý výstup z textu, který byl rozpoznán nesprávně.

Specializovaný průvodce naskenovaným PDF podrobněji popisuje čištění skenů, výběr jazyka OCR, podezřelé znaky a kontroly soukromí.

Krok 3: Přeložte reprezentativní stránku

Použijte pracovní postup navržený tak, aby vrátil dokument, nejen přeložený text. Pro většinu formátovaných PDF to znamená nahrát testovací soubor do BookTranslator PDF Translator, vybrat jazykový pár a zkontrolovat vrácené PDF.

Nehodnoťte pouze nejjednodušší odstavec. Porovnejte přesné prvky uvedené ve vašem výchozím stavu.

Krok 4: Zkontrolujte strukturu před slovním zněním

Zkontrolujte v tomto pořadí:

  1. Byly zahrnuty všechny zdrojové oblasti?
  2. Je směr čtení správný?
  3. Odkazují řádky tabulek, popisky grafů, nadpisy a poznámky pod čarou stále na správné objekty?
  4. Jsou čísla, jména, jednotky a vzorce neporušené?
  5. Vykresluje se cílové písmo správně?
  6. Až potom: je překlad plynulý a přesný?

Leštěný překlad špatného pořadí textu je stále selháním dokumentu.

Krok 5: Přeložte celý soubor a vyzkoušejte rizikové stránky

Poté, co reprezentativní stránka projde, přeložte kompletní PDF. Zkontrolujte první, prostřední a poslední výskyt každé rizikové struktury namísto kontroly pouze první stránky.

U dlouhé zprávy to může znamenat:

  • první a poslední dvousloupcovou stránku;
  • nejjednodušší a nejhustší tabulku;
  • graf na začátku a na konci;
  • každou stránku s varováním;
  • každou stránku, kde se mění cílové písmo nebo font.

Krok 6: Aplikujte nejméně destruktivní opravu

Opravte lokální problém lokálně. Nezkensujte globálně celý dokument jen proto, že jeden nadpis je dlouhý.

Vyřešte přetečení textu bez zmenšování všeho

Přeložený text přeteče, když cílová formulace již neodpovídá geometrii zdrojové oblasti. Bezprostřední příčinou může být expanze textu, ale omezujícím faktorem je obvykle jedno konkrétní pole, sloupec, řádek, font nebo pravidlo pro zalamování řádků.

Aplikujte opravy v tomto pořadí:

PořadíOpravaPoužít, kdyžHlavní riziko
1Povolit přirozené zalamováníOblast má nevyužitý svislý prostorOdsazení seznamu nebo výška řádku se mohou změnit
2Upravit místní řádkování nebo mezery mezi odstavciPřetečení je maléHustý text může být hůře čitelný
3Rozšířit nebo zvětšit dotčenou oblastOkolní prázdné místo je skutečně nevyužitéSousední objekty se mohou posunout
4Přeformátovat sousední prvkyO prostor soupeří několik blokůHierarchie stránek a odkazy se mohou posunout
5Použít schválený kratší cílový výrazExistuje standardní stručný termínVýznam vyžaduje dvojjazyčnou recenzi
6Přidat pokračovací stránkuObsah se vejde nečitelněZměny číslování stránek
7Snížit velikost písma lokálněMalé zmenšení zůstává čitelnéPřístupnost a vizuální konzistence

Nespoléhejte na jediné procento jazykové expanze. Německý odstavec může vyhovět, zatímco složený nadpis selže. Čínský text se může zkrátit, zatímco nepřeložená adresa URL stále přetéká buňku. Arabština může vyhovět počtem znaků, ale selhat, protože font, tvarování, interpunkce nebo směr jsou nesprávné.

Použijte tuto diagnostiku:

  • Oříznuto v jednom poli: změňte velikost nebo přeformátujte danou oblast.
  • Čtverečky nebo chybějící znaky: nahraďte nebo vložte font s požadovanými glyfy.
  • Dlouhá slova nebo adresy URL odmítají zalamovat: opravte pravidla pro zalamování řádků nebo dělení slov.
  • Selhávají pouze záhlaví tabulek: použijte opravu specifickou pro tabulky.
  • Opakovaná záhlaví se kolidují na každé stránce: upravte šablonu stránky namísto každého odstavce.
  • Dva fragmenty se stanou jedním předimenzovaným odstavcem: opravte směr čtení před úpravou typografie.

Pokud zdrojové rozvržení nemá prostor pro věrnou verzi v cílovém jazyce, jsou identické souřadnice nesprávným kritériem přijetí. Místo toho zachovejte úplnost, hierarchii a čitelnost.

Zachovejte tabulky, grafy, čísla a poznámky pod čarou

Tabulka PDF není vždy uložena jako tabulka. Může jít o upravitelný text nad mřížkou čar, mnoho umístěných fragmentů nebo jediný obrázek. Popisek grafu může být samostatný text nebo zapečený do grafiky.

To vytváří čtyři nezávislé třídy selhání:

Třída selháníPříkladProč to vizuální kontrola sama o sobě přehlédne
StrukturníSloučená buňka se rozpadne nebo se dvě buňky stanou jednou větouVýsledek může stále vypadat zarovnaný
Číselná-3.2% ztratí znaménko mínus nebo se přesune do jiného řádkuPlynulý text odvádí pozornost od hodnoty
VizuálníPřeložené záhlaví překračuje ohraničeníText může být stále kompletní
ReferenčníZnačka poznámky pod čarou ztratí svou poznámkuObě části se mohou stále objevovat jinde

Procházení chráněných tokenů použijte pro:

  • celá čísla a desetinné hodnoty;
  • kladná a záporná znaménka;
  • procenta, měny, data a čísla verzí;
  • jednotky a vzorce;
  • čísla tabulek a obrázků;
  • značky poznámek pod čarou a jejich kvalifikační text.

Jazykové konvence mohou změnit oddělovače desetinných míst nebo umístění měny. Otázkou není, zda je každý znak totožný; jde o to, zda cíl představuje stejné množství a zůstává připojen ke správnému popisku.

U každé tabulky ověřte:

  1. Počet řádků a sloupců stále odpovídá.
  2. Sloučené buňky pokrývají stejné záznamy.
  3. Každé číslo zůstává spárováno se svým zdrojovým popiskem.
  4. Jednotky, znaménka a přesnost jsou správné.
  5. Poznámky pod čarou stále kvalifikují zamýšlenou hodnotu.
  6. Zalamování záhlaví nezakrylo obsah.

U každého grafu ověřte, že geometrie a data zůstávají beze změny, popisky stále identifikují správné vizuální značky a popisky zůstávají připojeny. Pokud jsou popisky vloženy do obrázku, použijte OCR s podporou obrázků a nakreslete je znovu, nebo ponechte původní graf s přeloženým popiskem či legendou. Graf kvůli delším popiskům neroztahujte ani neořezávejte.

Pokud finanční, vědecká nebo právní tabulka obsahuje byť jen jeden špatný datový vztah, dokument selhává bez ohledu na to, jak vyleštěně vypadá.

Zvolte dvoujazyčné rozvržení PDF

Dvoujazyčné PDF je užitečné, když někdo musí ověřit cíl oproti zdroji. Není to automaticky ten nejlepší konečný výsledek.

Úkol recenzeNejlepší počáteční rozvrženíKompromis
Úprava odstavce po odstavciZdroj vlevo, cíl vpravoÚzké sloupce zesilují přetečení
Studium na mobilu nebo tabletuZdrojový odstavec následovaný cílovým odstavcemPočet stránek se zvyšuje
Právní nebo archivní referenceStránky zdroje a cíle proti soběDokument se zhruba zdvojnásobí v délce
Husté tabulky a pevné stránkyOddělené synchronizované zdrojové a cílové PDFVyžaduje prohlížeč nebo proces recenze, který udržuje stránky zarovnané
Doručení klientoviPDF pouze s cílem plus kopie pro samostatnou dvojjazyčnou recenziJe nutné udržovat dva kontrolované soubory

Nezarovnávejte podle vizuálních konců řádků. Překlad může rozdělit jednu zdrojovou větu na dvě cílové věty nebo spojit dvě krátké věty. Jako stabilní kotvy použijte nadpisy, posloupnost odstavců, čísla tabulek, čísla obrázků, položky seznamu a značky poznámek pod čarou.

Vedle sebe je špatnou výchozí volbou, pokud zdroj již má více sloupců, husté tabulky, okrajové poznámky nebo velkou lokální expanzi. V takových případech protější stránky nebo synchronizované jednojazyčné soubory zachovávají normální šířku čtení a usnadňují izolaci chyb.

Oba jazyky by měly zůstat prohledávatelné a vybratelné, kdykoli je to možné. Zkontrolujte pořadí zkopíorovaného textu, metadata jazyka dokumentu, nadpisy, tagy tabulek a popisy obrázků. Pokud je přístupnost přísným požadavkem, oddělené jednojazyčné soubory jsou často bezpečnější než složitá struktura se střídajícími se sloupci.

Zvolte správný nástroj pro danou práci

Specializovaný překladač PDF

Pro dlouhá, formátovaná nebo klientská PDF použijte specializovaný překladač. Je to správný výchozí bod, když požadovaným výstupem je jiné použitelné PDF namísto textového přepisu.

Google Translate

Pro rychlé pochopení krátkých, jednoduchých dokumentů, kdy rozvržení není předmětem dodávky, použijte Google Translate. Vícesloupcové stránky, skeny, husté tabulky a závěrečná publikační činnost vyžadují kontrolovanější pracovní postup. Průvodce Google Translate PDF popisuje jeho dokumentový pracovní postup a příznaky selhání.

ChatGPT

Pro krátké pasáže, přípravu glosáře, rozhodování o tónu a dvojjazyčnou recenzi použijte ChatGPT. Nechovejte se k chatovému rozhraní jako k publikačnímu stroji pro rozvržení dlouhého PDF. Pracovní postup ChatGPT pro PDF obsahuje výzvy, které zakazují shrnování a přidávání obsahu.

Konverze PDF do DOCX

Konvertujte nejdříve pouze tehdy, když máte v úmyslu dokument upravit nebo ručně sestavit. Konverze může před zahájením překladu rozdělit tabulky, změnit pořadí fragmentů a proměnit popisky grafů v plovoucí pole. Před odevzdáním otestujte nejtěžší stránku. Pokud je konvertovaný DOCX struktrálně čistý, pokračujte překladačem DOCX; pokud je již rozbitý, překlad konverzi neopraví.

Lidský nebo dvojjazyčný recenzent

Pro právní, lékařské, finanční, bezpečnostně kritické, akademické nebo publikované obsahy použijte kvalifikovaného recenzenta. Rozvržení pracovního postupu může zachovat každé pole, zatímco význam je stále špatný. Pomocí skutečných vzorků překladů zjistíte, jak oddělujeme jazykovou recenzi od recenze rozvržení.

Kontrolní seznam pro přijetí překladu PDF

Blokátory

  • Chybějící nebo oříznutý text
  • Nesprávný směr čtení
  • Se překrývající odstavce nebo popisky
  • Čísla přiřazená ke špatnému řádku nebo prvku grafu
  • Změněné vzorce, znaménka, jednotky nebo odkazy
  • Nečitelná velikost písma
  • Chybějící glyfy cílového jazyka
  • Porušený směr a interpunkce v arabštině nebo hebrejštině
  • Skrytá varování, nadpisy nebo poznámky pod čarou

Závažné vady

  • Nepohodlné, ale čitelné zalamování
  • Popisky oddělené od obrázků
  • Velký nevysvětlitelný posun stránek
  • Nekonzistentní zacházení s nadpisy
  • Opakované lokální změny velikosti písma
  • Dvojjazyčné bloky zarovnané ke špatné zdrojové pasáži

Kosmetické rozdíly

  • Různé konce řádků
  • Malé změny bílých míst
  • Mírná změna počtu stránek s opravenými odkazy
  • Mírně odlišné výšky řádků tabulky se vším viditelným obsahem

U každé selhané stránky zaznamenejte zdrojovou stránku, typ prvku, příznak, závazné omezení, opravu a to, zda je vyžadována recenze dvojjazyčného významu. Tento auditní záznam je užitečnější než prohlášení „formátování upraveno“.

Doporučený pracovní postup pro většinu PDF

  1. Uchovejte nedotčené zdrojové PDF.
  2. Zkontrolujte, zda jsou text a buňky tabulky vybratelné.
  3. Spusťte OCR pouze pro obsah obsahující výhradně obrázky a poté zkontrolujte chyby rozpoznávání.
  4. Stáhněte si stresový test PDF nebo vyberte nejtěžší stránku z vašeho vlastního souboru.
  5. Přeložte tuto reprezentativní stránku pomocí PDF Translator.
  6. Před plynulostí jazyka zkontrolujte směr čtení, tabulky, čísla, popisky, poznámky pod čarou, fonty a směr.
  7. Celý soubor přeložte až poté, co reprezentativní stránka projde.
  8. Opravte lokální omezení lokálně; nezmenšujte dokument globálně.
  9. Uchovejte zdroj, přeložené PDF, nastavení, glosář a poznámky k recenzi pohromadě pro budoucí revize.

Pro rovnice, citace a výzkumná rozvržení pokračujte pracovním postupem překladu akademických článků. Pokud se stále rozhodujete, zda by zdrojem mělo být PDF nebo EPUB, použijte rozhodovacího průvodce EPUB vs PDF.

Související příspěvky

Jak přeložit PDF a zachovat jeho formátování