BookTranslator
BookTranslator

Hoe je een PDF vertaalt met behoud van de opmaak

Gebruik een reproduceerbare PDF-workflow om de leesrichting, tabellen, grafieken, lettertypen, RTL-tekst en pagina-indeling te behouden tijdens de vertaling.

BookTranslator

BookTranslator Team

16 min read

Snelle antwoord: Behoud de zinvolle structuur van het document, niet elke coördinaat

Om een PDF te vertalen zonder verlies van opmaak, bepaal je eerst of het selecteerbare tekst, gescande afbeeldingen of beide bevat. Test vervolgens de moeilijkste representatieve pagina met een opmaakbewuste PDF-vertaler voordat je het volledige bestand verwerkt. Controleer de leesrichting, tekstoverloop, tabellen, grafieklabels, voetnoten, lettertypen en rechts-naar-linkse tekst afzonderlijk.

Het doel is geen pixel-voor-pixel identiteit. Een vertaling kan een regelomslag verplaatsen of een pagina toevoegen en het document nog steeds correct behouden. Het faalt wanneer informatie verdwijnt, naar de verkeerde tabelrij verhuist, onleesbaar wordt of zijn relatie met een bijschrift, voetnoot of visual verliest.

Gebruik deze beslissingstabel als startpunt:

PDF die je hebtEerste actieBelangrijkste opmaakrisico
Selecteerbare digitale PDFVertaal één moeilijke pagina directLeesrichting en tekstvakoverloop
Gescande of gefotografeerde PDFVoer OCR uit, controleer de tekstlaag en vertaal vervolgensOCR-fouten die vertaalfouten worden
PDF met dichte tabellen of grafiekenTest een pagina met samengevoegde cellen, getallen en labelsCorrect lijkend document met onjuiste datarelations
Papier of rapport met twee kolommenControleer de extractie en leesrichting voordat je de vloeiendheid beoordeeltKolommen die samensmelten of alinea's die buiten volgorde vallen
Formulier, certificaat of sjabloonBepaal welke coördinaten en paginareferenties vastliggenUitknipping veroorzaakt door rigide tekstregio's
Tweetalig beoordelingsexemplaarKies voor naast elkaar, geïnterleaveerd of gesynchroniseerde bestandenSmalle kolommen en onstabiele bron-doeluitlijning

Dit is de centrale workflow voor de PDF-vertaalcategorie. Als je kiest tussen producten in plaats van een bestand te diagnosticeren, begin dan met de vergelijking van PDF-vertalers. Als je geen tekst kunt selecteren, ga dan direct naar de workflow voor gescande PDF's en OCR.

Wat "Behoud opmaak" daadwerkelijk zou moeten betekenen

Het behouden van opmaak is geen alles-of-niets-functie. Het heeft ten minste vijf lagen:

  1. Inhoudelijke volledigheid: elke zinvolle alinea, label, waarschuwing, getal en notitie blijft aanwezig.
  2. Logische structuur: koppen, lijsten, tabelcellen, bijschriften, voetnoten en de leesrichting drukken nog steeds dezelfde relaties uit.
  3. Visuele hiërarchie: titels zien er nog steeds uit als titels, bijschriften blijven ondergeschikt en gerelateerde objecten blijven gegroepeerd.
  4. Ondersteuning voor schriften: de gekozen lettertypen bevatten de doeltekens en de richting en aanduidingen worden correct weergegeven.
  5. Paginabruikbaarheid: het resultaat blijft leesbaar op normale grootte zonder knipwerk, overlapping of willekeurige verkleining van lettertypen.

De PDF-documentatie van Adobe beschrijft zichtbare paginainhoud als een lijst met objecten en markeringsbewerkingen, niet als een op Word lijkende reeks bewerkbare alinea's. Het maakt ook onderscheid tussen de logische structuur van een document en de visuele plaatsing ervan. Dat onderscheid verklaart waarom een PDF er goed uit kan zien terwijl de gekopieerde tekst, toegankelijkheidsvolgorde of vertaalvolgorde onjuist is. Zie de documentatie van Adobe over PDF-paginainhoud en logische structuur in getagde PDF's.

De praktische regel is eenvoudig: vergelijk het vertaalde document op het niveau van relaties, niet alleen op basis van screenshots.

Een reproduceerbare stresstest voor PDF-indelingen

We hebben een synthetische stresstest voor PDF-indelingsvertalingen van twee pagina's gemaakt, zodat de moeilijke onderdelen van een PDF kunnen worden getest zonder klantdocumenten. Het is een A4, getagde PDF met verzonnen namen en cijfers. Het is een testobject, geen leveranciersbenchmark en geen bewijs dat een tool een nauwkeurige vertaling produceert.

Pagina 1 test:

  • leesrichting in twee kolommen;
  • een tabel met een samengevoegde cel;
  • een geheel getal, bedrag, getekend percentage en formule;
  • grafieklabels waarvan de positie betekenis heeft;
  • een bewust smal vast tekstgebied;
  • een voetnoot die verbonden moet blijven met de markering.

Synthetische PDF-stresstest met twee kolommen, een tabel met samengevoegde cellen, grafieklabels, een smal tekstgebied en een voetnoot

Pagina 2 plaatst Engelse, Duitse, Chinese en Arabische tekst in vakken van gelijke grootte. Dit brengt vier verschillende problemen aan het licht: lokale expansie, regelomslag, ontbrekende tekens en bidirectionele opmaak.

Gelijke PDF-tekstgebieden met Engelse, Duitse, Chinese en Arabische tekst voor expansie- en schrift-tests

De richtlijnen van het W3C over tekengrootte bij vertaling leggen uit waarom korte labels en strak begrensde regio's onevenredig kunnen uitzetten, terwijl andere vertalingen juist kunnen krimpen. Het Bidirectionele algoritme van Unicode specificeert hoe gemengde van links naar rechts en van rechts naar links lopende tekens worden opgelost. Geen van beide problemen kan betrouwbaar worden opgelost door brontekens te tellen.

Download het testobject en voer het uit via elke workflow die je overweegt. Noteer de tool, datum, instellingen, bronstaal, doeltaal en uitvoerbestand. Dat verandert "de opmaak ziet er goed uit" in een herhaalbare test.

Diagnoseer je PDF voordat je deze vertaalt

1. Test of de tekst selecteerbaar is

Probeer één zin en één tabelcel te selecteren.

  • Als beide netjes selecteren, heeft de PDF waarschijnlijk een bruikbare tekstlaag.
  • Als de hele pagina als één afbeelding selecteert, is OCR vereist.
  • Als tekst in kleine fragmenten selecteert of gekopieerde rijen in de verkeerde volgorde arriveren, is de visuele plaatsing niet gelijk aan de logische structuur.

Adobe opmerkt dat een gescande PDF aanvankelijk afbeeldingsgegevens bevat in plaats van doorzoekbare tekst. OCR voegt een selecteerbare, doorzoekbare laag toe, maar Adobe raadt ook aan om herkenningsfouten na verwerking te controleren. Zie Tekst herkennen in gescande PDF's.

2. Kopieer een moeilijk gedeelte naar een editor voor platte tekst

Doe dit met een alinea in twee kolommen, één volledige tabelrij en een bijschrift. Als de geplakte volgorde vóór de vertaling onjuist is, begint de vertaallaag vanaf de verkeerde volgorde.

De documentatie van de tool Leesvolgorde van Adobe laat zien dat complexe tabellen, figuren, dicht bij elkaar geplaatste kolommen en pagina-elementen expliciete ordening en tag-reparatie nodig kunnen hebben. Vloeiendheid kan geen alinea herstellen die is samengesteld uit de verkeerde fragmenten.

3. Kies de moeilijkste representatieve pagina

Test de tittelpagina niet. Kies de pagina met de grootste kans op mislukking:

  • de dichtste tabel;
  • de smalste zijbalk of callout;
  • een pagina met twee kolommen en een voetnoot;
  • een grafiek met korte labels;
  • een pagina met CJK, Arabisch, Devanagari of gemengde schriften;
  • een scan met laag contrast of scheefstand.

Als de moeilijkste pagina mislukt, zorgt het vooraf vertalen van 200 eenvoudigere pagina's alleen maar voor meer opruimwerk.

4. Noteer de niet-onderhandelbare beperkingen

Verschillende documenten vereisen verschillende definities van "behouden".

DocumenttypeMeestal niet-onderhandelbaarMeestal flexibel
Contract of formulierClausulevolledigheid, labels, handtekeningen, verwijzingenLokale omslag en bescheiden spatzijde
Academisch papierVergelijkingen, citaten, figuurrelaties, leesrichtingPaginatelling en alinea-regeleinden
JaarverslagCijfers, eenheden, tabelrijen, grafiekassociatiesLabelomslag en lokale regiogrootte
HandleidingWaarschuwingen, stapvolgorde, callouts, afbeeldingsverwijzingenPaginering en gecontroleerde reflow
Boek of lang rapportHoofdstukvolgorde, koppen, notities, afbeeldingsplaatsingPaginering en alineastroom

Schrijf deze beperkingen op voordat je kiest voor een reparatie. Anders hebben reviewers de neiging om de visuele gelijkenis te beschermen, zelfs wanneer dat ten koste gaat van de betekenis.

De veiligste end-to-end workflow

Stap 1: Bewaar de bron en leg een basislijn vast

Bewaar een onaangeroerd bronbestand. Noteer de paginatelling, het bestandstype, de taal, of de PDF getagd is en of de tekst selecteerbaar is. Als het document later wordt bijgewerkt, bewaar dan zowel het originele brondocument als de PDF.

Stap 2: Voer OCR alleen uit wanneer dat nodig is

Voer voor pagina's met alleen afbeeldingen OCR uit in de juiste bronstaal. Controleer namen, getallen, leestekens, tabellen, voetnoten en gebieden met een laag contrast vóór de vertaling. OCR-fouten zijn upstream-fouten: een vertaalsysteem kan vloeiende uitvoer produceren uit tekst die onjuist is herkend.

De toegewijde gids voor gescande PDF's behandelt het opschonen van scans, de selectie van OCR-talen, verdachte tekens en privacycontroles in meer detail.

Stap 3: Vertaal de representatieve pagina

Gebruik een workflow die is ontworpen om een document terug te geven, en niet alleen vertaalde proza. Voor de meeste opgemaakte PDF's betekent dit dat je het testbestand uploadt naar BookTranslator PDF Translator, het taalpaar selecteert en de geretourneerde PDF beoordeelt.

Beoordeel niet alleen de eenvoudigste alinea. Vergelijk de exacte elementen die in je basislijn staan vermeld.

Stap 4: Controleer de structuur vóór de formulering

Controleer in deze volgorde:

  1. Zijn alle bronregio's opgenomen?
  2. Is de leesrichting correct?
  3. Verwijzen tabelrijen, grafieklabels, bijschriften en voetnoten nog steeds naar de juiste objecten?
  4. Zijn getallen, namen, eenheden en formules intact?
  5. Wordt het doelschrift correct weergegeven?
  6. Pas dan: is de vertaling vloeiend en nauwkeurig?

Een gepolijste vertaling van de verkeerde tekstvolgorde is nog steeds een mislukt document.

Stap 5: Vertaal het volledige bestand en bemonster riskante pagina's

Nadat de representatieve pagina is geslaagd, vertaal je de volledige PDF. Controleer het eerste, middelste en laatste voorkomen van elke riskante structuur in plaats van alleen de eerste pagina te controleren.

Voor een lang rapport kan dit het volgende betekenen:

  • de eerste en laatste pagina met twee kolommen;
  • de eenvoudigste en dichtste tabel;
  • een grafiek nabij het begin en einde;
  • elke waarschuwingspagina;
  • elke pagina waar het doelschrift of lettertype verandert.

Stap 6: Pas de minst destructieve reparatie toe

Repareer een lokaal probleem lokaal. Verklein het document niet globaal omdat één kop lang is.

Tekstoverloop verhelpen zonder alles te verkleinen

Vertaalde tekst loopt over wanneer de doelformulering niet langer past in de geometrie van het brongebied. De onmiddellijke oorzaak kan tekstexpansie zijn, maar de bindende beperking is meestal één specifieke box, kolom, rij, lettertype of regelafbreekregel.

Pas reparaties toe in deze volgorde:

VolgordeReparatieGebruiken wanneerBelangrijkste risico
1Natuurlijke omslag toestaanDe regio heeft ongebruikte verticale ruimteLijstinspringing of rijhoogte kan veranderen
2Lokale regel- of alinea-afstand aanpassenDe overloop is kleinDichte tekst kan moeilijker leesbaar worden
3Verbreed of vergroot de getroffen regioNaburige witruimte is echt ongebruiktAangrenzende objecten kunnen verschuiven
4Naburige elementen laten doorlopenVerschillende blokken wedijveren om ruimtePaginahiërarchie en verwijzingen kunnen verschuiven
5Een goedgekeurde kortere doelterm gebruikenEen standaard beknopte term bestaatBetekenis vereist tweetalige beoordeling
6Een vervolgpagina toevoegenDe inhoud past niet leesbaarPaginering verandert
7Lettergrootte lokaal verlagenEen kleine verlaging blijft leesbaarToegankelijkheid en visuele consistentie

Vertrouw niet op een enkel taalexpansiepercentage. Een Duitse alinea kan passen terwijl een samengestelde kop mislukt. Chinese proza kan krimpen terwijl een onvertaalde URL nog steeds over een cel heen loopt. Arabisch past mogelijk op basis van tekentalen, maar mislukt omdat het lettertype, de vormgeving, de leestekens of de richting onjuist zijn.

Gebruik deze diagnose:

  • Afgehakt in één box: pas de grootte aan of laat die regio opnieuw doorlopen.
  • Vakjes of ontbrekende tekens: vervang of sluit een lettertype in met de vereiste tekens.
  • Lange woorden of URL's weigeren te omslaan: herstel regelafbreek- of koppeltekenregels.
  • Alleen tabelkoppen mislukken: gebruik een tabelspecifieke reparatie.
  • Herhaalde koppen botsen op elke pagina: herzie het paginasjabloon in plaats van elke alinea.
  • Twee fragmenten worden één te grote alinea: herstel de leesrichting voordat je de typografie aanraakt.

Als de bronindeling geen ruimte biedt voor een getrouwe doeltaalversie, zijn identieke coördinaten het verkeerde acceptatiecriterium. Behoud in plaats daarvan de volledigheid, hiërarchie en leesbaarheid.

Tabellen, grafieken, getallen en voetnoten behouden

Een PDF-tabel wordt niet altijd opgeslagen als een tabel. Deze kan bestaan uit bewerkbare tekst over rasterlijnen, vele gepositioneerde fragmenten of één enkele afbeelding. Een grafieklabel kan afzonderlijke tekst zijn of in de afbeelding zijn ingebakken.

Dat creëert vier onafhankelijke storingsklassen:

StoringsklasseVoorbeeldWaarom visuele inspectie dit alleen over het hoofd ziet
StructureelEen samengevoegde cel splitst of twee cellen worden één zinHet resultaat ziet er mogelijk nog steeds uitgelijnd uit
Numeriek-3.2% verliest het minteken of verhuist naar een andere rijVloeiend proza leidt af van de waarde
VisueelEen vertaalde kop kruist een randDe tekst is mogelijk nog steeds compleet
ReferentieelEen voetnootmarkering verliest zijn notitieBeide stukken verschijnen mogelijk nog steeds ergens anders

Gebruik een beoordeling met beschermde tokens voor:

  • gehele getallen en decimale waarden;
  • positieve en negatieve tekens;
  • percentages, valuta's, datums en versienummers;
  • eenheden en formules;
  • tabel- en figuurnummers;
  • voetnootmarkeringen en de bijbehorende kwalificerende tekst.

Landinstellingen kunnen decimaaltekens of valuta-plaatsing wijzigen. De vraag is niet of elk teken identiek is; de vraag is of het doel dezelfde hoeveelheid vertegenwoordigt en gekoppeld blijft aan het juiste label.

Controleer voor elke tabel:

  1. Het aantal rijen en kolommen komt nog steeds overeen.
  2. Samengevoegde cellen dekken dezelfde records af.
  3. Elk getal blijft gekoppeld aan het bronlabel.
  4. Eenheden, tekens en precisie zijn correct.
  5. Voetnoten kwalificeren nog steeds de beoogde waarde.
  6. Hoofdomslag heeft geen inhoud verborgen.

Controleer voor elke grafiek of de geometrie en gegevens ongewijzigd blijven, labels nog steeds de juiste visuele markeringen identificeren en bijschriften aangehecht blijven. Als labels in een afbeelding zijn ingebed, gebruik dan afbeelding-bewuste OCR en teken ze opnieuw, of behoud de originele grafiek met een vertaald bijschrift of legenda. Rek of snijd een grafiek niet uit om te passen bij langere labels.

Als een financieel, wetenschappelijk of juridisch document zelfs maar één onjuiste waarderelatie bevat, mislukt het document ongeacht hoe gepolijst het eruitziet.

Kies een tweetalige PDF-indeling

Een tweetalige PDF is handig wanneer iemand het doel moet controleren aan de hand van de bron. Het is niet automatisch het beste definitieve leverbaar product.

BeoordelingstaakBeste startindelingAfweging
Alinea-voor-alinea bewerkenBron links, doel rechtsSmalle kolommen versterken de overloop
Mobiele of tabletresumentBronalinea gevolgd door doelalineaPaginatelling neemt toe
Juridische of archiefreferentieTegenover elkaar liggende bron- en doelpagina'sHet document verdubbelt ruwweg in lengte
Dichte tabellen en vaste pagina'sAfzonderlijke gesynchroniseerde bron- en doel-PDF'sVereist een viewer of beoordelingsproces dat pagina's uitgelijnd houdt
KlantleveringDoel-alleen PDF plus een afzonderlijk tweetalig beoordelingsexemplaarTwee gecontroleerde bestanden moeten worden onderhouden

Niet uitlijnen op visuele regeleinden. Vertaling kan één bronzin splitsen in twee doelzinnen of twee korte zinnen combineren. Gebruik koppen, alineavolgorde, tabelnummers, figuurnummers, lijstitems en voetnootmarkeringen als stabiele ankers.

Naast elkaar is een slechte standaard wanneer de bron al meerdere kolommen, dichte tabellen, marginale notities of grote lokale expansie heeft. In die gevallen behouden tegenover elkaar liggende pagina's of gesynchroniseerde eentalige bestanden de normale leesbreedte en maken ze storingen gemakkelijker te isoleren.

Beide talen moeten doorzoekbaar en selecteerbaar blijven waar mogelijk. Controleer de gekopieerde tekstvolgorde, metagegevens van de documenttaal, koppen, tabeltags en figuurbeschrijvingen. Als toegankelijkheid een harde vereiste is, zijn afzonderlijke eentalige bestanden vaak veiliger dan een complexe structuur met afwisselende kolommen.

Kies de juiste tool voor de klus

Toegewijde PDF-vertaler

Gebruik een toegewijde vertaler voor lange, opgemaakte of klantgerichte PDF's. Dit is het juiste startpunt wanneer de vereiste uitvoer een andere bruikbare PDF is in plaats van een teksttranscript.

Google Translate

Gebruik Google Translate voor snelle begrippen van korte, eenvoudige documenten wanneer de indeling niet het te leveren product is. Pagina's met meerdere kolommen, scans, dichte tabellen en definitieve publicatie vereisen een beter gecontroleerde workflow. De gids voor Google Translate PDF behandelt de documentworkflow en faaltekens.

ChatGPT

Gebruik ChatGPT voor korte passages, het voorbereiden van woordenlijsten, toonbeslissingen en tweetalige beoordeling. Behandel een chatinterface niet als de pagina-indelingsengine voor een lange PDF. De ChatGPT PDF-workflow bevat aanwijzingen die samenvatting en toegevoegde inhoud verbieden.

PDF converteren naar DOCX

Converteer alleen eerst wanneer je van plan bent het document handmatig te bewerken of te herbouwen. Conversie kan tabellen splitsen, fragmenten opnieuw ordenen en grafieklabels veranderen in zwevende vakken voordat de vertaling begint. Test de moeilijkste pagina voordat je doorzet. Als de geconverteerde DOCX structureel schoon is, ga dan verder met de DOCX-vertaler; als deze al kapot is, zal vertaling de conversie niet herstellen.

Menselijke of tweetalige reviewer

Gebruik een gekwalificeerde reviewer voor juridische, medische, financiële, veiligheidskritieke, academische of gepubliceerde inhoud. Een indelingsworkflow kan elk vak behouden terwijl de betekenis nog steeds onjuist is. Gebruik de echte vertaalvoorbeelden om te zien hoe we taalbeoordeling scheiden van indelingsbeoordeling.

Acceptatiechecklist voor PDF-vertalingen

Blocker

  • Ontbrekende of afgehakte tekst
  • Onjuiste leesrichting
  • Over elkaar heen vallende alinea's of labels
  • Getallen toegewezen aan de verkeerde rij of grafiekelement
  • Gewijzigde formules, tekens, eenheden of verwijzingen
  • Onleesbare lettergrootte
  • Ontbrekende tekens in de doeltaal
  • Gebroken Arabische of Hebreeuwse richting en leestekens
  • Verborgen waarschuwingen, bijschriften of voetnoten

Grote defecten

  • Ongemakkelijke maar leesbare omslag
  • Bijschriften gescheiden van figuren
  • Grote onverklaarde paginadrift
  • Inconsistente behandeling van koppen
  • Herhaalde lokale wijzigingen in de lettergrootte
  • Tweetalige blokken uitgelijnd op de verkeerde bronpassage

Cosmetische verschillen

  • Verschillende regeleinden
  • Kleine wijzigingen in de witruimte
  • Een bescheiden wijziging in de paginatelling met gecorrigeerde verwijzingen
  • Enigszins verschillende tabelrijhoogten waarbij alle inhoud zichtbaar is

Noteer voor elke mislukte pagina de bronpagina, het elementtype, het symptoom, de bindende beperking, de reparatie en of een beoordeling van de tweetalige betekenis vereist is. Dat auditspoor is nuttiger dan te zeggen "opmaak aangepast".

Aanbevolen workflow voor de meeste PDF's

  1. Bewaar een onaangeroerde bron-PDF.
  2. Controleer of tekst- en tabelcellen selecteerbaar zijn.
  3. Voer alleen OCR uit voor inhoud met alleen afbeeldingen en beoordeel vervolgens herkenningsfouten.
  4. Download de PDF-stresstest of selecteer de moeilijkste pagina uit je eigen bestand.
  5. Vertaal die representatieve pagina met PDF Translator.
  6. Controleer leesrichting, tabellen, getallen, labels, voetnoten, lettertypen en richting vóór de taalvloeiendheid.
  7. Vertaal het volledige bestand pas nadat de representatieve pagina is geslaagd.
  8. Herstel lokale beperkingen lokaal; verklein het document niet globaal.
  9. Bewaar de bron, de vertaalde PDF, instellingen, woordenlijst en beoordelingsnotities samen voor toekomstige revisies.

Ga voor vergelijkingen, citaten en onderzoeksindelingen verder met de vertaalworkflow voor academische papers. Als je nog steeds beslist of de bron PDF of EPUB moet zijn, gebruik dan de beslissingsgids EPUB vs PDF.

Gerelateerde berichten

Hoe je een PDF vertaalt met behoud van de opmaak