BookTranslator
BookTranslator

Comment traduire un PDF tout en conservant sa mise en page

Utilisez un flux de travail PDF reproductible pour préserver l'ordre de lecture, les tableaux, les graphiques, les polices, le texte RTL et la mise en page lors de la traduction.

BookTranslator

BookTranslator Team

20 min read

Réponse rapide : Préservez la structure significative du document, pas chaque coordonnée

Pour traduire un PDF sans perdre sa mise en page, déterminez d'abord s'il contient du texte sélectionnable, des images numérisées ou les deux. Testez ensuite la page représentative la plus difficile avec un traducteur de PDF conscient de la mise en page avant de traiter l'ensemble du fichier. Examinez séparément l'ordre de lecture, le débordement de texte, les tableaux, les étiquettes de graphiques, les notes de bas de page, les polices et le texte de droite à gauche.

L'objectif n'est pas d'obtenir une identité pixel par pixel. Une traduction peut déplacer un saut de ligne ou ajouter une page tout en préservant correctement le document. Elle échoue lorsque des informations disparaissent, se déplacent vers la mauvaise ligne de tableau, deviennent illisibles ou perdent leur relation avec une légende, une note de bas de page ou un élément visuel.

Utilisez ce tableau de décision comme point de départ :

PDF dont vous disposezPremière actionPrincipal risque de mise en page
PDF numérique sélectionnableTraduire directement une page difficileOrdre de lecture et débordement des zones de texte
PDF numérisé ou photographiéExécuter l'OCR, examiner la couche de texte, puis traduireErreurs d'OCR devenant des erreurs de traduction
PDF avec des tableaux ou graphiques densesTester une page avec des cellules fusionnées, des chiffres et des étiquettesMise en page correcte mais relations de données erronées
Rapport ou document à deux colonnesVérifier l'extraction et l'ordre de lecture avant de juger la fluiditéFusion des colonnes ou paragraphes traduits hors séquence
Formulaire, certificat ou modèle fixeDécider quelles coordonnées et références de page sont fixées légalement ou opérationnellementRognage causé par des régions de texte rigides
Copie de révision bilingueChoisir des fichiers côte à côte, intercalés, en vis-à-vis ou synchronisésColonnes étroites et alignement source-cible instable

Ceci est le flux de travail central pour la catégorie de traduction PDF. Si vous choisissez entre plusieurs produits plutôt que de diagnostiquer un fichier, commencez par le comparatif des traducteurs PDF. Si vous ne pouvez sélectionner aucun texte, allez directement au flux de travail pour PDF numérisés et OCR.

Que devrait réellement signifier « conserver la mise en page »

La préservation de la mise en page n'est pas une simple fonctionnalité binaire de réussite ou d'échec. Elle comporte au moins cinq niveaux :

  1. Complétude du contenu : chaque paragraphe, étiquette, avertissement, nombre et note significatif reste présent.
  2. Structure logique : les titres, listes, cellules de tableau, légendes, notes de bas de page et l'ordre de lecture expriment toujours les mêmes relations.
  3. Hiérarchie visuelle : les titres ressemblent toujours à des titres, les légendes restent subordonnées et les objets associés restent groupés.
  4. Prise en charge des scripts : les polices choisies contiennent les glyphes cibles, et la directionnalité ainsi que la ponctuation s'affichent correctement.
  5. Utilisabilité de la page : le résultat reste lisible à une taille normale sans rognage, chevauchement ou réduction aveugle des polices.

La documentation PDF d'Adobe décrit le contenu visuel d'une page comme une liste d'objets et d'opérations de marquage, et non comme une séquence de paragraphes modifiables semblable à Word. Elle distingue également la structure logique d'un document de son emplacement visuel. Cette distinction explique pourquoi un PDF peut sembler correct alors que le texte copié, l'ordre d'accessibilité ou l'ordre de traduction est erroné. Consultez la documentation d'Adobe sur le contenu de page PDF et la structure logique dans les PDF balisés.

La règle pratique est simple : comparez le document traduit au niveau des relations, et non par de simples captures d'écran.

Un test de résistance reproductible de la mise en page PDF

Nous avons créé un test de résistance de traduction de mise en page PDF synthétique de deux pages afin de pouvoir tester les parties difficiles d'un PDF sans utiliser les documents de clients. Il s'agit d'un PDF au format A4, balisé, avec des noms et des chiffres inventés. C'est un élément de référence, pas un benchmark de fournisseur et pas la preuve qu'un outil produit une traduction précise.

La page 1 teste :

  • l'ordre de lecture à deux colonnes ;
  • un tableau avec une cellule fusionnée ;
  • un entier, un montant en devise, un pourcentage signé et une formule ;
  • des étiquettes de graphiques dont la position porte un sens ;
  • une région de texte fixe délibérément étroite ;
  • une note de bas de page qui doit rester connectée à son marqueur.

Test de résistance PDF synthétique avec deux colonnes, un tableau à cellules fusionnées, des étiquettes de graphique, une zone de texte étroite et une note de bas de page

La page 2 place du texte en anglais, allemand, chinois et arabe dans des boîtes de taille égale. Elle expose quatre problèmes différents : l'expansion locale, le retour à la ligne, les glyphes manquants et la mise en page bidirectionnelle.

Zones de texte PDF égales contenant du texte en anglais, allemand, chinois et arabe pour les tests d'expansion et de script

Les recommandations du W3C sur la taille du texte dans la traduction expliquent pourquoi les étiquettes courtes et les régions très contraintes peuvent s'étendre de manière disproportionnée, tandis que d'autres traductions peuvent se contracter. L'algorithme bidirectionnel Bidirectional Algorithm d'Unicode spécifie la manière dont les caractères mélangés de gauche à droite et de droite à gauche sont résolus. Aucun de ces problèmes ne peut être résolu de manière fiable en comptant les caractères source.

Téléchargez le fichier de référence et passez-le dans n'importe quel flux de travail que vous envisagez d'utiliser. Enregistrez l'outil, la date, les paramètres, la langue source, la langue cible et le fichier de sortie. Cela transforme l'affirmation « la mise en page a l'air correcte » en un test reproductible.

Diagnostiquez votre PDF avant de le traduire

1. Vérifiez si le texte est sélectionnable

Essayez de sélectionner une phrase et une cellule de tableau.

  • Si les deux se sélectionnent proprement, le PDF possède probablement une couche de texte utilisable.
  • Si la page entière se sélectionne comme une seule image, elle nécessite une reconnaissance optique de caractères (OCR).
  • Si le texte se sélectionne en tout petits fragments ou si les lignes copiées arrivent dans le désordre, l'emplacement visuel ne correspond pas à la structure logique.

Adobe note qu'un PDF numérisé contient initialement des données d'image plutôt que du texte interrogeable. L'OCR ajoute une couche sélectionnable et interrogeable, mais Adobe recommande également de revoir les erreurs de reconnaissance après traitement. Voir Reconnaissance de texte dans les PDF numérisés.

2. Copiez une section difficile dans un éditeur de texte brut

Faites-le avec un paragraphe à deux colonnes, une ligne complète de tableau et une légende. Si l'ordre du texte copié est erroné avant la traduction, la couche de traduction part de la mauvaise séquence.

La documentation de l'outil Ordre de lecture d'Adobe montre que les tableaux complexes, les figures, les colonnes rapprochées et les éléments de page peuvent nécessiter un ordre explicite et une correction du balisage. La fluidité ne peut pas réparer un paragraphe assemblé à partir de mauvais fragments.

3. Choisissez la page représentative la plus difficile

Ne testez pas la page de titre. Choisissez la page la plus susceptible d'échouer :

  • le tableau le plus dense ;
  • la barre latérale ou l'encadré le plus étroit ;
  • une page à deux colonnes avec une note de bas de page ;
  • un graphique avec des étiquettes courtes ;
  • une page contenant du CJK, de l'arabe, du devanagari ou des scripts mixtes ;
  • un document numérisé avec un faible contraste ou une inclinaison.

Si la page la plus difficile échoue, traduire d'abord 200 pages plus faciles ne fera que créer plus de travail de nettoyage.

4. Notez les contraintes non négociables

Différents documents nécessitent différentes définitions de la « préservation ».

Type de documentGénéralement non négociableGénéralement flexible
Contrat ou formulaireComplétude des clauses, étiquettes, signatures, références de pagesRetour à la ligne local et modifications modestes d'espacement
Article académiqueÉquations, citations, relations entre figures, ordre de lectureNombre de pages et sauts de ligne des paragraphes
Rapport annuelNombres, unités, lignes de tableaux, associations de graphiquesRetour à la ligne des étiquettes et taille de région locale
ManuelAvertissements, ordre des étapes, encadrés, références d'imagesPagination et refusion contrôlée
Livre ou long rapportOrdre des chapitres, titres, notes, placement des imagesNombre de pages et flux des paragraphes

Notez ces contraintes par écrit avant de choisir une correction. Sinon, les réviseurs ont tendance à protéger la similarité visuelle même lorsque cela nuit au sens.

Le flux de travail de bout en bout le plus sûr

Étape 1 : Préservez la source et établissez une référence

Conservez un fichier source intact. Enregistrez le nombre de pages, le type de fichier, la langue, le fait que le PDF soit balisé ou non, et si le texte est sélectionnable. Si le document doit être mis à jour ultérieurement, conservez le document source d'origine ainsi que le PDF.

Étape 2 : Exécutez l'OCR uniquement en cas de besoin

Pour les pages composées uniquement d'images, exécutez l'OCR dans la bonne langue source. Examinez les noms, les chiffres, la ponctuation, les tableaux, les notes de bas de page et les régions à faible contraste avant la traduction. Les erreurs d'OCR sont des erreurs en amont : un système de traduction peut produire un texte fluide à partir d'un texte mal reconnu.

Le guide dédié aux PDF numérisés aborde plus en détail le nettoyage des numérisations, la sélection de la langue pour l'OCR, les caractères suspects et les contrôles de confidentialité.

Étape 3 : Traduisez la page représentative

Utilisez un flux de travail conçu pour renvoyer un document et non seulement de la prose traduite. Pour la plupart des PDF mis en page, cela signifie importer le fichier de test dans BookTranslator PDF Translator, sélectionner la paire de langues et examiner le PDF renvoyé.

N'évaluez pas seulement le paragraphe le plus facile. Comparez les éléments exacts répertoriés dans votre référence.

Étape 4 : Examinez la structure avant la formulation

Vérifiez dans cet ordre :

  1. Toutes les régions sources ont-elles été incluses ?
  2. L'ordre de lecture est-il correct ?
  3. Les lignes de tableaux, étiquettes de graphiques, légendes et notes de bas de page pointent-elles toujours vers les bons objets ?
  4. Les nombres, noms, unités et formules sont-ils intacts ?
  5. Le script cible s'affiche-t-il correctement ?
  6. Seulement après : la traduction est-elle fluide et précise ?

Une traduction soignée du mauvais ordre de texte reste un document raté.

Étape 5 : Traduisez le fichier complet et échantillonnez les pages à risque

Une fois que la page représentative a réussi, traduisez le PDF complet. Examinez la première, la médiane et la dernière occurrence de chaque structure à risque plutôt que de ne vérifier que la première page.

Pour un long rapport, cela peut signifier :

  • la première et la dernière page à deux colonnes ;
  • le tableau le plus simple et le plus dense ;
  • un graphique près du début et de la fin ;
  • chaque page d'avertissement ;
  • chaque page où le script ou la police cible change.

Étape 6 : Appliquez la correction la moins destructive

Corrigez un problème local au niveau local. Ne réduisez pas globalement le document sous prétexte qu'un titre est long.

Corriger le débordement de texte sans tout réduire

Le texte traduit déborde lorsque la formulation cible ne correspond plus à la géométrie de la région source. La cause immédiate peut être l'expansion du texte, mais la contrainte limitative est généralement une boîte, une colonne, une ligne, une police ou une règle de césure spécifique.

Appliquez les corrections dans cet ordre :

OrdreCorrectionUtiliser lorsqueRisque principal
1Autoriser le retour à la ligne naturelLa région dispose d'un espace vertical inutiliséL'indentation des listes ou la hauteur des lignes peuvent changer
2Ajuster l'espacement local des lignes ou des paragraphesLe débordement est minimeLe texte dense peut devenir plus difficile à lire
3Élargir ou agrandir la région affectéeL'espace blanc voisin est réellement inutiliséLes objets adjacents peuvent se déplacer
4Refondre les éléments voisinsPlusieurs blocs se disputent l'espaceLa hiérarchie des pages et les références peuvent dériver
5Utiliser un terme cible plus court approuvéUn terme concis standard existeLe sens nécessite une révision bilingue
6Ajouter une page de continuationLe contenu ne peut pas tenir de manière lisibleLa modification de la pagination intervient
7Réduire la taille de police localementUne petite réduction reste lisibleAccessibilité et cohérence visuelle

Ne vous fiez pas à un pourcentage unique d'expansion de la langue. Un paragraphe en allemand peut tenir tandis qu'un titre composé échoue. La prose chinoise peut se contracter alors qu'une URL non traduite dépasse toujours d'une cellule. L'arabe peut convenir en nombre de caractères mais échouer parce que la police, la mise en forme, la ponctuation ou la direction sont erronées.

Utilisez ce diagnostic :

  • Croppé ou masqué dans une boîte : redimensionnez ou refondez cette région.
  • Boîtes ou caractères manquants : remplacez ou incorporez une police dotée des glyphes requis.
  • Les mots longs ou les URL refusent de passer à la ligne : corrigez les règles de césure ou de retour à la ligne.
  • Seuls les en-têtes de tableaux échouent : utilisez une correction spécifique aux tableaux.
  • Des en-têtes répétés se coincent sur chaque page : révisez le modèle de page plutôt que chaque paragraphe.
  • Deux fragments deviennent un seul paragraphe surdimensionné : corrigez l'ordre de lecture avant de toucher à la typographie.

Si la mise en page source n'offre pas d'espace pour une version fidèle dans la langue cible, des coordonnées identiques constituent un critère d'acceptation erroné. Préservez plutôt l'exhaustivité, la hiérarchie et la lisibilité.

Préserver les tableaux, graphiques, nombres et notes de bas de page

Un tableau PDF n'est pas toujours stocké en tant que tableau. Il peut s'agir de texte modifiable sur des lignes de grille, de nombreux fragments positionnés ou d'une seule image. L'étiquette d'un graphique peut être un texte séparé ou intégré au graphique.

Cela crée quatre catégories de pannes indépendantes :

Catégorie de panneExemplePourquoi l'inspection visuelle seule la manque
StructurelleUne cellule fusionnée se sépare ou deux cellules deviennent une seule phraseLe résultat peut toujours paraître aligné
Numérique-3.2% perd son signe moins ou se déplace vers une autre ligneLa prose fluide détourne l'attention de la valeur
VisuelleUn en-tête traduit traverse une bordureLe texte peut toujours être complet
RéférentielleUn marqueur de note de bas de page perd sa noteLes deux éléments peuvent toujours apparaître ailleurs

Utilisez une révision par jetons protégés pour :

  • les nombres entiers et décimaux ;
  • les signes positifs et négatifs ;
  • les pourcentages, devises, dates et numéros de version ;
  • les unités et les formules ;
  • les numéros de tableaux et de figures ;
  • les marqueurs de notes de bas de page et leur texte explicatif.

Les conventions locales peuvent modifier les séparateurs décimaux ou le placement des devises. La question n'est pas de savoir si chaque caractère est identique, mais si la cible représente la même quantité et reste attachée à la bonne étiquette.

Pour chaque tableau, vérifiez que :

  1. Le nombre de lignes et de colonnes correspond toujours.
  2. Les cellules fusionnées couvrent les mêmes enregistrements.
  3. Chaque nombre reste associé à son étiquette source.
  4. Les unités, les signes et la précision sont corrects.
  5. Les notes de bas de page qualifient toujours la valeur prévue.
  6. Le retour à la ligne des en-têtes n'a pas masqué de contenu.

Pour chaque graphique, vérifiez que la géométrie et les données restent inchangées, que les étiquettes identifient toujours les repères visuels corrects et que les légendes restent attachées. Si les étiquettes sont intégrées dans une image, utilisez une reconnaissance optique de caractères (OCR) adaptée aux images et redessinez-les, ou conservez le graphique d'origine avec une légende ou un libellé traduit. N'étirez pas et ne rognez pas un graphique pour faire tenir des étiquettes plus longues.

Si un tableau financier, scientifique ou juridique contient ne serait-ce qu'une seule relation de valeurs erronée, le document échoue quel que soit son degré de raffinement.

Choisir un PDF bilingue

Un PDF bilingue est utile lorsqu'une personne doit vérifier la cible par rapport à la source. Il ne constitue pas automatiquement le meilleur livrable final.

Tâche de révisionMeilleure mise en page de départCompromis
Édition paragraphe par paragrapheSource à gauche, cible à droiteLes colonnes étroites amplifient le débordement
Étude sur mobile ou tabletteParagraphe source suivi du paragraphe cibleLe nombre de pages augmente
Référence juridique ou archivistiquePages source et cible en vis-à-visLe document double approximativement en longueur
Tableaux denses et pages fixesPDF source et cible séparés et synchronisésNécessite un visionneuse ou un processus de révision maintenant les pages alignées
Livraison au clientPDF cible uniquement plus une copie de révision bilingue séparéeDeux fichiers contrôlés doivent être maintenus

N'alignez pas les éléments par saut de ligne visuel. Une traduction peut diviser une phrase source en deux phrases cible ou combiner deux phrases courtes. Utilisez les titres, la séquence des paragraphes, les numéros de tableaux, les numéros de figures, les éléments de liste et les marqueurs de notes de bas de page comme ancres stables.

L'affichage côte à côte est un mauvais choix par défaut lorsque la source comporte déjà plusieurs colonnes, des tableaux denses, des notes marginales ou une forte expansion locale. Dans ces cas-là, des pages en vis-à-vis ou des fichiers monolingues synchronisés préservent une largeur de lecture normale et permettent d'isoler plus facilement les pannes.

Les deux langues doivent rester interrogeables et sélectionnables dans la mesure du possible. Vérifiez l'ordre du texte copié, les métadonnées de langue du document, les titres, les balises de tableaux et les descriptions de figures. Si l'accessibilité est une exigence stricte, des fichiers monolingues séparés sont souvent plus sûrs qu'une structure complexe à colonnes alternées.

Choisir le bon outil pour la tâche

Traducteur de PDF dédié

Utilisez un traducteur dédié pour les PDF longs, mis en page ou destinés aux clients. C'est le point de départ idéal lorsque le résultat requis est un autre PDF utilisable plutôt qu'une transcription textuelle.

Google Translate

Utilisez Google Translate pour une compréhension rapide de documents courts et simples lorsque la mise en page ne constitue pas le livrable. Les pages à colonnes multiples, les documents numérisés, les tableaux denses et la publication finale nécessitent un flux de travail plus maîtrisé. Le guide Google Translate PDF couvre son flux de travail documentaire et ses signes d'échec.

ChatGPT

Utilisez ChatGPT pour les passages courts, la préparation de glossaires, les décisions de ton et la révision bilingue. Ne considérez pas une interface de chat comme le moteur de mise en page d'un PDF long. Le flux de travail ChatGPT pour PDF comprend des invites qui interdisent la résumisation et l'ajout de contenu.

Convertir le PDF en DOCX

Ne convertissez le fichier au préalable que si vous avez l'intention d'éditer ou de reconstruire le document manuellement. La conversion peut diviser des tableaux, réordonner des fragments et transformer les étiquettes de graphiques en boîtes flottantes avant même que la traduction ne commence. Testez la page la plus difficile avant de vous engager. Si le fichier DOCX converti est structurellement propre, continuez avec le traducteur DOCX ; s'il est déjà corrompu, la traduction ne réparera pas la conversion.

Réviseur humain ou bilingue

Faites appel à un réviseur qualifié pour les contenus juridiques, médicaux, financiers, critiques pour la sécurité, académiques ou publiés. Un flux de travail de mise en page peut préserver chaque boîte tout en rendant le sens erroné. Utilisez les exemples de traduction réels pour voir comment nous dissocions la révision linguistique de la révision de la mise en page.

Liste de contrôle d'acceptation pour la traduction de PDF

Éléments bloquants

  • Texte manquant ou rogné
  • Ordre de lecture incorrect
  • Paragraphes ou étiquettes qui se chevauchent
  • Nombres assignés à la mauvaise ligne ou au mauvais élément de graphique
  • Formules, signes, unités ou références modifiés
  • Taille de police illisible
  • Glyphes de la langue cible manquants
  • Direction et ponctuation de l'arabe ou de l'hébreu corrompues
  • Avertissements, légendes ou notes de bas de page masqués

Défauts majeurs

  • Retours à la ligne maladroits mais lisibles
  • Légendes séparées des figures
  • Dérive de page importante et inexpliquée
  • Traitement incohérent des titres
  • Changements répétés de la taille des polices locales
  • Blocs bilingues alignés sur le mauvais passage source

Différences cosmétiques

  • Fins de ligne différentes
  • Petites modifications d'espacement
  • Modification modeste du nombre de pages avec références corrigées
  • Hauteurs de lignes de tableaux légèrement différentes avec tout le contenu visible

Pour chaque page défaillante, enregistrez la page source, le type d'élément, le symptôme, la contrainte limitative, la correction apportée et indiquez si une révision du sens bilingue est nécessaire. Cette piste d'audit est plus utile que de simplement dire « mise en page ajustée ».

Flux de travail recommandé pour la plupart des PDF

  1. Conservez un PDF source intact.
  2. Vérifiez si le texte et les cellules des tableaux sont sélectionnables.
  3. Exécutez l'OCR uniquement pour le contenu composé d'images, puis examinez les erreurs de reconnaissance.
  4. Téléchargez le test de résistance PDF ou sélectionnez la page la plus difficile de votre propre fichier.
  5. Traduisez cette page représentative avec PDF Translator.
  6. Examinez l'ordre de lecture, les tableaux, les nombres, les étiquettes, les notes de bas de page, les polices et la direction avant de vous intéresser à la fluidité de la langue.
  7. Ne traduisez le fichier complet qu'après la validation de la page représentative.
  8. Corrigez les contraintes locales au niveau local ; ne réduisez pas globalement le document.
  9. Conservez ensemble la source, le PDF traduit, les paramètres, le glossaire et les notes de révision pour les révisions futures.

Pour les équations, les citations et les mises en page de recherche, poursuivez avec le flux de travail de traduction d'articles académiques. Si vous hésitez encore à savoir si la source doit être au format PDF ou EPUB, utilisez le guide de décision EPUB vs PDF.

Articles connexes

Comment traduire un PDF tout en conservant sa mise en page