BookTranslator
BookTranslator

Le copier-coller de PDF donne un mauvais texte ? Diagnostiquez d'abord la couche de texte

Un PDF peut sembler correct mais copier de mauvais mots ou nombres. Utilisez quatre fichiers d'exemple pour identifier les problèmes de couche de texte et choisissez une réparation vérifiable.

BookTranslator

BookTranslator Team

11 min read

Si un PDF a l'air correct mais colle un texte erroné, cessez d'utiliser la version collée comme source. Comparez d'abord un court passage avec la page visible : un nom, une phrase et un nombre. L'étape suivante dépend de l'absence de texte extractible, de correspondances de caractères incorrectes, d'une couche OCR masquée imprécise ou d'un problème d'ordre de lecture. Lancer l'OCR sur l'ensemble du document n'est pas la bonne première solution pour ces quatre cas.

L'erreur la plus dangereuse n'est pas le charabia. C'est le texte plausible : une page qui indique 18 cahiers , tandis que le texte extrait indique 13 cahiers. Nous avons créé quatre PDF téléchargeables pour rendre cette distinction observable, sans utiliser les documents privés de quiconque.

Commencez par une petite vérification par copier-comparer

Conservez le fichier d'origine intact et ouvrez une copie de travail. Collez une courte sélection dans un éditeur de texte brut, puis comparez-la caractère par caractère avec la page. Répétez l'opération sur une autre page et, si possible, dans un second lecteur de PDF. Il s'agit d'un contrôle de diagnostic, et non de la preuve que le reste du document est correct.

Ce qui se produitCe qu'il faut étudierPremière action utile
Rien ne se sélectionne ou le collage est videLa page contient peut-être uniquement une imageVérifiez si le lecteur sélectionne l'image de la page plutôt que le texte
Les lettres changent systématiquement, bien qu'elles aient l'air normales sur la pageEncodage des caractères ou correspondance d'extractionComparez la sortie d'un autre lecteur ; recherchez un fichier source d'origine ou une meilleure exportation
La plupart des mots sont lisibles, mais des noms ou des nombres sont erronésUne couche de texte imprécise, incluant une ancienne OCRComparez le passage extrait au scan visible
Les lettres sont correctes, mais les colonnes, les légendes ou les notes de bas de page apparaissent dans le désordreExtraction de la mise en page et de l'ordre de lectureTestez une seule colonne ou un seul paragraphe séparément
La copie est désactivéePermissions du document ou comportement du lecteurVérifiez les permissions du fichier et demandez une copie exploitable à la source

Ce sont des indices, et non un moyen d'identifier les mécanismes internes de chaque PDF à partir d'un seul symptôme. Le guide de réutilisation du contenu d'Adobe distingue le contenu exclusivement visuel des restrictions de copie. Aucun des deux ne doit être considéré automatiquement comme une couche de texte endommagée. Le guide d'extraction pypdf décrit séparément les images, l'extraction de texte ainsi que les difficultés liées aux tableaux et à l'espacement.

Pour un livre ou un rapport long, notez le numéro de page du PDF où chaque problème survient. Une page de titre propre ne vous indique pas si une annexe, un encart numérisé ou un chapitre sur deux colonnes sera copié correctement.

Quatre PDF : ce que montre la page par rapport à ce que renvoie l'extraction

Notre page de test contient quatre lignes d'origine, notamment :

L'archive contient 18 carnets.

L'article B-204 est arrivé le 6 mai.

Nous avons créé un PDF numérique normal et en avons délibérément construit trois variantes. Nous avons ensuite extrait leur texte avec Poppler et pypdf. Les deux extracteurs ont renvoyé le même texte pour chaque fichier de ce test.

Télécharger le PDFComment nous l'avons construitRésultat extrait réel
Texte numérique correctTexte visible normal avec une police intégrée18 notebooks; B-204; 6 May
Mauvais mappage UnicodeModification du mappage d'extraction, sans changer les glyphes visibles13 notebooks; plusieurs caractères a minuscules sont devenus x
Texte caché incorrectAjout intentionnel d'un texte invisible erroné sur l'image d'une page13 notebooks; B-2O4; 8 May
Page contenant uniquement une imageUtilisation de la même image de page sans couche de texteSortie de texte vide

Une page numérique d'apparence normale peut se copier de manière incorrecte

Les deux premiers PDF ont rendu des pixels identiques dans notre comparaison, mais le texte extrait différait. Dans le deuxième fichier, nous avons modifié intentionnellement un ToUnicode mappage : information utilisée pour associer des codes de caractères stockés à du texte Unicode. Le chiffre visible est resté 8, tandis que l'extraction a renvoyé 3. Le document de documentation CMap de pypdf illustre ce mécanisme de mappage.

Cela démontre un mécanisme de défaillance, et non l'affirmation selon laquelle chaque PDF corrompu présente le même défaut. Une entrée ToUnicode manquante ne constitue pas à elle seule notre diagnostic, et la modification manuelle des mappages ne représente pas une solution générale pour le lecteur.

Un document numérisé interrogeable peut contenir les mauvais mots

Les troisième et quatrième PDF ont également été affichés de manière identique l'un à l'autre. L'un contenait du texte invisible incorrect ; l'autre n'en contenait aucun. Dans le troisième fichier, l'extraction a modifié silencieusement à la fois une quantité et une date. Le code B-2O4 contenait la lettre O, et non le chiffre 0 affiché dans l'image.

Nous avons inséré ces erreurs nous-mêmes pour représenter le type de décalage qu'une couche de texte masquée peut contenir. Un moteur OCR n' a pas généré ces erreurs. Le quatrième fichier montre la condition inverse : une image de page lisible sans rien à renvoyer pour ces extracteurs de texte. Cela correspond à la limitation documentée de pypdf : il extrait le texte PDF existant et ne reconnaît pas les mots présents dans les images.

Ce que ce test établit, et ce qu'il n'établit pas

Le 10 septembre 2026, nous avons vérifié quatre fichiers d'une page à l'aide de Poppler 26.08.0 et pypdf 6.10.0. Les comparaisons visuelles ont utilisé Poppler à 144 dpi. L'égalité des pixels a été maintenue au sein des deux paires, mais pas sur l'ensemble des quatre fichiers : la paire basée sur des images a subi une étape de rendu supplémentaire.

Il s'agit d'une démonstration contrôlée et non d'un test de performance de la précision de l'OCR. Elle ne teste pas la reconnaissance multilingue, les mises en page complexes, la réparation par Acrobat, la réparation par OCRmyPDF ou les téléchargements sur BookTranslator. Il s'agissait d'exemples construits avec des défauts connus, et non d'une évaluation en aveugle.

Les résultats du texte brut et des pixels, les instructions de reproduction, et le générateur sont disponibles avec les fichiers. Ils utilisent une police Noto Sans non modifiée avec sa licence de police ouverte incluse.

Choisissez l'étape suivante la moins perturbatrice

Les pistes de réparation suivantes proviennent de la documentation officielle et de diagnostics pratiques. Elles ne sont pas les résultats de réparation de notre expérience sur quatre fichiers. Travaillez sur une copie et vérifiez le résultat avant de remplacer tout élément sur lequel vous comptez.

Si vous disposez du document source, essayez d'abord un nouvel export

Un nouveau PDF généré à partir du fichier original de traitement de texte, d'édition ou de mise en page est un premier candidat utile. Comparez précisément le passage qui a posé problème. Ne supposez pas qu'un nouveau nom de fichier ou un export réussi signifie que son texte est désormais correct.

Pour les documents provenant d'archives ou d'un éditeur, vérifiez s'il existe une autre version contenant du texte. Veillez à ce que l'édition et les références de page correspondent : un fichier plus propre d'une édition différente pourrait ne pas conserver le passage dont vous avez besoin.

Si un scan présente quelques erreurs de reconnaissance, révisez ces mots

Acrobat documente un flux de travail sous Numériser et OCR → Corriger le texte reconnu. Cela vous permet de réviser les mots signalés comme suspects par rapport à l'image numérisée et de corriger le texte reconnu. Suivez les instructions de correction actuelles d'Adobe pour l'interface de votre version.

N'utilisez pas une liste de suspects vide comme test d'exhaustivité. Comparez de manière indépendante les noms, dates, identifiants et quantités que vous allez citer ou traduire. Notre exemple délibérément erroné 13 notebooks l'exemple montre pourquoi un résultat lisible ne suffit pas.

Si le texte caché est globalement erroné, distinguez la réfection (redo) de la force (force)

Pour les lecteurs qui utilisent des outils en ligne de commande, OCRmyPDF documente différentes options pour les pages qui contiennent déjà du texte :

  • --redo-ocr supprime le texte OCR non imprimable existant et relance la reconnaissance tout en excluant le texte imprimable de l'OCR.
  • --skip-text ignore les pages contenant du texte. Ce n'est pas une solution pour réparer une couche de texte erronée existante.
  • --force-ocr rasterise le contenu des pages et applique l'OCR sur les images obtenues.

Ces comportements sont décrits dans la documentation d'OCRmyPDF sur les erreurs liées au texte existant. Dans la version 17, les options équivalentes sont également disponibles via --mode; les anciens indicateurs restent des alias.

Il y a des coûts et des exceptions. La réfection ne peut pas identifier toutes les dispositions OCR historiques ; certains fichiers placent une image opaque sur du texte qui est techniquement imprimable. Le forçage transforme le texte imprimable et le contenu vectoriel en pixels et aplatit le contenu interactif. La réfection et le forçage suppriment également une arborescence de structure existante au lieu de la reconstruire. Consultez la documentation avancée d'OCRmyPDF avant de choisir l'une ou l'autre option.

Un extrait réparé ne constitue donc pas une vérification d'accessibilité. Si le document nécessite des titres, un ordre de lecture ou des figures accessibles, utilisez les contrôles d'accessibilité PDF traduits.

séparés

Dressez la liste des pages qui contiennent déjà du texte numérique fiable et de celles qui nécessitent une reconnaissance. Vérifiez les langues sur les pages concernées avant de configurer l'OCR. Notre guide sur l'OCR des PDF multilingues aborde la sélection de la langue ; c'est une décision différente de celle qui consiste à déterminer si une ancienne couche de texte est erronée.

S'il n'y a aucune couche de texte, passez au flux de travail pour PDF numérisés. Essayer à plusieurs reprises un autre extracteur de texte brut ne permettra pas à pypdf de reconnaître les mots dans une image.

Vérifiez le texte de remplacement avant de l'utiliser

Utilisez le feuille de contrôle de la couche de texte téléchargeable pour conserver côte à côte la référence visible, l'extraction précédente et l'extraction de remplacement. Commencez par l'échec connu, puis testez un autre passage et toute mise en page nettement différente.

  1. Mots : comparez les noms et les termes peu familiers lettre par lettre.
  2. Chiffres : vérifiez les quantités, les virgules décimales, les dates et les identifiants tels que B-204.
  3. Ordre : lisez un paragraphe complet par-delà les sauts de ligne ; vérifiez séparément les colonnes et les légendes proches.
  4. Couverture : confirmez que les pages et les passages dont vous avez besoin n'ont pas été omis.
  5. Comportement du fichier : réouvrez le fichier de remplacement enregistré et répétez le test de copie. Si vous dépendez de signets, de liens ou d'une structure accessible, vérifiez-les également.

La validation de passages sélectionnés apporte des preuves pour ces passages. Elle ne certifie pas l'ensemble du fichier. Conservez l'image de la page originale comme référence, en particulier lors de la correction d'une citation ou d'une langue peu familière.

Ne traduisez qu'après avoir pu faire confiance à la source

Si votre objectif était de citer un paragraphe ou de prendre des notes, un extrait vérifié peut suffire. Vous n'avez pas besoin d'un service de traduction pour cette tâche.

Si vous devez lire l'intégralité du document dans une autre langue, utilisez le fichier vérifié comme point de départ pour la traduction de PDF. Le mode OCR de BookTranslator reconstruit un PDF traduit à partir du contenu reconnu ; cela ne garantit pas la réparation d'une couche de texte existante ni la reproduction exacte de la mise en page originale.

Conservez les pages de référence tout au long de l'étape de traduction. Les mêmes quantités et identifiants vérifiés ici doivent figurer dans la passe finale d'assurance qualité (AQ) de traduction de PDF. Une traduction fluide ne peut pas, à elle seule, vous indiquer que sa source aurait dû dire 18 plutôt que 13.

Articles connexes