BookTranslator
BookTranslator

Il copia-incolla da PDF dà il testo sbagliato? Diagnostica prima il livello di testo

Un PDF può sembrare corretto ma copiare parole o numeri errati. Usa quattro file di esempio per identificare i problemi del livello di testo e scegliere una riparazione verificabile.

BookTranslator

BookTranslator Team

10 min read

Se un PDF sembra corretto ma incolla il testo sbagliato, smetti di usare la versione incollata come fonte. Per prima cosa confronta un breve passaggio con la pagina visibile: un nome, una frase e un numero. Il passaggio successivo dipende dal fatto che il file non abbia testo estraibile, abbia mappature di caratteri errate, un livello OCR nascosto impreciso o un problema di ordine di lettura. Eseguire l'OCR sull'intero documento non è la prima mossa giusta per tutti e quattro.

L'errore più pericoloso non è illeggibile. È un testo plausibile: una pagina che mostra 18 quaderni , mentre il testo estratto dice 13 quaderni. Abbiamo creato quattro PDF scaricabili per rendere tale distinzione osservabile, senza utilizzare i documenti privati di nessuno.

Inizia con un piccolo controllo di copia e confronto

Mantieni il file originale invariato e apri una copia di lavoro. Incolla una breve selezione in un editor di testo semplice, quindi confrontala carattere per carattere con la pagina. Ripeti su una pagina diversa e, se disponibile, in un secondo lettore PDF. Questo è un controllo diagnostico, non la prova che il resto del documento sia corretto.

Cosa succedeCosa investigarePrima azione utile
Non si seleziona nulla o l'incolla è vuotoLa pagina potrebbe contenere solo un'immagineVerifica se il lettore sta selezionando l'immagine della pagina anziché il testo
Le lettere cambiano in modo coerente, sebbene sembrino normali sulla paginaCodifica dei caratteri o mappatura di estrazioneConfronta l'output di un altro lettore; cerca un file sorgente originale o un'esportazione migliore
La maggior parte delle parole è leggibile, ma nomi o numeri sono erratiUn livello di testo impreciso, incluso un vecchio OCRConfronta il passaggio estratto con la scansione visibile
Le lettere sono corrette, ma colonne, didascalie o note a piè di pagina compaiono nell'ordine sbagliatoEstrazione del layout e dell'ordine di letturaTesta una singola colonna o paragrafo separatamente
La copia è disabilitataAutorizzazioni del documento o comportamento del lettoreControlla le autorizzazioni del file e chiedi alla fonte una copia utilizzabile

Questi sono indizi, non un modo per identificare i meccanismi interni di ogni PDF da un singolo sintomo. La guida di Adobe sul riutilizzo dei contenuti distingue i contenuti di sole immagini dalle restrizioni di copia. Nessuno dei due deve essere trattato automaticamente come un livello di testo danneggiato. La guida all'estrazione di pypdf descrive separatamente immagini, estrazione del testo e difficoltà con tabelle e spaziatura.

Per un libro o un report lungo, annota il numero di pagina del PDF in cui si verifica ciascun problema. Una pagina del titolo pulita non ti dice se un'appendice, un inserto scansionato o un capitolo a due colonne verranno copiati correttamente.

Quattro PDF: ciò che mostra la pagina rispetto a ciò che restituisce l'estrazione

La nostra pagina di test contiene quattro righe originali, tra cui:

The archive contains 18 notebooks.

Item B-204 arrived on 6 May.

Abbiamo creato un normale PDF digitale e ne abbiamo costruito deliberatamente tre alternative. Poi abbiamo estratto il loro testo con Poppler e pypdf. Entrambi gli estrattori hanno restituito lo stesso testo per ogni file in questo test.

Scarica il PDFCome lo abbiamo costruitoRisultato estratto effettivo
Testo digitale correttoNormale testo visibile con un carattere incorporato18 notebooks; B-204; 6 May
Mappatura Unicode errataModificata la mappatura di estrazione, senza cambiare i glifi visibili13 notebooks; diversi caratteri minuscoli a sono diventati x
Testo nascosto erratoÈ stato posizionato del testo invisibile deliberatamente scorretto sopra un'immagine di pagina13 notebooks; B-2O4; 8 May
Pagina con sola immagineÈ stata utilizzata la stessa immagine di pagina senza alcun livello di testoOutput di testo vuoto

Una pagina digitale dall'aspetto normale può essere copiata in modo errato

I primi due PDF sono stati renderizzati con pixel identici nel nostro confronto, eppure il loro testo estratto differiva. Nel secondo file, abbiamo modificato deliberatamente una ToUnicode mappatura: informazioni utilizzate per associare i codici dei caratteri memorizzati al testo Unicode. Il numero visibile è rimasto 8, mentre l'estrazione ha restituito 3. La documentazione di pypdf su CMap illustra questo meccanismo di mappatura.

Questo dimostra un meccanismo di errore, non l'affermazione che ogni PDF alterato abbia lo stesso difetto. Una voce ToUnicode mancante da sola non costituisce la nostra diagnosi, e la modifica manuale delle mappature non è una riparazione generale per il lettore.

Una scansione ricercabile può contenere le parole sbagliate

Il terzo e il quarto PDF sono stati anch'essi renderizzati in modo identico l'uno all'altro. Uno conteneva testo invisibile errato; l'altro non ne conteneva alcuno. Nel terzo file, l'estrazione ha modificato silenziosamente sia una quantità che una data. Il codice B-2O4 conteneva la lettera O, e non il numero 0 mostrato nell'immagine.

Abbiamo inserito noi stessi questi errori per rappresentare il tipo di discrepanza che un livello di testo nascosto può contenere. Un motore OCR non li ha generati. Il quarto file mostra la condizione opposta: un'immagine di pagina leggibile senza nulla che questi estrattori di testo possano restituire. Ciò è coerente con la limitazione documentata di pypdf: estrae il testo PDF esistente; non riconosce le parole all'interno delle immagini.

Cosa stabilisce questo test, e cosa non stabilisce

Il 10 settembre 2026, abbiamo verificato quattro file di una pagina utilizzando Poppler 26.08.0 e pypdf 6.10.0. I confronti visivi hanno utilizzato Poppler a 144 dpi. L'uguaglianza dei pixel è stata mantenuta all'interno delle due coppie, non tra tutti e quattro i file: la coppia basata su immagini è passata attraverso un passaggio di rendering aggiuntivo.

Questa è una dimostrazione controllata, non un benchmark di accuratezza OCR. Non testa il riconoscimento multilingue, i layout complessi, la riparazione con Acrobat, la riparazione con OCRmyPDF o i caricamenti su BookTranslator. Si tratta di esempi costruiti con difetti noti, non di una valutazione in cieco.

I risultati del testo non elaborato e dei pixel, le istruzioni per la riproduzione, e il generatore sono disponibili insieme ai file. Utilizzano un font Noto Sans non modificato con la relativa licenza open font inclusa.

Scegliere il passaggio successivo meno invasivo

I seguenti percorsi di riparazione derivano dalla documentazione ufficiale e dalla diagnostica pratica. Essi non sono i risultati della riparazione del nostro esperimento su quattro file. Lavora su una copia e verifica l'output prima di sostituire qualsiasi cosa su cui fai affidamento.

Se hai il documento sorgente, prova prima una nuova esportazione

Un nuovo PDF dal file originale di elaborazione testi, pubblicazione o impaginazione è un utile primo candidato. Confronta esattamente il passaggio che ha presentato l'errore. Non dare per scontato che un nuovo nome di file o un'esportazione riuscita significhino che il testo sia ora corretto.

Per il materiale ottenuto da un archivio o da un editore, verifica se esiste una versione alternativa contenente testo. Mantieni allineati i riferimenti all'edizione e alla pagina: un file più pulito di un'edizione diversa potrebbe non conservare il passaggio di cui hai bisogno.

Se una scansione presenta alcuni errori di riconoscimento, revisiona quelle parole

Acrobat documenta un flusso di lavoro in Scansione e OCR → Correggi testo riconosciuto. Ti consente di rivedere le parole sospette contrassegnate rispetto all'immagine scansionata e di correggere il testo riconosciuto. Segui le attuali istruzioni di correzione di Adobe per l'interfaccia della tua versione.

Non utilizzare un elenco di sospetti vuoto come test di completezza. Confronta in modo indipendente i nomi, le date, gli identificatori e le quantità che citerai o tradurrai. Il nostro deliberatamente errato 13 notebooks l'esempio mostra perché un output leggibile non è sufficiente.

Se il testo nascosto è ampiamente errato, distingui la rigenerazione dalla forzatura

Per i lettori che utilizzano strumenti a riga di comando, OCRmyPDF documenta diversi percorsi per le pagine che contengono già testo:

  • --redo-ocr rimuove il testo OCR non stampabile esistente e lo riconosce nuovamente escludendo il testo stampabile dall'OCR.
  • --skip-text salta le pagine che contengono testo. Questa non è una riparazione per un livello di testo errato esistente.
  • --force-ocr rasterizza il contenuto della pagina ed esegue l'OCR sulle immagini risultanti.

Questi comportamenti sono descritti nella documentazione sugli errori di testo esistente di OCRmyPDF. Nella versione 17, le opzioni equivalenti sono disponibili anche tramite --mode; i flag più vecchi rimangono alias.

Ci sono costi ed eccezioni. La rigenerazione non è in grado di identificare ogni disposizione OCR storica; alcuni file posizionano un'immagine opaca sopra il testo che è tecnicamente stampabile. La forzatura trasforma il testo stampabile e il contenuto vettoriale in pixel e appiattisce il contenuto interattivo. Rigenerazione e forzatura scartano anche un albero di struttura esistente anziché ricostruirlo. Consulta la documentazione avanzata di OCRmyPDF prima di sceglierne una.

Un estratto riparato non costituisce pertanto un controllo di accessibilità. Se il documento richiede intestazioni, ordine di lettura o figure accessibili, utilizza il separato controlli di accessibilità PDF tradotti.

Se le pagine o le lingue differiscono, non dare per scontato che un'impostazione vada bene

Elenca quali pagine contengono già testo digitale affidabile e quali necessitano di riconoscimento. Controlla le lingue sulle pagine interessate prima di configurare l'OCR. La nostra guida all'OCR di PDF in lingua mista tratta la selezione della lingua; è una decisione diversa rispetto a determinare se un vecchio livello di testo sia errato.

Se non è presente alcun livello di testo, passa al flusso di lavoro per PDF scansionati. Continuare a provare un altro estrattore di testo semplice non farà sì che pypdf riconosca le parole in un'immagine.

Verifica il testo sostitutivo prima di utilizzarlo

Usa il scheda di controllo del livello di testo scaricabile per tenere affiancati il riferimento visibile, l'estrazione precedente e l'estrazione sostitutiva. Inizia con il guasto noto, quindi testa un passaggio diverso e qualsiasi layout di pagina marcatamente differente.

  1. Parole: confronta nomi e termini non familiari lettera per lettera.
  2. Numeri: controlla quantità, punti decimali, date e identificatori come B-204.
  3. Ordine: leggi un paragrafo completo oltre le interruzioni di riga; controlla colonne e didascalie vicine separatamente.
  4. Copertura: conferma che le pagine e i passaggi di cui hai bisogno non siano stati omessi.
  5. Comportamento del file: riapri la sostituzione salvata e ripeti il test di copia. Se dipendi da segnalibri, collegamenti o struttura accessibile, controlla anche quelli.

Il superamento di passaggi selezionati fornisce prove su quei passaggi. Non certifica l'intero file. Conserva l'immagine della pagina originale come riferimento, soprattutto quando correggi una citazione o una lingua non familiare.

Traduci solo dopo aver potuto fidarti della fonte

Se il tuo obiettivo era citare un paragrafo o prendere appunti, un estratto verificato potrebbe essere il punto di arrivo. Non hai bisogno di un servizio di traduzione per risolvere questo compito.

Se hai bisogno di leggere l'intero documento in un'altra lingua, usa il file verificato come punto di partenza per la traduzione di PDF. La modalità OCR di BookTranslator ricostruisce un PDF tradotto a partire dal contenuto riconosciuto; non è una promessa di riparare alcun livello di testo esistente o di riprodurre esattamente il layout di pagina originale.

Conserva le pagine di riferimento durante la fase di traduzione. Le stesse quantità e gli stessi identificatori controllati qui appartengono alla fase di QA finale della traduzione del PDF. Una traduzione fluente non può dirti di per sé che la sua fonte avrebbe dovuto dire 18 anziché 13.

Post Correlati