BookTranslator
BookTranslator

Tradurre un PDF scansionato: Problemi OCR e soluzioni pratiche

Scopri come eseguire l'OCR e tradurre PDF scansionati, diagnosticare i problemi di riconoscimento più comuni e preservare il layout con un flusso di lavoro orientato ai documenti.

BookTranslator

BookTranslator Team

10 min read

Risposta rapida: Un PDF scansionato richiede l'OCR prima della traduzione

Per tradurre un PDF scansionato, esegui prima l'OCR per trasformare le immagini delle pagine in testo selezionabile. Quindi traduci il PDF elaborato con l'OCR utilizzando un traduttore di documenti come PDF Translator. Se salti l'OCR, molti strumenti di traduzione restituiranno il file originale inalterato, salteranno le pagine o tradurranno solo le parti che contengono già un livello di testo.

Segui questo flusso di lavoro:

  1. Apri il PDF e prova a selezionare una frase.
  2. Se non riesci a selezionare il testo, esegui l'OCR.
  3. Rivedi il testo OCR prima di tradurlo.
  4. Carica il PDF elaborato con l'OCR su PDF Translator.
  5. Controlla il risultato tradotto confrontandolo con la scansione originale.

Se il tuo PDF ha già del testo selezionabile e il problema è la conservazione del layout, usa la guida su come tradurre un PDF senza perdere la formattazione.

Perché i PDF scansionati falliscono negli strumenti di traduzione

Un PDF scansionato è spesso solo un insieme di immagini di pagine all'interno di un contenitore PDF. La pagina può mostrare parole a un essere umano, ma il file potrebbe non contenere testo effettivo che il software possa estrarre.

Ciò crea un semplice errore:

Tipo di fileCosa vede il traduttoreCosa succede
PDF basato su testoTesto più dati di layoutLa traduzione può iniziare immediatamente.
PDF scansionato solo immaginiImmagini delle pagineÈ prima necessario l'OCR.
PDF con testo sopra l'immagineImmagine della scansione più livello di testo OCR nascostoLa traduzione può funzionare, ma gli errori OCR influiscono sulla qualità.

Il test più utile non è tecnico:

  1. Apri il PDF.
  2. Prova a evidenziare singole parole.
  3. Copia una frase.
  4. Incollala in un editor di testo.

Se la frase viene incollata correttamente, il PDF ha un livello di testo. Se non viene incollato nulla, o l'intera pagina si comporta come un'unica immagine, il PDF necessita dell'OCR.

L'OCR non è opzionale

OCR sta per riconoscimento ottico dei caratteri (Optical Character Recognition). Legge il testo da un'immagine e crea testo leggibile da una macchina. Per la traduzione di PDF, l'OCR di solito crea un livello di testo invisibile sopra la pagina scansionata.

Quel livello di testo diventa la fonte per la traduzione. Se l'OCR commette errori, la traduzione eredita tali errori.

Errori OCR comuni:

Errore OCRRischio di traduzione
rn letto come mLe parole cambiano significato.
1 letto come lNumeri, riferimenti o codici diventano errati.
O letto come 0ID, formule e nomi possono rompersi.
Accenti omessiNomi e termini diventano imprecisi.
Colonne uniteLe frasi vengono tradotte nell'ordine sbagliato.
Celle di tabella lette riga per riga in modo erratoLe etichette dei dati non corrispondono più ai valori.
Note a piè di pagina trattate come testo del corpoCitazioni e note finiscono nel contesto sbagliato.

Ecco perché la fase di revisione dell'OCR è importante. Non tradurre un documento scansionato finché non hai controllato a campione il testo estratto.

Il flusso di lavoro incentrato sull'OCR

Fase 1: Identificare il tipo di PDF

Prova a selezionare il testo. Se la selezione funziona, potresti non aver bisogno dell'OCR. Se la selezione fallisce, tratta il file come "solo immagini".

Ispeziona anche la pagina visivamente:

  • Le pagine storte suggeriscono una scansione.
  • La consistenza della carta grigia suggerisce una scansione.
  • Le ombre vicino alla rilegatura suggeriscono un libro fotografato.
  • Il contrasto irregolare suggerisce una fotocopia.
  • La ricerca che non trova parole visibili suggerisce che non esiste un livello di testo.

Fase 2: Migliorare la scansione se possibile

La qualità dell'OCR inizia con la qualità dell'immagine. Se puoi risansionare, fallo prima di perdere tempo a riparare gli errori OCR.

Usa questa checklist per la qualità dell'immagine:

  • Scansiona a una risoluzione sufficientemente alta per il testo piccolo.
  • Mantieni le pagine piatte e dritte.
  • Evita le ombre vicino alla rilegatura.
  • Ritaglia i bordi del tavolo, le dita o gli elementi di disturbo sullo sfondo.
  • Usa un forte contrasto tra il testo e la pagina.
  • Mantieni l'intera riga visibile.
  • Usa il corretto orientamento della pagina.
  • Non comprimere l'immagine così pesantemente da sfocare le lettere.

Per libri vecchi e fotocopie, i risultati migliori derivano solitamente dalla raddrizzatura (deskew), dalla correzione del contrasto e dalla risansione delle pagine fuori fuoco.

Fase 3: Eseguire l'OCR

Scegli uno strumento OCR in base al documento, non al marchio.

Opzione OCRIdeale perA cui fare attenzione
Adobe Acrobat OCRScansioni aziendali generali e pulizia di PDFControlla l'accesso al piano attuale prima di affidartici.
ABBYY FineReaderScansioni complesse, tabelle, colonne e layout difficiliRichiede comunque una revisione manuale.
Tesseract o OCRmyPDFFlussi di lavoro OCR locali, tecnici e ripetibiliRichiede dimestichezza con gli strumenti da riga di comando.
Strumenti OCR onlineFile occasionali a basso rischioPrivacy, limiti dei file e qualità variano.
App di scansione per smartphoneAcquisire rapidamente una nuova scansioneLa distorsione prospettica può danneggiare l'OCR.

Per contratti privati, cartelle cliniche, documenti finanziari, manoscritti inediti o lavori accademici in fase di revisione, preferisci un flusso di lavoro OCR locale o un ambiente sicuro. Non caricare scansioni sensibili su siti OCR gratuiti casuali.

Fase 4: Rivedere il testo OCR

Fai la revisione prima della traduzione, non dopo. Copia il testo da diverse pagine difficili e verifica se è leggibile.

Pagine campione da ispezionare:

  • La pagina del titolo.
  • Una pagina del corpo densa.
  • Una pagina con tabelle.
  • Una pagina con note a piè di pagina.
  • Una pagina con testo piccolo.
  • Una pagina con timbri, grafia o note a margine.
  • Una pagina in ciascuna lingua se il documento è multilingue.

Cerca:

  • Paragrafi mancanti.
  • Colonne unite.
  • Parole spezzate.
  • Caratteri errati.
  • Diacritici persi.
  • Etichette di tabella separate dai valori.
  • Intestazioni inserite nel testo del corpo.
  • Numeri di pagina mescolati nelle frasi.

Se la qualità dell'OCR è scarsa, correggila prima della traduzione. Un traduttore non può recuperare in modo affidabile un significato che l'OCR non ha mai catturato.

Fase 5: Tradurre il PDF elaborato con l'OCR

Una volta che il PDF ha un livello di testo pulito, caricalo su PDF Translator. La fase di traduzione può ora funzionare con il testo anziché con le immagini delle pagine.

Dopo la traduzione, confronta:

  • Scansione originale
  • Livello di testo OCR
  • PDF tradotto

Questa revisione a tre vie ti aiuta a identificare se un errore proviene dall'OCR o dalla traduzione. Se il testo OCR è errato, esegui nuovamente l'OCR. Se il testo OCR è corretto ma la traduzione è sbagliata, correggi la traduzione.

Fase 6: Rivedere i contenuti ad alto rischio

I documenti scansionati contengono spesso proprio quei contenuti che richiedono un'attenta revisione: vecchi contratti, moduli governativi, documenti accademici, manuali, documenti storici e pagine di libri.

Rivedi questi elementi manualmente:

  • Nomi
  • Date
  • Numeri
  • Indirizzi
  • Codici prodotto
  • Riferimenti legali
  • Citazioni
  • Etichette di tabella
  • Unità di misura
  • Equazioni
  • Didascalie
  • Note a piè di pagina

Per i file di ricerca e accademici, leggi anche la guida su come tradurre documenti di ricerca accademica, poiché i PDF accademici scansionati aggiungono rischi di citazione e layout oltre al rischio OCR.

Esempi di errore affiancati

Usa questa tabella mentre rivedi l'output dell'OCR.

La scansione originale probabilmente mostraOutput OCR erratoPerché è importante
modernmodemIl significato cambia completamente.
Section 10Section IOI riferimenti legali o tecnici possono rompersi.
20262O26Date e ID diventano inaffidabili.
patientpatlentI termini medici o tecnici diventano errati.
Due colonne separateUn paragrafo unitoLa traduzione legge le frasi nell'ordine sbagliato.
Riga di tabella con etichette e valoriUna singola riga di testo mistoI dati non corrispondono più all'etichetta corretta.
Marcatore di nota a piè di pagina 1Lettera lLe note potrebbero collegarsi alla frase sbagliata.

Se vedi questi errori nel livello OCR, correggici prima di tradurre.

Quale strumento dovresti usare?

Scegli in base alla difficoltà del documento.

DocumentoPercorso consigliato
Scansione aziendale pulitaOCR in Acrobat o un altro strumento OCR affidabile, quindi PDF Translator.
Scansione di vecchi libriRaddrizza e migliora il contratto, esegui l'OCR con attenzione, quindi traduci.
Scansione di documenti accademiciEsegui l'OCR, rivedi equazioni/citazioni/tabelle, quindi traduci con la revisione del layout.
Note scritte a manoLa trascrizione manuale potrebbe essere necessaria prima della traduzione.
Semplice documento personaleL'OCR online può essere accettabile se il rischio per la privacy è basso.
Documento sensibileUsa l'OCR locale o un flusso di lavoro controllato e sicuro.

Se desideri un confronto più ampio tra gli strumenti, consulta la guida al miglior traduttore di PDF.

Problemi comuni dei PDF scansionati

Pagine a bassa risoluzione

Le scansioni a bassa risoluzione sfocano le lettere facendole confondere. L'OCR potrebbe confondere rn e m, cl e d, o punteggiatura e polvere.

Soluzione: risansiona se possibile. In caso contrario, aumenta il contrasto e riprova l'OCR.

Pagine storte o curve

Le scansioni dei libri spesso si curvano vicino alla rilegatura. L'OCR legge male le linee curve e potrebbe riordinare il testo.

Soluzione: appiattisci la pagina, risansiona o usa uno strumento OCR con funzioni di raddrizzamento (deskew) e correzione della curvatura (dewarping).

Layout a più colonne

L'OCR può unire le colonne sinistra e destra in un unico flusso di frasi.

Soluzione: ispeziona l'ordine di lettura prima della traduzione. I documenti accademici richiedono particolare attenzione qui.

Tabelle

Le tabelle sono difficili perché l'OCR deve rilevare sia il testo che la struttura. Una tabella può sembrare corretta visivamente mentre il livello di testo è errato.

Soluzione: copia il testo OCR dalla tabella e conferma che le etichette corrispondano ancora ai valori.

Scrittura a mano e firme

L'OCR per il testo stampato è molto più affidabile del riconoscimento della scrittura manuale. Note a margine scritte a mano, firme e moduli compilati potrebbero essere saltati o storpiati.

Soluzione: trascrivi manualmente la grafia essenziale prima della traduzione.

Lingue miste

L'OCR funziona meglio quando conosce la lingua di origine. Una scansione con inglese, francese e cinese può fallire se l'OCR è impostato su una sola lingua.

Soluzione: scegli tutte le lingue OCR pertinenti se lo strumento lo supporta, quindi controlla a campione ogni sezione in lingua.

Checklist per la privacy e la sicurezza

Prima di caricare un PDF scansionato ovunque, chiediti:

  • Il documento contiene dati personali?
  • Include materiale medico, legale, finanziario, accademico o inedito?
  • È coperto da un accordo con un cliente o da una politica scolastica?
  • Un servizio OCR online è consentito per questo documento?
  • Hai invece bisogno di un flusso di lavoro locale?
  • Puoi rimuovere le pagine che non necessitano di traduzione?

I PDF scansionati sono spesso sensibili perché provengono da contratti, documenti d'identità, moduli, bozze di ricerca e archivi interni. Tratta le decisioni di caricamento OCR allo stesso modo in cui tratteresti il documento originale.

Post Correlati