BookTranslator
BookTranslator

Traducir un PDF escaneado: Problemas de OCR y soluciones prácticas

Aprende a aplicar OCR y traducir PDF escaneados, diagnosticar fallos comunes de reconocimiento y preservar el diseño con un flujo de trabajo optimizado para documentos.

BookTranslator

BookTranslator Team

11 min read

Respuesta rápida: Un PDF escaneado necesita OCR antes de la traducción

Para traducir un PDF escaneado, primero ejecuta el OCR para convertir las imágenes de las páginas en texto seleccionable. Luego, traduce el PDF procesado con OCR utilizando un traductor de documentos como PDF Translator. Si te saltas el OCR, muchas herramientas de traducción devolverán el archivo original sin cambios, omitirán páginas o traducirán únicamente las partes que ya contengan una capa de texto.

Sigue este flujo de trabajo:

  1. Abre el PDF e intenta seleccionar una frase.
  2. Si no puedes seleccionar texto, ejecuta el OCR.
  3. Revisa el texto del OCR antes de traducir.
  4. Sube el PDF procesado con OCR a PDF Translator.
  5. Revisa el resultado traducido frente al escaneo original.

Si tu PDF ya tiene texto seleccionable y el problema es la preservación del diseño, utiliza la guía para traducir un PDF sin perder el formato.

Por qué los PDF escaneados fallan en las herramientas de traducción

A menudo, un PDF escaneado es simplemente un conjunto de imágenes de páginas dentro de un contenedor PDF. La página puede mostrar palabras a un ser humano, pero el archivo puede no contener texto real para que el software lo extraiga.

Esto genera un fallo sencillo:

Tipo de archivoLo que ve el traductorQué sucede
PDF basado en textoTexto más datos de diseñoLa traducción puede comenzar de inmediato.
PDF escaneado solo con imágenesImágenes de páginasSe requiere OCR primero.
PDF con texto sobre imagenImagen escaneada más capa de texto OCR ocultaLa traducción puede funcionar, pero los errores de OCR afectan la calidad.

The most useful test is not technical:

  1. Abre el PDF.
  2. Intenta resaltar palabras individuales.
  3. Copia una frase.
  4. Pégala en un editor de texto.

Si la frase se pega correctamente, el PDF tiene una capa de texto. Si no se pega nada, o toda la página se comporta como una sola imagen, el PDF necesita OCR.

El OCR no es opcional

OCR significa reconocimiento óptico de caracteres. Lee el texto de una imagen y crea texto legible por máquina. Para la traducción de PDF, el OCR suele crear una capa de texto invisible sobre la página escaneada.

Esa capa de texto se convierte en la fuente para la traducción. Si el OCR comete errores, la traducción heredará dichos errores.

Errores comunes de OCR:

Error de OCRRiesgo de traducción
rn leído como mEl significado de las palabras cambia.
1 leído como lLos números, referencias o códigos se vuelven incorrectos.
O leído como 0Los identificadores, fórmulas y nombres pueden fallar.
Acentos omitidosLos nombres y términos se vuelven inexactos.
Columnas fusionadasLas frases se traducen en el orden incorrecto.
Celdas de tabla leídas fila por fila incorrectamenteLas etiquetas de datos ya no coinciden con los valores.
Notas al pie tratadas como texto principalLas citas y notas se mueven al contexto incorrecto.

Por esta razón es importante el paso de revisión del OCR. No traduzcas un documento escaneado hasta que hayas verificado de forma puntual el texto extraído.

El flujo de trabajo basado en OCR

Paso 1: Identificar el tipo de PDF

Intenta seleccionar texto. Si la selección funciona, es posible que no necesites OCR. Si la selección falla, trata el archivo como si fuera solo de imagen.

Inspecciona también la página visualmente:

  • Las páginas inclinadas sugieren un escaneo.
  • La textura de papel gris sugiere un escaneo.
  • Las sombras cerca del lomo sugieren un libro fotografiado.
  • El contraste irregular sugiere una fotocopia.
  • Si la búsqueda no encuentra palabras visibles, significa que no hay capa de texto.

Paso 2: Mejorar el escaneo si es posible

La calidad del OCR comienza con la calidad de la imagen. Si puedes volver a escanear, hazlo antes de perder tiempo reparando errores de OCR.

Utiliza esta lista de verificación de calidad de imagen:

  • Escanea a una resolución suficientemente alta para texto pequeño.
  • Mantén las páginas planas y rectas.
  • Evita sombras cerca del lomo.
  • Recorta los bordes de las mesas, dedos o elementos de fondo no deseados.
  • Utiliza un fuerte contraste entre el texto y la página.
  • Mantén toda la línea visible.
  • Utiliza la orientación de página correcta.
  • No compresiones la imagen tanto como para que las letras se difuminen.

Para libros antiguos y fotocopias, las mayores mejoras suelen provenir de enderezar las páginas, corregir el contraste y volver a escanear las que estén desenfocadas.

Paso 3: Ejecutar el OCR

Elige una herramienta de OCR según el documento, no la marca.

Opción de OCRIdeal paraA tener en cuenta
Adobe Acrobat OCREscaneos empresariales generales y limpieza de PDFComprueba el acceso a tu plan actual antes de depender de él.
ABBYY FineReaderEscaneos complejos, tablas, columnas y diseños difícilesAún requiere revisión manual.
Tesseract u OCRmyPDFFlujos de trabajo de OCR locales, técnicos y repetiblesRequiere familiaridad con herramientas de línea de comandos.
Herramientas de OCR en líneaArchivos ocasionales de bajo riesgoLa privacidad, los límites de archivos y la calidad varían.
Aplicaciones de escaneo móvilCapturar un nuevo escaneo rápidamenteLa distorsión de perspectiva puede afectar al OCR.

Para contratos privados, historias clínicas, documentos financieros, manuscritos inéditos o trabajos académicos en revisión, prefiere un flujo de trabajo de OCR local o un entorno de confianza. No subas escaneos confidenciales a sitios de OCR gratuitos aleatorios.

Paso 4: Revisar el texto del OCR

Revisa antes de traducir, no después. Copia texto de varias páginas difíciles y comprueba si es legible.

Páginas de muestra para inspeccionar:

  • La página de título.
  • Una página de texto denso.
  • Una página con tablas.
  • Una página con notas al pie.
  • Una página con texto pequeño.
  • Una página con sellos, escritura a mano o notas al margen.
  • Una página en cada idioma si el documento es multilingüe.

Busca:

  • Párrafos faltantes.
  • Columnas fusionadas.
  • Palabras rotas.
  • Caracteres erróneos.
  • Diacríticos perdidos.
  • Etiquetas de tablas separadas de sus valores.
  • Encabezados insertados en el texto principal.
  • Números de página mezclados en las oraciones.

Si la calidad del OCR es deficiente, arréglarla antes de traducir. Un traductor no puede recuperar de forma fiable un significado que el OCR nunca capturó.

Paso 5: Traducir el PDF procesado con OCR

Una vez que el PDF tenga una capa de texto limpia, súbelo a PDF Translator. El paso de traducción ahora puede trabajar con texto en lugar de con imágenes de páginas.

Después de la traducción, compara:

  • Escaneo original
  • Capa de texto OCR
  • PDF traducido

Esta revisión de tres vías te ayuda a identificar si un error provino del OCR o de la traducción. Si el texto del OCR es incorrecto, vuelve a ejecutar el OCR. Si el texto del OCR es correcto pero la traducción es errónea, corrige la traducción.

Paso 6: Revisar contenido de alto riesgo

A menudo, los documentos escaneados contienen exactamente el contenido que requiere una revisión cuidadosa: contratos antiguos, formularios gubernamentales, artículos académicos, manuales, documentos históricos y páginas de libros.

Revisa estos elementos manualmente:

  • Nombres
  • Fechas
  • Números
  • Direcciones
  • Códigos de producto
  • Referencias legales
  • Citas
  • Etiquetas de tablas
  • Unidades
  • Ecuaciones
  • Leyendas
  • Notas al pie

Para archivos de investigación y académicos, lee también la guía sobre cómo traducir trabajos de investigación académica, ya que los PDF académicos escaneados añaden riesgos de citas y diseño además del riesgo de OCR.

Ejemplos de fallos lado a lado

Utiliza esta tabla mientras revisas la salida del OCR.

El escaneo original probablemente muestraSalida de OCR defectuosaPor qué importa
modernmodemEl significado cambia por completo.
Section 10Section IOLas referencias legales o técnicas pueden fallar.
20262O26Las fechas y los identificadores dejan de ser fiables.
patientpatlentLos términos médicos o técnicos se vuelven incorrectos.
Dos columnas separadasUn solo párrafo fusionadoLa traducción lee las oraciones en el orden incorrecto.
Fila de tabla con etiquetas y valoresUna sola línea de texto mixtoLos datos ya no se corresponden con la etiqueta correcta.
Marcador de nota al pie 1Letra lLas notas pueden asociarse a la oración incorrecta.

Si ves estos errores en la capa de OCR, corrige el OCR antes de traducir.

¿Qué herramienta deberías utilizar?

Elige según la dificultad del documento.

DocumentoRuta recomendada
Escaneo empresarial limpioOCR en Acrobat u otra herramienta fiable, luego PDF Translator.
Escaneo de libro antiguoEnderezar y mejorar el contraste, aplicar OCR con cuidado y luego traducir.
Escaneo de artículo académicoOCR, revisar ecuaciones/citas/tablas, y luego traducir con revisión de diseño.
Notas manuscritasEs posible que se requiera transcripción manual antes de traducir.
Documento personal simpleEl OCR en línea puede ser aceptable si el riesgo de privacidad es bajo.
Documento confidencialUtiliza OCR local o un flujo de trabajo controlado y de confianza.

Si deseas una comparación más amplia de herramientas, consulta la guía de los mejores traductores de PDF.

Problemas comunes en PDF escaneados

Páginas de baja resolución

Los escaneos de baja resolución difuminan las letras. El OCR puede confundir rn con m, cl con d, o la puntuación con polvo.

Solución: vuelve a escanear si es posible. Si no, aumenta el contraste y prueba el OCR de nuevo.

Páginas inclinadas o curvadas

Los escaneos de libros a menudo se curvan cerca del lomo. El OCR lee las líneas curvas deficientemente y puede reordenar el texto.

Solución: aplana la página, vuelve a escanear o utiliza una herramienta de OCR con funciones de enderezamiento y corrección de curvatura.

Diseño de múltiples columnas

El OCR puede fusionar las columnas izquierda y derecha en un solo flujo de oraciones.

Solución: inspecciona el orden de lectura antes de traducir. Los artículos académicos necesitan atención especial aquí.

Tablas

Las tablas son difíciles porque el OCR tiene que detectar tanto el texto como la estructura. Una tabla puede verse correcta visualmente mientras que la capa de texto es errónea.

Solución: copia el texto OCR de la tabla y confirma que las etiquetas sigan coincidiendo con los valores.

Escritura a mano y firmas

El OCR de texto impreso es mucho más fiable que el reconocimiento de escritura a mano. Las notas manuscritas al margen, las firmas y los formularios rellenados pueden omitirse o distorsionarse.

Solución: transcribe manualmente la escritura a mano esencial antes de la traducción.

Idiomas mixtos

El OCR funciona mejor cuando conoce el idioma de origen. Un escaneo con inglés, francés y chino puede fallar si el OCR está configurado para un solo idioma.

Idiomas mixtos

El OCR funciona mejor cuando conoce el idioma de origen. Un escaneo en inglés, francés y chino puede fallar si el OCR está configurado para un solo idioma.

Solución: selecciona todos los idiomas relevantes de OCR si la herramienta lo admite y luego verifica puntualmente cada sección de idioma.

Lista de verificación de privacidad y seguridad

Antes de subir un PDF escaneado a cualquier lugar, pregúntate:

  • ¿El documento contiene datos personales?
  • ¿Incluye material médico, legal, financiero, académico o inédito?
  • ¿Está cubierto por un acuerdo de cliente o una política escolar?
  • ¿Se permite el uso de un servicio de OCR en línea para este documento?
  • ¿Necesitas un flujo de trabajo local en su lugar?
  • ¿Puedes eliminar las páginas que no necesitan traducción?

Los PDF escaneados suelen ser confidenciales porque provienen de contratos, identificaciones, formularios, borradores de investigación y archivos internos. Trata las decisiones de subida de OCR de la misma manera que tratarías el documento original.

Publicaciones relacionadas