BookTranslator
BookTranslator

Copiar e colar de um PDF dá o texto errado? Diagnostique primeiro a camada de texto

Um PDF pode parecer correto, mas copiar as palavras ou números errados. Utilize quatro ficheiros de exemplo para identificar problemas na camada de texto e escolher uma reparação que possa verificar.

BookTranslator

BookTranslator Team

10 min read

Se um PDF parecer correto mas colar o texto errado, pare de utilizar a versão colada como fonte. Primeiro, compare uma passagem curta com a página visível: um nome, uma frase e um número. O passo seguinte depende de o ficheiro não ter texto extraível, ter mapeamentos de caracteres incorretos, uma camada de OCR oculta imprecisa ou um problema na ordem de leitura. Executar o OCR em todo o documento não é o primeiro passo correto para os quatro casos.

O erro mais perigoso não é o texto incompreensível. É o texto plausível: uma página que diz 18 cadernos enquanto o texto extraído diz 13 cadernos. Criámos quatro PDFs para descarregar para tornar essa distinção observável, sem utilizar documentos privados de ninguém.

Comece com uma pequena verificação de copiar e comparar

Mantenha o ficheiro original inalterado e abra uma cópia de trabalho. Cole uma seleção curta num editor de texto simples e, em seguida, compare-a carácter a carácter com a página. Repita numa página diferente e, se disponível, num segundo leitor de PDF. Esta é uma verificação de diagnóstico, não uma prova de que o resto do documento está correto.

O que aconteceO que investigarPrimeira ação útil
Nada é selecionado ou a colagem está vaziaA página pode conter apenas uma imagemVerifique se o leitor está a selecionar a imagem da página em vez do texto
As letras mudam de forma consistente, embora pareçam normais na páginaCodificação de caracteres ou mapeamento de extraçãoCompare o resultado de outro leitor; procure um ficheiro de origem original ou uma exportação melhor
A maioria das palavras é legível, mas os nomes ou números estão erradosUma camada de texto imprecisa, incluindo OCR antigoCompare a passagem extraída com a digitalização visível
As letras estão corretas, mas as colunas, legendas ou notas de rodapé aparecem na ordem erradaExtração de layout e ordem de leituraTeste uma única coluna ou parágrafo separadamente
A cópia está desativadaPermissões do documento ou comportamento do leitorVerifique as permissões do ficheiro e peça à fonte uma cópia utilizável

Estas são pistas, não uma forma de identificar o funcionamento interno de cada PDF a partir de um único sintoma. As orientações de reutilização de conteúdo da Adobe distinguem o conteúdo apenas de imagem das restrições de cópia. Nenhum deles deve ser tratado automaticamente como uma camada de texto danificada. O guia de extração pypdf descreve separadamente imagens, extração de texto e dificuldades com tabelas e espaçamento.

Para um livro ou relatório longo, registe o número da página do PDF onde ocorre cada problema. Uma página de título limpa não lhe diz se um apêndice, um anexo digitalizado ou um capítulo de duas colunas será copiado corretamente.

Quatro PDFs: o que a página mostra versus o que a extração devolve

A nossa página de teste contém quatro linhas originais, incluindo:

O arquivo contém 18 cadernos.

O item B-204 chegou a 6 de maio.

Criámos um PDF digital normal e construímos deliberadamente três alternativas. Em seguida, extraímos o seu texto com o Poppler e o pypdf. Ambos os extratores devolveram o mesmo texto para cada ficheiro neste teste.

Descarregar o PDFComo o construímosResultado real extraído
Texto digital corretoTexto visível normal com um tipo de letra incorporado18 notebooks; B-204; 6 May
Mapeamento Unicode erradoAlterado o mapeamento de extração, sem alterar os glifos visíveis13 notebooks; vários a caracteres minúsculos tornaram-se x
Texto oculto incorretoColocou texto invisível deliberadamente incorreto sobre uma imagem de página13 notebooks; B-2O4; 8 May
Página apenas com imagemUtilizou a mesma imagem de página sem camada de textoSaída de texto vazia

Uma página digital competente e normal pode ser copiada incorretamente

Os dois primeiros PDFs foram renderizados com pixels idênticos na nossa comparação, mas o texto extraído diferiu. No segundo ficheiro, alterámos deliberadamente um ToUnicode mapeamento: informação utilizada para mapear códigos de caracteres armazenados para texto Unicode. O numeral visível permaneceu 8, enquanto a extração devolveu 3. A documentação do pypdf sobre CMap ilustra este mecanismo de mapeamento.

Isto demonstra um mecanismo de falha, não uma afirmação de que todos os PDFs corrompidos têm o mesmo defeito. Uma entrada ToUnicode em falta por si só não é o nosso diagnóstico, e editar mapeamentos manualmente não é uma reparação geral acessível ao leitor.

Uma digitalização pesquisável pode conter as palavras erradas

O terceiro e o quarto PDFs também foram renderizados de forma idêntica um ao outro. Um continha texto invisível incorreto; o outro não continha nenhum. No terceiro ficheiro, a extração alterou silenciosamente tanto uma quantidade como uma data. O código B-2O4 continha a letra O, e não o numeral 0 mostrado na imagem.

Nós próprios inserimos esses erros para representar o tipo de discrepância que uma camada de texto oculta pode conter. Um motor de OCR não os gerou. O quarto ficheiro mostra a condição oposta: uma imagem de página legível sem nada para estes extratores de texto devolverem. Isto é consistente com a limitação documentada do pypdf: extrai texto de PDF existente; não reconhece palavras dentro de imagens.

O que este teste estabelece — e o que não estabelece

Em 10 de setembro de 2026, verificámos quatro ficheiros de uma página utilizando o Poppler 26.08.0 e o pypdf 6.10.0. As comparações visuais utilizaram o Poppler a 144 dpi. A igualdade de píxeis manteve-se dentro dos dois pares, não em todos os quatro ficheiros: o par baseado em imagens passou por uma etapa de renderização adicional.

Esta é uma demonstração controlada, não um benchmark de precisão de OCR. Não testa o reconhecimento multilingue, layouts complexos, reparação do Acrobat, reparação do OCRmyPDF ou carregamentos no BookTranslator. Estes foram exemplos construídos com falhas conhecidas, não uma avaliação cega.

O texto simples e os resultados de píxeis, instruções de reprodução, e o gerador estão disponíveis com os ficheiros. Utilizam uma fonte Noto Sans não modificada com a sua licença de fonte aberta incluída.

Escolha o próximo passo menos disruptivo

As seguintes rotas de reparação provêm de documentação oficial e diagnóstico prático. Estas não são resultados de reparação da nossa experiência com quatro ficheiros. Trabalhe numa cópia e verifique o resultado antes de substituir qualquer coisa de que dependa.

Se tiver o documento de origem, tente primeiro uma nova exportação

Um novo PDF a partir do ficheiro original de processamento de texto, publicação ou composição é um primeiro candidato útil. Compare exatamente a passagem que falhou. Não assuma que um novo nome de ficheiro ou uma exportação bem-sucedida signifique que o seu texto está agora correto.

Para material obtido de um arquivo ou editora, verifique se existe uma versão alternativa com texto. Mantenha as referências de edição e página alinhadas: um ficheiro mais limpo de uma edição diferente pode não preservar a passagem de que necessita.

Se uma digitalização tiver alguns erros de reconhecimento, reveja essas palavras

O Acrobat documenta um fluxo de trabalho em Digitalizar e OCR → Corrigir texto reconhecido. Permite-lhe rever palavras suspeitas assinaladas em relação à imagem digitalizada e corrigir o texto reconhecido. Siga as instruções de correção atuais da Adobe para a interface na sua versão.

Não utilize uma lista de suspeitos vazia como teste de integridade. Compare de forma independente os nomes, datas, identificadores e quantidades que irá citar ou traduzir. O nosso deliberadamente errado 13 notebooks o exemplo mostra porque uma saída legível não é suficiente.

Se o texto oculto estiver amplamente errado, distinga entre refazer e forçar

Para leitores que utilizam ferramentas de linha de comandos, o OCRmyPDF documenta diferentes caminhos para páginas que já contêm texto:

  • --redo-ocr remove o texto OCR não imprimível existente e reconhece novamente, enquanto exclui o texto imprimível do OCR.
  • --skip-text ignora páginas que contêm texto. Isto não é uma reparação para uma camada de texto incorreta existente.
  • --force-ocr rasteriza o conteúdo da página e executa o OCR nas imagens resultantes.

Estes comportamentos são descritos em documentação de erros de texto existente do OCRmyPDF. Na versão 17, as escolhas equivalentes também estão disponíveis através de --mode; as flags mais antigas continuam a ser aliases.

Existem custos e exceções. O modo de repetição (redo) não consegue identificar todas as disposições OCR históricas; alguns ficheiros colocam uma imagem opaca sobre texto que é tecnicamente imprimível. O modo de força (force) transforma texto imprimível e conteúdo vetorial em pixéis e achata o conteúdo interativo. O redo e o force também descartam uma árvore de estrutura existente em vez de a reconstruir. Reveja documentação avançada do OCRmyPDF antes de escolher qualquer uma das opções.

Um extrato reparado não constitui, portanto, uma validação de acessibilidade. Se o documento precisar de títulos, ordem de leitura ou figuras acessíveis, utilize a opção separada de verificações de acessibilidade de PDF traduzidas.

Se as páginas ou os idiomas diferirem, não assuma que uma única definição serve

Liste quais as páginas que já contêm texto digital fiável e quais as que precisam de reconhecimento. Verifique os idiomas nas páginas afetadas antes de configurar o OCR. O nosso guia de OCR de PDF de vários idiomas abrange a seleção de idiomas; é uma decisão diferente de determinar se uma camada de texto antiga está errada.

Se não existir de todo nenhuma camada de texto, avance para o fluxo de trabalho para PDFs digitalizados. Tentar repetidamente outro extrator de texto simples não fará com que o pypdf reconheça palavras numa imagem.

Verifique o texto de substituição antes de o utilizar

Utilize o folha de verificação da camada de texto descarregável para manter a referência visível, a extração anterior e a extração de substituição lado a lado. Comece com a falha conhecida e, em seguida, teste uma passagem diferente e qualquer esquema de página distintamente diferente.

  1. Palavras: compare nomes e termos desconhecidos letra a letra.
  2. Números: verifique quantidades, pontos decimais, datas e identificadores como B-204.
  3. Ordem: leia um parágrafo completo através das quebras de linha; verifique as colunas e as legendas próximas separadamente.
  4. Cobertura: confirme que as páginas e passagens de que necessita não foram omitidas.
  5. Comportamento do ficheiro: reabra a substituição guardada e repita o teste de cópia. Se depender de marcadores, ligações ou estrutura acessível, verifique-os também.

A aprovação de passagens selecionadas fornece evidências sobre essas passagens. Não certifica o ficheiro completo. Preserve a imagem da página original como referência, especialmente ao corrigir uma citação ou uma língua desconhecida.

Traduza apenas depois de poder confiar na fonte

Se o seu objetivo era citar um parágrafo ou tirar notas, um extrato verificado pode ser o ponto final. Não precisa de um serviço de tradução para corrigir essa tarefa.

Se precisar de ler o documento completo noutro idioma, utilize o ficheiro verificado como ponto de partida para a tradução de PDF. O Modo OCR do BookTranslator reconstrói um PDF traduzido a partir do conteúdo reconhecido; não é uma promessa de reparar qualquer camada de texto existente ou reproduzir exatamente o esquema da página original.

Mantenha as páginas de referência durante a etapa de tradução. As mesmas quantidades e identificadores verificados aqui pertencem à etapa final de controlo de qualidade da tradução do PDF. Uma tradução fluente não pode, por si só, dizer-lhe que a sua fonte deveria ter dito 18 em vez de 13.

Publicações relacionadas