BookTranslator
BookTranslator

Копирането и поставянето от PDF дава грешен текст? Диагностицирайте текстовия слой първо

Един PDF може да изглежда правилно, но да копира грешните думи или числа. Използвайте четири примерни файла, за да идентифицирате проблемите с текстовия слой и да изберете корекция, която можете да проверите.

Ако един PDF изглежда правилно, но поставя грешен текст, спрете да използвате поставената версия като източник. Първо сравнете краткия откъс с видимата страница: име, изречение и число. Следващата стъпка зависи от това дали файлът няма извличащ се текст, има неправилни символни съпоставяния, неточен скрит OCR слой или проблем с реда на четене. Пускането на OCR върху целия документ не е правилната първа стъпка и за четирите.

Най-опасната грешка не е безсмислицата. Това е правдоподобен текст: страница, която показва 18 тетрадки , докато извлеченият текст казва 13 тетрадки. Създадохме четири изтегляеми PDF файла, за да направим тази разлика видима, без да използваме чиито и да е лични документи.

Започнете с кратка проверка чрез копиране и сравнение

Запазете оригиналния файл непроменен и отворете работно копие. Поставете едно кратко селектиране в текстов редактор, след което го сравнете символ по символ със страницата. Повторете на друга страница и, ако е налично, в четене на втори PDF. Това е диагностична проверка, а не доказателство, че останалата част от документа е правилна.

Какво се случваКакво да разследватеПърво полезно действие
Нищо не се избира или поставянето е празноСтраницата може да съдържа само изображениеПроверете дали четецът избира изображението на страницата, а не текста
Буквите се променят последователно, въпреки че изглеждат нормално на страницатаКодиране на символи или съпоставяне при извличанеСравнете изхода на друг четец; потърсете оригинален източник или по-добър експорт
Повечето думи са четими, но имената или числата са грешниНеточен текстов слой, включително стар OCRСравнете извлечения откъс с видимия сканиран документ
Буквите са правилни, но колоните, надписите или бележките под линия се появяват в грешен редИзвличане на оформлението и реда на четенеТествайте една колона или параграф отделно
Копирането е забраненоПрава на документа или поведение на четецаПроверете правата на файла и поискайте от източника използемо копие

Това са насоки, а не начин за идентифициране на вътрешната структура на всеки PDF по един симптом. Напътствията на Adobe за повторно използване на съдържание разграничават съдържанието само с изображения от ограниченията за копиране. Нито едно от двете не трябва автоматично да се третира като повреден текстов слой. Ръководството за извличане на pypdf описва отделно изображенията, извличането на текст и затрудненията с таблиците и разстоянията.

За дълга книга или отчет записвайте номера на PDF страницата, на която се появява всеки проблем. Чистата заглавна страница не ви подсказва дали приложение, сканирано вложено листо или двуколонен глава ще се копира правилно.

Четири PDF файла: какво показва страницата спрямо това какво връща извличането

Нашата тестова страница съдържа четири оригинални реда, включително:

Архивът съдържа 18 тетрадки.

Артикул B-204 пристигна на 6 май.

Направихме един нормален цифров PDF и целенасочено конструирахме три алтернативи. След това извлякохме техния текст с Poppler и pypdf. И двата инструмента за извличане върнаха един и същ текст за всеки файл в този тест.

Изтеглете PDF файлаКак го конструирахмеДействителен извлечен резултат
Правилен цифров текстНормален видим текст с вграден шрифт18 notebooks; B-204; 6 May
Грешно юникодово мапиранеПроменено мапиране на извличането, без промяна на видимите глифи13 notebooks; няколко малки a знака станаха x
Грешен скрит текстПоставен е умишлено неверен невидим текст върху изображение на страница13 notebooks; B-2O4; 8 May
Страница само с изображениеИзползвано е същото изображение на страница без текстов слойПразен текстов изход

Една изглеждаща нормално цифрова страница може да се копира неправилно

Първите два PDF файла се ренднаха до идентични пиксели в нашата сравнителна проверка, но извлеченият от тях текст се различаваше. във втория файл умишлено променихме ToUnicode съпоставяне: информация, използвана за свързване на съхранени кодове на знаци с Уникод текст. Видимата цифра остана 8, докато извличането върна 3. Документацията на pypdf за CMap илюстрира този механизъм за съпоставяне.

Това показва един механизъм на повреда, а не твърдение, че всеки повреден PDF има същия дефект. Само едно липсващо ToUnicode запис не е нашата диагноза и ръчното редактиране на съпоставянията не е общо решение за поправка, насочено към читателя.

Един сканиран документ с възможност за търсене може да съдържа грешните думи

Третият и четвъртият PDF файл също се ренднаха идентично един спрямо друг. Единият съдържаше грешен невидим текст; другият не съдържаше такъв. В третия файл извличането тихо промени както количество, така и дата. Кодът B-2O4 съдържаше буквата O, а не цифрата 0 , показана в изображението.

Внесохме тези грешки сами, за да представим вида несъответствие, който един невидим текстов слой може да съдържа. Един OCR двигател не ги е генерирал. Четвъртият файл показва обратното състояние: четливо изображение на страница без нищо, което тези инструменти за извличане на текст да върнат. Това е съвместимо с документираното ограничение на pypdf: то извлича съществуващ PDF текст; то не разпознава думи вътре в изображения.

Какво установява този тест — и какво не

На 10 септември 2026 г. проверихме четири едностранични файла, използвайки Poppler 26.08.0 и pypdf 6.10.0. Визуалните сравнения използваха Poppler при 144 dpi. Равенството на пикселите се запази в рамките на двете двойки, а не във всичките четири файла: двойката, базирана на изображения, премина през допълнителна стъпка на рендиране.

Това е контролирана демонстрация, а не бенчмарк за точност на OCR. Тя не тества многоезично разпознаване, сложни оформления, поправка с Acrobat, поправка с OCRmyPDF или качвания в BookTranslator. Това бяха конструирани примери с известни дефекти, а не сляпа оценка.

Наличните необработен текст и пикселни резултати, инструкции за възпроизвежданеи генераторът са достъпни заедно с файловете. Те използват немодифициран шрифт Noto Sans с включения му лиценз за отворен шрифт.

Изберете най-малко инвазивната следваща стъпка

Следните пътища за поправка идват от официална документация и практическа диагностика. Те не са резултати от поправка от нашия експеримент с четири файла. Работете върху копие и проверете резултата, преди да замените нещо, на което разчитате.

Ако разполагате с изходния документ, първо опитайте нов експорт

Нов PDF от оригиналния файл за текстообработка, публикуване или предпечат е подходящ първи вариант. Сравнете точно пасажа, който е дал грешка. Не приемайте, че новото име на файла или успешният експорт означават, че текстът му вече е правилен.

За материали, получени от архив или издател, проверете дали съществува алтернативна версия с текст. Поддържайте съответствието между изданията и препратките към страниците: по-чист файл от различно издание може да не съдържа точно пасажа, който ви е необходим.

Ако сканираният документ има няколко грешки при разпознаването, прегледайте тези думи

Acrobat документира работен процес в Scan & OCR → Correct recognized text. Той ви позволява да прегледате маркираните подозрителни думи спрямо сканираното изображение и да коригирате разпознатия текст. Следвайте текущите инструкции за корекция на Adobe за интерфейса във вашата версия.

Не използвайте празен списък с подозрителни думи като тест за пълнота. Сравнете независимо имената, датите, идентификаторите и количествата, които ще цитирате или превеждате. Нашият умишлено грешен 13 notebooks примерът показва защо четимият изход не е достатъчен.

Ако скритият текст е изцяло сгрешен, направете разлика между повторна обработка и принудително изпълнение

За читатели, които използват инструменти с команден ред, OCRmyPDF документира различни пътища за страници, които вече съдържат текст:

  • --redo-ocr премахва съществуващия непечатен OCR текст и го разпознава отново, като изключва печатаемия текст от OCR.
  • --skip-text пропуска страници, съдържащи текст. Това не е поправка за съществуващ грешен текстов слой.
  • --force-ocr растеризира съдържанието на страницата и стартира OCR върху получените изображения.

Тези поведения са описани в документацията на OCRmyPDF за грешки при съществуващ текст. Във версия 17 еквивалентните избори са налични и чрез --mode; по-старите флагове остават псевдоними.

Има разходи и изключения. Повторната обработка не може да идентифицира всяка историческа OCR подредба; някои файлове поставят непрозрачно изображение върху текст, който технически е печатаем. Принудителното изпълнение превръща печатаемия текст и векторното съдържание в пиксели и сплесква интерактивното съдържание. Повторната обработка и принудителното изпълнение също така изхвърлят съществуващото дърво на структурата, вместо да го възстановяват. Прегледайте разширената документация на OCRmyPDF преди да изберете което и да е от двете.

Поправеният извлечен файл следователно не е проверка за достъпност. Ако документът се нуждае от заглавия, ред на четене или достъпни фигури, използвайте отделните преведени проверки за достъпност на PDF файлове.

Ако страниците или езиците се различават, не приемайте, че една настройка е подходяща за

Избройте кои страници вече съдържат надежден цифров текст и кои се нуждаят от разпознаване. Проверете езиците на засегнатите страници, преди да конфигурирате OCR. Нашето ръководство за OCR на PDF файлове с смесени езици обхваща избора на език; това е различно решение от определянето дали стар текстов слой е сгрешен.

Ако изобщо няма текстов слой, преминете към работния процес за сканирани PDF файлове. Многократното опитване с друг екстрактор на обикновен текст няма да накара pypdf да разпознае думи в изображение.

Проверете заместващия текст, преди да го използвате

Използвайте контролен списък за проверка на текстовия слой за изтегляне за запазване на видимата референция, предишното извличане и заместващото извличане една до друга. Започнете с познатата грешка, след това тествайте различен откъс и всяко различно оформление на страницата.

  1. Думи: сравнявайте имената и непознатите термини буква по буква.
  2. Числа: проверявайте количествата, десетичните запетаи, датите и идентификаторите като B-204.
  3. Ред: прочетете цял параграф през прекъсванията на редовете; проверявайте колоните и съседните надписи отделно.
  4. Покритие: потвърдете, че страниците и откъсите, от които се нуждаете, не са пропуснати.
  5. Поведение на файла: отворете отново записания заместващ файл и повторете теста за копиране. Ако разчитате на отметки, връзки или достъпна структура, проверете и тях.

Преминаването на избрани откъси дава доказателства за тези откъси. Това не удостоверява целия файл. Запазете оригиналното изображение на страницата като референция, особено когато коригирате цитат или непознат език.

Превеждайте само след като можете да се доверите на източника

Ако целта ви е била да цитирате параграф или да си водите бележки, провереният извлечен текст може да бъде крайната точка. Не се нуждаете от услуга за превод, за да изпълните тази задача.

Ако трябва да прочетете целия документ на друг език, използвайте проверения файл като отправна точка за превод на PDF. Режимът OCR на BookTranslator възстановява преведен PDF от разпознато съдържание; това не е обещание за поправяне на съществуващ текстов слой или за точно възпроизвеждане на оригиналното оформление на страницата.

Запазете референтните страници по време на стъпката за превод. Същите количества и идентификатори, проверени тук, принадлежат към крайния етап на проверка на качеството на превода на PDF. Един гладък превод не може сам по себе си да ви каже, че неговият източник е трябвало да каже 18 вместо 13.

Свързани публикации