BookTranslator
BookTranslator

Превод на сканиран PDF: Проблеми с OCR и практични решения

Научете как да извършвате OCR и да превеждате сканирани PDF файлове, да диагностицирате чести грешки при разпознаването и да запазите оформлението с работен процес, съобразен с документите.

BookTranslator

BookTranslator Team

10 min read

Бърз отговор: Сканираният PDF се нуждае от OCR преди превод

За да преведете сканиран PDF файл, първо стартирайте OCR (оптично разпознаване на символи), за да превърнете изображенията на страниците в избираем текст. След това преведете обработения с OCR PDF файл с инструмент за превод на документи, като например PDF Translator. Ако пропуснете OCR, много инструменти за превод ще върнат оригиналния файл непроменен, ще пропуснат страници или ще преведат само частите, които вече съдържат текстов слой.

Използвайте следния работен процес:

  1. Отворете PDF файла и опитайте да изберете изречение.
  2. Ако не можете да избирате текст, стартирайте OCR.
  3. Прегледайте OCR текста преди превод.
  4. Качете обработения с OCR PDF файл в PDF Translator.
  5. Проверете преведения резултат спрямо оригиналното сканиране.

Ако вашият PDF файл вече има избираем текст и проблемът е запазването на оформлението, използвайте ръководството за превод на PDF без загуба на форматиране.

Защо сканираните PDF файлове се провалят в инструментите за превод

Сканираният PDF файл често е просто набор от изображения на страници вътре в PDF контейнер. Страницата може да показва думи на човек, но файлът може да не съдържа действителен текст, който софтуерът да извлече.

Това създава прост проблем:

Тип файлКакво вижда преводачътКакво се случва
Базиран на текст PDFТекст плюс данни за оформлениетоПреводът може да започне незабавно.
Само с изображения PDFИзображения на страницитеПърво се изисква OCR.
Текст върху изображениеСканирано изображение плюс скрит OCRПреводът може да работи, но грешките от OCR влошават качеството.

Най-полезният тест не е технически:

  1. Отворете PDF файла.
  2. Опитайте да маркирате отделни думи.
  3. Копирайте изречение.
  4. Поставете го в текстов редактор.

Ако изречението се постави правилно, PDF файлът има текстов слой. Ако нищо не се поставя или цялата страница се държи като едно изображение, PDF файлът се нуждае от OCR.

OCR не е опция, а необходимост

OCR означава оптично разпознаване на символи. То чете текст от изображение и създава четим за машина текст. За превод на PDF файлове OCR обикновено създава невидим текстов слой върху сканираната страница.

Този текстов слой се превръща в източник за превод. Ако OCR прави грешки, преводът наследява тези грешки.

Чести грешки на OCR:

Грешка на OCRРиск при превода
rn прочетено като mДумите променят значението си.
1 прочетено като lНомерата, препратките или кодовете стават грешни.
O прочетено като 0Идентификаторите, формулите и имената могат да се счупят.
Премахнати акцентиИменáта и термините стават неточни.
Слети колониИзреченията се превеждат в грешен ред.
Клетките на таблицата са прочетени неправилноЕтикетите с данни вече не съвпадат със стойностите.
Бележките под линия са третирани като основен текстЦитатите и бележките отиват в грешен контекст.

Ето защо стъпката за проверка на OCR е от значение. Не превеждайте сканиран документ, докато не сте проверили извлечения текст.

Работният процес с приоритет на OCR

Стъпка 1: Идентифицирайте типа на PDF файла

Опитайте да изберете текст. Ако изборът работи, може да не се нуждаете от OCR. Ако изборът е неуспешен, третирайте файла само като изображение.

Също така проверете страницата визуално:

  • Наклонените страници подсказват сканиране.
  • Сивата текстура на хартията подсказва сканиране.
  • Сенките близо до подвързията подсказват снимана книга.
  • Неравномерният контраст подсказва ксерокопие.
  • Търсенето, което не намира видими думи, подсказва липса на текстов слой.

Стъпка 2: Подобрете сканирането, ако е възможно

Качеството на OCR започва с качеството на изображението. Ако можете да сканирате отново, направете го, преди да губите време за поправяне на грешки от OCR.

Използвайте този списък за проверка на качеството на изображението:

  • Сканирайте с достатъчно висока резолюция за малък текст.
  • Дръжте страниците равни и изправени.
  • Избягвайте сенки близо до подвързията.
  • Изрежете ръбовете на таблици, пръсти или фонови замърсявания.
  • Използвайте силен контраст между текста и страницата.
  • Дръжте целия ред видим.
  • Използвайте правилната ориентация на страницата.
  • Не компресирайте изображението толкова силно, че буквите да се размажат.

За стари книги и ксерокопия най-големи ползи обикновено носят изправянето на наклона, корекцията на контраста и повторното сканиране на страници, които са извън фокус.

Стъпка 3: Стартирайте OCR

Изберете инструмент за OCR въз основа на документа, а не на марката.

Опция за OCRНай-подходящо заВнимавайте за
Adobe Acrobat OCRОбщи бизнес сканирания и почистване на PDFПроверете достъпа до текущия план, преди да разчитате на него.
ABBYY FineReaderСложни сканирания, таблици, колони и трудни оформленияВсе още изисква ръчна проверка.
Tesseract или OCRmyPDFЛокални, технически, повтарящи се работни процеси за OCRИзисква познаване на инструменти команден ред.
Онлайн инструменти за OCRФайлове с нисък риск и рядка употребаПоверителността, лимитите за файлове и качеството варират.
Приложения за сканиране с телефонБързо заснемане на ново сканиранеИзкривяването на перспективата може да навреди на OCR.

За поверителни договори, медицински досиета, финансови документи, неиздадени ръкописи или академични разработки под рецензия предпочитайте локален работен процес за OCR или доверена среда. Не качвайте чувствителни сканирания в случайни безплатни сайтове за OCR.

Стъпка 4: Прегледайте OCR текста

Правете преглед преди превод, а не след него. Копирайте текст от няколко трудни страници и проверете дали е четим.

Примерни страници за проверка:

  • Заглавната страница.
  • Страница с плътен основен текст.
  • Страница с таблица.
  • Страница с бележки под линия.
  • Страница с малък текст.
  • Страница с печати, ръкопис или бележки в полетата.
  • Страница на всеки език, ако документът е многоезичен.

Търсете:

  • Липсващи параграфи.
  • Слети колони.
  • Разбити думи.
  • Грешни символи.
  • Изгубени диакритични знаци.
  • Етикети на таблици, отделени от стойностите.
  • Заглавия, вмъкнати в основния текст.
  • Номера на страници, смесени с изречения.

Ако качеството на OCR е лошо, поправете го преди превод. Преводачът не може надеждно да възстанови значение, което OCR никога не е уловил.

Стъпка 5: Преведете обработения с OCR PDF файл

След като PDF файлът има чист текстов слой, го качете в PDF Translator. Стъпката на превод вече може да работи с текст вместо с изображения на страници.

След превода сравнете:

  • Оригиналното сканиране
  • OCR текстовия слой
  • Преведения PDF файл

Тази проверка в три посоки ви помага да установите дали дадена грешка идва от OCR или от превода. Ако OCR текстът е грешен, стартирайте OCR отново. Ако OCR текстът е верен, но преводът е грешен, поправете превода.

Стъпка 6: Прегледайте съдържанието с висок риск

Сканираните документи често съдържат точно съдържанието, което се нуждае от внимателен преглед: стари договори, правителствени формуляри, академични статии, ръководства, исторически документи и страници от книги.

Прегледайте тези елементи ръчно:

  • Именá
  • Дати
  • Номера
  • Адреси
  • Продуктови кодове
  • Правни препратки
  • Цитати
  • Етикети на таблици
  • Единици
  • Уравнения
  • Надписи
  • Бележки под линия

За изследователски и академични файлове прочетете и ръководството за превод на академични изследователски статии, тъй като сканираните академични PDF файлове добавят рискове за цитиране и оформление към риска от OCR.

Примери за грешки рамо до рамо

Използвайте тази таблица, докато преглеждате OCR изхода.

Оригиналното сканиране вероятно показваЛош OCR изходЗащо е от значение
modernmodemЗначението се променя напълно.
Section 10Section IOПравните или техническите препратки могат да се счупят.
20262O26Датите и идентификаторите стават ненадеждни.
patientpatlentМедицинските или техническите термини стават грешни.
Две отделни колониЕдин слят параграфПреводът чете изреченията в грешен ред.
Ред от таблица с етикети и стойностиЕдин единствен ред смесен текстДанните вече не съответстват на правилния етикет.
Маркер за бележка под линия 1Буква lБележките може да се закачат за грешно изречение.

Ако видите тези грешки в OCR слоя, поправете OCR преди превод.

Кой инструмент трябва да използвате?

Избирайте според трудността на документа.

ДокументПрепоръчителен път
Чисто бизнес сканиранеOCR в Acrobat или друг надежден OCR инструмент, след това PDF Translator.
Сканиране на стара книгаИзправете наклона и подобрете контраста, направете внимателно OCR и след това преведете.
Сканиране на академична статияOCR, преглед на уравнения/цитати/таблици, след това превод с проверка на оформлението.
Ръкописни бележкиМоже да се изисква ръчно преписване преди превод.
Обикновен личен документОнлайн OCR може да е приемлив, ако рискът за поверителността е нисък.
Чувствителен документИзползвайте локален OCR или доверен контролиран рабоten процес.

Ако искате по-общото сравнение на инструменти, вижте ръководството за най-добрите PDF преводачи.

Чести проблеми със сканирани PDF файлове

Страници с ниска резолюция

Сканиранията с ниска резолюция размазват буквите една в друга. OCR може да обърка rn и m, cl и d или пунктуацията и праха.

Решение: сканирайте отново, ако е възможно. Ако не, увеличете контраста и опитайте OCR отново.

Наклонени или извити страници

Сканираните книги често се извиват близо до подвързията. OCR чете извитите линии зле и може да пренареди текста.

Решение: изпънете страницата, сканирайте отново или използвайте OCR инструмент с функции за изправяне и премахване на изкривявания.

Многоколонно оформление

OCR може да слете лявата и дясната колона в един поток от изречения.

Решение: проверете реда за четене преди превод. Академичните статии се нуждаят от специално внимание тук.

Таблици

Таблиците са трудни, защото OCR трябва да открие както текста, така и структурата. Една таблица може да изглежда визуално правилна, докато текстовият слой е грешен.

Решение: копирайте OCR текста от таблицата и потвърдете, че етикетите все още съвпадат със стойностите.

Ръкопис и подписи

OCR за отпечатан текст е много по-надежден от разпознаването на ръкопис. Ръкописните бележки в полетата, подписите и попълнените формуляри може да бъдат пропуснати или объркани.

Решение: ръчно препишете съществения ръкопис преди превод.

Смесени езици

OCR работи най-добре, когато „знае“ изходния език. Сканиране с английски, френски и китайски може да се провали, ако OCR е настроен само на един език.

Решение: изберете всички подходящи езици за OCR, ако инструментът го поддържа, след което проверете на място всяка езикова секция.

Чеклист за поверителност и сигурност

Преди да качите сканиран PDF файл където и да било, задайте си следните въпроси:

  • Съдържа ли документът лични данни?
  • Включва ли медицински, правни, финансови, академични или неиздадени материали?
  • Покрит ли е от клиентско споразумение или училищна политика?
  • Разрешена ли е онлайн услуга за OCR за този документ?
  • Нуждаете ли се вместо това от локален работен процес?
  • Можете ли да премахнете страници, които не се нуждаят от превод?

Сканираните файлове често са чувствителни, защото идват от договори, лични карти, формуляри, изследователски чернови и вътрешни архиви. Третирайте решенията за качване на OCR по същия начин, по който бихте третирали оригиналния документ.

Свързани публикации