BookTranslator
BookTranslator

Перевод отсканированного PDF: проблемы OCR и практические решения

Узнайте, как выполнять распознавание текста (OCR) и перевод отсканированных PDF-файлов, диагностировать частые сбои распознавания и сохранять макет с помощью документоориентированного рабочего процесса.

BookTranslator

BookTranslator Team

9 min read

Быстрый ответ: отсканированному PDF требуется OCR перед переводом

Чтобы перевести отсканированный PDF-файл, сначала запустите OCR, чтобы превратить изображения страниц в выделяемый текст. Затем переведите обработанный с помощью OCR PDF-файл с помощью переводчика документов, такого как PDF Translator. Если пропустить OCR, многие инструменты перевода вернут исходный файл без изменений, пропустят страницы или переведут только те части, которые уже содержат текстовый слой.

Используйте этот рабочий процесс:

  1. Откройте PDF и попробуйте выделить предложение.
  2. Если текст не выделяется, запустите OCR.
  3. Проверьте текст OCR перед переводом.
  4. Загрузите обработанный с помощью OCR PDF-файл в PDF Translator.
  5. Сравните переведенный результат с оригинальным сканом.

Если ваш файл PDF уже содержит выделяемый текст и проблема заключается в сохранении макета, используйте руководство по переводу PDF без потери форматирования.

Почему отсканированные PDF не переводятся в инструментах перевода

Отсканированный PDF часто представляет собой просто набор изображений страниц внутри контейнера PDF. Страница может показывать слова человеку, но файл может не содержать реального текста для извлечения программным обеспечением.

Это создает простую проблему:

Тип файлаЧто видит переводчикЧто происходит
Текстовый PDFТекст плюс данные макетаПеревод может начаться немедленно.
Растровый отсканированный PDFИзображения страницСначала требуется OCR.
PDF «текст поверх изображения»Скан изображения плюс скрытый текстовый слой OCRПеревод может работать, но ошибки OCR влияют на качество.

Самый полезный тест не является техническим:

  1. Откройте PDF.
  2. Попробуйте выделить отдельные слова.
  3. Скопируйте предложение.
  4. Вставьте его в текстовый редактор.

Если предложение вставляется правильно, у PDF есть текстовый слой. Если ничего не вставляется или вся страница ведет себя как одно изображение, PDF требует OCR.

OCR не является необязательным

OCR означает оптическое распознавание символов. Оно считывает текст с изображения и создает машиночитаемый текст. Для перевода PDF OCR обычно создает невидимый текстовый слой поверх отсканированной страницы.

Этот текстовый слой становится источником для перевода. Если OCR делает ошибки, перевод наследует эти ошибки.

Частые ошибки OCR:

Ошибка OCRРиск перевода
rn распознано как mСлова меняют значение.
1 распознано как lНомера, ссылки или коды становятся неверными.
O распознано как 0Идентификаторы, формулы и имена могут сломаться.
Знаки ударения пропущеныИмена и термины становятся неточными.
Столбцы объединеныПредложения переводятся в неправильном порядке.
Ячейки таблицы прочитаны строка за строкой неверноМетки данных больше не соответствуют значениям.
Сноски обработаны как основной текстЦитаты и заметки попадают в неправильный контекст.

Именно поэтому важен этап проверки OCR. Не переводите отсканированный документ, пока не проверите выборочно извлеченный текст.

Рабочий процесс с OCR на первом месте

Шаг 1: Определите тип PDF

Попробуйте выделить текст. Если выделение работает, OCR может не понадобиться. Если выделение не работает, рассматривайте файл как растровый.

Также осмотрите страницу визуально:

  • Искривленные страницы указывают на скан.
  • Серая текстура бумаги указывает на скан.
  • Тени возле корешка указывают на сфотографированную книгу.
  • Неравномерный контраст указывает на ксерокопию.
  • Поиск, не находящий видимые слова, указывает на отсутствие текстового слоя.

Шаг 2: Улучшите скан, если это возможно

Качество OCR начинается с качества изображения. Если вы можете пересканировать документ, сделайте это, прежде чем тратить время на исправление ошибок OCR.

Используйте этот контрольный список качества изображения:

  • Сканируйте с разрешением, достаточно высоким для мелкого текста.
  • Держите страницы ровно и прямо.
  • Избегайте теней возле корешка.
  • Обрезайте края таблиц, пальцы или посторонние предметы на фоне.
  • Используйте сильный контраст между текстом и страницей.
  • Держите всю строку видимой.
  • Используйте правильную ориентацию страницы.
  • Не сжимайте изображение настолько сильно, чтобы буквы размывались.

Для старых книг и ксерокопий наибольшую пользу обычно приносят исправление искривлений, коррекция контрастности и повторное сканирование расфокусированных страниц.

Шаг 3: Запустите OCR

Выбирайте инструмент OCR на основе документа, а не бренда.

Вариант OCRЛучше всего подходит дляНа что обратить внимание
Adobe Acrobat OCRОбщие бизнес-сканы и очистка PDFПроверьте доступ к текущему плану перед использованием.
ABBYY FineReaderСложные сканы, таблицы, столбцы и сложные макетыВсе еще требует ручной проверки.
Tesseract или OCRmyPDFЛокальные, технические, повторяемые рабочие процессы OCRТребуется комфортное владение инструментами командной строки.
Онлайн-инструменты OCRФайлы для редкого использования с низким рискомКонфиденциальность, лимиты файлов и качество различаются.
Приложения для сканирования на телефонеБыстрое создание нового сканаИскажение перспективы может навредить OCR.

Для конфиденциальных контрактов, медицинских карт, финансовых документов, неопубликованных рукописей или академических работ на рецензировании отдавайте предпочтение локальному рабочему процессу OCR или доверенной среде. Не загружайте чувствительные сканы на случайные бесплатные сайты OCR.

Шаг 4: Проверьте текст OCR

Проверяйте до перевода, а не после. Скопируйте текст с нескольких сложных страниц и проверьте, читаем ли он.

Примеры страниц для проверки:

  • Титульная страница.
  • Страница с плотным основным текстом.
  • Страница с таблицей.
  • Страница со сносками.
  • Страница с мелким текстом.
  • Страница со штампами, рукописным текстом или пометками на полях.
  • Страница на каждом языке, если документ многоязычный.

Ищите:

  • Пропущенные абзацы.
  • Объединенные столбцы.
  • Разорванные слова.
  • Неправильные символы.
  • Утерянные диакритические знаки.
  • Метки таблиц, отделенные от значений.
  • Заголовки, вставленные в основной текст.
  • Номера страниц, смешанные с предложениями.

Если качество OCR низкое, исправьте его до перевода. Переводчик не может надежно восстановить смысл, который OCR никогда не захватывал.

Шаг 5: Переведите обработанный с помощью OCR PDF

Когда в PDF появится чистый текстовый слой, загрузите его в PDF Translator. Теперь этап перевода может работать с текстом вместо изображений страниц.

После перевода сравните:

  • Оригинальный скан
  • Текстовый слой OCR
  • Переведенный PDF

Эта трехсторонняя проверка помогает определить, откуда взялась ошибка — из OCR или из перевода. Если текст OCR неверчен, перезапустите OCR. Если текст OCR правильный, а перевод неверный, исправьте перевод.

Шаг 6: Проверьте контент с высоким уровнем риска

Отсканированные документы часто содержат именно тот контент, который требует тщательной проверки: старые контракты, правительственные формы, академические статьи, руководства, исторические документы и страницы книг.

Проверьте эти элементы вручную:

  • Имена
  • Даты
  • Номера
  • Адреса
  • Коды продуктов
  • Юридические ссылки
  • Цитаты
  • Метки таблиц
  • Единицы измерения
  • Уравнения
  • Подписи
  • Сноски

Для исследовательских и академических файлов также прочитайте руководство по переводу академических исследовательских работ, поскольку отсканированные академические PDF добавляют риски цитирования и макета поверх рисков OCR.

Примеры сбоев рядом друг с другом

Используйте эту таблицу при проверке вывода OCR.

Оригинальный скан вероятно показываетПлохой вывод OCRПочему это важно
modernmodemЗначение меняется полностью.
Section 10Section IOЮридические или технические ссылки могут сломаться.
20262O26Даты и идентификаторы становятся ненадежными.
patientpatlentМедицинские или технические термины становятся неверными.
Два отдельных столбцаОдин объединенный абзацПеревод читает предложения в неправильном порядке.
Строка таблицы с метками и значениямиОдна строка смешанного текстаДанные больше не сопоставляются с правильной меткой.
Маркер сноски 1Буква lПримечания могут прикрепляться к неправильному предложению.

Если вы видите эти ошибки в слое OCR, исправьте OCR перед переводом.

Какой инструмент вам следует использовать?

Выбирайте по сложности документа.

ДокументРекомендуемый путь
Чистый деловой сканOCR в Acrobat или другом надежном инструменте OCR, затем PDF Translator.
Скан старой книгиВыпрямите искривления и улучшите контрастность, аккуратно сделайте OCR, затем переведите.
Скан академической статьиСделайте OCR, проверьте уравнения/цитаты/таблицы, затем переведите с проверкой макета.
Рукописные заметкиПеред переводом может потребоваться ручная расшифровка.
Простой личный документОнлайн-OCR может быть приемлемым, если риск конфиденциальности невелик.
Чувствительный документИспользуйте локальный OCR или доверенный контролируемый рабочий процесс.

Если вы хотите ознакомиться с более широким сравнением инструментов, см. руководство по лучшим переводчикам PDF.

Частые проблемы отсканированных PDF

Страницы низкого разрешения

Сканы низкого разрешения размывают буквы вместе. OCR может перепутать rn и m, cl и d, или знаки препинания и пыль.

Решение: пересканируйте, если возможно. Если нет, увеличьте контрастность и попробуйте OCR снова.

Искривленные или изогнутые страницы

Сканы книг часто искривляются возле корешка. OCR плохо читает изогнутые строки и может изменить порядок текста.

Решение: выпрямите страницу, пересканируйте или используйте инструмент OCR с функциями исправления искривлений и выпрямления.

Многоколоночный макет

OCR может объединить левую и правую колонки в один поток предложений.

Решение: проверьте порядок чтения перед переводом. Академические статьи требуют здесь особого внимания.

Таблицы

Таблицы сложны, потому что OCR должен обнаруживать как текст, так и структуру. Таблица может выглядеть правильно визуально, в то время как текстовый слой неверчен.

Решение: скопируйте текст OCR из таблицы и убедитесь, что метки по-прежнему соответствуют значениям.

Рукописный текст и подписи

OCR печатного текста гораздо надежнее распознавания почерка. Рукописные пометки на полях, подписи и заполненные формы могут быть пропущены или искажены.

Решение: вручную расшифруйте важный рукописный текст перед переводом.

Смешанные языки

OCR работает лучше всего, когда он знает исходный язык. Скан с английским, французским и китайским языками может не удасться распознать, если OCR настроен только на один язык.

Решение: выберите все соответствующие языки OCR, если инструмент это поддерживает, а затем выборочно проверьте каждый языковой раздел.

Контрольный список конфиденциальности и безопасности

Прежде чем загружать отсканированный PDF куда-либо, спросите:

  • Содержит ли документ личные данные?
  • Включает ли он медицинский, юридический, финансовый, академический или неопубликованный материал?
  • Подпадает ли он под действие соглашения с клиентом или политики школы?
  • Разрешен ли онлайн-сервис OCR для этого документа?
  • Требуется ли вместо этого локальный рабочий процесс?
  • Можете ли вы удалить страницы, не требующие перевода?

Отсканированные документы часто чувствительны, потому что они происходят из контрактов, удостоверений личности, форм, черновиков исследований и внутренних архивов. Относитесь к решениям о загрузке для OCR так же, как вы бы отнеслись к исходному документу.

Похожие статьи