Перевод отсканированного PDF: проблемы OCR и практические решения
Узнайте, как выполнять распознавание текста (OCR) и перевод отсканированных PDF-файлов, диагностировать частые сбои распознавания и сохранять макет с помощью документоориентированного рабочего процесса.

Быстрый ответ: отсканированному PDF требуется OCR перед переводом
Чтобы перевести отсканированный PDF-файл, сначала запустите OCR, чтобы превратить изображения страниц в выделяемый текст. Затем переведите обработанный с помощью OCR PDF-файл с помощью переводчика документов, такого как PDF Translator. Если пропустить OCR, многие инструменты перевода вернут исходный файл без изменений, пропустят страницы или переведут только те части, которые уже содержат текстовый слой.
Используйте этот рабочий процесс:
- Откройте PDF и попробуйте выделить предложение.
- Если текст не выделяется, запустите OCR.
- Проверьте текст OCR перед переводом.
- Загрузите обработанный с помощью OCR PDF-файл в PDF Translator.
- Сравните переведенный результат с оригинальным сканом.
Если ваш файл PDF уже содержит выделяемый текст и проблема заключается в сохранении макета, используйте руководство по переводу PDF без потери форматирования.
Почему отсканированные PDF не переводятся в инструментах перевода
Отсканированный PDF часто представляет собой просто набор изображений страниц внутри контейнера PDF. Страница может показывать слова человеку, но файл может не содержать реального текста для извлечения программным обеспечением.
Это создает простую проблему:
| Тип файла | Что видит переводчик | Что происходит |
|---|---|---|
| Текстовый PDF | Текст плюс данные макета | Перевод может начаться немедленно. |
| Растровый отсканированный PDF | Изображения страниц | Сначала требуется OCR. |
| PDF «текст поверх изображения» | Скан изображения плюс скрытый текстовый слой OCR | Перевод может работать, но ошибки OCR влияют на качество. |
Самый полезный тест не является техническим:
- Откройте PDF.
- Попробуйте выделить отдельные слова.
- Скопируйте предложение.
- Вставьте его в текстовый редактор.
Если предложение вставляется правильно, у PDF есть текстовый слой. Если ничего не вставляется или вся страница ведет себя как одно изображение, PDF требует OCR.
OCR не является необязательным
OCR означает оптическое распознавание символов. Оно считывает текст с изображения и создает машиночитаемый текст. Для перевода PDF OCR обычно создает невидимый текстовый слой поверх отсканированной страницы.
Этот текстовый слой становится источником для перевода. Если OCR делает ошибки, перевод наследует эти ошибки.
Частые ошибки OCR:
| Ошибка OCR | Риск перевода |
|---|---|
rn распознано как m | Слова меняют значение. |
1 распознано как l | Номера, ссылки или коды становятся неверными. |
O распознано как 0 | Идентификаторы, формулы и имена могут сломаться. |
| Знаки ударения пропущены | Имена и термины становятся неточными. |
| Столбцы объединены | Предложения переводятся в неправильном порядке. |
| Ячейки таблицы прочитаны строка за строкой неверно | Метки данных больше не соответствуют значениям. |
| Сноски обработаны как основной текст | Цитаты и заметки попадают в неправильный контекст. |
Именно поэтому важен этап проверки OCR. Не переводите отсканированный документ, пока не проверите выборочно извлеченный текст.
Рабочий процесс с OCR на первом месте
Шаг 1: Определите тип PDF
Попробуйте выделить текст. Если выделение работает, OCR может не понадобиться. Если выделение не работает, рассматривайте файл как растровый.
Также осмотрите страницу визуально:
- Искривленные страницы указывают на скан.
- Серая текстура бумаги указывает на скан.
- Тени возле корешка указывают на сфотографированную книгу.
- Неравномерный контраст указывает на ксерокопию.
- Поиск, не находящий видимые слова, указывает на отсутствие текстового слоя.
Шаг 2: Улучшите скан, если это возможно
Качество OCR начинается с качества изображения. Если вы можете пересканировать документ, сделайте это, прежде чем тратить время на исправление ошибок OCR.
Используйте этот контрольный список качества изображения:
- Сканируйте с разрешением, достаточно высоким для мелкого текста.
- Держите страницы ровно и прямо.
- Избегайте теней возле корешка.
- Обрезайте края таблиц, пальцы или посторонние предметы на фоне.
- Используйте сильный контраст между текстом и страницей.
- Держите всю строку видимой.
- Используйте правильную ориентацию страницы.
- Не сжимайте изображение настолько сильно, чтобы буквы размывались.
Для старых книг и ксерокопий наибольшую пользу обычно приносят исправление искривлений, коррекция контрастности и повторное сканирование расфокусированных страниц.
Шаг 3: Запустите OCR
Выбирайте инструмент OCR на основе документа, а не бренда.
| Вариант OCR | Лучше всего подходит для | На что обратить внимание |
|---|---|---|
| Adobe Acrobat OCR | Общие бизнес-сканы и очистка PDF | Проверьте доступ к текущему плану перед использованием. |
| ABBYY FineReader | Сложные сканы, таблицы, столбцы и сложные макеты | Все еще требует ручной проверки. |
| Tesseract или OCRmyPDF | Локальные, технические, повторяемые рабочие процессы OCR | Требуется комфортное владение инструментами командной строки. |
| Онлайн-инструменты OCR | Файлы для редкого использования с низким риском | Конфиденциальность, лимиты файлов и качество различаются. |
| Приложения для сканирования на телефоне | Быстрое создание нового скана | Искажение перспективы может навредить OCR. |
Для конфиденциальных контрактов, медицинских карт, финансовых документов, неопубликованных рукописей или академических работ на рецензировании отдавайте предпочтение локальному рабочему процессу OCR или доверенной среде. Не загружайте чувствительные сканы на случайные бесплатные сайты OCR.
Шаг 4: Проверьте текст OCR
Проверяйте до перевода, а не после. Скопируйте текст с нескольких сложных страниц и проверьте, читаем ли он.
Примеры страниц для проверки:
- Титульная страница.
- Страница с плотным основным текстом.
- Страница с таблицей.
- Страница со сносками.
- Страница с мелким текстом.
- Страница со штампами, рукописным текстом или пометками на полях.
- Страница на каждом языке, если документ многоязычный.
Ищите:
- Пропущенные абзацы.
- Объединенные столбцы.
- Разорванные слова.
- Неправильные символы.
- Утерянные диакритические знаки.
- Метки таблиц, отделенные от значений.
- Заголовки, вставленные в основной текст.
- Номера страниц, смешанные с предложениями.
Если качество OCR низкое, исправьте его до перевода. Переводчик не может надежно восстановить смысл, который OCR никогда не захватывал.
Шаг 5: Переведите обработанный с помощью OCR PDF
Когда в PDF появится чистый текстовый слой, загрузите его в PDF Translator. Теперь этап перевода может работать с текстом вместо изображений страниц.
После перевода сравните:
- Оригинальный скан
- Текстовый слой OCR
- Переведенный PDF
Эта трехсторонняя проверка помогает определить, откуда взялась ошибка — из OCR или из перевода. Если текст OCR неверчен, перезапустите OCR. Если текст OCR правильный, а перевод неверный, исправьте перевод.
Шаг 6: Проверьте контент с высоким уровнем риска
Отсканированные документы часто содержат именно тот контент, который требует тщательной проверки: старые контракты, правительственные формы, академические статьи, руководства, исторические документы и страницы книг.
Проверьте эти элементы вручную:
- Имена
- Даты
- Номера
- Адреса
- Коды продуктов
- Юридические ссылки
- Цитаты
- Метки таблиц
- Единицы измерения
- Уравнения
- Подписи
- Сноски
Для исследовательских и академических файлов также прочитайте руководство по переводу академических исследовательских работ, поскольку отсканированные академические PDF добавляют риски цитирования и макета поверх рисков OCR.
Примеры сбоев рядом друг с другом
Используйте эту таблицу при проверке вывода OCR.
| Оригинальный скан вероятно показывает | Плохой вывод OCR | Почему это важно |
|---|---|---|
modern | modem | Значение меняется полностью. |
Section 10 | Section IO | Юридические или технические ссылки могут сломаться. |
2026 | 2O26 | Даты и идентификаторы становятся ненадежными. |
patient | patlent | Медицинские или технические термины становятся неверными. |
| Два отдельных столбца | Один объединенный абзац | Перевод читает предложения в неправильном порядке. |
| Строка таблицы с метками и значениями | Одна строка смешанного текста | Данные больше не сопоставляются с правильной меткой. |
Маркер сноски 1 | Буква l | Примечания могут прикрепляться к неправильному предложению. |
Если вы видите эти ошибки в слое OCR, исправьте OCR перед переводом.
Какой инструмент вам следует использовать?
Выбирайте по сложности документа.
| Документ | Рекомендуемый путь |
|---|---|
| Чистый деловой скан | OCR в Acrobat или другом надежном инструменте OCR, затем PDF Translator. |
| Скан старой книги | Выпрямите искривления и улучшите контрастность, аккуратно сделайте OCR, затем переведите. |
| Скан академической статьи | Сделайте OCR, проверьте уравнения/цитаты/таблицы, затем переведите с проверкой макета. |
| Рукописные заметки | Перед переводом может потребоваться ручная расшифровка. |
| Простой личный документ | Онлайн-OCR может быть приемлемым, если риск конфиденциальности невелик. |
| Чувствительный документ | Используйте локальный OCR или доверенный контролируемый рабочий процесс. |
Если вы хотите ознакомиться с более широким сравнением инструментов, см. руководство по лучшим переводчикам PDF.
Частые проблемы отсканированных PDF
Страницы низкого разрешения
Сканы низкого разрешения размывают буквы вместе. OCR может перепутать rn и m, cl и d, или знаки препинания и пыль.
Решение: пересканируйте, если возможно. Если нет, увеличьте контрастность и попробуйте OCR снова.
Искривленные или изогнутые страницы
Сканы книг часто искривляются возле корешка. OCR плохо читает изогнутые строки и может изменить порядок текста.
Решение: выпрямите страницу, пересканируйте или используйте инструмент OCR с функциями исправления искривлений и выпрямления.
Многоколоночный макет
OCR может объединить левую и правую колонки в один поток предложений.
Решение: проверьте порядок чтения перед переводом. Академические статьи требуют здесь особого внимания.
Таблицы
Таблицы сложны, потому что OCR должен обнаруживать как текст, так и структуру. Таблица может выглядеть правильно визуально, в то время как текстовый слой неверчен.
Решение: скопируйте текст OCR из таблицы и убедитесь, что метки по-прежнему соответствуют значениям.
Рукописный текст и подписи
OCR печатного текста гораздо надежнее распознавания почерка. Рукописные пометки на полях, подписи и заполненные формы могут быть пропущены или искажены.
Решение: вручную расшифруйте важный рукописный текст перед переводом.
Смешанные языки
OCR работает лучше всего, когда он знает исходный язык. Скан с английским, французским и китайским языками может не удасться распознать, если OCR настроен только на один язык.
Решение: выберите все соответствующие языки OCR, если инструмент это поддерживает, а затем выборочно проверьте каждый языковой раздел.
Контрольный список конфиденциальности и безопасности
Прежде чем загружать отсканированный PDF куда-либо, спросите:
- Содержит ли документ личные данные?
- Включает ли он медицинский, юридический, финансовый, академический или неопубликованный материал?
- Подпадает ли он под действие соглашения с клиентом или политики школы?
- Разрешен ли онлайн-сервис OCR для этого документа?
- Требуется ли вместо этого локальный рабочий процесс?
- Можете ли вы удалить страницы, не требующие перевода?
Отсканированные документы часто чувствительны, потому что они происходят из контрактов, удостоверений личности, форм, черновиков исследований и внутренних архивов. Относитесь к решениям о загрузке для OCR так же, как вы бы отнеслись к исходному документу.
Похожие статьи





