Как перевести PDF с сохранением форматирования
Используйте воспроизводимый рабочий процесс для PDF, чтобы сохранить порядок чтения, таблицы, графики, шрифты, текст с письмом справа налево (RTL) и макет страницы при переводе.

Быстрый ответ: Сохраняйте осмысленную структуру документа, а не каждые координаты
Чтобы перевести PDF без потери форматирования, сначала определите, содержит ли он выделяемый текст, отсканированные изображения или и то, и другое. Затем протестируйте самую сложную репрезентативную страницу с помощью переводчика PDF, учитывающего макет, прежде чем обрабатывать весь файл. Отдельно проверьте порядок чтения, переполнение текста, таблицы, подписи к графикам, сноски, шрифты и текст с письмом справа налево.
Цель состоит не в достижении попиксельной идентичности. Перевод может сместить перенос строки или добавить страницу и при этом правильно сохранить документ. Перевод считается неуспешным, если информация пропадает, смещается не в ту строку таблицы, становится нечитаемой или теряет связь с подписью, сноской или визуальным элементом.
Используйте эту таблицу решений в качестве отправной точки:
| Имеющийся у вас PDF | Первое действие | Основной риск форматирования |
|---|---|---|
| Цифровой PDF с выделяемым текстом | Перевести одну сложную страницу напрямую | Порядок чтения и переполнение текстовых блоков |
| Отсканированный или сфотографированный PDF | Выполнить OCR, проверить текстовый слой, а затем перевести | Ошибки OCR, переходящие в ошибки перевода |
| PDF с плотными таблицами или графиками | Протестировать страницу с объединенными ячейками, цифрами и метками | Корректно выглядящий макет с неверными связями данных |
| Двухколоночный документ или отчет | Проверить извлечение и порядок чтения перед оценкой плавности | Слияние колонок или перевод абзацев не в последовательности |
| Форма, сертификат или фиксированный шаблон | Решить, какие координаты и ссылки на страницы зафиксированы юридически или оперативно | Обрезка из-за жестких текстовых областей |
| Двуязычная копия для проверки | Выбрать параллельные, чередующиеся, расположенные на развороте или синхронизированные файлы | Узкие колонки и нестабильное выравнивание оригинала и перевода |
Это центральный рабочий процесс для категории перевода PDF. Если вы выбираете между продуктами, а не диагностируете файл, начните с сравнения переводчиков PDF. Если вы не можете выделить текст, перейдите непосредственно к рабочему процессу для отсканированных PDF и OCR.
Что на самом деле должно означать «Сохранить форматирование»
Сохранение форматирования — это не единая функция со статусом «успешно/неуспешно». Оно включает как минимум пять уровней:
- Полнота содержимого: каждый значимый абзац, метка, предупреждение, число и примечание остаются на месте.
- Логическая структура: заголовки, списки, ячейки таблиц, подписи, сноски и порядок чтения по-прежнему выражают те же связи.
- Визуальная иерархия: заголовки выглядят как заголовки, подписи остаются второстепенными, а связанные объекты сгруппированы.
- Поддержка письменности: выбранные шрифты содержат целевые глифы, а направление письма и пунктуация отображаются корректно.
- Удобство использования страницы: результат остается читаемым при обычном размере без обрезки, наложения или неизбирательного уменьшения шрифта.
Документация Adobe по PDF описывает видимое содержимое страницы как список объектов и операций разметки, а не как последовательность редактируемых абзацев, похожую на Word. Она также разграничивает логическую структуру документа и его визуальное размещение. Именно это различие объясняет, почему PDF может выглядеть корректно, в то время как скопированный текст, порядок для доступности или порядок перевода оказываются неверными. См. документацию Adobe о содержимом страниц PDF и логической структуре в тегированных PDF.
Практическое правило простое: сравнивайте переведенный документ на уровне связей, а не только по скриншотам.
Стресс-тест воспроизводимости макета PDF
Мы создали двухстраничный синтетический стресс-тест перевода макета PDF, чтобы сложные элементы PDF можно было тестировать без документов клиентов. Это тегированный PDF формата А4 с вымышленными именами и цифрами. Это тестовый фикстура-файл, а не бенчмарк поставщика и не доказательство того, что какой-либо инструмент выдает точный перевод.
Страница 1 проверяет:
- двухколоночный порядок чтения;
- таблицу с объединенной ячейкой;
- целое число, денежную сумму, число с десятичным знаком, сумму с плюсом/минусом и формулу;
- метки на графике, положение которых несет смысл;
- намеренно узкую фиксированную текстовую область;
- сноску, которая должна оставаться связанной со своим маркером.

Страница 2 размещает английский, немецкий, китайский и арабский текст в блоках одинакового размера. Она выявляет четыре разные проблемы: локальное расширение, перенос строк, отсутствие глифов и двунаправленный макет.

W3C рекомендации по размеру текста при переводе объясняют, почему короткие подписи и жестко ограниченные области могут непропорционально расширяться, в то время как другие переводы могут сокращаться. Двунаправленный алгоритм Unicode определяет, как разрешаются смешанные символы слева направо и справа налево. Ни одна из этих проблем не может быть надежно решена простым подсчетом исходных символов.
Загрузите тестовый файл и запустите его через любой рабочий процесс, который вы рассматриваете. Запишите инструмент, дату, настройки, исходный язык, целевой язык и выходной файл. Это превращает фразу «форматирование выглядит нормально» в повторяемый тест.
Проведите диагностику PDF перед переводом
1. Проверьте, выделяется ли текст
Попробуйте выделить одно предложение и одну ячейку таблицы.
- Если оба элемента выделяются чисто, в PDF вероятен рабочий текстовый слой.
- Если вся страница выделяется как единое изображение, требуется OCR.
- Если текст выделяется крошечными фрагментами или скопированные строки поступают не по порядку, визуальное размещение не совпадает с логической структурой.
Adobe отмечает, что отсканированный PDF изначально содержит данные изображений, а не доступный для поиска текст. OCR добавляет выделяемый, доступный для поиска слой, однако Adobe также рекомендует проверять ошибки распознавания после обработки. См. Распознавание текста в отсканированных PDF.
2. Скопируйте сложный раздел в текстовый редактор
Сделайте это с двухколоночным абзацем, одной полной строкой таблицы и подписью. Если вставленный порядок неверлен до перевода, слой перевода начинает работу с неправильной последовательности.
Документация инструмента «Порядок чтения» от Adobe показывает, что сложным таблицам, иллюстрациям, близко расположенным колонкам и элементам страницы может потребоваться явное исправление порядка и тегов. Плавность речи не может исправить абзац, собранный из неправильных фрагментов.
3. Выберите самую сложную репрезентативную страницу
Не тестируйте титульную страницу. Выберите страницу, которая с наибольшей вероятностью вызовет сбой:
- самую плотную таблицу;
- самую узкую боковую панель или врезку;
- двухколоночную страницу со сноской;
- график с короткими подписями;
- страницу, содержащую CJK, арабский язык, деванагари или смешанные шрифты;
- скан с низким контрастом или перекосом.
Если самая сложная страница потерпит неудачу, перевод 200 более простых страниц создаст лишь еще больше работы по очистке.
4. Запишите обязательные требования
Разные документы требуют разных определений «сохранности».
| Тип документа | Обычно обязательно к сохранению | Обычно гибко |
|---|---|---|
| Договор или форма | Полнота пунктов, метки, подписи, ссылки на страницы | Локальный перенос и небольшие изменения интервалов |
| Научная статья | Уравнения, цитаты, связи иллюстраций, порядок чтения | Количество страниц и разрывы строк абзацев |
| Годовой отчет | Числа, единицы измерения, строки таблиц, связи с графиками | Перенос подписей и размер локальной области |
| Руководство | Предупреждения, порядок шагов, врезки, ссылки на рисунки | Нумерация страниц и контролируемая переверстка |
| Книга или длинный отчет | Порядок глав, заголовки, примечания, размещение иллюстраций | Количество страниц и поток абзацев |
Запишите эти требования перед тем, как выбирать способ исправления. В противном случае рецензенты склонны защищать визуальное сходство даже тогда, когда оно нарушает смысл.
Самый безопасный сквозной рабочий процесс
Шаг 1: Сохраните оригинал и установите базовый уровень
Сохраните нетронутый исходный файл. Запишите количество страниц, тип файла, язык, является ли PDF тегированным и выделяется ли текст. Если документ будет обновляться позже, сохраните как оригинальный исходный документ, так и PDF.
Шаг 2: Запускайте OCR только при необходимости
Для страниц, состоящих только из изображений, запустите OCR на правильном исходном языке. Перед переводом проверьте имена, цифры, пунктуацию, таблицы, сноски и области с низким контрастом. Ошибки OCR — это ошибки на раннем этапе: система перевода может выдать беглый результат на основе текста, который был распознан некорректно.
Специальное руководство по отсканированным PDF более подробно описывает очистку сканов, выбор языка OCR, сомнительные символы и проверки конфиденциальности.
Шаг 3: Переведите репрезентативную страницу
Используйте рабочий процесс, разработанный для возврата документа, а не только переведенного текста. Для большинства форматированных PDF это означает загрузку тестового файла в PDF-переводчик BookTranslator, выбор языковой пары и просмотр возвращенного PDF.
Не оценивайте только самый простой абзац. Сравните точные элементы, перечисленные в вашем исходном базовом уровне.
Шаг 4: Проверьте структуру перед формулировками
Проверьте в таком порядке:
- Были ли включены все исходные области?
- Правилен ли порядок чтения?
- Указывают ли по-прежнему строки таблиц, подписи к графикам, подрисуночные подписи и сноски на правильные объекты?
- Целы ли числа, имена, единицы измерения и формулы?
- Корректно ли отображается целевой шрифт?
- И только после этого: является ли перевод беглым и точным?
Вылизанный перевод неправильного порядка текста — это все равно испорченный документ.
Шаг 5: Переведите весь файл и сделайте выборку страниц с рисками
После того как репрезентативная страница успешно пройдет проверку, переведите весь PDF. Проверьте первое, среднее и последнее появление каждой рискованной структуры вместо проверки только первой страницы.
Для длинного отчета это может означать:
- первую и последнюю двухколоночную страницу;
- самую простую и самую плотную таблицу;
- график в начале и в конце;
- каждую страницу с предупреждениями;
- каждую страницу, где меняется целевой шрифт или письменность.
Шаг 6: Примените наименее разрушительное исправление
Устраняйте локальную проблему локально. Не уменьшайте документ глобально из-за того, что один заголовок оказался длинным.
Исправление переполнения текста без глобального уменьшения
Переведенный текст переполняет область, когда целевая формулировка больше не помещается в геометрию исходной области. Непосредственной причиной может быть расширение текста, но ограничивающим фактором обычно является конкретный блок, колонка, строка, шрифт или правило переноса строк.
Применяйте исправления в следующем порядке:
| Порядок | Исправление | Использовать, когда | Основной риск |
|---|---|---|---|
| 1 | Разрешить естественный перенос строк | В области есть неиспользуемое вертикальное пространство | Может измениться отступ списка или высота строки |
| 2 | Изменить локальный интервал строк или абзацев | Переполнение незначительно | Плотный текст может стать труднее читать |
| 3 | Расширить или увеличить затрагиваемую область | Соседнее свободное место действительно не используется | Соседние объекты могут сместиться |
| 4 | Переверстать соседние элементы | Несколько блоков борются за пространство | Иерархия страниц и ссылки могут сместиться |
| 5 | Использовать одобренный более короткий термин | Существует стандартный лаконичный термин | Смысл требует двуязычной проверки |
| 6 | Добавить страницу продолжения | Содержимое не помещается разборчиво | Изменяется нумерация страниц |
| 7 | Уменьшить размер шрифта локально | Небольшое уменьшение остается читаемым | Доступность и визуальная согласованность |
Не полагайтесь на единый процент расширения языка. Немецкий абзац может поместиться, в то время как сложный составной заголовок вызовет сбой. Китайский текст может сократиться, в то время как непереведенный URL-адрес все еще выходит за пределы ячейки. Арабский текст может подойти по количеству символов, но вызвать сбой из-за неправильного шрифта, начертания, знаков препинания или направления письма.
Используйте следующую диагностику:
- Текст обрезан в одном блоке: измените размер или верстку этой области.
- Квадраты вместо символов или пропавшие символы: замените или внедрите шрифт с необходимыми глифами.
- Длинные слова или URL-адреса отказываются переноситься: исправьте правила переноса строк или дефисации.
- Сбои только в заголовках таблиц: используйте исправление, специфичное для таблиц.
- Повторяющиеся заголовки сталкиваются на каждой странице: переработайте шаблон страницы, а не каждый абзац.
- Два фрагмента сливаются в один огромный абзац: исправьте порядок чтения перед тем, как прикасаться к типографике.
Если исходный макет не оставляет места для точной версии на целевом языке, одинаковые координаты являются неверным критерием приемки. Вместо этого сохраняйте полноту, иерархию и читаемость.
Сохранение таблиц, графиков, чисел и сносок
Таблица в PDF не всегда сохраняется как таблица. Это может быть редактируемый текст поверх линий сетки, множество расположенных фрагментов или единственное изображение. Метка на графике может быть отдельным текстом или «впеченной» в графику.
Это порождает четыре независимых класса сбоев:
| Класс сбоев | Пример | Почему визуальный осмотр в одиночку пропускает это |
|---|---|---|
| Структурный | Объединенная ячейка разделяется или две ячейки становятся одним предложением | Результат все еще может выглядеть выровненным |
| Числовой | -3.2% теряет знак минус или перемещается в другую строку | Беглый текст отвлекает внимание от значения |
| Визуальный | Переведенный заголовок пересекает границу | Текст все еще может быть полным |
| Ссылочный | Маркер сноски теряет свою сноску | Обе части все еще могут отображаться в другом месте |
Используйте проверку защищенных токенов для:
- целых и десятичных значений;
- положительных и отрицательных знаков;
- процентов, валют, дат и номеров версий;
- единиц измерения и формул;
- номеров таблиц и рисунков;
- маркеров сносок и их поясняющего текста.
Локальные условности могут изменять десятичные разделители или размещение валюты. Вопрос не в том, идентичен ли каждый символ; вопрос в том, представляет ли целевой элемент ту же величину и остается ли он привязан к правильной метке.
Для каждой таблицы проверьте:
- Количество строк и столбцов по-прежнему совпадает.
- Объединенные ячейки охватывают те же записи.
- Каждое число остается спаренным со своей исходной меткой.
- Единицы измерения, знаки и точность правильны.
- Сноски по-прежнему уточняют нужное значение.
- Перенос строк в заголовках не скрыл содержимое.
Для каждого графика проверьте, что геометрия и данные остались неизменными, метки по-прежнему идентифицируют правильные визуальные отметки, а подписи остались прикрепленными. Если метки встроены в изображение, используйте OCR с поддержкой изображений и перерисуйте их либо сохраните исходный график с переведенной подписью или легендой. Не растягивайте и не кадрируйте график в попытке вместить более длинные метки.
Если финансовая, научная или юридическая таблица содержит хотя бы одно неверное соотношение значений, документ считается дефектным независимо от того, насколько отполированным он выглядит.
Выбор двуязычного макета PDF
Двуязычный PDF полезен, когда кто-то должен проверить перевод по оригиналу. Это не обязательно лучший итоговый результат.
| Задача проверки | Лучший исходный макет | Компромисс |
|---|---|---|
| Редактирование абзац за абзацем | Слева оригинал, справа перевод | Узкие колонки усиливают переполнение |
| Изучение на планшете или телефоне | Абзац оригинала сменяется абзацем перевода | Увеличивается количество страниц |
| Юридический или архивный архив | Страницы оригинала и перевода на развороте | Документ увеличивается в объеме примерно вдвое |
| Плотные таблицы и фиксированные страницы | Отдельные синхронизированные PDF оригинала и перевода | Требуется средство просмотра или процесс проверки, удерживающий страницы синхронными |
| Доставка клиенту | PDF только с переводом плюс отдельная двуязычная копия для проверки | Необходимо поддерживать два контролируемых файла |
Не выравнивайте текст по визуальным переносам строк. Перевод может разделить одно исходное предложение на два предложения перевода или объединить два коротких предложения. Используйте в качестве стабильных якорей заголовки, последовательность абзацев, номера таблиц, номера рисунков, элементы списков и маркеры сносок.
Расположение рядом — плохой вариант по умолчанию, когда в оригинале уже есть несколько колонок, плотные таблицы, маргинальные примечания или масштабное локальное расширение. В таких случаях разворот страниц или синхронизированные одноязычные файлы сохраняют нормальную ширину чтения и облегчают изоляцию сбоев.
Оба языка должны оставаться доступными для поиска и выделения, когда это возможно. Проверяйте порядок скопированного текста, метаданные языка документа, заголовки, теги таблиц и описания рисунков. Если требования к доступности жесткие, отдельные одноязычные файлы часто безопаснее сложной структуры с чередующимися колонками.
Выберите правильный инструмент для работы
Специализированный переводчик PDF
Используйте специализированный переводчик для длинных, форматированных PDF-файлов или документов, предназначенных для клиентов. Это правильная отправная точка, когда требуется получить другой пригодный для использования PDF, а не текстовую расшифровку.
Google Translate
Используйте Google Translate для быстрого понимания коротких, простых документов, когда макет не является конечным результатом. Многоколоночные страницы, сканы, плотные таблицы и финальная публикация требуют более контролируемого рабочего процесса. Руководство по PDF в Google Translate описывает его рабочий процесс с документами и признаки сбоев.
ChatGPT
Используйте ChatGPT для коротких отрывков, подготовки глоссария, принятия решений о тоне и двуязычной проверки. Не рассматривайте интерфейс чата как движок верстки страниц для длинного PDF. Рабочий процесс для PDF в ChatGPT включает промпты, запрещающие суммирование и добавление нового контента.
Конвертация PDF в DOCX
Конвертируйте формат только в том случае, если вы намерены редактировать или пересобирать документ вручную. Конвертация может разделить таблицы, изменить порядок фрагментов и превратить подписи к графикам в плавающие блоки еще до начала перевода. Протестируйте самую сложную страницу перед тем, как продолжить. Если сконвертированный DOCX структурно чист, продолжайте работу с переводчиком DOCX; если он уже поврежден, перевод не исправит результаты конвертации.
Услуги переводчика или двуязычного рецензента
Используйте квалифицированного рецензента для юридического, медицинского, финансового, критически важного для безопасности, академического или опубликованного контента. Макетный рабочий процесс может сохранить каждый блок, в то время как смысл все равно останется неверным. Используйте реальные образцы перевода, чтобы увидеть, как мы разделяем языковую проверку и проверку макета.
Чек-лист приемки перевода PDF
Блокеры
- Отсутствующий или обрезанный текст
- Неправильный порядок чтения
- Накладывающиеся друг на друга абзацы или метки
- Числа, назначенные не той строке или не тому элементу графика
- Измененные формулы, знаки, единицы измерения или ссылки
- Нечитаемый размер шрифта
- Отсутствие глифов целевого языка
- Нарушенное направление письма и пунктуация в арабском или иврите
- Скрытые предупреждения, подрисуночные подписи или сноски
Серьезные дефекты
- Неуклюжий, но читаемый перенос строк
- Подписи, отделенные от рисунков
- Большое необъяснимое смещение страниц
- Несогласованная обработка заголовков
- Повторяющиеся локальные изменения размера шрифта
- Двуязычные блоки, выровненные не по тому исходному отрывку
Косметические отличия
- Другие окончания строк
- Небольшие изменения пробелов
- Незначительное изменение количества страниц с исправленными ссылками
- Слегка отличающаяся высота строк таблиц при видимости всего содержимого
Для каждой проблемной страницы запишите исходную страницу, тип элемента, симптом, ограничивающее условие, исправление и необходимость проверки двуязычного смысла. Этот контрольный журнал полезнее фразы «форматирование скорректировано».
Рекомендуемый рабочий процесс для большинства PDF
- Сохраните нетронутый исходный PDF.
- Проверьте, выделяются ли текст и ячейки таблиц.
- Запускайте OCR только для содержимого, состоящего из изображений, после чего проверьте ошибки распознавания.
- Загрузите стресс-тест PDF или выберите самую сложную страницу из вашего собственного файла.
- Переведите эту репрезентативную страницу с помощью переводчика PDF.
- Проверьте порядок чтения, таблицы, числа, метки, сноски, шрифты и направление письма до оценки языковой плавности.
- Переводите весь файл только после успешного прохождения проверки репрезентативной страницы.
- Устраняйте локальные ограничения локально; не уменьшайте документ глобально.
- Храните оригинал, переведенный PDF, настройки, глоссарий и заметки о проверке вместе для будущих правок.
Для уравнений, цитат и исследовательских макетов продолжайте работу с рабочим процессом перевода академических статей. Если вы все еще решаете, должен ли оригинал быть в формате PDF или EPUB, используйте руководство по выбору между EPUB и PDF.
Похожие статьи





