ru

Перевод PDF: как перевести документ и сохранить оформление

PDF это самый распространённый формат, который заказчики присылают на перевод, и одновременно самый сложный для работы. Каталог, инструкция, отчёт, сертификат, презентация для инвесторов: всё это чаще всего приходит в бюро переводов именно в PDF, потому что так файл выглядит одинаково на любом устройстве.

Проблема в том, что PDF создавался как формат конечной публикации, а не как рабочий файл. Он предназначен для просмотра и печати, а не для редактирования. Поэтому перевод PDF это всегда две задачи: сначала получить текст, с которым можно работать, а уже потом собственно перевести и вернуть результат в первоначальном оформлении.

Ниже разбираем, почему так происходит, как выглядит корректный процесс и что стоит прислать в бюро, чтобы не переплачивать.

Почему PDF сложно перевести

Внутри PDF нет текста в том виде, в котором мы его представляем. Там есть набор символов с координатами: каждый знак имеет позицию на странице, шрифт и размер. Файл не знает, что эти символы складываются в предложения, а предложения в абзацы.

Отсюда все типичные сложности:

  • Нет логической структуры. Предложение, разбитое на две колонки или перенесённое на следующую страницу, для программы это два отдельных фрагмента.
  • Оформление жёстко зафиксировано. Ширина колонок, расположение подписей, разрывы строк заданы намертво. Любое изменение длины текста ломает страницу.
  • Шрифты встроены частично. Если в файл зашиты только латинские символы гарнитуры, кириллица в этом шрифте просто не отобразится.
  • Часть текста не является текстом. Надписи на схемах, кнопки на скриншотах, подписи на чертежах и фотографиях это изображения. Извлечь их обычным копированием невозможно.
  • Файл может быть защищён. Ограничения на копирование и редактирование добавляют ещё один шаг перед началом работы.

Это не проблема конкретного файла, это свойство формата. И именно поэтому стоимость перевода PDF почти всегда отличается от стоимости перевода того же текста в Word.

Два типа PDF: текстовый и сканированный

Перед оценкой заказа файл нужно классифицировать. Тип PDF определяет весь дальнейший процесс.

Текстовый PDF создан программно: экспортирован из Word, InDesign, Illustrator, из бухгалтерской или конструкторской системы. Текст внутри есть, его можно выделить и скопировать.

Сканированный PDF это фактически фотография страницы, вставленная в файл. Текста в нём нет вообще, есть только изображение. Такими обычно приходят архивные документы, подписанные договоры, сертификаты, паспорта оборудования, медицинские заключения.

Смешанный PDF встречается чаще всего: основной текст программный, а отдельные страницы или вставки сканированные.

Проверить тип можно за полминуты. Откройте файл и попробуйте выделить абзац мышью. Если выделяется строка текста, файл текстовый. Если выделяется прямоугольник, это скан. Второй способ: поиск по документу сочетанием Ctrl+F. Если поиск не находит слово, которое вы видите на экране, перед вами изображение.

Что происходит, когда PDF открывают напрямую в CAT-системе

Профессиональные системы перевода, в частности Trados, умеют принимать PDF. Но они не работают с ним непосредственно: файл автоматически конвертируется в редактируемый формат, чаще всего в DOCX, и уже этот результат поступает переводчику.

Качество такой конвертации для простого одноколоночного документа бывает вполне приемлемым. Для чего-либо сложнее результат выглядит так:

  • предложения разрываются на середине там, где в оригинале был перенос строки;
  • таблицы рассыпаются на отдельные текстовые блоки или превращаются в набор рамок;
  • колонтитулы, нумерация и подписи к рисункам попадают в текст вперемешку с основным содержанием;
  • многоколоночный макет читается зигзагом, поэтому абзацы меняются местами;
  • текст на иллюстрациях не извлекается вообще и остаётся на языке оригинала.

Следствие не только косметическое. Разбитое на случайные фрагменты предложение плохо сегментируется, а значит хуже работает память переводов и проверка терминологии. Если документ большой и повторяющийся, например серия технических инструкций, потери заметны сразу.

Поэтому прямая конвертация пригодна для ознакомительного перевода, когда нужно понять содержание. Для документа, который пойдёт заказчику, в типографию или в регуляторный орган, нужен полноценный процесс подготовки.

Как выглядит корректный процесс перевода PDF

В Профпереклад работа с PDF раскладывается на семь шагов.

1. Анализ файла. Определяем тип PDF, наличие защиты, количество страниц с изображениями, сложность макета. Здесь же подсчитываем объём: в PDF слова не считаются корректно, пока файл не переведён в редактируемый вид, поэтому точный расчёт возможен только после этого шага.

2. Распознавание текста для сканов. Для сканированных и смешанных файлов применяем оптическое распознавание. Это не автоматическая кнопка: распознавание даёт ошибки на похожих символах, путает кириллицу с латиницей, ломает сложные таблицы и многоколоночные страницы. Поэтому результат вычитывается и сверяется с оригиналом.

3. Подготовка рабочего файла. Восстанавливаем структуру: абзацы, заголовки, таблицы, списки, порядок чтения. Цель в том, чтобы переводчик видел целостные предложения, а не обломки строк.

4. Перевод. Файл проходит через систему перевода с подключённой памятью переводов и глоссарием заказчика. Это обеспечивает единую терминологию в пределах документа и между всеми документами проекта.

5. Редактирование и проверка. Двухэтапная проверка по стандарту ISO 17100: редактор сверяет перевод с оригиналом, дальше отрабатывают автоматические проверки числовых значений, единиц измерения, полноты сегментов.

6. Вёрстка. Переведённый текст возвращается в оформление оригинала: те же шрифты, колонки, подписи, расположение иллюстраций. Надписи внутри изображений перерисовываются отдельно. Вёрстка это отдельная услуга, она не входит в стоимость перевода.

7. Вычитка после вёрстки. Обязательный шаг, который часто пропускают. После переливания текста в макет появляются новые ошибки: обрезанные строки, некорректные переносы, съехавшие подписи, исчезнувшие диакритические знаки из-за шрифта. Лингвист проверяет уже готовый макет, а не текстовый файл.

На выходе заказчик получает PDF, который выглядит как оригинал, но на целевом языке.

Почему текст «расползается» после перевода

Отдельного внимания заслуживает расширение текста. Перевод с английского на украинский увеличивает объём примерно на 10 до 20 процентов. Немецкий, польский, испанский дают похожий эффект, иногда сильнее.

В Word это незаметно, документ просто становится длиннее. В PDF с фиксированным макетом это проблема: подпись не помещается под кнопкой, предложение вылезает за пределы таблицы, страница ломается и смещает всю дальнейшую нумерацию.

Поэтому в проектах, где оформление критично, мы учитываем расширение заранее: согласовываем с заказчиком, что допустимо менять кегль или межстрочный интервал, где можно сократить формулировки, а где текст должен остаться дословным. Если документ пойдёт в печать, эти договорённости лучше зафиксировать до начала перевода, а не после.

Текст внутри изображений, схем и чертежей

Надписи на иллюстрациях это чаще всего недооценённая часть заказа. Обозначения на схеме подключения, подписи осей на графике, кнопки на скриншоте интерфейса, предупреждающие надписи на чертеже узла.

Такой текст не извлекается автоматически, его нужно распознать или набрать вручную, перевести и перерисовать в изображении. Для технической документации объём этой работы бывает сопоставим с переводом основного текста.

Если у вас сохранились исходные файлы иллюстраций, например в форматах Illustrator, Visio или AutoCAD, пришлите их вместе с PDF. Это заметно удешевляет и ускоряет работу.

Когда PDF можно вообще обойти

Самый дешёвый перевод PDF это перевод не из PDF.

В большинстве случаев PDF появился из какого-то исходного файла: документ свёрстан в InDesign, написан в Word, собран во FrameMaker, выгружен из системы документооборота. Если этот исходник найдётся, цепочка сокращается. Файл InDesign, например, передаётся на перевод через промежуточный формат IDML, а переведённый текст возвращается назад в макет автоматически, без ручного переноса абзацев.

Тот же принцип работает шире. Когда контент живёт в системе управления сайтом, в справочном центре, в репозитории разработчиков или в дизайн-инструменте, автоматизацию обеспечивают коннекторы: специальные интеграции, которые сами выгружают текст в проект перевода и возвращают готовый перевод на место. Никто не делает таблицу соответствий и не переносит строки вручную, а значит исчезает целый класс ошибок и несколько дней работы.

PDF в этой схеме это резервный вариант для случаев, когда исходника уже нет: документ подписан, архивный, получен от контрагента или от производителя оборудования, который прекратил поддержку.

Практическое правило простое: прежде чем присылать PDF, спросите у коллег, кто делал этот документ, и сохранился ли файл, из которого его экспортировали.

Что прислать в бюро переводов

Чтобы получить точный расчёт с первого раза, добавьте к запросу:

  • исходный файл, если он есть, а PDF только как образец оформления;
  • исходники иллюстраций и шрифты, если документ пойдёт в печать;
  • указание языковой пары и того, нужна ли вёрстка на выходе;
  • глоссарий, предыдущие переводы или ссылку на сайт компании, чтобы зафиксировать терминологию;
  • информацию о назначении документа: внутреннее пользование, печать, подача в государственный орган, публикация на сайте. От этого зависит и глубина проверки, и стоимость.

Типичные ошибки заказчиков

Присылают скан вместо исходника, который лежит в соседней папке. Самый дорогой и самый долгий сценарий, которого в половине случаев можно избежать.

Распечатывают и сканируют электронный документ, чтобы «зафиксировать вид». Так текстовый PDF превращается в изображение, и работу приходится начинать с распознавания.

Пропускают этап вычитки после вёрстки. Экономия на этом шаге обычно оборачивается перепечаткой тиража.

Прогнали PDF через бесплатный онлайн-переводчик и просят «просто вычитать». Исправление машинного перевода с поломанным макетом выходит дороже, чем перевод с нуля, а конфиденциальные документы в таком сценарии уже оказались на стороннем сервере.

Не предупреждают о фиксированном объёме. Если текст должен уместиться в заданное количество страниц или в поле интерфейса, это нужно сказать сразу.

FAQ

Сколько стоит перевод PDF? Стоимость перевода начинается от 0,91 грн за слово для пары английский и украинский. Другие языковые пары тарифицируются дороже. Эта цена включает перевод и проверку, но не включает вёрстку, распознавание сканов и подготовку файла. Вёрстка и DTP рассчитываются отдельно, в зависимости от сложности макета и количества иллюстраций.

Почему нельзя назвать цену сразу, как для документа Word? В PDF слова не поддаются корректному подсчёту, пока файл не переведён в редактируемый вид. Кроме того, стоимость зависит от типа файла: скан и программно созданный PDF требуют разного объёма подготовки. Мы делаем расчёт после анализа файла, обычно в день обращения.

Можно ли перевести сканированный документ? Да. Сканы проходят оптическое распознавание с последующей вычиткой. Качество исходного скана влияет на сроки: чёткий скан в 300 dpi обрабатывается быстрее, чем фотография страницы, сделанная телефоном под углом.

Можно ли получить результат именно в PDF? Да. Если нужно сохранение оформления, мы вёрстаем перевод под оригинал и отдаём готовый PDF. Если оформление не критично, более дешёвый вариант это перевод в редактируемом файле без вёрстки.

Сколько времени занимает перевод PDF? Ориентир для перевода это около 8 до 10 страниц в день на одного лингвиста, плюс время на подготовку файла и вёрстку. Для сканированных документов и сложных макетов добавляется один или два дня. Точные сроки называем вместе с расчётом.

Что делать, если исходного файла нет вообще? Это обычная ситуация, и она полностью рабочая. Мы восстанавливаем структуру документа из PDF и возвращаем перевод в первоначальном оформлении. Просто учтите, что такой сценарий требует больше времени, чем работа с исходником.

Можно ли автоматизировать перевод документов, которые обновляются регулярно? Да, если контент хранится в системе, к которой можно подключить коннектор: в CMS сайта, справочном центре, репозитории или дизайн-инструменте. Тогда новые и изменённые фрагменты передаются на перевод автоматически, а готовый текст возвращается на место. Для документов, которые существуют только в виде PDF, автоматизировать можно подготовку файлов и повторное использование памяти переводов.

SEO title: 

SEO description: 

Цверкун Юрий
Автор статьи:

Юрий Цверкун

15 лет в бизнесе профессиональных переводов. Основатель и директор Бюро переводов Профпереклад. Ключевые компетенции: менеджмент, стратегический маркетинг, лингвистические технологии. Образование: Киево-Могилянская Бизнес Школа (KMBS) и IE Business School

Узнать стоимость
Заполните форму и прикрепите документ, и мы сообщим точную стоимость всей работы на email
Прикрепите документ для оценки стоимости перевода
Контакты
Вы также можете связаться с нашим офисом в Киеве любым удобным способом, и мы ответим на все вопросы.
Украина, 03150,
г. Киев, ул. Деловая, 5Б, 6-й этаж
Понедельник – Пятница с 9:00 до 18:00