PDF — це найпоширеніший формат, який замовники надсилають на переклад, і водночас найскладніший для роботи. Каталог, інструкція, звіт, сертифікат, презентація для інвесторів: усе це найчастіше приходить у бюро перекладів саме у PDF, тому що так файл виглядає однаково на будь-якому пристрої.
Проблема в тому, що PDF створювався як формат кінцевої публікації, а не як робочий файл. Він призначений для перегляду й друку, а не для редагування. Тому переклад PDF — це завжди дві задачі: спершу отримати текст, з яким можна працювати, а вже потім, власне, перекласти й повернути результат у первісному оформленні.
Нижче розбираємо, чому так відбувається, як виглядає коректний процес і що варто надіслати в бюро, щоб не переплачувати.
Чому PDF складно перекласти
Усередині PDF немає тексту в тому вигляді, у якому ми його уявляємо. Там є набір символів із координатами: кожен знак має позицію на сторінці, шрифт і розмір. Файл не знає, що ці символи складаються в речення, а речення в абзаци.
Звідси всі типові складнощі:
- Немає логічної структури. Речення, розбите на дві колонки або перенесене на наступну сторінку, для програми є двома окремими фрагментами.
- Оформлення жорстко зафіксоване. Ширина колонок, розташування підписів, розриви рядків задані намертво. Будь-яка зміна довжини тексту ламає сторінку.
- Шрифти вбудовані частково. Якщо у файл вшито лише латинські символи гарнітури, кирилиця в цьому шрифті просто не відобразиться.
- Частина тексту не є текстом. Написи на схемах, кнопки на скриншотах, підписи на кресленнях і фотографіях — це зображення. Витягнути їх звичайним копіюванням неможливо.
- Файл може бути захищений. Обмеження на копіювання та редагування додають ще один крок перед початком роботи.
Це не проблема конкретного файлу, це властивість формату. Саме тому вартість перекладу PDF майже завжди відрізняється від вартості перекладу того самого тексту у Word.
Два типи PDF: текстовий і сканований
Перед оцінкою замовлення файл потрібно класифікувати. Тип PDF визначає весь подальший процес.
Текстовий PDF створений програмно: експортований із Word, InDesign, Illustrator, з бухгалтерської чи конструкторської системи. Текст усередині є — його можна виділити та скопіювати.
Сканований PDF — це фактично фотографія сторінки, вставлена у файл. Тексту в ньому взагалі немає, є лише зображення. Такими зазвичай приходять архівні документи, підписані договори, сертифікати, паспорти обладнання, медичні висновки.
Змішаний PDF трапляється найчастіше: основний текст — програмний, а окремі сторінки чи вставки — скановані.
Перевірити тип можна за пів хвилини. Відкрийте файл і спробуйте виділити абзац мишею. Якщо виділяється рядок тексту, файл текстовий. Якщо виділяється прямокутник, це скан. Другий спосіб: пошук у документі за допомогою комбінації Ctrl+F. Якщо пошук не знаходить слово, яке ви бачите на екрані, перед вами зображення.
Що відбувається, коли PDF відкривають безпосередньо в CAT-системі
Професійні системи перекладу, зокрема Trados, уміють приймати PDF. Але вони не працюють із ним безпосередньо: файл автоматично конвертується в редаговану версію, найчастіше в DOCX, і вже цей результат надходить перекладачеві.
Якість такої конвертації для простого одноколонкового документа буває цілком прийнятною. Для будь-чого складнішого результат виглядає так:
- речення розриваються на середині там, де в оригіналі був перенос рядка;
- таблиці розсипаються на окремі текстові блоки або перетворюються на набір рамок;
- колонтитули, нумерація і підписи до рисунків потрапляють у текст упереміш з основним змістом;
- багатоколонковий макет читається зигзагом, тому абзаци міняються місцями;
- текст на ілюстраціях не витягується взагалі й залишається мовою оригіналу.
Наслідок не лише косметичний. Розбите на випадкові фрагменти речення погано сегментується, а отже, гірше працюють пам’ять перекладів і перевірка термінології. Якщо документ великий і повторюваний, наприклад серія технічних інструкцій, втрати помітні одразу.
Тому пряма конвертація придатна для ознайомчого перекладу, коли потрібно зрозуміти зміст. Для документа, який піде замовнику, друкареві чи в регуляторний орган, потрібен повноцінний процес підготовки.
Як виглядає коректний процес перекладу PDF
У «Профпереклад» робота з PDF розкладається на сім кроків.
- Аналіз файлу. Визначаємо тип PDF, наявність захисту, кількість сторінок із зображеннями, складність макета. Тут же підраховуємо обсяг: у PDF слова не рахуються коректно, поки файл не перетворено на редагований, тому точний прорахунок можливий лише після цього кроку.
- Розпізнавання тексту для сканів. Для сканованих і змішаних файлів застосовуємо оптичне розпізнавання. Це не автоматична кнопка: розпізнавання дає помилки на схожих символах, плутає кирилицю з латиницею, ламає складні таблиці й багатоколонкові сторінки. Тому результат вичитується та звіряється з оригіналом.
- Підготовка робочого файлу. Відновлюємо структуру: абзаци, заголовки, таблиці, списки, порядок читання. Мета в тому, щоб перекладач бачив цілісні речення, а не уламки рядків.
- Переклад. Файл проходить через систему перекладу з підключеною пам’яттю перекладів і глосарієм замовника. Це забезпечує єдину термінологію в межах документа та між усіма документами проєкту.
- Редагування й перевірка. Двоетапна перевірка за стандартом ISO 17100: редактор звіряє переклад з оригіналом, далі відпрацьовують автоматичні перевірки числових значень, одиниць вимірювання, повноти сегментів.
- Верстка. Перекладений текст повертається в оформлення оригіналу: ті самі шрифти, колонки, підписи, розташування ілюстрацій. Написи всередині зображень перемальовуються окремо. Верстка — це окрема послуга, вона не входить у вартість перекладу.
- Вичитка після верстки. Обов’язковий крок, який часто пропускають. Після переливання тексту в макет з’являються нові помилки: обрізані рядки, некоректні переноси, підписи з’їхали, діакритичні знаки зникли через шрифт. Лінгвіст перевіряє вже готовий макет, а не текстовий файл.
На виході замовник отримує PDF, який виглядає як оригінал, але цільовою мовою.
Чому текст «розповзається» після перекладу
Окремої уваги заслуговує розширення тексту. Переклад з англійської на українську збільшує обсяг приблизно на 10–20 %. Німецька, польська, іспанська дають подібний ефект, іноді сильніший.
У Word це непомітно — документ просто стає довшим. У PDF із фіксованим макетом це проблема: підпис не вміщується під кнопкою, речення вилазить за межі таблиці, сторінка ламається та зміщує всю подальшу нумерацію.
Тому в проєктах, де оформлення критичне, ми враховуємо розширення заздалегідь: узгоджуємо із замовником, чи допустимо змінювати кегль або міжрядковий інтервал, де можна скоротити формулювання, а де текст має лишитися дослівним. Якщо документ піде в друк, ці домовленості краще зафіксувати до початку перекладу, а не після.
Текст усередині зображень, схем і креслень
Написи на ілюстраціях — це найчастіше недооцінена частина замовлення. Позначення на схемі підключення, підписи осей на графіку, кнопки на скриншоті інтерфейсу, попереджувальні написи на кресленні вузла.
Такий текст не витягується автоматично: його потрібно розпізнати або набрати вручну, перекласти й перемалювати на зображенні. Для технічної документації обсяг цієї роботи можна порівняти з обсягом перекладу основного тексту.
Якщо у вас збереглися вихідні файли ілюстрацій, наприклад у форматах Illustrator, Visio або AutoCAD, надішліть їх разом із PDF. Це помітно здешевлює і пришвидшує роботу.
Коли PDF можна взагалі обійти
Найдешевший переклад PDF — це переклад не з PDF.
У більшості випадків PDF з’являється з якогось вихідного файлу: документ зверстано в InDesign, написано у Word, зібрано у FrameMaker, вивантажено із системи документообігу. Якщо цей вихідник знайдеться, ланцюжок скоротиться. Файл InDesign, наприклад, передається на переклад через проміжний формат IDML, а перекладений текст автоматично повертається назад у макет без ручного перенесення абзаців.
Той самий принцип працює ширше. Коли контент живе в системі керування сайтом, у довідковому центрі, у репозиторії розробників або в дизайн-інструменті, автоматизацію забезпечують конектори— спеціальні інтеграції, які самі вивантажують текст у проєкт перекладу й повертають готовий переклад на місце. Ніхто не робить таблицю відповідностей і не переносить рядки вручну, а отже, зникає цілий клас помилок і кілька днів роботи.
PDF у цій схемі — це резервний варіант для випадків, коли вихідника вже немає: документ підписаний, архівний, отриманий від контрагента чи виробника обладнання, який припинив підтримку.
Практичне правило просте: перш ніж надсилати PDF, запитайте в колег, хто робив цей документ, і чи зберігся файл, з якого його експортували.
Що надіслати в бюро перекладів
Щоб отримати точний прорахунок із першого разу, додайте до запиту:
- вихідний файл, якщо він є, а PDF використовуйте лише як зразок оформлення;
- вихідники ілюстрацій і шрифти, якщо документ піде в друк;
- вказівку щодо мовної пари й того, чи потрібна верстка на виході;
- глосарій, попередні переклади або посилання на сайт компанії, щоб зафіксувати термінологію;
- інформацію про призначення документа: внутрішнє користування, друк, подання в державний орган, публікація на сайті. Від цього залежить і глибина перевірки, і вартість.
Типові помилки замовників
Надсилають скан замість вихідника, який лежить у сусідній папці. Найдорожчий і найдовший сценарій, якого в половині випадків можна уникнути.
Роздруковують і сканують електронний документ, щоб «зафіксувати вигляд». Так текстовий PDF перетворюється на зображення, і роботу доводиться починати з розпізнавання.
Пропускають етап вичитки після верстки. Економія на цьому кроці зазвичай призводить до передруку тиражу.
Прогнали PDF через безкоштовний онлайн-перекладач і просять «просто вичитати». Виправлення машинного перекладу з поламаним макетом виходить дорожче, ніж переклад з нуля, а конфіденційні документи в такому сценарії вже опинилися на сторонньому сервері.
Не попереджають про фіксований обсяг. Якщо текст має вміститися в задану кількість сторінок або в поле інтерфейсу, це потрібно сказати відразу.
FAQ
Скільки коштує переклад PDF? Вартість перекладу починається від 0,91 грн за слово для пари англійська – українська. Інші мовні пари тарифікуються дорожче. Ця ціна охоплює переклад і перевірку, але не верстку, розпізнавання сканів чи підготовку файлу. Верстка й DTP розраховуються окремо, залежно від складності макета та кількості ілюстрацій.
Чому не можна одразу назвати ціну, як для документа Word? У PDF слова не можна коректно підрахувати, поки файл не переведено в редагований вигляд. Крім того, вартість залежить від типу файлу: скан і програмно створений PDF потребують різного обсягу підготовки. Ми робимо прорахунок після аналізу файлу, зазвичай у день звернення.
Чи можна перекласти сканований документ? Так. Скани проходять оптичне розпізнавання з подальшою вичиткою. Якість вихідного скана впливає на строки: чіткий скан у 300 dpi обробляється швидше, ніж фотографія сторінки, зроблена телефоном під кутом.
Чи можна отримати результат саме в PDF? Так. Якщо потрібно зберегти оформлення, ми верстаємо переклад під оригінал і віддаємо готовий PDF. Якщо оформлення не критичне, дешевший варіант — це переклад у редагованому файлі без верстки.
Скільки часу займає переклад PDF? Орієнтир для перекладу — від 8 до 10 сторінок на день на одного лінгвіста, плюс час на підготовку файлу й верстку. Для сканованих документів і складних макетів додається 1–2 дні. Точні строки називаємо разом із прорахунком.
Що робити, якщо вихідного файлу немає взагалі? Це звичайна ситуація, і вона повністю робоча. Ми відновлюємо структуру документа з PDF і повертаємо переклад у первісному оформленні. Просто врахуйте, що такий сценарій потребує більше часу, ніж робота з вихідником.
Чи можна автоматизувати переклад документів, що регулярно оновлюються? Так, якщо контент зберігається в системі, до якої можна підключити конектор: у CMS сайту, довідковому центрі, репозиторії або дизайн-інструменті. Тоді нові й змінені фрагменти автоматично передаються на переклад, а готовий текст повертається на місце. Для документів, які існують лише у вигляді PDF, можна автоматизувати підготовку файлів і повторне використання пам’яті перекладів.

15 лет в бизнесе профессиональных переводов. Основатель и директор Бюро переводов Профпереклад.
Ключевые компетенции:
менеджмент, стратегический маркетинг, лингвистические технологии.
Образование:
Киево-Могилянская Бизнес Школа (KMBS) и IE Business School