Все статьи

PDF на практике

Почему PDF плохо превращается в Word и что с этим делать

От конвертации PDF в Word обычно ждут невозможного: чтобы документ открылся в редакторе ровно таким, каким его видно в просмотрщике. Причина расхождения — в устройстве самого формата, и понимание этого устройства сразу подсказывает, чего ждать и что делать вместо.

3 мин чтения · обновлено 05.08.2026

Коротко

  • PDF хранит расположение символов на странице, а не структуру текста.
  • Абзацы, таблицы и колонки при конвертации восстанавливаются приблизительно.
  • У скана текстового слоя нет вовсе — сначала нужно распознавание.

Что на самом деле лежит внутри PDF

PDF задумывался как формат окончательного вида документа: он описывает, какой глиф и каким шрифтом нарисовать в конкретной точке страницы. Понятий «абзац», «заголовок», «ячейка таблицы» в нём, как правило, нет — есть координаты.

Word устроен наоборот: это структура, из которой вид собирается при отображении. Поэтому конвертация — это не перевод из формата в формат, а обратная реконструкция: по расположению символов алгоритм догадывается, где кончился абзац и начался новый.

Отсюда правило: чем проще вёрстка исходника, тем ближе результат к оригиналу.

Что переносится хорошо, а что нет

Линейный текст — статья, письмо, договор в одну колонку — восстанавливается предсказуемо: текст становится редактируемым, абзацы в основном совпадают.

Сложная вёрстка теряется. Таблицы без видимых границ превращаются в строки текста, две колонки могут склеиться в одну, точное положение картинок сдвигается. Это не дефект конкретного конвертера, а следствие того, что в исходнике этой информации просто нет.

  • Хорошо: сплошной текст, простые списки, единый шрифт.
  • Средне: таблицы с границами, подписи под изображениями, колонтитулы.
  • Плохо: многоколоночная вёрстка, сложные таблицы, текст поверх графики.

Цифровой PDF и скан — разные задачи

Проверить тип файла проще всего попыткой выделить текст. Если выделяется — PDF цифровой, текстовый слой есть, конвертация сработает. Если нет — перед вами картинки страниц, и извлекать в них нечего: конвертер честно вернёт пустой документ или ошибку.

Для скана сначала нужно распознавание текста (OCR): оно строит текстовый слой поверх изображения, и только после этого имеет смысл переводить документ в Word.

Когда Word вообще не нужен

Word запрашивают по привычке, хотя реальная задача часто другая. Если нужно вытащить текст для цитаты, поиска или переноса в другую систему, достаточно извлечь его в TXT: результат чище, потому что алгоритму не приходится придумывать несуществующую структуру.

Если нужно поправить пару строк и отправить документ дальше, иногда быстрее внести правку в исходник, из которого PDF был собран, и экспортировать заново.

Как получить максимум из конвертации

Несколько приёмов заметно повышают качество результата и почти ничего не стоят.

  • Конвертируйте не весь документ, а нужный раздел — извлеките страницы заранее.
  • Уберите декоративные страницы: обложки и разделители сбивают разбор структуры.
  • После конвертации сразу проверьте таблицы — правки там нужны чаще всего.
  • Для точной вёрстки используйте PDF как эталон, а DOCX — как источник текста.

Вопросы и ответы

Почему после конвертации получился пустой документ?

В PDF нет текстового слоя — это скан или фотография страниц. Нужно сначала распознавание текста, обычная конвертация здесь не поможет.

Сохранится ли оформление один в один?

Нет. Текст станет редактируемым, но сложные таблицы, колонки и позиции изображений изменятся: в PDF нет данных о структуре, только о расположении символов.

Что выбрать, если нужен только текст?

Извлечение в TXT. Оно не пытается воссоздать вёрстку и потому даёт более предсказуемый результат, чем DOCX.

Можно ли конвертировать защищённый паролем PDF?

Нет. Защиту нужно снять заранее в программе, где документ открывается с известным вам паролем, и только потом загружать файл.

Читать дальше