Коротко
- PDF хранит расположение символов на странице, а не структуру текста.
- Абзацы, таблицы и колонки при конвертации восстанавливаются приблизительно.
- У скана текстового слоя нет вовсе — сначала нужно распознавание.
Что на самом деле лежит внутри PDF
PDF задумывался как формат окончательного вида документа: он описывает, какой глиф и каким шрифтом нарисовать в конкретной точке страницы. Понятий «абзац», «заголовок», «ячейка таблицы» в нём, как правило, нет — есть координаты.
Word устроен наоборот: это структура, из которой вид собирается при отображении. Поэтому конвертация — это не перевод из формата в формат, а обратная реконструкция: по расположению символов алгоритм догадывается, где кончился абзац и начался новый.
Отсюда правило: чем проще вёрстка исходника, тем ближе результат к оригиналу.
Что переносится хорошо, а что нет
Линейный текст — статья, письмо, договор в одну колонку — восстанавливается предсказуемо: текст становится редактируемым, абзацы в основном совпадают.
Сложная вёрстка теряется. Таблицы без видимых границ превращаются в строки текста, две колонки могут склеиться в одну, точное положение картинок сдвигается. Это не дефект конкретного конвертера, а следствие того, что в исходнике этой информации просто нет.
- Хорошо: сплошной текст, простые списки, единый шрифт.
- Средне: таблицы с границами, подписи под изображениями, колонтитулы.
- Плохо: многоколоночная вёрстка, сложные таблицы, текст поверх графики.
Цифровой PDF и скан — разные задачи
Проверить тип файла проще всего попыткой выделить текст. Если выделяется — PDF цифровой, текстовый слой есть, конвертация сработает. Если нет — перед вами картинки страниц, и извлекать в них нечего: конвертер честно вернёт пустой документ или ошибку.
Для скана сначала нужно распознавание текста (OCR): оно строит текстовый слой поверх изображения, и только после этого имеет смысл переводить документ в Word.
Когда Word вообще не нужен
Word запрашивают по привычке, хотя реальная задача часто другая. Если нужно вытащить текст для цитаты, поиска или переноса в другую систему, достаточно извлечь его в TXT: результат чище, потому что алгоритму не приходится придумывать несуществующую структуру.
Если нужно поправить пару строк и отправить документ дальше, иногда быстрее внести правку в исходник, из которого PDF был собран, и экспортировать заново.
Как получить максимум из конвертации
Несколько приёмов заметно повышают качество результата и почти ничего не стоят.
- Конвертируйте не весь документ, а нужный раздел — извлеките страницы заранее.
- Уберите декоративные страницы: обложки и разделители сбивают разбор структуры.
- После конвертации сразу проверьте таблицы — правки там нужны чаще всего.
- Для точной вёрстки используйте PDF как эталон, а DOCX — как источник текста.
Вопросы и ответы
Почему после конвертации получился пустой документ?
В PDF нет текстового слоя — это скан или фотография страниц. Нужно сначала распознавание текста, обычная конвертация здесь не поможет.
Сохранится ли оформление один в один?
Нет. Текст станет редактируемым, но сложные таблицы, колонки и позиции изображений изменятся: в PDF нет данных о структуре, только о расположении символов.
Что выбрать, если нужен только текст?
Извлечение в TXT. Оно не пытается воссоздать вёрстку и потому даёт более предсказуемый результат, чем DOCX.
Можно ли конвертировать защищённый паролем PDF?
Нет. Защиту нужно снять заранее в программе, где документ открывается с известным вам паролем, и только потом загружать файл.
Читать дальше
Страницы PDF: удалить, извлечь, разделить, повернуть
Четыре операции над страницами PDF и разница между ними: когда нужно удаление, когда извлечение, когда разделение на части, а когда достаточно поворота.
Как собрать один PDF из фотографий, сканов и офисных файлов
Пошаговый порядок сборки пакета документов: приведение разных источников к PDF, объединение, проверка порядка страниц и нумерация.
Как уменьшить размер PDF: что реально работает
Разбор причин, из-за которых PDF весит десятки мегабайт, и четыре рабочих способа его ужать — от пересжатия картинок до разделения документа на части.