Перейти к содержимому
myconvert.ru

Конвертер PDF в TXT онлайн

Бесплатно, до 50 файлов сразу, на компьютере и телефоне — без загрузки на сервер

Принимаем PDF — до 50 файлов за раз.

Файлы не загружаются на сервер

PDF в TXT онлайн — сохранить страницы как картинки

Извлечение текста из PDF нужно, когда содержимое требуется не читать, а использовать: перенести в редактор, найти нужный фрагмент, прогнать через поиск, скопировать цитату из большого документа.

Инструмент разбирает документ в браузере и собирает текст постранично, помечая границы страниц. Ни одна страница не передаётся на сервер.

Чего инструмент не делает

Он не распознаёт текст на изображениях. Если PDF — это фотографии или сканы страниц, текстового слоя в нём нет, и никакой разбор его не найдёт. В таком случае инструмент сообщит об этом прямо, а не вернёт пустой файл без объяснений.

Он также не восстанавливает вёрстку: таблицы и колонки в простом тексте неизбежно теряют структуру.

Как пользоваться

  1. 1Добавьте PDF-документ.
  2. 2При необходимости укажите диапазон страниц.
  3. 3Нажмите «Конвертировать».
  4. 4Скачайте текстовый файл — он сохраняется в UTF-8 и открывается в любом редакторе.

PDF и TXT: в чём разница

Таблица помогает понять, что изменится после конвертации и не потеряете ли вы что-то важное.

Сравнение форматов PDF и TXT
ПараметрPDFTXT
Полное названиеPortable Document FormatPlain Text
РазработчикAdobe, с 2008 года открытый стандарт ISO 32000не имеет единого владельца, восходит к таблице ASCII
Год появления19931963
СжатиеС потерями и безБез сжатия
ПрозрачностьДаНет
АнимацияНетНет
Глубина цветазависит от вложенных изображений, поддерживает CMYK и цветовые профилинеприменимо
Поддержка браузерамиВсе браузерыВсе браузеры
Где встречаетсяДоговоры, счета, резюме, сканы документов, инструкции, электронные книгиЗаметки, логи, выгрузки, исходные тексты
Таблица сравнения PDF и TXT: сжатие, прозрачность, анимация, год появления

Частые вопросы

Из любого ли PDF можно извлечь текст?
Нет, только из тех, где есть текстовый слой, — то есть из документов, созданных в редакторе или экспортированных из программы. Если PDF получен сканированием, внутри лежат картинки, и извлекать нечего: инструмент честно сообщит, что текстового слоя нет.
Почему результат пустой, хотя текст на страницах виден?
Значит, это скан. Распознать текст на изображении может только OCR, а этот сервис распознаванием не занимается. Понять, что перед вами скан, просто: попробуйте выделить текст мышью в программе просмотра — если не выделяется, текстового слоя нет.
Сохранится ли форматирование?
Нет, на выходе получается простой текст. Колонки, таблицы, шрифты и выделения не переносятся — многоколоночная вёрстка может перемешаться, потому что в PDF текст хранится фрагментами с координатами, а не связными абзацами.
Как разделены страницы?
Перед каждой страницей ставится строка с её номером. Так проще найти нужное место и сопоставить результат с исходным документом.
Почему файл начинается со странного символа?
Это метка BOM. Она нужна, чтобы Блокнот Windows открыл файл как UTF-8 и не показал кракозябры вместо кириллицы. Большинство редакторов её не отображают.

О форматах

Статьи по теме