Как извлечь текст из PDF
Иногда оформление — именно то, чего вам не нужно. Подача документа в скрипт, переводчик, поисковый индекс или языковую модель работает намного лучше, когда на входе чистый текст, а не вёрстка страницы с колонками и колонтитулами.
Конвертация PDF в TXT убирает всё, кроме слов. Инструкция разбирает извлечение, то, как выглядит результат для разных типов документов, и единственный случай, когда на выходе не будет ничего, — отсканированные файлы.
Готовы попробовать? Откройте «PDF в TXT» и получите файл за несколько секунд.
Открыть инструментКогда нужно извлекать текст из PDF
- Передача содержимого документа в скрипт, поисковый индекс или аналитический конвейер.
- Подготовка текста для переводчика или языковой модели, которым мешает вёрстка.
- Копирование больших фрагментов из длинного документа без борьбы с выделением в просмотрщике PDF.
Как извлечь текст из PDF: пошагово
Убедитесь, что в PDF есть настоящий текст
Попробуйте выделить предложение в просмотрщике. Если выделяются отдельные слова, текстовый слой есть и его можно извлечь. Если не выделяется ничего, файл — скан, и ему нужен OCR.
Откройте инструмент PDF в TXT
Перейдите на страницу извлечения текста из PDF. Всё работает в браузере, без установки и аккаунта.
Загрузите документ
Перетащите PDF в область загрузки или выберите его в диалоге. Файлы под паролем нужно предварительно разблокировать.
Запустите извлечение
Начните процесс и подождите. Текстовый слой считывается из документа и записывается в файл простого текста.
Скачайте и вычистите результат
Скачайте TXT и откройте его в любом редакторе. Повторяющиеся колонтитулы, номера страниц и переносы в конце строк — обычные остатки, и пара замен по шаблону убирает их.
Частые проблемы и как их решить
Файл на выходе пустой
В PDF изображения текста, а не текст — скан или сфотографированный документ. Превратить пиксели в символы может только OCR, конвертации формата извлекать нечего.
Текст из колонок перемешан
Порядок чтения в многоколоночной вёрстке зависит от того, как собирался документ, и колонки могут чередоваться построчно. Разделить их в текстовом редакторе обычно быстрее любого автоматического способа.
Слова разорваны переносами
Переносы со строк сохраняются буквально. Замена «дефис плюс перенос строки» собирает слова обратно за одну операцию.
TXT или Word: какое извлечение выбрать
Выбирайте TXT, когда нужны только слова. Это самый чистый вход для скриптов, индексации, перевода и анализа, и он никогда не тащит лишнее оформление в то, что будет его обрабатывать.
Выбирайте «PDF в Word», когда документ будут переписывать и публиковать заново. Эта конвертация старается сохранить заголовки, стили, таблицы и изображения, давая то, что можно редактировать, а не просто обрабатывать. Спросите себя, кто следующий читатель — машина или человек, — и выбирайте соответственно.
Частые вопросы
Почему извлечённый файл пустой?
PDF — отсканированное изображение без текстового слоя. Пропустите его через программу OCR, чтобы создать слой, и извлеките текст после этого.
Сохраняется ли оформление?
Нет, и в этом смысл. Вы получаете символы и переносы строк без шрифтов, стилей, колонок и изображений.
В какой кодировке результат?
UTF-8, поэтому любой алфавит и все диакритические знаки сохраняются корректно.
Извлекаются ли изображения и таблицы?
Изображения — нет. Содержимое таблиц выходит текстом, но структура строк и столбцов не сохраняется.
Можно извлечь текст из защищённого PDF?
Сначала снимите защиту инструментом «Снять пароль с PDF», затем запустите извлечение.
Есть ли ограничение на размер документа?
До 100 МБ на файл, без дневного лимита, без регистрации и без водяных знаков.
Готовы попробовать? Откройте «PDF в TXT» и получите файл за несколько секунд.
Открыть инструмент