Как извлечь текст из PDF

Иногда оформление — именно то, чего вам не нужно. Подача документа в скрипт, переводчик, поисковый индекс или языковую модель работает намного лучше, когда на входе чистый текст, а не вёрстка страницы с колонками и колонтитулами.

Конвертация PDF в TXT убирает всё, кроме слов. Инструкция разбирает извлечение, то, как выглядит результат для разных типов документов, и единственный случай, когда на выходе не будет ничего, — отсканированные файлы.

Готовы попробовать? Откройте «PDF в TXT» и получите файл за несколько секунд.

Открыть инструмент

Когда нужно извлекать текст из PDF

  • Передача содержимого документа в скрипт, поисковый индекс или аналитический конвейер.
  • Подготовка текста для переводчика или языковой модели, которым мешает вёрстка.
  • Копирование больших фрагментов из длинного документа без борьбы с выделением в просмотрщике PDF.

Как извлечь текст из PDF: пошагово

  1. Убедитесь, что в PDF есть настоящий текст

    Попробуйте выделить предложение в просмотрщике. Если выделяются отдельные слова, текстовый слой есть и его можно извлечь. Если не выделяется ничего, файл — скан, и ему нужен OCR.

  2. Откройте инструмент PDF в TXT

    Перейдите на страницу извлечения текста из PDF. Всё работает в браузере, без установки и аккаунта.

  3. Загрузите документ

    Перетащите PDF в область загрузки или выберите его в диалоге. Файлы под паролем нужно предварительно разблокировать.

  4. Запустите извлечение

    Начните процесс и подождите. Текстовый слой считывается из документа и записывается в файл простого текста.

  5. Скачайте и вычистите результат

    Скачайте TXT и откройте его в любом редакторе. Повторяющиеся колонтитулы, номера страниц и переносы в конце строк — обычные остатки, и пара замен по шаблону убирает их.

Частые проблемы и как их решить

Файл на выходе пустой

В PDF изображения текста, а не текст — скан или сфотографированный документ. Превратить пиксели в символы может только OCR, конвертации формата извлекать нечего.

Текст из колонок перемешан

Порядок чтения в многоколоночной вёрстке зависит от того, как собирался документ, и колонки могут чередоваться построчно. Разделить их в текстовом редакторе обычно быстрее любого автоматического способа.

Слова разорваны переносами

Переносы со строк сохраняются буквально. Замена «дефис плюс перенос строки» собирает слова обратно за одну операцию.

TXT или Word: какое извлечение выбрать

Выбирайте TXT, когда нужны только слова. Это самый чистый вход для скриптов, индексации, перевода и анализа, и он никогда не тащит лишнее оформление в то, что будет его обрабатывать.

Выбирайте «PDF в Word», когда документ будут переписывать и публиковать заново. Эта конвертация старается сохранить заголовки, стили, таблицы и изображения, давая то, что можно редактировать, а не просто обрабатывать. Спросите себя, кто следующий читатель — машина или человек, — и выбирайте соответственно.

Частые вопросы

Почему извлечённый файл пустой?

PDF — отсканированное изображение без текстового слоя. Пропустите его через программу OCR, чтобы создать слой, и извлеките текст после этого.

Сохраняется ли оформление?

Нет, и в этом смысл. Вы получаете символы и переносы строк без шрифтов, стилей, колонок и изображений.

В какой кодировке результат?

UTF-8, поэтому любой алфавит и все диакритические знаки сохраняются корректно.

Извлекаются ли изображения и таблицы?

Изображения — нет. Содержимое таблиц выходит текстом, но структура строк и столбцов не сохраняется.

Можно извлечь текст из защищённого PDF?

Сначала снимите защиту инструментом «Снять пароль с PDF», затем запустите извлечение.

Есть ли ограничение на размер документа?

До 100 МБ на файл, без дневного лимита, без регистрации и без водяных знаков.

Готовы попробовать? Откройте «PDF в TXT» и получите файл за несколько секунд.

Открыть инструмент

Похожие инструкции

Все инструкции

ФУНКЦИИ