Як видобути текст із PDF

Іноді оформлення — саме те, чого вам не потрібно. Подання документа у скрипт, перекладач, пошуковий індекс чи мовну модель працює значно краще, коли на вході чистий текст, а не верстка сторінки з колонками та колонтитулами.

Конвертація PDF у TXT прибирає все, крім слів. Інструкція розбирає видобування, те, як виглядає результат для різних типів документів, і єдиний випадок, коли на виході не буде нічого, — відскановані файли.

Готові спробувати? Відкрийте «PDF у TXT» і отримайте файл за кілька секунд.

Відкрити інструмент

Коли потрібно видобувати текст із PDF

  • Передавання вмісту документа у скрипт, пошуковий індекс чи аналітичний конвеєр.
  • Підготовка тексту для перекладача чи мовної моделі, яким заважає верстка.
  • Копіювання великих фрагментів із довгого документа без боротьби з виділенням у переглядачі PDF.

Як видобути текст із PDF: покроково

  1. Переконайтеся, що в PDF є справжній текст

    Спробуйте виділити речення в переглядачі. Якщо виділяються окремі слова, текстовий шар є і його можна видобути. Якщо не виділяється нічого, файл — скан, і йому потрібен OCR.

  2. Відкрийте інструмент PDF у TXT

    Перейдіть на сторінку видобування тексту з PDF. Усе працює в браузері, без встановлення й облікового запису.

  3. Завантажте документ

    Перетягніть PDF в область завантаження або оберіть його в діалозі. Файли під паролем потрібно попередньо розблокувати.

  4. Запустіть видобування

    Почніть процес і зачекайте. Текстовий шар зчитується з документа й записується у файл простого тексту.

  5. Завантажте та вичистіть результат

    Завантажте TXT і відкрийте його в будь-якому редакторі. Повторювані колонтитули, номери сторінок і перенесення наприкінці рядків — звичайні залишки, і пара замін за шаблоном прибирає їх.

Часті проблеми та як їх розв'язати

Файл на виході порожній

У PDF зображення тексту, а не текст — скан чи сфотографований документ. Перетворити пікселі на символи може лише OCR, конвертації формату видобувати нічого.

Текст із колонок перемішано

Порядок читання в багатоколонковій верстці залежить від того, як збирався документ, і колонки можуть чергуватися порядково. Розділити їх у текстовому редакторі зазвичай швидше за будь-який автоматичний спосіб.

Слова розірвано перенесеннями

Перенесення з рядків зберігаються буквально. Заміна «дефіс плюс перенесення рядка» збирає слова назад за одну операцію.

TXT чи Word: яке видобування обрати

Обирайте TXT, коли потрібні лише слова. Це найчистіший вхід для скриптів, індексації, перекладу й аналізу, і він ніколи не тягне зайве оформлення в те, що його оброблятиме.

Обирайте «PDF у Word», коли документ переписуватимуть і публікуватимуть заново. Ця конвертація намагається зберегти заголовки, стилі, таблиці та зображення, даючи те, що можна редагувати, а не просто обробляти. Спитайте себе, хто наступний читач — машина чи людина, — і обирайте відповідно.

Часті запитання

Чому видобутий файл порожній?

PDF — відскановане зображення без текстового шару. Пропустіть його через програму OCR, щоб створити шар, і видобудьте текст після цього.

Чи зберігається оформлення?

Ні, і в цьому сенс. Ви отримуєте символи й перенесення рядків без шрифтів, стилів, колонок і зображень.

У якому кодуванні результат?

UTF-8, тому будь-яка абетка й усі діакритичні знаки зберігаються коректно.

Чи видобуваються зображення й таблиці?

Зображення — ні. Вміст таблиць виходить текстом, але структура рядків і стовпців не зберігається.

Чи можна видобути текст із захищеного PDF?

Спершу зніміть захист інструментом «Зняти пароль з PDF», потім запустіть видобування.

Чи є обмеження на розмір документа?

До 100 МБ на файл, без денного ліміту, без реєстрації та без водяних знаків.

Готові спробувати? Відкрийте «PDF у TXT» і отримайте файл за кілька секунд.

Відкрити інструмент

Схожі інструкції

Усі інструкції

TOOLS