Як видобути текст із PDF
Іноді оформлення — саме те, чого вам не потрібно. Подання документа у скрипт, перекладач, пошуковий індекс чи мовну модель працює значно краще, коли на вході чистий текст, а не верстка сторінки з колонками та колонтитулами.
Конвертація PDF у TXT прибирає все, крім слів. Інструкція розбирає видобування, те, як виглядає результат для різних типів документів, і єдиний випадок, коли на виході не буде нічого, — відскановані файли.
Готові спробувати? Відкрийте «PDF у TXT» і отримайте файл за кілька секунд.
Відкрити інструментКоли потрібно видобувати текст із PDF
- Передавання вмісту документа у скрипт, пошуковий індекс чи аналітичний конвеєр.
- Підготовка тексту для перекладача чи мовної моделі, яким заважає верстка.
- Копіювання великих фрагментів із довгого документа без боротьби з виділенням у переглядачі PDF.
Як видобути текст із PDF: покроково
Переконайтеся, що в PDF є справжній текст
Спробуйте виділити речення в переглядачі. Якщо виділяються окремі слова, текстовий шар є і його можна видобути. Якщо не виділяється нічого, файл — скан, і йому потрібен OCR.
Відкрийте інструмент PDF у TXT
Перейдіть на сторінку видобування тексту з PDF. Усе працює в браузері, без встановлення й облікового запису.
Завантажте документ
Перетягніть PDF в область завантаження або оберіть його в діалозі. Файли під паролем потрібно попередньо розблокувати.
Запустіть видобування
Почніть процес і зачекайте. Текстовий шар зчитується з документа й записується у файл простого тексту.
Завантажте та вичистіть результат
Завантажте TXT і відкрийте його в будь-якому редакторі. Повторювані колонтитули, номери сторінок і перенесення наприкінці рядків — звичайні залишки, і пара замін за шаблоном прибирає їх.
Часті проблеми та як їх розв'язати
Файл на виході порожній
У PDF зображення тексту, а не текст — скан чи сфотографований документ. Перетворити пікселі на символи може лише OCR, конвертації формату видобувати нічого.
Текст із колонок перемішано
Порядок читання в багатоколонковій верстці залежить від того, як збирався документ, і колонки можуть чергуватися порядково. Розділити їх у текстовому редакторі зазвичай швидше за будь-який автоматичний спосіб.
Слова розірвано перенесеннями
Перенесення з рядків зберігаються буквально. Заміна «дефіс плюс перенесення рядка» збирає слова назад за одну операцію.
TXT чи Word: яке видобування обрати
Обирайте TXT, коли потрібні лише слова. Це найчистіший вхід для скриптів, індексації, перекладу й аналізу, і він ніколи не тягне зайве оформлення в те, що його оброблятиме.
Обирайте «PDF у Word», коли документ переписуватимуть і публікуватимуть заново. Ця конвертація намагається зберегти заголовки, стилі, таблиці та зображення, даючи те, що можна редагувати, а не просто обробляти. Спитайте себе, хто наступний читач — машина чи людина, — і обирайте відповідно.
Часті запитання
Чому видобутий файл порожній?
PDF — відскановане зображення без текстового шару. Пропустіть його через програму OCR, щоб створити шар, і видобудьте текст після цього.
Чи зберігається оформлення?
Ні, і в цьому сенс. Ви отримуєте символи й перенесення рядків без шрифтів, стилів, колонок і зображень.
У якому кодуванні результат?
UTF-8, тому будь-яка абетка й усі діакритичні знаки зберігаються коректно.
Чи видобуваються зображення й таблиці?
Зображення — ні. Вміст таблиць виходить текстом, але структура рядків і стовпців не зберігається.
Чи можна видобути текст із захищеного PDF?
Спершу зніміть захист інструментом «Зняти пароль з PDF», потім запустіть видобування.
Чи є обмеження на розмір документа?
До 100 МБ на файл, без денного ліміту, без реєстрації та без водяних знаків.
Готові спробувати? Відкрийте «PDF у TXT» і отримайте файл за кілька секунд.
Відкрити інструмент