PDFをTXTに変換する方法
書式こそ要らない、という場面があります。文書をスクリプトや翻訳ツール、検索インデックス、言語モデルに渡すときは、段組みやヘッダー、フッターだらけのページ体裁より、きれいなテキストを入力にしたほうがはるかにうまくいきます。
PDFをTXTに変換すると、言葉以外のすべてがそぎ落とされます。このガイドでは、その取り出し方、文書の種類ごとに出力がどう見えるか、そして何も返ってこない唯一の場合——スキャンしたファイル——を扱います。
すぐ試しますか。PDF から TXTを開けば、数秒でファイルが手に入ります。
ツールを開くPDFからTXTが必要になる場面
- 文書の中身を、スクリプトや検索インデックス、解析の工程に流し込むとき。
- 翻訳ツールや言語モデルのために文章を用意するとき。どちらも体裁の雑音がないほうがよく働きます。
- 長い文書からまとまった分量を写し取りたいのに、PDFビューアーの選択と格闘したくないとき。
PDFをTXTに変換する手順
PDFに本物の文字があるか確かめる
PDFビューアーで一文を選択してみてください。単語単位で反転するなら、取り出せる文字の層があります。何も選択できなければ、そのファイルはスキャンで、必要なのはOCRです。
PDF→TXTツールを開く
PDFをTXTにのページを開きます。取り出しはブラウザーで行われ、インストールもアカウントも要りません。
文書をアップロードする
PDFをアップロード領域にドラッグするか、ダイアログから選びます。パスワード付きのファイルは先に解除しておいてください。
取り出す
処理を開始し、少し待ちます。文書から文字の層が読み出され、プレーンテキストのファイルに書き出されます。
ダウンロードして整える
TXTをダウンロードし、好きなエディターで開いてください。繰り返されるヘッダー、ページ番号、行末のハイフンが典型的な残りかすで、検索置換を二度ほどかければ片づきます。
よくあるつまずきと対処
出力ファイルが空になる
そのPDFに入っているのは文字ではなく、文字の画像です——スキャンか、撮影された文書。画素から文字を起こせるのはOCRだけで、形式の変換には取り出す対象がありません。
段組みの文章が入り混じる
多段組みの読み順は文書の作られ方に左右され、段が一行ごとに交互になってしまうことがあります。テキストエディターで段を分けるほうが、たいていどんな自動修正より早く済みます。
単語がハイフンで割れている
行末の分綴はそのまま残ります。ハイフンと改行の並びを検索置換すれば、単語はひと息でつながります。
TXTとWord、どちらの取り出し方を選ぶか
欲しいのが言葉だけなら、TXTを選んでください。スクリプト、索引づくり、翻訳、解析にとって、これ以上ないほどきれいな入力であり、受け取る側に余計な書式を持ち込むこともありません。
文書を書き直して出し直すつもりなら、PDF→Wordを選びます。こちらは見出しやスタイル、表、画像を残そうとするので、処理する材料ではなく編集する材料が手に入ります。次に読むのは機械か人か——そこで決めてください。
よくある質問
取り出したファイルが空なのはなぜですか。
そのPDFが、文字の層を持たないスキャン画像だからです。まずOCRソフトで文字の層を作り、それから取り出してください。
書式は少しでも残りますか。
残りません。そこが狙いです。文字と改行だけが手に入り、フォントもスタイルも段組みも画像もありません。
出力の文字コードは何ですか。
UTF-8です。どの文字体系も、アクセント付きの文字も正しく保たれます。
画像や表も取り出せますか。
画像は取り出せません。表の中身は文字として出てきますが、行と列の構造は保たれません。
保護されたPDFから文字を取り出せますか。
先にPDFのパスワード解除ツールで保護を外し、それから取り出しを実行してください。
文書の大きさに制限はありますか。
1ファイル100 MBまでで、1日あたりの制限も、登録も、透かしもありません。
すぐ試しますか。PDF から TXTを開けば、数秒でファイルが手に入ります。
ツールを開く