PDFをTXTに変換する方法

書式こそ要らない、という場面があります。文書をスクリプトや翻訳ツール、検索インデックス、言語モデルに渡すときは、段組みやヘッダー、フッターだらけのページ体裁より、きれいなテキストを入力にしたほうがはるかにうまくいきます。

PDFをTXTに変換すると、言葉以外のすべてがそぎ落とされます。このガイドでは、その取り出し方、文書の種類ごとに出力がどう見えるか、そして何も返ってこない唯一の場合——スキャンしたファイル——を扱います。

すぐ試しますか。PDF から TXTを開けば、数秒でファイルが手に入ります。

ツールを開く

PDFからTXTが必要になる場面

  • 文書の中身を、スクリプトや検索インデックス、解析の工程に流し込むとき。
  • 翻訳ツールや言語モデルのために文章を用意するとき。どちらも体裁の雑音がないほうがよく働きます。
  • 長い文書からまとまった分量を写し取りたいのに、PDFビューアーの選択と格闘したくないとき。

PDFをTXTに変換する手順

  1. PDFに本物の文字があるか確かめる

    PDFビューアーで一文を選択してみてください。単語単位で反転するなら、取り出せる文字の層があります。何も選択できなければ、そのファイルはスキャンで、必要なのはOCRです。

  2. PDF→TXTツールを開く

    PDFをTXTにのページを開きます。取り出しはブラウザーで行われ、インストールもアカウントも要りません。

  3. 文書をアップロードする

    PDFをアップロード領域にドラッグするか、ダイアログから選びます。パスワード付きのファイルは先に解除しておいてください。

  4. 取り出す

    処理を開始し、少し待ちます。文書から文字の層が読み出され、プレーンテキストのファイルに書き出されます。

  5. ダウンロードして整える

    TXTをダウンロードし、好きなエディターで開いてください。繰り返されるヘッダー、ページ番号、行末のハイフンが典型的な残りかすで、検索置換を二度ほどかければ片づきます。

よくあるつまずきと対処

出力ファイルが空になる

そのPDFに入っているのは文字ではなく、文字の画像です——スキャンか、撮影された文書。画素から文字を起こせるのはOCRだけで、形式の変換には取り出す対象がありません。

段組みの文章が入り混じる

多段組みの読み順は文書の作られ方に左右され、段が一行ごとに交互になってしまうことがあります。テキストエディターで段を分けるほうが、たいていどんな自動修正より早く済みます。

単語がハイフンで割れている

行末の分綴はそのまま残ります。ハイフンと改行の並びを検索置換すれば、単語はひと息でつながります。

TXTとWord、どちらの取り出し方を選ぶか

欲しいのが言葉だけなら、TXTを選んでください。スクリプト、索引づくり、翻訳、解析にとって、これ以上ないほどきれいな入力であり、受け取る側に余計な書式を持ち込むこともありません。

文書を書き直して出し直すつもりなら、PDF→Wordを選びます。こちらは見出しやスタイル、表、画像を残そうとするので、処理する材料ではなく編集する材料が手に入ります。次に読むのは機械か人か——そこで決めてください。

よくある質問

取り出したファイルが空なのはなぜですか。

そのPDFが、文字の層を持たないスキャン画像だからです。まずOCRソフトで文字の層を作り、それから取り出してください。

書式は少しでも残りますか。

残りません。そこが狙いです。文字と改行だけが手に入り、フォントもスタイルも段組みも画像もありません。

出力の文字コードは何ですか。

UTF-8です。どの文字体系も、アクセント付きの文字も正しく保たれます。

画像や表も取り出せますか。

画像は取り出せません。表の中身は文字として出てきますが、行と列の構造は保たれません。

保護されたPDFから文字を取り出せますか。

先にPDFのパスワード解除ツールで保護を外し、それから取り出しを実行してください。

文書の大きさに制限はありますか。

1ファイル100 MBまでで、1日あたりの制限も、登録も、透かしもありません。

すぐ試しますか。PDF から TXTを開けば、数秒でファイルが手に入ります。

ツールを開く

関連ガイド

すべてのガイド