如何把 PDF 转成 TXT

有时候,排版恰恰是你不想要的东西。把文档喂给脚本、翻译工具、检索索引或语言模型时,输入是干净的文字,会比一份塞满分栏、页眉页脚的页面排版好用得多。

把 PDF 转成 TXT,就是把词句之外的一切都剥掉。本指南讲这次提取怎么做、不同类型的文档得到的结果长什么样,以及唯一什么都提不出来的情形——扫描件。

想现在就试?打开 PDF 转 TXT,几秒钟就能拿到文件。

打开工具

什么时候需要把 PDF 转成 TXT

  • 把文档内容送进脚本、检索索引或分析流程。
  • 为翻译工具或语言模型准备文字,它们在没有排版噪音时表现最好。
  • 从长文档里成段地抄内容,又不想跟 PDF 阅读器的选中功能较劲。

把 PDF 转成 TXT 的步骤

  1. 先确认这份 PDF 里有真正的文字

    在 PDF 阅读器里试着选中一句话。如果选中时是一个个词被高亮,说明有可提取的文字层。如果什么都选不中,那这份文件是扫描件,需要的是 OCR。

  2. 打开“PDF 转 TXT”工具

    进入 PDF 转 TXT 页面。提取在浏览器里进行,不用安装,也不用账号。

  3. 上传文档

    把 PDF 拖到上传区,或者从对话框里选。设了密码的文件要先解开。

  4. 提取

    启动处理,稍等片刻。文字层会从文档里被读出来,写进一个纯文本文件。

  5. 下载并收拾一下

    下载 TXT,用任意编辑器打开。重复出现的页眉、页码,以及行末的连字符断词,是常见的残留,做两遍查找替换就能清掉。

常见问题及解决办法

输出文件是空的

这份 PDF 里装的是文字的图片,不是文字——扫描件,或者拍照拍下来的文档。只有 OCR 才能从像素里造出字符;格式转换根本无从提取。

分栏的文字串在了一起

多栏排版里的阅读顺序取决于文档当初是怎么做的,栏与栏可能变成一行一行交替出现。在文本编辑器里把栏拆开,通常比任何自动修复都快。

单词被连字符断开了

行末断词会被原样保留。对“连字符加换行”做一次查找替换,就能一次性把词拼回去。

该提成 TXT 还是转成 Word

只要词句本身,就选 TXT。对脚本、建索引、翻译和分析来说,这是能得到的最干净的输入,也绝不会把多余的排版带进下游。

如果打算重写并重新发布这份文档,就选“PDF 转 Word”。那次转换会尽力保住标题、样式、表格和图片,给你的是可以编辑的东西,而不是拿来处理的数据。问问自己:下一位读者是机器还是人——照着答案选就行。

常见问题

为什么提取出来的文件是空的?

这份 PDF 是没有文字层的扫描图像。先用 OCR 软件造一个文字层,再来提取。

会保留一点排版吗?

不会,而这正是重点。你拿到的是字符和换行,没有字体、样式、分栏或图片。

输出用的是什么编码?

UTF-8,因此任何文字体系和带音标的字符都能正确保留。

图片和表格会被提取出来吗?

图片不会。表格里的内容会以文字形式出来,但行列结构不会保留。

能从受保护的 PDF 里提取文字吗?

请先用“解除 PDF 密码”工具去掉保护,再运行提取。

文档大小有限制吗?

每个文件最大 100 MB,没有每日限制,不用注册,也不加水印。

想现在就试?打开 PDF 转 TXT,几秒钟就能拿到文件。

打开工具

相关指南

全部指南