PDF 转 TXT — 从 PDF 文件中提取文本
从 PDF 文件提取文本到纯文本。无上传,完全在浏览器中运行。
● 本地运行 · 文档永不离开设备页面加载以来工具发出的网络请求:0 次
PDF to TXT
Extract text from PDF files. Works entirely in your browser — no uploads, no limits.
将您的 PDF 文件拖到此处
或点击浏览(最大 50MB)
从 PDF 提取文本是那种听起来比实际更简单的操作之一。PDF 以带坐标的字形存储文本 —— 每个字符被绘制在页面的特定位置,而阅读顺序取决于字形在流中出现的顺序,这个顺序未必符合人类的阅读方式。工具读取 PDF 内置的文本层,按空间排列把字形分组成单词和行,并输出一份尽力而为的纯文本渲染。对于单栏文档(书籍、报告、法律文书),输出几乎与原文一致。对于多栏版式、表格以及含浮动元素的文档,文本顺序需要人工复核。
广告
使用方法
拖入你的 PDF
把 PDF 拖入拖放区。工具会从每一页提取文本层,并拼接成单个纯文本输出。
选择提取模式
Layout 模式保留视觉阅读顺序。Raw 模式按 PDF 流中字形出现的顺序提取,对于多栏布局可能与视觉顺序不同。
复制或下载文本
把提取的文本复制到剪贴板,或下载为 .txt 文件。输出是无格式的 UTF-8 纯文本。
常见问题
能从扫描版 PDF 中提取文本吗?
不能。扫描版 PDF 是文本的图像,不是文本本身。工具读取的是 PDF 内置的文本层 —— 如果 PDF 是未经 OCR 的扫描件,那就没有可提取的文本。请先用 OCR 工具处理扫描页。
为什么多栏 PDF 的文本顺序看起来是错的?
PDF 文本以渲染顺序存储,而非阅读顺序。双栏版式可能会让两栏的文本交错输出。切换到 layout 模式可大致还原阅读顺序。
表格会保留吗?
不会。表格结构(行、列、单元格对齐)不会保留在纯文本输出中。每个单元格的文本会被提取,但网格结构丢失。处理 PDF 表格请使用专门的表格提取工具。
限制说明
- 不支持 OCR工具仅提取已有的文本层。扫描文档、基于图像的 PDF、以及文本以轮廓形式渲染的 PDF 都会产出空输出。
- 格式总是会丢失粗体、斜体、字号、颜色 —— 所有格式都会被丢弃。输出是纯文本。
平台说明
- Web
- 完全在客户端运行。你的 PDF 保留在本地设备上。
广告
广告