ToolConvoyToolConvoyv2.6
DOC

PDF 转 TXT — 从 PDF 文件中提取文本

从 PDF 文件提取文本到纯文本。无上传,完全在浏览器中运行。

● 本地运行 · 文档永不离开设备页面加载以来工具发出的网络请求:0 次

PDF to TXT

Extract text from PDF files. Works entirely in your browser — no uploads, no limits.

将您的 PDF 文件拖到此处

或点击浏览(最大 50MB)

从 PDF 提取文本是那种听起来比实际更简单的操作之一。PDF 以带坐标的字形存储文本 —— 每个字符被绘制在页面的特定位置,而阅读顺序取决于字形在流中出现的顺序,这个顺序未必符合人类的阅读方式。工具读取 PDF 内置的文本层,按空间排列把字形分组成单词和行,并输出一份尽力而为的纯文本渲染。对于单栏文档(书籍、报告、法律文书),输出几乎与原文一致。对于多栏版式、表格以及含浮动元素的文档,文本顺序需要人工复核。

广告

使用方法

  1. 拖入你的 PDF

    把 PDF 拖入拖放区。工具会从每一页提取文本层,并拼接成单个纯文本输出。

  2. 选择提取模式

    Layout 模式保留视觉阅读顺序。Raw 模式按 PDF 流中字形出现的顺序提取,对于多栏布局可能与视觉顺序不同。

  3. 复制或下载文本

    把提取的文本复制到剪贴板,或下载为 .txt 文件。输出是无格式的 UTF-8 纯文本。

常见问题

能从扫描版 PDF 中提取文本吗?

不能。扫描版 PDF 是文本的图像,不是文本本身。工具读取的是 PDF 内置的文本层 —— 如果 PDF 是未经 OCR 的扫描件,那就没有可提取的文本。请先用 OCR 工具处理扫描页。

为什么多栏 PDF 的文本顺序看起来是错的?

PDF 文本以渲染顺序存储,而非阅读顺序。双栏版式可能会让两栏的文本交错输出。切换到 layout 模式可大致还原阅读顺序。

表格会保留吗?

不会。表格结构(行、列、单元格对齐)不会保留在纯文本输出中。每个单元格的文本会被提取,但网格结构丢失。处理 PDF 表格请使用专门的表格提取工具。

限制说明

  • 不支持 OCR工具仅提取已有的文本层。扫描文档、基于图像的 PDF、以及文本以轮廓形式渲染的 PDF 都会产出空输出。
  • 格式总是会丢失粗体、斜体、字号、颜色 —— 所有格式都会被丢弃。输出是纯文本。

平台说明

Web
完全在客户端运行。你的 PDF 保留在本地设备上。
广告
广告