CanDoYa
ZH

PDF转文本

全程在浏览器中运行,无需上传,无需注册。

请选择一个数字版PDF来提取可选文字。

分享此工具

怎么把PDF转成文本?

使用这个PDF转文本工具,提取数字版PDF里已经存在的可选文字,再复制或下载TXT文件。处理全程在浏览器内完成,文档不会上传。扫描件或纯图片PDF里的文字需要OCR,而这个工具不执行OCR。

使用方法

  1. 1选择数字版PDF. 把一个PDF拖到工具里,或者从设备中选择。为了得到最佳结果,请先确认您在常用PDF阅读器里可以选中文本。
  2. 2提取文字层. 点击提取文本。PDF.js会在本地读取每一页,并显示进度,不会把文件发送到服务器。
  3. 3检查纯文本. 对照原文检查段落、分栏、表格和符号。PDF的阅读顺序可能和页面上的视觉顺序不同。
  4. 4复制或下载. 如有需要可编辑结果,复制到剪贴板,或保存为UTF-8编码的TXT文件。

适用人群

这个转换器使用Mozilla PDF.js在您的设备上读取每一页已有的文字层。它会尽量保留页序和报告中的换行,然后给出一份可编辑的纯文本结果。图片、字体、分栏、表格和视觉排版不会保留到TXT输出中。

这里有一个重要边界:数字版PDF保存的是软件可以选择和搜索的字符。扫描件可能只保存了一张页面照片。提取前一种内容是文本解析,读取后一种需要光学字符识别。这个工具只做前一件事。

常见问题

我的PDF文件会上传到服务器吗?

不会。浏览器会用PDF.js在本地读取所选PDF,文件不会发送到CanDoYa。PDF引擎代码首次使用时可能会下载,但您的文档不在这次请求里。

这个PDF转文本工具免费吗?

是的。您可以免费提取、编辑、复制和下载文本,无需账号、水印或付费。处理在您的设备上完成,所以没有服务器转换队列,也不用等以后再取回上传的文件。

PDF大小和页数有限制吗?

工具接受单个PDF,最大100 MB、2,000页。设备内存和速度可能带来更低的实际限制,尤其是在手机上。如果特别大的文档浏览器无法完成,可以先拆分成更小的PDF。

这个工具能提取扫描版PDF里的文字吗?

如果扫描件里只有页面图片,就不能。这个转换器读取的是已有的可选中文本,不会执行OCR。扫描版PDF需要OCR工具从像素里识别字符。有些混合PDF在某些页面有可选文本,但其他页面没有;结果会标出没有文字的页面。

为什么提取出来的文字顺序不对?

PDF页面把文字片段放在坐标位置上,不一定保存清晰的段落或分栏顺序。PDF.js会跟随文档的文字项和换行,这可能和多栏版式、表格、页眉或复杂表单的视觉阅读顺序不同。

PDF转文本会保留格式和图片吗?

不会。TXT文件只包含纯字符,所以字体、颜色、图片、链接、分栏和表格边框都不会保留。换行来自PDF文字层,提取后可能还需要手动调整。

为什么有密码保护的PDF会被拒绝?

没有密码,浏览器无法读取加密文档。请在受信任的阅读器里打开PDF,输入密码,并在有权限的前提下另存一份解锁副本。然后再把那份副本加入转换器。

可以从PDF里提取哪些语言?

解析器不只针对某一种语言。只要PDF里有正确的字符映射和可选中的文字,它就可以返回任何书写系统的Unicode文本。如果文档使用了缺失或自定义的字体映射,复制出来的字符仍可能不完整或错误。