这个转换器使用Mozilla PDF.js在您的设备上读取每一页已有的文字层。它会尽量保留页序和报告中的换行,然后给出一份可编辑的纯文本结果。图片、字体、分栏、表格和视觉排版不会保留到TXT输出中。
这里有一个重要边界:数字版PDF保存的是软件可以选择和搜索的字符。扫描件可能只保存了一张页面照片。提取前一种内容是文本解析,读取后一种需要光学字符识别。这个工具只做前一件事。
全程在浏览器中运行,无需上传,无需注册。
使用这个PDF转文本工具,提取数字版PDF里已经存在的可选文字,再复制或下载TXT文件。处理全程在浏览器内完成,文档不会上传。扫描件或纯图片PDF里的文字需要OCR,而这个工具不执行OCR。
这个转换器使用Mozilla PDF.js在您的设备上读取每一页已有的文字层。它会尽量保留页序和报告中的换行,然后给出一份可编辑的纯文本结果。图片、字体、分栏、表格和视觉排版不会保留到TXT输出中。
这里有一个重要边界:数字版PDF保存的是软件可以选择和搜索的字符。扫描件可能只保存了一张页面照片。提取前一种内容是文本解析,读取后一种需要光学字符识别。这个工具只做前一件事。
不会。浏览器会用PDF.js在本地读取所选PDF,文件不会发送到CanDoYa。PDF引擎代码首次使用时可能会下载,但您的文档不在这次请求里。
是的。您可以免费提取、编辑、复制和下载文本,无需账号、水印或付费。处理在您的设备上完成,所以没有服务器转换队列,也不用等以后再取回上传的文件。
工具接受单个PDF,最大100 MB、2,000页。设备内存和速度可能带来更低的实际限制,尤其是在手机上。如果特别大的文档浏览器无法完成,可以先拆分成更小的PDF。
如果扫描件里只有页面图片,就不能。这个转换器读取的是已有的可选中文本,不会执行OCR。扫描版PDF需要OCR工具从像素里识别字符。有些混合PDF在某些页面有可选文本,但其他页面没有;结果会标出没有文字的页面。
PDF页面把文字片段放在坐标位置上,不一定保存清晰的段落或分栏顺序。PDF.js会跟随文档的文字项和换行,这可能和多栏版式、表格、页眉或复杂表单的视觉阅读顺序不同。
不会。TXT文件只包含纯字符,所以字体、颜色、图片、链接、分栏和表格边框都不会保留。换行来自PDF文字层,提取后可能还需要手动调整。
没有密码,浏览器无法读取加密文档。请在受信任的阅读器里打开PDF,输入密码,并在有权限的前提下另存一份解锁副本。然后再把那份副本加入转换器。
解析器不只针对某一种语言。只要PDF里有正确的字符映射和可选中的文字,它就可以返回任何书写系统的Unicode文本。如果文档使用了缺失或自定义的字体映射,复制出来的字符仍可能不完整或错误。