這個轉換器會在你的裝置上使用 Mozilla PDF.js 讀取每一頁現有的文字層。它會保留頁面順序與原本回傳的換行,最後產生一份可編輯的純文字結果。圖片、字型、欄位、表格與視覺版面格式不會保留在 TXT 輸出中。
這裡有一個重要界線:數位 PDF 會儲存可被軟體選取和搜尋的字元;掃描檔可能只存了一張頁面照片。擷取前者是文字解析,讀取後者需要光學字元辨識。這個工具只做前者。
全程在瀏覽器裡執行,免上傳、免註冊。
使用這個 PDF 轉文字工具,擷取已儲存在數位 PDF 裡、可以選取的文字,再複製或下載成 TXT 檔。處理過程都在你的瀏覽器內完成,文件不會上傳。掃描圖檔型 PDF 需要 OCR,而這個工具不執行 OCR。
這個轉換器會在你的裝置上使用 Mozilla PDF.js 讀取每一頁現有的文字層。它會保留頁面順序與原本回傳的換行,最後產生一份可編輯的純文字結果。圖片、字型、欄位、表格與視覺版面格式不會保留在 TXT 輸出中。
這裡有一個重要界線:數位 PDF 會儲存可被軟體選取和搜尋的字元;掃描檔可能只存了一張頁面照片。擷取前者是文字解析,讀取後者需要光學字元辨識。這個工具只做前者。
不會。你的瀏覽器會以 PDF.js 在本地讀取所選 PDF,檔案不會送到 CanDoYa。第一次使用時,PDF 引擎程式碼可能會下載,但你的文件不會包含在那個請求裡。
是的。你可以不需帳號、浮水印或付款,就直接擷取、編輯、複製和下載文字。運算都在你的裝置上執行,所以沒有伺服器轉檔佇列,也不需要日後再回來取檔。
本工具支援 1 份 PDF,最大 100 MB、2,000 頁。可用記憶體和裝置速度可能會讓實際上限更低,尤其是在手機上。若文件太大而瀏覽器無法完成,請拆成較小的 PDF。
如果掃描內容只有頁面影像,就不行。這個轉換器讀取的是現有可選取的文字,不做 OCR。掃描 PDF 需要能從像素辨識字元的 OCR 工具。有些混合型 PDF 的某些頁有可選取文字、某些頁沒有;結果會標示沒有文字的頁面。
PDF 會把文字片段放在座標位置,不一定會儲存清楚的段落或欄位順序。PDF.js 依照文件中的文字項目和換行來讀取,這和多欄版面、表格、頁首或複雜表單的視覺閱讀順序可能不同。
不會。TXT 檔只有純文字,所以字型、顏色、圖片、連結、欄位和表格框線都不會保留。換行來自 PDF 的文字層,擷取後可能還需要整理。
沒有密碼,瀏覽器無法讀取加密文件。請在可信任的檢視器中開啟 PDF、輸入密碼,若你有權限,再另存一份解除鎖定的副本。然後把那份副本加入工具。
解析器不限定單一語言。只要 PDF 內有正確的字元對照表和可選取文字,就能回傳任何書寫系統的 Unicode 文字。如果文件使用缺失或自訂的字型映射,複製出來的字元仍可能不完整或不正確。