這個工具不會把錄音送到轉錄服務,而是直接將語音轉成文字。Whisper 模型會在瀏覽器的背景工作執行緒中運行,電腦進行推論時,頁面仍能正常操作。可用時會採用 WebGPU,其他瀏覽器則改用速度較慢的 CPU 模式。下載過的模型會保存在瀏覽器快取中,之後可直接重複使用。
語音轉文字工具
全程在瀏覽器裡執行,免上傳、免註冊。
如何私密地將語音轉成文字?
加入音訊檔後,這個語音轉文字工具會在裝置上執行 Whisper 語音辨識模型。轉錄內容可以編輯,也能匯出成 TXT 或 SRT。錄音不會上傳,不過第一次使用時,瀏覽器必須先下載 AI 模型。
使用方式
- 1選擇錄音. 將 MP3、WAV、M4A、OGG、FLAC 或 WebM 檔拖放到工具中,或按一下上傳區域來選擇檔案。
- 2開始私密轉錄. 按下「轉錄音訊」。第一次使用時,先等待多語言 Whisper 模型下載完成,再讓它在裝置上處理錄音。
- 3校對並匯出. 重新聆聽不確定的段落並修正錯誤,接著複製逐字稿,或下載 TXT 與含時間碼的 SRT。
適合誰用
- 訪談工作者與研究人員可以先產生私密的初稿,再回頭核對錄音中的姓名與引文。
- 學生可以把課堂錄音或語音筆記轉成可編輯文字,不必上傳教室裡的音訊。
- Podcast 與影片創作者可以製作粗略逐字稿,或匯出含時間碼的 SRT 字幕檔。
- 處理敏感錄音的團隊可以讓原始音訊留在裝置上,不必送往雲端排隊轉錄。
常見問題
我的音訊會上傳到伺服器嗎?
不會。瀏覽器會解碼選取的檔案,並只把音訊取樣傳給同一部裝置上的本機背景工作執行緒。這個執行緒會從 Hugging Face 下載 Whisper 模型檔,但不會上傳錄音或逐字稿。CanDoYa 不會收到或儲存檔案。
語音轉文字工具免費嗎?
免費。不必建立帳號或付費,沒有轉錄額度,也不會加上浮水印。AI 推論由自己的裝置執行,實際成本是處理時間、記憶體與第一次下載模型所需的流量。若使用計量連線,網路供應商仍可能計入這次下載。
可以轉錄多大的檔案和多長的錄音?
上傳區接受最大 500 MB 的檔案,沒有固定的分鐘數限制。不過轉錄會在裝置上進行,錄音愈長就需要愈多記憶體與時間。一小時的會議或課程,使用較新的筆電通常比手機合適。
支援哪些音訊格式?
工具接受 MP3、WAV、M4A、OGG、FLAC、WebM 與部分相關格式。能否實際解碼,取決於瀏覽器和作業系統。若副檔名在清單中卻仍遭拒絕,請先轉成 MP3 或未壓縮 WAV,再試一次。
Whisper 可以轉錄哪些語言?
這裡使用的 Whisper tiny 是多語言模型,能自動辨識許多口語語言。準確度會隨語言、口音、錄音品質與主題而變化。它不會把逐字稿翻譯成其他語言,也不會辨識不同說話者,更無法保證姓名和專業術語的拼寫完全正確。
為什麼第一次轉錄要下載模型?
要在裝置上私密轉錄,電腦必須先取得語音辨識模型。WebGPU 模式約需下載 80 MB,CPU 備援模式則約 105 MB。瀏覽器通常會快取這些檔案,除非清除網站資料或快取,之後使用時都能直接沿用。
沒有 WebGPU 也能轉錄音訊嗎?
可以。工具會優先使用 WebGPU,因為相容的圖形處理器能大幅加快 Whisper。WebGPU 不存在或執行失敗時,系統會改用 CPU 上的 WebAssembly 重試。這個備援方式支援更多瀏覽器,但處理長錄音可能很慢,手機和舊電腦尤其明顯。
轉錄內容有多準確?
語音清楚時,Whisper tiny 能提供實用的初稿,但不保證逐字正確。背景雜音、音樂、重疊對話、收音微弱、少見姓名與長時間靜音都會降低準確度,甚至產生未說過的字句。重要引文、醫療資訊、法律陳述與決策,都應回頭對照原始錄音。