CanDoYa
ZH-TW

語音轉文字工具

全程在瀏覽器裡執行,免上傳、免註冊。

加入音訊檔,在裝置上建立私密逐字稿。

分享這個工具

如何私密地將語音轉成文字?

加入音訊檔後,這個語音轉文字工具會在裝置上執行 Whisper 語音辨識模型。轉錄內容可以編輯,也能匯出成 TXT 或 SRT。錄音不會上傳,不過第一次使用時,瀏覽器必須先下載 AI 模型。

使用方式

  1. 1選擇錄音. 將 MP3、WAV、M4A、OGG、FLAC 或 WebM 檔拖放到工具中,或按一下上傳區域來選擇檔案。
  2. 2開始私密轉錄. 按下「轉錄音訊」。第一次使用時,先等待多語言 Whisper 模型下載完成,再讓它在裝置上處理錄音。
  3. 3校對並匯出. 重新聆聽不確定的段落並修正錯誤,接著複製逐字稿,或下載 TXT 與含時間碼的 SRT。

適合誰用

這個工具不會把錄音送到轉錄服務,而是直接將語音轉成文字。Whisper 模型會在瀏覽器的背景工作執行緒中運行,電腦進行推論時,頁面仍能正常操作。可用時會採用 WebGPU,其他瀏覽器則改用速度較慢的 CPU 模式。下載過的模型會保存在瀏覽器快取中,之後可直接重複使用。

常見問題

我的音訊會上傳到伺服器嗎?

不會。瀏覽器會解碼選取的檔案,並只把音訊取樣傳給同一部裝置上的本機背景工作執行緒。這個執行緒會從 Hugging Face 下載 Whisper 模型檔,但不會上傳錄音或逐字稿。CanDoYa 不會收到或儲存檔案。

語音轉文字工具免費嗎?

免費。不必建立帳號或付費,沒有轉錄額度,也不會加上浮水印。AI 推論由自己的裝置執行,實際成本是處理時間、記憶體與第一次下載模型所需的流量。若使用計量連線,網路供應商仍可能計入這次下載。

可以轉錄多大的檔案和多長的錄音?

上傳區接受最大 500 MB 的檔案,沒有固定的分鐘數限制。不過轉錄會在裝置上進行,錄音愈長就需要愈多記憶體與時間。一小時的會議或課程,使用較新的筆電通常比手機合適。

支援哪些音訊格式?

工具接受 MP3、WAV、M4A、OGG、FLAC、WebM 與部分相關格式。能否實際解碼,取決於瀏覽器和作業系統。若副檔名在清單中卻仍遭拒絕,請先轉成 MP3 或未壓縮 WAV,再試一次。

Whisper 可以轉錄哪些語言?

這裡使用的 Whisper tiny 是多語言模型,能自動辨識許多口語語言。準確度會隨語言、口音、錄音品質與主題而變化。它不會把逐字稿翻譯成其他語言,也不會辨識不同說話者,更無法保證姓名和專業術語的拼寫完全正確。

為什麼第一次轉錄要下載模型?

要在裝置上私密轉錄,電腦必須先取得語音辨識模型。WebGPU 模式約需下載 80 MB,CPU 備援模式則約 105 MB。瀏覽器通常會快取這些檔案,除非清除網站資料或快取,之後使用時都能直接沿用。

沒有 WebGPU 也能轉錄音訊嗎?

可以。工具會優先使用 WebGPU,因為相容的圖形處理器能大幅加快 Whisper。WebGPU 不存在或執行失敗時,系統會改用 CPU 上的 WebAssembly 重試。這個備援方式支援更多瀏覽器,但處理長錄音可能很慢,手機和舊電腦尤其明顯。

轉錄內容有多準確?

語音清楚時,Whisper tiny 能提供實用的初稿,但不保證逐字正確。背景雜音、音樂、重疊對話、收音微弱、少見姓名與長時間靜音都會降低準確度,甚至產生未說過的字句。重要引文、醫療資訊、法律陳述與決策,都應回頭對照原始錄音。