工具會在瀏覽器內擷取影片音軌,轉成 Whisper 所需的 16 kHz 單聲道訊號,再由背景工作執行緒建立字幕時間。相容的電腦會使用 WebGPU 加速,其他瀏覽器則改用較慢的 CPU 備援模式。匯出前,可以修正辨識文字及每段字幕的開始與結束時間。
自動字幕產生器
全程在瀏覽器裡執行,免上傳、免註冊。
如何自動為影片產生字幕?
加入影片後,這個自動字幕產生器會在裝置上執行 Whisper 語音辨識。它會建立含時間碼、可編輯的字幕,能直接預覽並下載成 SRT 或 VTT。影片不會上傳,不過第一次使用時,瀏覽器必須先下載 AI 模型。
使用方式
- 1選擇影片. 將 MP4、WebM、MOV、M4V 或 MKV 檔拖放到工具中,或按一下上傳區域來選擇檔案。
- 2產生含時間碼的字幕. 按下「產生字幕」。第一次使用時,先等待多語言 Whisper 模型下載完成,再讓裝置處理音軌。
- 3逐段校對字幕. 從編輯器播放字幕、修正辨識內容,若自動時間太早或太晚,也可調整開始與結束時間。
- 4匯出字幕檔. 下載廣受剪輯軟體與平台支援的 SRT,或選擇適合 HTML 影片與網頁發佈的 VTT。
適合誰用
- 短影音創作者可以先做出易讀字幕,再套用樣式或將字幕燒錄到成品中。
- 教師與培訓人員可以讓錄製課程更容易理解,並提供可下載的字幕檔。
- Podcast 與訪談工作者可以把影片對話整理成含時間碼的初稿,不必把尚未公開的素材送進雲端轉錄佇列。
- 無障礙內容審核人員可以先建立初稿,再逐一檢查語音、姓名、聲音提示、時間與閱讀速度。
常見問題
我的影片會上傳到伺服器嗎?
不會。瀏覽器會讀取選取的檔案,只把解碼後的音訊取樣交給同一部裝置上的背景工作執行緒。執行緒會從 Hugging Face 下載 Whisper 模型檔,但不會上傳影片、音訊或字幕。CanDoYa 不會收到或儲存檔案。
自動字幕產生器免費嗎?
免費。不必建立帳號或付費,沒有字幕分鐘額度、浮水印或匯出限制。轉錄由裝置完成,實際成本是本機處理時間、記憶體與第一次下載模型的流量。若使用計量連線,網路供應商仍可能計入這次下載。
多大、多長的影片可以產生字幕?
上傳區接受最大 500 MB 的檔案,沒有固定的分鐘數限制。不過解碼和 AI 推論都在裝置上執行,影片愈長就需要愈多記憶體與時間。處理一小時左右的錄影時,建議使用較新的筆電、關閉占用大量記憶體的分頁,或先把影片分成較短片段。
支援哪些影片格式?
工具接受 MP4、WebM、MOV、M4V、MKV、AVI、MPEG 與 OGV 容器。能否實際解碼音訊,取決於瀏覽器和作業系統內建的編解碼器。含 AAC 音訊的 MP4 和含 Opus 音訊的 WebM 通常有最廣泛的支援。
可以編輯自動產生的字幕嗎?
可以。每段字幕都有可編輯的文字、開始時間和結束時間。播放單段字幕可跳到對應起點,再修正辨識錯誤與時間邊界。字幕為空、結束時間早於開始時間,或超出影片長度時,匯出功能會維持停用。
SRT 和 VTT 有什麼不同?
SRT 是影片剪輯軟體與發佈平台廣泛支援的字幕格式。WebVTT 採用相似的時間文字結構,但專為網頁設計,可直接搭配 HTML video 元素使用。這個工具能匯出兩種格式,不會套用視覺樣式或把字幕燒錄到影片。
沒有 WebGPU 也能產生字幕嗎?
可以。工具會先嘗試 WebGPU,因為相容的圖形處理器能更快執行 Whisper。WebGPU 無法使用或執行失敗時,系統會改用 CPU 上的 WebAssembly 重試。這個備援方式支援更多瀏覽器,但長影片可能處理得很慢,手機與舊電腦尤其明顯。
自動字幕的準確度足以製作無障礙內容嗎?
它適合當作初稿,不能直接視為完成的無障礙字幕。背景雜音、音樂、重疊對話、口音、少見姓名和專業術語都可能造成錯誤。自動辨識也會漏掉聲音說明與說話者標籤,因此發佈正式隱藏式字幕前,應對照影片校正並補上重要的非語音提示。