CanDoYa
ZH-TW

自動字幕產生器

全程在瀏覽器裡執行,免上傳、免註冊。

加入影片,在裝置上建立私密且可編輯的字幕。

分享這個工具

如何自動為影片產生字幕?

加入影片後,這個自動字幕產生器會在裝置上執行 Whisper 語音辨識。它會建立含時間碼、可編輯的字幕,能直接預覽並下載成 SRT 或 VTT。影片不會上傳,不過第一次使用時,瀏覽器必須先下載 AI 模型。

使用方式

  1. 1選擇影片. 將 MP4、WebM、MOV、M4V 或 MKV 檔拖放到工具中,或按一下上傳區域來選擇檔案。
  2. 2產生含時間碼的字幕. 按下「產生字幕」。第一次使用時,先等待多語言 Whisper 模型下載完成,再讓裝置處理音軌。
  3. 3逐段校對字幕. 從編輯器播放字幕、修正辨識內容,若自動時間太早或太晚,也可調整開始與結束時間。
  4. 4匯出字幕檔. 下載廣受剪輯軟體與平台支援的 SRT,或選擇適合 HTML 影片與網頁發佈的 VTT。

適合誰用

工具會在瀏覽器內擷取影片音軌,轉成 Whisper 所需的 16 kHz 單聲道訊號,再由背景工作執行緒建立字幕時間。相容的電腦會使用 WebGPU 加速,其他瀏覽器則改用較慢的 CPU 備援模式。匯出前,可以修正辨識文字及每段字幕的開始與結束時間。

常見問題

我的影片會上傳到伺服器嗎?

不會。瀏覽器會讀取選取的檔案,只把解碼後的音訊取樣交給同一部裝置上的背景工作執行緒。執行緒會從 Hugging Face 下載 Whisper 模型檔,但不會上傳影片、音訊或字幕。CanDoYa 不會收到或儲存檔案。

自動字幕產生器免費嗎?

免費。不必建立帳號或付費,沒有字幕分鐘額度、浮水印或匯出限制。轉錄由裝置完成,實際成本是本機處理時間、記憶體與第一次下載模型的流量。若使用計量連線,網路供應商仍可能計入這次下載。

多大、多長的影片可以產生字幕?

上傳區接受最大 500 MB 的檔案,沒有固定的分鐘數限制。不過解碼和 AI 推論都在裝置上執行,影片愈長就需要愈多記憶體與時間。處理一小時左右的錄影時,建議使用較新的筆電、關閉占用大量記憶體的分頁,或先把影片分成較短片段。

支援哪些影片格式?

工具接受 MP4、WebM、MOV、M4V、MKV、AVI、MPEG 與 OGV 容器。能否實際解碼音訊,取決於瀏覽器和作業系統內建的編解碼器。含 AAC 音訊的 MP4 和含 Opus 音訊的 WebM 通常有最廣泛的支援。

可以編輯自動產生的字幕嗎?

可以。每段字幕都有可編輯的文字、開始時間和結束時間。播放單段字幕可跳到對應起點,再修正辨識錯誤與時間邊界。字幕為空、結束時間早於開始時間,或超出影片長度時,匯出功能會維持停用。

SRT 和 VTT 有什麼不同?

SRT 是影片剪輯軟體與發佈平台廣泛支援的字幕格式。WebVTT 採用相似的時間文字結構,但專為網頁設計,可直接搭配 HTML video 元素使用。這個工具能匯出兩種格式,不會套用視覺樣式或把字幕燒錄到影片。

沒有 WebGPU 也能產生字幕嗎?

可以。工具會先嘗試 WebGPU,因為相容的圖形處理器能更快執行 Whisper。WebGPU 無法使用或執行失敗時,系統會改用 CPU 上的 WebAssembly 重試。這個備援方式支援更多瀏覽器,但長影片可能處理得很慢,手機與舊電腦尤其明顯。

自動字幕的準確度足以製作無障礙內容嗎?

它適合當作初稿,不能直接視為完成的無障礙字幕。背景雜音、音樂、重疊對話、口音、少見姓名和專業術語都可能造成錯誤。自動辨識也會漏掉聲音說明與說話者標籤,因此發佈正式隱藏式字幕前,應對照影片校正並補上重要的非語音提示。