CanDoYa
FIL

Auto Caption Generator para sa Video

Tumatakbo nang buo sa iyong browser - walang upload, walang sign-up.

Magdagdag ng video para gumawa ng pribado at nae-edit na caption sa device mo.

Ibahagi ang tool na ito

Paano gumawa ng awtomatikong caption sa video?

Magdagdag ng video at patatakbuhin ng auto caption generator na ito ang Whisper speech recognition sa device mo nang hindi ina-upload ang file. Makakakuha ka ng mga caption na may timing, puwedeng i-preview at i-edit, saka i-download bilang SRT o VTT. Sa unang gamit, kailangang i-download ng browser ang AI model.

Paano gamitin

  1. 1Pumili ng video. I-drop sa tool ang MP4, WebM, MOV, M4V, o MKV file, o i-click ang upload area para pumili mula sa device.
  2. 2Gumawa ng caption na may timing. I-click ang Gumawa ng mga caption. Sa unang beses, hintaying ma-download ang multilingual Whisper model, pagkatapos ay hayaang i-process ng device ang audio track.
  3. 3I-review ang bawat caption. I-play ang caption mula sa editor, itama ang maling salita, at ayusin ang simula o dulo kapag masyadong maaga o huli ang awtomatikong timing.
  4. 4I-export ang caption file. Mag-download ng SRT para sa malawak na suporta ng mga video editor at platform, o VTT para sa HTML video at web publishing.

Para kanino ito

Kinukuha ng tool ang audio track sa loob mismo ng browser, kino-convert ito sa 16 kHz mono signal na kailangan ng Whisper, at gumagawa ng mga timing sa isang background worker. Pinapabilis ng WebGPU ang proseso sa mga suportadong computer; mas mabagal na CPU fallback ang gagamitin sa ibang browser. Bago mag-export, puwedeng itama ang mga salita pati ang simula at dulo ng bawat caption.

FAQ

Ina-upload ba sa server ang video ko?

Hindi. Binabasa ng browser ang napiling file at ipinapasa ang decoded audio sample sa worker na nasa device ding iyon. Dina-download ng worker mula sa Hugging Face ang mga file ng Whisper model, pero hindi nito ina-upload ang video, audio, o caption mo. Hindi tinatanggap o sine-save ng CanDoYa ang file.

Libre ba ang auto caption generator?

Oo. Walang account, bayad, limitasyon sa minuto ng caption, watermark, o lock sa export. Device mo ang gumagawa ng transcription, kaya oras ng lokal na processing, paggamit ng memory, at unang pag-download ng model lang ang praktikal na kapalit. Maaaring mabilang ang download na iyon kung may data limit ang internet mo.

Gaano kalaki at kahabang video ang puwedeng lagyan ng caption?

Tumatanggap ang uploader ng file na hanggang 500 MB. Walang nakatakdang limitasyon sa minuto, pero mas maraming memory at oras ang kailangan ng mahabang video dahil lokal na ginagawa ang decoding at AI inference. Para sa isang oras na recording, gumamit ng modernong laptop, isara ang mga tab na malakas sa memory, o hatiin muna sa mas maiikling bahagi ang video.

Anong mga video format ang gumagana?

Tumatanggap ang tool ng MP4, WebM, MOV, M4V, MKV, AVI, MPEG, at OGV container. Nakasalalay sa codec na suportado ng browser at operating system kung mababasa ang audio. Karaniwang pinakamalawak ang browser support ng MP4 na may AAC audio at WebM na may Opus audio.

Puwede ko bang i-edit ang awtomatikong caption?

Oo. Mae-edit ang text, oras ng simula, at oras ng dulo ng bawat caption. I-play ang isang caption para tumalon ang preview sa simula nito, itama ang maling pagkilala, at ayusin ang hangganan. Hindi magagamit ang export kapag walang laman ang caption, nauuna ang dulo sa simula, o lumalampas ito sa haba ng video.

Ano ang pagkakaiba ng SRT at VTT?

Ang SRT ay isang malawak na suportadong subtitle format na ginagamit ng mga video editor at publishing platform. Katulad ang timed-text structure ng WebVTT, pero ginawa ito para sa web at direktang gumagana sa track element ng HTML video. Parehong ine-export ng tool nang hindi naglalagay ng visual style o permanenteng nagsusunog ng text sa video.

Gumagana ba ang paggawa ng caption kahit walang WebGPU?

Oo. WebGPU muna ang sinusubukan ng tool dahil mas mabilis nitong mapapatakbo ang Whisper kapag may angkop na graphics processor. Kapag wala o pumalya ang WebGPU, susubukan ulit gamit ang WebAssembly sa CPU. Mas maraming browser ang kaya ng fallback, pero maaari itong maging mas mabagal sa mahabang video, phone, o lumang computer.

Sapat ba ang accuracy ng auto caption para sa accessibility?

Magandang panimulang draft ito, pero hindi pa tapos na accessibility material. Maaaring magkamali dahil sa ingay, musika, sabay-sabay na boses, accent, di-karaniwang pangalan, at teknikal na termino. Hindi rin naisasama ng speech recognition ang maraming sound description at speaker label. I-review ang video at idagdag ang mahahalagang cue na hindi pananalita bago maglabas ng pormal na closed caption.