Nástroj vyjme zvukovou stopu přímo v prohlížeči, převede ji na monofonní signál 16 kHz pro Whisper a vypočítá časování titulků v pracovním vlákně. WebGPU zrychluje zpracování v podporovaných počítačích; ostatní prohlížeče použijí pomalejší režim CPU. Před exportem můžete v editoru opravit text i začátek a konec každého úseku.
Automatické titulky k videu
Běží celé ve vašem prohlížeči - nic se nenahrává, žádná registrace.
Jak automaticky vytvořit titulky k videu?
Přidejte video a generátor automatických titulků spustí rozpoznávání řeči Whisper přímo ve vašem zařízení. Vytvoří upravitelné úseky s časovými značkami, které si můžete přehrát a stáhnout jako SRT nebo VTT. Video se nikam neodesílá, při prvním použití však prohlížeč musí stáhnout model AI.
Jak na to
- 1Vyberte video. Přetáhněte do nástroje soubor MP4, WebM, MOV, M4V nebo MKV, případně klikněte na oblast nahrávání a vyberte soubor ze zařízení.
- 2Vytvořte časované titulky. Klikněte na „Vytvořit titulky“. Při prvním spuštění počkejte na stažení vícejazyčného modelu Whisper a poté nechte zařízení zpracovat zvukovou stopu.
- 3Zkontrolujte každý úsek. Přehrávejte úseky z editoru, opravujte text a měňte čas začátku nebo konce, pokud automatické časování přichází příliš brzy či pozdě.
- 4Exportujte soubor titulků. Stáhněte SRT pro videoeditory a publikační platformy nebo VTT pro HTML video a zveřejnění na webu.
Pro koho je nástroj
- Tvůrci krátkých videí připraví čitelné titulky k videím před jejich grafickou úpravou nebo vložením do konečného střihu.
- Učitelé a školitelé usnadní sledování nahraných lekcí a nabídnou samostatnou stopu titulků ke stažení.
- Autoři podcastů a tazatelé převedou rozhovor ve videu na časovaný návrh, aniž by nepublikovaný záznam odeslali cloudové přepisovací službě.
- Kontroloři přístupnosti vytvoří první verzi a pak ověří řeč, jména, zvukové popisy, časování i rychlost čtení.
Časté dotazy
Odesílá se moje video na server?
Ne. Prohlížeč načte vybraný soubor a předá dekódované zvukové vzorky pouze pracovnímu vláknu ve stejném zařízení. Vlákno stáhne soubory modelu Whisper z Hugging Face, ale video, zvuk ani titulky nikam neodesílá. CanDoYa soubor nepřijímá ani neukládá.
Je generátor automatických titulků zdarma?
Ano. Není potřeba účet ani platba, není stanoven limit minut a výsledek neobsahuje vodoznak ani zámek exportu. Přepis provádí vaše zařízení, takže skutečným nákladem je čas, paměť a první stažení modelu. Poskytovatel může stahování započítat do datového limitu.
Jak velké a dlouhé video mohu opatřit titulky?
Lze vybrat soubor o velikosti až 500 MB. Pevný limit minut není stanoven, dlouhá videa však potřebují více paměti a času, protože dekódování i výpočty AI probíhají místně. U hodinového záznamu použijte moderní notebook, zavřete náročné karty nebo video nejprve rozdělte.
Které formáty videa fungují?
Nástroj přijímá kontejnery MP4, WebM, MOV, M4V, MKV, AVI, MPEG a OGV. Skutečné dekódování zvuku závisí na kodecích prohlížeče a operačního systému. Nejširší podporu obvykle mají MP4 se zvukem AAC a WebM se zvukem Opus.
Mohu automatické titulky upravovat?
Ano. U každého úseku lze upravit text a čas začátku i konce. Přehráním přejdete na správné místo ve videu, opravíte chyby rozpoznávání a zpřesníte hranice. Export zůstane vypnutý, pokud je úsek prázdný, končí před začátkem nebo přesahuje délku videa.
Jaký je rozdíl mezi SRT a VTT?
SRT je široce podporovaný formát titulků pro videoeditory a publikační platformy. WebVTT má podobnou strukturu časovaného textu, ale je určen pro web a funguje přímo s prvkem stopy HTML videa. Nástroj exportuje oba formáty bez grafického stylu a bez vložení textu do obrazu.
Funguje generování titulků bez WebGPU?
Ano. Nástroj nejprve zkusí WebGPU, protože kompatibilní grafický procesor dokáže model Whisper zrychlit. Pokud WebGPU není dostupné nebo selže, zpracování se zopakuje přes WebAssembly v CPU. Tento režim funguje ve více prohlížečích, ale může být mnohem pomalejší, zvláště u dlouhých videí v telefonech a starších počítačích.
Jsou automatické titulky dost přesné pro přístupnost?
Jsou užitečným návrhem, nikoli hotovým výstupem pro přístupnost. Hluk, hudba, překrývající se hlasy, přízvuky, neobvyklá jména a odborné výrazy mohou způsobit chyby. Rozpoznávání řeči navíc vynechává popisy zvuků a označení mluvčích, proto video před zveřejněním projděte a důležité nemluvené informace doplňte.