Verktyget hämtar ljudspåret ur videon i webbläsaren, omvandlar det till den monosignal på 16 kHz som Whisper behöver och skapar tidskoderna i en bakgrundsprocess. WebGPU ger snabbare körning på datorer som stöds; andra webbläsare använder en långsammare CPU-reserv. Före exporten kan både orden och varje textrads start- och sluttid rättas.
Automatisk textning av video
Körs helt i din webbläsare - inget laddas upp, ingen registrering.
Hur skapar jag automatisk textning av en video?
Lägg till en video så kör verktyget taligenkänning med Whisper på din enhet. Det skapar redigerbara textrader med tidskoder som kan förhandsvisas och hämtas som SRT eller VTT. Videon laddas aldrig upp, men webbläsaren behöver hämta AI-modellen första gången.
Så använder du verktyget
- 1Välj en video. Släpp en MP4-, WebM-, MOV-, M4V- eller MKV-fil i verktyget eller klicka på uppladdningsytan för att välja den.
- 2Skapa textning med tidskoder. Klicka på Skapa textning. Första gången väntar du tills den flerspråkiga Whisper-modellen har hämtats; därefter bearbetar enheten ljudspåret.
- 3Granska varje textrad. Spela upp textningen i redigeraren, rätta felaktigt tolkade ord och justera start- eller sluttiden när den automatiska timingen ligger för tidigt eller sent.
- 4Exportera undertextfilen. Hämta SRT för bred kompatibilitet med redigerare och plattformar, eller VTT för HTML-video och publicering på webben.
Vem passar det för
- Skapare av korta videor får en lättläst första textning innan de formger eller bränner in den i den färdiga videon.
- Lärare och utbildare gör inspelade lektioner enklare att följa och kan erbjuda en separat undertextfil.
- Poddare och intervjuare omvandlar videosamtal till ett tidskodat utkast utan att skicka opublicerat material till en molntjänst.
- Tillgänglighetsgranskare får en första version där tal, namn, ljudbeskrivningar, tider och läshastighet kan kontrolleras.
Vanliga frågor
Laddas min video upp till en server?
Nej. Webbläsaren läser den valda filen och skickar bara avkodade ljuddata till en worker på samma enhet. Workern hämtar Whisper-modellfiler från Hugging Face men laddar inte upp videon, ljudet eller textningen. CanDoYa tar inte emot eller lagrar filen.
Är verktyget för automatisk textning gratis?
Ja. Inget konto, ingen betalning, minutkvot, vattenstämpel eller låst export finns. Enheten gör transkriberingen, så den praktiska kostnaden är bearbetningstid, minne och den första modellhämtningen. Din operatör kan räkna hämtningen mot en begränsad datapott.
Hur stor och lång video kan jag texta?
Filväljaren tar emot filer på högst 500 MB. Det finns ingen fast minutgräns, men långa videor kräver mer minne och tid eftersom avkodning och AI-körning sker på enheten. Använd en modern bärbar dator för timslånga inspelningar, stäng minneskrävande flikar eller dela videon först.
Vilka videoformat fungerar?
Verktyget accepterar MP4, WebM, MOV, M4V, MKV, AVI, MPEG och OGV. Den faktiska ljudavkodningen beror på vilka kodekar som finns i webbläsaren och operativsystemet. MP4 med AAC-ljud och WebM med Opus-ljud har vanligtvis bredast stöd.
Kan jag redigera den automatiska textningen?
Ja. Varje textrad har redigerbar text samt start- och sluttid. Spela en rad för att hoppa till dess början och rätta igenkänningsfel eller tidsgränser. Exporten är avstängd om en rad är tom, slutar före starten eller sträcker sig utanför videons längd.
Vad är skillnaden mellan SRT och VTT?
SRT är ett undertextformat med brett stöd i videoredigerare och publiceringsplattformar. WebVTT har en liknande tidskodad struktur men är gjort för webben och fungerar direkt med HTML-elementet video. Verktyget exporterar båda utan att lägga till visuell formgivning eller bränna in texten i videon.
Fungerar textningen utan WebGPU?
Ja. Verktyget provar WebGPU först eftersom en kompatibel grafikprocessor kan köra Whisper snabbare. Om WebGPU saknas eller misslyckas görs ett nytt försök med WebAssembly på CPU:n. Reserven stöder fler webbläsare men kan vara mycket långsam för långa videor på mobiler och äldre datorer.
Är automatisk textning tillräckligt korrekt för tillgänglighet?
Den är användbar som utkast, inte som en färdig tillgänglighetsleverans. Brus, musik, överlappande röster, dialekter, ovanliga namn och facktermer kan ge fel. Automatisk igenkänning utelämnar också många ljudbeskrivningar och talaretiketter. Granska videon och lägg till viktig information som inte är tal innan du publicerar slutlig textning.