Verktøyet henter lydsporet ut av videoen i nettleseren, gjør det om til monosignalet på 16 kHz som Whisper trenger, og lager tidskodene i en bakgrunnsprosess. WebGPU gir raskere behandling på støttede datamaskiner; andre nettlesere bruker en tregere prosessorreserve. Før eksport kan både ordlyden og start- og sluttiden for hver tekstrad korrigeres.
Automatisk teksting av video
Kjører helt i nettleseren - ingen opplasting, ingen registrering.
Hvordan lager jeg automatisk teksting av en video?
Legg til en video, så kjører verktøyet Whisper-talegjenkjenning på enheten din. Det lager redigerbare tekstrader med tidskoder som kan forhåndsvises og lastes ned som SRT eller VTT. Videoen lastes aldri opp, men nettleseren må laste ned KI-modellen første gang.
Slik bruker du verktøyet
- 1Velg en video. Slipp en MP4-, WebM-, MOV-, M4V- eller MKV-fil i verktøyet, eller klikk på opplastingsfeltet for å velge den.
- 2Lag teksting med tidskoder. Klikk på Lag teksting. Første gang venter du mens den flerspråklige Whisper-modellen lastes ned; deretter behandler enheten lydsporet.
- 3Kontroller hver tekstrad. Spill av raden i redigeringsverktøyet, rett feiltolkede ord, og juster start- eller sluttiden hvis den automatiske timingen ligger for tidlig eller sent.
- 4Eksporter tekstefilen. Last ned SRT for bred støtte i redigeringsprogrammer og plattformer, eller VTT til HTML-video og publisering på nettet.
Hvem passer det for
- Skapere av korte videoer får et lettlest utkast før tekstingen formgis eller brennes inn i den ferdige videoen.
- Lærere og kursholdere gjør opptak av undervisning enklere å følge og kan tilby en egen tekstefil.
- Podkastere og intervjuere gjør videosamtaler om til et tidskodet utkast uten å sende upublisert materiale til en skytjeneste.
- Tilgjengelighetskontrollører lager en første versjon der tale, navn, lydbeskrivelser, timing og lesehastighet kan kontrolleres.
Vanlige spørsmål
Lastes videoen min opp til en server?
Nei. Nettleseren leser den valgte filen og sender bare dekodede lyddata til en worker på samme enhet. Workeren laster ned Whisper-modellfiler fra Hugging Face, men laster ikke opp video, lyd eller teksting. CanDoYa mottar eller lagrer ikke filen.
Er automatisk teksting gratis?
Ja. Det er ingen konto, betaling, minuttgrense, vannmerke eller låst eksport. Enheten gjør transkriberingen, så de praktiske kostnadene er behandlingstid, minne og den første modellnedlastingen. Mobil- eller nettleverandøren kan telle nedlastingen i en begrenset datapakke.
Hvor stor og lang video kan jeg tekste?
Filvelgeren godtar opptil 500 MB. Det finnes ingen fast minuttgrense, men lange videoer krever mer minne og tid fordi dekoding og KI-kjøring skjer lokalt. Bruk en moderne bærbar datamaskin til opptak på en time, lukk minnekrevende faner, eller del videoen først.
Hvilke videoformater fungerer?
Verktøyet godtar MP4, WebM, MOV, M4V, MKV, AVI, MPEG og OGV. Den faktiske lyddekodingen avhenger av kodekene i nettleseren og operativsystemet. MP4 med AAC-lyd og WebM med Opus-lyd har vanligvis bredest støtte.
Kan jeg redigere den automatiske tekstingen?
Ja. Hver rad har redigerbar tekst samt start- og sluttid. Spill av en rad for å hoppe til begynnelsen og rette gjenkjenningsfeil eller tidsgrenser. Eksporten er slått av hvis en rad er tom, slutter før starten eller går utenfor videoens varighet.
Hva er forskjellen på SRT og VTT?
SRT er et tekstingsformat med bred støtte i videoredigerere og publiseringsplattformer. WebVTT har en lignende tidskodet struktur, men er laget for nettet og fungerer direkte med HTML-elementet video. Verktøyet eksporterer begge uten visuell stil eller innbrenning av tekst i bildet.
Fungerer tekstingen uten WebGPU?
Ja. Verktøyet prøver WebGPU først fordi en kompatibel grafikkprosessor kan kjøre Whisper raskere. Hvis WebGPU mangler eller mislykkes, prøver det på nytt med WebAssembly på prosessoren. Reserven støtter flere nettlesere, men kan være svært treg for lange videoer på telefoner og eldre datamaskiner.
Er automatisk teksting nøyaktig nok for tilgjengelighet?
Den er nyttig som utkast, ikke som en ferdig tilgjengelig leveranse. Støy, musikk, overlappende stemmer, dialekter, sjeldne navn og faguttrykk kan gi feil. Automatisk gjenkjenning utelater også mange lydbeskrivelser og talermarkeringer. Kontroller videoen og legg til viktig informasjon uten tale før publisering.