De tool haalt het audiospoor in je browser uit de video, zet het om naar het mono-signaal van 16 kHz dat Whisper nodig heeft en bepaalt de tijdcodes in een achtergrondproces. WebGPU versnelt dit op ondersteunde computers; andere browsers gebruiken een tragere CPU-modus. Voor de export kun je zowel de tekst als de begin- en eindtijd van iedere ondertitel corrigeren.
Automatisch ondertiteling genereren
Draait volledig in je browser - niets uploaden, geen account.
Hoe kan ik automatisch ondertiteling voor een video genereren?
Voeg een video toe. De generator voert Whisper-spraakherkenning op je apparaat uit en maakt bewerkbare ondertitels met tijdcodes. Je kunt ze bekijken en downloaden als SRT of VTT. De video wordt niet geüpload, al moet de browser het AI-model bij het eerste gebruik wel downloaden.
Zo werkt het
- 1Kies een video. Sleep een MP4-, WebM-, MOV-, M4V- of MKV-bestand naar de tool of klik op het uploadvak om een bestand te kiezen.
- 2Genereer ondertitels met tijdcodes. Klik op Ondertitels genereren. Wacht de eerste keer tot het meertalige Whisper-model is gedownload; daarna verwerkt je apparaat het audiospoor.
- 3Controleer iedere ondertitel. Speel een ondertitel af in de editor, verbeter verkeerd herkende woorden en pas de begin- of eindtijd aan als de automatische timing te vroeg of te laat is.
- 4Exporteer het ondertitelbestand. Download SRT voor brede ondersteuning in editors en platforms, of kies VTT voor HTML-video en publicatie op het web.
Voor wie
- Makers van korte video's zetten een leesbare eerste versie klaar voordat ze de ondertiteling vormgeven of in de definitieve montage branden.
- Docenten en trainers maken opgenomen lessen beter te volgen en bieden een los ondertitelbestand aan.
- Podcasters en interviewers zetten videogesprekken om in een concept met tijdcodes, zonder ongepubliceerd materiaal naar een transcriptiedienst te sturen.
- Toegankelijkheidscontroleurs maken een eerste versie om spraak, namen, geluidsaanduidingen, timing en leessnelheid na te lopen.
Veelgestelde vragen
Wordt mijn video naar een server geüpload?
Nee. De browser leest het gekozen bestand en stuurt alleen gedecodeerde audiosamples naar een worker op hetzelfde apparaat. De worker downloadt de Whisper-modelbestanden van Hugging Face, maar uploadt je video, audio of ondertiteling niet. CanDoYa ontvangt of bewaart het bestand niet.
Is deze generator voor automatische ondertiteling gratis?
Ja. Er is geen account, betaling, minutenlimiet, watermerk of exportslot. Je apparaat voert de transcriptie uit. De praktische kosten zijn verwerkingstijd, geheugen en de eerste download van het model. Bij een verbinding met een databundel kan je provider die download meetellen.
Hoe groot en lang mag de video zijn?
Je kunt bestanden tot 500 MB kiezen. Er is geen vaste limiet in minuten, maar lange video's vragen meer geheugen en tijd omdat decodering en AI-verwerking lokaal plaatsvinden. Gebruik voor een opname van een uur een moderne laptop, sluit zware browsertabbladen of splits de video eerst op.
Welke videoformaten werken?
De tool accepteert MP4, WebM, MOV, M4V, MKV, AVI, MPEG en OGV. Of het audiospoor echt kan worden gedecodeerd, hangt af van de codecs in je browser en besturingssysteem. MP4 met AAC-audio en WebM met Opus-audio hebben meestal de breedste ondersteuning.
Kan ik de automatisch gemaakte ondertitels bewerken?
Ja. Iedere ondertitel heeft bewerkbare tekst en een begin- en eindtijd. Speel een regel af om de video naar het beginpunt te zetten en verbeter herkenningsfouten of tijdgrenzen. Export blijft uitgeschakeld als een regel leeg is, vóór het begin eindigt of buiten de videoduur valt.
Wat is het verschil tussen SRT en VTT?
SRT is een breed ondersteund ondertitelformaat voor video-editors en publicatieplatforms. WebVTT heeft een vergelijkbare structuur met tijdcodes, maar is gemaakt voor het web en werkt direct met het HTML-video-element. De tool exporteert beide zonder opmaak toe te voegen of tekst in de video te branden.
Werkt het genereren ook zonder WebGPU?
Ja. De tool probeert eerst WebGPU, omdat een geschikte grafische processor Whisper sneller kan uitvoeren. Als WebGPU niet beschikbaar is of mislukt, volgt een nieuwe poging met WebAssembly op de CPU. Dat werkt in meer browsers, maar kan erg traag zijn bij lange video's op telefoons en oudere computers.
Is automatische ondertiteling nauwkeurig genoeg voor toegankelijkheid?
Het is een bruikbaar concept, geen afgerond toegankelijkheidsproduct. Ruis, muziek, overlappende stemmen, accenten, ongebruikelijke namen en vaktermen kunnen fouten veroorzaken. Automatische herkenning mist ook vaak geluidsbeschrijvingen en sprekerlabels. Controleer daarom de video en voeg belangrijke niet-gesproken informatie toe voordat je officiële ondertiteling publiceert.