Deze tool zet opgenomen spraak om in tekst zonder de opname naar een transcriptiedienst te sturen. Het Whisper-model draait in een browserworker, zodat de pagina blijft reageren terwijl je computer de berekening uitvoert. WebGPU wordt gebruikt als het beschikbaar is; andere browsers schakelen over op een tragere CPU-modus. De browser bewaart het gedownloade model in de cache voor een volgend bezoek.
Audio naar tekst omzetten
Draait volledig in je browser - niets uploaden, geen account.
Hoe zet ik audio privé om naar tekst?
Voeg een audiobestand toe. Deze audio-naar-tekstconverter voert het Whisper-model voor spraakherkenning op je apparaat uit. Je krijgt een bewerkbaar transcript dat je als TXT of SRT kunt exporteren. De opname wordt nooit geüpload, al moet de browser het AI-model bij het eerste gebruik wel downloaden.
Zo werkt het
- 1Kies de opname. Sleep een MP3-, WAV-, M4A-, OGG-, FLAC- of WebM-bestand naar de tool, of klik op het uploadvak om een bestand te kiezen.
- 2Start de privétranscriptie. Klik op Audio transcriberen. Wacht bij de eerste keer tot het meertalige Whisper-model is gedownload en laat je apparaat daarna de opname verwerken.
- 3Controleer en exporteer. Luister onzekere fragmenten terug, verbeter fouten en kopieer het transcript of download het als TXT of als SRT met tijdcodes.
Voor wie
- Interviewers en onderzoekers maken een eerste privéconcept voordat ze namen en citaten met de opname vergelijken.
- Studenten zetten opgenomen colleges of gesproken notities om in bewerkbare tekst zonder lesopnamen te uploaden.
- Podcast- en videomakers maken een ruwe transcriptie of een SRT-bestand met tijdcodes voor ondertiteling.
- Teams die met gevoelige opnamen werken houden de oorspronkelijke audio op het apparaat in plaats van deze naar een transcriptiewachtrij in de cloud te sturen.
Veelgestelde vragen
Wordt mijn audio naar een server geüpload?
Nee. De browser decodeert het gekozen bestand en stuurt de audiosamples alleen naar een lokale worker op hetzelfde apparaat. Die worker downloadt de Whisper-modelbestanden van Hugging Face, maar uploadt je opname of transcript niet. CanDoYa ontvangt en bewaart het bestand niet.
Is de audio-naar-tekstconverter gratis?
Ja. Je hebt geen account, betaling of transcriptietegoed nodig en er komt geen watermerk in het resultaat. Je eigen apparaat voert de AI-berekening uit, dus de praktische kosten zijn verwerkingstijd, geheugen en de eerste modeldownload. Je internetprovider kan die download wel meetellen bij een databundel.
Welke bestandsgrootte en opnameduur kan ik transcriberen?
Je kunt bestanden tot 500 MB kiezen. Er is geen vaste limiet in minuten, maar lange opnamen hebben meer geheugen en tijd nodig omdat de verwerking op je apparaat gebeurt. Voor vergaderingen of colleges van een uur is een moderne laptop geschikter dan een telefoon.
Welke audioformaten worden ondersteund?
De tool accepteert MP3, WAV, M4A, OGG, FLAC, WebM en enkele verwante formaten. Welke bestanden echt kunnen worden gedecodeerd hangt af van je browser en besturingssysteem. Wordt een bestand ondanks de genoemde extensie geweigerd, zet het dan om naar MP3 of ongecomprimeerde WAV en probeer opnieuw.
Welke talen kan Whisper transcriberen?
Het gekozen Whisper tiny-model is meertalig en herkent veel gesproken talen automatisch. De nauwkeurigheid verschilt per taal, accent, opnamekwaliteit en onderwerp. Het vertaalt het transcript niet, herkent geen afzonderlijke sprekers en garandeert niet dat namen en vaktermen goed worden gespeld.
Waarom wordt bij de eerste transcriptie een model gedownload?
Voor privétranscriptie op je apparaat moet het spraakherkenningsmodel op je computer staan. De WebGPU-route downloadt ongeveer 80 MB, terwijl de gekwantiseerde CPU-modus ongeveer 105 MB nodig heeft. Browsers bewaren die bestanden meestal in de cache, zodat ze opnieuw gebruikt worden zolang je de sitegegevens of cache niet wist.
Werkt audiotranscriptie zonder WebGPU?
Ja. De tool kiest eerst WebGPU omdat een geschikte grafische processor Whisper veel sneller kan uitvoeren. Als WebGPU ontbreekt of niet werkt, volgt een nieuwe poging met WebAssembly op de CPU. Die optie werkt in meer browsers, maar kan bij lange opnamen traag zijn, vooral op telefoons en oudere computers.
Hoe nauwkeurig is het transcript?
Whisper tiny maakt een bruikbare eerste versie van duidelijke spraak, maar biedt geen woordelijke garantie. Achtergrondruis, muziek, door elkaar pratende mensen, zwakke microfoons, ongebruikelijke namen en lange stiltes verlagen de nauwkeurigheid en kunnen verzonnen woorden veroorzaken. Controleer belangrijke citaten, medische gegevens, juridische verklaringen en besluiten aan de hand van de oorspronkelijke audio.