Verktyget gör om inspelat tal till text utan att skicka ljudet till en transkriberingstjänst. Whisper-modellen körs i en webbläsarworker, så sidan fortsätter svara medan datorn arbetar. WebGPU används när det finns stöd. Annars växlar verktyget till ett långsammare CPU-läge. Den hämtade modellen sparas normalt i webbläsarens cache.
Transkribera ljud till text
Körs helt i din webbläsare - inget laddas upp, ingen registrering.
Hur gör jag om ljud till text utan att ladda upp filen?
Lägg till en ljudfil så kör verktyget taligenkänning med Whisper på din enhet. Du får en redigerbar transkription som kan exporteras som TXT eller SRT. Inspelningen lämnar aldrig enheten, men webbläsaren behöver hämta AI-modellen första gången.
Så använder du verktyget
- 1Välj inspelning. Dra in en MP3-, WAV-, M4A-, OGG-, FLAC- eller WebM-fil i verktyget, eller klicka på uppladdningsytan och välj filen.
- 2Starta privat transkribering. Klicka på Transkribera ljud. Vid första körningen väntar du medan den flerspråkiga Whisper-modellen hämtas, sedan bearbetas inspelningen på enheten.
- 3Granska och exportera. Lyssna på osäkra avsnitt, rätta eventuella fel och kopiera texten eller hämta den som TXT eller tidskodad SRT.
Vem passar det för
- Intervjuare och forskare kan skapa ett privat första utkast och sedan kontrollera namn och citat mot inspelningen.
- Studenter kan göra föreläsningar och röstanteckningar redigerbara utan att ladda upp klassrumsljud.
- Poddare och videoskapare kan ta fram en grov transkription eller en tidskodad SRT-fil för undertexter.
- Team med känsligt ljud kan behålla källfilen på enheten i stället för att skicka den till en molntjänst.
Vanliga frågor
Laddas mitt ljud upp till en server?
Nej. Webbläsaren avkodar filen och skickar endast ljudproverna till en lokal worker på samma enhet. Workern hämtar Whisper-modellen från Hugging Face, men laddar inte upp inspelningen eller transkriptionen. CanDoYa tar inte emot eller lagrar filen.
Är verktyget för ljud till text gratis?
Ja. Du behöver inget konto, ingen betalning och inga transkriberingskrediter. Din enhet gör beräkningen, så den praktiska kostnaden är tid, minne och den första modellhämtningen. Ett mobilabonnemang kan räkna hämtningen mot din datamängd.
Hur stora och långa inspelningar kan jag transkribera?
Filväljaren tar emot filer på upp till 500 MB. Det finns ingen fast minutgräns, men långa inspelningar kräver mer minne och tar längre tid. För timslånga möten eller föreläsningar är en modern bärbar dator bättre än en telefon.
Vilka ljudformat stöds?
Verktyget tar emot MP3, WAV, M4A, OGG, FLAC, WebM och några närliggande format. Vilka filer som faktiskt kan avkodas beror på webbläsare och operativsystem. Om en fil avvisas kan du konvertera den till MP3 eller okomprimerad WAV och försöka igen.
Vilka språk kan Whisper transkribera?
Den valda lilla Whisper-modellen är flerspråkig och identifierar automatiskt många talade språk. Träffsäkerheten varierar med språk, dialekt, ljudkvalitet och ämne. Modellen översätter inte, skiljer inte på talare och kan inte garantera rätt stavning av namn eller facktermer.
Varför hämtas en modell första gången?
Privat transkribering på enheten kräver att taligenkänningsmodellen finns på datorn. WebGPU-läget hämtar cirka 80 MB och den kvantiserade CPU-reserven cirka 105 MB. Webbläsaren sparar normalt filerna tills webbplatsdata eller cache rensas.
Fungerar transkriberingen utan WebGPU?
Ja. Verktyget föredrar WebGPU eftersom en grafikprocessor med stöd kan köra Whisper betydligt snabbare. Om WebGPU saknas eller misslyckas försöker det igen med WebAssembly på CPU:n. Det fungerar i fler webbläsare men kan vara långsamt på äldre enheter.
Hur träffsäker blir transkriptionen?
Whisper tiny ger ett användbart utkast från tydligt tal, men ingen garanti om ordagrannhet. Brus, musik, överlappande röster, svaga mikrofoner, ovanliga namn och långa tystnader sänker kvaliteten. Kontrollera viktiga citat, medicinska uppgifter, juridiska uttalanden och beslut mot originalljudet.