Værktøjet omsætter optaget tale til tekst uden at sende lydfilen til en transskriptionstjeneste. Whisper-modellen kører i en separat browser-worker, så siden forbliver aktiv, mens computeren arbejder. WebGPU bruges, når det er tilgængeligt. Ellers skifter værktøjet til en langsommere CPU-tilstand. Den hentede model gemmes normalt i browserens cache.
Konvertér lyd til tekst
Kører helt i din browser - ingen upload, ingen tilmelding.
Hvordan laver jeg lyd om til tekst uden at uploade filen?
Tilføj en lydfil, så kører værktøjet Whisper-talegenkendelse på din enhed. Du får en redigerbar transskription, som kan eksporteres som TXT eller SRT. Optagelsen forlader aldrig enheden, men browseren skal hente AI-modellen første gang.
Sådan gør du
- 1Vælg optagelsen. Træk en MP3-, WAV-, M4A-, OGG-, FLAC- eller WebM-fil ind i værktøjet, eller klik på uploadfeltet for at vælge den.
- 2Start privat transskribering. Klik på Transskribér lyd. Første gang skal du vente, mens den flersprogede Whisper-model hentes, hvorefter optagelsen behandles på din enhed.
- 3Gennemgå og eksportér. Lyt til usikre passager, ret eventuelle fejl, og kopiér teksten eller hent den som TXT eller tidskodet SRT.
Hvem er det til
- Interviewere og forskere kan lave et privat første udkast og bagefter tjekke navne og citater mod optagelsen.
- Studerende kan gøre optagede forelæsninger og stemmenoter redigerbare uden at uploade undervisningslyd.
- Podcast- og videoskabere kan fremstille en grov transskription eller en tidskodet SRT-fil til undertekster.
- Teams med følsomme optagelser kan beholde kildelyden på enheden i stedet for at sende den til en cloudtjeneste.
Ofte stillede spørgsmål
Bliver min lyd uploadet til en server?
Nej. Browseren afkoder filen og sender kun lydprøverne til en lokal worker på samme enhed. Workeren henter Whisper-modellen fra Hugging Face, men uploader ikke optagelsen eller transskriptionen. CanDoYa modtager eller gemmer ikke filen.
Er konvertering fra lyd til tekst gratis?
Ja. Der kræves ingen konto, betaling, transskriptionskredit eller vandmærke. Din egen enhed udfører beregningen, så den praktiske pris er tid, hukommelse og den første modeldownload. Et mobilabonnement kan tælle downloadet med i dit dataforbrug.
Hvor store og lange optagelser kan jeg transskribere?
Filvælgeren accepterer op til 500 MB. Der er ingen fast minutgrænse, men lange optagelser kræver mere hukommelse og tager længere tid. Til møder eller forelæsninger på en time er en moderne bærbar computer bedre end en telefon.
Hvilke lydformater understøttes?
Værktøjet accepterer MP3, WAV, M4A, OGG, FLAC, WebM og enkelte beslægtede formater. Den faktiske afkodning afhænger af browser og operativsystem. Hvis en fil afvises, kan du konvertere den til MP3 eller ukomprimeret WAV og prøve igen.
Hvilke sprog kan Whisper transskribere?
Den valgte Whisper tiny-model er flersproget og registrerer automatisk mange talte sprog. Præcisionen varierer med sprog, accent, lydkvalitet og emne. Modellen oversætter ikke, skelner ikke mellem talere og garanterer ikke korrekt stavning af navne eller fagudtryk.
Hvorfor hentes en model ved første transskription?
Privat transskribering på enheden kræver, at talegenkendelsesmodellen ligger på computeren. WebGPU-udgaven henter cirka 80 MB, mens den kvantiserede CPU-reserve er cirka 105 MB. Browseren gemmer normalt filerne, indtil webstedsdata eller cache ryddes.
Virker transskribering uden WebGPU?
Ja. Værktøjet foretrækker WebGPU, fordi en understøttet grafikprocessor kan køre Whisper langt hurtigere. Hvis WebGPU mangler eller fejler, prøver det igen med WebAssembly på CPU'en. Det virker i flere browsere, men kan være langsomt ved lange optagelser.
Hvor præcis bliver transskriptionen?
Whisper tiny giver et brugbart udkast fra tydelig tale, men ingen garanti for et ordret resultat. Støj, musik, overlappende stemmer, svage mikrofoner, usædvanlige navne og lang stilhed sænker kvaliteten. Tjek vigtige citater, medicinske oplysninger, juridiske udsagn og beslutninger mod originallyden.