CanDoYa
NB

Konverter lyd til tekst

Kjører helt i nettleseren - ingen opplasting, ingen registrering.

Legg til en lydfil for å lage en privat transkripsjon på enheten.

Del dette verktøyet

Hvordan gjør jeg lyd om til tekst uten å laste opp filen?

Legg til en lydfil, så kjører verktøyet Whisper-talegjenkjenning på enheten din. Du får en redigerbar transkripsjon som kan eksporteres som TXT eller SRT. Opptaket forlater aldri enheten, men nettleseren må laste ned KI-modellen første gang.

Slik bruker du verktøyet

  1. 1Velg opptaket. Dra en MP3-, WAV-, M4A-, OGG-, FLAC- eller WebM-fil inn i verktøyet, eller klikk på opplastingsfeltet for å velge den.
  2. 2Start privat transkribering. Klikk på Transkriber lyd. Første gang venter du mens den flerspråklige Whisper-modellen lastes ned, før enheten behandler opptaket.
  3. 3Se gjennom og eksporter. Lytt til usikre partier, rett eventuelle feil, og kopier teksten eller last den ned som TXT eller tidskodet SRT.

Hvem passer det for

Verktøyet gjør opptak av tale om til tekst uten å sende lyden til en transkripsjonstjeneste. Whisper-modellen kjører i en egen nettleser-worker, slik at siden fortsatt svarer mens datamaskinen arbeider. WebGPU brukes når det er tilgjengelig. Ellers går verktøyet over til en tregere prosessormodus. Den nedlastede modellen lagres vanligvis i nettleserens hurtigbuffer.

Vanlige spørsmål

Lastes lyden min opp til en server?

Nei. Nettleseren dekoder filen og sender bare lydprøvene til en lokal worker på samme enhet. Workeren henter Whisper-modellen fra Hugging Face, men laster ikke opp opptaket eller transkripsjonen. CanDoYa mottar eller lagrer ikke filen.

Er konvertering fra lyd til tekst gratis?

Ja. Du trenger ingen konto, betaling eller transkripsjonskreditter, og resultatet får ikke vannmerke. Enheten din utfører beregningen, så den praktiske kostnaden er tid, minne og den første modellnedlastingen. Et mobilabonnement kan regne nedlastingen mot datakvoten.

Hvor store og lange opptak kan jeg transkribere?

Filvelgeren godtar opptil 500 MB. Det finnes ingen fast minuttgrense, men lange opptak krever mer minne og tar lengre tid. Til møter eller forelesninger på en time er en moderne bærbar datamaskin bedre enn en telefon.

Hvilke lydformater støttes?

Verktøyet godtar MP3, WAV, M4A, OGG, FLAC, WebM og enkelte beslektede formater. Den faktiske dekodingen avhenger av nettleseren og operativsystemet. Hvis en fil avvises, kan du konvertere den til MP3 eller ukomprimert WAV og prøve igjen.

Hvilke språk kan Whisper transkribere?

Den valgte Whisper tiny-modellen er flerspråklig og oppdager automatisk mange talespråk. Nøyaktigheten varierer med språk, dialekt, lydkvalitet og tema. Modellen oversetter ikke, skiller ikke mellom talere og garanterer ikke riktig stavemåte for navn eller faguttrykk.

Hvorfor lastes en modell ned første gang?

Privat transkribering på enheten krever at talegjenkjenningsmodellen finnes på datamaskinen. WebGPU-versjonen laster ned omtrent 80 MB, mens den kvantiserte prosessorreserven er omtrent 105 MB. Nettleseren lagrer vanligvis filene til nettstedsdata eller hurtigbuffer tømmes.

Fungerer transkriberingen uten WebGPU?

Ja. Verktøyet foretrekker WebGPU fordi en støttet grafikkprosessor kan kjøre Whisper mye raskere. Hvis WebGPU mangler eller svikter, prøver det igjen med WebAssembly på prosessoren. Det fungerer i flere nettlesere, men kan være tregt for lange opptak.

Hvor nøyaktig blir transkripsjonen?

Whisper tiny gir et nyttig utkast fra tydelig tale, men garanterer ikke et ordrett resultat. Støy, musikk, overlappende stemmer, svake mikrofoner, uvanlige navn og lang stillhet senker kvaliteten. Kontroller viktige sitater, medisinske opplysninger, juridiske uttalelser og beslutninger mot originallyden.