CanDoYa
ET

Heli tekstiks teisendamine

Töötab täielikult sinu brauseris - midagi ei laadita üles, kontot pole vaja.

Lisa helifail ja loo oma seadmes privaatne transkript.

Jaga seda tööriista

Kuidas teisendada heli tekstiks ilma salvestist üles laadimata?

Lisa helifail ja tööriist käivitab sinu seadmes Whisperi kõnetuvastusmudeli. Tulemuseks on redigeeritav transkript, mille saab eksportida TXT- või SRT-failina. Salvestist ei laadita kuhugi üles, kuid esimesel kasutuskorral peab brauser AI mudeli alla laadima.

Kuidas kasutada

  1. 1Vali salvestis. Lohista tööriistale MP3-, WAV-, M4A-, OGG-, FLAC- või WebM-fail või klõpsa faili valimiseks üleslaadimisalal.
  2. 2Käivita privaatne transkribeerimine. Klõpsa nuppu „Transkribeeri heli“. Esimesel korral oota, kuni mitmekeelne Whisperi mudel alla laaditakse, seejärel lase seadmel salvestist töödelda.
  3. 3Kontrolli ja ekspordi. Kuula ebaselged kohad uuesti üle, paranda vead ning kopeeri transkript või laadi see alla TXT- või ajatemplitega SRT-failina.

Kellele see sobib

See tööriist muudab salvestatud kõne tekstiks ega saada salvestist transkribeerimisteenusele. Whisperi mudel töötab brauseri eraldi protsessis, nii et leht püsib reageeriv, kuni arvuti heli töötleb. Võimaluse korral kasutatakse WebGPU-d, muudes brauserites lülitub tööriist aeglasemale protsessorirežiimile. Allalaaditud mudel jääb brauseri vahemällu ja seda saab järgmisel külastusel uuesti kasutada.

Korduvad küsimused

Kas mu heli laaditakse serverisse?

Ei. Brauser dekodeerib valitud faili ja saadab helinäidised ainult sama seadme kohalikule protsessile. Protsess laadib Whisperi mudelifailid alla Hugging Face'ist, kuid ei laadi sinu salvestist ega transkripti üles. CanDoYa ei saa ega talleta faili.

Kas heli tekstiks teisendamine on tasuta?

Jah. Kontot, makset ega transkribeerimiskrediiti pole vaja ja tulemusele ei lisata vesimärki. AI arvutused teeb sinu seade, seega on praktiliseks kuluks töötlusaeg, mälu ja mudeli esimene allalaadimine. Mahupiiranguga paketi korral võib internetiteenuse pakkuja mudeli allalaadimise andmemahu hulka arvestada.

Kui suure ja pika salvestise saan transkribeerida?

Valida saab kuni 500 MB faili. Kindlat minutipiirangut ei ole, kuid pikk salvestis vajab rohkem mälu ja aega, sest töötlus toimub seadmes. Tunniajase koosoleku või loengu jaoks sobib tänapäevane sülearvuti telefonist paremini.

Milliseid helivorminguid toetatakse?

Tööriist võtab vastu MP3-, WAV-, M4A-, OGG-, FLAC-, WebM- ja mitmeid seotud vorminguid. Tegelik dekodeerimise tugi sõltub brauserist ja operatsioonisüsteemist. Kui fail lükatakse loetletud laiendist hoolimata tagasi, teisenda see MP3-ks või pakkimata WAV-failiks ja proovi uuesti.

Milliseid keeli suudab Whisper transkribeerida?

Valitud väike Whisperi mudel on mitmekeelne ja tuvastab automaatselt paljusid kõneldavaid keeli. Täpsus sõltub keelest, aktsendist, salvestise kvaliteedist ja teemast. Mudel ei tõlgi transkripti teise keelde, ei erista kõnelejaid ega taga nimede ja erialaterminite õiget kirjapilti.

Miks laaditakse esimesel transkribeerimisel mudel alla?

Privaatseks kõnetuvastuseks peab mudel olema sinu arvutis. WebGPU režiim laadib alla umbes 80 MB, ühilduv q4 protsessori varurežiim aga umbes 105 MB. Brauserid hoiavad neid faile tavaliselt vahemälus ja kasutavad uuesti, kui saidiandmeid või vahemälu ei kustutata.

Kas transkribeerimine töötab ilma WebGPU-ta?

Jah. Tööriist eelistab WebGPU-d, sest toetatud graafikaprotsessor suudab Whisperit palju kiiremini käitada. Kui WebGPU puudub või nurjub, proovib tööriist uuesti protsessori WebAssembly abil. See varulahendus töötab rohkemates brauserites, kuid võib pika salvestisega aeglane olla, eriti telefonis ja vanemas arvutis.

Kui täpne on transkript?

Whisper tiny annab selgest kõnest kasuliku mustandi, kuid ei taga sõnasõnalist transkripti. Taustamüra, muusika, kattuv kõne, nõrk mikrofon, haruldased nimed ja pikk vaikus vähendavad täpsust ning võivad tekitada väljamõeldud sõnu. Olulised tsitaadid, meditsiinilised andmed, õiguslikud väited ja otsused kontrolli algse salvestise järgi üle.