CanDoYa
HR

Pretvaranje audiozapisa u tekst

Radi u cijelosti u pregledniku - bez slanja podataka i bez registracije.

Dodajte audiodatoteku za privatni prijepis na svojem uređaju.

Podijelite ovaj alat

Kako pretvoriti audio u tekst bez slanja snimke?

Dodajte audiodatoteku i alat će pokrenuti Whisperov model za prepoznavanje govora na vašem uređaju. Dobit ćete prijepis koji možete urediti te izvesti kao TXT ili SRT. Snimka se nikad ne šalje na poslužitelj, ali preglednik pri prvoj uporabi mora preuzeti AI model.

Kako se koristi

  1. 1Odaberite snimku. Ispustite MP3, WAV, M4A, OGG, FLAC ili WebM datoteku na alat ili pritisnite područje za odabir datoteke.
  2. 2Pokrenite privatni prijepis. Pritisnite „Prepiši audio“. Pri prvom pokretanju pričekajte da se preuzme višejezični model Whisper, a zatim dopustite uređaju da obradi snimku.
  3. 3Provjerite i izvezite. Ponovno poslušajte nejasne dijelove, ispravite pogreške pa kopirajte prijepis ili ga preuzmite kao TXT ili SRT s vremenskim oznakama.

Za koga je

Ovaj alat pretvara snimljeni govor u tekst bez slanja snimke servisu za transkripciju. Whisperov model radi u zasebnom procesu preglednika, pa stranica ostaje responzivna dok računalo obrađuje zvuk. WebGPU se koristi kada je dostupan, a ostali preglednici prelaze na sporiji rad s procesorom. Preuzeti model sprema se u predmemoriju preglednika za sljedeće posjete.

Česta pitanja

Šalje li se moj audio na poslužitelj?

Ne. Preglednik dekodira odabranu datoteku i šalje zvučne uzorke samo lokalnom procesu na istom uređaju. Taj proces preuzima datoteke modela Whisper s platforme Hugging Face, ali ne šalje vašu snimku ni prijepis. CanDoYa ne prima niti pohranjuje datoteku.

Je li pretvaranje audija u tekst besplatno?

Da. Nema računa, plaćanja, kredita za transkripciju ni vodenog žiga. AI obradu obavlja vaš uređaj, pa su stvarni troškovi vrijeme obrade, memorija i prvo preuzimanje modela. Davatelj internetske usluge može preuzimanje modela uračunati u ograničeni podatkovni promet.

Koliku datoteku i koliko dugu snimku mogu prepisati?

Možete odabrati datoteku do 500 MB. Nema fiksnog ograničenja u minutama, ali duge snimke traže više memorije i vremena jer se obrada odvija na uređaju. Za sastanke ili predavanja od sat vremena bolji je suvremeni laptop nego telefon.

Koji su audioformati podržani?

Alat prihvaća MP3, WAV, M4A, OGG, FLAC, WebM i nekoliko srodnih formata. Stvarna podrška za dekodiranje ovisi o pregledniku i operacijskom sustavu. Ako je datoteka odbijena iako je njezin nastavak naveden, pretvorite je u MP3 ili nekomprimirani WAV pa pokušajte ponovno.

Koje jezike Whisper može prepisati?

Odabrani mali model Whisper višejezičan je i automatski prepoznaje mnoge govorne jezike. Točnost ovisi o jeziku, naglasku, kvaliteti snimke i temi. Model ne prevodi prijepis na drugi jezik, ne prepoznaje govornike i ne jamči točno pisanje imena i stručnih izraza.

Zašto se pri prvom prijepisu preuzima model?

Za privatno prepoznavanje govora model mora biti na vašem računalu. WebGPU način preuzima oko 80 MB, a kompatibilni rezervni q4 način rada na procesoru oko 105 MB. Preglednici obično spremaju te datoteke u predmemoriju, pa ih mogu ponovno upotrijebiti dok ne izbrišete podatke web-mjesta ili predmemoriju.

Radi li transkripcija bez WebGPU-a?

Da. Alat daje prednost WebGPU-u jer podržani grafički procesor pokreće Whisper mnogo brže. Ako WebGPU nije dostupan ili zakaže, alat pokušava ponovno putem WebAssemblyja na procesoru. Ta zamjena radi u više preglednika, ali može biti spora za duge snimke, osobito na telefonima i starijim računalima.

Koliko je prijepis točan?

Whisper tiny daje korisnu radnu verziju kada je govor jasan, ali ne jamči doslovan prijepis. Pozadinska buka, glazba, istodobni govor, loši mikrofoni, neuobičajena imena i duga tišina smanjuju točnost te mogu stvoriti izmišljene riječi. Važne citate, medicinske podatke, pravne izjave i odluke provjerite prema izvornoj snimci.