CanDoYa
SR

Pretvaranje audio-snimka u tekst

Radi u celosti u pregledaču - bez otpremanja i bez registracije.

Dodajte audio-fajl za privatni transkript na svom uređaju.

Podelite ovu alatku

Kako pretvoriti audio u tekst bez slanja snimka?

Dodajte audio-fajl i alat će na vašem uređaju pokrenuti Whisperov model za prepoznavanje govora. Dobićete transkript koji možete da uredite i izvezete kao TXT ili SRT. Snimak se nikada ne šalje na server, ali pregledač pri prvoj upotrebi mora da preuzme AI model.

Kako se koristi

  1. 1Izaberite snimak. Prevucite MP3, WAV, M4A, OGG, FLAC ili WebM fajl na alat ili kliknite na polje za izbor fajla.
  2. 2Pokrenite privatnu transkripciju. Kliknite na „Transkribuj audio“. Pri prvom pokretanju sačekajte da se preuzme višejezični model Whisper, a zatim pustite uređaj da obradi snimak.
  3. 3Proverite i izvezite. Ponovo poslušajte nejasne delove, ispravite greške, pa kopirajte transkript ili ga preuzmite kao TXT ili SRT sa vremenskim oznakama.

Kome je namenjen

Ovaj alat pretvara snimljeni govor u tekst bez slanja snimka servisu za transkripciju. Whisperov model radi u posebnom procesu pregledača, pa stranica ostaje responzivna dok računar obrađuje zvuk. WebGPU se koristi kada je dostupan, dok ostali pregledači prelaze na sporiji rad preko procesora. Preuzeti model ostaje u kešu pregledača za naredne posete.

Česta pitanja

Da li se moj audio šalje na server?

Ne. Pregledač dekodira izabrani fajl i šalje audio-uzorke samo lokalnom procesu na istom uređaju. Taj proces preuzima fajlove modela Whisper sa platforme Hugging Face, ali ne šalje vaš snimak niti transkript. CanDoYa ne prima i ne čuva fajl.

Da li je pretvaranje audija u tekst besplatno?

Da. Nema naloga, plaćanja, kredita za transkripciju ni vodenog žiga. AI obradu obavlja vaš uređaj, pa su praktični troškovi vreme obrade, memorija i prvo preuzimanje modela. Internet provajder može da uračuna model u ograničeni paket podataka.

Koliki fajl i koliko dug snimak mogu da transkribujem?

Možete da izaberete fajl do 500 MB. Nema fiksnog ograničenja u minutima, ali dugi snimci traže više memorije i vremena jer se obrada odvija na uređaju. Za sastanke ili predavanja duge sat vremena bolji je savremen laptop nego telefon.

Koji audio-formati su podržani?

Alat prihvata MP3, WAV, M4A, OGG, FLAC, WebM i nekoliko srodnih formata. Stvarna podrška za dekodiranje zavisi od pregledača i operativnog sistema. Ako je fajl odbijen iako mu je nastavak naveden, pretvorite ga u MP3 ili nekompresovani WAV i pokušajte ponovo.

Koje jezike Whisper može da transkribuje?

Izabrani mali model Whisper je višejezičan i automatski prepoznaje mnoge govorne jezike. Tačnost zavisi od jezika, akcenta, kvaliteta snimka i teme. Model ne prevodi transkript na drugi jezik, ne prepoznaje govornike i ne garantuje pravilno pisanje imena i stručnih izraza.

Zašto se pri prvoj transkripciji preuzima model?

Za privatno prepoznavanje govora model mora da bude na vašem računaru. WebGPU režim preuzima oko 80 MB, a kompatibilni rezervni q4 režim na procesoru oko 105 MB. Pregledači obično čuvaju te fajlove u kešu, pa ih ponovo koriste dok ne obrišete podatke sajta ili keš.

Da li transkripcija radi bez WebGPU-a?

Da. Alat daje prednost WebGPU-u jer podržani grafički procesor može mnogo brže da pokrene Whisper. Ako WebGPU nije dostupan ili zakaže, alat pokušava ponovo koristeći WebAssembly na procesoru. Ova zamena radi u više pregledača, ali može da bude spora za duge snimke, posebno na telefonima i starijim računarima.

Koliko je transkript tačan?

Whisper tiny daje korisnu radnu verziju kada je govor jasan, ali ne garantuje doslovan transkript. Pozadinska buka, muzika, istovremeni govor, loši mikrofoni, neuobičajena imena i duga tišina smanjuju tačnost i mogu da stvore izmišljene reči. Važne citate, medicinske podatke, pravne izjave i odluke proverite uz originalni snimak.