CanDoYa
SL

Pretvorba zvoka v besedilo

Vse poteka v vašem brskalniku - brez nalaganja, brez registracije.

Dodajte zvočno datoteko za zasebni prepis v svoji napravi.

Delite to orodje

Kako pretvorim avdio v besedilo, ne da bi posnetek kam poslal?

Dodajte zvočno datoteko in orodje bo v vaši napravi zagnalo Whisperjev model za prepoznavanje govora. Nastane prepis, ki ga lahko uredite ter izvozite kot TXT ali SRT. Posnetek se nikoli ne pošlje na strežnik, mora pa brskalnik ob prvi uporabi prenesti model umetne inteligence.

Kako uporabljati

  1. 1Izberite posnetek. Datoteko MP3, WAV, M4A, OGG, FLAC ali WebM spustite na orodje oziroma kliknite območje za izbiro datoteke.
  2. 2Zaženite zasebni prepis. Kliknite „Prepiši zvok“. Ob prvem zagonu počakajte, da se prenese večjezični model Whisper, nato pa naj naprava obdela posnetek.
  3. 3Preverite in izvozite. Še enkrat poslušajte nejasne dele, popravite napake ter prepis kopirajte ali prenesite kot TXT oziroma SRT s časovnimi oznakami.

Komu je namenjeno

Orodje spremeni posneti govor v besedilo, ne da bi posnetek poslalo storitvi za prepisovanje. Model Whisper deluje v ločenem procesu brskalnika, zato stran ostane odzivna, medtem ko računalnik obdeluje zvok. Če je na voljo WebGPU, ga orodje uporabi, sicer preklopi na počasnejšo obdelavo s procesorjem. Preneseni model se shrani v predpomnilnik brskalnika za naslednje obiske.

Pogosta vprašanja

Ali se moj posnetek pošlje na strežnik?

Ne. Brskalnik dekodira izbrano datoteko in zvočne vzorce pošlje samo lokalnemu procesu v isti napravi. Ta proces prenese datoteke modela Whisper s platforme Hugging Face, vendar ne pošlje vašega posnetka ali prepisa. CanDoYa datoteke ne prejme in je ne shrani.

Je pretvorba zvoka v besedilo brezplačna?

Da. Ne potrebujete računa, plačila ali dobroimetja za prepis, prav tako ni vodnega žiga. Obdelavo z umetno inteligenco opravi vaša naprava, zato so dejanski stroški čas, pomnilnik in prvi prenos modela. Ponudnik dostopa do interneta lahko prenos modela všteje v omejeno količino podatkov.

Kako veliko in dolgo datoteko lahko prepišem?

Izberete lahko datoteko do 500 MB. Omejitve v minutah ni, vendar dolgi posnetki potrebujejo več pomnilnika in časa, ker obdelava poteka v napravi. Za enourne sestanke ali predavanja je sodoben prenosnik primernejši od telefona.

Katere zvočne oblike so podprte?

Orodje sprejme MP3, WAV, M4A, OGG, FLAC, WebM in več sorodnih oblik. Dejanska podpora za dekodiranje je odvisna od brskalnika in operacijskega sistema. Če je datoteka zavrnjena, čeprav je njena končnica navedena, jo pretvorite v MP3 ali nestisnjeni WAV in poskusite znova.

Katere jezike lahko Whisper prepiše?

Izbrani majhni model Whisper je večjezičen in samodejno prepozna številne govorjene jezike. Natančnost je odvisna od jezika, naglasa, kakovosti posnetka in teme. Model prepisa ne prevaja v drug jezik, ne ločuje govorcev ter ne zagotavlja pravilnega zapisa imen in strokovnih izrazov.

Zakaj se ob prvem prepisu prenese model?

Za zasebno prepoznavanje govora mora biti model v vašem računalniku. Način WebGPU prenese približno 80 MB, združljivi rezervni način q4 s procesorjem pa približno 105 MB. Brskalniki te datoteke praviloma shranijo v predpomnilnik in jih znova uporabijo, dokler ne izbrišete podatkov spletnega mesta ali predpomnilnika.

Ali prepisovanje deluje brez WebGPU?

Da. Orodje daje prednost WebGPU, ker podprt grafični procesor poganja Whisper precej hitreje. Če WebGPU ni na voljo ali ne deluje, orodje poskusi znova z WebAssemblyjem na procesorju. Ta možnost deluje v več brskalnikih, vendar je pri dolgih posnetkih lahko počasna, zlasti v telefonih in starejših računalnikih.

Kako natančen je prepis?

Whisper tiny pri jasnem govoru ustvari uporaben osnutek, ne zagotavlja pa dobesednega prepisa. Hrup v ozadju, glasba, hkratni govor, slab mikrofon, neobičajna imena in dolga tišina zmanjšajo natančnost ter lahko povzročijo izmišljene besede. Pomembne navedke, zdravstvene podatke, pravne izjave in odločitve preverite ob izvirnem posnetku.