Nástroj převádí nahranou řeč na text, aniž by nahrávku posílal přepisovací službě. Model Whisper běží v pracovním vlákně prohlížeče, takže stránka zůstává během zpracování použitelná. Je-li dostupné WebGPU, využije se grafický procesor. V ostatních prohlížečích se použije pomalejší režim CPU. Stažený model si prohlížeč uloží pro další návštěvy.
Přepis zvuku na text
Běží celé ve vašem prohlížeči - nic se nenahrává, žádná registrace.
Jak soukromě přepsat zvuk na text?
Přidejte zvukový soubor a převodník spustí rozpoznávání řeči Whisper přímo ve vašem zařízení. Výsledkem je upravitelný přepis, který lze stáhnout jako TXT nebo SRT. Nahrávka se nikam neodesílá, při prvním použití si však prohlížeč musí stáhnout model AI.
Jak na to
- 1Vyberte nahrávku. Přetáhněte do nástroje soubor MP3, WAV, M4A, OGG, FLAC či WebM nebo klikněte na oblast pro nahrání a soubor vyberte.
- 2Spusťte soukromý přepis. Klikněte na Přepsat zvuk. Při prvním spuštění počkejte na stažení vícejazyčného modelu Whisper a potom nechte zařízení nahrávku zpracovat.
- 3Zkontrolujte a stáhněte. Nejisté pasáže si znovu poslechněte, opravte chyby a přepis zkopírujte nebo stáhněte jako TXT či časovaný SRT.
Pro koho je nástroj
- Novináři a výzkumníci získají soukromý první přepis a následně ověří jména i citace podle nahrávky.
- Studenti převedou nahrané přednášky nebo hlasové poznámky na upravitelný text bez odesílání školního zvuku.
- Tvůrci podcastů a videí připraví hrubý přepis nebo časovaný soubor SRT pro titulky.
- Týmy pracující s citlivými nahrávkami ponechají zdrojový zvuk v zařízení místo odeslání do cloudové fronty.
Časté dotazy
Odesílá se můj zvuk na server?
Ne. Prohlížeč dekóduje vybraný soubor a zvukové vzorky předá pouze místnímu pracovnímu vláknu ve stejném zařízení. Vlákno stáhne soubory modelu Whisper z Hugging Face, ale nahrávku ani přepis nikam neodesílá. CanDoYa soubor nepřijímá ani neukládá.
Je převod zvuku na text zdarma?
Ano. Není potřeba účet, platba, kredit ani vodoznak. Výpočet provádí vaše zařízení, praktickou cenou je tedy čas, paměť a první stažení modelu. Poskytovatel internetu může stažení modelu započítat do datového limitu.
Jak velký a dlouhý záznam mohu přepsat?
Lze vybrat soubor do 500 MB. Pevný limit minut není stanoven, dlouhé nahrávky však potřebují více paměti a zpracování trvá déle. Pro hodinové porady nebo přednášky je vhodnější moderní notebook než telefon.
Které zvukové formáty jsou podporované?
Nástroj přijímá MP3, WAV, M4A, OGG, FLAC, WebM a několik příbuzných formátů. Skutečná podpora dekódování závisí na prohlížeči a operačním systému. Pokud soubor s uvedenou příponou nefunguje, převeďte jej na MP3 nebo nekomprimovaný WAV.
Které jazyky Whisper přepisuje?
Použitý malý model Whisper je vícejazyčný a automaticky rozpozná mnoho mluvených jazyků. Přesnost se liší podle jazyka, přízvuku, kvality záznamu a tématu. Model nepřekládá do jiného jazyka, nerozlišuje mluvčí a nezaručuje správný zápis jmen ani odborných výrazů.
Proč se při prvním přepisu stahuje model?
Soukromé zpracování v zařízení potřebuje model rozpoznávání řeči přímo v počítači. Varianta WebGPU stáhne přibližně 80 MB, kvantovaná záloha pro CPU asi 105 MB. Prohlížeč soubory obvykle uloží, dokud nevymažete data webu nebo mezipaměť.
Funguje přepis i bez WebGPU?
Ano. Nástroj dává přednost WebGPU, protože podporovaný grafický procesor dokáže Whisper výrazně urychlit. Když WebGPU chybí nebo selže, přepne se na WebAssembly v CPU. Tento režim funguje ve více prohlížečích, ale u dlouhých nahrávek může být pomalý.
Jak přesný je přepis?
Whisper tiny vytvoří z čisté řeči užitečný návrh, nikoli zaručeně doslovný přepis. Hluk, hudba, překrývající se hlasy, slabý mikrofon, neobvyklá jména a dlouhé ticho přesnost snižují. Důležité citace, zdravotní údaje, právní výroky a rozhodnutí ověřte podle původního zvuku.