Acest instrument transformă vorbirea înregistrată în text fără să trimită fișierul unui serviciu de transcriere. Modelul Whisper rulează într-un proces separat al browserului, așa că pagina rămâne utilizabilă în timp ce computerul face procesarea. Dacă WebGPU este disponibil, va fi folosit; celelalte browsere trec la un mod CPU mai lent. Modelul descărcat rămâne în memoria cache a browserului pentru vizitele următoare.
Transcriere audio în text
Rulează integral în browserul tău - fără încărcare, fără cont.
Cum pot face o transcriere audio în text în mod privat?
Adaugă un fișier audio, iar instrumentul rulează modelul de recunoaștere vocală Whisper pe dispozitivul tău. Primești o transcriere editabilă, pe care o poți exporta ca TXT sau SRT. Înregistrarea nu este încărcată nicăieri, însă browserul trebuie să descarce modelul AI la prima utilizare.
Cum se folosește
- 1Alege înregistrarea. Trage un fișier MP3, WAV, M4A, OGG, FLAC sau WebM peste instrument ori apasă pe zona de încărcare ca să îl alegi.
- 2Pornește transcrierea privată. Apasă Transcrie fișierul audio. La prima rulare, așteaptă descărcarea modelului Whisper multilingv, apoi lasă-l să proceseze înregistrarea pe dispozitiv.
- 3Verifică și exportă. Ascultă din nou fragmentele neclare, corectează greșelile, apoi copiază transcrierea sau descarc-o în format TXT ori SRT cu marcaje de timp.
Pentru cine este
- Intervievatori și cercetători care vor o primă versiune privată înainte să verifice numele și citatele în înregistrare.
- Studenți care transformă cursuri înregistrate sau notițe vocale în text editabil, fără să încarce sunetul din sala de curs.
- Creatori de podcasturi și materiale video care pregătesc o transcriere de lucru sau un fișier SRT cu marcaje de timp pentru subtitrări.
- Echipe care lucrează cu înregistrări sensibile și păstrează sursa audio pe dispozitiv, în loc să o trimită într-o coadă de transcriere în cloud.
Întrebări frecvente
Fișierul meu audio este încărcat pe un server?
Nu. Browserul decodează fișierul ales și trimite mostrele audio doar către un proces local de pe același dispozitiv. Procesul descarcă fișierele modelului Whisper de la Hugging Face, dar nu încarcă înregistrarea sau transcrierea. CanDoYa nu primește și nu stochează fișierul.
Instrumentul de transcriere audio este gratuit?
Da. Nu ai nevoie de cont, plată sau credite de transcriere, iar rezultatul nu are filigran. Dispozitivul tău efectuează procesarea AI, deci costul practic înseamnă timp, memorie și prima descărcare a modelului. Furnizorul de internet poate taxa datele dacă folosești o conexiune contorizată.
Ce dimensiune și ce durată poate avea înregistrarea?
Controlul de încărcare acceptă fișiere de până la 500 MB. Nu există o limită fixă de minute, dar înregistrările lungi consumă mai multă memorie și durează mai mult, fiind procesate pe dispozitiv. Pentru o ședință sau un curs de o oră, un laptop modern este mai potrivit decât un telefon.
Ce formate audio sunt acceptate?
Instrumentul acceptă MP3, WAV, M4A, OGG, FLAC, WebM și câteva formate înrudite. Decodarea efectivă depinde de browser și de sistemul de operare. Dacă un fișier este respins deși extensia apare în listă, convertește-l în MP3 sau WAV necomprimat și încearcă din nou.
Ce limbi poate transcrie Whisper?
Modelul Whisper tiny selectat este multilingv și detectează automat multe limbi vorbite. Acuratețea variază în funcție de limbă, accent, calitatea înregistrării și subiect. Nu traduce transcrierea în altă limbă, nu identifică vorbitorii și nu garantează ortografierea corectă a numelor sau termenilor specializați.
De ce prima transcriere descarcă un model?
Pentru transcriere privată pe dispozitiv, modelul de recunoaștere vocală trebuie să se afle pe computer. Varianta WebGPU descarcă aproximativ 80 MB, iar alternativa pentru CPU aproximativ 105 MB. În mod normal, browserul păstrează aceste fișiere în cache pentru utilizările următoare, până când ștergi datele site-ului sau memoria cache.
Transcrierea funcționează fără WebGPU?
Da. Instrumentul preferă WebGPU deoarece un procesor grafic compatibil poate rula Whisper mult mai repede. Dacă WebGPU lipsește sau eșuează, încearcă din nou cu WebAssembly pe CPU. Această alternativă funcționează în mai multe browsere, dar poate fi lentă pentru înregistrări lungi, mai ales pe telefoane și computere vechi.
Cât de precisă este transcrierea?
Whisper tiny oferă o versiune de lucru utilă pentru vorbirea clară, dar nu garantează fiecare cuvânt. Zgomotul de fond, muzica, discuțiile suprapuse, microfoanele slabe, numele neobișnuite și pauzele lungi scad acuratețea și pot genera cuvinte inexistente. Compară citatele importante, datele medicale, declarațiile juridice și deciziile cu înregistrarea originală.