Questo strumento trasforma una registrazione vocale in testo senza inviarla a un servizio di trascrizione. Il modello Whisper funziona in un worker del browser, così la pagina resta reattiva mentre il computer elabora l'audio. Quando è disponibile viene usato WebGPU; negli altri browser entra in funzione la modalità CPU, più lenta. Il browser conserva il modello scaricato nella cache per gli utilizzi successivi.
Trascrivere audio in testo
Funziona interamente nel browser: nessun caricamento, nessuna registrazione.
Come trascrivere audio in testo senza caricarlo online?
Aggiungi un file audio: il convertitore esegue il modello di riconoscimento vocale Whisper sul dispositivo. Ottieni una trascrizione modificabile da esportare in TXT o SRT. La registrazione non viene mai caricata, ma al primo utilizzo il browser deve scaricare il modello di IA.
Come si usa
- 1Scegli la registrazione. Trascina nello strumento un file MP3, WAV, M4A, OGG, FLAC o WebM, oppure fai clic nell'area di caricamento per selezionarlo.
- 2Avvia la trascrizione privata. Fai clic su Trascrivi audio. Al primo avvio attendi il download del modello Whisper multilingue, poi lascia che il dispositivo elabori la registrazione.
- 3Controlla ed esporta. Riascolta i passaggi incerti, correggi gli errori e infine copia la trascrizione oppure scaricala in TXT o SRT con indicazioni temporali.
A chi serve
- Intervistatori e ricercatori che preparano una prima bozza privata prima di verificare nomi e citazioni sulla registrazione.
- Studenti che trasformano lezioni registrate o appunti vocali in testo modificabile senza caricare l'audio delle lezioni.
- Podcaster e videomaker che vogliono una trascrizione di lavoro o un file SRT con indicazioni temporali per i sottotitoli.
- Gruppi che gestiscono registrazioni riservate e preferiscono lasciare l'audio originale sul dispositivo invece di inviarlo a un servizio cloud.
Domande frequenti
Il mio audio viene caricato su un server?
No. Il browser decodifica il file selezionato e invia i campioni audio soltanto a un worker locale sullo stesso dispositivo. Il worker scarica i file del modello Whisper da Hugging Face, ma non carica la registrazione né la trascrizione. CanDoYa non riceve e non conserva il file.
La trascrizione audio è gratis?
Sì. Non servono account, pagamenti o crediti di trascrizione e non viene aggiunta alcuna filigrana. È il dispositivo a eseguire l'inferenza IA, quindi i costi pratici sono il tempo di elaborazione, la memoria e il primo download del modello. Il gestore internet può comunque conteggiare il download nel traffico dati.
Quali dimensioni e durate posso trascrivere?
Puoi selezionare file fino a 500 MB. Non esiste un limite fisso in minuti, ma le registrazioni lunghe richiedono più memoria e tempo perché l'elaborazione avviene sul dispositivo. Per riunioni o lezioni di un'ora è preferibile un portatile recente rispetto a uno smartphone.
Quali formati audio sono supportati?
Lo strumento accetta MP3, WAV, M4A, OGG, FLAC, WebM e alcuni formati simili. La compatibilità di decodifica dipende dal browser e dal sistema operativo. Se un file viene rifiutato nonostante l'estensione sia nell'elenco, convertilo in MP3 o WAV non compresso e riprova.
Quali lingue può trascrivere Whisper?
Il modello Whisper tiny scelto è multilingue e riconosce automaticamente molte lingue parlate. La precisione cambia in base a lingua, accento, qualità della registrazione e argomento. Non traduce il testo in un'altra lingua, non distingue i parlanti e non garantisce la grafia corretta di nomi o termini specialistici.
Perché la prima trascrizione scarica un modello?
Per trascrivere in privato sul dispositivo, il modello di riconoscimento vocale deve trovarsi sul computer. Il percorso WebGPU scarica circa 80 MB, mentre la modalità CPU quantizzata ne richiede circa 105 MB. Di norma il browser conserva i file nella cache e li riutilizza, a meno che non vengano cancellati i dati del sito o la cache.
La trascrizione funziona anche senza WebGPU?
Sì. Lo strumento preferisce WebGPU perché un processore grafico compatibile può eseguire Whisper molto più velocemente. Se WebGPU manca o non funziona, riprova con WebAssembly sulla CPU. Questa modalità è compatibile con più browser, ma può essere lenta sulle registrazioni lunghe, soprattutto su smartphone e computer meno recenti.
Quanto è precisa la trascrizione?
Con una voce nitida Whisper tiny produce una buona bozza, ma non garantisce una trascrizione letterale. Rumore di fondo, musica, persone che parlano insieme, microfoni scadenti, nomi insoliti e lunghi silenzi riducono la precisione e possono generare parole inesistenti. Verifica sull'audio originale citazioni importanti, dati medici, dichiarazioni legali e decisioni.