Lo strumento estrae la traccia audio nel browser, la converte nel segnale mono a 16 kHz richiesto da Whisper e calcola i tempi in un processo in background. WebGPU accelera l'elaborazione sui computer compatibili; negli altri browser viene usata la CPU, più lenta. Prima dell'esportazione puoi correggere sia le parole sia i limiti di ogni segmento.
Generatore di sottotitoli automatici
Funziona interamente nel browser: nessun caricamento, nessuna registrazione.
Come creare sottotitoli automatici per un video?
Aggiungi un video e questo generatore di sottotitoli automatici userà il riconoscimento vocale Whisper sul tuo dispositivo. Otterrai segmenti temporizzati e modificabili, da controllare e scaricare in SRT o VTT. Il video non viene mai caricato, anche se al primo utilizzo il browser deve scaricare il modello di IA.
Come si usa
- 1Scegli un video. Trascina nello strumento un file MP4, WebM, MOV, M4V o MKV, oppure fai clic sull'area di caricamento per selezionarlo.
- 2Genera i sottotitoli. Fai clic su Genera sottotitoli. Al primo utilizzo attendi il download del modello multilingue Whisper, poi lascia che il dispositivo elabori la traccia audio.
- 3Controlla ogni segmento. Riproduci i sottotitoli dall'editor, correggi il testo e regola l'inizio o la fine se il tempo automatico è in anticipo o in ritardo.
- 4Esporta il file. Scarica SRT per la maggior parte degli editor e delle piattaforme, oppure VTT per i video HTML e la pubblicazione sul Web.
A chi serve
- Creator di video brevi che preparano sottotitoli leggibili prima di applicare lo stile o incorporarli nel montaggio finale.
- Insegnanti e formatori che rendono le lezioni registrate più facili da seguire e offrono una traccia di sottotitoli da scaricare.
- Podcaster e intervistatori che trasformano le conversazioni video in una bozza temporizzata senza inviare materiale inedito a un servizio di trascrizione cloud.
- Revisori dell'accessibilità che creano una prima versione per controllare parlato, nomi, indicazioni sonore, tempi e velocità di lettura.
Domande frequenti
Il mio video viene caricato su un server?
No. Il browser legge il file selezionato e passa i campioni audio decodificati a un processo sullo stesso dispositivo. Il processo scarica i file del modello Whisper da Hugging Face, ma non invia il video, l'audio o i sottotitoli. CanDoYa non riceve né conserva il file.
Il generatore di sottotitoli automatici è gratis?
Sì. Non servono account o pagamenti e non ci sono limiti di minuti, filigrane o blocchi dell'esportazione. Poiché la trascrizione avviene sul dispositivo, i limiti pratici sono il tempo di elaborazione, la memoria disponibile e il primo download del modello. Il gestore potrebbe conteggiare il download se la connessione ha un limite di dati.
Quali dimensioni e durata del video sono ammesse?
Puoi caricare file fino a 500 MB. Non c'è un limite fisso di minuti, ma i video lunghi richiedono più memoria e tempo perché decodifica e IA funzionano in locale. Per registrazioni di un'ora usa un portatile recente, chiudi le schede che consumano molta memoria o dividi prima il video in parti più piccole.
Quali formati video funzionano?
Lo strumento accetta i contenitori MP4, WebM, MOV, M4V, MKV, AVI, MPEG e OGV. La decodifica dell'audio dipende dai codec presenti nel browser e nel sistema operativo. MP4 con audio AAC e WebM con audio Opus offrono in genere la compatibilità più ampia.
Posso modificare i sottotitoli automatici?
Sì. Puoi cambiare il testo, l'ora di inizio e l'ora di fine di ogni segmento. Riproduci un segmento per portare il video al suo inizio, correggi gli errori di riconoscimento e regola i limiti. L'esportazione resta disattivata se un segmento è vuoto, finisce prima di iniziare o supera la durata del video.
Qual è la differenza tra SRT e VTT?
SRT è un formato di sottotitoli molto diffuso negli editor video e sulle piattaforme di pubblicazione. WebVTT usa una struttura simile di testo temporizzato, ma è pensato per il Web e funziona direttamente con l'elemento track dei video HTML. Lo strumento esporta entrambi senza applicare stili o incorporare il testo nell'immagine.
La generazione funziona senza WebGPU?
Sì. Lo strumento prova prima WebGPU perché una scheda grafica compatibile può eseguire Whisper più velocemente. Se WebGPU non è disponibile o non funziona, riprova con WebAssembly sulla CPU. Questa alternativa supporta più browser, ma può essere molto più lenta, soprattutto con video lunghi, telefoni o computer meno recenti.
I sottotitoli automatici sono abbastanza accurati per l'accessibilità?
Sono una bozza utile, non un risultato finale per l'accessibilità. Rumore, musica, voci sovrapposte, accenti, nomi insoliti e termini tecnici possono causare errori. Il riconoscimento automatico omette anche molte descrizioni sonore e i nomi dei parlanti, quindi controlla il video e aggiungi le indicazioni non verbali importanti prima della pubblicazione.