CanDoYa
IT

Generatore di sottotitoli automatici

Funziona interamente nel browser: nessun caricamento, nessuna registrazione.

Aggiungi un video per generare sottotitoli privati e modificabili sul tuo dispositivo.

Condividi questo strumento

Come creare sottotitoli automatici per un video?

Aggiungi un video e questo generatore di sottotitoli automatici userà il riconoscimento vocale Whisper sul tuo dispositivo. Otterrai segmenti temporizzati e modificabili, da controllare e scaricare in SRT o VTT. Il video non viene mai caricato, anche se al primo utilizzo il browser deve scaricare il modello di IA.

Come si usa

  1. 1Scegli un video. Trascina nello strumento un file MP4, WebM, MOV, M4V o MKV, oppure fai clic sull'area di caricamento per selezionarlo.
  2. 2Genera i sottotitoli. Fai clic su Genera sottotitoli. Al primo utilizzo attendi il download del modello multilingue Whisper, poi lascia che il dispositivo elabori la traccia audio.
  3. 3Controlla ogni segmento. Riproduci i sottotitoli dall'editor, correggi il testo e regola l'inizio o la fine se il tempo automatico è in anticipo o in ritardo.
  4. 4Esporta il file. Scarica SRT per la maggior parte degli editor e delle piattaforme, oppure VTT per i video HTML e la pubblicazione sul Web.

A chi serve

Lo strumento estrae la traccia audio nel browser, la converte nel segnale mono a 16 kHz richiesto da Whisper e calcola i tempi in un processo in background. WebGPU accelera l'elaborazione sui computer compatibili; negli altri browser viene usata la CPU, più lenta. Prima dell'esportazione puoi correggere sia le parole sia i limiti di ogni segmento.

Domande frequenti

Il mio video viene caricato su un server?

No. Il browser legge il file selezionato e passa i campioni audio decodificati a un processo sullo stesso dispositivo. Il processo scarica i file del modello Whisper da Hugging Face, ma non invia il video, l'audio o i sottotitoli. CanDoYa non riceve né conserva il file.

Il generatore di sottotitoli automatici è gratis?

Sì. Non servono account o pagamenti e non ci sono limiti di minuti, filigrane o blocchi dell'esportazione. Poiché la trascrizione avviene sul dispositivo, i limiti pratici sono il tempo di elaborazione, la memoria disponibile e il primo download del modello. Il gestore potrebbe conteggiare il download se la connessione ha un limite di dati.

Quali dimensioni e durata del video sono ammesse?

Puoi caricare file fino a 500 MB. Non c'è un limite fisso di minuti, ma i video lunghi richiedono più memoria e tempo perché decodifica e IA funzionano in locale. Per registrazioni di un'ora usa un portatile recente, chiudi le schede che consumano molta memoria o dividi prima il video in parti più piccole.

Quali formati video funzionano?

Lo strumento accetta i contenitori MP4, WebM, MOV, M4V, MKV, AVI, MPEG e OGV. La decodifica dell'audio dipende dai codec presenti nel browser e nel sistema operativo. MP4 con audio AAC e WebM con audio Opus offrono in genere la compatibilità più ampia.

Posso modificare i sottotitoli automatici?

Sì. Puoi cambiare il testo, l'ora di inizio e l'ora di fine di ogni segmento. Riproduci un segmento per portare il video al suo inizio, correggi gli errori di riconoscimento e regola i limiti. L'esportazione resta disattivata se un segmento è vuoto, finisce prima di iniziare o supera la durata del video.

Qual è la differenza tra SRT e VTT?

SRT è un formato di sottotitoli molto diffuso negli editor video e sulle piattaforme di pubblicazione. WebVTT usa una struttura simile di testo temporizzato, ma è pensato per il Web e funziona direttamente con l'elemento track dei video HTML. Lo strumento esporta entrambi senza applicare stili o incorporare il testo nell'immagine.

La generazione funziona senza WebGPU?

Sì. Lo strumento prova prima WebGPU perché una scheda grafica compatibile può eseguire Whisper più velocemente. Se WebGPU non è disponibile o non funziona, riprova con WebAssembly sulla CPU. Questa alternativa supporta più browser, ma può essere molto più lenta, soprattutto con video lunghi, telefoni o computer meno recenti.

I sottotitoli automatici sono abbastanza accurati per l'accessibilità?

Sono una bozza utile, non un risultato finale per l'accessibilità. Rumore, musica, voci sovrapposte, accenti, nomi insoliti e termini tecnici possono causare errori. Il riconoscimento automatico omette anche molte descrizioni sonore e i nomi dei parlanti, quindi controlla il video e aggiungi le indicazioni non verbali importanti prima della pubblicazione.