CanDoYa
PT-PT

Gerador de legendas automáticas

Funciona inteiramente no navegador - sem carregar nada, sem registo.

Adicione um vídeo para gerar legendas privadas e editáveis no seu dispositivo.

Partilhe esta ferramenta

Como gerar legendas para um vídeo automaticamente?

Adicione um vídeo e este gerador de legendas automáticas usa o reconhecimento de voz do Whisper no seu dispositivo. Cria segmentos temporizados e editáveis que pode rever e descarregar em SRT ou VTT. O vídeo nunca é carregado, embora o navegador tenha de descarregar o modelo de IA na primeira utilização.

Como utilizar

  1. 1Escolha um vídeo. Arraste um ficheiro MP4, WebM, MOV, M4V ou MKV para a ferramenta, ou clique na área de carregamento para o selecionar.
  2. 2Gere as legendas. Clique em Gerar legendas. Na primeira utilização, aguarde pelo modelo multilingue Whisper e deixe o dispositivo processar a faixa de áudio.
  3. 3Reveja cada segmento. Reproduza as legendas no editor, corrija o texto e ajuste o início ou o fim quando a temporização automática estiver adiantada ou atrasada.
  4. 4Exporte o ficheiro. Descarregue SRT para utilizar na maioria dos editores e plataformas, ou VTT para vídeo HTML e publicação na Web.

Para quem é

A ferramenta extrai a faixa de áudio no navegador, converte-a no sinal mono de 16 kHz esperado pelo Whisper e calcula os tempos num processo em segundo plano. O WebGPU acelera o trabalho em computadores compatíveis; nos restantes navegadores é usado o processador, que demora mais. O editor permite corrigir as palavras e os limites de cada segmento antes da exportação.

Perguntas frequentes

O meu vídeo é carregado para um servidor?

Não. O navegador lê o ficheiro selecionado e passa as amostras de áudio descodificadas a um processo no mesmo dispositivo. Esse processo descarrega os ficheiros do modelo Whisper através do Hugging Face, mas não envia o vídeo, o áudio ou as legendas. A CanDoYa não recebe nem guarda o ficheiro.

O gerador de legendas automáticas é gratuito?

Sim. Não há registo, pagamento, limite de minutos, marca de água ou bloqueio da exportação. Como a transcrição é feita no dispositivo, os limites práticos são o tempo de processamento, a memória disponível e o primeiro descarregamento do modelo. O fornecedor de Internet poderá contabilizar esse descarregamento numa ligação com limite de dados.

Que tamanho e duração de vídeo posso legendar?

O carregamento aceita ficheiros até 500 MB. Não há um limite fixo de minutos, mas os vídeos longos consomem mais memória e demoram mais porque a descodificação e a inferência da IA são locais. Para gravações de uma hora, utilize um portátil recente, feche separadores que consumam muita memória ou divida primeiro o vídeo em partes menores.

Que formatos de vídeo são compatíveis?

A ferramenta aceita contentores MP4, WebM, MOV, M4V, MKV, AVI, MPEG e OGV. A descodificação do áudio depende dos codecs disponíveis no navegador e no sistema operativo. MP4 com áudio AAC e WebM com áudio Opus costumam ter a compatibilidade mais ampla.

Posso editar as legendas automáticas?

Sim. Cada segmento permite editar o texto, a hora de início e a hora de fim. Reproduza um segmento para avançar o vídeo até ao seu início, corrija erros de reconhecimento e ajuste os limites. A exportação fica desativada se um segmento estiver vazio, terminar antes de começar ou ultrapassar a duração do vídeo.

Qual é a diferença entre SRT e VTT?

SRT é um formato de legendas amplamente suportado por editores de vídeo e plataformas de publicação. O WebVTT usa uma estrutura semelhante de texto temporizado, mas foi criado para a Web e funciona diretamente com o elemento track do vídeo HTML. A ferramenta exporta ambos sem aplicar estilos nem incorporar texto na imagem.

A geração de legendas funciona sem WebGPU?

Sim. A ferramenta tenta primeiro o WebGPU porque uma placa gráfica compatível pode executar o Whisper mais depressa. Se não estiver disponível ou falhar, volta a tentar com WebAssembly no processador. Esta alternativa funciona em mais navegadores, mas pode ser muito mais lenta, sobretudo com vídeos longos, telemóveis ou computadores antigos.

As legendas automáticas são suficientemente rigorosas para acessibilidade?

São um rascunho útil, não um trabalho final de acessibilidade. Ruído, música, vozes sobrepostas, sotaques, nomes pouco comuns e termos técnicos podem causar erros. O reconhecimento automático também omite muitas descrições sonoras e identificações de falantes, por isso reveja o vídeo e acrescente as indicações não verbais relevantes antes de publicar legendas descritivas.