CanDoYa
PT-BR

Gerador de legendas automáticas

Funciona inteiramente no seu navegador - sem upload, sem cadastro.

Adicione um vídeo para gerar legendas privadas e editáveis no seu dispositivo.

Compartilhe esta ferramenta

Como gerar legendas para um vídeo automaticamente?

Adicione um vídeo e este gerador de legendas automáticas usa o reconhecimento de fala do Whisper no seu dispositivo. Ele cria trechos cronometrados e editáveis para você conferir e baixar em SRT ou VTT. O vídeo nunca é enviado, embora o navegador precise baixar o modelo de IA no primeiro uso.

Como usar

  1. 1Escolha um vídeo. Arraste um arquivo MP4, WebM, MOV, M4V ou MKV para a ferramenta ou clique na área de upload para selecionar.
  2. 2Gere as legendas. Clique em Gerar legendas. No primeiro uso, aguarde o download do modelo multilíngue Whisper e deixe o dispositivo processar a faixa de áudio.
  3. 3Revise cada trecho. Reproduza as legendas no editor, corrija o texto e ajuste o início ou o fim quando o tempo automático estiver adiantado ou atrasado.
  4. 4Exporte o arquivo. Baixe SRT para usar na maioria dos editores e plataformas, ou VTT para vídeo HTML e publicação na web.

Para quem é

A ferramenta extrai a faixa de áudio dentro do navegador, converte o som para o sinal mono de 16 kHz esperado pelo Whisper e cria os tempos em segundo plano. O WebGPU acelera o processamento em computadores compatíveis; nos demais navegadores, a CPU assume o trabalho e leva mais tempo. No editor, você corrige as palavras e os limites de cada trecho antes de exportar.

Perguntas frequentes

Meu vídeo é enviado para um servidor?

Não. O navegador lê o arquivo selecionado e repassa as amostras de áudio decodificadas a um processo no mesmo dispositivo. Esse processo baixa os arquivos do modelo Whisper pelo Hugging Face, mas não envia seu vídeo, áudio ou legendas. A CanDoYa não recebe nem armazena o arquivo.

O gerador de legendas automáticas é gratuito?

Sim. Não há cadastro, pagamento, limite de minutos, marca d'água ou bloqueio de exportação. Como o dispositivo faz a transcrição, os limites práticos são o tempo de processamento, a memória disponível e o primeiro download do modelo. Sua operadora pode contabilizar esse download se a conexão tiver franquia de dados.

Qual tamanho e duração de vídeo posso legendar?

O upload aceita arquivos de até 500 MB. Não há um limite fixo de minutos, mas vídeos longos usam mais memória e demoram mais, pois a decodificação e a inferência da IA acontecem localmente. Para gravações de uma hora, use um notebook recente, feche abas que consomem muita memória ou divida o vídeo em partes menores.

Quais formatos de vídeo funcionam?

A ferramenta aceita contêineres MP4, WebM, MOV, M4V, MKV, AVI, MPEG e OGV. A decodificação do áudio depende dos codecs disponíveis no navegador e no sistema operacional. MP4 com áudio AAC e WebM com áudio Opus costumam ter a compatibilidade mais ampla.

Posso editar as legendas automáticas?

Sim. Cada trecho permite editar texto, hora de início e hora de término. Reproduza um trecho para levar o vídeo ao ponto inicial, corrija erros de reconhecimento e ajuste os limites. A exportação fica desativada se um trecho estiver vazio, terminar antes de começar ou ultrapassar a duração do vídeo.

Qual é a diferença entre SRT e VTT?

SRT é um formato de legendas amplamente aceito por editores de vídeo e plataformas de publicação. O WebVTT usa uma estrutura parecida de texto cronometrado, mas foi criado para a web e funciona diretamente com o elemento track do vídeo HTML. A ferramenta exporta os dois sem aplicar estilo visual nem incorporar o texto à imagem.

A geração de legendas funciona sem WebGPU?

Sim. A ferramenta tenta usar o WebGPU primeiro porque uma placa de vídeo compatível pode executar o Whisper mais rápido. Se o WebGPU não estiver disponível ou falhar, ela tenta novamente com WebAssembly na CPU. Essa alternativa funciona em mais navegadores, mas pode ser bem mais lenta, principalmente com vídeos longos, celulares ou computadores antigos.

As legendas automáticas são precisas o bastante para acessibilidade?

Elas são um bom rascunho, não uma entrega final de acessibilidade. Ruído, música, vozes sobrepostas, sotaques, nomes incomuns e termos técnicos podem causar erros. O reconhecimento automático também deixa de fora muitas descrições sonoras e identificações de falantes, então revise o vídeo e acrescente as indicações não verbais relevantes antes de publicar legendas descritivas.