CanDoYa
PT-BR

Conversor de áudio para texto

Funciona inteiramente no seu navegador - sem upload, sem cadastro.

Adicione um arquivo de áudio para criar uma transcrição privada no seu dispositivo.

Compartilhe esta ferramenta

Como transformar áudio em texto com privacidade?

Adicione um arquivo de áudio e este conversor executará o reconhecimento de fala do Whisper no seu dispositivo. O resultado é uma transcrição editável que pode ser exportada em TXT ou SRT. A gravação nunca é enviada, embora o navegador precise baixar o modelo de IA no primeiro uso.

Como usar

  1. 1Escolha a gravação. Arraste um arquivo MP3, WAV, M4A, OGG, FLAC ou WebM para a ferramenta ou clique na área de upload para escolher um arquivo.
  2. 2Inicie a transcrição privada. Clique em Transcrever áudio. No primeiro uso, aguarde o download do modelo multilíngue Whisper e deixe que ele processe a gravação no seu dispositivo.
  3. 3Revise e exporte. Escute novamente os trechos duvidosos, corrija os erros e copie a transcrição ou baixe o resultado em TXT ou SRT com marcações de tempo.

Para quem é

Esta ferramenta transforma fala gravada em texto sem enviar a gravação para um serviço de transcrição. O modelo Whisper é executado em um processo separado do navegador, mantendo a página responsiva enquanto o computador faz o processamento. Quando disponível, o WebGPU acelera o trabalho; outros navegadores usam um modo de CPU mais lento. O navegador armazena o modelo baixado no cache para as próximas visitas.

Perguntas frequentes

Meu áudio é enviado para um servidor?

Não. O navegador decodifica o arquivo selecionado e envia as amostras de áudio somente para um processo local no mesmo dispositivo. Esse processo baixa os arquivos do modelo Whisper do Hugging Face, mas não envia a gravação nem a transcrição. A CanDoYa não recebe nem armazena o arquivo.

O conversor de áudio para texto é grátis?

Sim. Não há conta, pagamento, créditos de transcrição nem marca d’água. Seu dispositivo executa a IA, então o custo prático é o tempo de processamento, a memória e o primeiro download do modelo. Se o plano de internet tiver franquia, esse download ainda poderá contar no consumo de dados.

Que tamanho e duração de gravação posso transcrever?

O campo de upload aceita arquivos de até 500 MB. Não existe uma cota fixa de minutos, mas gravações longas usam mais memória e demoram mais porque o processamento ocorre no dispositivo. Para reuniões ou aulas com uma hora de duração, um notebook moderno costuma ser melhor do que um celular.

Quais formatos de áudio são compatíveis?

A ferramenta aceita MP3, WAV, M4A, OGG, FLAC, WebM e vários formatos relacionados. A compatibilidade real de decodificação depende do navegador e do sistema operacional. Se um arquivo falhar mesmo com uma extensão listada, converta-o para MP3 ou WAV sem compressão e tente de novo.

Quais idiomas o Whisper consegue transcrever?

O modelo Whisper tiny escolhido é multilíngue e detecta automaticamente muitos idiomas falados. A precisão varia conforme o idioma, o sotaque, a qualidade da gravação e o assunto. Ele não traduz a transcrição para outro idioma, não identifica quem está falando e não garante a grafia correta de nomes ou termos especializados.

Por que a primeira transcrição baixa um modelo?

A transcrição privada no dispositivo exige que o modelo de reconhecimento de fala esteja no computador. A versão WebGPU baixa cerca de 80 MB, enquanto a alternativa quantizada para CPU usa cerca de 105 MB. Os navegadores normalmente guardam esses arquivos no cache e podem reutilizá-los, a menos que os dados do site ou o cache sejam apagados.

A transcrição de áudio funciona sem WebGPU?

Sim. A ferramenta prefere WebGPU porque uma placa gráfica compatível pode executar o Whisper muito mais rápido. Quando o WebGPU não existe ou falha, ela tenta novamente com WebAssembly na CPU. Essa opção funciona em mais navegadores, mas pode ser lenta para gravações longas, principalmente em celulares e computadores antigos.

Qual é a precisão da transcrição?

O Whisper tiny cria um bom rascunho quando a fala está clara, mas não garante uma reprodução palavra por palavra. Ruído de fundo, música, falas simultâneas, microfones ruins, nomes incomuns e longos períodos de silêncio reduzem a precisão e podem gerar palavras inventadas. Confira citações importantes, dados médicos, declarações legais e decisões no áudio original.