Esta ferramenta transforma fala gravada em texto sem enviar a gravação para um serviço de transcrição. O modelo Whisper é executado em um processo separado do navegador, mantendo a página responsiva enquanto o computador faz o processamento. Quando disponível, o WebGPU acelera o trabalho; outros navegadores usam um modo de CPU mais lento. O navegador armazena o modelo baixado no cache para as próximas visitas.
Conversor de áudio para texto
Funciona inteiramente no seu navegador - sem upload, sem cadastro.
Como transformar áudio em texto com privacidade?
Adicione um arquivo de áudio e este conversor executará o reconhecimento de fala do Whisper no seu dispositivo. O resultado é uma transcrição editável que pode ser exportada em TXT ou SRT. A gravação nunca é enviada, embora o navegador precise baixar o modelo de IA no primeiro uso.
Como usar
- 1Escolha a gravação. Arraste um arquivo MP3, WAV, M4A, OGG, FLAC ou WebM para a ferramenta ou clique na área de upload para escolher um arquivo.
- 2Inicie a transcrição privada. Clique em Transcrever áudio. No primeiro uso, aguarde o download do modelo multilíngue Whisper e deixe que ele processe a gravação no seu dispositivo.
- 3Revise e exporte. Escute novamente os trechos duvidosos, corrija os erros e copie a transcrição ou baixe o resultado em TXT ou SRT com marcações de tempo.
Para quem é
- Jornalistas e pesquisadores que precisam de um primeiro rascunho privado antes de conferir nomes e citações na gravação.
- Estudantes que transformam aulas gravadas ou notas de estudo em texto editável sem enviar o áudio da sala de aula.
- Podcasters e criadores de vídeo que preparam uma transcrição inicial ou um arquivo SRT com marcações de tempo para legendas.
- Equipes que lidam com gravações confidenciais e mantêm o áudio original no dispositivo, em vez de enviá-lo para uma fila de transcrição na nuvem.
Perguntas frequentes
Meu áudio é enviado para um servidor?
Não. O navegador decodifica o arquivo selecionado e envia as amostras de áudio somente para um processo local no mesmo dispositivo. Esse processo baixa os arquivos do modelo Whisper do Hugging Face, mas não envia a gravação nem a transcrição. A CanDoYa não recebe nem armazena o arquivo.
O conversor de áudio para texto é grátis?
Sim. Não há conta, pagamento, créditos de transcrição nem marca d’água. Seu dispositivo executa a IA, então o custo prático é o tempo de processamento, a memória e o primeiro download do modelo. Se o plano de internet tiver franquia, esse download ainda poderá contar no consumo de dados.
Que tamanho e duração de gravação posso transcrever?
O campo de upload aceita arquivos de até 500 MB. Não existe uma cota fixa de minutos, mas gravações longas usam mais memória e demoram mais porque o processamento ocorre no dispositivo. Para reuniões ou aulas com uma hora de duração, um notebook moderno costuma ser melhor do que um celular.
Quais formatos de áudio são compatíveis?
A ferramenta aceita MP3, WAV, M4A, OGG, FLAC, WebM e vários formatos relacionados. A compatibilidade real de decodificação depende do navegador e do sistema operacional. Se um arquivo falhar mesmo com uma extensão listada, converta-o para MP3 ou WAV sem compressão e tente de novo.
Quais idiomas o Whisper consegue transcrever?
O modelo Whisper tiny escolhido é multilíngue e detecta automaticamente muitos idiomas falados. A precisão varia conforme o idioma, o sotaque, a qualidade da gravação e o assunto. Ele não traduz a transcrição para outro idioma, não identifica quem está falando e não garante a grafia correta de nomes ou termos especializados.
Por que a primeira transcrição baixa um modelo?
A transcrição privada no dispositivo exige que o modelo de reconhecimento de fala esteja no computador. A versão WebGPU baixa cerca de 80 MB, enquanto a alternativa quantizada para CPU usa cerca de 105 MB. Os navegadores normalmente guardam esses arquivos no cache e podem reutilizá-los, a menos que os dados do site ou o cache sejam apagados.
A transcrição de áudio funciona sem WebGPU?
Sim. A ferramenta prefere WebGPU porque uma placa gráfica compatível pode executar o Whisper muito mais rápido. Quando o WebGPU não existe ou falha, ela tenta novamente com WebAssembly na CPU. Essa opção funciona em mais navegadores, mas pode ser lenta para gravações longas, principalmente em celulares e computadores antigos.
Qual é a precisão da transcrição?
O Whisper tiny cria um bom rascunho quando a fala está clara, mas não garante uma reprodução palavra por palavra. Ruído de fundo, música, falas simultâneas, microfones ruins, nomes incomuns e longos períodos de silêncio reduzem a precisão e podem gerar palavras inventadas. Confira citações importantes, dados médicos, declarações legais e decisões no áudio original.