Esta ferramenta transforma voz gravada em texto sem enviar o ficheiro para um serviço de transcrição. O modelo Whisper é executado num processo do navegador em segundo plano, mantendo a página utilizável enquanto o computador faz o processamento. Quando disponível, é usado o WebGPU; nos restantes navegadores entra em funcionamento um modo CPU mais lento. O modelo descarregado fica guardado na cache do navegador para visitas futuras.
Conversor de áudio para texto
Funciona inteiramente no navegador - sem carregar nada, sem registo.
Como converter áudio para texto em privado?
Adicione um ficheiro de áudio e este conversor executa o modelo de reconhecimento de voz Whisper no seu dispositivo. A transcrição pode ser editada e exportada em TXT ou SRT. A gravação nunca é enviada, embora o navegador tenha de descarregar o modelo de AI na primeira utilização.
Como utilizar
- 1Escolher a gravação. Arraste um ficheiro MP3, WAV, M4A, OGG, FLAC ou WebM para a ferramenta, ou clique na área de carregamento para o selecionar.
- 2Iniciar a transcrição privada. Clique em Transcrever áudio. Na primeira utilização, aguarde enquanto o modelo Whisper multilingue é descarregado e deixe-o depois processar a gravação no dispositivo.
- 3Rever e exportar. Volte a ouvir os trechos duvidosos, corrija eventuais erros e copie a transcrição ou descarregue-a em TXT ou SRT com marcação de tempo.
Para quem é
- Entrevistadores e investigadores que precisam de um primeiro rascunho privado antes de confirmarem nomes e citações na gravação.
- Estudantes que pretendem transformar aulas gravadas ou notas de voz em texto editável sem enviar o áudio da sala de aula.
- Autores de podcasts e vídeos que querem produzir uma transcrição inicial ou um ficheiro SRT com tempos para legendas.
- Equipas que tratam gravações sensíveis e preferem manter o áudio original no dispositivo em vez de o enviarem para uma fila de transcrição na nuvem.
Perguntas frequentes
O meu áudio é enviado para um servidor?
Não. O navegador descodifica o ficheiro selecionado e envia as amostras de áudio apenas para um processo local no mesmo dispositivo. Esse processo descarrega os ficheiros do modelo Whisper a partir do Hugging Face, mas não envia a gravação nem a transcrição. A CanDoYa não recebe nem guarda o ficheiro.
O conversor de áudio para texto é grátis?
Sim. Não exige conta, pagamento ou créditos de transcrição e não acrescenta marcas de água. O seu dispositivo faz o processamento de AI, pelo que o custo prático é o tempo, a memória utilizada e o primeiro download do modelo. Num tarifário com limite, o fornecedor de internet pode contabilizar esses dados.
Que tamanho e duração de gravação posso transcrever?
O controlo aceita ficheiros até 500 MB. Não existe um limite fixo de minutos, mas gravações longas consomem mais memória e demoram mais porque o processamento é feito no dispositivo. Para uma reunião ou aula com uma hora, um portátil recente é uma escolha melhor do que um telemóvel.
Que formatos de áudio são suportados?
A ferramenta aceita MP3, WAV, M4A, OGG, FLAC, WebM e alguns formatos relacionados. A capacidade real de descodificação depende do navegador e do sistema operativo. Se um ficheiro for recusado apesar de a extensão estar na lista, converta-o para MP3 ou WAV sem compressão e tente novamente.
Que idiomas pode o Whisper transcrever?
O modelo Whisper tiny selecionado é multilingue e deteta automaticamente muitos idiomas falados. A precisão varia com o idioma, sotaque, qualidade da gravação e tema. Não traduz a transcrição para outro idioma, não identifica oradores e não garante a grafia correta de nomes ou termos especializados.
Porque é necessário descarregar um modelo na primeira transcrição?
A transcrição privada no dispositivo exige que o modelo de reconhecimento de voz esteja no computador. O modo WebGPU descarrega cerca de 80 MB, enquanto a alternativa para CPU ronda os 105 MB. Normalmente, o navegador guarda estes ficheiros na cache e reutiliza-os até que os dados do site ou a cache sejam apagados.
A transcrição funciona sem WebGPU?
Sim. A ferramenta dá preferência ao WebGPU porque uma placa gráfica compatível executa o Whisper muito mais depressa. Se o WebGPU não existir ou falhar, volta a tentar com WebAssembly no CPU. Esta alternativa funciona em mais navegadores, mas pode ser lenta com gravações longas, sobretudo em telemóveis e computadores mais antigos.
Qual é a precisão da transcrição?
O Whisper tiny cria um rascunho útil quando a fala é nítida, mas não garante uma transcrição palavra por palavra. Ruído de fundo, música, vozes sobrepostas, microfones fracos, nomes invulgares e longos silêncios reduzem a precisão e podem gerar palavras inexistentes. Confirme citações importantes, dados médicos, declarações jurídicas e decisões no áudio original.