CanDoYa
PT-PT

Conversor de áudio para texto

Funciona inteiramente no navegador - sem carregar nada, sem registo.

Adicione um ficheiro de áudio para criar uma transcrição privada no dispositivo.

Partilhe esta ferramenta

Como converter áudio para texto em privado?

Adicione um ficheiro de áudio e este conversor executa o modelo de reconhecimento de voz Whisper no seu dispositivo. A transcrição pode ser editada e exportada em TXT ou SRT. A gravação nunca é enviada, embora o navegador tenha de descarregar o modelo de AI na primeira utilização.

Como utilizar

  1. 1Escolher a gravação. Arraste um ficheiro MP3, WAV, M4A, OGG, FLAC ou WebM para a ferramenta, ou clique na área de carregamento para o selecionar.
  2. 2Iniciar a transcrição privada. Clique em Transcrever áudio. Na primeira utilização, aguarde enquanto o modelo Whisper multilingue é descarregado e deixe-o depois processar a gravação no dispositivo.
  3. 3Rever e exportar. Volte a ouvir os trechos duvidosos, corrija eventuais erros e copie a transcrição ou descarregue-a em TXT ou SRT com marcação de tempo.

Para quem é

Esta ferramenta transforma voz gravada em texto sem enviar o ficheiro para um serviço de transcrição. O modelo Whisper é executado num processo do navegador em segundo plano, mantendo a página utilizável enquanto o computador faz o processamento. Quando disponível, é usado o WebGPU; nos restantes navegadores entra em funcionamento um modo CPU mais lento. O modelo descarregado fica guardado na cache do navegador para visitas futuras.

Perguntas frequentes

O meu áudio é enviado para um servidor?

Não. O navegador descodifica o ficheiro selecionado e envia as amostras de áudio apenas para um processo local no mesmo dispositivo. Esse processo descarrega os ficheiros do modelo Whisper a partir do Hugging Face, mas não envia a gravação nem a transcrição. A CanDoYa não recebe nem guarda o ficheiro.

O conversor de áudio para texto é grátis?

Sim. Não exige conta, pagamento ou créditos de transcrição e não acrescenta marcas de água. O seu dispositivo faz o processamento de AI, pelo que o custo prático é o tempo, a memória utilizada e o primeiro download do modelo. Num tarifário com limite, o fornecedor de internet pode contabilizar esses dados.

Que tamanho e duração de gravação posso transcrever?

O controlo aceita ficheiros até 500 MB. Não existe um limite fixo de minutos, mas gravações longas consomem mais memória e demoram mais porque o processamento é feito no dispositivo. Para uma reunião ou aula com uma hora, um portátil recente é uma escolha melhor do que um telemóvel.

Que formatos de áudio são suportados?

A ferramenta aceita MP3, WAV, M4A, OGG, FLAC, WebM e alguns formatos relacionados. A capacidade real de descodificação depende do navegador e do sistema operativo. Se um ficheiro for recusado apesar de a extensão estar na lista, converta-o para MP3 ou WAV sem compressão e tente novamente.

Que idiomas pode o Whisper transcrever?

O modelo Whisper tiny selecionado é multilingue e deteta automaticamente muitos idiomas falados. A precisão varia com o idioma, sotaque, qualidade da gravação e tema. Não traduz a transcrição para outro idioma, não identifica oradores e não garante a grafia correta de nomes ou termos especializados.

Porque é necessário descarregar um modelo na primeira transcrição?

A transcrição privada no dispositivo exige que o modelo de reconhecimento de voz esteja no computador. O modo WebGPU descarrega cerca de 80 MB, enquanto a alternativa para CPU ronda os 105 MB. Normalmente, o navegador guarda estes ficheiros na cache e reutiliza-os até que os dados do site ou a cache sejam apagados.

A transcrição funciona sem WebGPU?

Sim. A ferramenta dá preferência ao WebGPU porque uma placa gráfica compatível executa o Whisper muito mais depressa. Se o WebGPU não existir ou falhar, volta a tentar com WebAssembly no CPU. Esta alternativa funciona em mais navegadores, mas pode ser lenta com gravações longas, sobretudo em telemóveis e computadores mais antigos.

Qual é a precisão da transcrição?

O Whisper tiny cria um rascunho útil quando a fala é nítida, mas não garante uma transcrição palavra por palavra. Ruído de fundo, música, vozes sobrepostas, microfones fracos, nomes invulgares e longos silêncios reduzem a precisão e podem gerar palavras inexistentes. Confirme citações importantes, dados médicos, declarações jurídicas e decisões no áudio original.