Cet outil transforme une voix enregistrée en texte sans confier l’enregistrement à un service de transcription. Le modèle Whisper s’exécute dans un processus dédié du navigateur, ce qui laisse la page réactive pendant que l’ordinateur effectue le calcul. WebGPU accélère le traitement lorsqu’il est disponible ; les autres navigateurs passent à un mode CPU plus lent. Le modèle téléchargé reste dans le cache du navigateur pour les prochaines visites.
Convertisseur audio en texte
Fonctionne entièrement dans votre navigateur : aucun envoi, aucune inscription.
Comment convertir un audio en texte de façon privée ?
Ajoutez un fichier audio : ce convertisseur lance la reconnaissance vocale Whisper sur votre appareil. Vous obtenez une transcription modifiable, à exporter en TXT ou SRT. L’enregistrement n’est jamais envoyé, mais le navigateur doit télécharger le modèle d’IA lors de la première utilisation.
Comment l’utiliser
- 1Choisir l’enregistrement. Déposez un fichier MP3, WAV, M4A, OGG, FLAC ou WebM dans l’outil, ou cliquez sur la zone de dépôt pour le sélectionner.
- 2Lancer la transcription privée. Cliquez sur Transcrire l’audio. Lors du premier essai, attendez le téléchargement du modèle Whisper multilingue, puis laissez-le traiter l’enregistrement sur votre appareil.
- 3Relire et exporter. Réécoutez les passages incertains, corrigez les erreurs, puis copiez la transcription ou téléchargez-la en TXT ou en SRT horodaté.
Pour qui
- Journalistes et chercheurs préparant un premier brouillon privé avant de vérifier les noms et les citations dans l’enregistrement.
- Étudiants transformant des cours enregistrés ou des notes vocales en texte modifiable, sans envoyer l’audio de la salle de classe.
- Podcasteurs et vidéastes créant une transcription de travail ou un fichier SRT horodaté pour les sous-titres.
- Équipes qui traitent des enregistrements sensibles et souhaitent conserver l’audio source sur l’appareil au lieu de l’envoyer dans une file de transcription en ligne.
Questions fréquentes
Mon audio est-il envoyé vers un serveur ?
Non. Le navigateur décode le fichier choisi et transmet les échantillons audio uniquement à un processus local sur le même appareil. Ce processus télécharge les fichiers du modèle Whisper depuis Hugging Face, mais n’envoie ni l’enregistrement ni la transcription. CanDoYa ne reçoit pas le fichier et ne le conserve pas.
Le convertisseur audio en texte est-il gratuit ?
Oui. Aucun compte, paiement, crédit de transcription ou filigrane n’est demandé. Votre appareil exécute lui-même l’IA : les seules contraintes sont le temps de calcul, la mémoire et le premier téléchargement du modèle. Si votre forfait internet est limité, ce téléchargement peut être décompté de votre volume de données.
Quelle taille et quelle durée d’enregistrement puis-je transcrire ?
La zone de dépôt accepte les fichiers jusqu’à 500 Mo. Il n’y a pas de quota fixe en minutes, mais un long enregistrement demande plus de mémoire et de temps puisque le calcul s’effectue sur votre appareil. Pour une réunion ou un cours d’une heure, un ordinateur portable récent convient mieux qu’un téléphone.
Quels formats audio sont pris en charge ?
L’outil accepte MP3, WAV, M4A, OGG, FLAC, WebM et plusieurs formats apparentés. La capacité réelle de décodage dépend de votre navigateur et de votre système d’exploitation. Si un fichier est refusé malgré une extension annoncée, convertissez-le en MP3 ou en WAV non compressé, puis réessayez.
Quelles langues Whisper peut-il transcrire ?
Le modèle Whisper tiny choisi est multilingue et détecte automatiquement de nombreuses langues parlées. La précision varie selon la langue, l’accent, la qualité de l’enregistrement et le sujet. Il ne traduit pas la transcription dans une autre langue, ne distingue pas les locuteurs et ne garantit pas l’orthographe des noms ou des termes spécialisés.
Pourquoi la première transcription télécharge-t-elle un modèle ?
Une transcription privée sur l’appareil nécessite d’y stocker le modèle de reconnaissance vocale. La version WebGPU télécharge environ 80 Mo, contre 105 Mo pour la version quantifiée destinée au CPU. Le navigateur conserve normalement ces fichiers dans son cache et peut les réutiliser, sauf si vous effacez le cache ou les données du site.
La transcription audio fonctionne-t-elle sans WebGPU ?
Oui. L’outil privilégie WebGPU, car une carte graphique compatible peut exécuter Whisper bien plus vite. Si WebGPU manque ou échoue, il recommence avec WebAssembly sur le CPU. Cette solution fonctionne dans davantage de navigateurs, mais elle peut être lente avec de longs enregistrements, surtout sur un téléphone ou un ordinateur ancien.
Quelle est la précision de la transcription ?
Whisper tiny fournit un brouillon utile lorsque la voix est nette, mais ne garantit pas un verbatim. Bruit de fond, musique, voix superposées, mauvais microphone, noms rares et longues plages de silence réduisent la précision et peuvent faire apparaître des mots inexistants. Vérifiez les citations importantes, les informations médicales, les déclarations juridiques et les décisions dans l’audio original.