Esta herramienta pasa una grabación a texto sin enviarla a un servicio de transcripción. El modelo Whisper se ejecuta dentro de un proceso separado del navegador, así que la página sigue respondiendo mientras tu computadora procesa el audio. Si WebGPU está disponible, se utiliza para acelerar el trabajo; en otros navegadores se activa un modo de CPU más lento. El navegador guarda el modelo descargado en la caché para próximas visitas.
Convertidor de audio a texto
Funciona del todo en tu navegador: sin subir nada y sin registro.
¿Cómo convertir audio a texto de forma privada?
Añade un archivo de audio y este convertidor ejecutará el reconocimiento de voz de Whisper en tu dispositivo. Obtendrás una transcripción editable para exportar como TXT o SRT. La grabación nunca se sube, aunque el navegador debe descargar el modelo de IA la primera vez.
Cómo se usa
- 1Elige la grabación. Arrastra un archivo MP3, WAV, M4A, OGG, FLAC o WebM a la herramienta, o haz clic en el área de carga para seleccionarlo.
- 2Inicia la transcripción privada. Haz clic en Transcribir audio. La primera vez, espera a que se descargue el modelo multilingüe Whisper y deja que procese la grabación en tu dispositivo.
- 3Revisa y exporta. Vuelve a escuchar los fragmentos dudosos, corrige los errores y copia la transcripción o descárgala como TXT o SRT con marcas de tiempo.
Para quién es
- Periodistas e investigadores que necesitan un primer borrador privado antes de cotejar nombres y citas con la grabación.
- Estudiantes que quieren convertir clases grabadas o notas de voz en texto editable sin subir audios del aula.
- Podcasters y creadores de video que preparan una transcripción preliminar o un archivo SRT con marcas de tiempo para subtítulos.
- Equipos que manejan grabaciones sensibles y prefieren mantener el audio original en el dispositivo, fuera de una cola de transcripción en la nube.
Preguntas frecuentes
¿Mi audio se sube a un servidor?
No. El navegador decodifica el archivo seleccionado y envía las muestras de audio únicamente a un proceso local del mismo dispositivo. Ese proceso descarga los archivos del modelo Whisper desde Hugging Face, pero no sube la grabación ni la transcripción. CanDoYa no recibe ni almacena el archivo.
¿El convertidor de audio a texto es gratis?
Sí. No requiere cuenta, pago, créditos de transcripción ni añade marcas de agua. Tu propio dispositivo ejecuta la IA, por lo que el costo práctico es el tiempo de procesamiento, la memoria y la primera descarga del modelo. Si tu conexión tiene un límite de datos, esa descarga podría contar dentro del consumo.
¿Qué tamaño y duración de grabación puedo transcribir?
El control de carga acepta archivos de hasta 500 MB. No hay un límite fijo de minutos, pero las grabaciones largas requieren más memoria y tardan más porque se procesan en tu dispositivo. Para reuniones o clases de una hora, una laptop moderna suele funcionar mejor que un celular.
¿Qué formatos de audio admite?
La herramienta acepta MP3, WAV, M4A, OGG, FLAC, WebM y varios formatos relacionados. La compatibilidad real para decodificarlos depende del navegador y del sistema operativo. Si un archivo falla aunque su extensión figure en la lista, conviértelo a MP3 o WAV sin comprimir e inténtalo de nuevo.
¿Qué idiomas puede transcribir Whisper?
El modelo Whisper tiny seleccionado es multilingüe y detecta automáticamente muchos idiomas hablados. La precisión cambia según el idioma, el acento, la calidad de la grabación y el tema. No traduce el resultado a otro idioma, no identifica hablantes ni garantiza la escritura correcta de nombres y términos especializados.
¿Por qué la primera transcripción descarga un modelo?
Para transcribir de forma privada en el dispositivo, el modelo de reconocimiento de voz debe estar en tu computadora. La versión WebGPU descarga unos 80 MB y la alternativa cuantizada para CPU, unos 105 MB. Los navegadores suelen guardar estos archivos en la caché para reutilizarlos, salvo que borres los datos del sitio o la caché.
¿La transcripción funciona sin WebGPU?
Sí. La herramienta prefiere WebGPU porque una tarjeta gráfica compatible puede ejecutar Whisper mucho más rápido. Si WebGPU no está disponible o falla, vuelve a intentarlo con WebAssembly en la CPU. Este modo funciona en más navegadores, pero puede ser lento con grabaciones largas, sobre todo en celulares y computadoras antiguas.
¿Qué tan precisa es la transcripción?
Whisper tiny ofrece un borrador útil cuando la voz se oye con claridad, pero no garantiza una copia literal. El ruido de fondo, la música, las voces superpuestas, los micrófonos deficientes, los nombres poco comunes y los silencios largos reducen la precisión y pueden producir palabras inventadas. Compara las citas importantes y cualquier dato médico, legal o decisivo con el audio original.