CanDoYa
ES

Generador de subtítulos automáticos

Funciona del todo en tu navegador: sin subir nada y sin registro.

Añade un vídeo para generar subtítulos privados y editables en tu dispositivo.

Comparte esta herramienta

¿Cómo puedo generar subtítulos para un vídeo automáticamente?

Añade un vídeo y este generador de subtítulos automáticos usará el reconocimiento de voz de Whisper en tu dispositivo. Obtendrás bloques de subtítulos con tiempos que puedes revisar, reproducir y descargar en SRT o VTT. El vídeo nunca se sube, aunque el navegador sí necesita descargar el modelo de IA la primera vez.

Cómo se usa

  1. 1Elige un vídeo. Arrastra un archivo MP4, WebM, MOV, M4V o MKV hasta la herramienta, o pulsa la zona de carga para seleccionarlo.
  2. 2Genera los subtítulos. Pulsa Generar subtítulos. En el primer uso tendrás que esperar a que se descargue el modelo multilingüe de Whisper; después, el dispositivo procesará la pista de audio.
  3. 3Revisa cada bloque. Reproduce los subtítulos desde el editor, corrige el texto y ajusta el inicio o el final cuando el tiempo automático se adelante o se retrase.
  4. 4Exporta el archivo. Descarga SRT para usarlo en la mayoría de editores y plataformas, o VTT para vídeo HTML y publicaciones web.

Para quién es

La herramienta extrae la pista de audio en el navegador, la convierte en la señal mono de 16 kHz que necesita Whisper y calcula los tiempos en un proceso en segundo plano. WebGPU acelera el trabajo en equipos compatibles; los demás navegadores recurren a la CPU, que tarda más. Antes de exportar puedes corregir tanto el texto como el inicio y el final de cada bloque.

Preguntas frecuentes

¿Mi vídeo se sube a un servidor?

No. El navegador lee el archivo elegido y envía las muestras de audio decodificadas a un proceso del mismo dispositivo. Ese proceso descarga los archivos del modelo Whisper desde Hugging Face, pero no sube el vídeo, el audio ni los subtítulos. CanDoYa no recibe ni guarda el archivo.

¿El generador de subtítulos automáticos es gratis?

Sí. No necesitas cuenta ni pagar, y no hay límite de minutos, marca de agua o bloqueo de exportación. Como la transcripción se hace en tu dispositivo, los límites prácticos son el tiempo de procesamiento, la memoria disponible y la primera descarga del modelo. Tu proveedor de internet podría contabilizar esa descarga si tienes una tarifa de datos limitada.

¿Qué tamaño y duración de vídeo admite?

Puedes cargar archivos de hasta 500 MB. No hay un límite fijo de minutos, pero los vídeos largos necesitan más memoria y tardan más porque tanto la decodificación como la IA se ejecutan de forma local. Para grabaciones de una hora, usa un portátil reciente, cierra las pestañas que consuman mucha memoria o divide antes el vídeo en varias partes.

¿Qué formatos de vídeo funcionan?

La herramienta acepta contenedores MP4, WebM, MOV, M4V, MKV, AVI, MPEG y OGV. La posibilidad de decodificar el audio depende de los códecs incluidos en tu navegador y sistema operativo. MP4 con audio AAC y WebM con audio Opus suelen ofrecer la mayor compatibilidad.

¿Puedo editar los subtítulos automáticos?

Sí. Cada bloque permite modificar el texto, el tiempo de inicio y el de finalización. Reproduce un bloque para llevar el vídeo a su comienzo, corrige los errores de reconocimiento y ajusta los límites. La exportación queda desactivada si un bloque está vacío, termina antes de empezar o supera la duración del vídeo.

¿Qué diferencia hay entre SRT y VTT?

SRT es un formato de subtítulos muy compatible con editores de vídeo y plataformas de publicación. WebVTT usa una estructura de texto sincronizado parecida, pero está pensado para la web y funciona directamente con el elemento track del vídeo HTML. La herramienta exporta ambos sin aplicar estilos ni integrar el texto en la imagen.

¿La generación de subtítulos funciona sin WebGPU?

Sí. Primero se prueba WebGPU porque una tarjeta gráfica compatible puede ejecutar Whisper más deprisa. Si WebGPU no está disponible o falla, se vuelve a intentar con WebAssembly en la CPU. Esta alternativa funciona en más navegadores, pero puede ser mucho más lenta, sobre todo con vídeos largos, móviles o equipos antiguos.

¿Los subtítulos automáticos son lo bastante precisos para accesibilidad?

Son un buen borrador, no una entrega final de accesibilidad. El ruido, la música, las voces superpuestas, los acentos, los nombres poco comunes y los términos técnicos pueden provocar errores. El reconocimiento automático tampoco incluye muchas descripciones de sonidos ni identifica a los hablantes, así que revisa el vídeo y añade las indicaciones no verbales importantes antes de publicar subtítulos descriptivos.