Инструмент извлекает звуковую дорожку прямо в браузере, преобразует ее в моносигнал 16 кГц для Whisper и рассчитывает тайминг субтитров в фоновом процессе. На совместимых компьютерах обработку ускоряет WebGPU; в остальных браузерах используется более медленный режим CPU. Перед экспортом в редакторе можно исправить текст, начало и конец каждого фрагмента.
Автоматические субтитры для видео
Работает прямо в браузере - без загрузки файлов и регистрации.
Как автоматически сделать субтитры для видео?
Добавьте видео, и генератор автоматических субтитров запустит распознавание речи Whisper на вашем устройстве. Вы получите фрагменты с временными метками, которые можно проверить, отредактировать и скачать в SRT или VTT. Видео никуда не загружается, но при первом запуске браузер скачает модель ИИ.
Как пользоваться
- 1Выберите видео. Перетащите в инструмент файл MP4, WebM, MOV, M4V или MKV либо нажмите на область загрузки и выберите его на устройстве.
- 2Создайте субтитры с таймингом. Нажмите «Создать субтитры». При первом запуске дождитесь скачивания многоязычной модели Whisper, затем оставьте устройство обрабатывать звуковую дорожку.
- 3Проверьте каждый фрагмент. Запускайте отдельные фрагменты из редактора, исправляйте текст и меняйте время начала или окончания, если автоматический тайминг оказался ранним или поздним.
- 4Экспортируйте файл субтитров. Скачайте SRT для видеоредакторов и платформ или VTT для HTML-видео и публикации в интернете.
Кому пригодится
- Авторы коротких видео могут подготовить читаемые субтитры для ролика перед оформлением или встраиванием текста в финальный монтаж.
- Преподаватели и тренеры могут сделать записанные занятия понятнее и приложить к ним отдельный файл субтитров.
- Подкастеры и интервьюеры могут получить черновик с таймингом, не отправляя неопубликованное видео в облачный сервис транскрибации.
- Специалисты по доступности могут создать первую версию, а затем проверить речь, имена, звуковые пометки, тайминг и скорость чтения.
Вопросы и ответы
Загружается ли мое видео на сервер?
Нет. Браузер читает выбранный файл и передает декодированные аудиоданные только фоновому процессу на том же устройстве. Этот процесс скачивает файлы модели Whisper с Hugging Face, но не отправляет видео, аудио или субтитры. CanDoYa не получает и не хранит файл.
Генератор автоматических субтитров бесплатный?
Да. Учетная запись, оплата, лимит минут, водяной знак и блокировка экспорта отсутствуют. Расшифровку выполняет ваше устройство, поэтому на практике расходуются время обработки, память и трафик на первое скачивание модели. Провайдер может учесть этот трафик при лимитном тарифе.
Какой размер и длительность видео поддерживаются?
Можно выбрать файл размером до 500 МБ. Жесткого ограничения по минутам нет, но длинному видео требуется больше памяти и времени, поскольку декодирование и работа ИИ выполняются локально. Для часовой записи используйте современный ноутбук, закройте тяжелые вкладки или сначала разделите видео на части.
Какие видеоформаты работают?
Инструмент принимает контейнеры MP4, WebM, MOV, M4V, MKV, AVI, MPEG и OGV. Возможность декодировать звук зависит от кодеков браузера и операционной системы. Обычно лучше всего поддерживаются MP4 со звуком AAC и WebM со звуком Opus.
Можно ли редактировать автоматические субтитры?
Да. У каждого фрагмента можно изменить текст, время начала и время окончания. Запустите его, чтобы перейти к нужному месту видео, исправьте распознанные слова и уточните границы. Экспорт будет недоступен, если фрагмент пуст, заканчивается раньше начала или выходит за длительность видео.
Чем SRT отличается от VTT?
SRT широко поддерживается видеоредакторами и платформами для публикации. WebVTT имеет похожую структуру текста с временными метками, но создан для интернета и работает напрямую с элементом дорожки HTML-видео. Инструмент экспортирует оба формата без оформления и без встраивания текста в изображение.
Работает ли генерация субтитров без WebGPU?
Да. Сначала инструмент пробует WebGPU, потому что совместимый графический процессор ускоряет Whisper. Если WebGPU недоступен или дает сбой, обработка повторяется через WebAssembly на CPU. Этот режим поддерживает больше браузеров, но работает заметно медленнее, особенно с длинными видео на телефонах и старых компьютерах.
Достаточно ли точны автоматические субтитры для доступности?
Это полезный черновик, а не готовый материал по доступности. Шум, музыка, одновременная речь, акценты, редкие имена и специальные термины могут привести к ошибкам. Автоматическое распознавание также пропускает многие описания звуков и метки говорящих, поэтому перед публикацией проверьте видео и добавьте значимые неречевые пометки.