工具会在浏览器中提取视频的音轨,将其转换为Whisper需要的16 kHz单声道信号,再通过后台工作线程生成字幕时间。支持的电脑会使用WebGPU加速,其他浏览器则切换到速度较慢的CPU模式。导出前可以修改识别文字和每条字幕的起止时间。
自动字幕生成器
全程在浏览器中运行,无需上传,无需注册。
如何为视频自动生成字幕?
添加视频后,这款自动字幕生成器会在当前设备上运行Whisper语音识别。它会生成带时间码、可编辑的字幕,支持预览并下载SRT或VTT。视频不会上传,但浏览器首次使用时需要下载AI模型。
使用方法
- 1选择视频. 将MP4、WebM、MOV、M4V或MKV文件拖入工具,也可以点击上传区域选择文件。
- 2生成带时间码的字幕. 点击生成字幕。首次使用时,请等待多语言Whisper模型下载完成,随后设备会处理音轨。
- 3逐条校对字幕. 在编辑器中播放字幕,修改识别文字,并在自动时间过早或过晚时调整开始和结束时间。
- 4导出字幕文件. 下载兼容多种剪辑软件与平台的SRT,或选择适合HTML视频和网页发布的VTT。
适用人群
- 短视频创作者可以先生成易读字幕,再进行样式设计或把字幕压制到成片中。
- 教师与培训人员可以让课程录像更容易理解,并提供可下载的字幕文件。
- 播客与采访工作者可以把视频对话转换成带时间码的初稿,无需把未发布素材提交给云端转写服务。
- 无障碍审核人员可以先做一版字幕,再检查语音、姓名、声音提示、时间和阅读速度。
常见问题
我的视频会上传到服务器吗?
不会。浏览器会读取所选文件,只把解码后的音频样本交给同一设备上的工作线程。该线程会从Hugging Face下载Whisper模型文件,但不会上传视频、音频或字幕。CanDoYa不会接收或保存文件。
自动字幕生成器免费吗?
免费。无需账号或付费,没有字幕分钟额度、水印或导出限制。转写由当前设备完成,实际成本是本地处理时间、内存占用和首次模型下载。如果网络按流量计费,服务商可能会计算这次下载。
多大、多长的视频可以生成字幕?
上传控件接受最大500 MB的文件。没有固定的分钟数限制,但解码和AI推理都在本地进行,长视频需要更多内存和时间。处理一小时左右的录像时,建议使用现代笔记本电脑,关闭占用大量内存的标签页,或先把视频拆成较短片段。
支持哪些视频格式?
工具接受MP4、WebM、MOV、M4V、MKV、AVI、MPEG和OGV容器。能否实际解码音频取决于浏览器和操作系统内置的编解码器。带AAC音频的MP4和带Opus音频的WebM通常兼容性最好。
可以编辑自动生成的字幕吗?
可以。每条字幕都有可编辑的文字、开始时间和结束时间。播放单条字幕可跳到对应起点,便于修正识别错误和时间边界。字幕为空、结束时间早于开始时间或超出视频长度时,导出功能会保持禁用。
SRT和VTT有什么区别?
SRT是视频剪辑软件和发布平台广泛支持的字幕格式。WebVTT的时间文本结构与它相似,但专为网页设计,可直接用于HTML video元素。这款工具可以导出两种格式,不添加视觉样式,也不会把字幕压制进视频。
没有WebGPU也能生成字幕吗?
可以。工具会优先尝试WebGPU,因为兼容的图形处理器能更快运行Whisper。如果WebGPU不可用或失败,会改用CPU上的WebAssembly重试。这个后备方案支持更多浏览器,但处理长视频时可能很慢,尤其是在手机和旧电脑上。
自动字幕的准确度足以用于无障碍内容吗?
它适合生成初稿,不能直接视为完成的无障碍字幕。噪声、音乐、重叠人声、口音、少见姓名和专业术语都可能导致错误。自动识别还会遗漏声音说明和说话人标签,因此发布正式隐藏式字幕前,应对照视频校对并补充有意义的非语音提示。