CanDoYa
ZH

自动字幕生成器

全程在浏览器中运行,无需上传,无需注册。

添加视频,在当前设备上生成私密、可编辑的字幕。

分享此工具

如何为视频自动生成字幕?

添加视频后,这款自动字幕生成器会在当前设备上运行Whisper语音识别。它会生成带时间码、可编辑的字幕,支持预览并下载SRT或VTT。视频不会上传,但浏览器首次使用时需要下载AI模型。

使用方法

  1. 1选择视频. 将MP4、WebM、MOV、M4V或MKV文件拖入工具,也可以点击上传区域选择文件。
  2. 2生成带时间码的字幕. 点击生成字幕。首次使用时,请等待多语言Whisper模型下载完成,随后设备会处理音轨。
  3. 3逐条校对字幕. 在编辑器中播放字幕,修改识别文字,并在自动时间过早或过晚时调整开始和结束时间。
  4. 4导出字幕文件. 下载兼容多种剪辑软件与平台的SRT,或选择适合HTML视频和网页发布的VTT。

适用人群

工具会在浏览器中提取视频的音轨,将其转换为Whisper需要的16 kHz单声道信号,再通过后台工作线程生成字幕时间。支持的电脑会使用WebGPU加速,其他浏览器则切换到速度较慢的CPU模式。导出前可以修改识别文字和每条字幕的起止时间。

常见问题

我的视频会上传到服务器吗?

不会。浏览器会读取所选文件,只把解码后的音频样本交给同一设备上的工作线程。该线程会从Hugging Face下载Whisper模型文件,但不会上传视频、音频或字幕。CanDoYa不会接收或保存文件。

自动字幕生成器免费吗?

免费。无需账号或付费,没有字幕分钟额度、水印或导出限制。转写由当前设备完成,实际成本是本地处理时间、内存占用和首次模型下载。如果网络按流量计费,服务商可能会计算这次下载。

多大、多长的视频可以生成字幕?

上传控件接受最大500 MB的文件。没有固定的分钟数限制,但解码和AI推理都在本地进行,长视频需要更多内存和时间。处理一小时左右的录像时,建议使用现代笔记本电脑,关闭占用大量内存的标签页,或先把视频拆成较短片段。

支持哪些视频格式?

工具接受MP4、WebM、MOV、M4V、MKV、AVI、MPEG和OGV容器。能否实际解码音频取决于浏览器和操作系统内置的编解码器。带AAC音频的MP4和带Opus音频的WebM通常兼容性最好。

可以编辑自动生成的字幕吗?

可以。每条字幕都有可编辑的文字、开始时间和结束时间。播放单条字幕可跳到对应起点,便于修正识别错误和时间边界。字幕为空、结束时间早于开始时间或超出视频长度时,导出功能会保持禁用。

SRT和VTT有什么区别?

SRT是视频剪辑软件和发布平台广泛支持的字幕格式。WebVTT的时间文本结构与它相似,但专为网页设计,可直接用于HTML video元素。这款工具可以导出两种格式,不添加视觉样式,也不会把字幕压制进视频。

没有WebGPU也能生成字幕吗?

可以。工具会优先尝试WebGPU,因为兼容的图形处理器能更快运行Whisper。如果WebGPU不可用或失败,会改用CPU上的WebAssembly重试。这个后备方案支持更多浏览器,但处理长视频时可能很慢,尤其是在手机和旧电脑上。

自动字幕的准确度足以用于无障碍内容吗?

它适合生成初稿,不能直接视为完成的无障碍字幕。噪声、音乐、重叠人声、口音、少见姓名和专业术语都可能导致错误。自动识别还会遗漏声音说明和说话人标签,因此发布正式隐藏式字幕前,应对照视频校对并补充有意义的非语音提示。