这款工具能把录音转成文字,不会将录音发送给在线转写服务。Whisper模型在浏览器工作线程中运行,电脑进行推理时页面仍可正常操作。设备支持WebGPU时会优先使用显卡加速,其他浏览器则切换到速度较慢的CPU模式。下载后的模型会保存在浏览器缓存中,之后访问时可以继续使用。
音频转文字工具
全程在浏览器中运行,无需上传,无需注册。
如何在不上传文件的情况下将音频转成文字?
添加音频文件后,本工具会在当前设备上运行Whisper语音识别模型,并生成可编辑的文字稿,支持导出TXT和SRT。录音不会上传,但浏览器首次使用时需要下载AI模型。
使用方法
- 1选择录音. 将MP3、WAV、M4A、OGG、FLAC或WebM文件拖入工具,也可以点击上传区域从设备中选择。
- 2开始本地转写. 点击转写音频。首次使用时,请等待多语言Whisper模型下载完成,随后录音会在当前设备上处理。
- 3检查并导出. 重新听取不确定的片段,修改识别错误,然后复制文字稿,或下载TXT和带时间戳的SRT文件。
适用人群
- 记者与研究人员可先生成私密的初稿,再对照录音核实姓名和引文。
- 学生可把课程录音或学习语音笔记转成可编辑文字,无需上传课堂音频。
- 播客与视频创作者可生成粗略文字稿,或导出带时间戳的SRT字幕文件。
- 处理敏感录音的团队可将源音频留在设备上,避免送入云端转写队列。
常见问题
我的音频会上传到服务器吗?
不会。浏览器负责解码所选文件,音频采样只会发送给同一设备上的本地工作线程。该线程会从Hugging Face下载Whisper模型文件,但不会上传录音或文字稿。CanDoYa不会接收或保存文件。
音频转文字免费吗?
免费。无需账号、付费或转写额度,结果也没有水印。AI推理由当前设备完成,实际成本是处理时间、内存占用和首次模型下载。如果网络套餐按流量计费,下载模型可能会计入用量。
可以转写多大或多长的录音?
上传控件接受最大500 MB的文件。录音时长没有固定额度,但长录音需要更多内存和处理时间,因为推理完全在设备上进行。对于一小时左右的会议或课程,现代笔记本电脑通常比手机更合适。
支持哪些音频格式?
工具接受MP3、WAV、M4A、OGG、FLAC、WebM及一些相关格式。实际能否解码取决于浏览器和操作系统。如果文件扩展名在列表中却仍无法打开,请先转换为MP3或未压缩WAV,再重新尝试。
Whisper可以转写哪些语言?
当前使用的Whisper tiny模型支持多种语言,并能自动检测许多口语语言。准确率会随语言、口音、录音质量和主题变化。它不会把文字稿翻译成另一种语言,也不能区分说话人或保证姓名与专业术语的拼写完全正确。
为什么首次转写需要下载模型?
要在设备上私密地完成转写,语音识别模型必须存放在电脑中。WebGPU版本约需下载80 MB,量化后的CPU后备版本约为105 MB。浏览器通常会缓存这些文件,之后可以重复使用,除非清除了网站数据或缓存。
没有WebGPU也能进行音频转写吗?
可以。工具优先使用WebGPU,因为受支持的图形处理器能显著加快Whisper运行速度。如果WebGPU不可用或发生故障,工具会改用CPU上的WebAssembly重试。这种方式兼容更多浏览器,但处理长录音可能很慢,尤其是在手机和旧电脑上。
转写结果有多准确?
语音清晰时,Whisper tiny可以提供实用初稿,但无法保证逐字准确。背景噪声、音乐、重叠人声、较差的麦克风、少见姓名和长时间静音都会降低准确率,也可能生成录音中不存在的词。重要引文、医疗信息、法律表述和决定应对照原始音频检查。