Công cụ này biến lời nói đã ghi thành văn bản mà không gửi bản ghi đến dịch vụ phiên âm. Mô hình Whisper chạy trong tiến trình nền của trình duyệt, vì vậy trang vẫn phản hồi trong lúc máy tính xử lý. WebGPU được dùng khi có thể; các trình duyệt khác sẽ chuyển sang chế độ CPU chậm hơn. Mô hình đã tải được trình duyệt lưu vào bộ nhớ đệm cho những lần sau.
Công cụ chuyển âm thanh thành văn bản
Chạy hoàn toàn trên trình duyệt của bạn - không tải lên, không cần đăng ký.
Làm cách nào để chuyển âm thanh thành văn bản mà vẫn giữ riêng tư?
Thêm một tệp âm thanh, công cụ sẽ chạy mô hình nhận dạng giọng nói Whisper ngay trên thiết bị. Bản phiên âm có thể chỉnh sửa và xuất thành TXT hoặc SRT. Bản ghi không bao giờ được tải lên, nhưng trình duyệt cần tải mô hình AI trong lần dùng đầu tiên.
Cách dùng
- 1Chọn bản ghi. Thả tệp MP3, WAV, M4A, OGG, FLAC hoặc WebM vào công cụ, hoặc bấm vùng tải lên để chọn tệp.
- 2Bắt đầu phiên âm riêng tư. Bấm Phiên âm thanh. Trong lần chạy đầu tiên, chờ mô hình Whisper đa ngôn ngữ tải xong rồi để thiết bị xử lý bản ghi.
- 3Kiểm tra và xuất tệp. Nghe lại những đoạn chưa chắc, sửa lỗi rồi sao chép bản phiên âm hoặc tải xuống dưới dạng TXT hay SRT có mốc thời gian.
Dành cho ai
- Người phỏng vấn và nhà nghiên cứu tạo bản nháp riêng tư trước khi đối chiếu tên và câu trích dẫn với bản ghi.
- Sinh viên biến bài giảng đã ghi hoặc ghi chú bằng giọng nói thành văn bản có thể chỉnh sửa mà không phải tải âm thanh lớp học lên mạng.
- Người làm podcast và video tạo bản phiên âm thô hoặc tệp SRT có mốc thời gian để làm phụ đề.
- Nhóm xử lý bản ghi nhạy cảm giữ âm thanh gốc trên thiết bị thay vì đưa vào hàng chờ phiên âm đám mây.
Câu hỏi thường gặp
Âm thanh của tôi có được tải lên máy chủ không?
Không. Trình duyệt giải mã tệp đã chọn và chỉ gửi mẫu âm thanh đến tiến trình cục bộ trên cùng thiết bị. Tiến trình này tải các tệp mô hình Whisper từ Hugging Face nhưng không tải bản ghi hay bản phiên âm lên. CanDoYa không nhận hoặc lưu tệp.
Công cụ chuyển âm thanh thành văn bản có miễn phí không?
Có. Không cần tài khoản, thanh toán, lượt phiên âm hay hình mờ. Thiết bị của bạn tự thực hiện phép suy luận AI, nên chi phí thực tế là thời gian xử lý, bộ nhớ và lần tải mô hình đầu tiên. Nhà mạng vẫn có thể tính dung lượng tải mô hình vào gói dữ liệu.
Tôi có thể phiên âm tệp lớn và bản ghi dài đến mức nào?
Bộ chọn tệp nhận tệp tối đa 500 MB. Không có hạn mức cố định theo phút, nhưng bản ghi dài cần nhiều bộ nhớ và thời gian hơn vì quá trình xử lý diễn ra trên thiết bị. Với cuộc họp hoặc bài giảng kéo dài một giờ, máy tính xách tay đời mới phù hợp hơn điện thoại.
Công cụ hỗ trợ những định dạng âm thanh nào?
Công cụ nhận MP3, WAV, M4A, OGG, FLAC, WebM và một số định dạng liên quan. Khả năng giải mã thực tế phụ thuộc vào trình duyệt và hệ điều hành. Nếu tệp vẫn bị từ chối dù có phần mở rộng trong danh sách, hãy chuyển sang MP3 hoặc WAV không nén rồi thử lại.
Whisper có thể phiên âm những ngôn ngữ nào?
Mô hình Whisper tiny được chọn là mô hình đa ngôn ngữ và tự động nhận biết nhiều ngôn ngữ nói. Độ chính xác thay đổi theo ngôn ngữ, giọng địa phương, chất lượng bản ghi và chủ đề. Công cụ không dịch sang ngôn ngữ khác, không nhận diện từng người nói và không bảo đảm viết đúng tên riêng hay thuật ngữ chuyên môn.
Vì sao lần phiên âm đầu tiên phải tải mô hình?
Phiên âm riêng tư trên thiết bị cần có mô hình nhận dạng giọng nói trong máy tính. Chế độ WebGPU tải khoảng 80 MB, còn chế độ CPU đã lượng tử hóa tải khoảng 105 MB. Trình duyệt thường lưu các tệp này trong bộ nhớ đệm để dùng lại, trừ khi dữ liệu trang hoặc bộ nhớ đệm bị xóa.
Không có WebGPU thì phiên âm được không?
Được. Công cụ ưu tiên WebGPU vì bộ xử lý đồ họa tương thích có thể chạy Whisper nhanh hơn nhiều. Nếu WebGPU không có hoặc gặp lỗi, công cụ thử lại bằng WebAssembly trên CPU. Cách này hoạt động trên nhiều trình duyệt hơn nhưng có thể chậm với bản ghi dài, nhất là trên điện thoại và máy tính cũ.
Bản phiên âm chính xác đến đâu?
Whisper tiny tạo bản nháp hữu ích khi lời nói rõ, nhưng không bảo đảm đúng từng chữ. Tiếng ồn nền, nhạc, nhiều người nói đè lên nhau, mic yếu, tên hiếm gặp và khoảng lặng dài làm giảm độ chính xác, thậm chí sinh ra từ chưa từng được nói. Hãy đối chiếu câu trích dẫn quan trọng, thông tin y tế, phát biểu pháp lý và quyết định với âm thanh gốc.