CanDoYa
VI

Công cụ tạo phụ đề tự động

Chạy hoàn toàn trên trình duyệt của bạn - không tải lên, không cần đăng ký.

Thêm video để tạo phụ đề riêng tư, có thể chỉnh sửa ngay trên thiết bị.

Chia sẻ công cụ này

Làm cách nào để tạo phụ đề tự động cho video?

Thêm video, công cụ sẽ chạy nhận dạng giọng nói Whisper ngay trên thiết bị. Phụ đề có mốc thời gian được tạo ra để xem trước, chỉnh sửa và tải xuống dưới dạng SRT hoặc VTT. Video không được tải lên, nhưng trình duyệt cần tải mô hình AI trong lần dùng đầu tiên.

Cách dùng

  1. 1Chọn video. Thả tệp MP4, WebM, MOV, M4V hoặc MKV vào công cụ, hoặc bấm vùng tải lên để chọn tệp.
  2. 2Tạo phụ đề có mốc thời gian. Bấm Tạo phụ đề. Trong lần chạy đầu tiên, chờ mô hình Whisper đa ngôn ngữ tải xong rồi để thiết bị xử lý rãnh âm thanh.
  3. 3Rà soát từng dòng. Phát phụ đề trong trình chỉnh sửa, sửa lời nhận dạng sai và điều chỉnh thời điểm bắt đầu hoặc kết thúc nếu mốc tự động quá sớm hay quá muộn.
  4. 4Xuất tệp phụ đề. Tải SRT để dùng với nhiều trình biên tập và nền tảng, hoặc chọn VTT cho video HTML và nội dung xuất bản trên web.

Dành cho ai

Công cụ trích xuất rãnh âm thanh ngay trong trình duyệt, chuyển thành tín hiệu mono 16 kHz mà Whisper yêu cầu, rồi tạo mốc thời gian cho phụ đề trong tiến trình nền. Máy tính tương thích sẽ dùng WebGPU để tăng tốc; các trình duyệt khác chuyển sang chế độ CPU chậm hơn. Trước khi xuất, có thể sửa cả câu chữ lẫn điểm bắt đầu và kết thúc của từng dòng.

Câu hỏi thường gặp

Video của tôi có được tải lên máy chủ không?

Không. Trình duyệt đọc tệp đã chọn và chỉ chuyển mẫu âm thanh đã giải mã đến tiến trình trên cùng thiết bị. Tiến trình tải các tệp mô hình Whisper từ Hugging Face nhưng không tải video, âm thanh hay phụ đề lên. CanDoYa không nhận hoặc lưu tệp.

Công cụ tạo phụ đề tự động có miễn phí không?

Có. Không cần tài khoản hoặc thanh toán, không có hạn mức phút, hình mờ hay khóa xuất tệp. Thiết bị tự thực hiện phiên âm, nên chi phí thực tế là thời gian xử lý, bộ nhớ và lần tải mô hình đầu tiên. Nhà mạng có thể tính lượt tải đó vào gói dữ liệu.

Video có thể lớn và dài đến mức nào?

Bộ chọn nhận tệp tối đa 500 MB. Không có hạn mức cố định theo phút, nhưng video dài cần nhiều bộ nhớ và thời gian hơn vì giải mã và suy luận AI diễn ra trên thiết bị. Với bản ghi dài một giờ, nên dùng máy tính xách tay đời mới, đóng các thẻ ngốn bộ nhớ hoặc chia video thành đoạn ngắn trước.

Công cụ hỗ trợ những định dạng video nào?

Công cụ nhận các vùng chứa MP4, WebM, MOV, M4V, MKV, AVI, MPEG và OGV. Khả năng giải mã âm thanh thực tế phụ thuộc vào codec có trong trình duyệt và hệ điều hành. MP4 với âm thanh AAC và WebM với âm thanh Opus thường được hỗ trợ rộng nhất.

Có thể sửa phụ đề tự động không?

Có. Mỗi dòng đều có văn bản, thời gian bắt đầu và kết thúc để chỉnh sửa. Phát một dòng sẽ đưa phần xem trước tới điểm bắt đầu, giúp sửa lỗi nhận dạng và ranh giới thời gian. Xuất tệp bị vô hiệu hóa nếu dòng trống, kết thúc trước khi bắt đầu hoặc vượt quá thời lượng video.

SRT và VTT khác nhau thế nào?

SRT là định dạng phụ đề được nhiều trình biên tập video và nền tảng xuất bản hỗ trợ. WebVTT có cấu trúc văn bản theo thời gian tương tự nhưng được thiết kế cho web và dùng trực tiếp với phần tử video trong HTML. Công cụ xuất cả hai mà không thêm kiểu hiển thị hay ghép chữ vào hình.

Không có WebGPU thì tạo phụ đề được không?

Được. Công cụ thử WebGPU trước vì bộ xử lý đồ họa tương thích có thể chạy Whisper nhanh hơn. Nếu WebGPU không có hoặc gặp lỗi, công cụ thử lại bằng WebAssembly trên CPU. Cách này hỗ trợ nhiều trình duyệt hơn nhưng có thể rất chậm với video dài, nhất là trên điện thoại và máy tính cũ.

Phụ đề tự động có đủ chính xác cho nội dung tiếp cận không?

Phụ đề này hữu ích làm bản nháp, chưa phải sản phẩm tiếp cận hoàn chỉnh. Tiếng ồn, nhạc, nhiều người nói cùng lúc, giọng địa phương, tên hiếm và thuật ngữ chuyên môn có thể gây lỗi. Nhận dạng tự động cũng bỏ sót nhiều mô tả âm thanh và nhãn người nói, vì vậy cần xem lại video và thêm thông tin phi ngôn ngữ quan trọng trước khi công bố phụ đề đóng chính thức.