CanDoYa
TH

เครื่องมือสร้างซับอัตโนมัติ

ทำงานในเบราว์เซอร์ทั้งหมด ไม่ต้องอัปโหลด ไม่ต้องสมัครสมาชิก

เพิ่มวิดีโอเพื่อสร้างคำบรรยายส่วนตัวที่แก้ไขได้บนอุปกรณ์

แชร์เครื่องมือนี้

จะสร้างซับอัตโนมัติให้วิดีโอได้อย่างไร?

เพิ่มวิดีโอแล้วเครื่องมือจะใช้ Whisper รู้จำเสียงบนอุปกรณ์ สร้างคำบรรยายพร้อมเวลาให้แก้ไข ดูตัวอย่าง และดาวน์โหลดเป็น SRT หรือ VTT ได้ วิดีโอจะไม่ถูกอัปโหลด แต่ครั้งแรกเบราว์เซอร์ต้องดาวน์โหลดโมเดล AI ก่อน

วิธีใช้งาน

  1. 1เลือกวิดีโอ. วางไฟล์ MP4, WebM, MOV, M4V หรือ MKV ลงบนเครื่องมือ หรือคลิกพื้นที่อัปโหลดเพื่อเลือกไฟล์
  2. 2สร้างคำบรรยายพร้อมเวลา. คลิกสร้างคำบรรยาย ครั้งแรกให้รอจนดาวน์โหลดโมเดล Whisper หลายภาษาเสร็จ แล้วอุปกรณ์จะประมวลผลแทร็กเสียง
  3. 3ตรวจทีละช่วง. เล่นคำบรรยายจากตัวแก้ไข แก้คำที่รู้จำผิด และปรับเวลาเริ่มหรือจบเมื่อเวลาที่สร้างอัตโนมัติเร็วหรือช้าเกินไป
  4. 4ส่งออกไฟล์คำบรรยาย. ดาวน์โหลด SRT ที่ใช้ได้กับโปรแกรมตัดต่อและแพลตฟอร์มจำนวนมาก หรือเลือก VTT สำหรับวิดีโอ HTML และการเผยแพร่บนเว็บ

เหมาะกับใคร

เครื่องมือดึงแทร็กเสียงจากวิดีโอภายในเบราว์เซอร์ แปลงเป็นสัญญาณโมโน 16 kHz ที่ Whisper ใช้ แล้วสร้างเวลาของคำบรรยายในกระบวนการเบื้องหลัง คอมพิวเตอร์ที่รองรับจะใช้ WebGPU เพื่อเพิ่มความเร็ว ส่วนเบราว์เซอร์อื่นจะเปลี่ยนไปใช้ CPU ที่ช้ากว่า ก่อนส่งออก สามารถแก้ทั้งข้อความและเวลาเริ่มจบของแต่ละช่วงได้

คำถามที่พบบ่อย

วิดีโอจะถูกอัปโหลดไปยังเซิร์ฟเวอร์หรือไม่?

ไม่ เบราว์เซอร์อ่านไฟล์ที่เลือกและส่งเฉพาะตัวอย่างเสียงที่ถอดรหัสแล้วไปยังกระบวนการบนอุปกรณ์เดียวกัน กระบวนการนี้ดาวน์โหลดไฟล์โมเดล Whisper จาก Hugging Face แต่ไม่อัปโหลดวิดีโอ เสียง หรือคำบรรยาย CanDoYa ไม่ได้รับหรือจัดเก็บไฟล์

เครื่องมือสร้างซับอัตโนมัติใช้ฟรีหรือไม่?

ใช้ฟรี ไม่ต้องมีบัญชี ไม่ต้องจ่ายเงิน ไม่จำกัดนาที ไม่มีลายน้ำ และไม่ล็อกการส่งออก อุปกรณ์ทำงานถอดเสียงเอง สิ่งที่ต้องใช้จริงคือเวลา หน่วยความจำ และการดาวน์โหลดโมเดลครั้งแรก ผู้ให้บริการอินเทอร์เน็ตอาจนับข้อมูลดาวน์โหลดนี้หากแพ็กเกจมีโควตา

รองรับวิดีโอขนาดและความยาวเท่าใด?

ส่วนอัปโหลดรับไฟล์ได้สูงสุด 500 MB และไม่มีขีดจำกัดนาทีตายตัว วิดีโอยาวต้องใช้หน่วยความจำและเวลามากขึ้น เพราะการถอดรหัสและการทำงานของ AI เกิดบนอุปกรณ์ สำหรับวิดีโอยาวหนึ่งชั่วโมง ควรใช้แล็ปท็อปรุ่นใหม่ ปิดแท็บที่กินหน่วยความจำ หรือแบ่งวิดีโอเป็นช่วงสั้นก่อน

รองรับไฟล์วิดีโอประเภทใดบ้าง?

เครื่องมือรับคอนเทนเนอร์ MP4, WebM, MOV, M4V, MKV, AVI, MPEG และ OGV การถอดรหัสเสียงจริงขึ้นอยู่กับโคเดกในเบราว์เซอร์และระบบปฏิบัติการ โดยทั่วไป MP4 ที่ใช้เสียง AAC และ WebM ที่ใช้เสียง Opus รองรับในเบราว์เซอร์ได้กว้างที่สุด

แก้ไขคำบรรยายที่สร้างอัตโนมัติได้หรือไม่?

ได้ แต่ละช่วงมีข้อความ เวลาเริ่ม และเวลาจบให้แก้ไข เล่นช่วงใดช่วงหนึ่งเพื่อเลื่อนตัวอย่างไปยังจุดเริ่มต้น แล้วแก้คำผิดและขอบเขตเวลา ระบบจะปิดการส่งออกไว้หากมีช่วงที่ไม่มีข้อความ จบก่อนเริ่ม หรือยาวเกินระยะวิดีโอ

SRT กับ VTT ต่างกันอย่างไร?

SRT เป็นรูปแบบคำบรรยายที่โปรแกรมตัดต่อวิดีโอและแพลตฟอร์มเผยแพร่รองรับอย่างกว้างขวาง WebVTT มีโครงสร้างข้อความพร้อมเวลาคล้ายกัน แต่สร้างมาสำหรับเว็บและใช้กับองค์ประกอบ video ของ HTML ได้โดยตรง เครื่องมือนี้ส่งออกได้ทั้งสองแบบโดยไม่ใส่สไตล์หรือฝังข้อความลงในภาพ

สร้างคำบรรยายได้หรือไม่ถ้าไม่มี WebGPU?

ได้ เครื่องมือจะลองใช้ WebGPU ก่อน เพราะหน่วยประมวลผลกราฟิกที่เข้ากันได้รัน Whisper เร็วกว่า หากใช้ไม่ได้หรือทำงานล้มเหลว ระบบจะลองใหม่ด้วย WebAssembly บน CPU วิธีสำรองนี้รองรับเบราว์เซอร์มากกว่า แต่อาจช้ามากกับวิดีโอยาว โดยเฉพาะบนโทรศัพท์และคอมพิวเตอร์รุ่นเก่า

คำบรรยายอัตโนมัติแม่นยำพอสำหรับการเข้าถึงหรือไม่?

ใช้เป็นร่างได้ แต่ยังไม่ใช่งานการเข้าถึงที่พร้อมเผยแพร่ เสียงรบกวน ดนตรี คนพูดทับกัน สำเนียง ชื่อที่พบไม่บ่อย และศัพท์เฉพาะทำให้เกิดข้อผิดพลาดได้ ระบบยังมักละคำอธิบายเสียงและชื่อผู้พูด จึงควรตรวจวิดีโอและเพิ่มข้อมูลเสียงที่มีความหมายก่อนเผยแพร่คำบรรยายอย่างเป็นทางการ