เครื่องมือนี้ถอดคำพูดจากไฟล์บันทึกเสียงโดยไม่ส่งไฟล์ไปยังบริการถอดเสียง โมเดล Whisper ทำงานในกระบวนการเบื้องหลังของเบราว์เซอร์ หน้าเว็บจึงยังตอบสนองได้ขณะที่คอมพิวเตอร์ประมวลผล หากใช้ WebGPU ได้ ระบบจะเลือกใช้เพื่อเพิ่มความเร็ว ส่วนเบราว์เซอร์อื่นจะเปลี่ยนไปประมวลผลด้วย CPU ซึ่งช้ากว่า โมเดลที่ดาวน์โหลดแล้วจะถูกเก็บไว้ในแคชสำหรับครั้งถัดไป
เครื่องมือแปลงเสียงเป็นข้อความ
ทำงานในเบราว์เซอร์ทั้งหมด ไม่ต้องอัปโหลด ไม่ต้องสมัครสมาชิก
จะแปลงเสียงเป็นข้อความแบบส่วนตัวได้อย่างไร?
เพิ่มไฟล์เสียงแล้วเครื่องมือนี้จะใช้โมเดลรู้จำเสียงพูด Whisper บนอุปกรณ์ของคุณ จากนั้นแก้ไขข้อความที่ถอดได้ หรือส่งออกเป็น TXT และ SRT ได้ทันที ไฟล์บันทึกเสียงจะไม่ถูกอัปโหลด แต่เบราว์เซอร์ต้องดาวน์โหลดโมเดล AI ในการใช้งานครั้งแรก
วิธีใช้งาน
- 1เลือกไฟล์บันทึกเสียง. ลากไฟล์ MP3, WAV, M4A, OGG, FLAC หรือ WebM มาวางบนเครื่องมือ หรือคลิกพื้นที่อัปโหลดเพื่อเลือกไฟล์
- 2เริ่มถอดเสียงแบบส่วนตัว. คลิกถอดเสียง ครั้งแรกให้รอโมเดล Whisper แบบหลายภาษาดาวน์โหลด จากนั้นระบบจะประมวลผลไฟล์บนอุปกรณ์
- 3ตรวจทานและส่งออก. ฟังช่วงที่ไม่แน่ใจอีกครั้ง แก้คำที่ผิด แล้วคัดลอกข้อความหรือดาวน์โหลดเป็น TXT หรือ SRT พร้อมเวลา
เหมาะกับใคร
- ผู้สัมภาษณ์และนักวิจัยที่ต้องการร่างข้อความแบบส่วนตัวก่อนตรวจสอบชื่อและคำพูดอ้างอิงกับไฟล์ต้นฉบับ
- นักเรียนและนักศึกษาที่ต้องการเปลี่ยนเสียงบรรยายหรือโน้ตเสียงเป็นข้อความแก้ไขได้ โดยไม่อัปโหลดเสียงจากห้องเรียน
- ผู้ทำพอดแคสต์และวิดีโอที่ต้องการร่างบทถอดเสียงหรือไฟล์ SRT พร้อมเวลาเพื่อทำคำบรรยาย
- ทีมที่ทำงานกับเสียงละเอียดอ่อนซึ่งต้องการเก็บไฟล์ต้นฉบับไว้บนอุปกรณ์ ไม่ส่งเข้าสู่คิวถอดเสียงบนคลาวด์
คำถามที่พบบ่อย
ไฟล์เสียงจะถูกอัปโหลดไปยังเซิร์ฟเวอร์หรือไม่?
ไม่ เบราว์เซอร์จะถอดรหัสไฟล์ที่เลือกและส่งตัวอย่างเสียงไปยังกระบวนการภายในอุปกรณ์เดียวกันเท่านั้น กระบวนการนี้ดาวน์โหลดไฟล์โมเดล Whisper จาก Hugging Face แต่ไม่อัปโหลดไฟล์เสียงหรือข้อความที่ถอดได้ CanDoYa ไม่ได้รับหรือจัดเก็บไฟล์ของคุณ
เครื่องมือแปลงเสียงเป็นข้อความใช้ฟรีหรือไม่?
ใช้ฟรี ไม่ต้องมีบัญชี ไม่ต้องจ่ายเงิน ไม่มีเครดิตจำกัดนาที และไม่มีลายน้ำ อุปกรณ์ของคุณทำงาน AI เอง สิ่งที่ต้องใช้จริงคือเวลา หน่วยความจำ และการดาวน์โหลดโมเดลครั้งแรก ผู้ให้บริการอินเทอร์เน็ตอาจยังนับข้อมูลส่วนนี้หากแพ็กเกจมีโควตา
รองรับไฟล์ใหญ่และเสียงยาวแค่ไหน?
ส่วนอัปโหลดรับไฟล์ได้สูงสุด 500 MB และไม่ได้จำกัดจำนวนนาทีตายตัว แต่ไฟล์ยาวใช้หน่วยความจำมากกว่าและประมวลผลนานกว่า เพราะทุกอย่างทำบนอุปกรณ์ แล็ปท็อปรุ่นใหม่เหมาะกับการประชุมหรือการบรรยายยาวหนึ่งชั่วโมงมากกว่าโทรศัพท์
รองรับไฟล์เสียงประเภทใดบ้าง?
เครื่องมือรับ MP3, WAV, M4A, OGG, FLAC, WebM และรูปแบบใกล้เคียงบางชนิด การถอดรหัสจริงขึ้นอยู่กับเบราว์เซอร์และระบบปฏิบัติการ หากไฟล์ถูกปฏิเสธทั้งที่นามสกุลอยู่ในรายการ ให้แปลงเป็น MP3 หรือ WAV แบบไม่บีบอัดแล้วลองใหม่
Whisper ถอดเสียงภาษาใดได้บ้าง?
โมเดล Whisper tiny ที่ใช้รองรับหลายภาษาและตรวจจับภาษาพูดจำนวนมากโดยอัตโนมัติ ความแม่นยำต่างกันตามภาษา สำเนียง คุณภาพเสียง และหัวข้อ เครื่องมือนี้ไม่แปลข้อความเป็นอีกภาษา ไม่แยกผู้พูด และไม่รับประกันการสะกดชื่อหรือศัพท์เฉพาะ
ทำไมการถอดเสียงครั้งแรกต้องดาวน์โหลดโมเดล?
การถอดเสียงแบบส่วนตัวบนอุปกรณ์ต้องมีโมเดลรู้จำเสียงอยู่ในเครื่อง เส้นทาง WebGPU ดาวน์โหลดประมาณ 80 MB ส่วนโหมดสำรองด้วย CPU ดาวน์โหลดประมาณ 105 MB โดยปกติเบราว์เซอร์จะเก็บไฟล์เหล่านี้ไว้ในแคชให้ใช้ซ้ำ จนกว่าจะล้างข้อมูลเว็บไซต์หรือแคช
ถอดเสียงได้หรือไม่ถ้าไม่มี WebGPU?
ได้ เครื่องมือเลือก WebGPU ก่อน เพราะหน่วยประมวลผลกราฟิกที่รองรับจะรัน Whisper ได้เร็วกว่า หากไม่มี WebGPU หรือใช้งานไม่สำเร็จ ระบบจะลองใหม่ด้วย WebAssembly บน CPU วิธีสำรองนี้ใช้ได้กับเบราว์เซอร์มากกว่า แต่อาจช้าสำหรับไฟล์ยาว โดยเฉพาะบนโทรศัพท์และคอมพิวเตอร์รุ่นเก่า
ข้อความที่ถอดได้แม่นยำเพียงใด?
Whisper tiny ให้ร่างที่มีประโยชน์เมื่อเสียงชัด แต่ไม่รับประกันว่าจะตรงทุกคำ เสียงพื้นหลัง ดนตรี คนพูดแทรกกัน ไมโครโฟนเบา ชื่อที่พบไม่บ่อย และช่วงเงียบยาวจะลดความแม่นยำและอาจสร้างคำที่ไม่ได้พูด ควรเทียบคำพูดสำคัญ ข้อมูลทางการแพทย์ ข้อความทางกฎหมาย และข้อสรุปกับเสียงต้นฉบับ