CanDoYa
MS

Penukar Audio ke Teks

Berjalan sepenuhnya dalam pelayar anda - tanpa muat naik, tanpa pendaftaran.

Tambah fail audio untuk menghasilkan transkrip peribadi pada peranti.

Kongsi alat ini

Bagaimanakah cara menukar audio ke teks secara peribadi?

Tambah fail audio dan penukar audio ke teks ini akan menjalankan model pengecaman pertuturan Whisper pada peranti anda. Hasilnya ialah transkrip yang boleh disunting dan dieksport sebagai TXT atau SRT. Rakaman anda tidak dimuat naik, tetapi pelayar perlu memuat turun model AI pada kali pertama anda menggunakannya.

Cara guna

  1. 1Pilih rakaman. Lepaskan fail MP3, WAV, M4A, OGG, FLAC atau WebM pada alat ini, atau klik kawasan muat naik untuk memilih fail.
  2. 2Jalankan transkripsi peribadi. Klik Transkripsikan audio. Pada penggunaan pertama, tunggu model Whisper berbilang bahasa dimuat turun, kemudian biarkan peranti anda memproses rakaman itu.
  3. 3Semak dan eksport. Dengar semula bahagian yang meragukan, betulkan kesilapan, kemudian salin transkrip atau muat turunnya sebagai TXT atau SRT dengan cap masa.

Untuk siapa

Alat ini menukar rakaman suara kepada teks tanpa menghantar rakaman itu kepada perkhidmatan transkripsi. Model Whisper berjalan dalam pekerja pelayar, jadi halaman kekal responsif semasa komputer anda menjalankan inferens. WebGPU digunakan jika tersedia; pelayar lain beralih kepada mod CPU yang lebih perlahan. Model yang telah dimuat turun disimpan dalam cache pelayar untuk lawatan seterusnya.

Soalan lazim

Adakah audio saya dimuat naik ke pelayan?

Tidak. Pelayar menyahkod fail yang anda pilih dan menghantar sampel audio hanya kepada pekerja setempat pada peranti yang sama. Pekerja itu memuat turun fail model Whisper daripada Hugging Face, tetapi tidak memuat naik rakaman atau transkrip anda. CanDoYa tidak menerima atau menyimpan fail tersebut.

Adakah penukar audio ke teks ini percuma?

Ya. Tiada akaun, bayaran, kredit transkripsi atau tera air. Peranti anda sendiri menjalankan inferens AI, jadi kos praktikalnya ialah masa pemprosesan, memori dan muat turun model yang pertama. Penyedia internet anda mungkin masih mengira muat turun model dalam kuota data bermeter.

Apakah saiz fail dan panjang rakaman yang boleh saya transkripsikan?

Kawalan muat naik menerima fail sehingga 500 MB. Tiada kuota minit tetap, tetapi rakaman panjang memerlukan lebih banyak memori dan mengambil masa lebih lama kerana inferens berlaku pada peranti anda. Komputer riba moden lebih sesuai daripada telefon untuk mesyuarat atau kuliah selama satu jam.

Format audio manakah yang disokong?

Alat ini menerima MP3, WAV, M4A, OGG, FLAC, WebM dan beberapa format berkaitan. Sokongan penyahkodan sebenar bergantung pada pelayar dan sistem pengendalian anda. Jika fail ditolak walaupun sambungannya disenaraikan, tukarkannya kepada MP3 atau WAV tanpa mampatan dan cuba lagi.

Bahasa manakah yang boleh ditranskripsikan oleh Whisper?

Model Whisper tiny yang dipilih menyokong pelbagai bahasa dan mengesan banyak bahasa pertuturan secara automatik. Ketepatan berbeza mengikut bahasa, loghat, kualiti rakaman dan topik. Model ini tidak menterjemah transkrip ke bahasa lain, mengenal pasti penutur atau menjamin ejaan nama dan istilah khusus.

Mengapakah transkripsi pertama perlu memuat turun model?

Transkripsi peribadi pada peranti memerlukan model pengecaman pertuturan berada pada komputer anda. Laluan WebGPU memuat turun kira-kira 80 MB, manakala pilihan CPU terkuantum yang serasi menggunakan kira-kira 105 MB. Pelayar biasanya menyimpan fail itu dalam cache supaya lawatan seterusnya boleh menggunakannya semula, kecuali data tapak atau cache dipadamkan.

Adakah transkripsi audio berfungsi tanpa WebGPU?

Ya. Alat ini mengutamakan WebGPU kerana pemproses grafik yang disokong boleh menjalankan Whisper dengan lebih pantas. Jika WebGPU tiada atau gagal, alat mencuba semula dengan WebAssembly pada CPU. Pilihan ini berfungsi dalam lebih banyak pelayar, tetapi mungkin perlahan untuk rakaman panjang, terutama pada telefon dan komputer lama.

Sejauh manakah ketepatan transkrip?

Whisper tiny menghasilkan draf yang berguna daripada pertuturan jelas, tetapi tidak menjamin transkrip kata demi kata. Bunyi latar, muzik, pertuturan bertindih, mikrofon lemah, nama luar biasa dan bahagian senyap yang panjang mengurangkan ketepatan serta boleh menghasilkan perkataan rekaan. Semak petikan penting, butiran perubatan, kenyataan undang-undang dan keputusan dengan audio asal.