Alat ini mengubah rekaman suara menjadi teks tanpa mengirimkannya ke layanan transkripsi. Model Whisper berjalan di worker browser, sehingga halaman tetap responsif saat komputer memproses audio. WebGPU dipakai jika tersedia; browser lain akan beralih ke mode CPU yang lebih lambat. Model yang sudah diunduh disimpan di cache browser untuk kunjungan berikutnya.
Konverter audio ke teks
Berjalan sepenuhnya di browser Anda - tanpa unggah, tanpa daftar.
Bagaimana cara mengubah audio ke teks secara privat?
Tambahkan file audio, lalu konverter audio ke teks ini menjalankan model pengenalan suara Whisper di perangkat Anda. Hasilnya berupa transkrip yang bisa diedit serta diunduh sebagai TXT atau SRT. Rekaman tidak pernah diunggah, meski browser perlu mengunduh model AI saat pertama kali dipakai.
Cara pakai
- 1Pilih rekaman. Letakkan file MP3, WAV, M4A, OGG, FLAC, atau WebM di alat ini, atau klik area unggah untuk memilih file.
- 2Mulai transkripsi privat. Klik Transkripsikan audio. Pada pemakaian pertama, tunggu hingga model Whisper multibahasa selesai diunduh, lalu biarkan perangkat memproses rekaman.
- 3Periksa dan unduh. Dengarkan kembali bagian yang meragukan, perbaiki kesalahan, lalu salin transkrip atau unduh sebagai TXT maupun SRT dengan penanda waktu.
Cocok untuk siapa
- Pewawancara dan peneliti membuat draf privat sebelum mencocokkan nama dan kutipan dengan rekaman asli.
- Pelajar dan mahasiswa mengubah rekaman kuliah atau catatan suara menjadi teks yang dapat diedit tanpa mengunggah audio kelas.
- Podcaster dan kreator video menyiapkan transkrip awal atau file SRT dengan penanda waktu untuk takarir.
- Tim yang menangani rekaman sensitif menyimpan audio sumber di perangkat, bukan mengirimkannya ke antrean transkripsi cloud.
Tanya jawab
Apakah audio saya diunggah ke server?
Tidak. Browser membaca file yang dipilih dan hanya mengirim sampel audio ke worker lokal di perangkat yang sama. Worker mengunduh file model Whisper dari Hugging Face, tetapi tidak mengunggah rekaman atau transkrip Anda. CanDoYa tidak menerima maupun menyimpan file tersebut.
Apakah konverter audio ke teks ini gratis?
Ya. Tidak ada akun, pembayaran, kredit transkripsi, atau tanda air. Perangkat Anda sendiri menjalankan proses AI, jadi biaya praktisnya berupa waktu pemrosesan, memori, dan unduhan model pertama. Penyedia internet tetap dapat menghitung unduhan model dalam kuota data.
Berapa ukuran file dan durasi rekaman yang dapat ditranskripsikan?
Kontrol unggah menerima file hingga 500 MB. Tidak ada batas menit tetap, tetapi rekaman panjang memerlukan lebih banyak memori dan waktu karena seluruh proses berlangsung di perangkat. Laptop modern lebih cocok daripada ponsel untuk rapat atau kuliah berdurasi satu jam.
Format audio apa saja yang didukung?
Alat ini menerima MP3, WAV, M4A, OGG, FLAC, WebM, dan beberapa format terkait. Dukungan dekode sebenarnya bergantung pada browser dan sistem operasi. Jika ekstensi file tercantum tetapi tetap ditolak, ubah ke MP3 atau WAV tanpa kompresi lalu coba lagi.
Bahasa apa saja yang dapat ditranskripsikan Whisper?
Model Whisper tiny yang dipakai bersifat multibahasa dan dapat mendeteksi banyak bahasa lisan secara otomatis. Akurasi berbeda menurut bahasa, aksen, kualitas rekaman, dan topik. Model ini tidak menerjemahkan transkrip, mengenali pembicara, atau menjamin ejaan nama dan istilah khusus.
Mengapa transkripsi pertama perlu mengunduh model?
Transkripsi privat di perangkat memerlukan model pengenalan suara di komputer Anda. Jalur WebGPU mengunduh sekitar 80 MB, sedangkan mode CPU terkuantisasi sekitar 105 MB. Browser biasanya menyimpan file ini di cache agar dapat dipakai lagi, kecuali data situs atau cache dihapus.
Apakah transkripsi audio berfungsi tanpa WebGPU?
Ya. Alat ini mengutamakan WebGPU karena prosesor grafis yang didukung dapat menjalankan Whisper jauh lebih cepat. Jika WebGPU tidak tersedia atau gagal, alat akan mencoba lagi memakai WebAssembly di CPU. Mode ini mendukung lebih banyak browser, tetapi bisa lambat untuk rekaman panjang, terutama di ponsel dan komputer lama.
Seberapa akurat hasil transkripsinya?
Whisper tiny menghasilkan draf yang berguna dari suara jernih, tetapi tidak menjamin salinan kata demi kata. Derau latar, musik, percakapan yang tumpang tindih, mikrofon lemah, nama yang jarang, dan jeda panjang dapat menurunkan akurasi serta memunculkan kata rekaan. Cocokkan kutipan penting, rincian medis, pernyataan hukum, dan keputusan dengan audio asli.