CanDoYa
ID

Konverter audio ke teks

Berjalan sepenuhnya di browser Anda - tanpa unggah, tanpa daftar.

Tambahkan file audio untuk membuat transkrip privat di perangkat.

Bagikan tool ini

Bagaimana cara mengubah audio ke teks secara privat?

Tambahkan file audio, lalu konverter audio ke teks ini menjalankan model pengenalan suara Whisper di perangkat Anda. Hasilnya berupa transkrip yang bisa diedit serta diunduh sebagai TXT atau SRT. Rekaman tidak pernah diunggah, meski browser perlu mengunduh model AI saat pertama kali dipakai.

Cara pakai

  1. 1Pilih rekaman. Letakkan file MP3, WAV, M4A, OGG, FLAC, atau WebM di alat ini, atau klik area unggah untuk memilih file.
  2. 2Mulai transkripsi privat. Klik Transkripsikan audio. Pada pemakaian pertama, tunggu hingga model Whisper multibahasa selesai diunduh, lalu biarkan perangkat memproses rekaman.
  3. 3Periksa dan unduh. Dengarkan kembali bagian yang meragukan, perbaiki kesalahan, lalu salin transkrip atau unduh sebagai TXT maupun SRT dengan penanda waktu.

Cocok untuk siapa

Alat ini mengubah rekaman suara menjadi teks tanpa mengirimkannya ke layanan transkripsi. Model Whisper berjalan di worker browser, sehingga halaman tetap responsif saat komputer memproses audio. WebGPU dipakai jika tersedia; browser lain akan beralih ke mode CPU yang lebih lambat. Model yang sudah diunduh disimpan di cache browser untuk kunjungan berikutnya.

Tanya jawab

Apakah audio saya diunggah ke server?

Tidak. Browser membaca file yang dipilih dan hanya mengirim sampel audio ke worker lokal di perangkat yang sama. Worker mengunduh file model Whisper dari Hugging Face, tetapi tidak mengunggah rekaman atau transkrip Anda. CanDoYa tidak menerima maupun menyimpan file tersebut.

Apakah konverter audio ke teks ini gratis?

Ya. Tidak ada akun, pembayaran, kredit transkripsi, atau tanda air. Perangkat Anda sendiri menjalankan proses AI, jadi biaya praktisnya berupa waktu pemrosesan, memori, dan unduhan model pertama. Penyedia internet tetap dapat menghitung unduhan model dalam kuota data.

Berapa ukuran file dan durasi rekaman yang dapat ditranskripsikan?

Kontrol unggah menerima file hingga 500 MB. Tidak ada batas menit tetap, tetapi rekaman panjang memerlukan lebih banyak memori dan waktu karena seluruh proses berlangsung di perangkat. Laptop modern lebih cocok daripada ponsel untuk rapat atau kuliah berdurasi satu jam.

Format audio apa saja yang didukung?

Alat ini menerima MP3, WAV, M4A, OGG, FLAC, WebM, dan beberapa format terkait. Dukungan dekode sebenarnya bergantung pada browser dan sistem operasi. Jika ekstensi file tercantum tetapi tetap ditolak, ubah ke MP3 atau WAV tanpa kompresi lalu coba lagi.

Bahasa apa saja yang dapat ditranskripsikan Whisper?

Model Whisper tiny yang dipakai bersifat multibahasa dan dapat mendeteksi banyak bahasa lisan secara otomatis. Akurasi berbeda menurut bahasa, aksen, kualitas rekaman, dan topik. Model ini tidak menerjemahkan transkrip, mengenali pembicara, atau menjamin ejaan nama dan istilah khusus.

Mengapa transkripsi pertama perlu mengunduh model?

Transkripsi privat di perangkat memerlukan model pengenalan suara di komputer Anda. Jalur WebGPU mengunduh sekitar 80 MB, sedangkan mode CPU terkuantisasi sekitar 105 MB. Browser biasanya menyimpan file ini di cache agar dapat dipakai lagi, kecuali data situs atau cache dihapus.

Apakah transkripsi audio berfungsi tanpa WebGPU?

Ya. Alat ini mengutamakan WebGPU karena prosesor grafis yang didukung dapat menjalankan Whisper jauh lebih cepat. Jika WebGPU tidak tersedia atau gagal, alat akan mencoba lagi memakai WebAssembly di CPU. Mode ini mendukung lebih banyak browser, tetapi bisa lambat untuk rekaman panjang, terutama di ponsel dan komputer lama.

Seberapa akurat hasil transkripsinya?

Whisper tiny menghasilkan draf yang berguna dari suara jernih, tetapi tidak menjamin salinan kata demi kata. Derau latar, musik, percakapan yang tumpang tindih, mikrofon lemah, nama yang jarang, dan jeda panjang dapat menurunkan akurasi serta memunculkan kata rekaan. Cocokkan kutipan penting, rincian medis, pernyataan hukum, dan keputusan dengan audio asli.