CanDoYa
ID

Deteksi Bahasa dengan AI

Bahasa terbatas

Berjalan sepenuhnya di browser Anda - tanpa unggah, tanpa daftar.

Tempelkan satu kalimat atau paragraf untuk mendeteksi bahasanya.

Teks diproses dalam proses terpisah di browser dan tidak pernah diunggah. Hanya model AI publik yang diunduh.

20 bahasa yang didukung

Arab, Bulgaria, Tionghoa, Belanda, Inggris, Prancis, Jerman, Yunani, Hindi, Italia, Jepang, Polandia, Portugis, Rusia, Spanyol, Swahili, Thai, Turki, Urdu, dan Vietnam.

Teks dalam bahasa lain dapat keliru diberi label sebagai pilihan terdekat yang didukung.

Bagikan tool ini

Apa itu detektor bahasa?

Detektor bahasa memperkirakan bahasa yang paling mungkin digunakan dalam teks yang ditempel. Alat ini membandingkan sampel dengan 20 bahasa dan menampilkan tiga skor model tertinggi. AI berjalan secara lokal dalam proses terpisah di browser, jadi teks tidak diunggah, meskipun model perlu diunduh saat pertama kali digunakan.

Cara pakai

  1. 1Tempel sampel yang memadai. Masukkan satu kalimat lengkap atau paragraf dalam salah satu dari 20 bahasa yang didukung. Teks alami yang lebih panjang biasanya lebih mudah dikenali daripada nama atau satu kata.
  2. 2Jalankan deteksi di perangkat. Klik Deteksi bahasa. Pada penggunaan pertama, tunggu model selesai diunduh; kunjungan berikutnya dapat memakai cache browser selama datanya masih tersedia.
  3. 3Tinjau hasil berperingkat. Periksa bahasa teratas, kode ISO, skor, dan pilihan lain. Anggap skor yang berdekatan, sampel pendek, dan bahasa yang tidak didukung sebagai hasil yang belum pasti.

Cocok untuk siapa

Detektor menjalankan model klasifikasi XLM-R di perangkat dan mengerjakan inferensi dalam proses terpisah agar halaman tetap responsif. WebGPU dipilih untuk akselerasi, lalu sistem mencoba ulang dengan backend CPU WebAssembly bila diperlukan. Penggunaan pertama mengunduh sekitar 296 MB data model dan tokenizer dari Hugging Face. Browser biasanya menyimpan berkas tersebut di cache, tetapi dapat menghapusnya saat penyimpanan dibersihkan atau ruang hampir habis.

Model membandingkan bahasa Arab, Bulgaria, Tionghoa, Belanda, Inggris, Prancis, Jerman, Yunani, Hindi, Italia, Jepang, Polandia, Portugis, Rusia, Spanyol, Swahili, Thai, Turki, Urdu, dan Vietnam. Teks dalam bahasa lain akan dipaksa masuk ke salah satu label tersebut, jadi periksa daftar bahasa yang didukung sebelum mengandalkan hasilnya.

Tanya jawab

Apakah teks saya diunggah ke server?

Tidak. Teks diteruskan ke proses terpisah di dalam browser dan inferensi berlangsung di perangkat. Proses tersebut mengunduh berkas model publik serta runtime Transformers.js dari host eksternal, tetapi teks yang ditempel tidak ikut dikirim bersama permintaan tersebut. CanDoYa tidak menerima atau menyimpan sampel itu.

Apakah detektor bahasa ini gratis?

Ya. Tidak ada akun, pembayaran, batas kredit, atau kunci API. Perangkat menjalankan inferensi. Biaya praktisnya berupa unduhan model pertama, ruang penyimpanan lokal, memori, dan waktu pemrosesan. Penyedia internet tetap dapat mengenakan biaya data untuk mengunduh berkas model.

Berapa banyak teks yang dapat dianalisis?

Anda dapat menempelkan teks biasa sepanjang apa pun, tetapi detektor hanya menganalisis 400 karakter pertama agar tetap berada dalam jendela masukan model dan menjaga inferensi browser tetap terukur. Minimal diperlukan empat huruf atau angka. Untuk hasil yang berguna, masukkan setidaknya satu kalimat alami; satu paragraf memberi model lebih banyak pola pembeda.

Bahasa apa saja yang dapat dikenali alat ini?

Model mendukung 20 label: Arab, Bulgaria, Tionghoa, Belanda, Inggris, Prancis, Jerman, Yunani, Hindi, Italia, Jepang, Polandia, Portugis, Rusia, Spanyol, Swahili, Thai, Turki, Urdu, dan Vietnam. Bahasa di luar himpunan tertutup itu tidak dapat dikenali dengan andal.

Mengapa unduhan pertama berukuran sekitar 296 MB?

Detektor memakai model neural multibahasa XLM-R, bukan tabel frekuensi karakter yang kecil. Bobot ONNX terkuantisasi berukuran sekitar 279 MB dan tokenizer sekitar 17 MB. Browser biasanya menyimpan keduanya di cache, meskipun penghapusan cache, mode privat, atau pembersihan data situs dapat memicu unduhan ulang.

Apakah deteksi bahasa berfungsi tanpa WebGPU?

Ya. Worker mengutamakan WebGPU bila tersedia di browser. Jika WebGPU tidak tersedia atau model gagal dimulai, alat mencoba ulang dengan backend CPU WebAssembly. Inferensi CPU tetap menyimpan teks di perangkat, tetapi pemuatan dan deteksi bisa lebih lama di ponsel atau komputer lama.

Apa arti skor keyakinan?

Skor tersebut mengurutkan 20 label yang mungkin menurut model untuk sampel ini. Skor berguna untuk membandingkan kandidat, tetapi bukan jaminan, bukan probabilitas kebenaran yang berdiri sendiri, dan bukan bukti bahwa bahasa sebenarnya didukung. Skor teratas yang berdekatan berarti sebaiknya tambahkan teks alami.

Bisakah alat ini mengenali teks campuran atau alih aksara?

Alat menampilkan satu kecocokan utama beserta alternatif, bukan label bahasa untuk tiap kalimat atau kata. Teks campuran dapat menghasilkan skor yang berdekatan. Alih aksara informal, nama, emoji, URL, dan kode sumber juga menghilangkan banyak petunjuk aksara serta ejaan, jadi hasil tersebut perlu ditinjau manusia dengan hati-hati.