CanDoYa
MS

Pengesan Bahasa AI

Bahasa terhad

Berjalan sepenuhnya dalam pelayar anda - tanpa muat naik, tanpa pendaftaran.

Tampal satu ayat atau perenggan untuk mengenal pasti bahasanya.

Teks anda diproses dalam worker pelayar dan tidak pernah dimuat naik. Hanya model AI awam yang dimuat turun.

20 bahasa yang disokong

Arab, Bulgaria, Cina, Belanda, Inggeris, Perancis, Jerman, Yunani, Hindi, Itali, Jepun, Poland, Portugis, Rusia, Sepanyol, Swahili, Thai, Turki, Urdu dan Vietnam.

Teks dalam bahasa lain boleh tersalah label sebagai pilihan disokong yang paling hampir.

Kongsi alat ini

Apakah pengesan bahasa?

Pengesan bahasa mengenal pasti bahasa yang paling mungkin bagi teks yang ditampal. Alat ini membandingkan sampel anda dengan 20 bahasa dan memaparkan tiga skor model teratas. AI berjalan secara lokal dalam worker pelayar, jadi teks anda tidak dimuat naik, tetapi model perlu dimuat turun pada penggunaan pertama.

Cara guna

  1. 1Tampal sampel yang bermakna. Masukkan satu ayat penuh atau perenggan dalam salah satu daripada 20 bahasa yang disokong. Teks semula jadi yang lebih panjang biasanya lebih mudah dibezakan daripada nama atau satu perkataan.
  2. 2Jalankan pengesanan pada peranti. Klik Kesan bahasa. Pada penggunaan pertama, tunggu model selesai dimuat turun; lawatan seterusnya boleh menggunakan cache pelayar jika fail masih tersedia.
  3. 3Semak padanan mengikut kedudukan. Semak bahasa teratas, kod ISO, skor dan pilihan lain. Anggap skor yang rapat, sampel pendek dan bahasa yang tidak disokong sebagai keputusan yang tidak pasti.

Untuk siapa

Pengesan menjalankan model pengelasan XLM-R pada peranti anda dan membuat inferens dalam worker supaya halaman kekal responsif. Ia mengutamakan pecutan WebGPU dan mencuba semula melalui backend CPU WebAssembly apabila perlu. Penggunaan pertama memuat turun kira-kira 296 MB data model dan tokenizer daripada Hugging Face. Pelayar biasanya menyimpan fail itu dalam cache, tetapi boleh membuangnya apabila storan dikosongkan atau ruang tidak mencukupi.

Model membandingkan bahasa Arab, Bulgaria, Cina, Belanda, Inggeris, Perancis, Jerman, Yunani, Hindi, Itali, Jepun, Poland, Portugis, Rusia, Sepanyol, Swahili, Thai, Turki, Urdu dan Vietnam. Teks dalam bahasa lain tetap dipaksa kepada salah satu label tersebut, jadi semak senarai bahasa yang disokong sebelum bergantung pada keputusan.

Soalan lazim

Adakah teks saya dimuat naik ke pelayan?

Tidak. Teks dihantar kepada worker di dalam pelayar anda dan inferens berlaku pada peranti. Worker memuat turun fail model awam dan runtime Transformers.js daripada hos luar, tetapi teks yang anda tampal tidak dihantar bersama permintaan tersebut. CanDoYa tidak menerima atau menyimpan sampel itu.

Adakah pengesan bahasa ini percuma?

Ya. Tiada akaun, bayaran, had kredit atau kunci API. Peranti anda melakukan inferens. Kos praktikalnya ialah muat turun model kali pertama, storan lokal, memori dan masa pemprosesan. Sambungan internet bermeter masih boleh mengenakan caj untuk muat turun fail model.

Berapa banyak teks boleh dianalisis?

Anda boleh menampal petikan biasa, tetapi pengesan hanya menganalisis 400 aksara pertama supaya kekal dalam tetingkap input model dan masa inferens pelayar lebih mudah dijangka. Minimum ialah empat huruf atau nombor. Untuk keputusan yang berguna, berikan sekurang-kurangnya satu ayat semula jadi; satu perenggan memberi model lebih banyak corak pembeza.

Bahasa apa yang boleh dikenal pasti oleh alat ini?

Model menyokong 20 label: Arab, Bulgaria, Cina, Belanda, Inggeris, Perancis, Jerman, Yunani, Hindi, Itali, Jepun, Poland, Portugis, Rusia, Sepanyol, Swahili, Thai, Turki, Urdu dan Vietnam. Bahasa di luar set tertutup ini tidak dapat dikenal pasti dengan andal.

Mengapakah muat turun pertama kira-kira 296 MB?

Pengesan menggunakan model neural XLM-R pelbagai bahasa, bukannya jadual kecil kekerapan aksara. Weight ONNX terkuantumnya berukuran kira-kira 279 MB dan tokenizernya kira-kira 17 MB. Pelayar biasanya menyimpan kedua-duanya dalam cache, tetapi pembuangan cache, mod pelayaran peribadi atau data laman yang dipadam boleh memerlukan muat turun baharu.

Adakah pengesanan bahasa berfungsi tanpa WebGPU?

Ya. Worker mengutamakan WebGPU apabila tersedia dalam pelayar. Jika WebGPU tiada atau model gagal dimulakan, alat mencuba semula dengan backend CPU WebAssembly. Inferens CPU masih menyimpan teks pada peranti anda, tetapi pemuatan dan pengesanan boleh mengambil masa lebih lama pada telefon atau komputer lama.

Apakah maksud skor keyakinan?

Skor menyusun 20 label model yang mungkin bagi sampel ini. Skor berguna untuk membandingkan calon, tetapi bukan jaminan, bukan kebarangkalian ketepatan yang bebas dan bukan bukti bahawa bahasa sebenar disokong. Jika skor teratas rapat, tambah lebih banyak teks semula jadi.

Bolehkah alat ini mengesan teks bercampur atau teks transliterasi?

Alat memberikan satu padanan utama serta pilihan lain, bukannya label bahasa bagi setiap ayat atau perkataan. Teks bercampur bahasa boleh menghasilkan skor yang rapat. Transliterasi tidak formal, nama, emoji, URL dan kod sumber juga mengurangkan petunjuk tulisan serta ejaan, jadi input seperti ini perlu disemak dengan berhati-hati oleh manusia.