CanDoYa
FIL

Detektor ng Wika na Gumagamit ng AI

Limitadong wika

Tumatakbo nang buo sa iyong browser - walang upload, walang sign-up.

Mag-paste ng pangungusap o talata para matukoy ang wika nito.

Pinoproseso ang teksto mo sa isang worker ng browser at hindi ito ina-upload. Pampublikong AI model lang ang dina-download.

20 suportadong wika

Arabe, Bulgaro, Tsino, Olandes, Ingles, Pranses, Aleman, Griyego, Hindi, Italyano, Hapon, Polako, Portuges, Ruso, Espanyol, Swahili, Thai, Turko, Urdu at Biyetnames.

Maaaring maling matukoy ang tekstong nasa ibang wika bilang pinakamalapit na suportadong opsyon.

Ibahagi ang tool na ito

Ano ang detektor ng wika?

Tinutukoy ng detektor ng wika kung anong wika ang pinakamalamang na ginamit sa ipinaste na teksto. Inihahambing ng tool na ito ang sample sa 20 wika at ipinapakita ang tatlong pinakamataas na score ng model. Lokal na tumatakbo ang AI sa isang worker ng browser, kaya hindi ina-upload ang teksto mo, pero kailangang i-download ang model sa unang paggamit.

Paano gamitin

  1. 1Mag-paste ng makabuluhang sample. Maglagay ng buong pangungusap o talata sa isa sa 20 suportadong wika. Mas madaling makilala ang mas mahaba at natural na teksto kaysa pangalan o isang salita lang.
  2. 2Patakbuhin ang pagtukoy sa device. I-click ang Tukuyin ang wika. Sa unang gamit, hintaying matapos ang pag-download ng model; maaaring gamitin sa susunod na pagbisita ang cache ng browser kung naroon pa ang mga file.
  3. 3Suriin ang mga ranggong tugma. Tingnan ang nangungunang wika, ISO code, score at iba pang posibleng tugma. Ituring na hindi tiyak ang magkakalapit na score, maiikling sample at wikang hindi suportado.

Para kanino ito

Pinapatakbo ng detektor ang XLM-R classification model sa device mo at ginagawa ang inference sa isang worker para manatiling mabilis tumugon ang page. Inuuna nito ang WebGPU acceleration at sumusubok ulit sa WebAssembly CPU backend kapag kailangan. Sa unang gamit, nagda-download ito ng humigit-kumulang 296 MB na model at tokenizer data mula sa Hugging Face. Karaniwang sine-save ng browser ang mga file sa cache, pero puwedeng burahin ang mga ito kapag nilinis ang storage o kapos ang espasyo.

Inihahambing ng model ang Arabe, Bulgaro, Tsino, Olandes, Ingles, Pranses, Aleman, Griyego, Hindi, Italyano, Hapon, Polako, Portuges, Ruso, Espanyol, Swahili, Thai, Turko, Urdu at Biyetnames. Ang tekstong nasa ibang wika ay mapipilitang mapunta sa isa sa mga label na iyon, kaya tingnan muna ang listahan ng suportadong wika bago umasa sa resulta.

FAQ

Ina-upload ba sa server ang teksto ko?

Hindi. Ipinapasa ang teksto sa isang worker sa loob ng browser at sa device mo ginagawa ang inference. Nagda-download ang worker ng pampublikong model files at Transformers.js runtime mula sa mga panlabas na host, pero hindi kasama ang ipinaste mong teksto sa mga request na iyon. Hindi natatanggap o sine-save ng CanDoYa ang sample.

Libre ba ang detektor ng wika?

Oo. Walang account, bayad, credit limit o API key. Device mo ang gumagawa ng inference. Ang praktikal na kailangan ay ang unang pag-download ng model, lokal na storage, memory at oras ng pagproseso. Kung may bayad ayon sa gamit ang internet connection mo, maaari pa ring masingil ang pag-download ng model files.

Gaano karaming teksto ang puwedeng suriin?

Puwede kang mag-paste ng karaniwang sipi, pero hanggang unang 400 character lang ang sinusuri para manatili sa input window ng model at maging mas tiyak ang tagal ng inference sa browser. Apat na letra o numero ang minimum. Para sa kapaki-pakinabang na resulta, magbigay ng kahit isang natural na pangungusap; mas maraming natatanging pattern ang nakukuha sa isang talata.

Anong mga wika ang kayang tukuyin ng tool na ito?

May 20 label ang model: Arabe, Bulgaro, Tsino, Olandes, Ingles, Pranses, Aleman, Griyego, Hindi, Italyano, Hapon, Polako, Portuges, Ruso, Espanyol, Swahili, Thai, Turko, Urdu at Biyetnames. Hindi nito mapagkakatiwalaang makikilala ang mga wika sa labas ng closed set na ito.

Bakit humigit-kumulang 296 MB ang unang download?

Multilingual XLM-R neural model ang ginagamit ng detektor, hindi maliit na talahanayan lang ng dalas ng character. Humigit-kumulang 279 MB ang quantized ONNX weights at 17 MB ang tokenizer. Karaniwang sine-save ng browser ang dalawa sa cache, pero kakailanganing mag-download ulit kapag inalis ang cache, gumamit ng pribadong browsing o binura ang site data.

Gumagana ba ang pagtukoy ng wika nang walang WebGPU?

Oo. Inuuna ng worker ang WebGPU kapag available ito sa browser. Kapag walang WebGPU o hindi nagsimula ang model, sumusubok ulit ang tool gamit ang WebAssembly CPU backend. Nananatili pa rin sa device mo ang teksto sa CPU inference, pero maaaring mas matagal ang pag-load at pagtukoy sa phone o mas lumang computer.

Ano ang ibig sabihin ng confidence score?

Iniraranggo ng mga score ang 20 posibleng label ng model para sa sample. Kapaki-pakinabang ang mga ito sa paghahambing ng kandidato, pero hindi garantiya, hiwalay na posibilidad ng pagiging tama o patunay na suportado ang tunay na wika. Kapag magkalapit ang nangungunang score, magdagdag ng mas natural na teksto.

Kaya ba nitong tukuyin ang halo-halo o transliterated na teksto?

Isang dominanteng nangungunang tugma at mga alternatibo ang ibinibigay ng tool, hindi label ng wika para sa bawat pangungusap o salita. Maaaring magbigay ng magkakalapit na score ang tekstong may halong wika. Nababawasan din ang palatandaan sa script at baybay kapag impormal ang transliteration o may mga pangalan, emoji, URL at source code, kaya kailangan pa rin ng maingat na pagsusuri ng tao.