CanDoYa
LV

Teksta valodas noteikšana ar MI

Ierobežotas valodas

Darbojas tikai tavā pārlūkā - bez augšupielādes un reģistrācijas.

Ielīmējiet teikumu vai rindkopu, lai noteiktu teksta valodu.

Teksts tiek apstrādāts atsevišķā pārlūka procesā un nekad netiek augšupielādēts. Tiek lejupielādēts tikai publiskais MI modelis.

20 atbalstītās valodas

Arābu, bulgāru, ķīniešu, nīderlandiešu, angļu, franču, vācu, grieķu, hindi, itāļu, japāņu, poļu, portugāļu, krievu, spāņu, svahili, taju, turku, urdu un vjetnamiešu.

Tekstu citā valodā var kļūdaini apzīmēt kā tuvāko atbalstīto iespēju.

Kopīgot šo rīku

Kā noteikt teksta valodu?

Valodas noteikšanas rīks atrod visdrīzāk izmantoto valodu ielīmētajā tekstā. Šis rīks salīdzina paraugu ar 20 valodām un parāda trīs augstākos modeļa vērtējumus. MI darbojas lokāli atsevišķā pārlūka procesā, tāpēc teksts netiek augšupielādēts, taču pirmajā lietošanas reizē ir jālejupielādē modelis.

Kā lietot

  1. 1Ielīmējiet noderīgu paraugu. Ievadiet pilnu teikumu vai rindkopu vienā no 20 atbalstītajām valodām. Garāku, dabisku tekstu parasti ir vieglāk atšķirt nekā vārdu vai vienu atsevišķu vārdu.
  2. 2Palaidiet noteikšanu ierīcē. Noklikšķiniet uz Noteikt valodu. Pirmajā reizē uzgaidiet, kamēr tiek lejupielādēts modelis. Vēlāk rīks var izmantot pārlūka kešatmiņu, ja tā joprojām ir pieejama.
  3. 3Pārskatiet sarindotos rezultātus. Pārbaudiet pirmo valodu, ISO kodu, vērtējumu un citus variantus. Tuvus vērtējumus, īsus paraugus un neatbalstītas valodas uzskatiet par nedrošiem rezultātiem.

Kam noder

Rīks jūsu ierīcē palaiž XLM-R klasifikācijas modeli, bet aprēķinus veic atsevišķā procesā, lai lapa saglabātu ātru reakciju. Vispirms tas izmanto WebGPU paātrinājumu, bet vajadzības gadījumā mēģina vēlreiz ar WebAssembly un centrālo procesoru. Pirmajā palaišanas reizē no Hugging Face tiek lejupielādēti aptuveni 296 MB modeļa un tekstvienību dalītāja datu. Pārlūks tos parasti saglabā kešatmiņā, taču var dzēst, ja notīrāt krātuvi vai ierīcē trūkst vietas.

Modelis salīdzina arābu, bulgāru, ķīniešu, nīderlandiešu, angļu, franču, vācu, grieķu, hindi, itāļu, japāņu, poļu, portugāļu, krievu, spāņu, svahili, taju, turku, urdu un vjetnamiešu valodu. Teksts citā valodā tiks pieskaitīts vienai no šīm iezīmēm, tāpēc pirms paļaušanās uz rezultātu pārbaudiet atbalstīto valodu sarakstu.

Biežāk uzdotie jautājumi

Vai mans teksts tiek augšupielādēts serverī?

Nē. Teksts tiek nodots atsevišķam procesam pārlūkā, un apstrāde notiek jūsu ierīcē. Šis process no ārējiem serveriem lejupielādē publiskos modeļa failus un Transformers.js izpildvidi, taču kopā ar šiem pieprasījumiem nesūta ielīmēto tekstu. CanDoYa paraugu nesaņem un neglabā.

Vai valodas noteikšana ir bez maksas?

Jā. Nav vajadzīgs konts, maksājums, kredītlimits vai API atslēga. Aprēķinus veic jūsu ierīce. Praktiskās izmaksas ir pirmais modeļa lejupielādes apjoms, vietējā krātuve, atmiņa un apstrādes laiks. Ja par interneta savienojumu maksājat atbilstoši datu apjomam, modeļa failu lejupielādei var būt papildu maksa.

Cik daudz teksta varu analizēt?

Varat ielīmēt parastu jebkura garuma fragmentu, taču rīks analizē ne vairāk kā pirmās 400 rakstzīmes, lai nepārsniegtu modeļa ievades logu un pārlūka aprēķini būtu paredzami. Nepieciešami vismaz četri burti vai cipari. Noderīgam rezultātam ievadiet vismaz vienu dabisku teikumu, bet rindkopa modelim sniegs vairāk atšķirīgu pazīmju.

Kuras valodas rīks var noteikt?

Modelis atbalsta 20 iezīmes: arābu, bulgāru, ķīniešu, nīderlandiešu, angļu, franču, vācu, grieķu, hindi, itāļu, japāņu, poļu, portugāļu, krievu, spāņu, svahili, taju, turku, urdu un vjetnamiešu valodu. Valodas ārpus šīs slēgtās kopas tas droši nenosaka.

Kāpēc pirmajā reizē jālejupielādē aptuveni 296 MB?

Rīks izmanto daudzvalodu XLM-R neironu modeli, nevis mazu rakstzīmju biežuma tabulu. Kvantētie ONNX svari aizņem aptuveni 279 MB, bet tekstvienību dalītājs vēl aptuveni 17 MB. Pārlūks abus parasti saglabā kešatmiņā, tomēr tās iztīrīšana, privātā pārlūkošana vai vietnes datu dzēšana var pieprasīt jaunu lejupielādi.

Vai valodas noteikšana darbojas bez WebGPU?

Jā. Process vispirms izmanto WebGPU, ja pārlūks to piedāvā. Ja WebGPU nav pieejams vai modeli nevar palaist, rīks mēģina vēlreiz ar WebAssembly un CPU. Apstrādājot centrālajā procesorā, teksts joprojām paliek jūsu ierīcē, bet ielāde un noteikšana tālruņos vai vecākos datoros var aizņemt vairāk laika.

Ko nozīmē pārliecības vērtējumi?

Vērtējumi sarindo modeļa 20 iespējamās iezīmes šim paraugam. Tie noder kandidātu salīdzināšanai, bet nav garantija, neatkarīga pareizības varbūtība vai pierādījums, ka īstā valoda tiek atbalstīta. Ja vadošie vērtējumi ir tuvi, pievienojiet vairāk dabiska teksta.

Vai rīks var noteikt jauktu vai transliterētu tekstu?

Rīks atgriež vienu vadošo rezultātu un citus variantus, nevis valodas iezīmi katram teikumam vai vārdam. Jaukts teksts var saņemt tuvus vērtējumus. Neformāla transliterācija, vārdi, emocijzīmes, URL adreses un pirmkods arī noņem daudzas rakstības un pareizrakstības norādes, tāpēc šādi rezultāti cilvēkam jāpārbauda īpaši rūpīgi.