CanDoYa
ET

Teksti keele tuvastamine tehisintellektiga

Piiratud keeled

Töötab täielikult sinu brauseris - midagi ei laadita üles, kontot pole vaja.

Kleebi lause või lõik, et selle keel tuvastada.

Teksti töödeldakse brauseri taustaprotsessis ja seda ei laadita kunagi üles. Alla laaditakse ainult avalik tehisintellekti mudel.

20 toetatud keelt

Araabia, bulgaaria, hiina, hollandi, inglise, prantsuse, saksa, kreeka, hindi, itaalia, jaapani, poola, portugali, vene, hispaania, suahiili, tai, türgi, urdu ja vietnami.

Mõnes muus keeles tekst võidakse ekslikult märkida lähima toetatud keelena.

Jaga seda tööriista

Kuidas teksti keelt tuvastada?

Keeletuvastaja määrab, millises keeles on kleebitud tekst kõige tõenäolisemalt kirjutatud. See tööriist võrdleb näidist 20 keelega ja kuvab mudeli kolm kõrgeimat hinnangut. Tehisintellekt töötab kohapeal brauseri taustaprotsessis, seega teksti üles ei laadita, kuid esimesel kasutuskorral tuleb mudel alla laadida.

Kuidas kasutada

  1. 1Kleebi piisav tekstinäidis. Sisesta täislause või lõik ühes 20 toetatud keelest. Pikemat loomulikku teksti on tavaliselt lihtsam eristada kui nime või üksikut sõna.
  2. 2Käivita tuvastamine seadmes. Klõpsa nuppu Tuvasta keel. Esimesel korral oota, kuni mudel alla laaditakse. Hilisematel külastustel saab tööriist kasutada brauseri vahemälu, kui see on veel alles.
  3. 3Vaata järjestatud vasteid. Kontrolli esimest keelt, ISO-koodi, hinnangut ja teisi kandidaate. Lähedasi hinnanguid, lühikesi näidiseid ja toetamata keeli tuleb pidada ebakindlaks.

Kellele see sobib

Tööriist käivitab sinu seadmes XLM-R-i klassifitseerimismudeli ning teeb arvutused eraldi taustaprotsessis, et leht reageeriks sujuvalt. Esmalt kasutatakse WebGPU kiirendust, vajaduse korral proovitakse uuesti WebAssembly ja protsessoriga. Esimesel käivitamisel laaditakse Hugging Face'ist alla umbes 296 MB mudeli ja tokenisaatori andmeid. Brauser salvestab need tavaliselt vahemällu, kuid võib need eemaldada, kui salvestusruum tühjendatakse või ruumi napib.

Mudel võrdleb araabia, bulgaaria, hiina, hollandi, inglise, prantsuse, saksa, kreeka, hindi, itaalia, jaapani, poola, portugali, vene, hispaania, suahiili, tai, türgi, urdu ja vietnami keelt. Mõnes muus keeles tekst sunnitakse ühe nende siltide alla, seega kontrolli enne tulemuse usaldamist toetatud keelte loendit.

Korduvad küsimused

Kas minu tekst laaditakse serverisse?

Ei. Tekst edastatakse brauseri taustaprotsessi ja töötlus toimub sinu seadmes. Taustaprotsess laadib välistest serveritest alla mudeli avalikud failid ja Transformers.js-i käituskeskkonna, kuid kleebitud teksti nende päringutega kaasa ei saadeta. CanDoYa ei saa ega salvesta tekstinäidist.

Kas keele tuvastamine on tasuta?

Jah. Kontot, makset, krediidilimiiti ega API-võtit pole vaja. Arvutused teeb sinu seade. Praktilised kulud on mudeli esimene allalaadimine, kohalik salvestusruum, mälu ja töötlusaeg. Mahupõhise internetipaketi korral võib mudelifailide allalaadimine maksta.

Kui palju teksti saan analüüsida?

Kleepida võib tavalise mis tahes pikkusega tekstiosa, kuid tööriist analüüsib kõige rohkem esimest 400 märki. Nii jääb sisend mudeli aknasse ja töö brauseris on prognoositav. Vaja on vähemalt nelja tähte või numbrit. Kasuliku tulemuse jaoks sisesta vähemalt üks loomulik lause, lõik annab mudelile rohkem eristavaid mustreid.

Milliseid keeli saab tööriist tuvastada?

Mudel toetab 20 silti: araabia, bulgaaria, hiina, hollandi, inglise, prantsuse, saksa, kreeka, hindi, itaalia, jaapani, poola, portugali, vene, hispaania, suahiili, tai, türgi, urdu ja vietnami keelt. Väljaspool seda suletud hulka olevaid keeli ei tuvasta see usaldusväärselt.

Miks on esimene allalaadimine umbes 296 MB?

Tööriist kasutab mitmekeelset XLM-R-i närvivõrgumudelit, mitte väikest tähemärkide sagedustabelit. Kvanditud ONNX-i kaalud võtavad umbes 279 MB ja tokenisaator umbes 17 MB. Brauser salvestab mõlemad tavaliselt vahemällu, kuid vahemälu kustutamine, privaatne sirvimine või saidiandmete eemaldamine võib nõuda uut allalaadimist.

Kas keele tuvastamine töötab ilma WebGPU-ta?

Jah. Taustaprotsess eelistab WebGPU-d, kui brauser seda pakub. Kui WebGPU puudub või mudeli käivitamine nurjub, proovib tööriist uuesti WebAssembly ja protsessoriga. Protsessoris töötlemisel jääb tekst samuti sinu seadmesse, kuid laadimine ning tuvastamine võivad telefonis või vanemas arvutis kauem aega võtta.

Mida usaldusväärsuse hinnangud tähendavad?

Hinnangud järjestavad selle näidise jaoks mudeli 20 võimalikku silti. Neist on abi kandidaatide võrdlemisel, kuid need ei ole garantii, sõltumatu õigesti tuvastamise tõenäosus ega tõend, et tegelik keel on toetatud. Kui esimesed hinnangud on lähestikku, lisa rohkem loomulikku teksti.

Kas tööriist tuvastab segatud või translitereeritud teksti?

Tööriist tagastab ühe juhtiva vaste ja alternatiivid, mitte iga lause või sõna keelesilti. Mitmekeelne tekst võib saada lähestikku hinnangud. Vabamas vormis transliteratsioon, nimed, emotikonid, URL-id ja lähtekood eemaldavad samuti palju kirjaviisi vihjeid, seega vajavad sellised tulemused hoolikat inimese kontrolli.