CanDoYa
FI

Tunnista tekstin kieli tekoälyllä

Rajatut kielet

Toimii kokonaan selaimessasi - ei lähetyksiä, ei rekisteröitymistä.

Liitä lause tai kappale kielen tunnistamista varten.

Teksti käsitellään selaimen taustasäikeessä eikä sitä koskaan lähetetä palvelimelle. Vain julkinen tekoälymalli ladataan.

20 tuettua kieltä

Arabia, bulgaria, kiina, hollanti, englanti, ranska, saksa, kreikka, hindi, italia, japani, puola, portugali, venäjä, espanja, swahili, thai, turkki, urdu ja vietnam.

Muunkielinen teksti voidaan merkitä virheellisesti lähimmällä tuetulla vaihtoehdolla.

Jaa tämä työkalu

Mikä kieli tämä on?

Kielentunnistin arvioi, millä kielellä liitetty teksti todennäköisimmin on kirjoitettu. Työkalu vertaa näytettä 20 kieleen ja näyttää mallin kolme korkeinta pistemäärää. Tekoäly toimii paikallisesti selaimen taustasäikeessä, joten tekstiä ei lähetetä palvelimelle. Malli on kuitenkin ladattava ensimmäisellä käyttökerralla.

Näin se toimii

  1. 1Liitä riittävä tekstinäyte. Kirjoita kokonainen lause tai kappale jollakin 20 tuetusta kielestä. Pitkä, luonteva teksti on yleensä helpompi erottaa kuin nimi tai yksittäinen sana.
  2. 2Käynnistä tunnistus laitteella. Napsauta Tunnista kieli. Odota ensimmäisellä kerralla mallin latautumista. Myöhemmillä käynneillä selain voi käyttää välimuistia, jos tiedostot ovat yhä tallessa.
  3. 3Tarkista järjestetyt osumat. Katso paras kieli, ISO-koodi, pistemäärä ja vaihtoehdot. Pidä lähekkäisiä pistemääriä, lyhyitä näytteitä ja tukemattomia kieliä epävarmoina.

Kenelle

Tunnistin suorittaa XLM-R-luokittelumallin omalla laitteellasi ja tekee päättelyn taustasäikeessä, jotta sivu pysyy käytettävänä. Se käyttää ensisijaisesti WebGPU-kiihdytystä ja yrittää tarvittaessa uudelleen suorittimella WebAssemblyn kautta. Ensimmäinen käyttökerta lataa Hugging Facesta noin 296 MB malli- ja tokenisointitietoja. Selain tallentaa tiedostot yleensä välimuistiin, mutta voi poistaa ne, jos tallennustila tyhjennetään tai se käy vähiin.

Malli vertailee arabiaa, bulgariaa, kiinaa, hollantia, englantia, ranskaa, saksaa, kreikkaa, hindiä, italiaa, japania, puolaa, portugalia, venäjää, espanjaa, swahilia, thaita, turkkia, urdua ja vietnamia. Muulla kielellä kirjoitettu teksti pakotetaan johonkin näistä luokista. Tarkista siis tuettujen kielten luettelo ennen tulokseen luottamista.

Usein kysyttyä

Lähetetäänkö tekstini palvelimelle?

Ei. Teksti siirtyy selaimen sisäiseen taustasäikeeseen, ja päättely tapahtuu omalla laitteellasi. Taustasäie lataa julkiset mallitiedostot ja Transformers.js-ajoympäristön ulkoisista palveluista, mutta ei lähetä liittämääsi tekstiä näiden pyyntöjen mukana. CanDoYa ei vastaanota eikä tallenna näytettä.

Onko kielentunnistin ilmainen?

On. Tiliä, maksua, krediittejä tai API-avainta ei tarvita. Oma laitteesi tekee laskennan. Käytännön kustannuksia ovat mallin ensimmäinen lataus, paikallinen tallennustila, muisti ja käsittelyaika. Käytön mukaan laskutettava verkkoyhteys voi silti veloittaa mallitiedostojen siirrosta.

Kuinka paljon tekstiä voi analysoida?

Voit liittää tavallisen tekstikatkelman, mutta tunnistin analysoi enintään 400 ensimmäistä merkkiä, jotta se pysyy mallin syöteikkunassa ja selaimen laskenta säilyy ennakoitavana. Vähimmäismäärä on neljä kirjainta tai numeroa. Käytä hyödyllistä tulosta varten vähintään kokonaista, luontevaa lausetta. Kappale antaa mallille enemmän erottavia piirteitä.

Mitä kieliä työkalu tunnistaa?

Malli tukee 20 luokkaa: arabiaa, bulgariaa, kiinaa, hollantia, englantia, ranskaa, saksaa, kreikkaa, hindiä, italiaa, japania, puolaa, portugalia, venäjää, espanjaa, swahilia, thaita, turkkia, urdua ja vietnamia. Se ei tunnista luotettavasti tämän suljetun joukon ulkopuolisia kieliä.

Miksi ensimmäinen lataus on noin 296 MB?

Tunnistin käyttää monikielistä XLM-R-neuroverkkomallia pienen merkkitaajuustaulukon sijaan. Kvantisoidut ONNX-painot vievät noin 279 MB ja tokenisoija noin 17 MB. Selain tallentaa yleensä molemmat välimuistiin, mutta välimuistin poisto, yksityinen selaus tai sivustotietojen tyhjentäminen voi vaatia uuden latauksen.

Toimiiko kielentunnistus ilman WebGPU:ta?

Kyllä. Taustasäie käyttää ensisijaisesti WebGPU:ta, kun selain tarjoaa sen. Jos WebGPU puuttuu tai mallin käynnistys epäonnistuu, työkalu yrittää uudelleen suorittimella WebAssemblyn avulla. Teksti pysyy silloinkin laitteella, mutta lataaminen ja tunnistus voivat kestää pidempään puhelimilla ja vanhoilla tietokoneilla.

Mitä luottamuspisteet tarkoittavat?

Pisteet asettavat mallin 20 mahdollista luokkaa järjestykseen tämän näytteen perusteella. Niillä voi vertailla ehdokkaita, mutta ne eivät ole takuu, itsenäinen oikeellisuuden todennäköisyys tai osoitus siitä, että todellinen kieli kuuluu tuettuihin. Lisää luontevaa tekstiä, jos parhaat pistemäärät ovat lähellä toisiaan.

Tunnistaako työkalu sekoitetun tai translitteroidun tekstin?

Työkalu palauttaa yhden hallitsevan osuman ja vaihtoehtoja, ei erillistä kieliluokkaa jokaiselle lauseelle tai sanalle. Monikielinen teksti voi tuottaa lähekkäisiä pistemääriä. Epämuodollinen translitterointi, nimet, emojit, URL-osoitteet ja lähdekoodi poistavat myös monia kirjoitusjärjestelmään ja oikeinkirjoitukseen liittyviä vihjeitä, joten tulos kannattaa arvioida itse.