CanDoYa
NB

Gjenkjenn språk i tekst med KI

Få språk

Kjører helt i nettleseren - ingen opplasting, ingen registrering.

Lim inn en setning eller et avsnitt for å gjenkjenne språket.

Teksten behandles i en bakgrunnstråd i nettleseren og blir aldri lastet opp. Bare den offentlige KI-modellen lastes ned.

20 støttede språk

Arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, gresk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk.

Tekst på et annet språk kan feilaktig få etiketten til det nærmeste støttede alternativet.

Del dette verktøyet

Hvilket språk er dette?

En språkgjenkjenner finner det mest sannsynlige språket i tekst du limer inn. Verktøyet sammenligner prøven med 20 språk og viser modellens tre høyeste poengsummer. KI-modellen kjører lokalt i en bakgrunnstråd i nettleseren, så teksten blir ikke lastet opp. Modellen må likevel lastes ned første gang.

Slik bruker du verktøyet

  1. 1Lim inn en nyttig tekstprøve. Skriv inn en hel setning eller et avsnitt på ett av de 20 støttede språkene. Lengre, naturlig tekst er vanligvis lettere å skille enn et navn eller ett enkelt ord.
  2. 2Kjør gjenkjenning på enheten. Klikk på Gjenkjenn språk. Vent mens modellen lastes ned første gang. Ved senere besøk kan nettleseren bruke hurtigbufferen hvis filene fortsatt finnes.
  3. 3Se gjennom de rangerte treffene. Kontroller toppspråket, ISO-koden, poengsummen og alternativene. Se på jevne poengsummer, korte prøver og språk utenfor listen som usikre resultater.

Hvem passer det for

Gjenkjenneren kjører en XLM-R-klassifiseringsmodell på enheten din og utfører beregningen i en bakgrunnstråd, slik at siden fortsetter å svare. Den foretrekker WebGPU-akselerasjon og prøver på nytt med prosessoren via WebAssembly ved behov. Første kjøring laster ned omtrent 296 MB med modell- og tokenizerdata fra Hugging Face. Nettleseren lagrer vanligvis filene i hurtigbufferen, men kan fjerne dem når lagringen tømmes eller plassen begynner å bli knapp.

Modellen sammenligner arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, gresk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk. Tekst på et annet språk blir tvunget mot én av disse etikettene. Sjekk derfor listen over støttede språk før du stoler på resultatet.

Vanlige spørsmål

Blir teksten min lastet opp til en server?

Nei. Teksten sendes til en bakgrunnstråd i nettleseren, og beregningen skjer på enheten. Tråden laster ned offentlige modellfiler og Transformers.js fra eksterne tjenere, men sender ikke teksten du limte inn med disse forespørslene. CanDoYa mottar eller lagrer ikke prøven.

Er språkgjenkjenneren gratis?

Ja. Du trenger ingen konto, betaling, kreditt eller API-nøkkel. Enheten din utfører beregningen. De praktiske kostnadene er den første modellnedlastingen, lokal lagringsplass, minne og behandlingstid. Et abonnement med betaling for databruk kan fortsatt kreve betaling for modellfilene.

Hvor mye tekst kan jeg analysere?

Du kan lime inn en vanlig tekstpassasje, men gjenkjenneren analyserer maksimalt de første 400 tegnene for å holde seg innenfor modellens inndatavindu og gjøre kjøringen i nettleseren forutsigbar. Minst fire bokstaver eller tall kreves. Bruk minst én naturlig setning for et nyttig resultat. Et avsnitt gir modellen flere språklige kjennetegn.

Hvilke språk kan verktøyet gjenkjenne?

Modellen støtter 20 etiketter: arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, gresk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk. Den kan ikke identifisere språk utenfor dette lukkede settet pålitelig.

Hvorfor er den første nedlastingen omtrent 296 MB?

Gjenkjenneren bruker en flerspråklig nevral XLM-R-modell i stedet for en liten tabell med tegnfrekvenser. De kvantiserte ONNX-vektene er omtrent 279 MB og tokenizeren omtrent 17 MB. Nettleseren lagrer vanligvis begge i hurtigbufferen, men tømming av buffer, privat surfing eller slettede nettstedsdata kan kreve en ny nedlasting.

Fungerer språkgjenkjenning uten WebGPU?

Ja. Bakgrunnstråden foretrekker WebGPU når nettleseren tilbyr det. Hvis WebGPU mangler eller modellen ikke starter, prøver verktøyet på nytt med prosessoren via WebAssembly. Teksten forblir på enheten også da, men lasting og gjenkjenning kan ta lengre tid på telefoner og eldre datamaskiner.

Hva betyr modellens sikkerhetspoeng?

Poengsummene rangerer modellens 20 mulige etiketter for denne prøven. De er nyttige når du sammenligner kandidater, men er ingen garanti, ingen uavhengig sannsynlighet for at resultatet er riktig, og heller ikke bevis på at det virkelige språket støttes. Legg til mer naturlig tekst hvis de øverste poengsummene ligger tett.

Kan verktøyet gjenkjenne blandet eller translitterert tekst?

Verktøyet returnerer ett dominerende topptreff og alternativer, ikke en språketikett for hver setning eller hvert ord. Flerspråklig tekst kan gi jevne poengsummer. Uformell translitterering, navn, emojier, URL-er og kildekode fjerner også mange ledetråder fra skriftsystem og staving, så resultatet bør vurderes av et menneske.