CanDoYa
SV

Identifiera språk i text med AI

Få språk

Körs helt i din webbläsare - inget laddas upp, ingen registrering.

Klistra in en mening eller ett stycke för att identifiera språket.

Texten behandlas i en bakgrundstråd i webbläsaren och laddas aldrig upp. Endast den offentliga AI-modellen hämtas.

20 språk stöds

Arabiska, bulgariska, kinesiska, nederländska, engelska, franska, tyska, grekiska, hindi, italienska, japanska, polska, portugisiska, ryska, spanska, swahili, thailändska, turkiska, urdu och vietnamesiska.

Text på ett annat språk kan felaktigt märkas som det närmaste alternativet som stöds.

Dela det här verktyget

Vilket språk är detta?

En språkidentifierare avgör vilket språk en inklistrad text troligen är skriven på. Verktyget jämför provet med 20 språk och visar modellens tre högsta poäng. AI-modellen körs lokalt i en bakgrundstråd i webbläsaren, så texten laddas inte upp. Modellen behöver däremot hämtas första gången.

Så använder du verktyget

  1. 1Klistra in ett användbart textprov. Skriv en hel mening eller ett stycke på något av de 20 språk som stöds. Längre, naturlig text är vanligtvis lättare att skilja åt än ett namn eller ett enstaka ord.
  2. 2Kör identifieringen på enheten. Klicka på Identifiera språk. Vänta medan modellen hämtas första gången. Vid senare besök kan webbläsaren återanvända cachen om den fortfarande finns kvar.
  3. 3Granska de rangordnade träffarna. Kontrollera det främsta språket, ISO-koden, poängen och alternativen. Se jämna poäng, korta prov och språk utanför listan som osäkra resultat.

Vem passar det för

Identifieraren kör en klassificeringsmodell av typen XLM-R på din enhet och gör beräkningen i en bakgrundstråd så att sidan fortsätter svara. Den använder helst WebGPU för acceleration och försöker igen med WebAssembly på processorn när det behövs. Första körningen hämtar cirka 296 MB modell- och tokeniseringsdata från Hugging Face. Webbläsaren brukar spara filerna i cachen, men kan ta bort dem om lagringsutrymmet rensas eller börjar ta slut.

Modellen jämför arabiska, bulgariska, kinesiska, nederländska, engelska, franska, tyska, grekiska, hindi, italienska, japanska, polska, portugisiska, ryska, spanska, swahili, thailändska, turkiska, urdu och vietnamesiska. Text på ett annat språk tvingas till någon av dessa etiketter. Kontrollera därför listan över språk som stöds innan du litar på resultatet.

Vanliga frågor

Laddas min text upp till en server?

Nej. Texten skickas till en bakgrundstråd i webbläsaren och beräkningen sker på enheten. Bakgrundstråden hämtar offentliga modellfiler och Transformers.js från externa servrar, men den bifogar inte din inklistrade text i de anropen. CanDoYa tar varken emot eller lagrar provet.

Är språkidentifieraren gratis?

Ja. Du behöver inget konto, ingen betalning, ingen kredit och ingen API-nyckel. Enheten sköter beräkningen. De praktiska kostnaderna är den första modellhämtningen, lokalt lagringsutrymme, minne och processortid. Ett abonnemang med begränsad data kan fortfarande ta betalt för hämtningen.

Hur mycket text kan analyseras?

Du kan klistra in ett vanligt textstycke, men identifieraren analyserar högst de första 400 tecknen för att hålla sig inom modellens indatafönster och ge förutsägbar körning i webbläsaren. Minst fyra bokstäver eller siffror krävs. En naturlig hel mening ger ett användbart resultat, och ett stycke ger modellen fler språkliga ledtrådar.

Vilka språk kan verktyget identifiera?

Modellen har 20 etiketter: arabiska, bulgariska, kinesiska, nederländska, engelska, franska, tyska, grekiska, hindi, italienska, japanska, polska, portugisiska, ryska, spanska, swahili, thailändska, turkiska, urdu och vietnamesiska. Språk utanför den slutna uppsättningen kan inte identifieras tillförlitligt.

Varför är den första hämtningen cirka 296 MB?

Identifieraren använder en flerspråkig neural XLM-R-modell i stället för en liten tabell med teckenfrekvenser. De kvantiserade ONNX-vikterna är cirka 279 MB och tokeniseraren cirka 17 MB. Webbläsaren brukar cacha båda, men cachetömning, privat surfning eller raderad webbplatsdata kan göra att filerna måste hämtas igen.

Fungerar språkidentifiering utan WebGPU?

Ja. Bakgrundstråden föredrar WebGPU när webbläsaren erbjuder det. Om WebGPU saknas eller modellen inte kan starta försöker verktyget igen med WebAssembly på processorn. Texten stannar på enheten även då, men inläsning och identifiering kan ta längre tid på mobiler och äldre datorer.

Vad betyder säkerhetspoängen?

Poängen rangordnar modellens 20 möjliga etiketter för just det här provet. De hjälper dig att jämföra kandidater, men är ingen garanti, ingen fristående sannolikhet för att svaret är rätt och inget bevis på att det verkliga språket stöds. Lägg till mer naturlig text om de främsta poängen ligger nära varandra.

Kan verktyget känna igen blandad eller translittererad text?

Verktyget ger en dominerande toppträff och några alternativ, inte en språketikett för varje mening eller ord. Flerspråkig text kan ge jämna poäng. Informell translitterering, namn, emoji, URL:er och källkod tar också bort många ledtrådar från skrift och stavning, så resultatet behöver granskas med omdöme.