CanDoYa
DA

Genkend sproget i en tekst med AI

Få sprog

Kører helt i din browser - ingen upload, ingen tilmelding.

Indsæt en sætning eller et afsnit for at genkende sproget.

Teksten behandles i en baggrundstråd i browseren og bliver aldrig uploadet. Kun den offentlige AI-model hentes.

20 understøttede sprog

Arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, græsk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk.

Tekst på et andet sprog kan fejlagtigt få etiketten for den nærmeste understøttede mulighed.

Del dette værktøj

Hvilket sprog er dette?

En sproggenkender finder det mest sandsynlige sprog i en indsat tekst. Værktøjet sammenligner din prøve med 20 sprog og viser modellens tre højeste resultater. AI-modellen kører lokalt i en baggrundstråd i browseren, så teksten ikke bliver uploadet. Modellen skal dog hentes ved første brug.

Sådan gør du

  1. 1Indsæt en brugbar tekstprøve. Indtast en hel sætning eller et afsnit på et af de 20 understøttede sprog. Længere, naturlig tekst er som regel nemmere at skelne end et navn eller et enkelt ord.
  2. 2Kør genkendelsen på enheden. Klik på Genkend sprog. Vent på, at modellen bliver hentet første gang. Ved senere besøg kan browseren genbruge cachen, hvis den stadig findes.
  3. 3Gennemgå de rangerede resultater. Se på det øverste sprog, ISO-koden, scoren og alternativerne. Betragt tætte scorer, korte prøver og ikke-understøttede sprog som usikre.

Hvem er det til

Genkenderen kører en XLM-R-klassifikationsmodel på din enhed og udfører beregningen i en baggrundstråd, så siden bliver ved med at reagere. Den foretrækker WebGPU-acceleration og prøver igen på processoren via WebAssembly, når det er nødvendigt. Første kørsel henter cirka 296 MB model- og tokenizerdata fra Hugging Face. Browseren gemmer normalt filerne i cachen, men kan fjerne dem, hvis lageret ryddes, eller pladsen bliver knap.

Modellen sammenligner arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, græsk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk. Tekst på et andet sprog bliver tvunget hen imod en af disse etiketter. Tjek derfor listen over understøttede sprog, før du stoler på et resultat.

Ofte stillede spørgsmål

Bliver min tekst uploadet til en server?

Nej. Teksten sendes til en baggrundstråd i din browser, og beregningen foregår på enheden. Tråden henter offentlige modelfiler og Transformers.js fra eksterne værter, men sender ikke din indsatte tekst med de anmodninger. CanDoYa modtager eller gemmer ikke prøven.

Er sproggenkenderen gratis?

Ja. Der kræves ingen konto, betaling, kredit eller API-nøgle. Din enhed udfører beregningen. De praktiske omkostninger er den første modelhentning, lokal lagerplads, hukommelse og behandlingstid. Et internetabonnement med forbrugsbetaling kan stadig opkræve data for modelfilerne.

Hvor meget tekst kan jeg analysere?

Du kan indsætte en almindelig tekstpassage, men genkenderen analyserer højst de første 400 tegn for at holde sig inden for modellens inputvindue og gøre beregningen i browseren forudsigelig. Der kræves mindst fire bogstaver eller tal. Brug mindst en naturlig sætning for et brugbart resultat, mens et afsnit giver modellen flere sproglige spor.

Hvilke sprog kan værktøjet genkende?

Modellen understøtter 20 etiketter: arabisk, bulgarsk, kinesisk, nederlandsk, engelsk, fransk, tysk, græsk, hindi, italiensk, japansk, polsk, portugisisk, russisk, spansk, swahili, thai, tyrkisk, urdu og vietnamesisk. Den kan ikke genkende sprog uden for det lukkede sæt pålideligt.

Hvorfor fylder den første hentning cirka 296 MB?

Genkenderen bruger en flersproget neural XLM-R-model frem for en lille tabel med tegnfrekvenser. De kvantiserede ONNX-vægte fylder cirka 279 MB, og tokenizeren cirka 17 MB. Browseren gemmer normalt begge dele i cachen, men rydning af cachen, privat browsing eller slettede webstedsdata kan kræve en ny hentning.

Virker sproggenkendelse uden WebGPU?

Ja. Baggrundstråden foretrækker WebGPU, når browseren tilbyder det. Hvis WebGPU mangler, eller modellen ikke kan starte, prøver værktøjet igen på processoren med WebAssembly. Teksten bliver også her på enheden, men indlæsning og genkendelse kan tage længere tid på telefoner og ældre computere.

Hvad betyder modellens sikkerhedsscorer?

Scorerne rangerer modellens 20 mulige etiketter for denne prøve. De kan bruges til at sammenligne kandidater, men er ikke en garanti, en uafhængig sandsynlighed for korrekthed eller et bevis på, at det virkelige sprog er understøttet. Tilføj mere naturlig tekst, hvis de øverste scorer ligger tæt.

Kan værktøjet genkende blandet eller translittereret tekst?

Værktøjet returnerer ét dominerende resultat plus alternativer, ikke en sprogetiket for hver sætning eller hvert ord. Flersproget tekst kan give tætte scorer. Uformel translitteration, navne, emoji, URL'er og kildekode fjerner også mange spor fra skrift og stavning, så resultatet bør vurderes af et menneske.