CanDoYa
CA

Detector d'idiomes amb IA

Idiomes limitats

Funciona del tot al navegador: sense pujar res ni registrar-te.

Enganxa una frase o un paràgraf per identificar-ne l'idioma.

El text es processa en un worker del navegador i no es puja mai. Només es baixa el model públic d'IA.

20 idiomes admesos

Àrab, búlgar, xinès, neerlandès, anglès, francès, alemany, grec, hindi, italià, japonès, polonès, portuguès, rus, castellà, suahili, tailandès, turc, urdú i vietnamita.

Un text en una altra llengua es pot etiquetar erròniament com l'opció admesa més propera.

Comparteix aquesta eina

Què és un detector d'idiomes?

Un detector d'idiomes identifica la llengua més probable d'un text enganxat. Aquesta eina compara la mostra amb 20 idiomes i mostra les tres puntuacions més altes del model. La IA s'executa localment en un worker del navegador, de manera que el text no es puja, tot i que el model s'ha de baixar el primer cop.

Com s’utilitza

  1. 1Enganxa una mostra útil. Escriu una frase sencera o un paràgraf en un dels 20 idiomes admesos. Un text natural i llarg sol ser més fàcil de distingir que un nom o una sola paraula.
  2. 2Executa la detecció al dispositiu. Fes clic a Detecta l'idioma. El primer cop, espera que acabi la baixada del model; les visites següents poden reutilitzar la memòria cau del navegador si encara està disponible.
  3. 3Revisa els resultats ordenats. Comprova l'idioma principal, el codi ISO, la puntuació i les alternatives. Considera incerts els resultats amb puntuacions molt properes, mostres curtes o llengües no admeses.

Per a qui és

El detector executa un model de classificació XLM-R al teu dispositiu i fa la inferència en un worker perquè la pàgina continuï responent. Prioritza l'acceleració WebGPU i, quan cal, torna a provar-ho amb el backend de CPU WebAssembly. La primera execució baixa uns 296 MB de dades del model i del tokenitzador des de Hugging Face. Normalment, el navegador desa aquests fitxers a la memòria cau, però els pot eliminar si s'esborra l'emmagatzematge o queda poc espai.

El model compara àrab, búlgar, xinès, neerlandès, anglès, francès, alemany, grec, hindi, italià, japonès, polonès, portuguès, rus, castellà, suahili, tailandès, turc, urdú i vietnamita. Un text en una altra llengua es força cap a una d'aquestes etiquetes, així que consulta la llista d'idiomes admesos abans de confiar en el resultat.

Preguntes freqüents

El meu text es puja a un servidor?

No. El text es passa a un worker dins del navegador i la inferència es fa al dispositiu. El worker baixa els fitxers públics del model i l'entorn Transformers.js des de servidors externs, però no envia el text enganxat amb aquestes peticions. CanDoYa no rep ni desa la mostra.

El detector d'idiomes és gratuït?

Sí. No cal cap compte, pagament, límit de crèdit ni clau d'API. El dispositiu fa la inferència. Els costos pràctics són la primera baixada del model, l'emmagatzematge local, la memòria i el temps de processament. Una connexió amb dades limitades pot cobrar igualment la baixada dels fitxers del model.

Quant text puc analitzar?

Pots enganxar qualsevol fragment habitual, però el detector analitza com a màxim els primers 400 caràcters per mantenir-se dins la finestra d'entrada del model i fer més previsible la inferència al navegador. El mínim són quatre lletres o números. Per obtenir un resultat útil, escriu almenys una frase natural; un paràgraf aporta més patrons distintius al model.

Quins idiomes pot identificar aquesta eina?

El model admet 20 etiquetes: àrab, búlgar, xinès, neerlandès, anglès, francès, alemany, grec, hindi, italià, japonès, polonès, portuguès, rus, castellà, suahili, tailandès, turc, urdú i vietnamita. No identifica de manera fiable les llengües que queden fora d'aquest conjunt tancat.

Per què la primera baixada ocupa uns 296 MB?

El detector utilitza un model neuronal multilingüe XLM-R, no una taula petita de freqüència de caràcters. Els pesos ONNX quantificats ocupen uns 279 MB i el tokenitzador, uns 17 MB. El navegador normalment desa tots dos a la memòria cau, però l'expulsió de la cau, la navegació privada o l'eliminació de les dades del lloc poden obligar a baixar-los de nou.

La detecció d'idioma funciona sense WebGPU?

Sí. El worker prioritza WebGPU quan el navegador l'ofereix. Si WebGPU no està disponible o el model no s'inicia, l'eina ho torna a provar amb el backend de CPU WebAssembly. La inferència amb CPU manté el text al dispositiu, però la càrrega i la detecció poden trigar més en mòbils o ordinadors antics.

Què signifiquen les puntuacions de confiança?

Les puntuacions ordenen les 20 etiquetes possibles del model per a aquesta mostra. Serveixen per comparar candidates, però no són cap garantia, una probabilitat independent d'encert ni una prova que la llengua real estigui admesa. Si les puntuacions principals són properes, afegeix més text natural.

Pot detectar text barrejat o transliterat?

L'eina retorna un resultat principal i algunes alternatives, no una etiqueta per a cada frase o paraula. El text que barreja idiomes pot produir puntuacions molt properes. La transliteració informal, els noms, els emoji, els URL i el codi font també eliminen molts indicis d'escriptura i ortografia, de manera que aquests casos requereixen una revisió humana prudent.