CanDoYa
FR

Détecteur de langue par IA

Fonctionne entièrement dans votre navigateur : aucun envoi, aucune inscription.

Collez une phrase ou un paragraphe pour identifier sa langue.

Votre texte est traité dans un processus du navigateur et n’est jamais envoyé. Seul le modèle d’IA public est téléchargé.

20 langues prises en charge

Allemand, anglais, arabe, bulgare, chinois, espagnol, français, grec, hindi, italien, japonais, néerlandais, polonais, portugais, russe, swahili, thaï, turc, ourdou et vietnamien.

Un texte dans une autre langue peut être étiqueté comme la langue prise en charge la plus proche.

Partager cet outil

Qu’est-ce qu’un détecteur de langue ?

Un détecteur de langue indique la langue la plus probable d’un texte collé. Cet outil compare l’extrait à 20 langues et affiche les trois meilleurs scores. L’IA fonctionne dans un processus du navigateur, donc le texte n’est pas envoyé, même si le modèle doit être téléchargé à la première utilisation.

Comment l’utiliser

  1. 1Collez un extrait exploitable. Saisissez une phrase complète ou un paragraphe dans l’une des 20 langues prises en charge. Un texte naturel et assez long se distingue généralement mieux qu’un nom ou un mot isolé.
  2. 2Lancez la détection sur l’appareil. Cliquez sur Détecter la langue. À la première utilisation, attendez le téléchargement du modèle ; les visites suivantes pourront réutiliser le cache du navigateur s’il est encore présent.
  3. 3Examinez les résultats classés. Vérifiez la première langue, son code ISO, son score et les autres possibilités. Restez prudent lorsque les scores sont proches, l’extrait court ou la langue absente de la liste.

Pour qui

Le détecteur exécute un modèle de classification XLM-R sur votre appareil et confie l’analyse à un processus distinct pour que la page reste fluide. Il privilégie l’accélération WebGPU, puis réessaie avec WebAssembly sur le processeur si nécessaire. Au premier lancement, environ 296 MB de données du modèle et du tokeniseur sont téléchargés depuis Hugging Face. Le navigateur les conserve généralement en cache, mais peut les supprimer après un nettoyage du stockage ou lorsque l’espace manque.

Le modèle compare l’allemand, l’anglais, l’arabe, le bulgare, le chinois, l’espagnol, le français, le grec, le hindi, l’italien, le japonais, le néerlandais, le polonais, le portugais, le russe, le swahili, le thaï, le turc, l’ourdou et le vietnamien. Un texte dans une autre langue sera forcément rapproché de l’une de ces étiquettes. Vérifiez la liste prise en charge avant de vous fier au résultat.

Questions fréquentes

Mon texte est-il envoyé à un serveur ?

Non. Le texte passe dans un processus du navigateur et l’analyse s’effectue sur votre appareil. Ce processus télécharge les fichiers publics du modèle et l’environnement Transformers.js depuis des hôtes externes, sans joindre le texte collé à ces requêtes. CanDoYa ne reçoit ni ne conserve l’extrait.

Le détecteur de langue est-il gratuit ?

Oui. Aucun compte, paiement, crédit ou clé d’API n’est nécessaire. Votre appareil réalise l’analyse. Il faut seulement prévoir le premier téléchargement, de l’espace local, de la mémoire et un peu de temps de calcul. Une connexion facturée au volume peut néanmoins compter le téléchargement du modèle.

Quelle quantité de texte puis-je analyser ?

Vous pouvez coller un passage courant de n’importe quelle longueur, mais le détecteur analyse au plus les 400 premiers caractères pour respecter la fenêtre d’entrée du modèle et garder un temps de calcul prévisible. Il faut au minimum quatre lettres ou chiffres. Une phrase naturelle donne un résultat utile ; un paragraphe apporte davantage d’indices.

Quelles langues cet outil peut-il identifier ?

Le modèle possède 20 étiquettes : allemand, anglais, arabe, bulgare, chinois, espagnol, français, grec, hindi, italien, japonais, néerlandais, polonais, portugais, russe, swahili, thaï, turc, ourdou et vietnamien. Il n’identifie pas de façon fiable les langues extérieures à cet ensemble fermé.

Pourquoi le premier téléchargement fait-il environ 296 MB ?

Le détecteur utilise un modèle neuronal multilingue XLM-R plutôt qu’une petite table de fréquence des caractères. Ses poids ONNX quantifiés occupent environ 279 MB et son tokeniseur environ 17 MB. Le navigateur les met normalement en cache, mais la navigation privée, la suppression des données ou l’éviction du cache peuvent imposer un nouveau téléchargement.

La détection fonctionne-t-elle sans WebGPU ?

Oui. Le processus privilégie WebGPU lorsque le navigateur le propose. Si WebGPU manque ou si le modèle ne démarre pas, l’outil réessaie avec WebAssembly sur le processeur. Le texte reste sur l’appareil, mais le chargement et l’analyse peuvent être plus longs sur un téléphone ou un ordinateur ancien.

Que signifient les scores de confiance ?

Les scores classent les 20 étiquettes possibles pour cet extrait. Ils permettent de comparer les candidates, mais ne garantissent pas la bonne réponse, ne constituent pas des probabilités indépendantes et ne prouvent pas que la langue réelle est prise en charge. Des scores proches invitent à ajouter du texte naturel.

Peut-il détecter un texte mixte ou translittéré ?

L’outil renvoie une langue dominante et des solutions de remplacement, pas une étiquette pour chaque phrase ou chaque mot. Un texte multilingue peut produire des scores proches. La translittération informelle, les noms, les emoji, les URL et le code source réduisent aussi les indices d’écriture et d’orthographe ; ces résultats méritent une vérification humaine.