CanDoYa
ES

Detector de idiomas con IA

Funciona del todo en tu navegador: sin subir nada y sin registro.

Pega una frase o un párrafo para identificar el idioma.

El texto se procesa en un proceso del navegador y nunca se sube. Solo se descarga el modelo público de IA.

20 idiomas admitidos

Árabe, búlgaro, chino, neerlandés, inglés, francés, alemán, griego, hindi, italiano, japonés, polaco, portugués, ruso, español, suajili, tailandés, turco, urdu y vietnamita.

Un texto en otro idioma puede etiquetarse como la opción admitida más cercana.

Comparte esta herramienta

¿Qué es un detector de idiomas?

Un detector de idiomas indica cuál es el idioma más probable de un texto pegado. Esta herramienta compara la muestra con 20 idiomas y muestra las tres puntuaciones más altas. La IA se ejecuta en un proceso del navegador, así que el texto no se sube, aunque el modelo debe descargarse la primera vez.

Cómo se usa

  1. 1Pega una muestra útil. Introduce una frase completa o un párrafo en uno de los 20 idiomas admitidos. Un texto natural y algo más largo suele distinguirse mejor que un nombre o una sola palabra.
  2. 2Detecta el idioma en tu dispositivo. Pulsa Detectar idioma. La primera vez tendrás que esperar a que se descargue el modelo; en visitas posteriores podrá reutilizarse la caché del navegador si sigue disponible.
  3. 3Revisa las coincidencias ordenadas. Comprueba el primer idioma, el código ISO, la puntuación y las alternativas. Toma con cautela las puntuaciones cercanas, las muestras cortas y los idiomas no admitidos.

Para quién es

El detector ejecuta un modelo de clasificación XLM-R en tu dispositivo y realiza el análisis en un proceso aparte para que la página siga respondiendo. Primero intenta usar la aceleración WebGPU y, si no está disponible, repite con WebAssembly en la CPU. La primera ejecución descarga unos 296 MB del modelo y el tokenizador desde Hugging Face. El navegador suele guardar esos archivos en caché, pero puede borrarlos al limpiar el almacenamiento o cuando queda poco espacio.

El modelo compara árabe, búlgaro, chino, neerlandés, inglés, francés, alemán, griego, hindi, italiano, japonés, polaco, portugués, ruso, español, suajili, tailandés, turco, urdu y vietnamita. Si el texto está en otro idioma, lo asignará por fuerza a una de esas etiquetas. Comprueba la lista admitida antes de confiar en el resultado.

Preguntas frecuentes

¿Se sube mi texto a un servidor?

No. El texto pasa a un proceso dentro del navegador y el análisis se hace en tu dispositivo. Ese proceso descarga los archivos públicos del modelo y el entorno Transformers.js desde servidores externos, pero no envía el texto pegado con esas solicitudes. CanDoYa no recibe ni guarda la muestra.

¿El detector de idiomas es gratis?

Sí. No necesitas cuenta, pago, límite de créditos ni clave de API. Tu dispositivo realiza el análisis. En la práctica, solo hacen falta una primera descarga, espacio local, memoria y tiempo de procesamiento. Una conexión de datos con límite puede cobrar la descarga del modelo.

¿Cuánto texto puedo analizar?

Puedes pegar cualquier fragmento normal, pero el detector solo analiza los primeros 400 caracteres para respetar la ventana de entrada del modelo y mantener un rendimiento previsible. El mínimo son cuatro letras o números. Para obtener un resultado útil, escribe al menos una frase natural; un párrafo ofrece más patrones distintivos.

¿Qué idiomas puede identificar esta herramienta?

El modelo admite 20 etiquetas: árabe, búlgaro, chino, neerlandés, inglés, francés, alemán, griego, hindi, italiano, japonés, polaco, portugués, ruso, español, suajili, tailandés, turco, urdu y vietnamita. No identifica de forma fiable idiomas ajenos a ese conjunto cerrado.

¿Por qué la primera descarga ocupa unos 296 MB?

El detector usa un modelo neuronal multilingüe XLM-R, no una pequeña tabla de frecuencias de caracteres. Sus pesos ONNX cuantizados ocupan unos 279 MB y el tokenizador, unos 17 MB. El navegador suele guardar ambos en caché, aunque la navegación privada, el borrado de datos o la expulsión de la caché pueden exigir otra descarga.

¿Funciona la detección sin WebGPU?

Sí. El proceso intenta usar WebGPU cuando el navegador lo ofrece. Si falta WebGPU o falla el inicio del modelo, la herramienta lo intenta de nuevo con WebAssembly en la CPU. El texto sigue en tu dispositivo, pero la carga y la detección pueden tardar más en móviles y ordenadores antiguos.

¿Qué significan las puntuaciones de confianza?

Las puntuaciones ordenan las 20 etiquetas posibles para esta muestra. Sirven para comparar candidatas, pero no garantizan que el resultado sea correcto, no son una probabilidad independiente ni demuestran que el idioma real esté admitido. Si las primeras puntuaciones están cerca, añade más texto natural.

¿Puede reconocer texto mezclado o transliterado?

La herramienta devuelve una coincidencia principal y varias alternativas, no una etiqueta para cada frase o palabra. Un texto con varios idiomas puede dar puntuaciones cercanas. La transliteración informal, los nombres, los emoji, las URL y el código fuente también eliminan muchas pistas de escritura y ortografía, así que conviene revisar esos resultados manualmente.