CanDoYa
PT-PT

Detector de idioma com IA

Funciona inteiramente no navegador - sem carregar nada, sem registo.

Cole uma frase ou um parágrafo para identificar o idioma.

O texto é processado num processo do navegador e nunca é enviado. Apenas o modelo público de IA é descarregado.

20 idiomas suportados

Árabe, búlgaro, chinês, neerlandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polaco, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita.

Um texto noutra língua pode ser identificado incorretamente como a opção suportada mais próxima.

Partilhe esta ferramenta

Como saber que idioma é um texto?

Um detector de idioma identifica a língua mais provável do texto colado. Esta ferramenta compara a amostra com 20 idiomas e apresenta as três pontuações mais altas do modelo. A IA funciona localmente num processo do navegador, por isso o texto não é enviado, embora seja necessário descarregar o modelo na primeira utilização.

Como utilizar

  1. 1Cole uma amostra útil. Introduza uma frase completa ou um parágrafo num dos 20 idiomas suportados. Um texto natural e mais longo costuma ser mais fácil de distinguir do que um nome ou uma única palavra.
  2. 2Detete no dispositivo. Clique em Detetar idioma. Na primeira utilização, aguarde pela descarga do modelo; em visitas posteriores, o navegador pode reutilizar a cache se os ficheiros ainda estiverem disponíveis.
  3. 3Reveja os resultados ordenados. Consulte o primeiro idioma, o código ISO, a pontuação e as alternativas. Considere incertos os resultados com pontuações próximas, amostras curtas ou idiomas não suportados.

Para quem é

O detector executa um modelo de classificação XLM-R no seu dispositivo e faz a inferência num processo separado para manter a página disponível. Dá preferência à aceleração WebGPU e, se necessário, volta a tentar com o módulo WebAssembly no CPU. Na primeira utilização, são descarregados do Hugging Face cerca de 296 MB de dados do modelo e do tokenizador. O navegador costuma guardar estes ficheiros em cache, mas pode removê-los quando o armazenamento é limpo ou há pouco espaço.

O modelo compara árabe, búlgaro, chinês, neerlandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polaco, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita. Um texto noutra língua é forçado para uma destas etiquetas, por isso confirme a lista de idiomas suportados antes de confiar no resultado.

Perguntas frequentes

O meu texto é enviado para um servidor?

Não. O texto passa para um processo dentro do navegador e a inferência acontece no seu dispositivo. Esse processo descarrega ficheiros públicos do modelo e o ambiente Transformers.js de servidores externos, mas não envia o texto colado nesses pedidos. A CanDoYa não recebe nem guarda a amostra.

O detector de idioma é gratuito?

Sim. Não precisa de conta, pagamento, limite de créditos ou chave API. O seu dispositivo faz a inferência. Os custos práticos são a primeira descarga do modelo, o armazenamento local, a memória e o tempo de processamento. Uma ligação com tráfego pago pode cobrar a descarga dos ficheiros do modelo.

Quanto texto posso analisar?

Pode colar uma passagem normal, mas o detector analisa no máximo os primeiros 400 carateres para respeitar a janela de entrada do modelo e manter previsível a inferência no navegador. São necessárias pelo menos quatro letras ou algarismos. Para um resultado útil, use uma frase natural completa; um parágrafo dá ao modelo mais padrões distintivos.

Que idiomas consegue esta ferramenta identificar?

O modelo suporta 20 etiquetas: árabe, búlgaro, chinês, neerlandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polaco, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita. Não identifica de forma fiável idiomas fora deste conjunto fechado.

Porque é que a primeira descarga tem cerca de 296 MB?

O detector usa um modelo neuronal multilingue XLM-R em vez de uma pequena tabela de frequência de carateres. Os pesos ONNX quantizados ocupam cerca de 279 MB e o tokenizador cerca de 17 MB. O navegador costuma guardar ambos em cache, mas a remoção da cache, a navegação privada ou a limpeza dos dados do site podem exigir nova descarga.

A deteção de idioma funciona sem WebGPU?

Sim. O processo dá prioridade ao WebGPU quando o navegador o disponibiliza. Se não houver WebGPU ou o modelo não arrancar, a ferramenta volta a tentar com o módulo WebAssembly no CPU. O texto continua no dispositivo, mas o carregamento e a deteção podem demorar mais em telemóveis ou computadores antigos.

O que significam as pontuações de confiança?

As pontuações ordenam as 20 etiquetas possíveis do modelo para esta amostra. São úteis para comparar candidatos, mas não garantem que a resposta esteja certa, não são probabilidades independentes e não provam que o idioma real seja suportado. Se as primeiras pontuações estiverem próximas, acrescente mais texto natural.

Consegue detetar texto misto ou transliterado?

A ferramenta devolve um resultado principal e alternativas, não uma etiqueta para cada frase ou palavra. Um texto com vários idiomas pode produzir pontuações próximas. Transliteração informal, nomes, emoji, URL e código-fonte também retiram muitas pistas de escrita e ortografia, por isso estes resultados devem ser revistos por uma pessoa.