CanDoYa
PT-BR

Detector de idioma com IA

Funciona inteiramente no seu navegador - sem upload, sem cadastro.

Cole uma frase ou um parágrafo para identificar o idioma.

O texto é processado em um processo do navegador e nunca é enviado. Apenas o modelo público de IA é baixado.

20 idiomas compatíveis

Árabe, búlgaro, chinês, holandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polonês, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita.

Um texto em outro idioma pode receber o rótulo da opção compatível mais próxima.

Compartilhe esta ferramenta

O que é um detector de idioma?

Um detector de idioma aponta qual é o idioma mais provável de um texto colado. Esta ferramenta compara a amostra com 20 idiomas e mostra as três pontuações mais altas. A IA roda em um processo do navegador, então o texto não é enviado, embora seja necessário baixar o modelo no primeiro uso.

Como usar

  1. 1Cole uma amostra útil. Digite uma frase completa ou um parágrafo em um dos 20 idiomas compatíveis. Um texto natural e mais longo costuma ser mais fácil de distinguir do que um nome ou uma única palavra.
  2. 2Detecte no próprio dispositivo. Clique em Detectar idioma. No primeiro uso, aguarde o download do modelo; nas próximas visitas, o cache do navegador poderá ser reutilizado se ainda estiver disponível.
  3. 3Confira as opções classificadas. Verifique o idioma principal, o código ISO, a pontuação e as alternativas. Considere incertos os resultados com pontuações próximas, amostras curtas ou idiomas não compatíveis.

Para quem é

O detector executa um modelo de classificação XLM-R no seu dispositivo e faz a inferência em um processo separado para manter a página responsiva. Primeiro tenta usar a aceleração WebGPU e, se necessário, repete com WebAssembly na CPU. A primeira execução baixa cerca de 296 MB do modelo e do tokenizador no Hugging Face. O navegador costuma guardar esses arquivos em cache, mas pode removê-los quando o armazenamento é limpo ou há pouco espaço.

O modelo compara árabe, búlgaro, chinês, holandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polonês, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita. Um texto em outro idioma será forçado para um desses rótulos. Confira a lista de idiomas compatíveis antes de confiar no resultado.

Perguntas frequentes

Meu texto é enviado para um servidor?

Não. O texto passa para um processo dentro do navegador e a inferência acontece no seu dispositivo. Esse processo baixa os arquivos públicos do modelo e o ambiente Transformers.js de servidores externos, mas não envia o texto colado junto com essas solicitações. A CanDoYa não recebe nem armazena a amostra.

O detector de idioma é grátis?

Sim. Não há conta, pagamento, limite de créditos nem chave de API. Seu dispositivo faz a inferência. Na prática, você só precisa de um primeiro download, armazenamento local, memória e tempo de processamento. Uma conexão de dados limitada ainda pode cobrar pelo download do modelo.

Quanto texto posso analisar?

Você pode colar qualquer trecho comum, mas o detector analisa no máximo os primeiros 400 caracteres para respeitar a janela de entrada do modelo e manter o desempenho previsível. O mínimo são quatro letras ou números. Para um resultado útil, inclua pelo menos uma frase natural; um parágrafo oferece mais padrões distintivos.

Quais idiomas esta ferramenta identifica?

O modelo oferece 20 rótulos: árabe, búlgaro, chinês, holandês, inglês, francês, alemão, grego, hindi, italiano, japonês, polonês, português, russo, espanhol, suaíli, tailandês, turco, urdu e vietnamita. Ele não identifica com confiança idiomas fora desse conjunto fechado.

Por que o primeiro download tem cerca de 296 MB?

O detector usa um modelo neural multilíngue XLM-R, não uma pequena tabela de frequência de caracteres. Os pesos ONNX quantizados ocupam cerca de 279 MB e o tokenizador, aproximadamente 17 MB. O navegador costuma guardar os dois em cache, mas a navegação anônima, a limpeza de dados ou a remoção do cache podem exigir outro download.

A detecção funciona sem WebGPU?

Sim. O processo tenta usar WebGPU quando o navegador oferece esse recurso. Se o WebGPU não estiver disponível ou a inicialização do modelo falhar, a ferramenta tenta novamente com WebAssembly na CPU. O texto continua no seu dispositivo, mas o carregamento e a detecção podem demorar mais em celulares e computadores antigos.

O que significam as pontuações de confiança?

As pontuações classificam os 20 rótulos possíveis para a amostra. Elas ajudam a comparar opções, mas não garantem acerto, não são probabilidades independentes nem provam que o idioma real está entre os compatíveis. Se as primeiras pontuações estiverem próximas, adicione mais texto natural.

A ferramenta detecta texto misto ou transliterado?

A ferramenta retorna uma opção principal e alternativas, não um rótulo para cada frase ou palavra. Um texto com vários idiomas pode gerar pontuações próximas. Transliteração informal, nomes, emojis, URLs e código-fonte também eliminam muitas pistas de escrita e ortografia, por isso esses resultados pedem revisão humana.