CanDoYa
IT

Rilevatore di lingua con AI

Funziona interamente nel browser: nessun caricamento, nessuna registrazione.

Incolla una frase o un paragrafo per riconoscerne la lingua.

Il testo viene elaborato in un processo separato del browser e non viene mai caricato. Si scarica soltanto il modello AI pubblico.

20 lingue supportate

Arabo, bulgaro, cinese, olandese, inglese, francese, tedesco, greco, hindi, italiano, giapponese, polacco, portoghese, russo, spagnolo, swahili, thai, turco, urdu e vietnamita.

Un testo in un'altra lingua può essere associato per errore all'opzione supportata più vicina.

Condividi questo strumento

Che cos'è un rilevatore di lingua?

Un rilevatore di lingua individua la lingua più probabile di un testo incollato. Questo strumento confronta il campione con 20 lingue e mostra i tre punteggi più alti del modello. L'AI opera in locale, in un processo separato del browser, quindi il testo non viene caricato; al primo utilizzo, però, occorre scaricare il modello.

Come si usa

  1. 1Incolla un campione utile. Inserisci una frase completa o un paragrafo in una delle 20 lingue supportate. Un testo naturale e più lungo è in genere più facile da distinguere rispetto a un nome o a una sola parola.
  2. 2Avvia il rilevamento sul dispositivo. Fai clic su Rileva lingua. Al primo utilizzo attendi il download del modello; nelle visite successive il browser può riutilizzare la cache, se è ancora disponibile.
  3. 3Controlla i risultati ordinati. Esamina la lingua principale, il codice ISO, il punteggio e le alternative. Considera incerti i punteggi ravvicinati, i campioni brevi e le lingue non supportate.

A chi serve

Il rilevatore esegue sul dispositivo un modello di classificazione XLM-R e svolge l'inferenza in un processo separato per mantenere reattiva la pagina. Usa WebGPU quando è disponibile e, se necessario, riprova con il backend CPU WebAssembly. Al primo avvio scarica da Hugging Face circa 296 MB di dati tra modello e tokenizer. Di norma il browser conserva questi file nella cache, ma può rimuoverli quando si cancellano i dati o lo spazio è quasi esaurito.

Il modello confronta arabo, bulgaro, cinese, olandese, inglese, francese, tedesco, greco, hindi, italiano, giapponese, polacco, portoghese, russo, spagnolo, swahili, thai, turco, urdu e vietnamita. Un testo in un'altra lingua viene comunque associato a una di queste etichette: controlla quindi l'elenco delle lingue supportate prima di fare affidamento sul risultato.

Domande frequenti

Il mio testo viene caricato su un server?

No. Il testo passa a un processo separato nel browser e l'inferenza avviene sul dispositivo. Questo processo scarica i file pubblici del modello e l'ambiente Transformers.js da host esterni, ma non invia il testo incollato insieme a tali richieste. CanDoYa non riceve né conserva il campione.

Il rilevatore di lingua è gratis?

Sì. Non servono account, pagamenti, crediti o chiavi API. È il dispositivo a eseguire l'inferenza. I costi pratici sono il primo download del modello, lo spazio locale, la memoria e il tempo di elaborazione. Con una connessione a consumo, il gestore può comunque addebitare i dati usati per scaricare i file del modello.

Quanto testo posso analizzare?

Puoi incollare un normale brano di qualsiasi lunghezza, ma il rilevatore analizza al massimo i primi 400 caratteri, così resta entro la finestra di input del modello e mantiene prevedibile l'inferenza nel browser. Servono almeno quattro lettere o numeri. Per un risultato utile, inserisci una frase naturale completa; un paragrafo offre più elementi distintivi.

In che lingua è scritto questo testo? Quali lingue riconosce?

Il modello supporta 20 etichette: arabo, bulgaro, cinese, olandese, inglese, francese, tedesco, greco, hindi, italiano, giapponese, polacco, portoghese, russo, spagnolo, swahili, thai, turco, urdu e vietnamita. Non riconosce in modo affidabile lingue esterne a questo insieme chiuso.

Perché il primo download pesa circa 296 MB?

Il rilevatore usa un modello neurale multilingue XLM-R, non una piccola tabella di frequenze dei caratteri. I pesi ONNX quantizzati occupano circa 279 MB e il tokenizer circa 17 MB. Di solito il browser li conserva entrambi nella cache, ma la navigazione privata, la cancellazione dei dati del sito o la rimozione della cache possono richiedere un nuovo download.

Il rilevamento funziona senza WebGPU?

Sì. Il processo preferisce WebGPU quando il browser lo rende disponibile. Se WebGPU manca o il modello non si avvia, lo strumento riprova con il backend CPU WebAssembly. L'inferenza sulla CPU mantiene il testo sul dispositivo, ma il caricamento e il rilevamento possono richiedere più tempo su telefoni e computer meno recenti.

Che cosa indicano i punteggi di affidabilità?

I punteggi ordinano le 20 etichette possibili del modello per questo campione. Sono utili per confrontare i candidati, ma non sono una garanzia, una probabilità indipendente di correttezza o una prova che la lingua reale sia supportata. Se i primi punteggi sono vicini, aggiungi altro testo naturale.

Può riconoscere testi misti o traslitterati?

Lo strumento restituisce una corrispondenza principale e alcune alternative, non un'etichetta per ogni frase o parola. I testi in più lingue possono generare punteggi ravvicinati. Traslitterazioni informali, nomi, emoji, URL e codice sorgente eliminano molti indizi di alfabeto e ortografia, quindi richiedono una verifica umana prudente.