CanDoYa
RO

Detectare limbă cu AI

Limbi limitate

Rulează integral în browserul tău - fără încărcare, fără cont.

Introdu o propoziție sau un paragraf pentru a identifica limba.

Textul este procesat local într-un proces al navigatorului și nu este încărcat. Se descarcă doar modelul AI public.

20 de limbi acceptate

Arabă, bulgară, chineză, neerlandeză, engleză, franceză, germană, greacă, hindi, italiană, japoneză, poloneză, portugheză, rusă, spaniolă, swahili, thailandeză, turcă, urdu și vietnameză.

Româna și alte limbi din afara listei pot fi etichetate greșit ca cea mai apropiată opțiune acceptată.

Distribuie acest instrument

Cum identific limba unui text?

Un detector de limbă găsește limba cea mai probabilă a textului introdus. Instrumentul compară fragmentul cu 20 de limbi și afișează primele trei scoruri ale modelului. AI rulează local într-un proces al navigatorului, așa că textul nu este încărcat, însă modelul trebuie descărcat la prima utilizare.

Cum se folosește

  1. 1Introdu un fragment util. Scrie o propoziție completă sau un paragraf într-una dintre cele 20 de limbi acceptate. Textul natural și mai lung este de obicei mai ușor de diferențiat decât un nume sau un singur cuvânt.
  2. 2Pornește detectarea pe dispozitiv. Apasă Detectează limba. La prima utilizare, așteaptă descărcarea modelului; vizitele ulterioare pot folosi memoria cache a navigatorului dacă fișierele sunt încă disponibile.
  3. 3Verifică rezultatele ordonate. Analizează prima limbă, codul ISO, scorul și alternativele. Consideră incerte scorurile apropiate, fragmentele scurte și limbile neacceptate.

Pentru cine este

Detectorul rulează pe dispozitiv un model de clasificare XLM-R și efectuează analiza într-un proces separat, astfel încât pagina să rămână activă. Încearcă mai întâi accelerarea WebGPU, iar la nevoie trece la modul WebAssembly pe CPU. La prima rulare, descarcă de pe Hugging Face aproximativ 296 MB de date pentru model și segmentator. Navigatorul păstrează de regulă aceste fișiere în memoria cache, dar le poate șterge când spațiul de stocare este curățat sau devine insuficient.

Modelul compară araba, bulgara, chineza, neerlandeza, engleza, franceza, germana, greaca, hindi, italiana, japoneza, poloneza, portugheza, rusa, spaniola, swahili, thailandeza, turca, urdu și vietnameza. Româna nu se află printre etichete. Un text în altă limbă va fi atribuit forțat uneia dintre opțiunile disponibile, așa că verifică lista înainte de a te baza pe rezultat.

Întrebări frecvente

Textul meu este încărcat pe un server?

Nu. Textul este transmis unui proces din navigator, iar analiza are loc pe dispozitiv. Procesul descarcă fișierele publice ale modelului și mediul Transformers.js de pe servere externe, dar nu include textul introdus în acele cereri. CanDoYa nu primește și nu stochează fragmentul.

Detectorul de limbă este gratuit?

Da. Nu ai nevoie de cont, plată, credite sau cheie API. Dispozitivul efectuează analiza. Costurile practice sunt prima descărcare a modelului, spațiul local, memoria și timpul de procesare. Dacă internetul este taxat după trafic, descărcarea fișierelor modelului poate genera costuri.

Cât text pot analiza?

Poți introduce un pasaj obișnuit, dar detectorul analizează cel mult primele 400 de caractere, pentru a respecta fereastra de intrare a modelului și a menține previzibilă rularea în navigator. Sunt necesare minimum patru litere sau cifre. Pentru un rezultat util, oferă cel puțin o propoziție naturală; un paragraf conține mai multe tipare distinctive.

Ce limbi poate identifica instrumentul?

Modelul acceptă 20 de etichete: arabă, bulgară, chineză, neerlandeză, engleză, franceză, germană, greacă, hindi, italiană, japoneză, poloneză, portugheză, rusă, spaniolă, swahili, thailandeză, turcă, urdu și vietnameză. Româna nu face parte din acest set închis și nu poate fi identificată în mod fiabil.

De ce prima descărcare are aproximativ 296 MB?

Detectorul folosește un model neuronal multilingv XLM-R, nu un tabel mic cu frecvența caracterelor. Parametrii ONNX cuantizați ocupă aproximativ 279 MB, iar segmentatorul circa 17 MB. Navigatorul le păstrează de obicei în memoria cache, dar navigarea privată, ștergerea datelor site-ului sau eliminarea fișierelor din cache pot impune o nouă descărcare.

Detectarea limbii funcționează fără WebGPU?

Da. Procesul preferă WebGPU când navigatorul îl oferă. Dacă WebGPU lipsește sau modelul nu pornește, instrumentul încearcă din nou cu modul WebAssembly pe CPU. Textul rămâne pe dispozitiv, dar încărcarea și detectarea pot dura mai mult pe telefoane sau calculatoare vechi.

Ce înseamnă scorurile de încredere?

Scorurile ordonează cele 20 de etichete posibile ale modelului pentru fragmentul analizat. Sunt utile pentru a compara variantele, dar nu garantează corectitudinea, nu sunt probabilități independente și nu arată că limba reală este acceptată. Dacă primele scoruri sunt apropiate, adaugă mai mult text natural.

Poate detecta text mixt sau transliterat?

Instrumentul întoarce un rezultat principal și alternative, nu o etichetă pentru fiecare propoziție sau cuvânt. Limbile amestecate pot genera scoruri apropiate. Transliterarea informală, numele, emoji, adresele URL și codul sursă elimină multe indicii de alfabet și ortografie, așa că aceste rezultate trebuie verificate atent de o persoană.