CanDoYa
SK

Detektor jazyka s AI

Obmedzené jazyky

Beží celý vo vašom prehliadači - bez nahrávania, bez registrácie.

Vložte vetu alebo odsek a zistite jeho jazyk.

Text sa spracúva v pracovnom vlákne prehliadača a nikdy sa neodosiela. Sťahuje sa len verejný model AI.

20 podporovaných jazykov

Arabčina, bulharčina, čínština, holandčina, angličtina, francúzština, nemčina, gréčtina, hindčina, taliančina, japončina, poľština, portugalčina, ruština, španielčina, svahilčina, thajčina, turečtina, urdčina a vietnamčina.

Text v inom jazyku môže byť nesprávne označený ako najbližšia podporovaná možnosť.

Zdieľať tento nástroj

Ako funguje detekcia jazyka?

Detektor jazyka určí najpravdepodobnejší jazyk vloženého textu. Nástroj porovná ukážku s 20 jazykmi a zobrazí tri najvyššie skóre modelu. AI beží lokálne v pracovnom vlákne prehliadača, takže text sa nikam neodosiela. Pri prvom použití však treba stiahnuť model.

Ako na to

  1. 1Vložte dostatočnú ukážku. Zadajte celú vetu alebo odsek v jednom z 20 podporovaných jazykov. Dlhší, prirodzený text sa zvyčajne rozlišuje ľahšie ako meno alebo jediné slovo.
  2. 2Spustite detekciu v zariadení. Kliknite na Zistiť jazyk. Pri prvom spustení počkajte na stiahnutie modelu. Pri ďalších návštevách môže prehliadač použiť vyrovnávaciu pamäť, ak ju medzitým neodstránil.
  3. 3Skontrolujte zoradené zhody. Pozrite si prvý jazyk, kód ISO, skóre aj ďalšie možnosti. Blízke skóre, krátke ukážky a nepodporované jazyky považujte za neisté výsledky.

Pre koho je nástroj určený

Detektor spúšťa klasifikačný model XLM-R priamo vo vašom zariadení a výpočet robí v pracovnom vlákne, aby stránka zostala svižná. Prednostne používa akceleráciu WebGPU a podľa potreby skúsi výpočet znova na procesore cez WebAssembly. Pri prvom spustení stiahne z Hugging Face približne 296 MB údajov modelu a tokenizéra. Prehliadač ich zvyčajne uloží do vyrovnávacej pamäte, ale po vymazaní úložiska alebo pri nedostatku miesta ich môže odstrániť.

Model porovnáva arabčinu, bulharčinu, čínštinu, holandčinu, angličtinu, francúzštinu, nemčinu, gréčtinu, hindčinu, taliančinu, japončinu, poľštinu, portugalčinu, ruštinu, španielčinu, svahilčinu, thajčinu, turečtinu, urdčinu a vietnamčinu. Text v inom jazyku priradí k jednej z týchto značiek. Pred použitím výsledku si preto pozrite zoznam podporovaných jazykov.

Časté otázky

Odosiela sa môj text na server?

Nie. Text sa odovzdá pracovnému vláknu v prehliadači a výpočet prebehne vo vašom zariadení. Pracovné vlákno sťahuje z externých serverov verejné súbory modelu a prostredie Transformers.js, ale vložený text s týmito požiadavkami neposiela. CanDoYa ukážku neprijíma ani neukladá.

Je detektor jazyka zadarmo?

Áno. Nepotrebujete účet, platbu, kredit ani kľúč API. Výpočet vykonáva vaše zariadenie. Praktickými nákladmi sú prvé stiahnutie modelu, miestne úložisko, pamäť a čas spracovania. Pri dátovo spoplatnenom pripojení môže operátor stiahnutie súborov modelu účtovať.

Koľko textu možno analyzovať?

Vložiť môžete bežný text, detektor však analyzuje najviac prvých 400 znakov, aby zostal v rámci vstupného okna modelu a výpočet v prehliadači bol predvídateľný. Minimom sú štyri písmená alebo číslice. Pre užitočný výsledok zadajte aspoň prirodzenú vetu, odsek poskytne modelu viac rozlišovacích znakov.

Ktoré jazyky nástroj rozpozná?

Model podporuje 20 značiek: arabčinu, bulharčinu, čínštinu, holandčinu, angličtinu, francúzštinu, nemčinu, gréčtinu, hindčinu, taliančinu, japončinu, poľštinu, portugalčinu, ruštinu, španielčinu, svahilčinu, thajčinu, turečtinu, urdčinu a vietnamčinu. Jazyky mimo tejto uzavretej množiny nedokáže spoľahlivo určiť.

Prečo má prvé stiahnutie približne 296 MB?

Detektor používa viacjazyčný neurónový model XLM-R, nie malú tabuľku frekvencie znakov. Kvantované váhy ONNX majú približne 279 MB a tokenizér asi 17 MB. Prehliadač oboje zvyčajne uloží do vyrovnávacej pamäte. Po jej odstránení, pri súkromnom prehliadaní alebo po vymazaní údajov stránky bude potrebné súbory stiahnuť znova.

Funguje rozpoznanie jazyka bez WebGPU?

Áno. Pracovné vlákno uprednostní WebGPU, ak ho prehliadač sprístupní. Keď WebGPU chýba alebo sa model nespustí, nástroj skúsi výpočet znova na procesore pomocou WebAssembly. Text zostane v zariadení aj vtedy, ale načítanie a detekcia môžu na telefóne alebo staršom počítači trvať dlhšie.

Čo znamenajú skóre istoty?

Skóre zoraďujú 20 možných značiek modelu pre zadanú ukážku. Pomáhajú porovnať kandidátov, ale nie sú zárukou, nezávislou pravdepodobnosťou správnosti ani dôkazom, že model skutočný jazyk podporuje. Ak sú prvé skóre blízko pri sebe, pridajte dlhší prirodzený text.

Rozpozná zmiešaný alebo prepísaný text?

Nástroj vráti jednu hlavnú zhodu a ďalšie možnosti, nie jazykovú značku pre každú vetu či slovo. Pri viacjazyčnom texte môžu byť skóre blízko pri sebe. Neformálny prepis, mená, emoji, URL a zdrojový kód navyše odstraňujú mnohé vodidlá z písma a pravopisu, preto výsledok overte ľudským úsudkom.