CanDoYa
CS

Detekce jazyka pomocí AI

Omezené jazyky

Běží celé ve vašem prohlížeči - nic se nenahrává, žádná registrace.

Vložte větu nebo odstavec a určete jeho jazyk.

Text se zpracovává v pracovním vlákně prohlížeče a nikam se neodesílá. Stahuje se pouze veřejný model AI.

20 podporovaných jazyků

Arabština, bulharština, čínština, nizozemština, angličtina, francouzština, němčina, řečtina, hindština, italština, japonština, polština, portugalština, ruština, španělština, svahilština, thajština, turečtina, urdština a vietnamština.

Text v jiném jazyce může být chybně označen jako nejbližší podporovaná možnost.

Sdílet tento nástroj

Jak funguje detekce jazyka?

Detekce jazyka určí nejpravděpodobnější jazyk vloženého textu. Tento nástroj porovná ukázku s 20 jazyky a zobrazí tři nejvyšší skóre modelu. AI běží místně v pracovním vlákně prohlížeče, takže se text nikam neodesílá. Při prvním použití je však nutné stáhnout model.

Jak na to

  1. 1Vložte dostatečně dlouhou ukázku. Zadejte celou větu nebo odstavec v jednom z 20 podporovaných jazyků. Delší přirozený text se obvykle rozlišuje snáze než jméno nebo jediné slovo.
  2. 2Spusťte detekci v zařízení. Klikněte na Určit jazyk. Při prvním spuštění počkejte na stažení modelu. Při dalších návštěvách může prohlížeč použít mezipaměť, pokud ji mezitím neodstranil.
  3. 3Projděte seřazené shody. Zkontrolujte první jazyk, kód ISO, skóre i další možnosti. Blízká skóre, krátké ukázky a nepodporované jazyky berte jako nejisté výsledky.

Pro koho je nástroj

Detektor spouští klasifikační model XLM-R přímo v zařízení a výpočty provádí v pracovním vlákně, aby stránka zůstala svižná. Přednostně využije akceleraci WebGPU. Pokud není dostupná, zkusí znovu výpočet na procesoru přes WebAssembly. Při prvním spuštění stáhne z Hugging Face přibližně 296 MB dat modelu a tokenizéru. Prohlížeč je obvykle uloží do mezipaměti, ale při jejím vymazání nebo nedostatku místa je může odstranit.

Model rozlišuje arabštinu, bulharštinu, čínštinu, nizozemštinu, angličtinu, francouzštinu, němčinu, řečtinu, hindštinu, italštinu, japonštinu, polštinu, portugalštinu, ruštinu, španělštinu, svahilštinu, thajštinu, turečtinu, urdštinu a vietnamštinu. Text v jiném jazyce přiřadí k jednomu z těchto štítků, proto se před použitím výsledku podívejte na seznam podporovaných jazyků.

Časté dotazy

Odesílá se můj text na server?

Ne. Text se předá pracovnímu vláknu uvnitř prohlížeče a výpočet proběhne v zařízení. Pracovní vlákno stahuje z externích serverů veřejné soubory modelu a běhové prostředí Transformers.js, ale vložený text s těmito požadavky neposílá. CanDoYa ukázku nepřijímá ani neukládá.

Je detektor jazyka zdarma?

Ano. Nepotřebujete účet, platbu, kredit ani klíč API. Výpočet provádí vaše zařízení. Počítejte jen s prvním stažením modelu, místem v úložišti, pamětí a časem procesoru. U zpoplatněného datového připojení může operátor stažení modelu naúčtovat.

Kolik textu lze analyzovat?

Vložit můžete běžně dlouhý text, detektor však analyzuje nejvýše prvních 400 znaků, aby zůstal v rámci vstupního okna modelu a výpočet v prohlížeči byl předvídatelný. Minimem jsou čtyři písmena nebo číslice. Pro použitelný výsledek zadejte alespoň přirozenou větu, odstavec nabídne více rozlišovacích znaků.

Které jazyky nástroj rozpozná?

Model podporuje 20 štítků: arabštinu, bulharštinu, čínštinu, nizozemštinu, angličtinu, francouzštinu, němčinu, řečtinu, hindštinu, italštinu, japonštinu, polštinu, portugalštinu, ruštinu, španělštinu, svahilštinu, thajštinu, turečtinu, urdštinu a vietnamštinu. Jazyky mimo tuto uzavřenou sadu spolehlivě určit neumí.

Proč má první stažení přibližně 296 MB?

Detektor používá vícejazyčný neuronový model XLM-R, nikoli malou tabulku četnosti znaků. Kvantované váhy ONNX mají přibližně 279 MB a tokenizér asi 17 MB. Prohlížeč obojí obvykle uloží do mezipaměti. Po jejím automatickém vyprázdnění, v anonymním režimu nebo po smazání dat webu bude nutné soubory stáhnout znovu.

Funguje detekce jazyka bez WebGPU?

Ano. Pracovní vlákno upřednostní WebGPU, pokud ho prohlížeč zpřístupní. Když WebGPU chybí nebo se model nespustí, nástroj zkusí znovu výpočet na procesoru pomocí WebAssembly. Text zůstane v zařízení i tehdy, ale načítání a detekce mohou na telefonu nebo starším počítači trvat déle.

Co znamená skóre jistoty?

Skóre řadí 20 možných štítků modelu pro zadanou ukázku. Hodí se k porovnání kandidátů, ale není zárukou, nezávislou pravděpodobností správnosti ani důkazem, že je skutečný jazyk podporován. Pokud jsou první skóre blízko u sebe, přidejte delší přirozený text.

Rozpozná smíšený nebo přepsaný text?

Nástroj vrátí jednu hlavní shodu a další možnosti, nikoli jazykový štítek pro každou větu či slovo. U vícejazyčného textu mohou být skóre blízko u sebe. Neformální přepis, jména, emoji, URL a zdrojový kód navíc odstraňují mnoho vodítek z abecedy a pravopisu, proto výsledek ověřte lidským úsudkem.