CanDoYa
LT

Teksto kalbos atpažinimas su DI

Ribotos kalbos

Veikia tik jūsų naršyklėje - nieko neįkeliama, registracija nereikalinga.

Įklijuokite sakinį arba pastraipą ir atpažinkite teksto kalbą.

Tekstas apdorojamas atskiroje naršyklės gijoje ir niekur neįkeliamas. Atsisiunčiamas tik viešas DI modelis.

20 palaikomų kalbų

Arabų, bulgarų, kinų, olandų, anglų, prancūzų, vokiečių, graikų, hindi, italų, japonų, lenkų, portugalų, rusų, ispanų, svahilių, tajų, turkų, urdų ir vietnamiečių.

Kitos kalbos tekstas gali būti klaidingai pažymėtas kaip artimiausia palaikoma kalba.

Dalintis šiuo įrankiu

Kaip atpažinti teksto kalbą?

Kalbos atpažinimo priemonė nustato, kokia kalba greičiausiai parašytas įklijuotas tekstas. Ši priemonė palygina pavyzdį su 20 kalbų ir parodo tris aukščiausius modelio įverčius. DI veikia lokaliai atskiroje naršyklės gijoje, todėl tekstas niekur neįkeliamas, tačiau naudojant pirmą kartą reikia atsisiųsti modelį.

Kaip naudotis

  1. 1Įklijuokite tinkamą pavyzdį. Įveskite visą sakinį arba pastraipą viena iš 20 palaikomų kalbų. Ilgesnį natūralų tekstą paprastai lengviau atskirti nei vardą ar pavienį žodį.
  2. 2Paleiskite atpažinimą įrenginyje. Spustelėkite Atpažinti kalbą. Naudodami pirmą kartą palaukite, kol bus atsisiųstas modelis. Vėliau priemonė gali panaudoti naršyklės podėlį, jei jis vis dar išsaugotas.
  3. 3Peržiūrėkite surikiuotus rezultatus. Patikrinkite pirmąją kalbą, ISO kodą, įvertį ir kitus variantus. Artimus įverčius, trumpus pavyzdžius ir nepalaikomas kalbas vertinkite atsargiai.

Kam pravers

Priemonė jūsų įrenginyje paleidžia XLM-R klasifikavimo modelį, o skaičiavimus atlieka atskiroje gijoje, kad puslapis reaguotų sklandžiai. Pirmiausia bandomas WebGPU spartinimas, o prireikus skaičiavimai kartojami procesoriuje per WebAssembly. Pirmą kartą paleidus iš Hugging Face atsisiunčiama apie 296 MB modelio ir tokenizatoriaus duomenų. Naršyklė paprastai juos išsaugo podėlyje, bet gali pašalinti išvalius saugyklą arba trūkstant vietos.

Modelis lygina arabų, bulgarų, kinų, olandų, anglų, prancūzų, vokiečių, graikų, hindi, italų, japonų, lenkų, portugalų, rusų, ispanų, svahilių, tajų, turkų, urdų ir vietnamiečių kalbas. Kitos kalbos tekstas bus priskirtas vienai iš šių žymų, todėl prieš pasikliaudami rezultatu patikrinkite palaikomų kalbų sąrašą.

DUK

Ar mano tekstas įkeliamas į serverį?

Ne. Tekstas perduodamas atskirai naršyklės gijai, o apdorojimas vyksta jūsų įrenginyje. Ši gija iš išorinių serverių atsisiunčia viešus modelio failus ir Transformers.js vykdymo aplinką, bet kartu su šiomis užklausomis įklijuoto teksto nesiunčia. CanDoYa pavyzdžio negauna ir nesaugo.

Ar kalbos atpažinimas nemokamas?

Taip. Nereikia paskyros, mokėjimo, kreditų ar API rakto. Skaičiavimus atlieka jūsų įrenginys. Praktinės sąnaudos yra pirmasis modelio atsisiuntimas, vietinė saugykla, atmintis ir apdorojimo laikas. Jei mokate už perduotus interneto duomenis, modelio failų atsisiuntimas gali kainuoti.

Kiek teksto galiu analizuoti?

Galite įklijuoti bet kokios įprastos apimties ištrauką, tačiau priemonė analizuoja ne daugiau kaip pirmuosius 400 ženklų, kad neviršytų modelio įvesties lango ir naršyklės skaičiavimai būtų nuspėjami. Būtinos bent keturios raidės arba skaitmenys. Naudingam rezultatui pateikite bent vieną natūralų sakinį, o pastraipoje modelis ras daugiau skiriamųjų požymių.

Kokias kalbas ši priemonė gali atpažinti?

Modelis palaiko 20 žymų: arabų, bulgarų, kinų, olandų, anglų, prancūzų, vokiečių, graikų, hindi, italų, japonų, lenkų, portugalų, rusų, ispanų, svahilių, tajų, turkų, urdų ir vietnamiečių kalbas. Už šio uždaro rinkinio ribų esančių kalbų jis patikimai neatpažįsta.

Kodėl pirmą kartą atsisiunčiama apie 296 MB?

Priemonė naudoja daugiakalbį XLM-R neuroninį modelį, o ne mažą ženklų dažnių lentelę. Kvantuoti ONNX svoriai užima apie 279 MB, tokenizatorius dar apie 17 MB. Naršyklė paprastai abu išsaugo podėlyje, tačiau jį išvalius, naudojant privatų naršymą arba pašalinus svetainės duomenis gali tekti atsisiųsti iš naujo.

Ar kalbos atpažinimas veikia be WebGPU?

Taip. Gija pirmiausia naudoja WebGPU, jei naršyklė jį palaiko. Jei WebGPU nepasiekiamas arba modelio nepavyksta paleisti, priemonė bando dar kartą naudodama WebAssembly ir CPU. Apdorojant procesoriuje tekstas taip pat lieka įrenginyje, bet telefonuose ir senesniuose kompiuteriuose įkėlimas bei atpažinimas gali trukti ilgiau.

Ką reiškia pasitikėjimo įverčiai?

Pagal įverčius surikiuojama 20 galimų šio pavyzdžio modelio žymų. Jie naudingi kandidatams palyginti, tačiau nėra garantija, nepriklausoma teisingumo tikimybė ar įrodymas, kad tikroji kalba palaikoma. Jei pirmaujantys įverčiai panašūs, pridėkite daugiau natūralaus teksto.

Ar galima atpažinti mišrų arba transliteruotą tekstą?

Priemonė pateikia vieną pagrindinį rezultatą ir kitus variantus, o ne kiekvieno sakinio ar žodžio kalbos žymą. Mišrus tekstas gali gauti panašius įverčius. Neformali transliteracija, vardai, jaustukai, URL adresai ir programinis kodas taip pat panaikina daug rašto bei rašybos požymių, todėl tokius rezultatus žmogus turėtų įvertinti atsargiai.