CanDoYa
HU

AI nyelvfelismerő

Korlátozott nyelvek

Teljesen a böngésződben fut - feltöltés és regisztráció nélkül.

Illessz be egy mondatot vagy bekezdést a nyelv azonosításához.

A szöveget a böngésző egy háttérszálon dolgozza fel, és soha nem tölti fel. Csak a nyilvános AI-modell töltődik le.

20 támogatott nyelv

Arab, bolgár, kínai, holland, angol, francia, német, görög, hindi, olasz, japán, lengyel, portugál, orosz, spanyol, szuahéli, thai, török, urdu és vietnámi.

Más nyelvű szöveg tévesen a legközelebbi támogatott lehetőség címkéjét kaphatja.

Oszd meg ezt az eszközt

Mi az a nyelvfelismerő?

A nyelvfelismerő megállapítja, hogy egy beillesztett szöveg nagy valószínűséggel milyen nyelvű. Ez az eszköz 20 nyelvvel veti össze a mintát, és megmutatja a modell három legmagasabb pontszámát. Az AI helyben, a böngésző egyik háttérszálán fut, ezért a böngésző nem tölti fel a szöveget. Első használatkor viszont le kell tölteni a modellt.

Így működik

  1. 1Illessz be használható mintát. Adj meg egy teljes mondatot vagy bekezdést a 20 támogatott nyelv egyikén. A hosszabb, természetes szöveget általában könnyebb megkülönböztetni, mint egy nevet vagy egyetlen szót.
  2. 2Indítsd el a helyi felismerést. Kattints a Nyelv felismerése gombra. Az első futtatáskor várd meg a modell letöltését. Később a böngésző felhasználhatja a gyorsítótárat, ha az még elérhető.
  3. 3Nézd át a rangsorolt találatokat. Ellenőrizd az első nyelvet, az ISO-kódot, a pontszámot és a további lehetőségeket. A közeli pontszámokat, a rövid mintákat és a nem támogatott nyelveket kezeld bizonytalan eredményként.

Kinek hasznos

A felismerő egy XLM-R osztályozómodellt futtat az eszközödön, a számítást pedig háttérszálon végzi, hogy az oldal közben is gyors maradjon. Elsősorban WebGPU-gyorsítást használ, szükség esetén pedig megpróbálja újra a processzoron, WebAssembly környezetben. Az első futtatáskor körülbelül 296 MB modell- és tokenizálóadat töltődik le a Hugging Face-ről. A böngésző rendszerint gyorsítótárba teszi ezeket, de törölheti őket, ha kiüríted a tárhelyet vagy kevés a szabad hely.

A modell az arab, bolgár, kínai, holland, angol, francia, német, görög, hindi, olasz, japán, lengyel, portugál, orosz, spanyol, szuahéli, thai, török, urdu és vietnámi nyelvet hasonlítja össze. Más nyelvű szöveget is ezek egyikéhez sorol, ezért mielőtt a találatra hagyatkozol, ellenőrizd a támogatott nyelvek listáját.

Gyakori kérdések

Feltöltődik a szövegem egy szerverre?

Nem. A szöveget a böngésző egyik háttérszála kapja meg, a következtetés pedig az eszközödön történik. A háttérszál nyilvános modellfájlokat és a Transformers.js futtatókörnyezetet tölt le külső tárhelyekről, de ezekkel a kérésekkel nem küldi el a beillesztett szöveget. A CanDoYa nem kapja meg és nem tárolja a mintát.

Ingyenes a nyelvfelismerő?

Igen. Nincs szükség fiókra, fizetésre, kreditre vagy API-kulcsra. A számítást a saját eszközöd végzi. A gyakorlati költség az első modellletöltés, a helyi tárhely, a memória és a feldolgozási idő. Forgalmi díjas internetkapcsolatnál a szolgáltató felszámíthatja a modell adatforgalmát.

Mennyi szöveget lehet elemezni?

Szokásos hosszúságú szöveget is beilleszthetsz, de a felismerő legfeljebb az első 400 karaktert elemzi, hogy a modell bemeneti korlátján belül maradjon, és kiszámítható legyen a böngészőben végzett feldolgozás. Legalább négy betű vagy szám szükséges. Használható eredményhez adj meg egy természetes mondatot, egy bekezdés pedig több megkülönböztető mintát biztosít.

Mely nyelveket ismeri fel az eszköz?

A modell 20 címkét támogat: arab, bolgár, kínai, holland, angol, francia, német, görög, hindi, olasz, japán, lengyel, portugál, orosz, spanyol, szuahéli, thai, török, urdu és vietnámi. A zárt halmazon kívüli nyelveket nem azonosítja megbízhatóan.

Miért körülbelül 296 MB az első letöltés?

A felismerő egy többnyelvű XLM-R neurális modellt használ, nem pedig egy kis karaktersűrűségi táblázatot. A kvantált ONNX-súlyok körülbelül 279 MB-osak, a tokenizáló pedig nagyjából 17 MB. A böngésző rendszerint mindkettőt gyorsítótárazza, de a gyorsítótár ürítése, a privát böngészés vagy a webhelyadatok törlése miatt újra le kell tölteni őket.

Működik a nyelvfelismerés WebGPU nélkül?

Igen. A háttérszál előnyben részesíti a WebGPU-t, ha a böngésző elérhetővé teszi. Ha a WebGPU hiányzik, vagy a modell indítása sikertelen, az eszköz WebAssembly használatával újrapróbálja a processzoron. A szöveg ekkor is az eszközön marad, de telefonon vagy régebbi számítógépen a betöltés és a felismerés tovább tarthat.

Mit jelentenek a bizonyossági pontszámok?

A pontszámok a modell 20 lehetséges címkéjét rangsorolják ehhez a mintához. Hasznosak a jelöltek összevetésére, de nem jelentenek garanciát, önálló helyességi valószínűséget vagy bizonyítékot arra, hogy a valódi nyelv támogatott. Ha az első pontszámok közel vannak egymáshoz, adj meg több természetes szöveget.

Felismeri a kevert vagy átírt szöveget?

Az eszköz egy vezető találatot és további lehetőségeket ad vissza, nem pedig minden mondathoz vagy szóhoz külön nyelvi címkét. Többnyelvű szövegnél közel kerülhetnek egymáshoz a pontszámok. A nem szabványos átírás, a nevek, az emodzsik, az URL-ek és a forráskódok sok írásképi és helyesírási támpontot eltüntetnek, ezért az eredményt érdemes emberileg ellenőrizni.