CanDoYa
PL

Wykrywanie języka przez AI

Działa w całości w przeglądarce - bez wysyłania plików i bez rejestracji.

Wklej zdanie lub akapit, aby rozpoznać jego język.

Tekst jest przetwarzany w procesie roboczym przeglądarki i nigdy nie jest wysyłany. Pobierany jest tylko publiczny model AI.

20 obsługiwanych języków

Arabski, bułgarski, chiński, niderlandzki, angielski, francuski, niemiecki, grecki, hindi, włoski, japoński, polski, portugalski, rosyjski, hiszpański, suahili, tajski, turecki, urdu i wietnamski.

Tekst w innym języku może zostać błędnie oznaczony jako najbliższa obsługiwana opcja.

Udostępnij to narzędzie

Na czym polega wykrywanie języka?

Wykrywanie języka wskazuje, w jakim języku najprawdopodobniej napisano wklejony tekst. Narzędzie porównuje próbkę z 20 językami i pokazuje trzy najwyższe wyniki modelu. AI działa lokalnie w procesie roboczym przeglądarki, więc tekst nie jest wysyłany. Przy pierwszym użyciu trzeba jednak pobrać model.

Jak korzystać

  1. 1Wklej użyteczną próbkę. Wpisz pełne zdanie lub akapit w jednym z 20 obsługiwanych języków. Dłuższy, naturalny tekst jest zwykle łatwiejszy do rozpoznania niż imię albo pojedyncze słowo.
  2. 2Uruchom wykrywanie na urządzeniu. Kliknij Wykryj język. Przy pierwszym użyciu poczekaj na pobranie modelu. Podczas kolejnych wizyt przeglądarka może użyć pamięci podręcznej, jeśli dane nadal są dostępne.
  3. 3Sprawdź uporządkowane wyniki. Zobacz pierwszy język, kod ISO, wynik i pozostałych kandydatów. Zbliżone wyniki, krótkie próbki i nieobsługiwane języki traktuj jako niepewne.

Dla kogo

Detektor uruchamia na urządzeniu model klasyfikacyjny XLM-R. Wnioskowanie odbywa się w osobnym procesie roboczym, dzięki czemu strona pozostaje responsywna. Najpierw używane jest przyspieszenie WebGPU, a w razie potrzeby narzędzie ponawia próbę z backendem CPU WebAssembly. Przy pierwszym uruchomieniu pobierane jest około 296 MB danych modelu i tokenizera z Hugging Face. Przeglądarka zwykle przechowuje te pliki w pamięci podręcznej, ale może je usunąć po wyczyszczeniu danych lub gdy brakuje miejsca.

Model porównuje język arabski, bułgarski, chiński, niderlandzki, angielski, francuski, niemiecki, grecki, hindi, włoski, japoński, polski, portugalski, rosyjski, hiszpański, suahili, tajski, turecki, urdu i wietnamski. Tekst w innym języku zostanie przypisany do jednej z tych etykiet, dlatego przed wykorzystaniem wyniku sprawdź listę obsługiwanych języków.

Najczęstsze pytania

Czy mój tekst jest wysyłany na serwer?

Nie. Tekst trafia do procesu roboczego w przeglądarce, a wnioskowanie odbywa się na urządzeniu. Proces pobiera publiczne pliki modelu oraz środowisko Transformers.js z zewnętrznych serwerów, ale nie dołącza wklejonego tekstu do tych żądań. CanDoYa nie otrzymuje ani nie przechowuje próbki.

Czy wykrywanie języka jest darmowe?

Tak. Nie potrzeba konta, płatności, limitu punktów ani klucza API. Wnioskowanie wykonuje urządzenie. W praktyce potrzebne są pierwsze pobranie modelu, lokalna pamięć, RAM i czas procesora. Przy połączeniu taryfikowanym operator może naliczyć opłatę za pobranie plików modelu.

Ile tekstu mogę przeanalizować?

Można wkleić zwykły tekst dowolnej długości, ale detektor analizuje najwyżej pierwsze 400 znaków, aby zmieścić się w oknie wejściowym modelu i zachować przewidywalny czas wnioskowania w przeglądarce. Wymagane są co najmniej cztery litery lub cyfry. Pełne, naturalne zdanie daje użyteczny wynik, a akapit dostarcza więcej cech do rozróżnienia.

W jakim języku jest ten tekst i jakie języki rozpoznaje model?

Model obsługuje 20 etykiet: arabski, bułgarski, chiński, niderlandzki, angielski, francuski, niemiecki, grecki, hindi, włoski, japoński, polski, portugalski, rosyjski, hiszpański, suahili, tajski, turecki, urdu i wietnamski. Języków spoza tego zamkniętego zbioru nie rozpoznaje wiarygodnie.

Dlaczego pierwsze pobranie ma około 296 MB?

Detektor korzysta z wielojęzycznego modelu neuronowego XLM-R, a nie z małej tabeli częstości znaków. Skwantowane wagi ONNX zajmują około 279 MB, a tokenizer około 17 MB. Przeglądarka zwykle zapisuje oba składniki w pamięci podręcznej, ale tryb prywatny, usunięcie danych witryny lub wyczyszczenie pamięci może wymusić ponowne pobranie.

Czy wykrywanie języka działa bez WebGPU?

Tak. Proces roboczy wybiera WebGPU, gdy przeglądarka je udostępnia. Jeśli WebGPU nie ma lub model się nie uruchomi, narzędzie ponawia próbę z backendem CPU WebAssembly. Wnioskowanie na CPU nadal pozostawia tekst na urządzeniu, lecz ładowanie i wykrywanie mogą trwać dłużej na telefonach i starszych komputerach.

Co oznaczają wyniki ufności?

Wyniki szeregują 20 etykiet, które model może wybrać dla tej próbki. Pomagają porównać kandydatów, ale nie gwarantują poprawności, nie są niezależnym prawdopodobieństwem trafienia ani dowodem, że prawdziwy język jest obsługiwany. Gdy pierwsze wyniki są zbliżone, dodaj więcej naturalnego tekstu.

Czy narzędzie wykrywa tekst mieszany lub zapisany w transliteracji?

Narzędzie zwraca jeden dominujący wynik i alternatywy, a nie osobną etykietę dla każdego zdania lub słowa. Tekst mieszający języki może dać zbliżone wyniki. Nieformalna transliteracja, nazwy, emoji, adresy URL i kod źródłowy usuwają wiele wskazówek alfabetu oraz pisowni, więc wymagają ostrożnej oceny człowieka.