CanDoYa
UK

Визначити мову за допомогою ШІ

Обмежений набір мов

Працює повністю у вашому браузері - без завантаження на сервер і без реєстрації.

Вставте речення або абзац, щоб визначити його мову.

Текст обробляється в окремому процесі браузера й ніколи не завантажується на сервер. Завантажується лише загальнодоступна модель ШІ.

20 підтримуваних мов

Арабська, болгарська, китайська, нідерландська, англійська, французька, німецька, грецька, гінді, італійська, японська, польська, португальська, російська, іспанська, суахілі, тайська, турецька, урду та в’єтнамська.

Українська й інші мови поза списком можуть бути помилково позначені як найближчий підтримуваний варіант.

Поділитися інструментом

Як визначити мову тексту?

Визначник мови знаходить найімовірнішу мову вставленого тексту. Цей інструмент порівнює зразок із 20 мовами та показує три найвищі оцінки моделі. ШІ працює локально в окремому процесі браузера, тому текст не завантажується на сервер, але під час першого запуску потрібно завантажити модель.

Як користуватися

  1. 1Вставте достатній зразок. Введіть повне речення або абзац однією з 20 підтримуваних мов. Довший природний текст зазвичай легше розрізнити, ніж ім’я чи окреме слово.
  2. 2Запустіть визначення на пристрої. Натисніть «Визначити мову». Під час першого запуску дочекайтеся завантаження моделі; надалі браузер зможе повторно використати кеш, якщо файли збережуться.
  3. 3Перевірте впорядковані збіги. Перегляньте найімовірнішу мову, код ISO, оцінку та альтернативи. Близькі оцінки, короткі зразки й непідтримувані мови слід вважати невизначеними.

Кому це знадобиться

Визначник запускає на вашому пристрої модель класифікації XLM-R і виконує обчислення в окремому процесі, щоб сторінка не зависала. Спочатку він намагається використати прискорення WebGPU, а за потреби переходить на процесорний модуль WebAssembly. Під час першого запуску з Hugging Face завантажується приблизно 296 МБ даних моделі й токенізатора. Зазвичай браузер зберігає ці файли в кеші, але може видалити їх після очищення сховища або через нестачу місця.

Модель порівнює арабську, болгарську, китайську, нідерландську, англійську, французьку, німецьку, грецьку, гінді, італійську, японську, польську, португальську, російську, іспанську, суахілі, тайську, турецьку, урду та в’єтнамську мови. Української серед її міток немає. Текст іншою мовою буде примусово віднесено до однієї з підтримуваних, тому перевіряйте список перед використанням результату.

Часті запитання

Чи завантажується мій текст на сервер?

Ні. Текст передається в окремий процес у браузері, а обчислення відбуваються на вашому пристрої. Цей процес завантажує загальнодоступні файли моделі та середовище Transformers.js із зовнішніх джерел, але не надсилає разом із запитами вставлений текст. CanDoYa не отримує і не зберігає зразок.

Визначник мови безплатний?

Так. Обліковий запис, оплата, ліміт кредитів чи ключ API не потрібні. Обчислення виконує ваш пристрій. Практичні витрати охоплюють перше завантаження моделі, місце в локальному сховищі, пам’ять і час обробки. За тарифу з оплатою трафіку завантаження файлів моделі може коштувати грошей.

Який обсяг тексту можна проаналізувати?

Можна вставити звичайний уривок, але визначник аналізує щонайбільше перші 400 символів, щоб не перевищити вхідне вікно моделі та зберегти передбачувану швидкість у браузері. Потрібно щонайменше чотири літери або цифри. Для корисного результату дайте хоча б одне природне речення; абзац містить більше характерних ознак.

Які мови може визначити цей інструмент?

Модель підтримує 20 міток: арабську, болгарську, китайську, нідерландську, англійську, французьку, німецьку, грецьку, гінді, італійську, японську, польську, португальську, російську, іспанську, суахілі, тайську, турецьку, урду та в’єтнамську. Українська до цього закритого набору не входить і не визначатиметься надійно.

Чому перше завантаження має обсяг близько 296 МБ?

Визначник використовує багатомовну нейронну модель XLM-R, а не малу таблицю частот символів. Її квантовані ваги ONNX займають близько 279 МБ, а токенізатор ще приблизно 17 МБ. Зазвичай браузер кешує обидва файли, але очищення кешу, приватний режим або видалення даних сайту можуть вимагати нового завантаження.

Чи працює визначення мови без WebGPU?

Так. Коли WebGPU доступний у браузері, процес надає йому перевагу. Якщо WebGPU немає або модель не запускається, інструмент повторює спробу через процесорний модуль WebAssembly. Текст так само залишається на пристрої, проте завантаження й визначення можуть тривати довше на телефонах і старих комп’ютерах.

Що означають оцінки впевненості?

Оцінки впорядковують 20 можливих міток моделі для цього зразка. Вони допомагають порівняти варіанти, але не гарантують правильність, не є незалежною ймовірністю і не доводять, що справжня мова підтримується. Якщо найвищі оцінки близькі, додайте більше природного тексту.

Чи можна визначити змішаний або транслітерований текст?

Інструмент повертає один основний збіг та альтернативи, а не окрему мітку для кожного речення чи слова. Змішані мови можуть дати близькі оцінки. Неформальна транслітерація, імена, емодзі, URL та програмний код теж прибирають багато ознак письма й правопису, тому такі результати потребують уважної перевірки людиною.