CanDoYa
RU

Определить язык текста с помощью ИИ

Работает прямо в браузере - без загрузки файлов и регистрации.

Вставьте предложение или абзац, чтобы определить язык.

Текст обрабатывается в отдельном процессе браузера и никуда не отправляется. Загружается только общедоступная модель ИИ.

20 поддерживаемых языков

Арабский, болгарский, вьетнамский, голландский, греческий, испанский, итальянский, китайский, немецкий, польский, португальский, русский, суахили, тайский, турецкий, урду, французский, хинди, японский и английский.

Текст на другом языке может получить ошибочную метку ближайшего поддерживаемого варианта.

Поделиться инструментом

Что такое определитель языка?

Определитель языка находит наиболее вероятный язык вставленного текста. Этот инструмент сравнивает образец с 20 языками и показывает три наивысших оценки модели. ИИ работает локально в отдельном процессе браузера, поэтому текст никуда не отправляется. При первом запуске потребуется только загрузить модель.

Как пользоваться

  1. 1Вставьте содержательный образец. Введите полное предложение или абзац на одном из 20 поддерживаемых языков. Длинный естественный текст обычно распознать проще, чем имя или отдельное слово.
  2. 2Запустите определение на устройстве. Нажмите Определить язык. При первом запуске дождитесь загрузки модели. Во время следующих посещений браузер сможет использовать кеш, если файлы еще доступны.
  3. 3Проверьте варианты по порядку. Посмотрите основной язык, код ISO, оценку и альтернативы. Близкие оценки, короткие образцы и неподдерживаемые языки следует считать неопределенными.

Кому пригодится

Определитель запускает модель классификации XLM-R на вашем устройстве и выполняет анализ в отдельном процессе, чтобы страница не зависала. Сначала используется ускорение WebGPU, а при необходимости модель повторно запускается через WebAssembly на процессоре. При первом запуске с Hugging Face загружается около 296 МБ данных модели и токенизатора. Обычно браузер сохраняет их в кеше, но может удалить после очистки хранилища или при нехватке места.

Модель сравнивает арабский, болгарский, вьетнамский, голландский, греческий, испанский, итальянский, китайский, немецкий, польский, португальский, русский, суахили, тайский, турецкий, урду, французский, хинди, японский и английский языки. Текст на другом языке будет принудительно отнесен к одной из этих меток. Сверяйтесь со списком поддерживаемых языков, прежде чем полагаться на результат.

Вопросы и ответы

Мой текст отправляется на сервер?

Нет. Текст передается в отдельный процесс браузера и анализируется на вашем устройстве. Этот процесс загружает общедоступные файлы модели и среду Transformers.js с внешних серверов, но не прикрепляет вставленный текст к этим запросам. CanDoYa не получает и не сохраняет образец.

Определитель языка бесплатный?

Да. Не нужны учетная запись, оплата, кредиты или ключ API. Анализ выполняет ваше устройство. Потребуются только первая загрузка, место в локальном хранилище, оперативная память и время на вычисления. При тарифе с оплатой трафика загрузка модели может расходовать платный пакет данных.

Какой объем текста можно проанализировать?

Можно вставить обычный фрагмент любой длины, но определитель анализирует не более первых 400 символов. Это укладывается во входное окно модели и делает время работы в браузере предсказуемым. Минимум составляют четыре буквы или цифры. Для полезного результата нужна хотя бы естественная фраза, а абзац даст больше различительных признаков.

Какие языки умеет определять этот инструмент?

Модель поддерживает 20 меток: арабский, болгарский, вьетнамский, голландский, греческий, испанский, итальянский, китайский, немецкий, польский, португальский, русский, суахили, тайский, турецкий, урду, французский, хинди, японский и английский. Языки за пределами этого закрытого набора она надежно не определяет.

Почему при первом запуске загружается около 296 МБ?

Определитель использует многоязычную нейросетевую модель XLM-R, а не небольшую таблицу частот символов. Квантованные веса ONNX занимают около 279 МБ, а токенизатор около 17 МБ. Обычно браузер сохраняет оба файла в кеше, но очистка данных, приватный режим или вытеснение кеша могут потребовать повторной загрузки.

Работает ли определение языка без WebGPU?

Да. Отдельный процесс предпочитает WebGPU, если браузер предоставляет эту возможность. Если WebGPU недоступен или модель не запускается, инструмент повторяет попытку с WebAssembly на процессоре. Текст остается на устройстве, но загрузка и анализ могут занять больше времени на телефонах и старых компьютерах.

Что означают оценки уверенности?

Оценки ранжируют 20 возможных меток для этого образца. Они помогают сравнить варианты, но не гарантируют правильность, не являются независимыми вероятностями и не доказывают, что настоящий язык поддерживается. Если первые оценки близки, добавьте больше естественного текста.

Можно определить смешанный текст или транслитерацию?

Инструмент возвращает один основной вариант и альтернативы, а не отдельную метку для каждого предложения или слова. Смешанный текст может дать близкие оценки. Неформальная транслитерация, имена, эмодзи, URL и исходный код тоже убирают многие признаки письменности и орфографии, поэтому такие результаты нужно проверять вручную.