CanDoYa
BG

Разпознаване на езика на текст с AI

Работи изцяло в браузъра - без качване и без регистрация.

Поставете изречение или абзац, за да разпознаете езика му.

Текстът се обработва в процес на браузъра и никога не се качва. Изтегля се само публичният AI модел.

20 поддържани езика

Арабски, български, китайски, нидерландски, английски, френски, немски, гръцки, хинди, италиански, японски, полски, португалски, руски, испански, суахили, тайски, турски, урду и виетнамски.

Текст на друг език може да бъде погрешно означен като най-близкия поддържан вариант.

Споделете този инструмент

Как работи разпознаването на език?

Разпознаването на език определя най-вероятния език на поставения текст. Този инструмент сравнява откъса с 20 езика и показва трите най-високи оценки на модела. AI работи локално в процес на браузъра, затова текстът не се качва никъде, но при първото използване моделът трябва да бъде изтеглен.

Как се използва

  1. 1Поставете достатъчно дълъг откъс. Въведете цяло изречение или абзац на един от 20-те поддържани езика. Естественият и по-дълъг текст обикновено се различава по-лесно от име или отделна дума.
  2. 2Стартирайте локалното разпознаване. Натиснете Разпознай езика. При първото използване изчакайте моделът да се изтегли. Следващите посещения могат да използват кеша на браузъра, ако все още е наличен.
  3. 3Прегледайте подредените съвпадения. Проверете първия език, ISO кода, оценката и алтернативите. Близките оценки, кратките откъси и неподдържаните езици трябва да се приемат като несигурни.

За кого е

Инструментът изпълнява класификационен модел XLM-R на вашето устройство, а изчисленията протичат в отделен процес, за да остане страницата отзивчива. Първо се използва ускорение с WebGPU, а при нужда задачата се повтаря чрез WebAssembly на CPU. При първото стартиране се изтеглят около 296 MB данни за модела и токенизатора от Hugging Face. Браузърът обикновено ги кешира, но може да ги премахне при изчистване на хранилището или недостиг на място.

Моделът сравнява арабски, български, китайски, нидерландски, английски, френски, немски, гръцки, хинди, италиански, японски, полски, португалски, руски, испански, суахили, тайски, турски, урду и виетнамски. Текст на друг език ще бъде причислен към един от тези етикети, затова проверете списъка с поддържани езици, преди да разчитате на резултата.

Често задавани въпроси

Качва ли се текстът ми на сървър?

Не. Текстът се предава на отделен процес в браузъра и се обработва на вашето устройство. Процесът изтегля публичните файлове на модела и средата Transformers.js от външни хостове, но не изпраща поставения текст с тези заявки. CanDoYa не получава и не съхранява откъса.

Безплатно ли е разпознаването на език?

Да. Не са нужни профил, плащане, кредитен лимит или API ключ. Изчисленията се извършват от вашето устройство. Практическите разходи са първоначалното изтегляне на модела, локално място, памет и време за обработка. При интернет с таксуване според трафика изтеглянето на файловете може да се заплаща.

Колко текст мога да анализирам?

Можете да поставите обикновен откъс с всякаква дължина, но инструментът анализира най-много първите 400 знака, за да остане в прозореца за вход на модела и да осигури предвидима работа в браузъра. Минимумът е четири букви или цифри. За полезен резултат въведете поне едно естествено изречение, а абзацът дава повече отличителни белези.

Кои езици може да разпознава инструментът?

Моделът поддържа 20 етикета: арабски, български, китайски, нидерландски, английски, френски, немски, гръцки, хинди, италиански, японски, полски, португалски, руски, испански, суахили, тайски, турски, урду и виетнамски. Той не разпознава надеждно езици извън този затворен набор.

Защо първото изтегляне е около 296 MB?

Инструментът използва многоезичен невронен модел XLM-R, а не малка таблица с честоти на знаците. Квантизираните ONNX тегла са около 279 MB, а токенизаторът е около 17 MB. Браузърът обикновено кешира и двете, но изчистването на данните, частният режим или премахването на кеша може да наложат ново изтегляне.

Работи ли разпознаването без WebGPU?

Да. Процесът предпочита WebGPU, когато браузърът го предоставя. Ако WebGPU липсва или моделът не се стартира, инструментът опитва отново чрез WebAssembly на CPU. Обработката на CPU пак оставя текста на устройството ви, но зареждането и разпознаването може да са по-бавни на телефони и по-стари компютри.

Какво означават оценките за увереност?

Оценките подреждат 20-те възможни етикета на модела за този откъс. Те са полезни за сравнение на кандидатите, но не са гаранция, независимо изчислена вероятност за верен отговор или доказателство, че истинският език се поддържа. Ако водещите оценки са близки, добавете още естествен текст.

Може ли да разпознава смесен или транслитериран текст?

Инструментът връща едно водещо съвпадение и алтернативи, а не отделен етикет за всяко изречение или дума. При смесен текст оценките може да са близки. Неформалната транслитерация, имената, емоджитата, URL адресите и програмният код също премахват много от белезите на писмеността и правописа, затова тези резултати изискват внимателна човешка преценка.