CanDoYa
BN

ভাষা শনাক্তকারী

সীমিত ভাষা

পুরোটাই আপনার ব্রাউজারে চলে - কিছু আপলোড নেই, সাইন-আপ নেই।

ভাষা শনাক্ত করতে একটি বাক্য বা অনুচ্ছেদ পেস্ট করুন।

আপনার টেক্সট ব্রাউজারের worker-এ প্রক্রিয়া হয় এবং কখনো আপলোড হয় না। কেবল সর্বজনীন AI model ডাউনলোড হয়।

সমর্থিত ২০টি ভাষা

আরবি, বুলগেরীয়, চীনা, ডাচ, ইংরেজি, ফরাসি, জার্মান, গ্রিক, হিন্দি, ইতালীয়, জাপানি, পোলিশ, পর্তুগিজ, রুশ, স্প্যানিশ, সোয়াহিলি, থাই, তুর্কি, উর্দু ও ভিয়েতনামি।

অন্য ভাষার টেক্সটকে কাছাকাছি কোনো সমর্থিত ভাষা হিসেবে ভুল label দেওয়া হতে পারে।

এই টুল শেয়ার করুন

ভাষা শনাক্তকারী কী?

ভাষা শনাক্তকারী পেস্ট করা টেক্সটের সবচেয়ে সম্ভাব্য ভাষাটি বের করে। এই টুল আপনার নমুনাকে ২০টি ভাষার সঙ্গে তুলনা করে মডেলের সেরা তিনটি স্কোর দেখায়। AI ব্রাউজারের একটি worker-এ স্থানীয়ভাবে চলে, তাই আপনার টেক্সট আপলোড হয় না, তবে প্রথমবার ব্যবহারের সময় মডেলটি ডাউনলোড করতে হয়।

যেভাবে ব্যবহার করবেন

  1. 1অর্থবহ নমুনা পেস্ট করুন. সমর্থিত ২০টি ভাষার কোনো একটিতে একটি পূর্ণ বাক্য বা অনুচ্ছেদ লিখুন। নাম বা এক শব্দের চেয়ে একটু লম্বা স্বাভাবিক লেখা আলাদা করা সাধারণত সহজ।
  2. 2ডিভাইসে শনাক্তকরণ চালান. ভাষা শনাক্ত করুন বোতামে ক্লিক করুন। প্রথমবার মডেল ডাউনলোড হওয়া পর্যন্ত অপেক্ষা করুন; cache-এ ফাইল থাকলে পরেরবার ব্রাউজার সেগুলো আবার ব্যবহার করতে পারে।
  3. 3ক্রম অনুযায়ী মিল দেখুন. সেরা ভাষা, ISO code, score ও বিকল্পগুলো দেখুন। কাছাকাছি score, ছোট নমুনা ও অসমর্থিত ভাষাকে অনিশ্চিত ফল হিসেবে ধরুন।

কাদের জন্য

শনাক্তকারী আপনার ডিভাইসে একটি XLM-R শ্রেণিবিন্যাস মডেল চালায় এবং পেজ সচল রাখতে worker-এ inference করে। এটি আগে WebGPU acceleration ব্যবহারের চেষ্টা করে, প্রয়োজন হলে WebAssembly CPU backend দিয়ে আবার চেষ্টা করে। প্রথমবার প্রায় ২৯৬ MB মডেল ও tokenizer data Hugging Face থেকে ডাউনলোড হয়। ব্রাউজার সাধারণত ফাইলগুলো cache-এ রাখে, তবে storage পরিষ্কার করলে বা জায়গা কম থাকলে সেগুলো মুছে যেতে পারে।

মডেলটি আরবি, বুলগেরীয়, চীনা, ডাচ, ইংরেজি, ফরাসি, জার্মান, গ্রিক, হিন্দি, ইতালীয়, জাপানি, পোলিশ, পর্তুগিজ, রুশ, স্প্যানিশ, সোয়াহিলি, থাই, তুর্কি, উর্দু ও ভিয়েতনামি ভাষা তুলনা করে। অন্য ভাষার টেক্সটও এই লেবেলগুলোর একটির দিকে জোর করে ঠেলে দেওয়া হয়, তাই ফলাফলের ওপর নির্ভর করার আগে সমর্থিত ভাষার তালিকা দেখে নিন।

সাধারণ প্রশ্ন

আমার টেক্সট কি সার্ভারে আপলোড হয়?

না। টেক্সট ব্রাউজারের ভেতরের একটি worker-এ পাঠানো হয় এবং inference আপনার ডিভাইসেই ঘটে। worker বাইরের host থেকে সর্বজনীন model file ও Transformers.js runtime ডাউনলোড করে, কিন্তু ওই request-এর সঙ্গে আপনার পেস্ট করা টেক্সট পাঠায় না। CanDoYa নমুনাটি পায় না বা সংরক্ষণ করে না।

ভাষা শনাক্তকারী কি বিনামূল্যে ব্যবহার করা যায়?

হ্যাঁ। কোনো account, payment, credit limit বা API key লাগে না। আপনার ডিভাইস inference করে। বাস্তবে প্রথমবার model download, স্থানীয় storage, memory ও processing time লাগে। মিটারযুক্ত internet connection-এ model file ডাউনলোডের জন্য খরচ হতে পারে।

কতটা টেক্সট বিশ্লেষণ করা যায়?

সাধারণ যেকোনো অংশ পেস্ট করতে পারেন, তবে model-এর input window-এর মধ্যে থাকতে এবং browser inference-এর সময় নিয়ন্ত্রণে রাখতে শনাক্তকারী প্রথম ৪০০টি character পর্যন্ত বিশ্লেষণ করে। কমপক্ষে চারটি অক্ষর বা সংখ্যা লাগবে। কাজে লাগার মতো ফল পেতে অন্তত একটি স্বাভাবিক বাক্য দিন; একটি অনুচ্ছেদ মডেলকে আরও বেশি পার্থক্যসূচক pattern দেয়।

এই টুল কোন কোন ভাষা শনাক্ত করতে পারে?

মডেলটি ২০টি label সমর্থন করে: আরবি, বুলগেরীয়, চীনা, ডাচ, ইংরেজি, ফরাসি, জার্মান, গ্রিক, হিন্দি, ইতালীয়, জাপানি, পোলিশ, পর্তুগিজ, রুশ, স্প্যানিশ, সোয়াহিলি, থাই, তুর্কি, উর্দু ও ভিয়েতনামি। এই closed set-এর বাইরের ভাষা এটি নির্ভরযোগ্যভাবে শনাক্ত করতে পারে না।

প্রথম ডাউনলোড প্রায় ২৯৬ MB কেন?

শনাক্তকারী ছোট character-frequency table-এর বদলে বহুভাষিক XLM-R neural model ব্যবহার করে। এর quantized ONNX weight প্রায় ২৭৯ MB এবং tokenizer প্রায় ১৭ MB। ব্রাউজার সাধারণত দুটোই cache-এ রাখে, তবে cache eviction, private browsing বা site data মুছে ফেললে আবার ডাউনলোড করতে হতে পারে।

WebGPU ছাড়া কি ভাষা শনাক্তকরণ কাজ করে?

হ্যাঁ। ব্রাউজারে WebGPU থাকলে worker আগে সেটি ব্যবহার করে। WebGPU না থাকলে বা model চালু না হলে টুলটি WebAssembly CPU backend দিয়ে আবার চেষ্টা করে। CPU inference-এও টেক্সট আপনার ডিভাইসেই থাকে, তবে phone বা পুরোনো computer-এ load ও detection বেশি সময় নিতে পারে।

Confidence score-এর অর্থ কী?

Scoreগুলো এই নমুনার জন্য মডেলের সম্ভাব্য ২০টি label-কে ক্রম অনুযায়ী সাজায়। সম্ভাব্য ভাষাগুলো তুলনা করতে এগুলো কাজে লাগে, তবে এগুলো নিশ্চয়তা, সঠিক হওয়ার স্বাধীন probability বা আসল ভাষাটি সমর্থিত হওয়ার প্রমাণ নয়। সেরা scoreগুলো কাছাকাছি হলে আরও স্বাভাবিক টেক্সট যোগ করুন।

এটি কি মিশ্র বা প্রতিবর্ণীকৃত টেক্সট শনাক্ত করতে পারে?

টুলটি প্রতিটি বাক্য বা শব্দের জন্য আলাদা label দেয় না, বরং একটি প্রধান মিল ও কয়েকটি বিকল্প দেয়। মিশ্র ভাষার টেক্সটে score কাছাকাছি হতে পারে। অনানুষ্ঠানিক প্রতিবর্ণীকরণ, নাম, emoji, URL ও source code-এ লিপি ও বানানের অনেক ইঙ্গিত হারিয়ে যায়, তাই এসব ফল মানুষকে সতর্কভাবে যাচাই করতে হবে।