CanDoYa
HI

AI भाषा पहचानकर्ता

पूरी तरह आपके ब्राउज़र में चलता है - न कुछ अपलोड, न साइन-अप।

भाषा पहचानने के लिए कोई वाक्य या अनुच्छेद चिपकाएं।

आपका टेक्स्ट ब्राउज़र वर्कर में प्रोसेस होता है और कभी अपलोड नहीं किया जाता। सिर्फ सार्वजनिक AI मॉडल डाउनलोड होता है।

20 समर्थित भाषाएं

अरबी, बल्गेरियाई, चीनी, डच, अंग्रेजी, फ्रेंच, जर्मन, ग्रीक, हिंदी, इतालवी, जापानी, पोलिश, पुर्तगाली, रूसी, स्पेनिश, स्वाहिली, थाई, तुर्की, उर्दू और वियतनामी।

दूसरी भाषा के टेक्स्ट को सबसे करीबी समर्थित विकल्प का गलत लेबल मिल सकता है।

यह टूल शेयर करें

भाषा पहचानकर्ता क्या होता है?

भाषा पहचानकर्ता चिपकाए गए टेक्स्ट की सबसे संभावित भाषा बताता है। यह टूल नमूने की तुलना 20 भाषाओं से करके मॉडल के तीन सबसे ऊंचे स्कोर दिखाता है। AI ब्राउज़र वर्कर में स्थानीय रूप से चलता है, इसलिए टेक्स्ट अपलोड नहीं होता, हालांकि पहली बार मॉडल डाउनलोड करना पड़ता है।

कैसे इस्तेमाल करें

  1. 1उपयोगी नमूना चिपकाएं. 20 समर्थित भाषाओं में से किसी एक का पूरा वाक्य या अनुच्छेद डालें। नाम या एक शब्द के मुकाबले लंबा, स्वाभाविक टेक्स्ट पहचानना आम तौर पर आसान होता है।
  2. 2डिवाइस पर भाषा पहचानें. भाषा पहचानें पर क्लिक करें। पहली बार मॉडल डाउनलोड होने तक प्रतीक्षा करें; बाद में फाइलें उपलब्ध होने पर ब्राउज़र कैश दोबारा इस्तेमाल हो सकता है।
  3. 3क्रम से मिले नतीजे देखें. सबसे ऊपर की भाषा, ISO कोड, स्कोर और दूसरे विकल्प देखें। पास-पास के स्कोर, छोटे नमूने और असमर्थित भाषाओं को अनिश्चित मानें।

किसके लिए है

यह पहचानकर्ता आपके डिवाइस पर XLM-R वर्गीकरण मॉडल चलाता है और पेज को सक्रिय रखने के लिए वर्कर में अनुमान करता है। पहले WebGPU से गति बढ़ाने की कोशिश होती है और जरूरत पड़ने पर WebAssembly CPU बैकएंड इस्तेमाल किया जाता है। पहली बार Hugging Face से करीब 296 MB का मॉडल और टोकनाइज़र डेटा डाउनलोड होता है। ब्राउज़र आम तौर पर इन फाइलों को कैश में रखता है, लेकिन स्टोरेज साफ करने या जगह कम होने पर इन्हें हटा सकता है।

मॉडल अरबी, बल्गेरियाई, चीनी, डच, अंग्रेजी, फ्रेंच, जर्मन, ग्रीक, हिंदी, इतालवी, जापानी, पोलिश, पुर्तगाली, रूसी, स्पेनिश, स्वाहिली, थाई, तुर्की, उर्दू और वियतनामी की तुलना करता है। किसी दूसरी भाषा का टेक्स्ट इन्हीं लेबलों में से किसी एक की ओर धकेला जाएगा, इसलिए नतीजे पर भरोसा करने से पहले समर्थित भाषाओं की सूची देखें।

अक्सर पूछे जाने वाले सवाल

क्या मेरा टेक्स्ट सर्वर पर अपलोड होता है?

नहीं। टेक्स्ट ब्राउज़र के भीतर एक वर्कर को दिया जाता है और अनुमान आपके डिवाइस पर होता है। वर्कर बाहरी होस्ट से सार्वजनिक मॉडल फाइलें और Transformers.js रनटाइम डाउनलोड करता है, लेकिन उन अनुरोधों में आपका चिपकाया हुआ टेक्स्ट नहीं जाता। CanDoYa नमूना प्राप्त या संग्रहित नहीं करता।

क्या भाषा पहचानकर्ता मुफ्त है?

हां। किसी खाते, भुगतान, क्रेडिट सीमा या API कुंजी की जरूरत नहीं है। आपका डिवाइस अनुमान करता है। व्यावहारिक खर्च पहली बार का मॉडल डाउनलोड, स्थानीय स्टोरेज, मेमोरी और प्रोसेसिंग समय हैं। डेटा के हिसाब से शुल्क वाले इंटरनेट पर मॉडल डाउनलोड का शुल्क लग सकता है।

कितने टेक्स्ट का विश्लेषण हो सकता है?

आप सामान्य लंबाई का अंश चिपका सकते हैं, लेकिन मॉडल की इनपुट सीमा में रहने और ब्राउज़र में अनुमान को स्थिर रखने के लिए पहचानकर्ता सिर्फ पहले 400 वर्णों का विश्लेषण करता है। कम से कम चार अक्षर या अंक जरूरी हैं। उपयोगी नतीजे के लिए कम से कम एक स्वाभाविक वाक्य दें; अनुच्छेद से मॉडल को फर्क बताने वाले अधिक पैटर्न मिलते हैं।

यह टूल किन भाषाओं की पहचान कर सकता है?

मॉडल में 20 लेबल हैं: अरबी, बल्गेरियाई, चीनी, डच, अंग्रेजी, फ्रेंच, जर्मन, ग्रीक, हिंदी, इतालवी, जापानी, पोलिश, पुर्तगाली, रूसी, स्पेनिश, स्वाहिली, थाई, तुर्की, उर्दू और वियतनामी। यह इस बंद समूह से बाहर की भाषाओं को भरोसेमंद तरीके से नहीं पहचानता।

पहला डाउनलोड करीब 296 MB का क्यों है?

पहचानकर्ता छोटी वर्ण-आवृत्ति तालिका की जगह बहुभाषी XLM-R न्यूरल मॉडल इस्तेमाल करता है। इसके क्वांटाइज किए गए ONNX वेट करीब 279 MB और टोकनाइज़र करीब 17 MB का है। ब्राउज़र आम तौर पर दोनों को कैश करता है, हालांकि कैश हटने, निजी ब्राउज़िंग या साइट डेटा साफ होने पर फिर से डाउनलोड करना पड़ सकता है।

क्या WebGPU के बिना भाषा पहचान चलती है?

हां। ब्राउज़र में WebGPU उपलब्ध होने पर वर्कर उसे प्राथमिकता देता है। WebGPU न मिलने या मॉडल शुरू न होने पर टूल WebAssembly CPU बैकएंड के साथ फिर कोशिश करता है। टेक्स्ट डिवाइस पर ही रहता है, लेकिन फोन या पुराने कंप्यूटर पर लोडिंग और पहचान में ज्यादा समय लग सकता है।

विश्वास स्कोर का क्या अर्थ है?

स्कोर इस नमूने के लिए मॉडल के 20 संभावित लेबलों को क्रम देते हैं। वे उम्मीदवारों की तुलना के लिए उपयोगी हैं, लेकिन सही होने की गारंटी, स्वतंत्र संभावना या वास्तविक भाषा के समर्थित होने का प्रमाण नहीं हैं। ऊपर के स्कोर पास हों तो और स्वाभाविक टेक्स्ट जोड़ें।

क्या यह मिली-जुली या लिप्यंतरित भाषा पहचान सकता है?

टूल हर वाक्य या शब्द के लिए अलग लेबल नहीं देता, बल्कि एक मुख्य मिलान और कुछ विकल्प लौटाता है। मिली-जुली भाषा में स्कोर पास आ सकते हैं। अनौपचारिक लिप्यंतरण, नाम, इमोजी, URL और सोर्स कोड भी लिपि और वर्तनी के कई संकेत हटा देते हैं, इसलिए ऐसे नतीजों की सावधानी से मानवीय समीक्षा करें।