CanDoYa
HI

इमेज से टेक्स्ट कन्वर्टर

पूरी तरह आपके ब्राउज़र में चलता है - न कुछ अपलोड, न साइन-अप।

शुरू करने के लिए साफ प्रिंटेड टेक्स्ट वाली इमेज चुनें।

यह टूल शेयर करें

इमेज से टेक्स्ट कन्वर्टर कैसे काम करता है?

इमेज से टेक्स्ट कन्वर्टर ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) तकनीक का उपयोग कर फोटो या स्कैन में छपे अक्षरों को पहचानकर एडिटेबल टेक्स्ट देता है। यह टूल आपके ब्राउज़र में Tesseract WebAssembly चलाता है, जो उन भाषाओं को कवर करता है जो सभी 40 CanDoYa लोकैल्स में उपयोग होती हैं, और आप बिना इमेज अपलोड किए रिजल्ट कॉपी या डाउनलोड कर सकते हैं।

कैसे इस्तेमाल करें

  1. 1साफ इमेज चुनें. JPEG, PNG, WebP, BMP या non-animated GIF (अधिकतम 15 MB और 24 मेगापिक्सल) ड्रॉप करें या बिल्ट-इन उदाहरण लोड करें।
  2. 2टेक्स्ट की भाषा चुनें. इमेज में जो भाषा छपी है वही चुनें। चुनी गई Tesseract भाषा का डाटा एक्सट्रैक्शन शुरू करते समय डाउनलोड होगा।
  3. 3एक्सट्रैक्ट करें और जांचें. OCR चलाएं, नाम और नंबर स्रोत इमेज से मिलाएं, जरूरत हो तो सुधारें, फिर टेक्स्ट कॉपी करें या UTF-8 TXT फाइल डाउनलोड करें।

किसके लिए है

यह कन्वर्टर Tesseract.js 7 का उपयोग करता है, जो ओपन-सोर्स Tesseract OCR इंजन का ब्राउज़र पोर्ट है। कोड, WebAssembly कोर और चुनी गई भाषा का डाटा तभी लोड होता है जब आप एक्सट्रैक्शन शुरू करते हैं। Tesseract अपनी वर्कर प्रक्रिया में पहचान करता है, जिससे पेज चलते हुए भी आपके डिवाइस पर इमेज प्रोसेस होती है।

OCR की सटीकता मुख्य रूप से इमेज की क्वालिटी पर निर्भर करती है, फाइल फॉर्मेट पर नहीं। सीधे छपा टेक्स्ट, समान रोशनी, स्पष्ट फोकस, अच्छा कंट्रास्ट और पर्याप्त पिक्सल डिटेल मदद करते हैं। छोटे स्क्रीनशॉट को अपस्केल करने से रिजल्ट बेहतर हो सकता है, जबकि तिरछी इमेज, सजावटी फॉन्ट, कॉलम, हस्तलिखित नोट, चमक या धुंधली फोटो में मैन्युअल सुधार की जरूरत पड़ सकती है।

अक्सर पूछे जाने वाले सवाल

क्या मेरी इमेज सर्वर पर जाती है?

नहीं। चुनी गई फाइल आपके डिवाइस पर Tesseract की बैकग्राउंड प्रक्रिया द्वारा प्रोसेस होती है। ब्राउज़र केवल पब्लिक OCR रनटाइम और भाषा फाइल्स को बाहरी सर्वर से डाउनलोड करता है, इनमें आपकी इमेज शामिल नहीं होती। CanDoYa आपकी इमेज या निकाले गए टेक्स्ट को प्राप्त या स्टोर नहीं करता।

क्या यह इमेज से टेक्स्ट कन्वर्टर मुफ्त है?

हां। इसमें न अकाउंट, न पेमेंट, न वॉटरमार्क, न पेज क्रेडिट और न रिजल्ट डाउनलोड पर कोई शुल्क है। प्रोसेसिंग आपके डिवाइस पर होती है। OCR इंजन और भाषा डाटा का पहला डाउनलोड आपके इंटरनेट कनेक्शन से होता है, और बड़े भाषा मॉडल लिमिटेड डेटा पर फर्क डाल सकते हैं।

कौन से इमेज फॉर्मेट और लिमिट्स सपोर्टेड हैं?

आप एक JPEG, PNG, WebP, BMP या non-animated GIF (अधिकतम 15 MB और 24 मेगापिक्सल) प्रोसेस कर सकते हैं। ये लिमिट्स फोन और लैपटॉप पर मेमोरी फेलियर कम करती हैं। यह टूल सिर्फ इमेज के लिए है; पूरी PDF पेज के लिए स्कैन किए गए PDF OCR टूल का उपयोग करें।

OCR इमेज से टेक्स्ट कितनी सटीकता से निकालता है?

साफ छपा टेक्स्ट अच्छी तरह पहचाना जा सकता है, लेकिन कोई भी OCR रिजल्ट पूरी तरह गारंटीड नहीं होता। स्पष्ट फोकस, बड़े अक्षर, उच्च कंट्रास्ट, सीधी इमेज और सही भाषा चुनने से सटीकता बढ़ती है। हस्तलिखित, असामान्य फॉन्ट, चमक, धुंधलापन, टेबल, कॉलम या मिक्स रीडिंग डायरेक्शन में गड़बड़ी आ सकती है।

क्या यह हैंडराइटिंग भी निकाल सकता है?

बहुत साफ ब्लॉक अक्षरों वाली हैंडराइटिंग आंशिक रूप से निकाली जा सकती है, लेकिन यह टूल मुख्य रूप से प्रिंटेड टेक्स्ट के लिए है। कर्सिव या असमान अक्षर कम भरोसेमंद हैं। हैंडराइटिंग रिजल्ट को ड्राफ्ट मानें और हर जरूरी शब्द, तारीख और नंबर को इमेज से मिलाएं।

कौन सी भाषा चुननी चाहिए?

वह भाषा चुनें जिसमें इमेज में टेक्स्ट छपा है, न कि आपके ब्राउज़र की भाषा। सूची में सभी 40 CanDoYa लोकैल्स में उपयोग होने वाली भाषाएं शामिल हैं, जिनमें साधारण और पारंपरिक चीनी अलग-अलग हैं। अगर पेज में एक से अधिक भाषा है तो मुख्य भाषा चुनें; हर बार एक ही भाषा मॉडल चलता है।

पहली बार एक्सट्रैक्शन में ज्यादा समय क्यों लगता है?

ब्राउज़र को पहले Tesseract.js कोड, उपयुक्त WebAssembly कोर और चुनी गई भाषा का डाटा डाउनलोड करना पड़ता है। ब्राउज़र कैश से अगली बार तेज हो सकता है, लेकिन प्राइवेट मोड, स्टोरेज क्लीनअप, नई भाषा या कैश हटने पर फिर से डाउनलोड करना पड़ सकता है।

क्या निकाले गए टेक्स्ट को बिना जांचे इस्तेमाल कर सकते हैं?

पहले जरूर जांचें, खासकर नाम, कुल, तारीख, विराम चिह्न और O व 0 या l व 1 जैसे मिलते-जुलते अक्षर। दिखाया गया confidence सिर्फ एक अनुमान है। यह हर शब्द की गारंटी नहीं देता और न ही इमेज का असली लेआउट रखता है।