CanDoYa
HI

ऑडियो को टेक्स्ट में बदलने का टूल

पूरी तरह आपके ब्राउज़र में चलता है - न कुछ अपलोड, न साइन-अप।

डिवाइस पर निजी ट्रांसक्रिप्ट बनाने के लिए ऑडियो फ़ाइल जोड़ें।

यह टूल शेयर करें

ऑडियो को निजी तरीके से टेक्स्ट में कैसे बदलें?

ऑडियो फ़ाइल जोड़ें और यह टूल आपके डिवाइस पर Whisper स्पीच रिकग्निशन मॉडल चलाएगा। मिला हुआ ट्रांसक्रिप्ट संपादित किया जा सकता है और TXT या SRT में डाउनलोड हो जाता है। रिकॉर्डिंग कभी अपलोड नहीं होती, हालांकि पहली बार ब्राउज़र को AI मॉडल डाउनलोड करना पड़ता है।

कैसे इस्तेमाल करें

  1. 1रिकॉर्डिंग चुनें. MP3, WAV, M4A, OGG, FLAC या WebM फ़ाइल को टूल पर छोड़ें, या अपलोड वाले हिस्से पर क्लिक करके फ़ाइल चुनें।
  2. 2निजी ट्रांसक्रिप्शन चलाएँ. ऑडियो ट्रांसक्राइब करें पर क्लिक करें। पहली बार बहुभाषी Whisper मॉडल डाउनलोड होने तक रुकें, फिर इसे डिवाइस पर रिकॉर्डिंग प्रोसेस करने दें।
  3. 3जाँचें और डाउनलोड करें. जिन हिस्सों पर संदेह हो उन्हें फिर सुनें, गलतियाँ सुधारें, फिर ट्रांसक्रिप्ट कॉपी करें या TXT अथवा टाइमस्टैम्प वाली SRT फ़ाइल डाउनलोड करें।

किसके लिए है

यह टूल रिकॉर्ड की गई आवाज़ को किसी ट्रांसक्रिप्शन सेवा पर भेजे बिना टेक्स्ट में बदलता है। Whisper मॉडल ब्राउज़र के अलग बैकग्राउंड प्रोसेस में चलता है, इसलिए कंप्यूटर पर प्रोसेसिंग के दौरान पेज काम करता रहता है। उपलब्ध होने पर WebGPU इस्तेमाल होता है, जबकि दूसरे ब्राउज़र धीमे CPU मोड पर चले जाते हैं। डाउनलोड किया हुआ मॉडल अगली बार के लिए ब्राउज़र कैश में रहता है।

अक्सर पूछे जाने वाले सवाल

क्या मेरी ऑडियो फ़ाइल किसी सर्वर पर अपलोड होती है?

नहीं। ब्राउज़र चुनी हुई फ़ाइल को डिकोड करता है और ऑडियो सैंपल सिर्फ़ उसी डिवाइस पर चल रहे बैकग्राउंड प्रोसेस को देता है। यह प्रोसेस Hugging Face से Whisper मॉडल की फ़ाइलें डाउनलोड करता है, लेकिन रिकॉर्डिंग या ट्रांसक्रिप्ट अपलोड नहीं करता। CanDoYa आपकी फ़ाइल न लेता है, न सहेजता है।

क्या ऑडियो से टेक्स्ट टूल मुफ़्त है?

हाँ। अकाउंट, भुगतान, ट्रांसक्रिप्शन क्रेडिट या वॉटरमार्क नहीं है। AI की गणना आपका अपना डिवाइस करता है, इसलिए असली खर्च प्रोसेसिंग का समय, मेमोरी और पहली बार मॉडल डाउनलोड करना है। मीटर्ड कनेक्शन पर इंटरनेट प्रदाता इस डाउनलोड का डेटा गिन सकता है।

कितनी बड़ी और कितनी लंबी रिकॉर्डिंग ट्रांसक्राइब हो सकती है?

अपलोड कंट्रोल 500 MB तक की फ़ाइल लेता है। मिनटों की कोई तय सीमा नहीं है, पर लंबी रिकॉर्डिंग को ज़्यादा मेमोरी और समय चाहिए क्योंकि प्रोसेसिंग आपके डिवाइस पर होती है। एक घंटे की मीटिंग या लेक्चर के लिए फ़ोन से बेहतर नया लैपटॉप रहेगा।

कौन से ऑडियो फ़ॉर्मैट चलते हैं?

टूल MP3, WAV, M4A, OGG, FLAC, WebM और कुछ मिलते-जुलते फ़ॉर्मैट लेता है। फ़ाइल वास्तव में डिकोड होगी या नहीं, यह ब्राउज़र और ऑपरेटिंग सिस्टम पर निर्भर है। सूची में एक्सटेंशन होने के बाद भी फ़ाइल न खुले, तो उसे MP3 या बिना कंप्रेशन वाली WAV में बदलकर दोबारा कोशिश करें।

Whisper किन भाषाओं को ट्रांसक्राइब कर सकता है?

चुना गया Whisper tiny मॉडल बहुभाषी है और कई बोली जाने वाली भाषाएँ अपने आप पहचानता है। सटीकता भाषा, लहजे, रिकॉर्डिंग की गुणवत्ता और विषय के अनुसार बदलती है। यह ट्रांसक्रिप्ट का दूसरी भाषा में अनुवाद नहीं करता, वक्ताओं को अलग नहीं पहचानता और नामों या विशेष शब्दों की सही वर्तनी की गारंटी नहीं देता।

पहले ट्रांसक्रिप्शन पर मॉडल क्यों डाउनलोड होता है?

डिवाइस पर निजी ट्रांसक्रिप्शन के लिए स्पीच रिकग्निशन मॉडल कंप्यूटर पर होना चाहिए। WebGPU वाला तरीका करीब 80 MB डाउनलोड करता है, जबकि CPU विकल्प करीब 105 MB लेता है। ब्राउज़र आम तौर पर इन फ़ाइलों को कैश कर लेता है, इसलिए साइट डेटा या कैश साफ़ होने तक अगली बार इन्हें फिर से इस्तेमाल किया जा सकता है।

क्या WebGPU के बिना ऑडियो ट्रांसक्रिप्शन चलेगा?

हाँ। टूल पहले WebGPU चुनता है क्योंकि समर्थित ग्राफ़िक्स प्रोसेसर Whisper को बहुत तेज़ चला सकता है। WebGPU न मिले या विफल हो जाए तो यह CPU पर WebAssembly के साथ फिर कोशिश करता है। यह विकल्प अधिक ब्राउज़र में चलता है, मगर लंबी रिकॉर्डिंग पर धीमा हो सकता है, खासकर फ़ोन और पुराने कंप्यूटर पर।

ट्रांसक्रिप्ट कितना सही होगा?

साफ़ आवाज़ से Whisper tiny उपयोगी ड्राफ़्ट देता है, लेकिन हर शब्द सही होने की गारंटी नहीं है। पीछे का शोर, संगीत, एक साथ बातचीत, कमज़ोर माइक्रोफ़ोन, अनजाने नाम और लंबा मौन सटीकता घटाते हैं और न बोले गए शब्द जोड़ सकते हैं। अहम उद्धरण, चिकित्सा विवरण, कानूनी बयान और फ़ैसले मूल ऑडियो से ज़रूर मिलाएँ।