यह टूल रिकॉर्ड की गई आवाज़ को किसी ट्रांसक्रिप्शन सेवा पर भेजे बिना टेक्स्ट में बदलता है। Whisper मॉडल ब्राउज़र के अलग बैकग्राउंड प्रोसेस में चलता है, इसलिए कंप्यूटर पर प्रोसेसिंग के दौरान पेज काम करता रहता है। उपलब्ध होने पर WebGPU इस्तेमाल होता है, जबकि दूसरे ब्राउज़र धीमे CPU मोड पर चले जाते हैं। डाउनलोड किया हुआ मॉडल अगली बार के लिए ब्राउज़र कैश में रहता है।
ऑडियो को टेक्स्ट में बदलने का टूल
पूरी तरह आपके ब्राउज़र में चलता है - न कुछ अपलोड, न साइन-अप।
ऑडियो को निजी तरीके से टेक्स्ट में कैसे बदलें?
ऑडियो फ़ाइल जोड़ें और यह टूल आपके डिवाइस पर Whisper स्पीच रिकग्निशन मॉडल चलाएगा। मिला हुआ ट्रांसक्रिप्ट संपादित किया जा सकता है और TXT या SRT में डाउनलोड हो जाता है। रिकॉर्डिंग कभी अपलोड नहीं होती, हालांकि पहली बार ब्राउज़र को AI मॉडल डाउनलोड करना पड़ता है।
कैसे इस्तेमाल करें
- 1रिकॉर्डिंग चुनें. MP3, WAV, M4A, OGG, FLAC या WebM फ़ाइल को टूल पर छोड़ें, या अपलोड वाले हिस्से पर क्लिक करके फ़ाइल चुनें।
- 2निजी ट्रांसक्रिप्शन चलाएँ. ऑडियो ट्रांसक्राइब करें पर क्लिक करें। पहली बार बहुभाषी Whisper मॉडल डाउनलोड होने तक रुकें, फिर इसे डिवाइस पर रिकॉर्डिंग प्रोसेस करने दें।
- 3जाँचें और डाउनलोड करें. जिन हिस्सों पर संदेह हो उन्हें फिर सुनें, गलतियाँ सुधारें, फिर ट्रांसक्रिप्ट कॉपी करें या TXT अथवा टाइमस्टैम्प वाली SRT फ़ाइल डाउनलोड करें।
किसके लिए है
- इंटरव्यू लेने वाले और शोधकर्ता नामों और उद्धरणों को रिकॉर्डिंग से मिलाने से पहले एक निजी शुरुआती ड्राफ़्ट बना सकते हैं।
- विद्यार्थी कक्षा की ऑडियो फ़ाइल अपलोड किए बिना रिकॉर्ड किए गए लेक्चर या पढ़ाई के नोट्स को संपादन योग्य टेक्स्ट में बदल सकते हैं।
- पॉडकास्टर और वीडियो क्रिएटर कैप्शन के लिए शुरुआती ट्रांसक्रिप्ट या टाइमस्टैम्प वाली SRT फ़ाइल तैयार कर सकते हैं।
- संवेदनशील रिकॉर्डिंग पर काम करने वाली टीमें स्रोत ऑडियो को क्लाउड ट्रांसक्रिप्शन कतार में भेजने के बजाय अपने डिवाइस पर रख सकती हैं।
अक्सर पूछे जाने वाले सवाल
क्या मेरी ऑडियो फ़ाइल किसी सर्वर पर अपलोड होती है?
नहीं। ब्राउज़र चुनी हुई फ़ाइल को डिकोड करता है और ऑडियो सैंपल सिर्फ़ उसी डिवाइस पर चल रहे बैकग्राउंड प्रोसेस को देता है। यह प्रोसेस Hugging Face से Whisper मॉडल की फ़ाइलें डाउनलोड करता है, लेकिन रिकॉर्डिंग या ट्रांसक्रिप्ट अपलोड नहीं करता। CanDoYa आपकी फ़ाइल न लेता है, न सहेजता है।
क्या ऑडियो से टेक्स्ट टूल मुफ़्त है?
हाँ। अकाउंट, भुगतान, ट्रांसक्रिप्शन क्रेडिट या वॉटरमार्क नहीं है। AI की गणना आपका अपना डिवाइस करता है, इसलिए असली खर्च प्रोसेसिंग का समय, मेमोरी और पहली बार मॉडल डाउनलोड करना है। मीटर्ड कनेक्शन पर इंटरनेट प्रदाता इस डाउनलोड का डेटा गिन सकता है।
कितनी बड़ी और कितनी लंबी रिकॉर्डिंग ट्रांसक्राइब हो सकती है?
अपलोड कंट्रोल 500 MB तक की फ़ाइल लेता है। मिनटों की कोई तय सीमा नहीं है, पर लंबी रिकॉर्डिंग को ज़्यादा मेमोरी और समय चाहिए क्योंकि प्रोसेसिंग आपके डिवाइस पर होती है। एक घंटे की मीटिंग या लेक्चर के लिए फ़ोन से बेहतर नया लैपटॉप रहेगा।
कौन से ऑडियो फ़ॉर्मैट चलते हैं?
टूल MP3, WAV, M4A, OGG, FLAC, WebM और कुछ मिलते-जुलते फ़ॉर्मैट लेता है। फ़ाइल वास्तव में डिकोड होगी या नहीं, यह ब्राउज़र और ऑपरेटिंग सिस्टम पर निर्भर है। सूची में एक्सटेंशन होने के बाद भी फ़ाइल न खुले, तो उसे MP3 या बिना कंप्रेशन वाली WAV में बदलकर दोबारा कोशिश करें।
Whisper किन भाषाओं को ट्रांसक्राइब कर सकता है?
चुना गया Whisper tiny मॉडल बहुभाषी है और कई बोली जाने वाली भाषाएँ अपने आप पहचानता है। सटीकता भाषा, लहजे, रिकॉर्डिंग की गुणवत्ता और विषय के अनुसार बदलती है। यह ट्रांसक्रिप्ट का दूसरी भाषा में अनुवाद नहीं करता, वक्ताओं को अलग नहीं पहचानता और नामों या विशेष शब्दों की सही वर्तनी की गारंटी नहीं देता।
पहले ट्रांसक्रिप्शन पर मॉडल क्यों डाउनलोड होता है?
डिवाइस पर निजी ट्रांसक्रिप्शन के लिए स्पीच रिकग्निशन मॉडल कंप्यूटर पर होना चाहिए। WebGPU वाला तरीका करीब 80 MB डाउनलोड करता है, जबकि CPU विकल्प करीब 105 MB लेता है। ब्राउज़र आम तौर पर इन फ़ाइलों को कैश कर लेता है, इसलिए साइट डेटा या कैश साफ़ होने तक अगली बार इन्हें फिर से इस्तेमाल किया जा सकता है।
क्या WebGPU के बिना ऑडियो ट्रांसक्रिप्शन चलेगा?
हाँ। टूल पहले WebGPU चुनता है क्योंकि समर्थित ग्राफ़िक्स प्रोसेसर Whisper को बहुत तेज़ चला सकता है। WebGPU न मिले या विफल हो जाए तो यह CPU पर WebAssembly के साथ फिर कोशिश करता है। यह विकल्प अधिक ब्राउज़र में चलता है, मगर लंबी रिकॉर्डिंग पर धीमा हो सकता है, खासकर फ़ोन और पुराने कंप्यूटर पर।
ट्रांसक्रिप्ट कितना सही होगा?
साफ़ आवाज़ से Whisper tiny उपयोगी ड्राफ़्ट देता है, लेकिन हर शब्द सही होने की गारंटी नहीं है। पीछे का शोर, संगीत, एक साथ बातचीत, कमज़ोर माइक्रोफ़ोन, अनजाने नाम और लंबा मौन सटीकता घटाते हैं और न बोले गए शब्द जोड़ सकते हैं। अहम उद्धरण, चिकित्सा विवरण, कानूनी बयान और फ़ैसले मूल ऑडियो से ज़रूर मिलाएँ।