এই টুল রেকর্ড করা কথা কোনো ট্রান্সক্রিপশন সার্ভিসে না পাঠিয়ে টেক্সটে বদলে দেয়। Whisper মডেলটি ব্রাউজারের একটি worker-এ চলে, তাই কম্পিউটার ইনফারেন্স চালানোর সময়ও পেজটি ব্যবহার করা যায়। WebGPU থাকলে সেটি ব্যবহার হয়; অন্য ব্রাউজার ধীর CPU মোডে চলে। ডাউনলোড করা মডেলটি পরেরবারের জন্য ব্রাউজারের cache-এ থাকে।
অডিও থেকে টেক্সট কনভার্টার
পুরোটাই আপনার ব্রাউজারে চলে - কিছু আপলোড নেই, সাইন-আপ নেই।
ব্যক্তিগতভাবে অডিও থেকে টেক্সট কনভার্ট করব কীভাবে?
একটি অডিও ফাইল যোগ করুন। এই অডিও থেকে টেক্সট কনভার্টার আপনার ডিভাইসে Whisper স্পিচ রিকগনিশন মডেল চালিয়ে সম্পাদনা করা যায় এমন ট্রান্সক্রিপ্ট তৈরি করবে, যা TXT বা SRT হিসেবে এক্সপোর্ট করা যায়। রেকর্ডিং আপলোড হয় না, তবে প্রথমবার ব্যবহারের সময় ব্রাউজারকে AI মডেলটি ডাউনলোড করতে হবে।
যেভাবে ব্যবহার করবেন
- 1রেকর্ডিং বেছে নিন. টুলের ওপর MP3, WAV, M4A, OGG, FLAC বা WebM ফাইল ছেড়ে দিন, অথবা ফাইল বেছে নিতে upload area-তে ক্লিক করুন।
- 2ব্যক্তিগত ট্রান্সক্রিপশন চালান. অডিও ট্রান্সক্রাইব করুন বাটনে ক্লিক করুন। প্রথমবার multilingual Whisper মডেলটি ডাউনলোড হওয়া পর্যন্ত অপেক্ষা করুন, তারপর আপনার ডিভাইসকে রেকর্ডিংটি প্রসেস করতে দিন।
- 3যাচাই করে এক্সপোর্ট করুন. সন্দেহজনক অংশগুলো আবার শুনুন, ভুল ঠিক করুন, তারপর ট্রান্সক্রিপ্ট কপি করুন অথবা TXT বা সময়সহ SRT হিসেবে ডাউনলোড করুন।
কাদের জন্য
- সাক্ষাৎকার গ্রহণকারী ও গবেষক যারা নাম ও উদ্ধৃতি রেকর্ডিংয়ের সঙ্গে মিলিয়ে দেখার আগে ব্যক্তিগতভাবে প্রথম খসড়া তৈরি করেন।
- শিক্ষার্থী যারা ক্লাসের অডিও আপলোড না করে রেকর্ড করা লেকচার বা স্টাডি নোট সম্পাদনাযোগ্য টেক্সটে বদলান।
- পডকাস্টার ও ভিডিও নির্মাতা যারা মোটামুটি একটি ট্রান্সক্রিপ্ট বা সাবটাইটেলের জন্য সময়সহ SRT ফাইল তৈরি করেন।
- সংবেদনশীল রেকর্ডিং নিয়ে কাজ করা দল যারা মূল অডিও cloud transcription queue-তে না পাঠিয়ে ডিভাইসেই রাখেন।
সাধারণ প্রশ্ন
আমার অডিও কি কোনো সার্ভারে আপলোড হয়?
না। ব্রাউজার আপনার বেছে নেওয়া ফাইল ডিকোড করে এবং অডিও sample শুধু একই ডিভাইসের একটি local worker-এ পাঠায়। worker Hugging Face থেকে Whisper মডেলের ফাইল ডাউনলোড করে, কিন্তু আপনার রেকর্ডিং বা ট্রান্সক্রিপ্ট আপলোড করে না। CanDoYa ফাইলটি পায় না বা সংরক্ষণ করে না।
অডিও থেকে টেক্সট কনভার্টারটি কি বিনামূল্যে?
হ্যাঁ। কোনো account, payment, transcription credit বা watermark নেই। AI inference আপনার নিজের ডিভাইস চালায়, তাই ব্যবহারিক খরচ হলো প্রসেসিংয়ের সময়, memory এবং প্রথমবার মডেল ডাউনলোড। আপনার internet provider মডেল ডাউনলোডকে metered data allowance-এর মধ্যে ধরতে পারে।
কত বড় ফাইল ও কত লম্বা রেকর্ডিং ট্রান্সক্রাইব করা যায়?
Upload control সর্বোচ্চ ৫০০ MB ফাইল নেয়। মিনিটের কোনো নির্দিষ্ট quota নেই, তবে inference আপনার ডিভাইসে হওয়ায় লম্বা রেকর্ডিংয়ে বেশি memory ও সময় লাগে। এক ঘণ্টার meeting বা lecture-এর জন্য ফোনের চেয়ে আধুনিক laptop ভালো।
কোন কোন অডিও ফরম্যাট চলে?
টুলটি MP3, WAV, M4A, OGG, FLAC, WebM এবং আরও কিছু কাছাকাছি ফরম্যাট নেয়। আসল decoding support আপনার browser ও operating system-এর ওপর নির্ভর করে। তালিকায় extension থাকার পরেও ফাইল rejected হলে সেটি MP3 বা uncompressed WAV-এ convert করে আবার চেষ্টা করুন।
Whisper কোন কোন ভাষা ট্রান্সক্রাইব করতে পারে?
বেছে নেওয়া Whisper tiny মডেলটি multilingual এবং বাংলা সহ অনেক কথ্য ভাষা নিজে থেকেই শনাক্ত করে। ভাষা, উচ্চারণ, রেকর্ডিংয়ের মান ও বিষয় অনুযায়ী নির্ভুলতা বদলায়। এটি ট্রান্সক্রিপ্ট অন্য ভাষায় অনুবাদ করে না, বক্তা চিহ্নিত করে না, আর নাম ও বিশেষায়িত শব্দের সঠিক বানান নিশ্চিত করে না।
প্রথম ট্রান্সক্রিপশনে মডেল ডাউনলোড হয় কেন?
ডিভাইসে ব্যক্তিগত ট্রান্সক্রিপশন চালাতে speech recognition model আপনার কম্পিউটারে থাকা দরকার। WebGPU পথে প্রায় ৮০ MB ডাউনলোড হয়, আর compatible quantized CPU fallback-এ প্রায় ১০৫ MB লাগে। ব্রাউজার সাধারণত ফাইলগুলো cache করে রাখে, তাই site data বা cache মুছে না ফেললে পরে আবার ব্যবহার করা যায়।
WebGPU ছাড়া কি অডিও ট্রান্সক্রিপশন চলে?
হ্যাঁ। Supported graphics processor-এ Whisper অনেক দ্রুত চলতে পারে বলে টুলটি WebGPU-কে অগ্রাধিকার দেয়। WebGPU না থাকলে বা ব্যর্থ হলে CPU-তে WebAssembly দিয়ে আবার চেষ্টা করে। এই fallback বেশি browser-এ চলে, তবে লম্বা recording, বিশেষ করে phone ও পুরোনো computer-এ ধীর হতে পারে।
ট্রান্সক্রিপ্ট কতটা নির্ভুল?
পরিষ্কার কথার ক্ষেত্রে Whisper tiny কাজের একটি খসড়া দেয়, তবে প্রতিটি শব্দ হুবহু থাকবে এমন নিশ্চয়তা নেই। পেছনের শব্দ, গান, একই সঙ্গে কথা বলা, দুর্বল microphone, অপরিচিত নাম ও দীর্ঘ নীরবতা নির্ভুলতা কমায় এবং এমন শব্দ তৈরি করতে পারে যা বলা হয়নি। গুরুত্বপূর্ণ উদ্ধৃতি, চিকিৎসার তথ্য, আইনি বক্তব্য ও সিদ্ধান্ত মূল অডিওর সঙ্গে মিলিয়ে দেখুন।