Bu araç, kaydı bir transkripsiyon hizmetine göndermeden konuşmayı metne dönüştürür. Whisper modeli tarayıcıdaki bir worker içinde çalışır, böylece bilgisayar çıkarım yaparken sayfa yanıt vermeye devam eder. Uygun olduğunda WebGPU kullanılır; diğer tarayıcılarda daha yavaş CPU moduna geçilir. İndirilen model sonraki ziyaretler için tarayıcı önbelleğinde tutulur.
Sesi yazıya çevirme aracı
Tümüyle tarayıcınızda çalışır - yükleme yok, üyelik yok.
Sesi gizli şekilde yazıya nasıl çevirebilirim?
Bir ses dosyası ekleyin. Bu araç Whisper konuşma tanıma modelini cihazınızda çalıştırır ve TXT veya SRT olarak dışa aktarabileceğiniz düzenlenebilir bir metin oluşturur. Kayıt hiçbir zaman yüklenmez, ancak ilk kullanımda tarayıcının AI modelini indirmesi gerekir.
Nasıl kullanılır
- 1Kaydı seçin. MP3, WAV, M4A, OGG, FLAC veya WebM dosyasını araca bırakın ya da yükleme alanına tıklayarak seçin.
- 2Gizli transkripsiyonu başlatın. Sesi yazıya çevir düğmesine tıklayın. İlk çalıştırmada çok dilli Whisper modeli indirilirken bekleyin, ardından kaydın cihazınızda işlenmesine izin verin.
- 3Kontrol edip dışa aktarın. Belirsiz bölümleri yeniden dinleyin, hataları düzeltin ve metni kopyalayın ya da TXT veya zaman kodlu SRT olarak indirin.
Kimler için
- Röportaj yapanlar ve araştırmacılar, adları ve alıntıları kayıtla karşılaştırmadan önce gizli bir ilk taslak hazırlayabilir.
- Öğrenciler, ders kayıtlarını veya sesli notları sınıf sesini yüklemeden düzenlenebilir metne çevirebilir.
- Podcast ve video üreticileri, kaba bir transkript ya da altyazılar için zaman kodlu SRT dosyası oluşturabilir.
- Hassas kayıtlarla çalışan ekipler, kaynak sesi bulut transkripsiyon kuyruğuna göndermek yerine cihazda tutabilir.
Sık sorulan sorular
Ses kaydım bir sunucuya yükleniyor mu?
Hayır. Tarayıcı seçtiğiniz dosyayı çözer ve ses örneklerini yalnızca aynı cihazdaki yerel bir worker'a gönderir. Worker, Whisper model dosyalarını Hugging Face üzerinden indirir fakat kaydı veya transkripti yüklemez. CanDoYa dosyayı almaz ve saklamaz.
Sesi yazıya çevirme aracı ücretsiz mi?
Evet. Hesap, ödeme, transkripsiyon kredisi veya filigran yoktur. AI çıkarımını kendi cihazınız yaptığı için pratik karşılığı işlem süresi, bellek ve ilk model indirmesidir. İnternet sağlayıcınız bu indirmeyi kotalı veri kullanımına dahil edebilir.
Hangi dosya boyutunu ve kayıt uzunluğunu yazıya çevirebilirim?
Yükleme alanı 500 MB'a kadar dosyaları kabul eder. Sabit bir dakika kotası yoktur, ancak işlem cihazda yapıldığı için uzun kayıtlar daha fazla bellek ve zaman ister. Bir saatlik toplantı veya derslerde telefon yerine güncel bir dizüstü bilgisayar kullanmak daha uygundur.
Hangi ses biçimleri destekleniyor?
Araç MP3, WAV, M4A, OGG, FLAC, WebM ve bazı benzer biçimleri kabul eder. Gerçek çözme desteği tarayıcıya ve işletim sistemine bağlıdır. Uzantısı listede olduğu halde dosya reddediliyorsa MP3'e veya sıkıştırılmamış WAV'a dönüştürüp yeniden deneyin.
Whisper hangi dilleri yazıya çevirebilir?
Seçilen Whisper tiny modeli çok dillidir ve konuşulan birçok dili otomatik algılar. Doğruluk dile, aksana, kayıt kalitesine ve konuya göre değişir. Transkripti başka bir dile çevirmez, konuşmacıları ayırmaz ve adlar ile uzmanlık terimlerinin doğru yazılacağını garanti etmez.
İlk transkripsiyonda neden model indiriliyor?
Cihazda gizli transkripsiyon için konuşma tanıma modelinin bilgisayarınızda bulunması gerekir. WebGPU yolu yaklaşık 80 MB, sıkıştırılmış CPU alternatifi ise yaklaşık 105 MB indirir. Site verilerini veya önbelleği temizlemediğiniz sürece tarayıcı bu dosyaları genellikle saklar ve yeniden kullanır.
WebGPU olmadan ses transkripsiyonu çalışır mı?
Evet. Desteklenen bir grafik işlemci Whisper'ı çok daha hızlı çalıştırabildiği için araç önce WebGPU'yu dener. WebGPU yoksa veya başarısız olursa CPU üzerinde WebAssembly ile yeniden dener. Bu seçenek daha fazla tarayıcıda çalışır, fakat özellikle telefonlarda ve eski bilgisayarlarda uzun kayıtlar için yavaş olabilir.
Transkript ne kadar doğru?
Whisper tiny temiz konuşmalarda işe yarar bir taslak verir, fakat kelimesi kelimesine doğruluk garantisi yoktur. Arka plan gürültüsü, müzik, üst üste konuşma, zayıf mikrofonlar, az rastlanan adlar ve uzun sessizlikler doğruluğu düşürür ve modelin söylenmemiş kelimeler üretmesine yol açabilir. Önemli alıntıları, tıbbi ayrıntıları, hukuki ifadeleri ve kararları özgün kayıtla karşılaştırın.