CanDoYa
TR

Sesi yazıya çevirme aracı

Tümüyle tarayıcınızda çalışır - yükleme yok, üyelik yok.

Cihazınızda gizli bir transkript oluşturmak için ses dosyası ekleyin.

Bu aracı paylaş

Sesi gizli şekilde yazıya nasıl çevirebilirim?

Bir ses dosyası ekleyin. Bu araç Whisper konuşma tanıma modelini cihazınızda çalıştırır ve TXT veya SRT olarak dışa aktarabileceğiniz düzenlenebilir bir metin oluşturur. Kayıt hiçbir zaman yüklenmez, ancak ilk kullanımda tarayıcının AI modelini indirmesi gerekir.

Nasıl kullanılır

  1. 1Kaydı seçin. MP3, WAV, M4A, OGG, FLAC veya WebM dosyasını araca bırakın ya da yükleme alanına tıklayarak seçin.
  2. 2Gizli transkripsiyonu başlatın. Sesi yazıya çevir düğmesine tıklayın. İlk çalıştırmada çok dilli Whisper modeli indirilirken bekleyin, ardından kaydın cihazınızda işlenmesine izin verin.
  3. 3Kontrol edip dışa aktarın. Belirsiz bölümleri yeniden dinleyin, hataları düzeltin ve metni kopyalayın ya da TXT veya zaman kodlu SRT olarak indirin.

Kimler için

Bu araç, kaydı bir transkripsiyon hizmetine göndermeden konuşmayı metne dönüştürür. Whisper modeli tarayıcıdaki bir worker içinde çalışır, böylece bilgisayar çıkarım yaparken sayfa yanıt vermeye devam eder. Uygun olduğunda WebGPU kullanılır; diğer tarayıcılarda daha yavaş CPU moduna geçilir. İndirilen model sonraki ziyaretler için tarayıcı önbelleğinde tutulur.

Sık sorulan sorular

Ses kaydım bir sunucuya yükleniyor mu?

Hayır. Tarayıcı seçtiğiniz dosyayı çözer ve ses örneklerini yalnızca aynı cihazdaki yerel bir worker'a gönderir. Worker, Whisper model dosyalarını Hugging Face üzerinden indirir fakat kaydı veya transkripti yüklemez. CanDoYa dosyayı almaz ve saklamaz.

Sesi yazıya çevirme aracı ücretsiz mi?

Evet. Hesap, ödeme, transkripsiyon kredisi veya filigran yoktur. AI çıkarımını kendi cihazınız yaptığı için pratik karşılığı işlem süresi, bellek ve ilk model indirmesidir. İnternet sağlayıcınız bu indirmeyi kotalı veri kullanımına dahil edebilir.

Hangi dosya boyutunu ve kayıt uzunluğunu yazıya çevirebilirim?

Yükleme alanı 500 MB'a kadar dosyaları kabul eder. Sabit bir dakika kotası yoktur, ancak işlem cihazda yapıldığı için uzun kayıtlar daha fazla bellek ve zaman ister. Bir saatlik toplantı veya derslerde telefon yerine güncel bir dizüstü bilgisayar kullanmak daha uygundur.

Hangi ses biçimleri destekleniyor?

Araç MP3, WAV, M4A, OGG, FLAC, WebM ve bazı benzer biçimleri kabul eder. Gerçek çözme desteği tarayıcıya ve işletim sistemine bağlıdır. Uzantısı listede olduğu halde dosya reddediliyorsa MP3'e veya sıkıştırılmamış WAV'a dönüştürüp yeniden deneyin.

Whisper hangi dilleri yazıya çevirebilir?

Seçilen Whisper tiny modeli çok dillidir ve konuşulan birçok dili otomatik algılar. Doğruluk dile, aksana, kayıt kalitesine ve konuya göre değişir. Transkripti başka bir dile çevirmez, konuşmacıları ayırmaz ve adlar ile uzmanlık terimlerinin doğru yazılacağını garanti etmez.

İlk transkripsiyonda neden model indiriliyor?

Cihazda gizli transkripsiyon için konuşma tanıma modelinin bilgisayarınızda bulunması gerekir. WebGPU yolu yaklaşık 80 MB, sıkıştırılmış CPU alternatifi ise yaklaşık 105 MB indirir. Site verilerini veya önbelleği temizlemediğiniz sürece tarayıcı bu dosyaları genellikle saklar ve yeniden kullanır.

WebGPU olmadan ses transkripsiyonu çalışır mı?

Evet. Desteklenen bir grafik işlemci Whisper'ı çok daha hızlı çalıştırabildiği için araç önce WebGPU'yu dener. WebGPU yoksa veya başarısız olursa CPU üzerinde WebAssembly ile yeniden dener. Bu seçenek daha fazla tarayıcıda çalışır, fakat özellikle telefonlarda ve eski bilgisayarlarda uzun kayıtlar için yavaş olabilir.

Transkript ne kadar doğru?

Whisper tiny temiz konuşmalarda işe yarar bir taslak verir, fakat kelimesi kelimesine doğruluk garantisi yoktur. Arka plan gürültüsü, müzik, üst üste konuşma, zayıf mikrofonlar, az rastlanan adlar ve uzun sessizlikler doğruluğu düşürür ve modelin söylenmemiş kelimeler üretmesine yol açabilir. Önemli alıntıları, tıbbi ayrıntıları, hukuki ifadeleri ve kararları özgün kayıtla karşılaştırın.