CanDoYa
PL

Konwerter audio na tekst

Działa w całości w przeglądarce - bez wysyłania plików i bez rejestracji.

Dodaj plik audio, aby utworzyć prywatną transkrypcję na urządzeniu.

Udostępnij to narzędzie

Jak zamienić audio na tekst bez wysyłania nagrania?

Dodaj plik audio, a konwerter uruchomi model rozpoznawania mowy Whisper bezpośrednio na urządzeniu. Otrzymasz edytowalną transkrypcję z możliwością eksportu do TXT i SRT. Nagranie nie jest wysyłane, ale przy pierwszym użyciu przeglądarka musi pobrać model AI.

Jak korzystać

  1. 1Wybierz nagranie. Przeciągnij plik MP3, WAV, M4A, OGG, FLAC lub WebM na narzędzie albo kliknij obszar wyboru pliku.
  2. 2Uruchom prywatną transkrypcję. Kliknij Transkrybuj audio. Przy pierwszym uruchomieniu poczekaj na pobranie wielojęzycznego modelu Whisper, a następnie pozwól urządzeniu przetworzyć nagranie.
  3. 3Sprawdź i wyeksportuj. Odsłuchaj niepewne fragmenty, popraw błędy, a następnie skopiuj transkrypcję lub pobierz ją jako TXT albo SRT ze znacznikami czasu.

Dla kogo

Narzędzie zamienia nagraną mowę na tekst bez przekazywania pliku do zewnętrznej usługi transkrypcji. Model Whisper działa w procesie roboczym przeglądarki, więc strona reaguje także wtedy, gdy komputer wykonuje obliczenia. Gdy jest dostępny WebGPU, narzędzie z niego korzysta; w pozostałych przeglądarkach przechodzi na wolniejszy tryb CPU. Pobrany model trafia do pamięci podręcznej przeglądarki i może być użyty ponownie.

Najczęstsze pytania

Czy moje audio jest wysyłane na serwer?

Nie. Przeglądarka dekoduje wybrany plik i przekazuje próbki dźwięku tylko do lokalnego procesu na tym samym urządzeniu. Proces pobiera pliki modelu Whisper z Hugging Face, ale nie wysyła nagrania ani transkrypcji. CanDoYa nie odbiera i nie przechowuje pliku.

Czy konwerter audio na tekst jest darmowy?

Tak. Nie wymaga konta, płatności ani limitu kredytów i nie dodaje znaku wodnego. Obliczenia AI wykonuje urządzenie, dlatego praktycznym kosztem są czas przetwarzania, pamięć oraz pierwsze pobranie modelu. Operator internetu może wliczyć pobranie modelu do limitu danych.

Jak duży i długi plik mogę transkrybować?

Można wybrać plik do 500 MB. Nie ma stałego limitu minut, lecz długie nagrania potrzebują więcej pamięci i czasu, ponieważ obliczenia odbywają się na urządzeniu. Do godzinnego spotkania lub wykładu lepiej użyć współczesnego laptopa niż telefonu.

Jakie formaty audio są obsługiwane?

Narzędzie przyjmuje MP3, WAV, M4A, OGG, FLAC, WebM i kilka pokrewnych formatów. Rzeczywista możliwość dekodowania zależy od przeglądarki i systemu operacyjnego. Jeśli plik z wymienionym rozszerzeniem zostanie odrzucony, przekonwertuj go na MP3 lub nieskompresowany WAV i spróbuj ponownie.

Jakie języki potrafi transkrybować Whisper?

Wybrany model Whisper tiny jest wielojęzyczny i automatycznie rozpoznaje wiele języków mówionych. Dokładność zależy od języka, akcentu, jakości nagrania i tematu. Model nie tłumaczy tekstu na inny język, nie rozpoznaje mówców i nie gwarantuje poprawnej pisowni nazw ani specjalistycznych terminów.

Dlaczego pierwsza transkrypcja pobiera model?

Prywatna transkrypcja na urządzeniu wymaga zapisania modelu rozpoznawania mowy na komputerze. Wariant WebGPU pobiera około 80 MB, a skwantyzowany tryb CPU około 105 MB. Przeglądarka zwykle przechowuje te pliki w pamięci podręcznej i używa ich ponownie, chyba że dane witryny lub pamięć zostaną wyczyszczone.

Czy transkrypcja działa bez WebGPU?

Tak. Narzędzie wybiera WebGPU, ponieważ zgodny procesor graficzny może znacznie szybciej uruchomić Whisper. Jeśli WebGPU jest niedostępny lub zawiedzie, ponawia próbę przez WebAssembly na CPU. Ten tryb działa w większej liczbie przeglądarek, ale może być wolny przy długich nagraniach, zwłaszcza na telefonach i starszych komputerach.

Jak dokładna jest transkrypcja?

Whisper tiny przygotowuje użyteczny szkic z wyraźnej mowy, ale nie gwarantuje dosłownego zapisu. Hałas w tle, muzyka, rozmowy nakładające się na siebie, słabe mikrofony, rzadkie nazwiska i długa cisza obniżają dokładność oraz mogą wywołać zmyślone słowa. Ważne cytaty, informacje medyczne, treści prawne i decyzje należy porównać z oryginalnym nagraniem.