CanDoYa
PL

Automatyczne napisy do filmu

Działa w całości w przeglądarce - bez wysyłania plików i bez rejestracji.

Dodaj film, aby utworzyć prywatne, edytowalne napisy na urządzeniu.

Udostępnij to narzędzie

Jak automatycznie dodać napisy do filmu?

Dodaj film, a generator automatycznych napisów uruchomi rozpoznawanie mowy Whisper bezpośrednio na urządzeniu. Utworzy edytowalne segmenty z czasem, które można obejrzeć i pobrać jako SRT lub VTT. Film nie jest nigdzie wysyłany, ale przy pierwszym użyciu przeglądarka musi pobrać model AI.

Jak korzystać

  1. 1Wybierz film. Upuść w narzędziu plik MP4, WebM, MOV, M4V lub MKV albo kliknij obszar przesyłania i wybierz plik z urządzenia.
  2. 2Wygeneruj napisy z czasem. Kliknij „Generuj napisy”. Przy pierwszym uruchomieniu poczekaj na pobranie wielojęzycznego modelu Whisper, a następnie pozwól urządzeniu przetworzyć ścieżkę audio.
  3. 3Sprawdź każdy segment. Odtwarzaj segmenty z edytora, poprawiaj słowa i zmieniaj czas początku lub końca, gdy automatyczna synchronizacja jest zbyt wczesna albo zbyt późna.
  4. 4Wyeksportuj plik napisów. Pobierz SRT, aby użyć napisów w edytorze lub na platformie, albo VTT do wideo HTML i publikacji w internecie.

Dla kogo

Narzędzie wyodrębnia ścieżkę audio w przeglądarce, przekształca ją w sygnał mono 16 kHz wymagany przez Whisper i oblicza czas napisów w procesie roboczym. WebGPU przyspiesza działanie na obsługiwanych komputerach; pozostałe przeglądarki korzystają z wolniejszego trybu CPU. Przed eksportem można poprawić tekst oraz początek i koniec każdego segmentu.

Najczęstsze pytania

Czy mój film jest wysyłany na serwer?

Nie. Przeglądarka odczytuje wybrany plik i przekazuje zdekodowane próbki audio tylko procesowi roboczemu na tym samym urządzeniu. Proces pobiera pliki modelu Whisper z Hugging Face, ale nie wysyła filmu, audio ani napisów. CanDoYa nie odbiera ani nie przechowuje pliku.

Czy generator automatycznych napisów jest darmowy?

Tak. Nie ma konta, płatności, limitu minut, znaku wodnego ani blokady eksportu. Transkrypcję wykonuje urządzenie, więc praktycznym kosztem jest czas przetwarzania, pamięć i pierwsze pobranie modelu. Operator może uwzględnić ten transfer w limicie danych.

Jak duży i długi film mogę opatrzyć napisami?

Można wybrać plik do 500 MB. Nie ma stałego limitu minut, ale długie filmy wymagają więcej pamięci i czasu, ponieważ dekodowanie i obliczenia AI odbywają się lokalnie. Przy godzinnym nagraniu użyj nowoczesnego laptopa, zamknij wymagające karty albo najpierw podziel film na części.

Jakie formaty wideo działają?

Narzędzie przyjmuje kontenery MP4, WebM, MOV, M4V, MKV, AVI, MPEG i OGV. Faktyczne dekodowanie audio zależy od kodeków w przeglądarce i systemie operacyjnym. Najszerszą obsługę mają zwykle MP4 z dźwiękiem AAC oraz WebM z dźwiękiem Opus.

Czy automatyczne napisy można edytować?

Tak. Każdy segment ma edytowalny tekst oraz czas początku i końca. Odtwórz segment, aby przejść do właściwego miejsca filmu, popraw błędy rozpoznawania i ustaw granice. Eksport pozostaje wyłączony, jeśli segment jest pusty, kończy się przed początkiem albo wykracza poza długość filmu.

Czym różnią się SRT i VTT?

SRT to powszechnie obsługiwany format napisów używany przez edytory wideo i platformy publikacyjne. WebVTT ma podobną strukturę tekstu z czasem, ale jest przeznaczony do internetu i działa bezpośrednio z elementem ścieżki wideo HTML. Narzędzie eksportuje oba formaty bez stylu i bez wtapia tekstu w obraz.

Czy generowanie napisów działa bez WebGPU?

Tak. Narzędzie najpierw próbuje WebGPU, ponieważ zgodny procesor graficzny przyspiesza model Whisper. Jeśli WebGPU jest niedostępny lub zawiedzie, przetwarzanie zostanie powtórzone przez WebAssembly na CPU. Ten tryb działa w większej liczbie przeglądarek, ale jest dużo wolniejszy, zwłaszcza przy długich filmach na telefonach i starszych komputerach.

Czy automatyczne napisy są wystarczająco dokładne do celów dostępności?

To przydatny szkic, a nie gotowy materiał spełniający wymagania dostępności. Hałas, muzyka, nakładające się głosy, akcenty, nietypowe nazwiska i terminy techniczne mogą powodować błędy. Rozpoznawanie mowy pomija też opisy dźwięków i oznaczenia mówców, dlatego przed publikacją trzeba obejrzeć film i dodać istotne informacje pozawerbalne.