CanDoYa
KO

자동 자막 생성기

브라우저에서 바로 실행됩니다. 업로드도, 회원가입도 없습니다.

영상을 추가해 기기에서 비공개로 수정 가능한 자막을 만드세요.

이 도구 공유하기

영상에 자동으로 자막을 넣으려면 어떻게 하나요?

영상을 추가하면 이 자동 자막 생성기가 기기에서 Whisper 음성 인식을 실행합니다. 시간 정보가 있는 자막을 만들고, 문구와 시간을 고친 뒤 SRT 또는 VTT로 저장할 수 있습니다. 영상은 업로드되지 않지만 처음 사용할 때 브라우저가 AI 모델을 내려받아야 합니다.

사용 방법

  1. 1영상 선택. MP4, WebM, MOV, M4V 또는 MKV 파일을 도구 위에 놓거나 업로드 영역을 눌러 선택하세요.
  2. 2시간 정보가 있는 자막 생성. 자막 생성을 누르세요. 처음 실행할 때는 다국어 Whisper 모델이 내려받아질 때까지 기다린 뒤 기기에서 오디오 트랙을 처리합니다.
  3. 3자막별로 검토. 편집기에서 자막을 재생하고 잘못 인식된 문구를 고치세요. 자동 시간이 빠르거나 늦으면 시작 및 종료 시간도 조정할 수 있습니다.
  4. 4자막 파일 내보내기. 여러 편집기와 플랫폼에서 널리 쓰이는 SRT를 받거나, HTML 영상과 웹 게시용 VTT를 선택하세요.

이런 분께 추천

브라우저에서 영상의 오디오 트랙을 추출하고 Whisper가 요구하는 16 kHz 모노 신호로 변환한 뒤, 백그라운드 워커에서 자막 시간을 만듭니다. 지원되는 컴퓨터에서는 WebGPU로 속도를 높이고, 그 외 환경에서는 더 느린 CPU 모드로 전환합니다. 내보내기 전에 인식된 문구와 각 자막의 시작 및 종료 시간을 모두 수정할 수 있습니다.

자주 묻는 질문

영상이 서버에 업로드되나요?

아니요. 브라우저가 선택한 파일을 읽고 해석한 오디오 샘플만 같은 기기의 워커에 전달합니다. 워커는 Hugging Face에서 Whisper 모델 파일을 내려받지만 영상, 오디오, 자막은 업로드하지 않습니다. CanDoYa도 파일을 받거나 저장하지 않습니다.

자동 자막 생성기는 무료인가요?

네. 계정, 결제, 자막 시간 제한, 워터마크, 내보내기 잠금이 없습니다. 기기가 직접 전사를 수행하므로 실제로 드는 것은 처리 시간, 메모리, 첫 모델 다운로드입니다. 데이터 사용량에 따라 요금을 내는 연결이라면 다운로드가 사용량에 포함될 수 있습니다.

어느 정도 크기와 길이의 영상에 자막을 만들 수 있나요?

최대 500MB 파일을 선택할 수 있습니다. 고정된 분량 제한은 없지만 디코딩과 AI 추론이 기기에서 이뤄지므로 영상이 길수록 메모리와 시간이 더 필요합니다. 한 시간 분량은 최신 노트북에서 처리하고, 메모리를 많이 쓰는 탭을 닫거나 영상을 짧게 나눈 뒤 작업하세요.

어떤 영상 형식을 지원하나요?

MP4, WebM, MOV, M4V, MKV, AVI, MPEG, OGV 컨테이너를 선택할 수 있습니다. 실제 오디오 해석 여부는 브라우저와 운영체제에 내장된 코덱에 달려 있습니다. AAC 오디오가 든 MP4와 Opus 오디오가 든 WebM이 보통 가장 널리 지원됩니다.

자동 생성된 자막을 수정할 수 있나요?

네. 자막마다 문구, 시작 시간, 종료 시간을 수정할 수 있습니다. 한 자막을 재생하면 미리보기가 시작 지점으로 이동하므로 인식 오류와 시간 경계를 바로잡기 쉽습니다. 문구가 비어 있거나 종료 시간이 시작보다 빠르거나 영상 길이를 넘으면 내보내기가 비활성화됩니다.

SRT와 VTT는 무엇이 다른가요?

SRT는 영상 편집기와 게시 플랫폼에서 널리 지원되는 자막 형식입니다. WebVTT는 비슷한 시간 기반 텍스트 구조를 쓰지만 웹용으로 설계되어 HTML video 요소와 바로 사용할 수 있습니다. 이 도구는 시각 스타일을 넣거나 영상에 자막을 합성하지 않고 두 형식을 모두 내보냅니다.

WebGPU가 없어도 자막을 생성할 수 있나요?

네. 호환 그래픽 프로세서에서 Whisper를 더 빠르게 실행할 수 있어 WebGPU를 먼저 시도합니다. 사용할 수 없거나 실패하면 CPU의 WebAssembly로 다시 실행합니다. 이 방식은 더 많은 브라우저를 지원하지만 휴대전화나 오래된 컴퓨터에서 긴 영상을 처리할 때 특히 느릴 수 있습니다.

자동 자막이 접근성 용도로 충분히 정확한가요?

검토할 초안으로는 유용하지만 완성된 접근성 자막은 아닙니다. 잡음, 음악, 겹치는 목소리, 억양, 드문 이름, 전문 용어 때문에 오류가 생길 수 있습니다. 자동 인식은 소리 설명과 화자 표기도 자주 빠뜨리므로 공식 폐쇄 자막을 게시하기 전에 영상을 확인하고 의미 있는 비언어 정보를 추가하세요.