CanDoYa
KO

오디오 텍스트 변환기

브라우저에서 바로 실행됩니다. 업로드도, 회원가입도 없습니다.

오디오 파일을 추가해 기기에서 비공개 받아쓰기를 만드세요.

이 도구 공유하기

오디오를 비공개로 텍스트로 변환하려면 어떻게 하나요?

오디오 파일을 추가하면 이 변환기가 기기에서 Whisper 음성 인식 모델을 실행합니다. 결과는 직접 고칠 수 있으며 TXT와 SRT로 저장할 수 있습니다. 녹음 파일은 업로드되지 않지만, 처음 사용할 때 브라우저가 AI 모델을 내려받아야 합니다.

사용 방법

  1. 1녹음 파일 선택. MP3, WAV, M4A, OGG, FLAC 또는 WebM 파일을 도구 위에 놓거나 업로드 영역을 눌러 선택하세요.
  2. 2비공개 받아쓰기 시작. 오디오 받아쓰기를 누르세요. 처음 실행할 때는 다국어 Whisper 모델이 내려받아질 때까지 기다린 뒤 기기에서 녹음을 처리합니다.
  3. 3확인 후 내보내기. 불확실한 부분을 다시 듣고 잘못 인식된 내용을 고친 다음, 텍스트를 복사하거나 TXT 또는 시간 정보가 있는 SRT로 저장하세요.

이런 분께 추천

녹음 파일을 외부 받아쓰기 서비스로 보내지 않고 음성을 글로 바꿉니다. Whisper 모델은 브라우저 워커 안에서 실행되므로 컴퓨터가 음성을 처리하는 동안에도 페이지가 멈추지 않습니다. 지원되는 환경에서는 WebGPU를 사용하고, 그렇지 않으면 더 느린 CPU 모드로 전환합니다. 한 번 받은 모델은 브라우저 캐시에 저장되어 다음에 다시 쓸 수 있습니다.

자주 묻는 질문

오디오가 서버에 업로드되나요?

아니요. 브라우저가 선택한 파일을 해석하고 오디오 샘플을 같은 기기의 로컬 워커에만 보냅니다. 워커는 Hugging Face에서 Whisper 모델 파일을 내려받지만 녹음이나 변환 결과는 업로드하지 않습니다. CanDoYa는 파일을 받거나 저장하지 않습니다.

오디오 텍스트 변환기는 무료인가요?

네. 계정, 결제, 변환 크레딧, 워터마크가 없습니다. 기기가 AI 연산을 직접 수행하므로 실제로 필요한 것은 처리 시간과 메모리, 첫 모델 다운로드입니다. 종량제 인터넷에서는 모델 다운로드가 데이터 사용량에 포함될 수 있습니다.

어느 정도 크기와 길이의 녹음을 변환할 수 있나요?

최대 500MB 파일을 선택할 수 있습니다. 분 단위의 고정 제한은 없지만 녹음이 길수록 기기에서 더 많은 메모리와 시간이 필요합니다. 한 시간 분량의 회의나 강의는 휴대전화보다 최신 노트북에서 처리하는 편이 좋습니다.

어떤 오디오 형식을 지원하나요?

MP3, WAV, M4A, OGG, FLAC, WebM과 몇 가지 관련 형식을 받을 수 있습니다. 실제 디코딩 지원 여부는 브라우저와 운영체제에 따라 달라집니다. 목록에 있는 확장자인데도 열리지 않는다면 MP3나 비압축 WAV로 변환한 뒤 다시 시도하세요.

Whisper는 어떤 언어를 받아쓸 수 있나요?

사용하는 Whisper tiny 모델은 다국어 모델이며 여러 음성 언어를 자동으로 감지합니다. 정확도는 언어, 억양, 녹음 품질, 주제에 따라 달라집니다. 다른 언어로 번역하거나 화자를 구분하지 않으며 이름과 전문 용어의 철자를 보장하지도 않습니다.

첫 변환 때 모델을 내려받는 이유는 무엇인가요?

기기에서 비공개로 받아쓰려면 음성 인식 모델이 컴퓨터에 있어야 합니다. WebGPU 방식은 약 80MB, 양자화된 CPU 대체 방식은 약 105MB를 내려받습니다. 사이트 데이터나 캐시를 지우지 않는 한 브라우저는 보통 이 파일을 캐시에 보관하고 다시 사용합니다.

WebGPU가 없어도 오디오 받아쓰기가 되나요?

네. 지원되는 그래픽 프로세서는 Whisper를 훨씬 빠르게 실행할 수 있어 WebGPU를 우선 사용합니다. WebGPU가 없거나 실패하면 CPU에서 WebAssembly로 다시 시도합니다. 더 많은 브라우저에서 작동하지만, 특히 휴대전화나 오래된 컴퓨터에서 긴 녹음을 처리할 때는 느릴 수 있습니다.

변환 결과는 얼마나 정확한가요?

Whisper tiny는 또렷한 음성에서 쓸 만한 초안을 만들지만 모든 말을 그대로 옮긴다고 보장할 수는 없습니다. 배경 소음, 음악, 겹치는 대화, 품질이 낮은 마이크, 드문 이름, 긴 무음은 정확도를 떨어뜨리고 없던 말을 만들기도 합니다. 중요한 인용문과 의료 정보, 법적 진술, 결정 사항은 원본 오디오와 대조하세요.