CanDoYa
RU

Конвертер аудио в текст

Работает прямо в браузере - без загрузки файлов и регистрации.

Добавьте аудиофайл, чтобы создать приватную расшифровку на своем устройстве.

Поделиться инструментом

Как перевести аудио в текст без загрузки на сервер?

Добавьте аудиофайл, и конвертер запустит распознавание речи Whisper на вашем устройстве. Результат можно отредактировать и сохранить в TXT или SRT. Запись никуда не загружается, но при первом запуске браузеру потребуется скачать модель ИИ.

Как пользоваться

  1. 1Выберите запись. Перетащите в инструмент файл MP3, WAV, M4A, OGG, FLAC или WebM либо нажмите на область загрузки и выберите его на устройстве.
  2. 2Запустите приватную расшифровку. Нажмите Расшифровать аудио. При первом запуске дождитесь скачивания многоязычной модели Whisper, после чего она обработает запись на вашем устройстве.
  3. 3Проверьте и сохраните. Еще раз прослушайте сомнительные места, исправьте ошибки, затем скопируйте текст или скачайте его в TXT либо SRT с временными метками.

Кому пригодится

Этот инструмент переводит записанную речь в текст, не отправляя запись в сервис транскрибации. Модель Whisper работает в отдельном процессе браузера, поэтому страница остается отзывчивой, пока компьютер выполняет обработку. Если доступен WebGPU, он ускоряет распознавание. В остальных браузерах включается более медленный режим CPU. Скачанная модель сохраняется в кеше браузера для следующих посещений.

Вопросы и ответы

Загружается ли мое аудио на сервер?

Нет. Браузер декодирует выбранный файл и передает аудиоданные только локальному процессу на том же устройстве. Этот процесс скачивает файлы модели Whisper с Hugging Face, но не отправляет запись или расшифровку. CanDoYa не получает и не хранит файл.

Можно ли перевести аудио в текст бесплатно?

Да. Учетная запись, оплата, лимит минут и водяной знак отсутствуют. Вычисления ИИ выполняет ваше устройство, поэтому на практике расходуются время, память и трафик на первую загрузку модели. При тарифе с ограниченным объемом данных провайдер может учесть эту загрузку.

Какой размер и длительность записи поддерживаются?

Можно выбрать файл размером до 500 МБ. Жесткого ограничения по минутам нет, но длинным записям требуется больше памяти и времени, поскольку обработка идет на вашем устройстве. Для часовой встречи или лекции современный ноутбук подходит лучше телефона.

Какие аудиоформаты поддерживаются?

Инструмент принимает MP3, WAV, M4A, OGG, FLAC, WebM и некоторые родственные форматы. Возможность декодирования зависит от браузера и операционной системы. Если файл с указанным в списке расширением не открывается, преобразуйте его в MP3 или несжатый WAV и повторите попытку.

Какие языки распознает Whisper?

Выбранная модель Whisper tiny поддерживает много языков и автоматически определяет язык речи. Точность зависит от языка, акцента, качества записи и тематики. Инструмент не переводит расшифровку, не различает говорящих и не гарантирует правильное написание имен и специальных терминов.

Почему перед первой расшифровкой скачивается модель?

Для приватного распознавания на устройстве модель должна находиться на компьютере. Вариант WebGPU скачивает около 80 МБ, а квантованный вариант для CPU - около 105 МБ. Обычно браузер сохраняет эти файлы в кеше и использует снова, пока не будут очищены кеш или данные сайта.

Работает ли транскрибация без WebGPU?

Да. Инструмент предпочитает WebGPU, поскольку совместимый графический процессор заметно ускоряет Whisper. Если WebGPU отсутствует или дает сбой, обработка повторяется через WebAssembly на CPU. Такой вариант доступен в большем числе браузеров, но может медленно обрабатывать длинные записи, особенно на телефонах и старых компьютерах.

Насколько точна расшифровка?

Whisper tiny создает полезный черновик при четкой речи, но не гарантирует дословный результат. Фоновый шум, музыка, перебивающие друг друга голоса, слабый микрофон, редкие имена и длинная тишина снижают точность и иногда приводят к выдуманным словам. Сверяйте с исходным аудио важные цитаты, медицинские данные, юридические формулировки и решения.