CanDoYa
BG

Преобразуване на аудио в текст

Работи изцяло в браузъра - без качване и без регистрация.

Добавете аудиофайл, за да създадете локална и поверителна транскрипция.

Споделете този инструмент

Как да преобразувам аудио в текст, без да качвам записа?

Добавете аудиофайл и инструментът ще стартира модела Whisper за разпознаване на реч директно на устройството. Получавате редактируем текст и файлове TXT и SRT. Записът не се качва никъде, но при първото използване браузърът трябва да изтегли AI модела.

Как се използва

  1. 1Изберете записа. Пуснете MP3, WAV, M4A, OGG, FLAC или WebM файл върху инструмента или натиснете зоната за качване, за да го изберете.
  2. 2Стартирайте локалното транскрибиране. Натиснете „Транскрибиране на аудио“. При първото стартиране изчакайте многоезичният модел Whisper да се изтегли, след което той ще обработи записа на устройството.
  3. 3Проверете и изтеглете. Прослушайте отново неясните места, поправете грешките и копирайте транскрипцията или я изтеглете като TXT или SRT с времеви маркери.

За кого е

Инструментът превръща записана реч в текст, без да изпраща файла към услуга за транскрипция. Моделът Whisper работи в отделен процес на браузъра, така че страницата остава отзивчива, докато компютърът обработва звука. При възможност се използва WebGPU, а останалите браузъри преминават към по-бавен режим с процесора. Изтегленият модел се пази в кеша на браузъра за следващи посещения.

Често задавани въпроси

Качва ли се аудиото ми на сървър?

Не. Браузърът декодира избрания файл и изпраща аудиоданните само към локален процес на същото устройство. Процесът изтегля файловете на модела Whisper от Hugging Face, но не качва записа или транскрипцията. CanDoYa не получава и не съхранява файла.

Безплатно ли е преобразуването на аудио в текст?

Да. Не са нужни профил, плащане или кредити за транскрипция и няма воден знак. Вашето устройство извършва AI обработката, така че реалната цена е време, памет и първото изтегляне на модела. Доставчикът ви на интернет може да отчете това изтегляне при тарифен план с ограничени данни.

Какъв размер и продължителност на записа мога да транскрибирам?

Можете да изберете файл до 500 MB. Няма фиксирано ограничение в минути, но дългите записи изискват повече памет и време, защото обработката е на устройството. За едночасови срещи или лекции е по-подходящ съвременен лаптоп, отколкото телефон.

Кои аудиоформати се поддържат?

Инструментът приема MP3, WAV, M4A, OGG, FLAC, WebM и някои близки формати. Реалната поддръжка за декодиране зависи от браузъра и операционната система. Ако файл с посочено разширение бъде отхвърлен, преобразувайте го в MP3 или некомпресиран WAV и опитайте отново.

На кои езици може да транскрибира Whisper?

Избраният малък модел Whisper е многоезичен и разпознава автоматично много говорими езици. Точността зависи от езика, акцента, качеството на записа и темата. Моделът не превежда текста на друг език, не разпознава кой говори и не гарантира правилно изписване на имена и специализирани термини.

Защо при първата транскрипция се изтегля модел?

За локалното разпознаване на реч моделът трябва да бъде на компютъра. Режимът с WebGPU изтегля около 80 MB, а съвместимият резервен q4 режим с процесора изтегля около 105 MB. Обикновено браузърът кешира тези файлове и ги използва отново, освен ако данните за сайта или кешът не бъдат изчистени.

Работи ли транскрибирането без WebGPU?

Да. Инструментът предпочита WebGPU, защото поддържан графичен процесор изпълнява Whisper много по-бързо. Ако WebGPU липсва или даде грешка, инструментът опитва отново с WebAssembly на централния процесор. Този режим работи в повече браузъри, но може да е бавен при дълги записи, особено на телефони и по-стари компютри.

Колко точна е транскрипцията?

Whisper tiny дава полезна чернова при ясен говор, но не гарантира дословен резултат. Фонов шум, музика, едновременна реч, слаби микрофони, редки имена и дълги тихи участъци намаляват точността и могат да породят измислени думи. Сверявайте важните цитати, медицински данни, правни твърдения и решения с оригиналното аудио.