Инструментът превръща записана реч в текст, без да изпраща файла към услуга за транскрипция. Моделът Whisper работи в отделен процес на браузъра, така че страницата остава отзивчива, докато компютърът обработва звука. При възможност се използва WebGPU, а останалите браузъри преминават към по-бавен режим с процесора. Изтегленият модел се пази в кеша на браузъра за следващи посещения.
Преобразуване на аудио в текст
Работи изцяло в браузъра - без качване и без регистрация.
Как да преобразувам аудио в текст, без да качвам записа?
Добавете аудиофайл и инструментът ще стартира модела Whisper за разпознаване на реч директно на устройството. Получавате редактируем текст и файлове TXT и SRT. Записът не се качва никъде, но при първото използване браузърът трябва да изтегли AI модела.
Как се използва
- 1Изберете записа. Пуснете MP3, WAV, M4A, OGG, FLAC или WebM файл върху инструмента или натиснете зоната за качване, за да го изберете.
- 2Стартирайте локалното транскрибиране. Натиснете „Транскрибиране на аудио“. При първото стартиране изчакайте многоезичният модел Whisper да се изтегли, след което той ще обработи записа на устройството.
- 3Проверете и изтеглете. Прослушайте отново неясните места, поправете грешките и копирайте транскрипцията или я изтеглете като TXT или SRT с времеви маркери.
За кого е
- Интервюиращи и изследователи, които подготвят поверителна чернова, преди да сверят имената и цитатите със записа.
- Студенти, които превръщат записани лекции или учебни бележки в редактируем текст, без да качват аудио от занятията.
- Автори на подкасти и видеа, които създават работна транскрипция или SRT файл с времеви маркери за субтитри.
- Екипи с чувствителни записи, които оставят оригиналното аудио на устройството, вместо да го изпращат към облачна услуга.
Често задавани въпроси
Качва ли се аудиото ми на сървър?
Не. Браузърът декодира избрания файл и изпраща аудиоданните само към локален процес на същото устройство. Процесът изтегля файловете на модела Whisper от Hugging Face, но не качва записа или транскрипцията. CanDoYa не получава и не съхранява файла.
Безплатно ли е преобразуването на аудио в текст?
Да. Не са нужни профил, плащане или кредити за транскрипция и няма воден знак. Вашето устройство извършва AI обработката, така че реалната цена е време, памет и първото изтегляне на модела. Доставчикът ви на интернет може да отчете това изтегляне при тарифен план с ограничени данни.
Какъв размер и продължителност на записа мога да транскрибирам?
Можете да изберете файл до 500 MB. Няма фиксирано ограничение в минути, но дългите записи изискват повече памет и време, защото обработката е на устройството. За едночасови срещи или лекции е по-подходящ съвременен лаптоп, отколкото телефон.
Кои аудиоформати се поддържат?
Инструментът приема MP3, WAV, M4A, OGG, FLAC, WebM и някои близки формати. Реалната поддръжка за декодиране зависи от браузъра и операционната система. Ако файл с посочено разширение бъде отхвърлен, преобразувайте го в MP3 или некомпресиран WAV и опитайте отново.
На кои езици може да транскрибира Whisper?
Избраният малък модел Whisper е многоезичен и разпознава автоматично много говорими езици. Точността зависи от езика, акцента, качеството на записа и темата. Моделът не превежда текста на друг език, не разпознава кой говори и не гарантира правилно изписване на имена и специализирани термини.
Защо при първата транскрипция се изтегля модел?
За локалното разпознаване на реч моделът трябва да бъде на компютъра. Режимът с WebGPU изтегля около 80 MB, а съвместимият резервен q4 режим с процесора изтегля около 105 MB. Обикновено браузърът кешира тези файлове и ги използва отново, освен ако данните за сайта или кешът не бъдат изчистени.
Работи ли транскрибирането без WebGPU?
Да. Инструментът предпочита WebGPU, защото поддържан графичен процесор изпълнява Whisper много по-бързо. Ако WebGPU липсва или даде грешка, инструментът опитва отново с WebAssembly на централния процесор. Този режим работи в повече браузъри, но може да е бавен при дълги записи, особено на телефони и по-стари компютри.
Колко точна е транскрипцията?
Whisper tiny дава полезна чернова при ясен говор, но не гарантира дословен резултат. Фонов шум, музика, едновременна реч, слаби микрофони, редки имена и дълги тихи участъци намаляват точността и могат да породят измислени думи. Сверявайте важните цитати, медицински данни, правни твърдения и решения с оригиналното аудио.