CanDoYa
UK

Конвертер аудіо в текст

Працює повністю у вашому браузері - без завантаження на сервер і без реєстрації.

Додайте аудіофайл, щоб створити приватну транскрипцію на своєму пристрої.

Поділитися інструментом

Як приватно перетворити аудіо в текст?

Додайте аудіофайл, і конвертер запустить модель розпізнавання мовлення Whisper на вашому пристрої. Отриману транскрипцію можна відредагувати та експортувати у TXT або SRT. Запис нікуди не надсилається, хоча під час першого запуску браузер має завантажити модель AI.

Як користуватися

  1. 1Виберіть запис. Перетягніть у поле файл MP3, WAV, M4A, OGG, FLAC або WebM чи натисніть область завантаження, щоб вибрати його на пристрої.
  2. 2Запустіть приватну транскрипцію. Натисніть Транскрибувати аудіо. Під час першого запуску дочекайтеся завантаження багатомовної моделі Whisper, після чого вона опрацює запис на пристрої.
  3. 3Перевірте та експортуйте. Ще раз прослухайте сумнівні уривки, виправте помилки, а потім скопіюйте текст або завантажте його як TXT чи SRT із часовими мітками.

Кому це знадобиться

Інструмент перетворює записану мову на текст, не надсилаючи аудіо до сервісу транскрипції. Модель Whisper працює в окремому процесі браузера, тому сторінка не зависає, поки комп'ютер виконує обчислення. За наявності використовується WebGPU, а в інших браузерах вмикається повільніший режим CPU. Завантажена модель зберігається в кеші браузера для наступних сеансів.

Часті запитання

Чи завантажується моє аудіо на сервер?

Ні. Браузер декодує вибраний файл і передає зразки аудіо лише локальному фоновому процесу на тому самому пристрої. Цей процес завантажує файли моделі Whisper з Hugging Face, але не надсилає ваш запис або транскрипцію. CanDoYa не отримує і не зберігає файл.

Конвертер аудіо в текст безкоштовний?

Так. Не потрібні обліковий запис, оплата чи кредити на хвилини, а на результаті немає водяного знака. Обчислення AI виконує ваш пристрій, тому практична ціна полягає в часі обробки, використаній пам'яті та першому завантаженні моделі. На тарифі з лімітом провайдер може врахувати цей трафік.

Файли якого розміру та тривалості можна транскрибувати?

Поле завантаження приймає файли до 500 МБ. Фіксованого ліміту хвилин немає, але довгі записи потребують більше пам'яті та часу, адже обробка відбувається на вашому пристрої. Для годинної зустрічі або лекції сучасний ноутбук підходить краще за телефон.

Які аудіоформати підтримуються?

Інструмент приймає MP3, WAV, M4A, OGG, FLAC, WebM і деякі споріднені формати. Фактична підтримка декодування залежить від браузера та операційної системи. Якщо файл відхилено попри розширення зі списку, перетворіть його на MP3 або нестиснений WAV і спробуйте ще раз.

Які мови може транскрибувати Whisper?

Обрана модель Whisper tiny є багатомовною й автоматично розпізнає багато мов. Точність залежить від мови, акценту, якості запису та теми. Інструмент не перекладає транскрипцію іншою мовою, не розрізняє мовців і не гарантує правильне написання імен чи спеціальних термінів.

Навіщо під час першої транскрипції завантажується модель?

Для приватної транскрипції на пристрої модель розпізнавання мовлення має бути на вашому комп'ютері. Варіант WebGPU завантажує приблизно 80 МБ, а резервний варіант для CPU важить близько 105 МБ. Браузери зазвичай кешують ці файли й використовують їх повторно, доки ви не очистите кеш або дані сайту.

Чи працює транскрипція без WebGPU?

Так. Інструмент віддає перевагу WebGPU, оскільки сумісний графічний процесор запускає Whisper набагато швидше. Якщо WebGPU відсутній або дає збій, інструмент повторює спробу через WebAssembly на CPU. Цей режим працює в більшій кількості браузерів, але може бути повільним для довгих записів, особливо на телефонах і старих комп'ютерах.

Наскільки точною буде транскрипція?

Whisper tiny створює корисну чернетку з чіткої мови, але не гарантує дослівної точності. Фоновий шум, музика, одночасні репліки, слабкий мікрофон, незвичні імена та довгі паузи погіршують результат і можуть додати слова, яких не було. Звіряйте важливі цитати, медичні дані, юридичні заяви та рішення з оригінальним аудіо.