Työkalu muuttaa tallennetun puheen tekstiksi lähettämättä äänitettä litterointipalveluun. Whisper-malli toimii selaimen erillisessä worker-säikeessä, joten sivu pysyy käytettävänä käsittelyn aikana. WebGPU:ta käytetään, jos se on saatavilla. Muuten työkalu vaihtaa hitaampaan suoritintilaan. Selain tallentaa ladatun mallin tavallisesti välimuistiin seuraavia käyttökertoja varten.
Muunna ääni tekstiksi
Toimii kokonaan selaimessasi - ei lähetyksiä, ei rekisteröitymistä.
Miten muunnan äänen tekstiksi lähettämättä tallennetta verkkoon?
Lisää äänitiedosto, niin työkalu suorittaa Whisper-puheentunnistuksen omalla laitteellasi. Saat muokattavan litteroinnin, jonka voi viedä TXT- tai SRT-muodossa. Tallenne ei poistu laitteelta, mutta selaimen täytyy ladata tekoälymalli ensimmäisellä käyttökerralla.
Näin se toimii
- 1Valitse tallenne. Vedä työkaluun MP3-, WAV-, M4A-, OGG-, FLAC- tai WebM-tiedosto tai valitse tiedosto napsauttamalla latausaluetta.
- 2Aloita yksityinen litterointi. Valitse Litteroi ääni. Odota ensimmäisellä kerralla monikielisen Whisper-mallin latautumista ja anna laitteen käsitellä tallenne.
- 3Tarkista ja vie. Kuuntele epäselvät kohdat uudelleen, korjaa virheet ja kopioi litterointi tai lataa se TXT- tai aikakoodattuna SRT-tiedostona.
Kenelle
- Haastattelijat ja tutkijat voivat tehdä yksityisen ensimmäisen version ja tarkistaa nimet sekä lainaukset tallenteesta.
- Opiskelijat voivat muuttaa luentotallenteet ja äänimuistiinpanot muokattavaksi tekstiksi lataamatta niitä palveluun.
- Podcastien ja videoiden tekijät voivat luoda raakatekstin tai aikakoodatun SRT-tiedoston tekstityksiä varten.
- Arkaluonteisia tallenteita käsittelevät tiimit voivat pitää alkuperäisen äänen laitteella pilvipalvelun sijaan.
Usein kysyttyä
Lähetetäänkö äänitiedostoni palvelimelle?
Ei. Selain purkaa valitun tiedoston ja välittää ääninäytteet vain saman laitteen paikalliselle worker-säikeelle. Säie lataa Whisper-mallin tiedostot Hugging Facesta, mutta ei lähetä tallennetta tai litterointia. CanDoYa ei vastaanota eikä tallenna tiedostoa.
Onko äänen muuttaminen tekstiksi ilmaista?
Kyllä. Tiliä, maksua, litterointikrediittejä tai vesileimaa ei ole. Oma laitteesi suorittaa laskennan, joten käytännön kustannuksia ovat käsittelyaika, muisti ja mallin ensimmäinen lataus. Operaattori voi laskea mallin latauksen mukaan datakiintiöön.
Kuinka suuren ja pitkän tallenteen voin litteroida?
Tiedoston enimmäiskoko on 500 Mt. Kiinteää minuuttirajaa ei ole, mutta pitkät tallenteet vaativat enemmän muistia ja aikaa. Tunnin mittaisiin kokouksiin tai luentoihin nykyaikainen kannettava sopii puhelinta paremmin.
Mitä äänimuotoja tuetaan?
Työkalu hyväksyy MP3-, WAV-, M4A-, OGG-, FLAC- ja WebM-tiedostot sekä joitakin vastaavia muotoja. Todellinen purkutuki riippuu selaimesta ja käyttöjärjestelmästä. Jos luettelossa oleva tiedosto ei avaudu, muunna se MP3- tai pakkaamattomaan WAV-muotoon.
Mitä kieliä Whisper osaa litteroida?
Valittu Whisper tiny -malli on monikielinen ja tunnistaa automaattisesti monia puhuttuja kieliä. Tarkkuus vaihtelee kielen, aksentin, äänenlaadun ja aiheen mukaan. Malli ei käännä toiselle kielelle, tunnista puhujia eikä takaa nimien tai erikoistermien oikeinkirjoitusta.
Miksi ensimmäinen litterointi lataa mallin?
Yksityinen käsittely laitteella edellyttää puheentunnistusmallia tietokoneella. WebGPU-versio lataa noin 80 Mt ja kvantisoitu suoritinvarmistus noin 105 Mt. Selain säilyttää tiedostot yleensä välimuistissa, kunnes sivuston tiedot tai välimuisti tyhjennetään.
Toimiiko litterointi ilman WebGPU:ta?
Kyllä. Työkalu suosii WebGPU:ta, koska tuettu grafiikkasuoritin voi ajaa Whisperiä paljon nopeammin. Jos WebGPU puuttuu tai epäonnistuu, työkalu yrittää uudelleen WebAssemblyllä suorittimessa. Se toimii useammissa selaimissa, mutta voi olla hidas pitkillä tallenteilla.
Kuinka tarkka litterointi on?
Whisper tiny tekee selkeästä puheesta käyttökelpoisen luonnoksen, ei taattua sanatarkkaa tekstiä. Melu, musiikki, päällekkäinen puhe, heikko mikrofoni, harvinaiset nimet ja pitkät hiljaisuudet heikentävät tulosta. Tarkista tärkeät lainaukset, lääketiedot, oikeudelliset lausumat ja päätökset alkuperäisestä äänestä.