CanDoYa
CA

Convertidor d'àudio a text

Funciona del tot al navegador: sense pujar res ni registrar-te.

Afegeix un fitxer d'àudio per crear una transcripció privada al dispositiu.

Comparteix aquesta eina

Com puc convertir àudio a text de manera privada?

Afegeix un fitxer i aquest convertidor d'àudio a text executarà el model de reconeixement de veu Whisper al teu dispositiu. Obtindràs una transcripció editable que podràs exportar en TXT o SRT. La gravació no es puja enlloc, però el navegador ha de baixar el model d'IA la primera vegada.

Com s’utilitza

  1. 1Tria la gravació. Deixa anar un fitxer MP3, WAV, M4A, OGG, FLAC o WebM sobre l'eina, o fes clic a l'àrea de càrrega per seleccionar-lo.
  2. 2Fes la transcripció privada. Prem Transcriu l'àudio. En el primer ús, espera que es descarregui el model Whisper multilingüe i deixa que el dispositiu processi la gravació.
  3. 3Revisa i exporta. Torna a escoltar els fragments dubtosos, corregeix els errors i després copia la transcripció o baixa-la en TXT o SRT amb marques de temps.

Per a qui és

Aquesta eina passa la veu gravada a text sense enviar l'àudio a cap servei de transcripció. El model Whisper s'executa en un worker del navegador, de manera que la pàgina continua responent mentre l'ordinador fa la inferència. Si hi ha WebGPU, l'eina l'aprofita; en altres navegadors recorre a un mode de CPU més lent. El navegador desa el model descarregat a la memòria cau per a visites posteriors.

Preguntes freqüents

El meu àudio es puja a algun servidor?

No. El navegador descodifica el fitxer seleccionat i només envia les mostres d'àudio a un worker local del mateix dispositiu. Aquest worker baixa els fitxers del model Whisper des de Hugging Face, però no puja ni la gravació ni la transcripció. CanDoYa no rep ni desa el fitxer.

El convertidor d'àudio a text és gratuït?

Sí. No cal compte ni pagament, no hi ha crèdits de transcripció ni marques d'aigua. El teu dispositiu fa la inferència d'IA, així que el cost pràctic és el temps de processament, la memòria i la primera descàrrega del model. El teu proveïdor pot comptar aquesta descàrrega si tens una tarifa de dades limitada.

Quina mida i durada de gravació puc transcriure?

El control de càrrega accepta fitxers de fins a 500 MB. No hi ha una quota fixa de minuts, però les gravacions llargues necessiten més memòria i triguen més perquè la inferència es fa al teu dispositiu. Per a reunions o classes d'una hora, és millor un portàtil modern que no pas un telèfon.

Quins formats d'àudio s'admeten?

L'eina accepta MP3, WAV, M4A, OGG, FLAC, WebM i alguns formats relacionats. La compatibilitat real de descodificació depèn del navegador i del sistema operatiu. Si rebutja un fitxer tot i que l'extensió apareix a la llista, converteix-lo a MP3 o WAV sense comprimir i torna-ho a provar.

Quins idiomes pot transcriure Whisper?

El model Whisper tiny seleccionat és multilingüe i detecta automàticament moltes llengües parlades, inclòs el català. La precisió varia segons la llengua, l'accent, la qualitat de la gravació i el tema. No tradueix la transcripció a una altra llengua, no identifica qui parla ni garanteix l'ortografia dels noms i els termes especialitzats.

Per què la primera transcripció descarrega un model?

La transcripció privada al dispositiu necessita tenir el model de reconeixement de veu a l'ordinador. La via WebGPU baixa uns 80 MB, mentre que l'alternativa quantitzada i compatible per CPU ocupa uns 105 MB. El navegador sol desar aquests fitxers a la memòria cau i els reutilitza en visites posteriors, tret que esborris les dades del lloc o la memòria cau.

La transcripció d'àudio funciona sense WebGPU?

Sí. L'eina prefereix WebGPU perquè un processador gràfic compatible pot executar Whisper molt més de pressa. Si WebGPU no està disponible o falla, ho torna a provar amb WebAssembly a la CPU. Aquesta alternativa funciona en més navegadors, però pot ser lenta amb gravacions llargues, sobretot en telèfons i ordinadors antics.

Quina precisió té la transcripció?

Whisper tiny genera un esborrany útil quan la veu és clara, però no garanteix una transcripció literal. El soroll de fons, la música, les veus alhora, un micròfon fluix, els noms poc habituals i els silencis llargs redueixen la precisió i poden fer aparèixer paraules inventades. Contrasta amb l'àudio original les citacions, les dades mèdiques, les declaracions jurídiques i les decisions importants.