CanDoYa
DE

Audio in Text umwandeln

Läuft komplett in deinem Browser - kein Upload, keine Anmeldung.

Fügen Sie eine Audiodatei hinzu, um ein privates Transkript auf Ihrem Gerät zu erstellen.

Dieses Tool teilen

Wie lässt sich Audio privat in Text umwandeln?

Fügen Sie eine Audiodatei hinzu. Dieser Konverter führt die Whisper-Spracherkennung auf Ihrem Gerät aus und erstellt ein bearbeitbares Transkript für den Export als TXT oder SRT. Die Aufnahme wird nie hochgeladen. Nur das KI-Modell muss der Browser bei der ersten Nutzung herunterladen.

So funktioniert’s

  1. 1Aufnahme auswählen. Ziehen Sie eine MP3-, WAV-, M4A-, OGG-, FLAC- oder WebM-Datei auf das Tool oder klicken Sie auf den Upload-Bereich, um eine Datei auszuwählen.
  2. 2Private Transkription starten. Klicken Sie auf Audio transkribieren. Warten Sie beim ersten Durchlauf, bis das mehrsprachige Whisper-Modell heruntergeladen ist. Anschließend verarbeitet es die Aufnahme auf Ihrem Gerät.
  3. 3Prüfen und exportieren. Hören Sie unsichere Stellen erneut an, korrigieren Sie Fehler und kopieren Sie das Transkript oder laden Sie es als TXT beziehungsweise als SRT mit Zeitmarken herunter.

Für wen

Dieses Tool wandelt aufgenommene Sprache in Text um, ohne die Aufnahme an einen Transkriptionsdienst zu senden. Das Whisper-Modell läuft in einem eigenen Browser-Prozess. So bleibt die Seite bedienbar, während der Computer die Aufnahme verarbeitet. Wenn WebGPU verfügbar ist, wird es zur Beschleunigung genutzt. Andere Browser wechseln in einen langsameren CPU-Modus. Das heruntergeladene Modell speichert der Browser für spätere Besuche im Cache.

Häufige Fragen

Wird meine Audiodatei auf einen Server hochgeladen?

Nein. Der Browser dekodiert die ausgewählte Datei und sendet die Audiodaten nur an einen lokalen Prozess auf demselben Gerät. Dieser Prozess lädt die Dateien des Whisper-Modells von Hugging Face herunter, überträgt aber weder Aufnahme noch Transkript. CanDoYa empfängt oder speichert die Datei nicht.

Ist die Umwandlung von Audio in Text kostenlos?

Ja. Es gibt kein Konto, keine Zahlung, keine Transkriptionsguthaben und kein Wasserzeichen. Ihr eigenes Gerät führt die KI-Berechnung aus. Der praktische Aufwand besteht aus Rechenzeit, Arbeitsspeicher und dem ersten Modelldownload. Bei einem Tarif mit Datenlimit kann dieser Download trotzdem auf das Datenvolumen angerechnet werden.

Welche Dateigröße und Aufnahmedauer kann ich transkribieren?

Der Upload nimmt Dateien bis 500 MB an. Es gibt kein festes Minutenlimit. Lange Aufnahmen benötigen jedoch mehr Arbeitsspeicher und mehr Zeit, da die Berechnung auf Ihrem Gerät erfolgt. Für einstündige Besprechungen oder Vorlesungen eignet sich ein moderner Laptop besser als ein Smartphone.

Welche Audioformate werden unterstützt?

Das Tool akzeptiert MP3, WAV, M4A, OGG, FLAC, WebM und einige verwandte Formate. Welche Dateien tatsächlich dekodiert werden können, hängt vom Browser und vom Betriebssystem ab. Wenn eine Datei trotz aufgeführter Endung abgelehnt wird, konvertieren Sie sie in MP3 oder unkomprimiertes WAV und versuchen es erneut.

Welche Sprachen kann Whisper transkribieren?

Das ausgewählte Whisper-Tiny-Modell ist mehrsprachig und erkennt viele gesprochene Sprachen automatisch. Die Genauigkeit hängt von Sprache, Akzent, Aufnahmequalität und Thema ab. Das Tool übersetzt nicht in eine andere Sprache, unterscheidet keine Sprecher und garantiert keine korrekte Schreibweise von Namen oder Fachbegriffen.

Warum wird bei der ersten Transkription ein Modell heruntergeladen?

Für eine private Transkription auf dem Gerät muss sich das Spracherkennungsmodell auf Ihrem Computer befinden. Der WebGPU-Pfad lädt ungefähr 80 MB herunter, die quantisierte CPU-Variante ungefähr 105 MB. Browser speichern diese Dateien normalerweise im Cache und verwenden sie später erneut, sofern Website-Daten und Cache nicht gelöscht werden.

Funktioniert die Audiotranskription ohne WebGPU?

Ja. Das Tool bevorzugt WebGPU, weil eine unterstützte Grafikeinheit Whisper deutlich schneller ausführen kann. Falls WebGPU fehlt oder scheitert, startet es mit WebAssembly auf der CPU neu. Diese Variante funktioniert in mehr Browsern, kann bei langen Aufnahmen aber langsam sein, besonders auf Smartphones und älteren Computern.

Wie genau ist das Transkript?

Whisper tiny erstellt bei klarer Sprache einen brauchbaren Entwurf, garantiert aber keine wortgetreue Abschrift. Hintergrundgeräusche, Musik, überlappende Stimmen, schwache Mikrofone, seltene Namen und lange stille Stellen verringern die Genauigkeit und können erfundene Wörter erzeugen. Prüfen Sie wichtige Zitate, medizinische Angaben, rechtliche Aussagen und Entscheidungen anhand der Originalaufnahme.