CanDoYa
DE

Sprache mit KI erkennen

Läuft komplett in deinem Browser - kein Upload, keine Anmeldung.

Fügen Sie einen Satz oder Absatz ein, um seine Sprache zu erkennen.

Ihr Text wird in einem Browser-Prozess verarbeitet und nie hochgeladen. Nur das öffentliche KI-Modell wird heruntergeladen.

20 unterstützte Sprachen

Arabisch, Bulgarisch, Chinesisch, Deutsch, Englisch, Französisch, Griechisch, Hindi, Italienisch, Japanisch, Niederländisch, Polnisch, Portugiesisch, Russisch, Spanisch, Suaheli, Thailändisch, Türkisch, Urdu und Vietnamesisch.

Text in einer anderen Sprache kann fälschlich als ähnlichste unterstützte Sprache bezeichnet werden.

Dieses Tool teilen

Was ist eine Spracherkennung?

Eine Spracherkennung bestimmt die wahrscheinlichste Sprache eines eingefügten Textes. Dieses Werkzeug vergleicht die Probe mit 20 Sprachen und zeigt die drei höchsten Modellwerte. Die KI läuft lokal in einem Browser-Prozess, sodass Ihr Text nicht hochgeladen wird. Beim ersten Einsatz muss allerdings das Modell heruntergeladen werden.

So funktioniert’s

  1. 1Aussagekräftige Textprobe einfügen. Geben Sie einen vollständigen Satz oder Absatz in einer der 20 unterstützten Sprachen ein. Längerer, natürlicher Text lässt sich meist besser unterscheiden als ein Name oder ein einzelnes Wort.
  2. 2Sprache auf dem Gerät erkennen. Klicken Sie auf Sprache erkennen. Warten Sie beim ersten Start auf den Modell-Download. Bei späteren Besuchen kann der vorhandene Browser-Cache wiederverwendet werden.
  3. 3Sortierte Treffer prüfen. Prüfen Sie die führende Sprache, den ISO-Code, den Wert und die Alternativen. Nahe Werte, kurze Proben und nicht unterstützte Sprachen sollten Sie als unsicher behandeln.

Für wen

Die Erkennung führt ein XLM-R-Klassifikationsmodell auf Ihrem Gerät aus und verarbeitet den Text in einem eigenen Prozess, damit die Seite bedienbar bleibt. Sie bevorzugt WebGPU-Beschleunigung und versucht es bei Bedarf erneut mit WebAssembly auf dem Prozessor. Beim ersten Start werden ungefähr 296 MB Modell- und Tokenizer-Daten von Hugging Face geladen. Der Browser speichert diese Dateien normalerweise im Cache, kann sie aber bei einer Speicherbereinigung oder bei knappem Platz entfernen.

Das Modell vergleicht Arabisch, Bulgarisch, Chinesisch, Deutsch, Englisch, Französisch, Griechisch, Hindi, Italienisch, Japanisch, Niederländisch, Polnisch, Portugiesisch, Russisch, Spanisch, Suaheli, Thailändisch, Türkisch, Urdu und Vietnamesisch. Text in einer anderen Sprache wird zwangsweise einem dieser Labels zugeordnet. Prüfen Sie deshalb die unterstützte Liste, bevor Sie sich auf das Ergebnis verlassen.

Häufige Fragen

Wird mein Text an einen Server hochgeladen?

Nein. Der Text wird an einen Prozess in Ihrem Browser übergeben und auf Ihrem Gerät analysiert. Dieser Prozess lädt öffentliche Modelldateien und die Transformers.js-Laufzeit von externen Hosts, sendet den eingefügten Text aber nicht mit diesen Anfragen. CanDoYa empfängt oder speichert die Probe nicht.

Ist die Spracherkennung kostenlos?

Ja. Sie brauchen weder Konto noch Zahlung, Guthaben oder API-Schlüssel. Ihr Gerät übernimmt die Analyse. Praktisch fallen nur der erste Download sowie lokaler Speicher, Arbeitsspeicher und Rechenzeit an. Bei einem volumenabhängigen Datentarif kann der Modell-Download trotzdem Kosten verursachen.

Wie viel Text kann ich analysieren?

Sie können einen beliebigen normalen Abschnitt einfügen. Die Erkennung analysiert jedoch höchstens die ersten 400 Zeichen, damit sie im Eingabefenster des Modells bleibt und die Laufzeit im Browser berechenbar ist. Mindestens vier Buchstaben oder Zahlen sind nötig. Ein natürlicher Satz ist brauchbar, ein Absatz liefert mehr eindeutige Muster.

Welche Sprachen kann dieses Werkzeug erkennen?

Das Modell unterstützt 20 Labels: Arabisch, Bulgarisch, Chinesisch, Deutsch, Englisch, Französisch, Griechisch, Hindi, Italienisch, Japanisch, Niederländisch, Polnisch, Portugiesisch, Russisch, Spanisch, Suaheli, Thailändisch, Türkisch, Urdu und Vietnamesisch. Sprachen außerhalb dieses geschlossenen Satzes erkennt es nicht zuverlässig.

Warum ist der erste Download ungefähr 296 MB groß?

Die Erkennung nutzt ein mehrsprachiges neuronales XLM-R-Modell statt einer kleinen Tabelle mit Zeichenhäufigkeiten. Seine quantisierten ONNX-Gewichte sind ungefähr 279 MB groß, der Tokenizer etwa 17 MB. Der Browser speichert beides meist im Cache. Cache-Bereinigung, privates Surfen oder gelöschte Websitedaten können einen erneuten Download nötig machen.

Funktioniert die Spracherkennung ohne WebGPU?

Ja. Der Browser-Prozess bevorzugt WebGPU, wenn es verfügbar ist. Fehlt WebGPU oder kann das Modell nicht starten, versucht das Werkzeug es mit WebAssembly auf dem Prozessor erneut. Der Text bleibt auf Ihrem Gerät, aber Laden und Erkennung können auf Smartphones und älteren Computern länger dauern.

Was bedeuten die Konfidenzwerte?

Die Werte ordnen die 20 möglichen Labels für diese Probe. Sie helfen beim Vergleich, garantieren aber kein richtiges Ergebnis, sind keine unabhängigen Wahrscheinlichkeiten und belegen nicht, dass die tatsächliche Sprache unterstützt wird. Liegen die besten Werte nah beieinander, fügen Sie mehr natürlichen Text hinzu.

Erkennt das Werkzeug gemischten oder transliterierten Text?

Das Werkzeug liefert einen führenden Treffer und Alternativen, nicht für jeden Satz oder jedes Wort ein eigenes Label. Gemischtsprachiger Text kann ähnliche Werte erzeugen. Informelle Transliteration, Namen, Emoji, URLs und Quellcode entfernen ebenfalls viele Schrift- und Rechtschreibmerkmale. Solche Ergebnisse sollten Menschen prüfen.