CanDoYa
NL

Taal herkennen met AI

Draait volledig in je browser - niets uploaden, geen account.

Plak een zin of alinea om de taal te herkennen.

Je tekst wordt in een apart browserproces verwerkt en nooit geüpload. Alleen het openbare AI-model wordt gedownload.

20 ondersteunde talen

Arabisch, Bulgaars, Chinees, Nederlands, Engels, Frans, Duits, Grieks, Hindi, Italiaans, Japans, Pools, Portugees, Russisch, Spaans, Swahili, Thai, Turks, Urdu en Vietnamees.

Tekst in een andere taal kan ten onrechte als de meest vergelijkbare ondersteunde optie worden aangeduid.

Deel deze tool

Wat is taalherkenning?

Taalherkenning bepaalt in welke taal geplakte tekst waarschijnlijk is geschreven. Deze toepassing vergelijkt je fragment met 20 talen en toont de drie hoogste modelscores. De AI draait lokaal in een apart browserproces, zodat je tekst niet wordt geüpload. Bij het eerste gebruik moet het model wel worden gedownload.

Zo werkt het

  1. 1Plak een bruikbaar fragment. Voer een volledige zin of alinea in een van de 20 ondersteunde talen in. Langere, natuurlijke tekst is meestal beter te onderscheiden dan een naam of één woord.
  2. 2Start herkenning op je apparaat. Klik op Taal herkennen. Wacht bij het eerste gebruik tot het model is gedownload. Bij een volgend bezoek kan de browser de cache opnieuw gebruiken als die nog beschikbaar is.
  3. 3Bekijk de gerangschikte uitkomsten. Controleer de eerste taal, ISO-code, score en alternatieven. Beschouw dicht bij elkaar liggende scores, korte fragmenten en niet-ondersteunde talen als onzeker.

Voor wie

De taalherkenner voert een XLM-R-classificatiemodel uit op je apparaat. De inferentie draait in een apart browserproces, zodat de pagina blijft reageren. WebGPU heeft de voorkeur voor versnelling; zo nodig probeert de toepassing het opnieuw met de WebAssembly-backend voor de CPU. De eerste keer wordt ongeveer 296 MB aan model- en tokenizergegevens van Hugging Face gedownload. De browser bewaart deze bestanden normaal gesproken in de cache, maar kan ze verwijderen als je opslag wist of weinig ruimte over hebt.

Het model vergelijkt Arabisch, Bulgaars, Chinees, Nederlands, Engels, Frans, Duits, Grieks, Hindi, Italiaans, Japans, Pools, Portugees, Russisch, Spaans, Swahili, Thai, Turks, Urdu en Vietnamees. Tekst in een andere taal wordt toch naar een van deze labels gedwongen. Controleer daarom de lijst met ondersteunde talen voordat je op de uitkomst vertrouwt.

Veelgestelde vragen

Wordt mijn tekst naar een server geüpload?

Nee. De tekst gaat naar een apart proces in je browser en de inferentie vindt plaats op je apparaat. Dat proces downloadt openbare modelbestanden en de Transformers.js-runtime van externe hosts, maar stuurt je geplakte tekst niet mee met die verzoeken. CanDoYa ontvangt of bewaart het fragment niet.

Is taalherkenning gratis?

Ja. Je hebt geen account, betaling, tegoedlimiet of API-sleutel nodig. Je apparaat voert de inferentie uit. De praktische kosten zijn de eerste modeldownload, lokale opslag, geheugen en verwerkingstijd. Bij een internetverbinding met een databundel kan je provider het downloaden van de modelbestanden wel in rekening brengen.

Hoeveel tekst kan ik analyseren?

Je kunt een gewone tekst van elke lengte plakken, maar de herkenner analyseert alleen de eerste 400 tekens om binnen het invoervenster van het model te blijven en de inferentie in de browser voorspelbaar te houden. Er zijn minimaal vier letters of cijfers nodig. Gebruik minstens één natuurlijke, volledige zin; een alinea geeft het model meer onderscheidende patronen.

Welke taal is deze tekst en welke talen worden herkend?

Het model ondersteunt 20 labels: Arabisch, Bulgaars, Chinees, Nederlands, Engels, Frans, Duits, Grieks, Hindi, Italiaans, Japans, Pools, Portugees, Russisch, Spaans, Swahili, Thai, Turks, Urdu en Vietnamees. Talen buiten deze gesloten verzameling worden niet betrouwbaar herkend.

Waarom is de eerste download ongeveer 296 MB?

De herkenner gebruikt een meertalig XLM-R-neuraal model in plaats van een kleine tabel met tekenfrequenties. De gekwantiseerde ONNX-gewichten zijn ongeveer 279 MB en de tokenizer ongeveer 17 MB. De browser bewaart beide normaal gesproken in de cache, maar privé browsen, het wissen van sitegegevens of het verwijderen van de cache kan een nieuwe download vereisen.

Werkt taalherkenning zonder WebGPU?

Ja. Het browserproces gebruikt bij voorkeur WebGPU als de browser dit aanbiedt. Ontbreekt WebGPU of start het model niet, dan probeert de toepassing het opnieuw met de WebAssembly-backend voor de CPU. CPU-inferentie houdt de tekst eveneens op je apparaat, maar laden en herkennen kunnen langer duren op telefoons en oudere computers.

Wat betekenen de betrouwbaarheidsscores?

De scores rangschikken de 20 labels die het model voor dit fragment kan kiezen. Ze helpen kandidaten te vergelijken, maar zijn geen garantie, geen onafhankelijke kans op een correct antwoord en geen bewijs dat de werkelijke taal wordt ondersteund. Voeg meer natuurlijke tekst toe als de hoogste scores dicht bij elkaar liggen.

Kan de toepassing gemengde of getranslitereerde tekst herkennen?

Je krijgt één dominante overeenkomst en alternatieven, niet voor elke zin of elk woord een eigen taallabel. Meertalige tekst kan scores opleveren die dicht bij elkaar liggen. Informele transliteratie, namen, emoji, URL's en broncode nemen bovendien veel aanwijzingen over schrift en spelling weg, zodat een zorgvuldige menselijke controle nodig blijft.