CanDoYa
EL

Ανίχνευση γλώσσας με AI

Λειτουργεί εξ ολοκλήρου στον browser σας - χωρίς μεταφόρτωση, χωρίς εγγραφή.

Επικολλήστε μια πρόταση ή παράγραφο για να αναγνωρίσετε τη γλώσσα.

Το κείμενο υποβάλλεται σε επεξεργασία σε νήμα του προγράμματος περιήγησης και δεν αποστέλλεται ποτέ. Λαμβάνεται μόνο το δημόσιο μοντέλο AI.

20 υποστηριζόμενες γλώσσες

Αραβικά, βουλγαρικά, κινεζικά, ολλανδικά, αγγλικά, γαλλικά, γερμανικά, ελληνικά, χίντι, ιταλικά, ιαπωνικά, πολωνικά, πορτογαλικά, ρωσικά, ισπανικά, σουαχίλι, ταϊλανδικά, τουρκικά, ουρντού και βιετναμικά.

Κείμενο σε άλλη γλώσσα μπορεί να επισημανθεί λανθασμένα ως η πλησιέστερη υποστηριζόμενη επιλογή.

Κοινοποιήστε αυτό το εργαλείο

Τι είναι η ανίχνευση γλώσσας;

Ο ανιχνευτής γλώσσας βρίσκει την πιθανότερη γλώσσα του κειμένου που επικολλάτε. Το εργαλείο συγκρίνει το δείγμα με 20 γλώσσες και εμφανίζει τις τρεις υψηλότερες βαθμολογίες του μοντέλου. Η AI εκτελείται τοπικά σε ένα νήμα του προγράμματος περιήγησης, οπότε το κείμενο δεν αποστέλλεται, αλλά το μοντέλο πρέπει να ληφθεί κατά την πρώτη χρήση.

Πώς λειτουργεί

  1. 1Επικολλήστε ένα επαρκές δείγμα. Εισαγάγετε μια πλήρη πρόταση ή παράγραφο σε μία από τις 20 υποστηριζόμενες γλώσσες. Το μεγαλύτερο, φυσικό κείμενο διακρίνεται συνήθως ευκολότερα από ένα όνομα ή μία λέξη.
  2. 2Ξεκινήστε την ανίχνευση στη συσκευή. Πατήστε Ανίχνευση γλώσσας. Κατά την πρώτη χρήση περιμένετε να ολοκληρωθεί η λήψη του μοντέλου. Σε επόμενες επισκέψεις, το πρόγραμμα περιήγησης μπορεί να χρησιμοποιήσει ξανά την προσωρινή μνήμη, αν τα αρχεία παραμένουν διαθέσιμα.
  3. 3Ελέγξτε τα ταξινομημένα αποτελέσματα. Δείτε την πρώτη γλώσσα, τον κωδικό ISO, τη βαθμολογία και τις εναλλακτικές. Θεωρήστε αβέβαιες τις κοντινές βαθμολογίες, τα μικρά δείγματα και τις μη υποστηριζόμενες γλώσσες.

Σε ποιους απευθύνεται

Ο ανιχνευτής εκτελεί ένα μοντέλο ταξινόμησης XLM-R στη συσκευή και πραγματοποιεί την ανάλυση σε ξεχωριστό νήμα, ώστε η σελίδα να παραμένει λειτουργική. Προτιμά την επιτάχυνση WebGPU και, όταν χρειάζεται, περνά στη μονάδα WebAssembly της CPU. Κατά την πρώτη εκτέλεση λαμβάνονται από το Hugging Face περίπου 296 MB δεδομένων μοντέλου και tokenizer. Το πρόγραμμα περιήγησης συνήθως αποθηκεύει αυτά τα αρχεία στην προσωρινή μνήμη, αλλά μπορεί να τα αφαιρέσει όταν εκκαθαριστεί ο χώρος αποθήκευσης ή απομένει λίγος χώρος.

Το μοντέλο συγκρίνει αραβικά, βουλγαρικά, κινεζικά, ολλανδικά, αγγλικά, γαλλικά, γερμανικά, ελληνικά, χίντι, ιταλικά, ιαπωνικά, πολωνικά, πορτογαλικά, ρωσικά, ισπανικά, σουαχίλι, ταϊλανδικά, τουρκικά, ουρντού και βιετναμικά. Κείμενο σε άλλη γλώσσα θα αντιστοιχιστεί υποχρεωτικά σε μία από αυτές τις ετικέτες, γι' αυτό ελέγξτε τη λίστα υποστήριξης πριν βασιστείτε στο αποτέλεσμα.

Συχνές ερωτήσεις

Αποστέλλεται το κείμενό μου σε διακομιστή;

Όχι. Το κείμενο περνά σε ένα νήμα μέσα στο πρόγραμμα περιήγησης και η ανάλυση γίνεται στη συσκευή. Το νήμα λαμβάνει τα δημόσια αρχεία του μοντέλου και το περιβάλλον Transformers.js από εξωτερικούς διακομιστές, αλλά δεν στέλνει μαζί τους το κείμενο που επικολλήθηκε. Το CanDoYa δεν λαμβάνει ούτε αποθηκεύει το δείγμα.

Είναι δωρεάν ο ανιχνευτής γλώσσας;

Ναι. Δεν απαιτούνται λογαριασμός, πληρωμή, όριο μονάδων ή κλειδί API. Η συσκευή σας πραγματοποιεί την ανάλυση. Το πρακτικό κόστος είναι η πρώτη λήψη του μοντέλου, ο τοπικός χώρος, η μνήμη και ο χρόνος επεξεργασίας. Μια σύνδεση με χρέωση δεδομένων μπορεί να επιβαρυνθεί για τη λήψη των αρχείων.

Πόσο κείμενο μπορώ να αναλύσω;

Μπορείτε να επικολλήσετε ένα συνηθισμένο απόσπασμα, αλλά ο ανιχνευτής αναλύει το πολύ τους πρώτους 400 χαρακτήρες, ώστε να παραμένει μέσα στο παράθυρο εισόδου του μοντέλου και να έχει προβλέψιμη απόδοση στο πρόγραμμα περιήγησης. Απαιτούνται τουλάχιστον τέσσερα γράμματα ή ψηφία. Για χρήσιμο αποτέλεσμα, δώστε τουλάχιστον μία φυσική πρόταση. Μια παράγραφος προσφέρει περισσότερα διακριτικά μοτίβα.

Ποιες γλώσσες μπορεί να αναγνωρίσει το εργαλείο;

Το μοντέλο υποστηρίζει 20 ετικέτες: αραβικά, βουλγαρικά, κινεζικά, ολλανδικά, αγγλικά, γαλλικά, γερμανικά, ελληνικά, χίντι, ιταλικά, ιαπωνικά, πολωνικά, πορτογαλικά, ρωσικά, ισπανικά, σουαχίλι, ταϊλανδικά, τουρκικά, ουρντού και βιετναμικά. Δεν αναγνωρίζει αξιόπιστα γλώσσες έξω από αυτό το κλειστό σύνολο.

Γιατί η πρώτη λήψη είναι περίπου 296 MB;

Ο ανιχνευτής χρησιμοποιεί ένα πολυγλωσσικό νευρωνικό μοντέλο XLM-R αντί για έναν μικρό πίνακα συχνοτήτων χαρακτήρων. Τα κβαντισμένα βάρη ONNX είναι περίπου 279 MB και ο tokenizer περίπου 17 MB. Το πρόγραμμα περιήγησης συνήθως αποθηκεύει και τα δύο, αλλά η διαγραφή της προσωρινής μνήμης, η ιδιωτική περιήγηση ή η εκκαθάριση δεδομένων ιστοτόπου μπορεί να απαιτήσει νέα λήψη.

Λειτουργεί η ανίχνευση γλώσσας χωρίς WebGPU;

Ναι. Το νήμα προτιμά το WebGPU όταν είναι διαθέσιμο στο πρόγραμμα περιήγησης. Αν λείπει ή το μοντέλο δεν ξεκινήσει, το εργαλείο δοκιμάζει ξανά με τη μονάδα WebAssembly της CPU. Το κείμενο παραμένει στη συσκευή, αλλά η φόρτωση και η ανίχνευση μπορεί να διαρκέσουν περισσότερο σε κινητά ή παλαιότερους υπολογιστές.

Τι σημαίνουν οι βαθμολογίες βεβαιότητας;

Οι βαθμολογίες ταξινομούν τις 20 πιθανές ετικέτες του μοντέλου για το συγκεκριμένο δείγμα. Βοηθούν στη σύγκριση υποψηφίων, αλλά δεν εγγυώνται ότι η απάντηση είναι σωστή, δεν είναι ανεξάρτητες πιθανότητες και δεν αποδεικνύουν ότι υποστηρίζεται η πραγματική γλώσσα. Αν οι πρώτες βαθμολογίες είναι κοντά, προσθέστε περισσότερο φυσικό κείμενο.

Μπορεί να ανιχνεύσει μικτό ή μεταγραμμένο κείμενο;

Το εργαλείο επιστρέφει ένα κύριο αποτέλεσμα και εναλλακτικές, όχι ετικέτα για κάθε πρόταση ή λέξη. Το κείμενο σε πολλές γλώσσες μπορεί να δώσει κοντινές βαθμολογίες. Η ανεπίσημη μεταγραφή, τα ονόματα, τα emoji, οι διευθύνσεις URL και ο πηγαίος κώδικας αφαιρούν επίσης πολλές ενδείξεις γραφής και ορθογραφίας, οπότε χρειάζεται προσεκτικός ανθρώπινος έλεγχος.