CanDoYa
EL

Εργαλείο μετατροπής ήχου σε κείμενο

Λειτουργεί εξ ολοκλήρου στον browser σας - χωρίς μεταφόρτωση, χωρίς εγγραφή.

Προσθέστε ένα αρχείο ήχου για ιδιωτική απομαγνητοφώνηση στη συσκευή.

Κοινοποιήστε αυτό το εργαλείο

Πώς γίνεται ιδιωτικά η μετατροπή ήχου σε κείμενο;

Προσθέστε ένα αρχείο ήχου και το εργαλείο θα εκτελέσει το μοντέλο αναγνώρισης ομιλίας Whisper στη συσκευή σας. Παράγει επεξεργάσιμο κείμενο με εξαγωγή σε TXT και SRT. Η ηχογράφηση δεν μεταφορτώνεται ποτέ, αν και ο browser πρέπει να κατεβάσει το μοντέλο AI την πρώτη φορά.

Πώς λειτουργεί

  1. 1Επιλέξτε την ηχογράφηση. Σύρετε ένα αρχείο MP3, WAV, M4A, OGG, FLAC ή WebM στο εργαλείο ή πατήστε στην περιοχή μεταφόρτωσης για να το επιλέξετε.
  2. 2Ξεκινήστε την ιδιωτική απομαγνητοφώνηση. Πατήστε Απομαγνητοφώνηση ήχου. Την πρώτη φορά, περιμένετε να κατέβει το πολύγλωσσο μοντέλο Whisper και αφήστε το να επεξεργαστεί την ηχογράφηση στη συσκευή.
  3. 3Ελέγξτε και εξαγάγετε. Ακούστε ξανά τα αβέβαια σημεία, διορθώστε τυχόν λάθη και αντιγράψτε το κείμενο ή κατεβάστε το ως TXT ή SRT με χρονικές σημάνσεις.

Σε ποιους απευθύνεται

Το εργαλείο μετατρέπει την ηχογραφημένη ομιλία σε κείμενο χωρίς να στέλνει το αρχείο σε υπηρεσία απομαγνητοφώνησης. Το μοντέλο Whisper εκτελείται σε ξεχωριστή διεργασία του browser, ώστε η σελίδα να παραμένει λειτουργική όσο ο υπολογιστής κάνει την επεξεργασία. Όταν είναι διαθέσιμο χρησιμοποιείται WebGPU, ενώ οι υπόλοιποι browsers περνούν σε πιο αργή λειτουργία CPU. Το μοντέλο που έχει κατέβει αποθηκεύεται στην κρυφή μνήμη για επόμενες επισκέψεις.

Συχνές ερωτήσεις

Μεταφορτώνεται το αρχείο ήχου σε διακομιστή;

Όχι. Ο browser αποκωδικοποιεί το επιλεγμένο αρχείο και στέλνει τα δείγματα ήχου μόνο σε μια τοπική διεργασία στην ίδια συσκευή. Η διεργασία κατεβάζει τα αρχεία του μοντέλου Whisper από το Hugging Face, αλλά δεν μεταφορτώνει την ηχογράφηση ή το κείμενο. Το CanDoYa δεν λαμβάνει ούτε αποθηκεύει το αρχείο.

Είναι δωρεάν η μετατροπή ήχου σε κείμενο;

Ναι. Δεν χρειάζεται λογαριασμός, πληρωμή ή πιστώσεις απομαγνητοφώνησης και δεν προστίθεται υδατογράφημα. Η συσκευή σας κάνει την επεξεργασία AI, οπότε το πρακτικό κόστος είναι ο χρόνος, η μνήμη και η πρώτη λήψη του μοντέλου. Ο πάροχος μπορεί να χρεώσει αυτά τα δεδομένα σε σύνδεση με όριο.

Τι μέγεθος και διάρκεια ηχογράφησης μπορώ να απομαγνητοφωνήσω;

Το πεδίο μεταφόρτωσης δέχεται αρχεία έως 500 MB. Δεν υπάρχει σταθερό όριο λεπτών, αλλά οι μεγάλες ηχογραφήσεις χρειάζονται περισσότερη μνήμη και χρόνο επειδή η επεξεργασία γίνεται στη συσκευή. Για συνάντηση ή διάλεξη μίας ώρας, ένας σύγχρονος φορητός υπολογιστής είναι καλύτερη επιλογή από κινητό.

Ποιοι τύποι αρχείων ήχου υποστηρίζονται;

Το εργαλείο δέχεται MP3, WAV, M4A, OGG, FLAC, WebM και ορισμένους συναφείς τύπους. Η πραγματική υποστήριξη αποκωδικοποίησης εξαρτάται από τον browser και το λειτουργικό σύστημα. Αν ένα αρχείο απορριφθεί παρότι η κατάληξή του βρίσκεται στη λίστα, μετατρέψτε το σε MP3 ή ασυμπίεστο WAV και δοκιμάστε ξανά.

Ποιες γλώσσες μπορεί να απομαγνητοφωνήσει το Whisper;

Το επιλεγμένο μοντέλο Whisper tiny είναι πολύγλωσσο και εντοπίζει αυτόματα πολλές ομιλούμενες γλώσσες. Η ακρίβεια διαφέρει ανάλογα με τη γλώσσα, την προφορά, την ποιότητα της ηχογράφησης και το θέμα. Δεν μεταφράζει το κείμενο σε άλλη γλώσσα, δεν αναγνωρίζει ομιλητές και δεν εγγυάται τη σωστή γραφή ονομάτων ή ειδικών όρων.

Γιατί κατεβαίνει μοντέλο στην πρώτη απομαγνητοφώνηση;

Η ιδιωτική επεξεργασία στη συσκευή απαιτεί το μοντέλο αναγνώρισης ομιλίας να βρίσκεται στον υπολογιστή. Η διαδρομή WebGPU κατεβάζει περίπου 80 MB, ενώ η εναλλακτική CPU περίπου 105 MB. Οι browsers συνήθως κρατούν αυτά τα αρχεία στην κρυφή μνήμη και τα χρησιμοποιούν ξανά, εκτός αν διαγραφούν τα δεδομένα της σελίδας ή η cache.

Λειτουργεί η απομαγνητοφώνηση χωρίς WebGPU;

Ναι. Το εργαλείο προτιμά το WebGPU, επειδή μια συμβατή κάρτα γραφικών μπορεί να εκτελέσει το Whisper πολύ πιο γρήγορα. Αν το WebGPU λείπει ή αποτύχει, δοκιμάζει ξανά με WebAssembly στον CPU. Αυτή η εναλλακτική λειτουργεί σε περισσότερους browsers, αλλά μπορεί να είναι αργή για μεγάλες ηχογραφήσεις, ιδίως σε κινητά και παλιούς υπολογιστές.

Πόσο ακριβές είναι το κείμενο;

Το Whisper tiny δίνει ένα χρήσιμο πρώτο κείμενο από καθαρή ομιλία, αλλά δεν εγγυάται πιστή απόδοση κάθε λέξης. Θόρυβος, μουσική, φωνές που επικαλύπτονται, αδύναμα μικρόφωνα, σπάνια ονόματα και μεγάλες σιωπές μειώνουν την ακρίβεια και μπορεί να δημιουργήσουν λέξεις που δεν ειπώθηκαν. Ελέγξτε σημαντικά παραθέματα, ιατρικά στοιχεία, νομικές δηλώσεις και αποφάσεις στην αρχική ηχογράφηση.