Αρχική › Τοπική αναγνώριση ομιλίας
Βασικά · Αναγνώριση ομιλίας στο Mac
Τοπική αναγνώριση ομιλίας: τι σημαίνει στην πράξη
Τοπική αναγνώριση ομιλίας σημαίνει ότι το γλωσσικό μοντέλο τρέχει πάνω στον δικό σας υπολογιστή: ο ήχος μετατρέπεται σε κείμενο εκεί και δεν φεύγει από τη συσκευή. Θα τη συναντήσετε και ως «αναγνώριση ομιλίας στη συσκευή», «on-device» ή «απομαγνητοφώνηση χωρίς σύνδεση».
Ο ορισμός, χωρίς περιτυλίγματα
Αναγνώριση ομιλίας είναι η αυτόματη μετατροπή του προφορικού λόγου σε γραπτό κείμενο. Το ερώτημα που ξεχωρίζει τις υλοποιήσεις μεταξύ τους δεν είναι αν δουλεύει, αλλά πού γίνεται ο υπολογισμός. Στην εκδοχή cloud η εφαρμογή παίρνει τον ήχο σας, τον ανεβάζει σε διακομιστή του παρόχου, εκεί τρέχει το μοντέλο, και το έτοιμο κείμενο επιστρέφει. Στην τοπική εκδοχή το ίδιο μοντέλο κάθεται ως αρχείο στον δίσκο σας και ο υπολογισμός γίνεται στη μνήμη και στην GPU του μηχανήματός σας. Η διαδρομή των δεδομένων είναι σύντομη: μικρόφωνο ή αρχείο μέσα, κείμενο έξω, χωρίς δίκτυο ενδιάμεσα.
Δεν πρόκειται για λεπτομέρεια μάρκετινγκ αλλά για αρχιτεκτονική απόφαση με πολύ συγκεκριμένες συνέπειες: στην εμπιστευτικότητα, στη δυνατότητα να δουλέψετε χωρίς σύνδεση, στο κόστος και στις απαιτήσεις από το υλικό σας.
Τρεις όροι που μπερδεύονται διαρκώς στα ελληνικά
Πριν προχωρήσουμε, μια διευκρίνιση που λύνει πραγματική σύγχυση: τρεις διαφορετικές τεχνολογίες μοιράζονται σχεδόν την ίδια ονομασία.
- Αναγνώριση ομιλίας — ομιλία σε κείμενο. Η μηχανή ακούει και γράφει. Αυτό περιγράφει η σελίδα.
- Σύνθεση ομιλίας — κείμενο σε φωνή. Το ακριβώς αντίστροφο: η μηχανή διαβάζει φωναχτά ένα γραπτό κείμενο.
- Αναγνώριση ομιλητή — ποιος μιλάει. Δεν απαντά στο τι ειπώθηκε αλλά στο ποιος το είπε, ώστε να μπει ετικέτα σε κάθε παράγραφο.
Το Lesskeys κάνει το πρώτο και το τρίτο. Δεν κάνει σύνθεση ομιλίας: δεν διαβάζει κείμενα φωναχτά. Το τελικό προϊόν το λέμε στα ελληνικά απομαγνητοφώνηση — ο όρος που χρησιμοποιούν δικηγορικά γραφεία, δημοσιογράφοι, γραμματείες και ερευνητές. Η λέξη «μεταγραφή» ακούγεται περιστασιακά ως συνώνυμο, αλλά στα ελληνικά παραπέμπει πρώτα σε ποδοσφαιρική ή φοιτητική μεταγραφή, γι' αυτό την αποφεύγουμε.
Τοπικά ή cloud: η διαφορά στην πράξη
Και οι δύο προσεγγίσεις δίνουν σήμερα χρήσιμα αποτελέσματα. Διαφέρουν σε ό,τι συμβαίνει πέρα από το κείμενο.
| Τοπικά (στη συσκευή) | Cloud | |
|---|---|---|
| Πού γίνεται η επεξεργασία | Στον υπολογιστή σας | Σε διακομιστή του παρόχου |
| Ο ήχος φεύγει από τη συσκευή | Όχι | Ναι |
| Λειτουργεί χωρίς internet | Ναι | Όχι |
| Απαιτεί λογαριασμό | Όχι | Συνήθως ναι |
| Μοντέλο κόστους | Συχνά εφάπαξ | Συνήθως ανά λεπτό ή συνδρομή |
| Απαιτήσεις από το υλικό | Υψηλές — χρειάζεται σύγχρονη GPU | Χαμηλές |
| Παλιός ή μη Apple υπολογιστής | Δεν υποστηρίζεται | Δουλεύει |
| Χρόνος σε μεγάλες ηχογραφήσεις | Εξαρτάται από το μηχάνημά σας | Εξαρτάται από τον φόρτο του παρόχου |
Οι τρεις τελευταίες γραμμές είναι η τίμια άλλη όψη: η τοπική επεξεργασία μεταφέρει τον υπολογιστικό φόρτο σε εσάς. Μια δίωρη συνέντευξη απασχολεί αισθητά τον υπολογιστή σας όσο απομαγνητοφωνείται, και αν δουλεύετε σε μηχάνημα που δεν πληροί τις απαιτήσεις, η τοπική λύση απλώς δεν είναι επιλογή. Σε αντάλλαγμα δεν δημιουργείται αντίγραφο του ήχου σας σε μέρος που δεν ελέγχετε.
Γιατί χρειάζεται Mac με Apple Silicon
Ένα σύγχρονο μοντέλο αναγνώρισης ομιλίας έχει από μερικές εκατοντάδες εκατομμύρια έως λίγα δισεκατομμύρια παραμέτρους. Για να τρέξει η απομαγνητοφώνηση σε λογικό χρόνο, οι πράξεις πρέπει να εκτελεστούν στη γραφική μονάδα και το μοντέλο πρέπει να χωράει στη μνήμη που μοιράζονται επεξεργαστής και GPU.
Αυτό ακριβώς προσφέρει η ενοποιημένη μνήμη του Apple Silicon: επεξεργαστής και GPU βλέπουν την ίδια μνήμη, οπότε το μοντέλο δεν χρειάζεται να αντιγράφεται συνεχώς από τη μια περιοχή στην άλλη. Σε Mac με επεξεργαστή Intel αυτή η προϋπόθεση δεν υπάρχει. Γι' αυτό το Lesskeys είναι εφαρμογή αποκλειστικά για Apple Silicon: Mac με M1 ή νεότερο είναι απαίτηση, όχι σύσταση — σε Mac με Intel απλώς δεν εκκινεί. Ελάχιστο λειτουργικό: macOS 13 (Ventura). Το γλωσσικό μοντέλο κατεβαίνει μία φορά και μετά μένει στον δίσκο.
Πόσο αξιόπιστο είναι το αποτέλεσμα
Για υπαγόρευση και για ομιλία που έχει ηχογραφηθεί σε φυσιολογικές συνθήκες, τα τοπικά μοντέλα κινούνται σήμερα στην ίδια περιοχή με τις υπηρεσίες cloud. Δεν δημοσιεύουμε ποσοστό ακρίβειας, γιατί ένα νούμερο χωρίς το δικό σας υλικό δεν σημαίνει τίποτα. Οι πηγές λάθους είναι και στις δύο περιπτώσεις οι ίδιες και σχεδόν πάντα αφορούν τον ήχο, όχι το μοντέλο:
- Ποιότητα ηχογράφησης. Ένα μικρόφωνο κοντά στον ομιλητή νικάει κάθε μοντέλο. Η ηχώ της αίθουσας και η απόσταση από το τραπέζι κοστίζουν περισσότερο από την επιλογή λογισμικού.
- Ταυτόχρονη ομιλία. Όταν μιλούν δύο άνθρωποι μαζί, ο ένας αποδίδεται χειρότερα. Ισχύει για κάθε σύστημα.
- Κύρια ονόματα, ακρωνύμια, ορολογία. Επωνυμίες, τοπωνύμια και συντομογραφίες βγαίνουν συχνά ηχητικά εύλογες αλλά γραμμένες λάθος.
- Έντονο ιδίωμα ή προφορά. Η κοινή νεοελληνική αποδίδεται πιο σταθερά από βαριά ιδιώματα.
Ρεαλιστικά: ένα αυτόματο κείμενο είναι προσχέδιο. Γλιτώνει το μεγαλύτερο μέρος της πληκτρολόγησης, δεν αντικαθιστά όμως το πέρασμα με το μάτι — ιδίως εκεί όπου θα παραθέσετε αυτούσια λόγια.
Τι σημαίνει «δεν φεύγει από τη συσκευή» — και τι δεν σημαίνει
Η τοπική επεξεργασία είναι δήλωση για την αρχιτεκτονική: δεν υπάρχει μεταφόρτωση του ηχητικού αρχείου, δεν υπάρχει υπηρεσία που το παραλαμβάνει, άρα δεν υπάρχει και τρίτος πάροχος που το επεξεργάζεται για λογαριασμό σας. Η εφαρμογή δεν ζητά λογαριασμό και δουλεύει και σε λειτουργία πτήσης.
Αυτό που δεν προκύπτει από τα παραπάνω είναι κρίση για τη νομιμότητα της δικής σας επεξεργασίας. Δεν διεκδικούμε καμία πιστοποίηση ή συμμόρφωση με τον ΓΚΠΔ ή τον ν. 4624/2019, και η ΑΠΔΠΧ αναφέρεται εδώ μόνο ως εποπτική αρχή, ποτέ ως φορέας έγκρισης. Από τη στιγμή που ηχογραφείτε ανθρώπους, κρατάτε προσωπικά δεδομένα, και η νομιμότητα εξαρτάται από τον σκοπό, τη νομική βάση και τα εμπλεκόμενα πρόσωπα — ελέγξτε το με τον υπεύθυνο προστασίας δεδομένων ή τον νομικό σας σύμβουλο. Η αρχιτεκτονική απλώς σας απαλλάσσει από ένα ερώτημα που αλλιώς μπαίνει πρώτο: πού πάει ο ήχος.
Όταν στην ηχογράφηση μπαίνουν και άλλοι
Από τη στιγμή που καταγράφονται και άλλα πρόσωπα, το τεχνικό ερώτημα είναι το μικρότερο. Στην Ελλάδα η καταγραφή ιδιωτικής προφορικής ή τηλεφωνικής συνομιλίας χωρίς να το γνωρίζουν οι συμμετέχοντες μπορεί να στοιχειοθετήσει ποινικό αδίκημα κατά το άρθρο 370Α ΠΚ, ενώ το άρθρο 19 του Συντάγματος προστατεύει το απόρρητο των επικοινωνιών και στην παράγραφο 3 απαγορεύει τη χρήση αποδεικτικών μέσων που αποκτήθηκαν κατά παράβασή του. Στον χώρο εργασίας προστίθενται οι κατευθύνσεις της ΑΠΔΠΧ. Πρακτικά: ενημερώνετε πριν αρχίσει η ηχογράφηση, καταγράφετε ότι οι συμμετέχοντες ενημερώθηκαν, και αν κάποιος αρνηθεί δεν ηχογραφείτε. Τα παραπάνω αφορούν την ελληνική έννομη τάξη· σε άλλη δικαιοδοσία, όπως στην Κύπρο, το πλαίσιο είναι διαφορετικό. Είναι ενημέρωση, όχι νομική συμβουλή.
Τοπική αναγνώριση ομιλίας στο Mac
Το Lesskeys είναι εφαρμογή macOS που δουλεύει αποκλειστικά τοπικά: υπαγόρευση σε όλο το σύστημα με μία συντόμευση, και δίπλα απομαγνητοφώνηση συζητήσεων, συνεντεύξεων και αρχείων ήχου ή βίντεο με αυτόματο διαχωρισμό ομιλητών. Αναγνωρίζονται 99 γλώσσες και η γλώσσα εντοπίζεται μόνη της. Το κείμενο της υπαγόρευσης αντιγράφεται στο πρόχειρο και το επικολλάτε εσείς με ⌘V — η εφαρμογή δεν πληκτρολογεί μόνη της μέσα σε άλλα προγράμματα, και είναι σχεδιαστική επιλογή. Η λήψη από το Mac App Store είναι δωρεάν και το Pro ξεκλειδώνει με εφάπαξ αγορά εντός εφαρμογής 49,99 $, ποτέ συνδρομή· στο ελληνικό App Store η χρέωση γίνεται σε ευρώ, οπότε το ποσό σε δολάρια είναι ενδεικτικό. Η δωρεάν έκδοση δίνει 5 λεπτά υπαγόρευσης την ημέρα και 5 απομαγνητοφωνήσεις ήχου συν 5 βίντεο συνολικά — όχι ημερησίως. Η ηχογράφηση δεν μετριέται ποτέ και η επανάληψη της απομαγνητοφώνησης σε κάτι ήδη επεξεργασμένο δεν καταναλώνει όριο.
Αν θέλετε τη σειρά των ενεργειών βήμα βήμα, συνεχίστε στο πώς γίνεται η απομαγνητοφώνηση.
Δωρεάν λήψη, δωρεάν έκδοση με όρια. Χωρίς συνδρομή. · Pro: εφάπαξ αγορά εντός εφαρμογής 49,99 $ (το ελληνικό App Store χρεώνει σε ευρώ) · από macOS 13
Συχνές ερωτήσεις
Τι είναι η τοπική αναγνώριση ομιλίας;
Είναι η μετατροπή του προφορικού λόγου σε κείμενο πάνω στον ίδιο τον υπολογιστή σας. Το γλωσσικό μοντέλο βρίσκεται ως αρχείο στον δίσκο και ο υπολογισμός γίνεται στη GPU της συσκευής, οπότε ο ήχος δεν ανεβαίνει πουθενά. Θα τη βρείτε και ως «αναγνώριση ομιλίας στη συσκευή» ή «απομαγνητοφώνηση χωρίς σύνδεση».
Ποια η διαφορά από την αναγνώριση ομιλίας στο cloud;
Στο cloud η ηχογράφηση μεταφέρεται σε διακομιστή του παρόχου και επεξεργάζεται εκεί, συνήθως με λογαριασμό και χρέωση ανά λεπτό. Τοπικά υπολογίζει ο δικός σας Mac, ο ήχος δεν φεύγει από τη συσκευή και όλα δουλεύουν χωρίς internet — με αντάλλαγμα ότι απαιτείται ικανό υλικό.
Αναγνώριση ομιλίας, σύνθεση ομιλίας και αναγνώριση ομιλητή είναι το ίδιο;
Όχι. Η αναγνώριση ομιλίας μετατρέπει την ομιλία σε κείμενο. Η σύνθεση ομιλίας κάνει το αντίστροφο, διαβάζει κείμενο φωναχτά. Η αναγνώριση ομιλητή απαντά στο ποιος μιλάει, όχι στο τι ειπώθηκε. Το Lesskeys κάνει το πρώτο και το τρίτο, δεν κάνει σύνθεση ομιλίας.
Τι υπολογιστή χρειάζομαι για τοπική αναγνώριση ομιλίας;
Mac με Apple Silicon, δηλαδή M1 ή νεότερο, και τουλάχιστον macOS 13 (Ventura). Οι Mac με Intel δεν υποστηρίζονται καθόλου, επειδή το μοντέλο χρειάζεται τη μνήμη που μοιράζονται επεξεργαστής και GPU.
Πόσο ακριβής είναι η τοπική απομαγνητοφώνηση;
Για καθαρά ηχογραφημένη ομιλία κινείται στην ίδια περιοχή με τις υπηρεσίες cloud, αλλά δεν δημοσιεύουμε ποσοστό γιατί εξαρτάται από τον δικό σας ήχο. Τα λάθη έρχονται κυρίως από κακή ηχογράφηση, ταυτόχρονη ομιλία, κύρια ονόματα και ακρωνύμια. Το αυτόματο κείμενο είναι προσχέδιο και θέλει διόρθωση.
Η τοπική επεξεργασία σημαίνει ότι είμαι νομικά καλυμμένος;
Όχι. Είναι δήλωση για την αρχιτεκτονική: ο ήχος δεν φεύγει από το Mac σας και δεν υπάρχει τρίτος πάροχος που τον επεξεργάζεται. Δεν διεκδικούμε πιστοποίηση ή συμμόρφωση με τον ΓΚΠΔ ή τον ν. 4624/2019. Αν ηχογραφείτε άλλους, ενημερώστε τους πρώτα και ελέγξτε την περίπτωσή σας με τον DPO ή τον νομικό σας σύμβουλο.