Αρχική › Τοπική αναγνώριση ομιλίας

Βασικά · Αναγνώριση ομιλίας στο Mac

Τοπική αναγνώριση ομιλίας: τι σημαίνει στην πράξη

Τοπική αναγνώριση ομιλίας σημαίνει ότι το γλωσσικό μοντέλο τρέχει πάνω στον δικό σας υπολογιστή: ο ήχος μετατρέπεται σε κείμενο εκεί και δεν φεύγει από τη συσκευή. Θα τη συναντήσετε και ως «αναγνώριση ομιλίας στη συσκευή», «on-device» ή «απομαγνητοφώνηση χωρίς σύνδεση».

100%τοπικά στο Mac — ο ήχος δεν ανεβαίνει ποτέ
Δωρεάνλήψη — το Pro ξεκλειδώνει με 49,99 $ εφάπαξ, χωρίς συνδρομή
99γλώσσες, με αυτόματη αναγνώριση
macOS 13+Apple Silicon (M1 ή νεότερος)

Ο ορισμός, χωρίς περιτυλίγματα

Αναγνώριση ομιλίας είναι η αυτόματη μετατροπή του προφορικού λόγου σε γραπτό κείμενο. Το ερώτημα που ξεχωρίζει τις υλοποιήσεις μεταξύ τους δεν είναι αν δουλεύει, αλλά πού γίνεται ο υπολογισμός. Στην εκδοχή cloud η εφαρμογή παίρνει τον ήχο σας, τον ανεβάζει σε διακομιστή του παρόχου, εκεί τρέχει το μοντέλο, και το έτοιμο κείμενο επιστρέφει. Στην τοπική εκδοχή το ίδιο μοντέλο κάθεται ως αρχείο στον δίσκο σας και ο υπολογισμός γίνεται στη μνήμη και στην GPU του μηχανήματός σας. Η διαδρομή των δεδομένων είναι σύντομη: μικρόφωνο ή αρχείο μέσα, κείμενο έξω, χωρίς δίκτυο ενδιάμεσα.

Δεν πρόκειται για λεπτομέρεια μάρκετινγκ αλλά για αρχιτεκτονική απόφαση με πολύ συγκεκριμένες συνέπειες: στην εμπιστευτικότητα, στη δυνατότητα να δουλέψετε χωρίς σύνδεση, στο κόστος και στις απαιτήσεις από το υλικό σας.

Τρεις όροι που μπερδεύονται διαρκώς στα ελληνικά

Πριν προχωρήσουμε, μια διευκρίνιση που λύνει πραγματική σύγχυση: τρεις διαφορετικές τεχνολογίες μοιράζονται σχεδόν την ίδια ονομασία.

Το Lesskeys κάνει το πρώτο και το τρίτο. Δεν κάνει σύνθεση ομιλίας: δεν διαβάζει κείμενα φωναχτά. Το τελικό προϊόν το λέμε στα ελληνικά απομαγνητοφώνηση — ο όρος που χρησιμοποιούν δικηγορικά γραφεία, δημοσιογράφοι, γραμματείες και ερευνητές. Η λέξη «μεταγραφή» ακούγεται περιστασιακά ως συνώνυμο, αλλά στα ελληνικά παραπέμπει πρώτα σε ποδοσφαιρική ή φοιτητική μεταγραφή, γι' αυτό την αποφεύγουμε.

Τοπικά ή cloud: η διαφορά στην πράξη

Και οι δύο προσεγγίσεις δίνουν σήμερα χρήσιμα αποτελέσματα. Διαφέρουν σε ό,τι συμβαίνει πέρα από το κείμενο.

Τοπικά (στη συσκευή)Cloud
Πού γίνεται η επεξεργασίαΣτον υπολογιστή σαςΣε διακομιστή του παρόχου
Ο ήχος φεύγει από τη συσκευήΌχιΝαι
Λειτουργεί χωρίς internetΝαιΌχι
Απαιτεί λογαριασμόΌχιΣυνήθως ναι
Μοντέλο κόστουςΣυχνά εφάπαξΣυνήθως ανά λεπτό ή συνδρομή
Απαιτήσεις από το υλικόΥψηλές — χρειάζεται σύγχρονη GPUΧαμηλές
Παλιός ή μη Apple υπολογιστήςΔεν υποστηρίζεταιΔουλεύει
Χρόνος σε μεγάλες ηχογραφήσειςΕξαρτάται από το μηχάνημά σαςΕξαρτάται από τον φόρτο του παρόχου

Οι τρεις τελευταίες γραμμές είναι η τίμια άλλη όψη: η τοπική επεξεργασία μεταφέρει τον υπολογιστικό φόρτο σε εσάς. Μια δίωρη συνέντευξη απασχολεί αισθητά τον υπολογιστή σας όσο απομαγνητοφωνείται, και αν δουλεύετε σε μηχάνημα που δεν πληροί τις απαιτήσεις, η τοπική λύση απλώς δεν είναι επιλογή. Σε αντάλλαγμα δεν δημιουργείται αντίγραφο του ήχου σας σε μέρος που δεν ελέγχετε.

Γιατί χρειάζεται Mac με Apple Silicon

Ένα σύγχρονο μοντέλο αναγνώρισης ομιλίας έχει από μερικές εκατοντάδες εκατομμύρια έως λίγα δισεκατομμύρια παραμέτρους. Για να τρέξει η απομαγνητοφώνηση σε λογικό χρόνο, οι πράξεις πρέπει να εκτελεστούν στη γραφική μονάδα και το μοντέλο πρέπει να χωράει στη μνήμη που μοιράζονται επεξεργαστής και GPU.

Αυτό ακριβώς προσφέρει η ενοποιημένη μνήμη του Apple Silicon: επεξεργαστής και GPU βλέπουν την ίδια μνήμη, οπότε το μοντέλο δεν χρειάζεται να αντιγράφεται συνεχώς από τη μια περιοχή στην άλλη. Σε Mac με επεξεργαστή Intel αυτή η προϋπόθεση δεν υπάρχει. Γι' αυτό το Lesskeys είναι εφαρμογή αποκλειστικά για Apple Silicon: Mac με M1 ή νεότερο είναι απαίτηση, όχι σύσταση — σε Mac με Intel απλώς δεν εκκινεί. Ελάχιστο λειτουργικό: macOS 13 (Ventura). Το γλωσσικό μοντέλο κατεβαίνει μία φορά και μετά μένει στον δίσκο.

Πόσο αξιόπιστο είναι το αποτέλεσμα

Για υπαγόρευση και για ομιλία που έχει ηχογραφηθεί σε φυσιολογικές συνθήκες, τα τοπικά μοντέλα κινούνται σήμερα στην ίδια περιοχή με τις υπηρεσίες cloud. Δεν δημοσιεύουμε ποσοστό ακρίβειας, γιατί ένα νούμερο χωρίς το δικό σας υλικό δεν σημαίνει τίποτα. Οι πηγές λάθους είναι και στις δύο περιπτώσεις οι ίδιες και σχεδόν πάντα αφορούν τον ήχο, όχι το μοντέλο:

Ρεαλιστικά: ένα αυτόματο κείμενο είναι προσχέδιο. Γλιτώνει το μεγαλύτερο μέρος της πληκτρολόγησης, δεν αντικαθιστά όμως το πέρασμα με το μάτι — ιδίως εκεί όπου θα παραθέσετε αυτούσια λόγια.

Τι σημαίνει «δεν φεύγει από τη συσκευή» — και τι δεν σημαίνει

Η τοπική επεξεργασία είναι δήλωση για την αρχιτεκτονική: δεν υπάρχει μεταφόρτωση του ηχητικού αρχείου, δεν υπάρχει υπηρεσία που το παραλαμβάνει, άρα δεν υπάρχει και τρίτος πάροχος που το επεξεργάζεται για λογαριασμό σας. Η εφαρμογή δεν ζητά λογαριασμό και δουλεύει και σε λειτουργία πτήσης.

Αυτό που δεν προκύπτει από τα παραπάνω είναι κρίση για τη νομιμότητα της δικής σας επεξεργασίας. Δεν διεκδικούμε καμία πιστοποίηση ή συμμόρφωση με τον ΓΚΠΔ ή τον ν. 4624/2019, και η ΑΠΔΠΧ αναφέρεται εδώ μόνο ως εποπτική αρχή, ποτέ ως φορέας έγκρισης. Από τη στιγμή που ηχογραφείτε ανθρώπους, κρατάτε προσωπικά δεδομένα, και η νομιμότητα εξαρτάται από τον σκοπό, τη νομική βάση και τα εμπλεκόμενα πρόσωπα — ελέγξτε το με τον υπεύθυνο προστασίας δεδομένων ή τον νομικό σας σύμβουλο. Η αρχιτεκτονική απλώς σας απαλλάσσει από ένα ερώτημα που αλλιώς μπαίνει πρώτο: πού πάει ο ήχος.

Όταν στην ηχογράφηση μπαίνουν και άλλοι

Από τη στιγμή που καταγράφονται και άλλα πρόσωπα, το τεχνικό ερώτημα είναι το μικρότερο. Στην Ελλάδα η καταγραφή ιδιωτικής προφορικής ή τηλεφωνικής συνομιλίας χωρίς να το γνωρίζουν οι συμμετέχοντες μπορεί να στοιχειοθετήσει ποινικό αδίκημα κατά το άρθρο 370Α ΠΚ, ενώ το άρθρο 19 του Συντάγματος προστατεύει το απόρρητο των επικοινωνιών και στην παράγραφο 3 απαγορεύει τη χρήση αποδεικτικών μέσων που αποκτήθηκαν κατά παράβασή του. Στον χώρο εργασίας προστίθενται οι κατευθύνσεις της ΑΠΔΠΧ. Πρακτικά: ενημερώνετε πριν αρχίσει η ηχογράφηση, καταγράφετε ότι οι συμμετέχοντες ενημερώθηκαν, και αν κάποιος αρνηθεί δεν ηχογραφείτε. Τα παραπάνω αφορούν την ελληνική έννομη τάξη· σε άλλη δικαιοδοσία, όπως στην Κύπρο, το πλαίσιο είναι διαφορετικό. Είναι ενημέρωση, όχι νομική συμβουλή.

Τοπική αναγνώριση ομιλίας στο Mac

Το Lesskeys είναι εφαρμογή macOS που δουλεύει αποκλειστικά τοπικά: υπαγόρευση σε όλο το σύστημα με μία συντόμευση, και δίπλα απομαγνητοφώνηση συζητήσεων, συνεντεύξεων και αρχείων ήχου ή βίντεο με αυτόματο διαχωρισμό ομιλητών. Αναγνωρίζονται 99 γλώσσες και η γλώσσα εντοπίζεται μόνη της. Το κείμενο της υπαγόρευσης αντιγράφεται στο πρόχειρο και το επικολλάτε εσείς με ⌘V — η εφαρμογή δεν πληκτρολογεί μόνη της μέσα σε άλλα προγράμματα, και είναι σχεδιαστική επιλογή. Η λήψη από το Mac App Store είναι δωρεάν και το Pro ξεκλειδώνει με εφάπαξ αγορά εντός εφαρμογής 49,99 $, ποτέ συνδρομή· στο ελληνικό App Store η χρέωση γίνεται σε ευρώ, οπότε το ποσό σε δολάρια είναι ενδεικτικό. Η δωρεάν έκδοση δίνει 5 λεπτά υπαγόρευσης την ημέρα και 5 απομαγνητοφωνήσεις ήχου συν 5 βίντεο συνολικά — όχι ημερησίως. Η ηχογράφηση δεν μετριέται ποτέ και η επανάληψη της απομαγνητοφώνησης σε κάτι ήδη επεξεργασμένο δεν καταναλώνει όριο.

Αν θέλετε τη σειρά των ενεργειών βήμα βήμα, συνεχίστε στο πώς γίνεται η απομαγνητοφώνηση.

Λήψη από το Mac App Store

Δωρεάν λήψη, δωρεάν έκδοση με όρια. Χωρίς συνδρομή. · Pro: εφάπαξ αγορά εντός εφαρμογής 49,99 $ (το ελληνικό App Store χρεώνει σε ευρώ) · από macOS 13

Συχνές ερωτήσεις

Τι είναι η τοπική αναγνώριση ομιλίας;

Είναι η μετατροπή του προφορικού λόγου σε κείμενο πάνω στον ίδιο τον υπολογιστή σας. Το γλωσσικό μοντέλο βρίσκεται ως αρχείο στον δίσκο και ο υπολογισμός γίνεται στη GPU της συσκευής, οπότε ο ήχος δεν ανεβαίνει πουθενά. Θα τη βρείτε και ως «αναγνώριση ομιλίας στη συσκευή» ή «απομαγνητοφώνηση χωρίς σύνδεση».

Ποια η διαφορά από την αναγνώριση ομιλίας στο cloud;

Στο cloud η ηχογράφηση μεταφέρεται σε διακομιστή του παρόχου και επεξεργάζεται εκεί, συνήθως με λογαριασμό και χρέωση ανά λεπτό. Τοπικά υπολογίζει ο δικός σας Mac, ο ήχος δεν φεύγει από τη συσκευή και όλα δουλεύουν χωρίς internet — με αντάλλαγμα ότι απαιτείται ικανό υλικό.

Αναγνώριση ομιλίας, σύνθεση ομιλίας και αναγνώριση ομιλητή είναι το ίδιο;

Όχι. Η αναγνώριση ομιλίας μετατρέπει την ομιλία σε κείμενο. Η σύνθεση ομιλίας κάνει το αντίστροφο, διαβάζει κείμενο φωναχτά. Η αναγνώριση ομιλητή απαντά στο ποιος μιλάει, όχι στο τι ειπώθηκε. Το Lesskeys κάνει το πρώτο και το τρίτο, δεν κάνει σύνθεση ομιλίας.

Τι υπολογιστή χρειάζομαι για τοπική αναγνώριση ομιλίας;

Mac με Apple Silicon, δηλαδή M1 ή νεότερο, και τουλάχιστον macOS 13 (Ventura). Οι Mac με Intel δεν υποστηρίζονται καθόλου, επειδή το μοντέλο χρειάζεται τη μνήμη που μοιράζονται επεξεργαστής και GPU.

Πόσο ακριβής είναι η τοπική απομαγνητοφώνηση;

Για καθαρά ηχογραφημένη ομιλία κινείται στην ίδια περιοχή με τις υπηρεσίες cloud, αλλά δεν δημοσιεύουμε ποσοστό γιατί εξαρτάται από τον δικό σας ήχο. Τα λάθη έρχονται κυρίως από κακή ηχογράφηση, ταυτόχρονη ομιλία, κύρια ονόματα και ακρωνύμια. Το αυτόματο κείμενο είναι προσχέδιο και θέλει διόρθωση.

Η τοπική επεξεργασία σημαίνει ότι είμαι νομικά καλυμμένος;

Όχι. Είναι δήλωση για την αρχιτεκτονική: ο ήχος δεν φεύγει από το Mac σας και δεν υπάρχει τρίτος πάροχος που τον επεξεργάζεται. Δεν διεκδικούμε πιστοποίηση ή συμμόρφωση με τον ΓΚΠΔ ή τον ν. 4624/2019. Αν ηχογραφείτε άλλους, ενημερώστε τους πρώτα και ελέγξτε την περίπτωσή σας με τον DPO ή τον νομικό σας σύμβουλο.

Σχετικά θέματα