Acasă › Recunoaștere vocală locală
Noțiuni de bază · recunoaștere vocală pe Mac
Recunoaștere vocală locală: ce înseamnă tehnic
Recunoaștere vocală locală înseamnă că modelul care ascultă rulează pe calculatorul tău: înregistrarea se transformă în text acolo și nu pleacă de pe disc. Se mai spune „procesare pe dispozitiv”, „recunoaștere vocală offline” sau „transcriere locală” — sunt același lucru.
Definiția, fără ocolișuri
Recunoașterea vocală este transformarea automată a vorbirii în text scris. Pentru pagina asta nu contează dacă funcționează, ci unde se face calculul, pentru că de acolo vin toate consecințele practice.
În varianta din cloud, aplicația înregistrează, urcă fișierul audio pe serverul furnizorului, modelul rulează acolo, iar textul se întoarce la tine prin rețea. În varianta locală, un model de același tip stă ca fișier pe discul tău, iar calculul se face în memoria și pe procesorul grafic al Mac-ului. Drumul datelor devine scurt: intră sunetul de la microfon sau dintr-un fișier, iese textul, fără nimic la mijloc.
Nu este un detaliu de marketing, ci o decizie de arhitectură cu urmări foarte concrete: cine ajunge să dețină o copie a înregistrării, dacă poți lucra fără internet, cum se plătește și ce hardware îți trebuie.
Cloud sau local: diferența în practică
Ambele abordări dau azi rezultate utilizabile. Diferența nu stă atât în calitatea textului, cât în tot ce se mai întâmplă în jurul lui.
| Aspect | Local (pe dispozitiv) | Cloud |
|---|---|---|
| Unde se face calculul | Pe Mac-ul tău | Pe serverul furnizorului |
| Fișierul audio pleacă de pe calculator | Nu | Da |
| Merge fără internet | Da | Nu |
| Cont de utilizator | Nu e nevoie | De regulă da |
| Model de cost | De obicei o plată unică | Cel mai des pe minut sau abonament |
| Cerințe hardware | Mari — e nevoie de un procesor recent | Mici |
| Durata la înregistrări lungi | Depinde de calculatorul tău | Depinde de încărcarea serverului |
Ultimele două rânduri sunt partea onestă a poveștii: procesarea locală mută efortul de calcul la tine. Un interviu de două ore ține Mac-ul ocupat vizibil cât timp îl transcrie, iar ventilatorul se aude. În schimb nu apare nicăieri o copie a înregistrării într-un loc pe care nu îl controlezi.
De ce e obligatoriu Apple Silicon
Un model modern de recunoaștere vocală are de la câteva sute de milioane până la câteva miliarde de parametri. Ca transcrierea să meargă mai repede decât durata înregistrării, operațiile trebuie executate pe unitatea grafică, iar modelul trebuie să încapă în memoria la care ajung împreună și procesorul, și unitatea grafică.
Exact asta face memoria unificată de pe Apple Silicon: procesorul și GPU-ul folosesc același spațiu de memorie, deci modelul nu trebuie copiat înainte și înapoi între două zone separate. Pe Mac-urile cu procesor Intel această condiție nu există. De aceea Lesskeys rulează exclusiv pe Apple Silicon: un Mac cu M1 sau mai nou este o cerință, nu o recomandare. Pe hardware Intel aplicația nu pornește. Sistemul de operare trebuie să fie macOS 13 (Ventura) sau mai nou.
Verifici în meniul Apple, la „About This Mac” („Despre acest Mac”): dacă la procesor scrie „Apple M…”, ești în regulă.
Cât de exactă e recunoașterea vocală pe română
Aici merită spus limpede ce se poate și ce nu, pentru că o promisiune umflată strică fix pagina care ar trebui să construiască încredere. Modelele multilingve au fost antrenate pe mult mai multe ore de engleză decât de română, iar diferența se vede. Pe vorbire îngrijită, cu microfon apropiat, textul rezultat e bun și scutește cea mai mare parte din tastare. Problemele apar previzibil:
- Regionalisme și vorbire foarte rapidă. Pronunția neîngrijită sau accentuat regională scade precizia mai mult decât la engleză.
- Jargon profesional. Termenii juridici, medicali sau tehnici sunt adesea scriși plauzibil fonetic, dar greșit.
- Nume proprii românești. Numele de persoane, localități și instituții sunt cel mai frecvent loc în care trebuie să intervii.
- Cifre dictate repede. Sume, numere de dosar, date calendaristice și numere de telefon cer verificare, indiferent de aplicație.
- Diacriticele și punctuația. Vin din model, nu dintr-o regulă fixă. De cele mai multe ori sunt corecte, dar o corectură finală rămâne necesară — mai ales dacă textul urmează să fie publicat sau citat.
- Vorbire suprapusă. Când două persoane vorbesc simultan, una dintre ele iese mai prost. Asta e valabil pentru orice sistem, local sau din cloud.
Concluzia realistă: o transcriere automată este o ciornă. Îți ia din brațe partea plictisitoare, dar nu înlocuiește citirea pe curat.
Ce înseamnă „nu părăsește Mac-ul” — și ce nu înseamnă
Procesarea locală este o afirmație despre arhitectură: nu există încărcare a fișierului audio, nu există un serviciu care să primească înregistrarea și, prin urmare, nu există un furnizor care să prelucreze materialul în numele tău. Lesskeys nu cere cont și funcționează cu Mac-ul deconectat de la rețea.
Ce nu decurge de aici: o concluzie despre legalitatea prelucrării tale concrete. Dacă ai voie să înregistrezi, să păstrezi și să analizezi o anumită discuție ține de scop, de persoanele implicate și de organizația ta. Evaluarea temeiului legal revine operatorului de date — în practică responsabilului cu protecția datelor sau juristului tău. Cadrul pe care îl verifici cu ei este legislația europeană aplicată prin Legea 190/2018, iar autoritatea de supraveghere este ANSPDCP. Noi nu dăm opinii juridice, nu certificăm nimic și nu afirmăm conformitatea produsului. Arhitectura îți răspunde doar la prima întrebare care se pune de obicei: unde ajunge înregistrarea.
Când în înregistrare apar și alți oameni
Din momentul în care înregistrezi o discuție cu alte persoane, partea tehnică e cea ușoară. În România, înregistrarea unei convorbiri la care ești tu însuți parte nu intră sub art. 302 din Codul penal — acel text vizează interceptarea comunicărilor dintre alții. Rămân însă drepturile nepatrimoniale din Codul civil: art. 71 protejează viața privată, iar art. 74 lit. c) enumeră expres captarea sau utilizarea vocii unei persoane aflate într-un spațiu privat fără acordul ei. Practic: anunță înainte de a porni înregistrarea, notează acordul, iar dacă cineva se opune, nu înregistra.
Într-o firmă apare un strat în plus: monitorizarea angajaților este condiționată de art. 5 din Legea 190/2018 — informare prealabilă, consultarea sindicatului sau a reprezentanților salariaților, proporționalitate și un termen limitat de păstrare. Acestea sunt informații, nu consultanță juridică.
Termenii care se confundă
În română circulă mai multe denumiri pentru același lucru, ceea ce face căutarea inutil de grea. „Recunoaștere vocală locală”, „procesare pe dispozitiv”, „recunoaștere vocală offline” și „transcriere fără cloud” descriu toate prelucrarea pe propriul calculator. Nu e același lucru cu recunoașterea vorbitorului, care răspunde la întrebarea cine a vorbit, nu la ce s-a spus; abia cele două împreună dau o transcriere lizibilă a unei discuții. Și nici cu sinteza vocală, care merge invers, din text în voce.
Recunoaștere vocală locală pe Mac, concret
Lesskeys este o aplicație macOS care lucrează exclusiv local: dictare la nivel de sistem printr-o scurtătură de tastatură și, separat, transcrierea discuțiilor, interviurilor și a fișierelor audio sau video, cu separarea automată a vorbitorilor. Sunt acoperite 99 de limbi, iar limba este detectată automat. Textul dictat ajunge în clipboard și îl lipești tu cu ⌘V — aplicația nu scrie singură în alte programe.
Descărcarea este gratuită, iar versiunea completă se deblochează cu o achiziție unică în aplicație de 49,99 $, fără abonament. Versiunea gratuită include 5 minute de dictare pe zi și 5 transcrieri audio plus 5 video în total; înregistrarea nu este niciodată contorizată, iar re-transcrierea unui material deja transcris nu consumă din limită. Prețul este cel afișat în dolari; în App Store-ul din România vezi suma corespunzătoare în lei.
Dacă vrei să vezi pașii concreți, continuă cu cum transformi vocea în text pe Mac.
Descărcare gratuită. Plătești o singură dată. Fără abonament. · Pro: 49,99 $ o singură dată, achiziție în aplicație (în App Store România prețul apare în lei) · macOS 13 sau mai nou
Întrebări frecvente
Ce înseamnă recunoaștere vocală locală?
Înseamnă că modelul care transformă vorbirea în text rulează pe calculatorul tău: stă ca fișier pe disc și calculează pe procesorul grafic, iar fișierul audio nu este încărcat nicăieri. Se mai numește procesare pe dispozitiv, recunoaștere vocală offline sau transcriere locală.
Prin ce diferă de recunoașterea vocală din cloud?
În cloud, înregistrarea se transmite pe serverul furnizorului și se procesează acolo, de obicei cu un cont și cu plată pe minut sau abonament. Local, calculează Mac-ul tău, înregistrarea nu pleacă de pe disc și totul merge fără internet — în schimb ai nevoie de hardware recent.
Cât de bine se descurcă pe limba română?
Pe vorbire îngrijită și cu microfonul aproape, rezultatul este bun și scutește majoritatea tastării. Greșește mai des la regionalisme, jargon profesional, nume proprii românești și cifre dictate rapid, iar diacriticele și punctuația cer o corectură finală. O transcriere automată rămâne o ciornă.
Ce hardware îmi trebuie?
Un Mac cu Apple Silicon, adică M1 sau mai nou, și cel puțin macOS 13 (Ventura). Mac-urile cu procesor Intel nu sunt acceptate, pentru că modelul are nevoie de memoria unificată la care ajung împreună procesorul și unitatea grafică. Verifici în meniul Apple, la „About This Mac”.
Procesarea locală rezolvă automat partea de protecție a datelor?
Nu. Procesarea locală descrie arhitectura: fișierul audio nu părăsește Mac-ul și nu există un furnizor care să îl primească. Dacă ai voie să înregistrezi și să analizezi o anumită discuție se evaluează de operatorul de date, în practică de responsabilul cu protecția datelor sau de juristul tău, în cadrul dat de Legea 190/2018 și supravegheat de ANSPDCP. Noi nu certificăm nimic.
Pot înregistra o discuție fără să spun nimic?
Nu este recomandat. Chiar dacă ești parte la conversație și nu intri sub art. 302 din Codul penal, rămân aplicabile art. 71 și art. 74 lit. c) din Codul civil, care protejează viața privată și acordul persoanei pentru captarea vocii într-un spațiu privat. Anunță înainte, notează acordul și nu înregistra dacă cineva se opune.