Acasă › Recunoaștere vocală locală

Noțiuni de bază · recunoaștere vocală pe Mac

Recunoaștere vocală locală: ce înseamnă tehnic

Recunoaștere vocală locală înseamnă că modelul care ascultă rulează pe calculatorul tău: înregistrarea se transformă în text acolo și nu pleacă de pe disc. Se mai spune „procesare pe dispozitiv”, „recunoaștere vocală offline” sau „transcriere locală” — sunt același lucru.

100%local pe Mac — audio nu se încarcă nicăieri
Gratuitde descărcat — Pro se deblochează cu o singură plată de 49,99 $
99de limbi, detectate automat
macOS 13+Apple Silicon (M1 sau mai nou), obligatoriu

Definiția, fără ocolișuri

Recunoașterea vocală este transformarea automată a vorbirii în text scris. Pentru pagina asta nu contează dacă funcționează, ci unde se face calculul, pentru că de acolo vin toate consecințele practice.

În varianta din cloud, aplicația înregistrează, urcă fișierul audio pe serverul furnizorului, modelul rulează acolo, iar textul se întoarce la tine prin rețea. În varianta locală, un model de același tip stă ca fișier pe discul tău, iar calculul se face în memoria și pe procesorul grafic al Mac-ului. Drumul datelor devine scurt: intră sunetul de la microfon sau dintr-un fișier, iese textul, fără nimic la mijloc.

Nu este un detaliu de marketing, ci o decizie de arhitectură cu urmări foarte concrete: cine ajunge să dețină o copie a înregistrării, dacă poți lucra fără internet, cum se plătește și ce hardware îți trebuie.

Cloud sau local: diferența în practică

Ambele abordări dau azi rezultate utilizabile. Diferența nu stă atât în calitatea textului, cât în tot ce se mai întâmplă în jurul lui.

AspectLocal (pe dispozitiv)Cloud
Unde se face calcululPe Mac-ul tăuPe serverul furnizorului
Fișierul audio pleacă de pe calculatorNuDa
Merge fără internetDaNu
Cont de utilizatorNu e nevoieDe regulă da
Model de costDe obicei o plată unicăCel mai des pe minut sau abonament
Cerințe hardwareMari — e nevoie de un procesor recentMici
Durata la înregistrări lungiDepinde de calculatorul tăuDepinde de încărcarea serverului

Ultimele două rânduri sunt partea onestă a poveștii: procesarea locală mută efortul de calcul la tine. Un interviu de două ore ține Mac-ul ocupat vizibil cât timp îl transcrie, iar ventilatorul se aude. În schimb nu apare nicăieri o copie a înregistrării într-un loc pe care nu îl controlezi.

De ce e obligatoriu Apple Silicon

Un model modern de recunoaștere vocală are de la câteva sute de milioane până la câteva miliarde de parametri. Ca transcrierea să meargă mai repede decât durata înregistrării, operațiile trebuie executate pe unitatea grafică, iar modelul trebuie să încapă în memoria la care ajung împreună și procesorul, și unitatea grafică.

Exact asta face memoria unificată de pe Apple Silicon: procesorul și GPU-ul folosesc același spațiu de memorie, deci modelul nu trebuie copiat înainte și înapoi între două zone separate. Pe Mac-urile cu procesor Intel această condiție nu există. De aceea Lesskeys rulează exclusiv pe Apple Silicon: un Mac cu M1 sau mai nou este o cerință, nu o recomandare. Pe hardware Intel aplicația nu pornește. Sistemul de operare trebuie să fie macOS 13 (Ventura) sau mai nou.

Verifici în meniul Apple, la „About This Mac” („Despre acest Mac”): dacă la procesor scrie „Apple M…”, ești în regulă.

Cât de exactă e recunoașterea vocală pe română

Aici merită spus limpede ce se poate și ce nu, pentru că o promisiune umflată strică fix pagina care ar trebui să construiască încredere. Modelele multilingve au fost antrenate pe mult mai multe ore de engleză decât de română, iar diferența se vede. Pe vorbire îngrijită, cu microfon apropiat, textul rezultat e bun și scutește cea mai mare parte din tastare. Problemele apar previzibil:

Concluzia realistă: o transcriere automată este o ciornă. Îți ia din brațe partea plictisitoare, dar nu înlocuiește citirea pe curat.

Ce înseamnă „nu părăsește Mac-ul” — și ce nu înseamnă

Procesarea locală este o afirmație despre arhitectură: nu există încărcare a fișierului audio, nu există un serviciu care să primească înregistrarea și, prin urmare, nu există un furnizor care să prelucreze materialul în numele tău. Lesskeys nu cere cont și funcționează cu Mac-ul deconectat de la rețea.

Ce nu decurge de aici: o concluzie despre legalitatea prelucrării tale concrete. Dacă ai voie să înregistrezi, să păstrezi și să analizezi o anumită discuție ține de scop, de persoanele implicate și de organizația ta. Evaluarea temeiului legal revine operatorului de date — în practică responsabilului cu protecția datelor sau juristului tău. Cadrul pe care îl verifici cu ei este legislația europeană aplicată prin Legea 190/2018, iar autoritatea de supraveghere este ANSPDCP. Noi nu dăm opinii juridice, nu certificăm nimic și nu afirmăm conformitatea produsului. Arhitectura îți răspunde doar la prima întrebare care se pune de obicei: unde ajunge înregistrarea.

Când în înregistrare apar și alți oameni

Din momentul în care înregistrezi o discuție cu alte persoane, partea tehnică e cea ușoară. În România, înregistrarea unei convorbiri la care ești tu însuți parte nu intră sub art. 302 din Codul penal — acel text vizează interceptarea comunicărilor dintre alții. Rămân însă drepturile nepatrimoniale din Codul civil: art. 71 protejează viața privată, iar art. 74 lit. c) enumeră expres captarea sau utilizarea vocii unei persoane aflate într-un spațiu privat fără acordul ei. Practic: anunță înainte de a porni înregistrarea, notează acordul, iar dacă cineva se opune, nu înregistra.

Într-o firmă apare un strat în plus: monitorizarea angajaților este condiționată de art. 5 din Legea 190/2018 — informare prealabilă, consultarea sindicatului sau a reprezentanților salariaților, proporționalitate și un termen limitat de păstrare. Acestea sunt informații, nu consultanță juridică.

Termenii care se confundă

În română circulă mai multe denumiri pentru același lucru, ceea ce face căutarea inutil de grea. „Recunoaștere vocală locală”, „procesare pe dispozitiv”, „recunoaștere vocală offline” și „transcriere fără cloud” descriu toate prelucrarea pe propriul calculator. Nu e același lucru cu recunoașterea vorbitorului, care răspunde la întrebarea cine a vorbit, nu la ce s-a spus; abia cele două împreună dau o transcriere lizibilă a unei discuții. Și nici cu sinteza vocală, care merge invers, din text în voce.

Recunoaștere vocală locală pe Mac, concret

Lesskeys este o aplicație macOS care lucrează exclusiv local: dictare la nivel de sistem printr-o scurtătură de tastatură și, separat, transcrierea discuțiilor, interviurilor și a fișierelor audio sau video, cu separarea automată a vorbitorilor. Sunt acoperite 99 de limbi, iar limba este detectată automat. Textul dictat ajunge în clipboard și îl lipești tu cu ⌘V — aplicația nu scrie singură în alte programe.

Descărcarea este gratuită, iar versiunea completă se deblochează cu o achiziție unică în aplicație de 49,99 $, fără abonament. Versiunea gratuită include 5 minute de dictare pe zi și 5 transcrieri audio plus 5 video în total; înregistrarea nu este niciodată contorizată, iar re-transcrierea unui material deja transcris nu consumă din limită. Prețul este cel afișat în dolari; în App Store-ul din România vezi suma corespunzătoare în lei.

Dacă vrei să vezi pașii concreți, continuă cu cum transformi vocea în text pe Mac.

Descarcă din Mac App Store

Descărcare gratuită. Plătești o singură dată. Fără abonament. · Pro: 49,99 $ o singură dată, achiziție în aplicație (în App Store România prețul apare în lei) · macOS 13 sau mai nou

Întrebări frecvente

Ce înseamnă recunoaștere vocală locală?

Înseamnă că modelul care transformă vorbirea în text rulează pe calculatorul tău: stă ca fișier pe disc și calculează pe procesorul grafic, iar fișierul audio nu este încărcat nicăieri. Se mai numește procesare pe dispozitiv, recunoaștere vocală offline sau transcriere locală.

Prin ce diferă de recunoașterea vocală din cloud?

În cloud, înregistrarea se transmite pe serverul furnizorului și se procesează acolo, de obicei cu un cont și cu plată pe minut sau abonament. Local, calculează Mac-ul tău, înregistrarea nu pleacă de pe disc și totul merge fără internet — în schimb ai nevoie de hardware recent.

Cât de bine se descurcă pe limba română?

Pe vorbire îngrijită și cu microfonul aproape, rezultatul este bun și scutește majoritatea tastării. Greșește mai des la regionalisme, jargon profesional, nume proprii românești și cifre dictate rapid, iar diacriticele și punctuația cer o corectură finală. O transcriere automată rămâne o ciornă.

Ce hardware îmi trebuie?

Un Mac cu Apple Silicon, adică M1 sau mai nou, și cel puțin macOS 13 (Ventura). Mac-urile cu procesor Intel nu sunt acceptate, pentru că modelul are nevoie de memoria unificată la care ajung împreună procesorul și unitatea grafică. Verifici în meniul Apple, la „About This Mac”.

Procesarea locală rezolvă automat partea de protecție a datelor?

Nu. Procesarea locală descrie arhitectura: fișierul audio nu părăsește Mac-ul și nu există un furnizor care să îl primească. Dacă ai voie să înregistrezi și să analizezi o anumită discuție se evaluează de operatorul de date, în practică de responsabilul cu protecția datelor sau de juristul tău, în cadrul dat de Legea 190/2018 și supravegheat de ANSPDCP. Noi nu certificăm nimic.

Pot înregistra o discuție fără să spun nimic?

Nu este recomandat. Chiar dacă ești parte la conversație și nu intri sub art. 302 din Codul penal, rămân aplicabile art. 71 și art. 74 lit. c) din Codul civil, care protejează viața privată și acordul persoanei pentru captarea vocii într-un spațiu privat. Anunță înainte, notează acordul și nu înregistra dacă cineva se opune.

Vezi și