Acasă › Cine a vorbit
Separare pe vorbitori · local pe Mac
Cine a vorbit: transcriere separată pe vorbitori
O transcriere în care nu se vede cine ce a spus este aproape inutilă la un interviu sau la o ședință. Aplicația împarte automat înregistrarea pe voci, le poți da nume, iar aceleași persoane sunt recunoscute și data viitoare — cu tot calculul făcut pe Mac-ul tău.
Ce face, concret
După ce transcrierea e gata, textul nu apare ca un bloc continuu. Înregistrarea este mai întâi împărțită pe voci distincte, apoi fiecare fragment primește o etichetă de vorbitor și poziția lui în audio. Rezultatul arată ca un dialog, nu ca o pagină de text neîntrerupt:
- Vorbitor 1 · 00:04 — „Hai să reluăm de la bugetul pe trimestrul următor.”
- Vorbitor 2 · 00:11 — „Am pregătit cifrele, dar lipsesc datele de la achiziții.”
- Vorbitor 1 · 00:19 — „Le cerem azi și le punem în minută.”
Diferența practică e mare. Cu etichete poți urmări o singură persoană prin toată discuția, poți extrage exact ce a spus un intervievat și poți verifica rapid o afirmație, pentru că marcajul de timp te duce direct la locul din înregistrare. Termenul de specialitate pentru operația asta este diarizare, dar nu ai nevoie de el ca să o folosești.
Nume, nu „Vorbitor 3”
Etichetele generice sunt doar punctul de plecare. Le înlocuiești cu numele reale direct în transcriere, iar schimbarea se aplică la toate fragmentele persoanei respective, nu unul câte unul. De aici încolo transcrierea devine citibilă de altcineva decât tine — un coleg, un coordonator de lucrare, un client.
Când dai un nume, se păstrează local un profil vocal, adică o reprezentare numerică a felului în care sună vocea respectivă. La înregistrarea următoare, aceeași persoană este recunoscută automat și primește direct numele, fără să o mai etichetezi. Pentru o echipă care se întâlnește săptămânal, asta înseamnă că după două-trei ședințe transcrierile vin deja completate.
Profilurile rămân pe Mac-ul tău, în fișierele aplicației. Nu sunt trimise nicăieri, nu există un cont în care să fie sincronizate și le poți șterge oricând.
Unde greșește — spus deschis
Separarea pe vorbitori este partea cea mai fragilă a oricărei transcrieri automate, aici sau altundeva. Merită să știi dinainte unde se încurcă, ca să nu construiești pe ea așteptări false:
| Situație | Ce se întâmplă |
|---|---|
| Doi oameni vorbesc simultan | Fragmentul suprapus ajunge la un singur vorbitor, iar celălalt se pierde parțial. |
| Microfon depărtat sau încăpere cu ecou | Vocile se aseamănă între ele și apar etichete amestecate. |
| Ședință cu mulți participanți la un singur microfon | Cu cât sunt mai mulți și mai departe, cu atât atribuirea e mai instabilă. |
| Voci foarte asemănătoare | Doi bărbați cu timbru apropiat sau două femei cu registru similar pot fi contopiți într-un singur vorbitor. |
| Intervenții foarte scurte | Un „da” sau un „mhm” de o secundă are prea puțin material ca să fie atribuit corect. |
| Aceeași persoană cu răceală sau pe un alt microfon | Profilul vocal poate să nu se mai potrivească și persoana apare ca vorbitor nou. |
Concluzia onestă: rezultatul este o ciornă bună, care îți scutește partea grea, dar are nevoie de o trecere de corectură. La discuțiile în doi, cu microfon apropiat, corecturile sunt puține. La o ședință cu opt oameni în jurul unei mese, dintr-un singur microfon de laptop, te aștepți să repari destul.
Cum obții rezultate mai bune
- Apropie microfonul. Este singurul lucru cu impact cu adevărat mare. O lavalieră de câteva zeci de lei pe fiecare participant schimbă complet transcrierea unui interviu.
- Alege camera. O încăpere cu mochetă, draperii și mobilă recunoaște mai bine decât una goală cu pereți tari.
- Spune numele la început. Când fiecare se prezintă în primele secunde, ai o ancoră clară pentru a atribui etichetele corect la corectură.
- Nu vorbiți unul peste altul. E o regulă de ședință bună oricum, dar aici se vede direct în text.
- Verifică schimbările de vorbitor înainte de a exporta. Greșelile se adună acolo, la trecerile dintre replici, nu în mijlocul unui monolog.
Profilul vocal și acordul persoanelor
Un profil vocal este o dată cu caracter personal, indiferent că stă doar pe laptopul tău. Asta înseamnă că persoanele înregistrate trebuie informate: spune-le că înregistrezi, că transcrierea va identifica automat vorbitorii și că profilul rămâne local. Acordul se ia înainte de a porni înregistrarea, iar dacă cineva se opune, nu înregistra.
În România, înregistrarea unei convorbiri la care ești tu însuți parte nu intră sub art. 302 din Codul penal, care vizează interceptarea comunicărilor dintre alții. Rămân însă aplicabile art. 71 din Codul civil, privind viața privată, și art. 74 lit. c), care enumeră expres captarea sau utilizarea vocii unei persoane aflate într-un spațiu privat fără acordul ei. În context de muncă apare un strat suplimentar: monitorizarea angajaților este condiționată de art. 5 din Legea 190/2018 — informare prealabilă, consultarea sindicatului sau a reprezentanților salariaților, proporționalitate și termen limitat de păstrare.
Ce nu facem aici: nu afirmăm conformitatea produsului cu nicio reglementare și nu dăm consultanță juridică. Descriem doar arhitectura — fișierul audio și profilurile vocale rămân pe Mac-ul tău. Evaluarea temeiului legal revine operatorului de date, în practică responsabilului cu protecția datelor sau juristului tău, iar autoritatea de supraveghere la care te poți raporta este ANSPDCP. Nu oferim nicio garanție privind valoarea juridică a transcrierii.
Cui îi folosește cel mai mult
- Jurnaliștilor, care au nevoie să extragă exact citatul unei surse dintr-un interviu de o oră.
- Cercetătorilor și studenților care transcriu interviuri semi-structurate pentru licență, disertație sau un proiect de cercetare calitativă.
- Echipelor care vor din înregistrarea ședinței materialul pe baza căruia se redactează minuta, cu deciziile atribuite corect.
- Avocaților și consultanților care recapitulează o discuție cu clientul și nu vor să trimită materialul unui furnizor extern.
- Podcasterilor, pentru transcrierea unui episod cu doi sau trei invitați și pentru subtitrarea lui.
Cerințe, versiunea gratuită și preț
Este nevoie de macOS 13 (Ventura) sau mai nou și de un Mac cu Apple Silicon (M1 sau mai nou); este o cerință, nu o recomandare, iar pe Mac-uri cu procesor Intel aplicația nu rulează. Recunoașterea acoperă 99 de limbi, detectate automat, iar tot calculul se face local.
Descărcarea este gratuită și include 5 transcrieri audio și 5 video în total, plus 5 minute de dictare pe zi. Înregistrarea nu se contorizează niciodată, iar re-transcrierea unui material deja transcris nu consumă din limită. Versiunea completă se deblochează cu o achiziție unică în aplicație de 49,99 $, fără abonament. În App Store-ul din România prețul se afișează în lei.
Vezi și cum arată fluxul complet pentru un fișier existent, la transcrierea unei înregistrări audio.
Descărcare gratuită. Plătești o singură dată. Fără abonament. · Pro: 49,99 $ o singură dată, achiziție în aplicație (în App Store România prețul apare în lei) · macOS 13 sau mai nou
Întrebări frecvente
Cum aflu cine a vorbit într-o înregistrare?
Aplicația împarte automat înregistrarea pe voci distincte și pune o etichetă de vorbitor pe fiecare fragment, împreună cu poziția lui în audio. Transcrierea arată ca un dialog, nu ca un bloc de text, iar etichetele generice le înlocuiești cu numele reale.
Persoanele sunt recunoscute și în înregistrările următoare?
Da. Când dai un nume unui vorbitor, se păstrează local un profil vocal, iar la înregistrările următoare aceeași persoană primește automat numele. Profilul rămâne pe Mac-ul tău, nu este sincronizat nicăieri și îl poți șterge oricând.
Cât de exactă e separarea pe vorbitori?
Bună la discuții în doi cu microfonul aproape, mai slabă cu cât crește numărul de participanți și distanța față de microfon. Greșește la vorbire suprapusă, la voci foarte asemănătoare, la intervenții de o secundă și în camere cu ecou. Rezultatul este o ciornă care are nevoie de o trecere de corectură.
Ce este diarizarea?
Este termenul tehnic pentru împărțirea unei înregistrări pe vorbitori, adică răspunsul la întrebarea cine a vorbit și când. Nu se confundă cu transcrierea propriu-zisă, care răspunde la ce s-a spus; cele două împreună dau un text de discuție lizibil.
Profilul vocal pleacă de pe calculator?
Nu. Fișierul audio și profilurile vocale rămân pe Mac-ul tău, nu există cont și nu există server care să le primească. Un profil vocal este totuși o dată cu caracter personal, așa că informează persoanele înregistrate și obține acordul lor înainte de a porni înregistrarea.
Cât costă și ce pot încerca gratuit?
Descărcarea este gratuită și include 5 transcrieri audio și 5 video în total, plus 5 minute de dictare pe zi; înregistrarea și re-transcrierea nu consumă din limită. Versiunea completă se deblochează cu o achiziție unică de 49,99 $ în aplicație, fără abonament.