Головна › Розділення мовців
Мовці · транскрипт розмови
Хто що сказав: розділення мовців у записі
Транскрипт розмови без поділу за голосами — це суцільна стіна тексту, у якій неможливо зрозуміти, хто що сказав. Lesskeys виконує розділення мовців у записі автоматично: ділить його за голосами, підписує репліки й дає мовцям імена, які впізнаються в наступних записах. Усе це відбувається на вашому Mac, без вивантаження запису.
Що дає розділення мовців у записі
Розпізнавання мовлення відповідає на питання, що було сказано. Розділення мовців відповідає на друге, не менш важливе питання — хто це сказав. Лише разом вони дають запис, який справді можна читати: репліка, ім’я, час, наступна репліка.
Українською цю функцію шукають описово — «хто що сказав у записі», «розділити голоси», «розпізнати, хто говорить», «транскрипт з іменами». Фаховий термін для неї — діаризація; далі на сторінці ми його не вживаємо, бо в живій мові він майже не трапляється. Людину, яка говорить, застосунок підписує мовцем — саме так, як прийнято в українському діловому тексті.
Як застосунок відрізняє голоси
Спершу запис ділиться на фрагменти мовлення й відсіюється тиша. Далі для кожного фрагмента рахується числовий «відбиток» голосу — компактний набір чисел, який описує тембр, а не слова. Фрагменти з близькими відбитками об’єднуються в групи: одна група — один голос. Уже після цього кожна група отримує текст, а транскрипт складається в діалог.
Важливо, що застосунок не намагається вгадати, скільки в записі людей, за вашими словами — він виводить це з самого звуку. Якщо ви знаєте кількість учасників наперед, її можна вказати в налаштуваннях, і це помітно допомагає на складних записах: коротка нарада вчотирьох із поганим мікрофоном без підказки може розпастися на більше груп, ніж було людей.
Імена мовців і голосові профілі
Одразу після обробки мовці підписані нейтрально — «Мовець 1», «Мовець 2». Ви замінюєте це на справжні імена, і транскрипт стає читабельним. Далі є два рівні пам’яті:
- У межах запису. Перейменування застосовується до всіх реплік цього голосу одразу, а не по одній.
- Між записами. Голосовий профіль зберігається, тож у наступній нараді той самий голос підписується автоматично. Для команди, яка збирається щотижня, це означає, що після кількох записів імена вже майже не доводиться проставляти вручну.
Профілями можна керувати: перейменувати людину глобально, роз’єднати помилково склеєні голоси або, навпаки, об’єднати два профілі, які насправді належать одній людині. Усі профілі зберігаються локально на вашому Mac разом із рештою даних застосунку.
Голосовий профіль — це дані про людину
Тут потрібна повна ясність. Голос людини є персональними даними в розумінні Закону України «Про захист персональних даних», а збережений голосовий профіль — це вже за своєю природою біометрична характеристика, яка дає змогу впізнати конкретну людину в інших записах. Те, що профіль лежить на вашому диску, а не на чужому сервері, знімає питання «куди він потрапив», але не знімає питання «чи маєте ви право його зберігати».
Ми не заявляємо відповідності ані Закону «Про захист персональних даних», ані GDPR і нічого не сертифікуємо. Оцінка мети обробки та правової підстави — це до вашого юриста або до особи, відповідальної за захист персональних даних у вашій організації. Практичне ж правило просте: попередьте людину і отримайте згоду — окремо на запис і окремо на те, що її голос буде впізнаватися надалі. Профіль, який більше не потрібен, варто видалити.
Згода на запис і на подальше використання
Стаття 163 Кримінального кодексу карає порушення таємниці листування й телефонних розмов, тобто втручання в чужі комунікації. Зворотного висновку — що власну розмову записувати вільно — ми не робимо: це юридична оцінка, яку ми не маємо права давати. Стаття 182 КК стосується незаконного збирання, зберігання, використання й поширення конфіденційної інформації про особу, тож вона працює не лише в момент запису, а й тоді, коли ви надсилаєте комусь підписаний іменами транскрипт. Цивільний кодекс додає право на приватне життя (ст. 301), таємницю телефонних розмов, використання яких потребує згоди (ст. 306), і згоду на відеозйомку (ст. 307) — останнє стосується записів екрана й відеодзвінків.
На роботі окремого закону про запис розмов немає: питання регулюють законодавство про персональні дані та внутрішні правила організації. Тому запис нарад узгоджують заздалегідь із керівництвом і з відповідальною за персональні дані особою, а не ставлять колег перед фактом. Це інформаційний блок, а не юридична консультація, і жодних гарантій щодо доказової сили запису ми не даємо.
Де воно збивається
Розділення мовців — статистична задача, і чесно назвати її межі корисніше, ніж обіцяти безпомилковість.
| Ситуація | Що стається |
|---|---|
| Двоє говорять одночасно | Репліки на перетині приписуються комусь одному або дробляться |
| Один мікрофон посеред столу | Далекі голоси звучать тихо й глухо, межі між ними розмиваються |
| Дуже схожі голоси | Два мовці можуть злитися в один профіль |
| Короткі вставки на пів секунди | «Так», «ага», «згоден» часто чіпляються до сусідньої репліки |
| Гучний фон, вулиця, погана лінія | Кількість груп визначається менш стабільно |
| Той самий голос через телефон і мікрофон | Може розпастися на два профілі — канал звучить по-різному |
Тому транскрипт — це чернетка: атрибуцію на складних місцях треба переглянути, а прізвища й терміни поправити. Найдієвіше поліпшення тут не програмне, а організаційне: гарнітури замість одного мікрофона на кімнату й домовленість не перебивати одне одного.
Кому це справді потрібно
- Нарадам і робочим дзвінкам. Протокол, у якому видно, хто взяв на себе завдання, а не просто перелік речень.
- Інтерв’ю й дослідженням. Репліки респондента відокремлені від питань інтерв’юера — цитувати можна одразу.
- Журналістиці. Довга розмова з кількома учасниками, у якій потрібно швидко знайти, хто саме сказав фразу.
- Юристам і консультантам. Зустрічі з кількома сторонами, де плутанина в тому, хто що заявив, неприпустима.
- Подкастам. Розшифровка з підписаними голосами як основа для субтитрів і шоуноутів.
Що поруч у застосунку
Розділення мовців працює і на живому записі (мікрофон плюс системний звук Mac, тож нарада в Zoom, Google Meet чи Microsoft Teams пишеться без жодного бота в кімнаті), і на готових аудіо- та відеофайлах. Кожен фрагмент має мітку часу, транскрипт експортується в TXT, а для субтитрів — у SRT і VTT. Усі записи лежать у локальній бібліотеці, де можна шукати за словом у тексті, за датою або за конкретним мовцем.
Вимоги, ціна й безкоштовна версія
Потрібна macOS 13 (Ventura) або новіша і Mac з Apple Silicon (M1 або новішим) — це обов’язкова вимога, а не рекомендація: на Mac з процесором Intel застосунок не запуститься. Розпізнавання охоплює 99 мов і визначає мову автоматично. Продиктований текст, якщо ви користуєтеся ще й голосовим введенням, потрапляє в буфер обміну — вставляєте його ви через ⌘V, застосунок нічого не друкує сам.
Завантаження безкоштовне. Pro відкриває разова покупка в застосунку — $49.99, в App Store сума показується у валюті вашого облікового запису; це не підписка. У безкоштовній версії доступні 5 хвилин диктування на добу та 5 аудіо- і 5 відеотранскрипцій усього (загальна кількість, не денна). Сам запис не обмежується ніколи, а повторна транскрибація вже розшифрованого файлу квоту не витрачає — тож перезапустити розпізнавання, щоб перевірити поділ на мовців, можна скільки завгодно разів.
Завантаження безкоштовне. Без підписки. · Pro — разова покупка $49.99 у застосунку (в App Store ціна у валюті вашого акаунта) · macOS 13 або новіша
Часті запитання
Як зрозуміти, хто що сказав у записі?
Lesskeys ділить запис за голосами автоматично: кожна репліка в транскрипті підписана мовцем і має мітку часу. Мовцям можна дати справжні імена, і вони застосуються до всіх реплік цього голосу одразу. Обробка відбувається на вашому Mac, запис нікуди не вивантажується.
Чи запам’ятовує застосунок імена мовців для наступних записів?
Так. Разом з іменем зберігається голосовий профіль, тож у наступному записі той самий голос підписується автоматично — це зручно для команди, яка збирається регулярно. Профілі зберігаються локально, їх можна перейменувати, об’єднати, роз’єднати або видалити.
Голосовий профіль — це персональні дані?
Голос людини є персональними даними в розумінні Закону України «Про захист персональних даних», а збережений профіль дає змогу впізнати конкретну людину в інших записах. Ми не заявляємо відповідності цьому закону чи GDPR і нічого не сертифікуємо: попередьте людину, отримайте згоду, а оцінку правової підстави лишіть своєму юристові або відповідальній за персональні дані особі.
Скільки мовців застосунок може розрізнити?
Кількість голосів визначається із самого запису, вказувати її наперед не обов’язково. Але якщо ви знаєте, скільки людей у розмові, цю кількість можна задати в налаштуваннях — на складних записах із поганим мікрофоном це помітно точніше, ніж автоматична оцінка.
Наскільки точно працює поділ за голосами?
Добре на чистому записі, де люди говорять по черзі й мікрофон близько. Гірше, коли двоє говорять одночасно, голоси схожі, фон гучний або мікрофон один на всю кімнату: короткі вставки чіпляються до сусідньої репліки, а два голоси можуть злитися. Транскрипт — це чернетка, атрибуцію варто переглянути.
Чи можна так розшифрувати нараду в Zoom або Teams?
Так, застосунок пише системний звук Mac разом із мікрофоном, тому не залежить від конкретної програми для дзвінків і не додає бота в кімнату. Перед записом попередьте учасників і отримайте згоду — і на сам запис, і на подальше використання транскрипту. Це інформація, а не юридична консультація.