Главная › Кто что сказал
Разделение по голосам · Расшифровка с говорящими
Кто что сказал: разделение записи по голосам
Расшифровка разговора без пометки говорящих читается плохо: сплошной текст, в котором непонятно, кто задавал вопрос, а кто отвечал. Lesskeys автоматически делит запись по голосам — каждая реплика получает своего говорящего, которому можно дать имя. Всё считается на вашем Mac, запись никуда не загружается.
Две разные задачи: что сказано и кем
В расшифровке разговора решаются две независимые задачи. Первая — распознавание речи: превратить звук в слова. Вторая — понять, кому принадлежит каждая реплика. Именно вторая превращает стену текста в читаемый протокол, где видно вопрос и ответ, возражение и уступку.
В профессиональной литературе вторая задача называется диаризацией — если вы искали именно этот термин, вы на нужной странице. Но по-русски люди обычно ищут описательно: «кто что сказал», «разделить по голосам», «определить спикеров в аудио», «расшифровка интервью с несколькими собеседниками». Это всё об одном и том же.
Стоит отличать это от идентификации личности по голосу в смысле проверки «это точно Иванов». Здесь решается более скромная и более полезная задача: сгруппировать реплики по разным голосам внутри записи и дать вам возможность назвать их так, как удобно.
Как запись делится по голосам
Обработка идёт в несколько проходов, и все они выполняются на вашем Mac:
- Находятся участки речи. Тишина, шум и паузы отсекаются, дальше работа идёт только с фрагментами, где кто-то говорит.
- Для каждого фрагмента считается «отпечаток» голоса — компактный числовой вектор, описывающий тембр и манеру, а не содержание слов.
- Похожие отпечатки объединяются в группы. Каждая группа — один говорящий. Если вы знаете число участников, его можно задать вручную, и это заметно повышает точность.
- Реплики соединяются с текстом, получая метки времени и говорящего.
Ни на одном из шагов запись не передаётся наружу: модели лежат на диске, вычисление идёт на графическом ускорителе Apple Silicon. Аккаунт не нужен, интернет тоже.
Имена вместо «Говорящий 1»
Сразу после обработки участники называются нейтрально: «Говорящий 1», «Говорящий 2». Прослушав пару реплик, вы переименовываете их — «Анна», «клиент», «интервьюер», — и весь транскрипт обновляется целиком, а не построчно. В экспортированном TXT имена уже стоят на своих местах.
Если программа разрезала одного человека на двух говорящих (так бывает, когда он то отходит от микрофона, то говорит вплотную), их можно объединить; если склеила двух похожих — реплику можно переназначить вручную.
Голосовой профиль: тот же человек узнаётся в следующий раз
Самая практичная часть. Когда вы дали говорящему имя, его голосовой профиль сохраняется локально, на вашем Mac. В следующей записи тот же человек распознаётся автоматически и сразу подписывается нужным именем.
На одной записи это мелочь. На серии интервью, на еженедельных планёрках с постоянным составом, на регулярных созвонах с одним и тем же клиентом это экономит основную часть ручной работы: не приходится каждый раз заново разбираться, кто здесь первый, а кто второй.
Профили — обычные локальные данные: их видно в приложении, их можно переименовать и удалить. Они не синхронизируются ни в какое облако.
Где это ошибается — честно
Разделение по голосам — статистическая задача, и стопроцентной она не бывает ни у кого. Типичные проблемные ситуации:
- Одновременная речь. Когда двое перебивают друг друга, часть слов теряется, а атрибуция реплик на этом участке плывёт.
- Похожие голоса. Два человека близкого тембра, особенно записанные одним микрофоном издалека, могут склеиться в одного говорящего.
- Плохой звук. Эхо, шум улицы, запись через динамик громкой связи — здесь ошибаются все системы без исключения.
- Очень короткие реплики. «Да», «угу», «согласен» дают слишком мало звука, чтобы уверенно отнести их к кому-то.
- Много участников. Чем больше людей, тем выше шанс ошибки; если число участников известно, задайте его вручную.
Отсюда рабочее правило: сначала пробегитесь по расшифровке и проверьте, кому приписаны ключевые фразы, и только потом рассылайте её. Машинный транскрипт — черновик; гарантии юридической силы расшифровки мы не даём.
Голос — персональные данные, голосовой профиль — биометрия
Это важнее, чем кажется на первый взгляд. Голос человека — его персональные данные, а сохранённый голосовой профиль в ряде юрисдикций относят уже к биометрическим данным, и режим обработки у них строже, чем у обычной записи. Как именно — зависит от вашей страны и вашего сценария.
Локальность здесь помогает, но не отменяет обязанностей. Тот факт, что профиль хранится на вашем Mac и никуда не передаётся, снимает вопрос «кому ещё достались эти данные». Он не снимает вопроса «а спросили ли вы человека». Людей на записи нужно уведомить и получить их согласие — тем более если вы собираетесь хранить их голосовые профили и узнавать этих людей в последующих записях.
Мы описываем только устройство программы и не заявляем ни о каком соответствии требованиям законодательства о персональных данных; сертифицированным решением она не является. Оценку вашего конкретного сценария должен сделать ваш юрист или ответственный за обработку персональных данных.
Перед тем как записывать разговор
Правила записи разговоров различаются от страны к стране, а читатели этой страницы живут в разных юрисдикциях, поэтому ориентир поведенческий, а не ссылка на конкретную норму:
- предупредите участников до начала записи;
- зафиксируйте согласие — первой репликой в самой записи или строкой в протоколе;
- при отказе не записывайте;
- в компании сверьтесь с внутренними регламентами: работник должен быть уведомлён об обработке своих данных, и одного решения того, кто нажимает кнопку, здесь недостаточно;
- отдельно продумайте, кому вы передадите запись и расшифровку потом — распространение чужого частного разговора почти везде рискованнее самой записи.
Это ориентир, а не юридическая консультация.
Кому это нужно
- Интервью и исследования. Расшифровка глубинного интервью с пометкой говорящих — половина работы аналитика.
- Планёрки и совещания. Кто что пообещал и к какому сроку — вопрос, ради которого протокол и ведётся.
- Консультации. Юристы, психологи, врачи — те, для кого сама передача записи подрядчику и есть проблема.
- Продажи. Разбор созвона по репликам клиента, а не по памяти менеджера.
Требования и цена
Нужен Mac на Apple Silicon (M1 или новее) — обязательно, на Intel-Mac приложение не работает, и macOS 13 (Ventura) или новее. Поддерживается 99 языков с автоопределением.
Загрузка бесплатна: в бесплатной версии доступны 5 минут голосового ввода в сутки (продиктованный текст попадает в буфер обмена, вставляете его вы сами через ⌘V) и 5 расшифровок аудио плюс 5 расшифровок видео суммарно (не в день), а сама запись не ограничена; повторная расшифровка уже обработанного материала лимит не тратит. Ограничения снимает разовая встроенная покупка $49.99 — не подписка, платёж один раз; итоговую цену в вашей валюте показывает App Store.
Скачать бесплатно, у бесплатной версии есть лимиты. Без подписки. · Pro — разовая встроенная покупка $49.99 (итоговую цену в вашей валюте покажет App Store) · macOS 13 и новее
Частые вопросы
Как понять из расшифровки, кто что сказал?
Запись автоматически делится по голосам: каждая реплика получает своего говорящего и метку времени. Говорящих можно переименовать из «Говорящий 1» в реальные имена, и весь транскрипт обновится целиком, включая экспорт в TXT.
Запомнит ли программа человека для следующих записей?
Да. Когда вы дали говорящему имя, его голосовой профиль сохраняется локально на вашем Mac, и в следующих записях тот же человек подписывается автоматически. Это заметно экономит время на серии интервью или регулярных планёрках.
Где разделение по голосам ошибается?
При одновременной речи, сильном шуме, записи через громкую связь, очень похожих голосах и очень коротких репликах вроде «да» и «угу». Чем больше участников, тем выше шанс ошибки — если их число известно, его лучше задать вручную, а ключевые реплики перепроверить по звуку.
Голосовой профиль уходит на сервер?
Нет. И само разделение по голосам, и хранение профилей происходит на вашем Mac. Профили видны в приложении, их можно переименовать и удалить, они не синхронизируются в облако.
Голос считается персональными данными?
Да. А сохранённый голосовой профиль в ряде юрисдикций относят уже к биометрическим данным, режим обработки которых строже. Локальное хранение снимает вопрос о передаче данных третьим лицам, но не отменяет обязанности уведомить людей на записи и получить их согласие. Оценку вашего сценария должен сделать ваш юрист или ответственный за персональные данные — мы не заявляем ни о каком соответствии требованиям.
Можно ли задать количество говорящих вручную?
Да, и если состав известен заранее, это стоит сделать: указание числа участников заметно повышает точность разделения, особенно на записях с похожими голосами.