Главная › Локальное распознавание речи

Основы · Распознавание речи на Mac

Локальное распознавание речи: что это значит технически

Локальное распознавание речи — это когда модель, превращающая голос в текст, работает на вашем собственном компьютере: запись обрабатывается прямо на нём и никуда не отправляется. В русскоязычном поиске то же самое называют «on-device распознаванием», «офлайн-распознаванием» и «локальной расшифровкой» — это одно и то же явление, просто описанное разными словами.

100%обработка на самом Mac — аудио никуда не загружается
Бесплатнозагрузка — Pro открывается разовой покупкой $49.99, без подписки
99языков — определяются автоматически
macOS 13+Apple Silicon (M1 и новее) обязателен

Что это такое

Распознавание речи (по-английски speech-to-text) — это автоматическое превращение произнесённых слов в письменный текст. Для этой страницы важно не то, работает ли оно вообще, а где именно происходит вычисление.

В облачном варианте приложение записывает ваш голос, отправляет аудиофайл на сервер поставщика услуги, там его обрабатывает нейросетевая модель, и обратно приходит готовый текст. В локальном варианте та же самая модель лежит файлом на вашем диске, а вычисление идёт в оперативной памяти и на графическом ускорителе вашего компьютера. Путь данных получается коротким: на входе микрофон или файл, на выходе текст, сети между ними нет вообще.

Это не деталь для рекламного буклета, а архитектурное решение с очень конкретными последствиями — для конфиденциальности, для работы без интернета, для стоимости и для требований к железу. Разберём их по порядку.

Локально или в облаке: разница на практике

Оба подхода сегодня дают пригодный к работе результат, и спорить о том, какой «лучше вообще», бессмысленно. Различаются они не столько качеством текста, сколько тем, что происходит вокруг него.

Локально (on-device)Облачный сервис
Где считает модельНа вашем MacНа сервере поставщика
Файл уходит с устройстваНетДа
Работает без интернетаДаНет
Нужен аккаунтНетКак правило, да
Модель оплатыЧаще разоваяОбычно подписка или поминутно
Требования к железуВысокие: нужен современный графический ускорительНизкие
Если сервис закроетсяПрограмма продолжает работатьРасшифровка становится недоступна
Время на длинной записиЗависит от вашего MacЗависит от нагрузки на сервер

Две строки в этой таблице — честная обратная сторона локального подхода. Вычислительная нагрузка переезжает к вам: двухчасовое интервью заметно займёт Mac на время расшифровки, вентилятор может включиться, ноутбук на батарее сядет быстрее. Взамен не появляется копия вашей записи там, где вы не управляете ни сроком хранения, ни доступом.

Почему для этого нужен Apple Silicon

Современная модель распознавания речи — это от нескольких сотен миллионов до нескольких миллиардов параметров. Чтобы расшифровка шла быстрее, чем длится сама запись, эти вычисления должны выполняться на графическом ускорителе, а модель при этом целиком помещаться в память, к которой ускоритель имеет быстрый доступ.

Именно это даёт унифицированная память Apple Silicon: процессор и графика работают с одним и тем же массивом памяти, поэтому модель не приходится постоянно перекладывать между двумя областями. На Intel-Mac — с отдельной или встроенной графикой — этой предпосылки нет.

Поэтому Lesskeys — программа только для Apple Silicon: Mac с чипом M1 или новее обязателен, это требование, а не пожелание. На Intel-Mac приложение не работает. Минимальная система — macOS 13 (Ventura) и новее. Проверить свой компьютер можно за десять секунд: меню Apple → «Об этом Mac» → строка «Чип»; если там написано Intel, дальше читать эту страницу можно из любопытства, но не как инструкцию к покупке.

«Локально — значит менее точно»: почему это заблуждение

Распространённое ожидание: раз считает не мощный дата-центр, а ноутбук, то и текст будет хуже. На самом деле точность определяется размером модели и качеством записи, а не географией вычисления: на диктовке и на обычных разговорных записях локальные модели сегодня работают в том же диапазоне, что и облачные сервисы.

Настоящая цена локальности — не качество, а ресурсы: крупная модель занимает больше памяти и считает дольше, поэтому выбор между быстрой и точной моделью здесь виден пользователю, а в облаке спрятан за ценником. Ошибки же и там и там возникают по одним и тем же причинам, и почти всегда это звук, а не алгоритм:

Реалистичный вывод: машинная расшифровка — это черновик. Она снимает основную часть механической работы, но не отменяет вычитку, особенно там, где текст потом цитируют.

Термины, которые означают одно и то же — и те, что не означают

По-русски одно и то же явление называют вперемешку: «локальное распознавание речи», «on-device распознавание», «офлайн-распознавание», «распознавание без интернета», «локальная расшифровка». Все они описывают обработку на самом устройстве, и искать имеет смысл по любому из них.

А вот что не одно и то же. Распознавание речи отвечает на вопрос «что сказано», распознавание говорящих — на вопрос «кем сказано»; вместе они дают читаемый протокол разговора. Синтез речи — обратная задача, текст в голос. Голосовое управление в macOS — это выполнение команд, а не набор связного текста. И наконец, «транскрибация», «расшифровка» и «стенограмма» — три регистра одного и того же результата: профессиональный, бытовой и формальный соответственно.

Что значит «аудио не покидает Mac» — и что из этого не следует

Локальная обработка — это утверждение об устройстве программы: загрузки аудиофайла нет, серверной части, принимающей запись, нет, а значит, нет и подрядчика, который обрабатывает данные по вашему поручению. Аккаунт не нужен, в авиарежиме всё работает так же.

Из этого не следует вывод о правомерности вашей конкретной обработки. Можно ли записывать, хранить и анализировать конкретный разговор, зависит от цели, от того, чьи это данные, от вашей отрасли и от внутренних регламентов организации. Мы не заявляем ни о каком соответствии требованиям законодательства о персональных данных и не называем программу сертифицированным решением — такую оценку должен делать ваш юрист или ответственный за обработку персональных данных. Архитектура снимает с вас ровно один вопрос, который обычно задают первым: куда уходит запись. Остальные вопросы остаются вашими.

Если на записи есть другие люди

Как только в записи звучит не только ваш голос, техническая сторона становится второстепенной. Правила различаются от страны к стране, и читатели этой страницы живут в разных юрисдикциях, поэтому единственный универсальный совет — поведенческий, а не ссылка на статью:

Скрытая запись чужого частного разговора и особенно его распространение — самая рискованная зона практически везде. Это ориентир, а не юридическая консультация. Гарантии юридической силы расшифровки мы не даём: это результат автоматической обработки, и важные фрагменты надо сверять с исходным звуком.

Локальное распознавание речи на Mac

Lesskeys — приложение для macOS, которое работает только локально: голосовой ввод по горячей клавише плюс расшифровка разговоров, интервью, аудио- и видеофайлов с автоматическим разделением по голосам. Поддерживается 99 языков, язык определяется автоматически. Продиктованный текст копируется в буфер обмена, а вставляете его вы сами — ⌘V; программа ничего не печатает самостоятельно в чужие окна, и это осознанное решение: вы видите текст до того, как он куда-то попадёт.

Загрузка бесплатна. В бесплатной версии доступны 5 минут голосового ввода в сутки, а также 5 расшифровок аудио и 5 расшифровок видео всего (не в день); сама запись не ограничена, и повторная расшифровка уже обработанного материала лимит не тратит. Полная версия открывается разовой встроенной покупкой $49.99 — не подпиской; итоговую цену в вашей валюте показывает App Store.

Если хочется увидеть весь процесс по шагам, а не в теории — это на странице как перевести речь в текст.

Загрузить в Mac App Store

Скачать бесплатно, у бесплатной версии есть лимиты. Без подписки. · Pro — разовая встроенная покупка $49.99 (итоговую цену в вашей валюте покажет App Store) · macOS 13 и новее

Частые вопросы

Что такое локальное распознавание речи?

Это распознавание, при котором модель работает прямо на вашем компьютере: она лежит файлом на диске и считает на графическом ускорителе, а аудиофайл никуда не загружается. То же самое называют on-device распознаванием, офлайн-распознаванием и локальной расшифровкой.

Чем локальное распознавание отличается от облачного?

В облаке запись передаётся на сервер поставщика и обрабатывается там, обычно с аккаунтом и оплатой по минутам или по подписке. Локально считает ваш собственный Mac, запись не покидает устройство и всё работает без интернета — но требуется достаточно мощное железо.

Локально распознаёт хуже, чем в облаке?

Нет. Точность зависит от размера модели и качества записи, а не от того, где идёт вычисление. Основные источники ошибок в обоих случаях одни и те же: далёкий микрофон, перебивания, имена и термины, сильный акцент. Машинная расшифровка в любом случае остаётся черновиком и требует вычитки.

Какое железо нужно для локального распознавания на Mac?

Нужен Mac на Apple Silicon, то есть с чипом M1 или новее, и macOS 13 (Ventura) или новее. Intel-Mac не поддерживается: модели нужна унифицированная память, к которой процессор и графика обращаются совместно.

Если обработка локальная, значит, с персональными данными всё в порядке?

Нет, это разные вопросы. Локальность — утверждение об архитектуре: аудио не покидает ваш Mac и нет подрядчика, который его получает. Правомерность конкретной записи и её последующей обработки оценивает ваш юрист или ответственный за персональные данные; мы не заявляем о соответствии каким-либо требованиям и не называем программу сертифицированным решением.

Можно ли просто записать разговор с коллегой или клиентом?

Не молча. Правила различаются по странам, поэтому универсальное поведение такое: предупредить участников до начала записи, зафиксировать согласие в самой записи или в протоколе, при отказе не записывать, а на работе дополнительно свериться с внутренними регламентами и местным законом.

Читайте также