Головна › Локальне розпізнавання мовлення

Основи · розпізнавання мовлення на Mac

Локальне розпізнавання мовлення: що це означає технічно

Локальне розпізнавання мовлення означає, що модель працює на вашому власному комп’ютері: запис перетворюється на текст на місці й нікуди не вивантажується. Ту саму річ називають «розпізнаванням мовлення офлайн», «локальною транскрибацією» або «моделлю на пристрої» — це синоніми, а не різні технології.

100%локально на вашому Mac — аудіо нікуди не вивантажується
Безкоштовнозавантаження; Pro — разова покупка $49.99, без підписки
99мов, визначаються автоматично
macOS 13+Apple Silicon (M1 або новіший) — обов’язково

Спершу про сам термін

Українською одну технологію звично називають двома різними словами, і плутанина тут виникає постійно. Розпізнавання мовлення — це перетворення сказаного вголос на текст. Розпізнавання мови — це визначення того, якою саме мовою людина говорить. У застосунку, про який ідеться далі, працює і те, і те: спершу визначається мова запису, потім мовлення перетворюється на текст. На цій сторінці «мовлення» — це те, що ви вимовляєте, а «мова» — українська, польська чи англійська.

Що означає «локальне»

Питання не в тому, чи технологія працює, а в тому, де відбуваються обчислення. У хмарному варіанті програма записує ваш голос, надсилає файл на чужий сервер, там модель рахує, а готовий текст повертається назад. У локальному варіанті та сама модель лежить звичайним файлом на вашому диску, а рахують процесор і графічний чип вашого комп’ютера. Шлях даних короткий: звук увійшов — текст вийшов, мережі між ними немає взагалі.

Це не «офлайн-режим», який хтось дописав збоку. Автономність тут — наслідок архітектури: якщо обчислення й так відбуваються на вашій машині, то запитувати нема кого й нема про що. Тому застосунок однаково працює в літаку, у поїзді, у приміщенні без покриття та тоді, коли інтернету просто немає.

Хмара проти пристрою: що насправді відрізняється

Обидва підходи дають придатний результат, і жоден не «кращий» сам по собі — вони відрізняються тим, що відбувається навколо самого тексту.

Локально (на пристрої)У хмарі
Де відбуваються обчисленняВаш комп’ютерСервер постачальника
Запис залишає комп’ютерНіТак
Працює без інтернетуТакНі
Обліковий записНе потрібенЗазвичай обов’язковий
ОплатаНайчастіше разоваЗазвичай за хвилини або щомісяця
Вимоги до залізаВисокі — потрібен потужний графічний чипНизькі
Час на довгому записіЗалежить від вашого MacЗалежить від завантаженості сервера

Два останні рядки — чесний зворотний бік. Локальне розпізнавання переносить навантаження на вас: двогодинне інтерв’ю займе Mac на відчутний час, вентилятор може загудіти, а батарея сідатиме швидше, ніж під час набору тексту. Натомість ніде не з’являється копія запису в місці, яке ви не контролюєте.

Чому потрібен саме Apple Silicon

Сучасна модель розпізнавання мовлення — це від кількох сотень мільйонів до кількох мільярдів параметрів. Щоб транскрибація йшла швидше за сам запис, обчислення мають виконуватися на графічному чипі, а модель має вміститися в пам’ять, до якої процесор і графіка звертаються спільно.

Саме це дає уніфікована пам’ять Apple Silicon: процесор і GPU працюють з однією й тією самою оперативною пам’яттю, тож модель не доводиться безперервно копіювати між двома окремими областями. У Mac на процесорах Intel такої архітектури немає. Тому Lesskeys — застосунок винятково для Apple Silicon: Mac з M1 або новішим чипом обов’язковий, а не бажаний; на Intel-Mac він не запуститься. Система — macOS 13 (Ventura) або новіша. Перевірити своє залізо можна в меню Apple → «Про цей Mac».

Що впливає на точність

Результат залежить не від «магії моделі», а від умов запису — і це варто знати до того, як ви зробите висновок про технологію загалом.

Практичний висновок: автоматичний транскрипт — це чернетка. Вона знімає більшість ручної роботи, але не замінює вичитування, особливо якщо ви збираєтеся з цього тексту цитувати.

Що означає «аудіо не залишає Mac» — і чого воно не означає

Локальна обробка — це твердження про архітектуру застосунку: немає вивантаження аудіофайлу, немає сервера, який його приймає, немає облікового запису й немає телеметрії. Мережа потрібна лише двічі: щоб завантажити застосунок із магазину і щоб один раз завантажити модель.

Чого з цього не випливає — правової оцінки вашої конкретної обробки. Голос людини, а надто збережений голосовий профіль, є персональними даними в розумінні Закону України «Про захист персональних даних», і для їх обробки потрібна правова підстава. Ми не заявляємо відповідності ані цьому закону, ані GDPR, ані будь-яким стандартам і нічого не сертифікуємо. Чи можна записувати, зберігати й аналізувати конкретну розмову, залежить від мети, від людей у записі та від вашої організації — це питання до вашого юриста або до особи, відповідальної за захист персональних даних. Архітектура знімає лише одне питання, яке зазвичай ставлять першим: куди потрапляє запис. Жодних гарантій щодо доказової сили запису ми не даємо.

Коли в записі є інші люди

Щойно в записі звучить хтось іще, технічний бік відходить на другий план. Стаття 163 Кримінального кодексу карає порушення таємниці листування й телефонних розмов, тобто втручання в чужі комунікації. Зворотного висновку — «а власну розмову записувати можна» — ми свідомо не робимо: це юридична оцінка, яку ми не маємо права давати. Стаття 182 КК стосується незаконного збирання, зберігання, використання та поширення конфіденційної інформації про особу, тож вона стає актуальною не лише в момент запису, а й тоді, коли ви надсилаєте комусь готовий транскрипт. Цивільний кодекс додає свій шар: стаття 301 — право на приватне життя, стаття 306 — таємниця листування й телефонних розмов, використання та оприлюднення яких потребує згоди, стаття 307 — згода на відеозйомку, що важливо, бо запис екрана фіксує не лише звук.

Практичне правило одне: попередьте і отримайте згоду на початку розмови, зафіксуйте її в самому записі або в протоколі, а якщо людина проти — не записуйте. На роботі окремої «статті про запис» немає: питання регулюють закон про персональні дані та внутрішні правила, тому узгодьте це заздалегідь із керівництвом і з відповідальною за персональні дані особою. Це інформаційний блок, а не юридична консультація.

Чотири речі, які легко переплутати

Розпізнавання мовлення відповідає на питання, що було сказано. Розділення мовців відповідає, хто це сказав — лише разом вони дають читабельний запис розмови. Синтез мовлення — зворотний напрямок: текст перетворюється на голос. А голосове керування в macOS виконує команди, а не створює зв’язний текст.

Локальне розпізнавання мовлення на Mac

Lesskeys — застосунок для macOS, який працює винятково локально: голосове введення гарячою клавішею в будь-якій програмі та транскрибація розмов, інтерв’ю й готових аудіо- та відеофайлів з автоматичним поділом на мовців. Розпізнає 99 мов і сам визначає, якою ви говорите. Продиктований текст потрапляє в буфер обміну, а вставляєте його ви самі через ⌘V — застосунок нічого не друкує самостійно в чужі вікна, тож ви бачите кожну фразу до того, як вона кудись потрапить.

Завантаження безкоштовне, Pro відкриває разова покупка в застосунку — $49.99, в App Store сума показується у валюті вашого акаунта. Це не підписка й не оплата за хвилини. У безкоштовній версії доступні 5 хвилин диктування на добу та 5 аудіо- і 5 відеотранскрипцій усього (не на день); сам запис не обмежується ніколи, а повторна транскрибація вже розшифрованого файлу квоту не витрачає. Якщо хочете побачити весь процес крок за кроком — перейдіть до опису того, як перетворити голос на текст.

Завантажити в Mac App Store

Завантаження безкоштовне. Без підписки. · Pro — разова покупка $49.99 у застосунку (в App Store ціна у валюті вашого акаунта) · macOS 13 або новіша

Часті запитання

Що таке локальне розпізнавання мовлення?

Це перетворення мовлення на текст безпосередньо на вашому комп’ютері. Модель лежить файлом на диску й рахує на графічному чипі, а запис нікуди не надсилається. Ту саму річ називають розпізнаванням мовлення офлайн, локальною транскрибацією або моделлю на пристрої.

Чим локальне розпізнавання відрізняється від хмарного?

У хмарі запис потрапляє на сервер постачальника й обробляється там, зазвичай з обліковим записом і оплатою за хвилини. Локально рахує ваш Mac, запис не залишає комп’ютер і все працює без інтернету — натомість потрібне потужніше залізо, а довгі файли навантажують саме вашу машину.

Чим «розпізнавання мовлення» відрізняється від «розпізнавання мови»?

Розпізнавання мовлення перетворює сказане вголос на текст. Розпізнавання мови визначає, якою саме мовою говорить людина. Lesskeys робить обидві дії: спершу визначає мову запису серед 99 доступних, потім перетворює мовлення на текст.

Яке залізо потрібне для локального розпізнавання мовлення на Mac?

Потрібен Mac з Apple Silicon, тобто з чипом M1 або новішим, і macOS 13 (Ventura) чи новіша. Mac на процесорах Intel не підтримуються, бо моделі потрібна спільна пам’ять процесора й графічного чипа. Перевірити можна в меню Apple → «Про цей Mac».

Чи означає локальна обробка, що питання персональних даних закрите?

Ні. Локальна обробка — це твердження про архітектуру: аудіофайл не залишає ваш Mac і немає постачальника, який його отримує. Ми не заявляємо відповідності Закону України «Про захист персональних даних», GDPR чи будь-яким стандартам. Оцінка мети й правової підстави — до вашого юриста або до відповідальної за персональні дані особи.

Чи можна просто записати розмову з іншою людиною?

Стаття 163 Кримінального кодексу карає порушення таємниці листування й телефонних розмов, тобто втручання в чужі комунікації, а стаття 182 — незаконне збирання, використання й поширення конфіденційної інформації про особу; Цивільний кодекс вимагає згоди на використання телефонних розмов та на відеозйомку. Практичне правило: попередьте і отримайте згоду, а на роботі узгодьте з керівництвом і відповідальною за персональні дані особою. Це інформація, а не юридична консультація.

Читайте також