Головна › Як перетворити голос на текст
Інструкція · голос у текст на Mac
Як перетворити голос на текст на Mac — крок за кроком
Як перетворити голос на текст на Mac — нижче весь шлях сигналу від натиснутої клавіші до готового тексту: що робить мікрофон, де рахує модель, як визначається мова і чому останній крок — ⌘V — робите ви, а не застосунок. Ідеться про живий голос; якщо у вас уже є готовий файл, вам потрібна сторінка про те, як перевести аудіо в текст.
Що відбувається між клавішею і текстом
Ланцюжок короткий і в ньому немає жодного сервера. Ви утримуєте гарячу клавішу — мікрофон пише звук у пам’ять. Ви відпускаєте клавішу — запис іде в модель розпізнавання мовлення, яка лежить файлом на вашому диску й рахує на графічному чипі Mac. Модель визначає мову, повертає текст, застосунок кладе його в буфер обміну й показує вам. Далі ви ставите курсор туди, куди треба, і натискаєте ⌘V.
Жоден із цих кроків не потребує мережі. Саме тому голос перетворюється на текст однаково в літаку, у поїзді, у приміщенні без покриття або тоді, коли інтернету просто немає — модель уже у вас, питати нема кого.
Як перетворити голос на текст: покроково
- Один раз: завантажити модель. Після встановлення застосунок пропонує завантажити модель розпізнавання — це єдиний момент, коли потрібен інтернет. Далі вона лежить на диску й працює автономно.
- Один раз: дозволити мікрофон. macOS запитає доступ до мікрофона під час першого запису. Без цього дозволу система не передасть звук жодній програмі.
- Утримати ⌥Space. Поки клавіша натиснута, іде запис; на екрані видно індикатор і рівень звуку, тож ви бачите, що мікрофон справді щось чує.
- Говорити звичайно. Розділові знаки диктувати не треба — модель розставляє їх сама.
- Відпустити клавішу. Розпізнавання починається одразу; коротка фраза перетворюється на текст за секунди.
- Натиснути ⌘V. Текст уже в буфері обміну — вставте його в лист, нотатку, чат, редактор коду, форму в браузері.
Гаряча клавіша: утримати чи перемкнути
Два способи однакові за результатом і різні за зручністю. Утримання підходить для коротких реплік: натиснули, сказали одне речення, відпустили. Перемикання (коротке натискання вмикає запис, друге вимикає) зручніше для довгої думки, коли тримати клавішу пів хвилини незручно. Комбінацію можна змінити, якщо ⌥Space у вас уже зайнято іншою програмою.
Одна практична деталь: бездротовій гарнітурі потрібно приблизно півтори секунди, щоб перемкнутися в режим мікрофона. Якщо ви натиснули й одразу заговорили, перші слова можуть не потрапити в запис. З Bluetooth-гарнітурою надійніше або витримати коротку паузу після натискання, або користуватися режимом перемикання.
Автовизначення мови — і чому варто звузити перелік
Застосунок розпізнає 99 мов і визначає мову сам, тож перед кожним диктуванням нічого перемикати не треба. Але визначення відбувається на запис, і в цьому вся тонкість: коротка або нерозбірлива фраза дає моделі мало матеріалу для рішення, і вона може «поїхати» в мову, якою ви не говорили.
Лікується це одним налаштуванням: у списку мов лишіть ті дві-три, якими ви реально працюєте — скажімо, українську й англійську. Тоді навіть на двох словах вибір робиться лише між ними, а не між дев’яносто дев’ятьма. Окремі англійські терміни в українському реченні проблемою не є; проблемою є довгі уривки іншою мовою всередині одного запису. Докладніше — на сторінці про розпізнавання української мови.
Модель: одне завантаження — і далі без інтернету
Модель розпізнавання — це файл на кілька сотень мегабайтів або більше, залежно від обраного розміру. Більша модель точніша, але потребує більше пам’яті й часу; менша відповідає швидше. Її можна замінити пізніше й перезапустити розпізнавання на тому самому записі.
Обчислення виконуються на графічному чипі Apple Silicon, який працює зі спільною з процесором пам’яттю. Саме тому Mac з чипом M1 або новішим обов’язковий: на Intel-Mac застосунок не запуститься взагалі. Потрібна також macOS 13 (Ventura) або новіша.
Чому текст іде в буфер обміну, а не друкується сам
Це свідоме рішення, а не спрощення. Застосунок не імітує натискання клавіш і не втручається у вікна інших програм — він кладе розпізнаний текст у буфер обміну й зупиняється. Вставляєте ви, натиснувши ⌘V там, де стоїть курсор.
Практична вигода в тому, що ви бачите кожну фразу до того, як вона кудись потрапить: якщо модель почула не те, ви просто не вставляєте текст. Крім того, буфер обміну працює однаково скрізь — у пошті, нотатках, месенджері, текстовому редакторі, полі форми в браузері, — тож немає програм, «з якими воно не дружить».
Що впливає на якість результату
- Мікрофон і відстань. Гарнітура або мікрофон біля рота дають помітно кращий текст, ніж вбудований мікрофон ноутбука через кімнату.
- Темп і паузи. Звичайне мовлення повними реченнями розпізнається краще за квапливе бурмотіння з обірваними фразами.
- Фоновий шум. Кав’ярня, вулиця, гучний кулер — усе це відбирає точність.
- Власні назви. Прізвища, назви компаній і абревіатури звучатимуть упізнавано, але писатимуться часто неправильно. Це доведеться правити руками.
- Довжина фрази. Одне-два слова дають моделі надто мало контексту — і для тексту, і для визначення мови.
Реалістична рамка така: продиктований текст — чернетка. Він знімає більшість механічної роботи, але його треба перечитати. Жодних обіцянок на кшталт «утричі швидше» ми не даємо: виграш залежить від того, як швидко ви друкуєте і скільки правите.
Що з цим текстом можна робити далі
Кожне диктування зберігається в локальній історії, тож фразу, яку ви вставили годину тому, не треба надиктовувати заново — її можна знайти й скопіювати ще раз. Там же можна перезапустити розпізнавання того самого запису поточними налаштуваннями — наприклад, після того як ви змінили в налаштуваннях модель або звузили перелік мов.
Якщо ж вам потрібен не набір тексту, а розшифровка розмови, то це вже інший сценарій: застосунок пише системний звук Mac разом із мікрофоном, поділяє запис на мовців і складає транскрипт із мітками часу. Тут доречно нагадати: щойно в записі звучать інші люди, попередьте їх і отримайте згоду. Стаття 163 Кримінального кодексу карає порушення таємниці листування й телефонних розмов, тобто втручання в чужі комунікації, стаття 182 — незаконне збирання, використання й поширення конфіденційної інформації про особу, а Цивільний кодекс вимагає згоди на використання телефонних розмов (ст. 306) і на відеозйомку (ст. 307). На роботі це узгоджують із керівництвом і відповідальною за персональні дані особою. Це інформація, а не юридична консультація, і жодних гарантій щодо доказової сили запису ми не даємо.
Вимоги, ціна й безкоштовна версія
| Пункт | Значення |
|---|---|
| Система | macOS 13 (Ventura) або новіша |
| Процесор | Apple Silicon (M1 або новіший) — обов’язково |
| Mac на Intel | не підтримуються |
| Інтернет | лише для завантаження застосунку і одноразового завантаження моделі |
| Ціна | завантаження безкоштовне; Pro — разова покупка $49.99 у застосунку, без підписки |
| Безкоштовна версія | 5 хвилин диктування на добу, 5 аудіо- і 5 відеотранскрипцій усього; запис і повторна транскрибація не обмежуються |
| Обліковий запис | не потрібен; телеметрії немає |
Сума в доларах — це ціна магазину; в App Store вона показується у валюті вашого облікового запису. Спробувати можна без покупки й без реєстрації: 5 хвилин диктування на добу і 5 аудіо- та 5 відеотранскрипцій усього (це загальний ліміт, а не денний). Сам запис не обмежується ніколи, а перезапуск розпізнавання на вже розшифрованому файлі квоту не витрачає. Купівля проходить через Mac App Store — там само діють і правила повернення коштів Apple.
Завантаження безкоштовне. Без підписки. · Pro — разова покупка $49.99 у застосунку (в App Store ціна у валюті вашого акаунта) · macOS 13 або новіша
Часті запитання
Як перетворити голос на текст на Mac без інтернету?
Потрібен застосунок з локальною моделлю розпізнавання. У Lesskeys ви один раз завантажуєте модель, після чого утримуєте ⌥Space, говорите й відпускаєте клавішу: розпізнавання відбувається на графічному чипі вашого Mac, а готовий текст потрапляє в буфер обміну. Мережа після завантаження моделі не потрібна.
Чи вставляє застосунок текст автоматично?
Ні. Розпізнаний текст копіюється в буфер обміну, а вставляєте його ви самі через ⌘V. Застосунок нічого не друкує самостійно в чужі вікна, тож ви бачите кожну фразу до того, як вона кудись потрапить.
Яку гарячу клавішу використовує голосове введення?
За замовчуванням це ⌥Space: утримуйте її, поки говорите, і відпустіть, щоб отримати текст. Є також режим перемикання — коротке натискання вмикає запис, друге вимикає, що зручніше для довгих фрагментів. Комбінацію можна змінити, якщо вона вже зайнята іншою програмою.
Чи треба щоразу вибирати мову?
Ні, мова визначається автоматично серед 99 доступних. Але визначення відбувається на кожен запис, тому на дуже коротких фразах воно буває помилковим. Якщо ви працюєте двома-трьома мовами, звузьте перелік у налаштуваннях до них — вибір робитиметься лише між ними.
Скільки коштує і що дає безкоштовна версія?
Завантаження безкоштовне, а Pro відкриває разова покупка в застосунку — $49.99, без підписки; в App Store сума показується у валюті вашого акаунта. Безкоштовно доступні 5 хвилин диктування на добу та 5 аудіо- і 5 відеотранскрипцій усього. Запис не обмежується, а повторна транскрибація вже розшифрованого файлу квоту не витрачає.
Чому потрібен Mac з Apple Silicon?
Модель розпізнавання рахує на графічному чипі, який в Apple Silicon користується спільною з процесором пам’яттю. У Mac на Intel такої архітектури немає, тому застосунок там не запускається. Потрібен M1 або новіший чип і macOS 13 (Ventura) чи новіша.