Strona główna › Lokalne rozpoznawanie mowy

Podstawy · rozpoznawanie mowy na Macu

Lokalne rozpoznawanie mowy — co to znaczy technicznie

Lokalne rozpoznawanie mowy oznacza, że model językowy pracuje na Twoim własnym komputerze: nagranie zamienia się w tekst na miejscu i nie opuszcza urządzenia. Spotkasz też określenia „rozpoznawanie mowy offline”, „transkrypcja lokalna” i „model na urządzeniu” — chodzi o to samo.

100%lokalnie na Macu — audio nigdzie nie jest wysyłane
Za darmopobierasz program; wersja Pro to jednorazowy zakup 49,99 $, bez abonamentu
99języków, wykrywanych automatycznie
macOS 13+Apple Silicon (M1 lub nowszy) — wymagany

Co znaczy „lokalne”

Rozpoznawanie mowy to automatyczna zamiana wypowiedzianych słów na tekst. Dla tej strony ważne jest nie to, czy to działa, tylko gdzie się dzieje. W wariancie chmurowym program nagrywa Twój głos, wysyła plik na cudzy serwer, tam liczy model, a gotowy tekst wraca do Ciebie. W wariancie lokalnym ten sam model leży jako plik na Twoim dysku, a obliczenia idą na procesor i układ graficzny Twojego komputera. Droga danych jest krótka: dźwięk wchodzi, tekst wychodzi, po drodze nie ma sieci.

W polskim internecie tę samą rzecz nazywa się na kilka sposobów — „rozpoznawanie mowy”, „zamiana mowy na tekst”, „transkrypcja offline”, „model na urządzeniu”. Wszystkie opisują to samo: przetwarzanie u Ciebie, bez pośrednika. Różnica między nimi jest wyłącznie językowa, a nie techniczna.

Chmura kontra urządzenie — co się naprawdę różni

Oba podejścia dają dziś użyteczne wyniki i żadne z nich nie jest „lepsze” w oderwaniu od zastosowania. Różnią się tym, co poza samym tekstem dzieje się przy okazji.

Lokalnie (na urządzeniu)W chmurze
Gdzie idą obliczeniaTwój komputerSerwer dostawcy
Nagranie opuszcza komputerNieTak
Działa bez internetuTakNie
Konto użytkownikaNiepotrzebneZwykle wymagane
RozliczenieNajczęściej jednorazoweZwykle za minutę nagrania lub w abonamencie
Wymagania sprzętoweWysokie — potrzebny mocny układ graficznyNiskie
Czas przy długim nagraniuZależy od Twojego komputeraZależy od obciążenia serwera

Dwa ostatnie wiersze to uczciwa druga strona medalu. Lokalne rozpoznawanie mowy przenosi obciążenie na Ciebie: dwugodzinny wywiad zajmie Twojego Maca na dłuższą chwilę, wentylator może ruszyć, a bateria schodzi szybciej niż przy pisaniu. W zamian nigdzie nie powstaje kopia nagrania w miejscu, nad którym nie masz kontroli.

Dlaczego wymagany jest Apple Silicon

Współczesny model rozpoznawania mowy to od kilkuset milionów do kilku miliardów parametrów. Żeby transkrypcja szła szybciej niż samo nagranie, te obliczenia muszą lecieć na układzie graficznym, a model musi zmieścić się w pamięci, do której procesor i grafika sięgają wspólnie.

Dokładnie to daje wspólna pamięć w układach Apple Silicon: procesor i GPU korzystają z tej samej pamięci operacyjnej, więc model nie jest bez przerwy kopiowany między dwoma obszarami. Makom z procesorami Intel tego brakuje. Dlatego Lesskeys jest programem wyłącznie dla Apple Silicon — Mac z M1 lub nowszym jest wymagany, a nie zalecany; na sprzęcie Intel program się nie uruchomi. System: macOS 13 (Ventura) lub nowszy. Sprawdzisz to w menu Apple → „Ten Mac”.

Jak model radzi sobie z polszczyzną

To jest pytanie, o które rozbija się każdy polski tekst o rozpoznawaniu mowy, więc odpowiedź bez upiększeń. Model wielojęzyczny radzi sobie z polskim dobrze przy mowie starannej: jedna osoba, mikrofon blisko ust, całe zdania, normalne tempo. Polskie znaki diakrytyczne i interpunkcję model dopisuje sam — nie musisz dyktować „przecinek”, ale też nie jest to zapis w stu procentach zgodny z tym, jak postawiłbyś znaki własnoręcznie.

Realistycznie: automatyczny zapis to materiał surowy. Oszczędza większość przepisywania, ale nie zastępuje korekty, zwłaszcza jeśli zamierzasz z tego tekstu cytować.

Co znaczy „nagranie nie opuszcza Maca”, a czego nie znaczy

Przetwarzanie lokalne to stwierdzenie o architekturze programu: nie ma wysyłki pliku audio, nie ma serwera, który to nagranie przyjmuje, nie ma konta użytkownika ani telemetrii, a program działa w trybie samolotowym. Sieć jest potrzebna wyłącznie do pobrania aplikacji ze sklepu i do jednorazowego pobrania modelu.

Czego z tego nie wynika: oceny, czy Twoje konkretne przetwarzanie jest zgodne z prawem. To, czy wolno Ci nagrać, przechowywać i analizować daną rozmowę, zależy od celu, od osób nagrywanych i od Twojej organizacji. Nie deklarujemy zgodności z żadnymi przepisami i niczego nie certyfikujemy — ocena podstawy prawnej należy do administratora danych, w praktyce do Twojego IOD albo działu prawnego. Architektura zdejmuje z Ciebie tylko jedno pytanie, które zwykle pada jako pierwsze: dokąd trafia nagranie. Nie dajemy też gwarancji wykorzystania transkrypcji jako dowodu w jakimkolwiek postępowaniu.

Kiedy w nagraniu są inne osoby

Od momentu, w którym w nagraniu słychać kogoś jeszcze, kwestia techniczna schodzi na drugi plan. Nagrywanie rozmowy, w której sam uczestniczysz, nie jest w Polsce przestępstwem z art. 267 Kodeksu karnego — ten przepis dotyczy uzyskiwania dostępu do cudzej komunikacji, która nie była przeznaczona dla Ciebie. „Legalne” nie znaczy jednak „bez konsekwencji”: potajemne nagranie narusza dobra osobiste rozmówcy, w tym tajemnicę komunikowania się (art. 23 i 24 Kodeksu cywilnego), i rodzi odpowiedzialność cywilną, a samo przetwarzanie cudzego głosu to przetwarzanie danych osobowych z własnymi obowiązkami. W firmie dochodzi warstwa monitoringu pracowników: art. 22² i następne Kodeksu pracy wymagają wcześniejszej informacji w regulaminie lub obwieszczeniu, a stanowisko UODO wobec nagrywania dźwięku w miejscu pracy jest restrykcyjne.

W praktyce: uprzedź na początku rozmowy, odnotuj zgodę w transkrypcji, a przy sprzeciwie po prostu nie nagrywaj. To informacja, nie porada prawna.

Pojęcia, które łatwo pomylić

Cztery różne rzeczy nazywa się po polsku podobnie, co utrudnia szukanie. Rozpoznawanie mowy odpowiada na pytanie, co zostało powiedziane. Rozpoznawanie mówców odpowiada, kto to powiedział — dopiero jedno z drugim daje czytelny zapis rozmowy. Synteza mowy to kierunek odwrotny: tekst zamieniany w głos. A sterowanie głosem w macOS wykonuje polecenia, zamiast tworzyć tekst ciągły.

Lokalne rozpoznawanie mowy na Macu

Lesskeys to aplikacja macOS działająca wyłącznie lokalnie: dyktowanie skrótem klawiszowym w całym systemie oraz przepisywanie rozmów, wywiadów i gotowych plików audio i wideo z automatycznym podziałem na mówców. Rozpoznaje 99 języków i sam wykrywa, w którym mówisz. Podyktowany tekst trafia do schowka, a wklejasz go sam skrótem ⌘V — program nic nie wpisuje samodzielnie do cudzych okien, więc każdą wypowiedź widzisz, zanim gdziekolwiek wyląduje.

Pobranie jest bezpłatne, a wersję Pro odblokowuje jednorazowy zakup w aplikacji (49,99 $; w polskim App Store zobaczysz kwotę w złotych) — nie ma abonamentu ani opłat za minutę. W wersji bezpłatnej masz 5 minut dyktowania dziennie oraz 5 transkrypcji audio i 5 wideo łącznie; samo nagrywanie nie jest limitowane, a ponowna transkrypcja materiału, który już raz przez nią przeszedł, nie zużywa limitu. Jeśli chcesz zobaczyć cały przebieg krok po kroku, przejdź do opisu zamiany mowy na tekst.

Pobierz w Mac App Store

Pobranie za darmo. Bez abonamentu. · Wersja Pro to jednorazowy zakup w aplikacji 49,99 $ (w polskim App Store cena w złotych) · macOS 13 lub nowszy

Częste pytania

Czym jest lokalne rozpoznawanie mowy?

To zamiana mowy na tekst wykonywana bezpośrednio na Twoim komputerze. Model językowy leży jako plik na dysku i pracuje na układzie graficznym, a nagranie nie jest nigdzie wysyłane. Inne spotykane nazwy tego samego to rozpoznawanie mowy offline, transkrypcja lokalna i model na urządzeniu.

Czym różni się rozpoznawanie lokalne od chmurowego?

W chmurze nagranie trafia na serwer dostawcy i tam jest przetwarzane, zwykle z kontem użytkownika i rozliczeniem za minutę. Lokalnie liczy Twój Mac, nagranie nie opuszcza komputera i wszystko działa bez internetu — w zamian potrzebny jest mocniejszy sprzęt, a długie pliki obciążają Twoją maszynę.

Jak dobrze lokalny model radzi sobie z językiem polskim?

Przy starannej mowie, jednym mówcy i mikrofonie blisko ust wynik jest dobry, a polskie znaki diakrytyczne i interpunkcja powstają automatycznie. Słabiej wypadają nazwiska, nazwy własne, skróty, żargon branżowy i gwara. Automatyczny zapis traktuj jako materiał surowy, który trzeba przeczytać i poprawić.

Jakiego sprzętu wymaga lokalne rozpoznawanie mowy na Macu?

Lesskeys wymaga Maca z Apple Silicon, czyli M1 lub nowszym, oraz systemu macOS 13 (Ventura) lub nowszego. Maki z procesorami Intel nie są obsługiwane — program jest wydawany wyłącznie w wersji dla Apple Silicon, bo dopiero wspólna pamięć procesora i układu graficznego czyni lokalny model praktycznym.

Czy przetwarzanie lokalne załatwia sprawę zgodności z RODO?

Nie. Lokalne przetwarzanie to stwierdzenie o architekturze: plik audio nie opuszcza Twojego Maca i nie ma dostawcy, który go otrzymuje. Ocena podstawy prawnej i celu przetwarzania należy do administratora danych, w praktyce do Twojego IOD lub działu prawnego. Nie deklarujemy zgodności z przepisami ani żadnej certyfikacji.

Czy mogę po prostu nagrać rozmowę z inną osobą?

Nagranie rozmowy, w której sam uczestniczysz, nie jest przestępstwem z art. 267 Kodeksu karnego, ale potajemne nagranie narusza dobra osobiste rozmówcy z art. 23 i 24 Kodeksu cywilnego i rodzi obowiązki wobec danych osobowych. W firmie dochodzi monitoring pracowników z Kodeksu pracy. Uprzedź, odnotuj zgodę, przy sprzeciwie nie nagrywaj. To informacja, nie porada prawna.

Zobacz też