Startpagina › Spraak naar tekst op de Mac

Zo werkt het · Van spraak naar tekst

Spraak naar tekst op de Mac: zo werkt de keten

Tussen de gesproken zin en de kant-en-klare tekst zitten vier stappen: opnemen, herkennen door een lokaal model, opschonen en invoegen. Deze pagina loopt ze allemaal langs — zonder snelheidsbeloftes, wél met de plekken waar het in de praktijk hapert.

100%lokaal op je Mac — audio wordt nooit geüpload
Gratisdownloaden — Pro eenmalig $49,99, geen abonnement
99talen, automatisch herkend
macOS 13+Apple Silicon (M1 of nieuwer)

De keten in vier stappen

Wat er tussen je stem en de tekst in je document gebeurt, volgt bij elke vorm van spraakherkenning hetzelfde patroon:

Die laatste stap is bewust jouw handeling: de app typt niets uit zichzelf in andere programma’s. Het kost je één toetsaanslag, en het levert op dat er geen programma buiten je om tekst in je vensters zet.

Dicteren: sneltoets vasthouden, spreken, plakken

Zet je cursor waar de tekst moet komen — een mail, Slack, Pages, een formulier in Safari. Houd de sneltoets ingedrukt, spreek je zin uit, laat los. Er verschijnt een klein balkje met een niveaumeter, zodat je meteen ziet of je microfoon daadwerkelijk geluid oppikt. Even later staat de tekst op je klembord en plak je hem met ⌘V.

Kort tikken in plaats van vasthouden schakelt de opname aan en uit: één tik start, de volgende tik stopt. Dat is prettiger voor langere stukken, waarbij je je vinger niet op de toets wilt houden.

Eén ding om te weten voordat je denkt dat het stuk is: bij een bluetooth-headset duurt het ongeveer anderhalve seconde voordat de microfoon van luisterstand naar gespreksstand is geschakeld. Houd je de toets korter ingedrukt, dan neem je vooral stilte op. Met een bekabelde of de ingebouwde microfoon speelt dat niet.

De sneltoets instellen

De combinatie ligt niet vast: je legt hem in de instellingen op de toets die jou het beste ligt. Twee praktische tips. Kies iets wat niet botst met wat je al gebruikt — Spotlight, een launcher als Raycast of Alfred, en de emoji-kiezer bezetten samen al aardig wat combinaties. En kies iets wat je met één hand kunt vasthouden, want je houdt hem tijdens de hele zin ingedrukt.

De eerste keer vraagt macOS toestemming voor de microfoon. Weigerde je die per ongeluk, dan zet je hem alsnog aan via Systeeminstellingen › Privacy en beveiliging › Microfoon.

Bestaande opnames volgen dezelfde route

Sleep je een bestand in het venster — een m4a uit Spraakmemo’s, een mp3, een wav, de geluidsband van een mp4 of mov — dan doorloopt dat dezelfde keten, alleen zonder microfoon en met meer rekentijd. Je krijgt dan geen los stukje tekst maar een transcript met tijdcodes en gescheiden sprekers. Dat pad staat uitgebreider beschreven bij audio naar tekst omzetten.

Wat dat model is en waar het staat

Het “model” is een bestand van enkele honderden megabytes tot ruim anderhalve gigabyte, afhankelijk van de grootte die je kiest. Het wordt één keer gedownload tijdens het instellen en staat daarna gewoon op je schijf. Vanaf dat moment heb je geen internetverbinding meer nodig.

De afweging is simpel: een groter model is nauwkeuriger en trager, een kleiner model sneller en foutgevoeliger. Voor korte dicteerzinnen volstaat een kleiner model vaak; voor een gesprek van een uur vol vaktaal loont het grootste.

Een detail dat vaak voor verwarring zorgt: de eerste transcriptie na het opstarten duurt langer, omdat het model dan van schijf in het geheugen wordt geladen. Daarna gaat het merkbaar vlotter. Wij plakken er bewust geen “x keer sneller dan typen” op: dat hangt volledig af van je Mac, je model en je opname.

99 talen en automatische taalherkenning

Er worden 99 talen herkend en de taal wordt automatisch bepaald — je hoeft niets om te zetten om na een Nederlandse mail een Engelse te dicteren. Je kunt de herkenning wel begrenzen tot de talen die je echt gebruikt, bijvoorbeeld Nederlands en Engels. Dat is aan te raden: hoe kleiner de verzameling, hoe kleiner de kans dat een kort of zacht fragment als een heel andere taal wordt aangezien. Voor Nederlandstaligen is dat geen theoretisch geval, want Nederlands, Duits en Afrikaans liggen akoestisch dicht genoeg bij elkaar om een korte zin te laten kantelen.

Wat er tussen herkenning en uitvoer gebeurt

Ruwe modeluitvoer is nog geen bruikbare tekst. Daartussen zit een aantal stappen: interpunctie en hoofdletters, en daarna jouw eigen tekstvervangingen — afkortingen die automatisch worden uitgeschreven, vaste formuleringen, namen die je altijd op dezelfde manier gespeld wilt zien. Dat laatste is de goedkoopste manier om vaktaal onder controle te krijgen: een naam die je model structureel verkeerd schrijft, corrigeer je één keer als regel in plaats van elke keer met de hand.

Daarnaast zit er een filter op herhalingslussen: het bekende verschijnsel waarbij een model in een stiltemoment dezelfde zin blijft herhalen. En je kunt per programma andere instellingen laten gelden, zodat je in een chatvenster andere gewoontes hebt dan in een tekstverwerker.

Als je microfoon niet wordt gehoord

Waar de kwaliteit vanaf hangt

Afstand tot de microfoon is de grootste knop waar je aan kunt draaien — groter dan welke instelling ook. Daarna komt achtergrondgeluid: een café, een ventilator of een openstaand raam kost meer dan je denkt. En spreek in hele zinnen: het model gebruikt de context van de zin om woorden te kiezen, dus losse woorden met lange stiltes ertussen leveren juist slechtere tekst op dan gewoon doorpraten.

Als er anderen op de opname staan

Dicteren doe je alleen; zodra je een gesprek opneemt, komen er anderen bij kijken. In Nederland is het opnemen van een gesprek waaraan je zelf deelneemt niet strafbaar — artikel 139a Sr gaat over het heimelijk opnemen van gesprekken waar je géén deelnemer aan bent. Dat is geen vrijbrief: in werkverband heb je een grondslag onder de AVG nodig, heeft de ondernemingsraad een stem bij het monitoren van medewerkers, en kan het delen van een stiekeme opname alsnog onrechtmatig zijn. Meld het daarom aan het begin en leg de instemming vast. Meer daarover staat bij notulen maken van een vergaderopname.

Systeemeisen en kosten

Lesskeys draait vanaf macOS 13 (Ventura) en vereist een Mac met Apple Silicon (M1 of nieuwer); Intel-Macs worden niet ondersteund. Downloaden is gratis, de volledige versie schakel je vrij met een eenmalige in-app-aankoop van $49,99 (in de Nederlandse App Store in euro’s) — geen abonnement, geen afrekening per minuut. In de gratis versie zit 5 minuten dictaat per dag plus 5 audio- en 5 videotranscripties in totaal; opnemen en opnieuw laten uitwerken zijn onbeperkt.

Downloaden in de Mac App Store

Gratis te downloaden. Eenmalig betalen. Geen abonnement. · Pro eenmalig $49,99 (in de Nederlandse App Store in euro's) · macOS 13 of nieuwer

Veelgestelde vragen

Hoe zet ik spraak om in tekst op mijn Mac?

Je zet je cursor waar de tekst moet komen, houdt de sneltoets ingedrukt, spreekt je zin uit en laat los. Een lokaal taalmodel herkent de spraak, de tekst komt op je klembord en je plakt hem met ⌘V. Bestaande opnames sleep je in het venster en krijg je terug als transcript met tijdcodes en sprekers.

Werkt spraak naar tekst zonder internetverbinding?

Ja. Het taalmodel wordt één keer gedownload tijdens het instellen en staat daarna op je schijf. Daarna werkt het herkennen zonder verbinding, ook in de vliegtuigmodus of op een afgeschermd netwerk.

Typt de app de tekst automatisch in mijn programma?

Nee. De herkende tekst komt op je klembord en jij plakt hem zelf met ⌘V. De app zet niets buiten je om in een ander venster.

Waarom duurt de eerste transcriptie langer?

Bij de eerste keer na het opstarten moet het model van schijf in het geheugen worden geladen. Daarna is dat al gebeurd en gaat het merkbaar sneller. Hoe lang het precies duurt, hangt af van je Mac, de gekozen modelgrootte en de lengte van de opname.

Moet ik de taal instellen voordat ik dicteer?

Nee, de taal wordt automatisch bepaald binnen 99 talen. Het is wel verstandig om de herkenning te beperken tot de talen die je echt gebruikt, bijvoorbeeld Nederlands en Engels: dan wordt een kort of zacht fragment minder snel voor een andere taal aangezien.

Welke Mac heb ik nodig en wat kost het?

Minimaal macOS 13 (Ventura) en een Mac met Apple Silicon, dus M1 of nieuwer; Intel-Macs worden niet ondersteund. De app is gratis te downloaden en de volledige versie kost eenmalig $49,99 als in-app-aankoop, zonder abonnement. Gratis krijg je 5 minuten dictaat per dag plus 5 audio- en 5 videotranscripties in totaal; opnemen en opnieuw laten uitwerken zijn onbeperkt.

Meer hierover