Startpagina › Spraak naar tekst op de Mac
Zo werkt het · Van spraak naar tekst
Spraak naar tekst op de Mac: zo werkt de keten
Tussen de gesproken zin en de kant-en-klare tekst zitten vier stappen: opnemen, herkennen door een lokaal model, opschonen en invoegen. Deze pagina loopt ze allemaal langs — zonder snelheidsbeloftes, wél met de plekken waar het in de praktijk hapert.
De keten in vier stappen
Wat er tussen je stem en de tekst in je document gebeurt, volgt bij elke vorm van spraakherkenning hetzelfde patroon:
- Opnemen. De microfoon levert geluid; de app zet dat om naar het formaat waar het model mee rekent (mono, 16 kHz).
- Herkennen. Het taalmodel op je schijf zet dat geluid om in woorden. Bij Lesskeys gebeurt dat op de GPU van je eigen Mac, niet op een server.
- Opschonen. Interpunctie en hoofdletters, jouw eigen tekstvervangingen, en het opruimen van herkenbare rommel zoals herhalingslussen.
- Invoegen. De tekst komt op je klembord en jij plakt hem met ⌘V op de plek waar je cursor staat.
Die laatste stap is bewust jouw handeling: de app typt niets uit zichzelf in andere programma’s. Het kost je één toetsaanslag, en het levert op dat er geen programma buiten je om tekst in je vensters zet.
Dicteren: sneltoets vasthouden, spreken, plakken
Zet je cursor waar de tekst moet komen — een mail, Slack, Pages, een formulier in Safari. Houd de sneltoets ingedrukt, spreek je zin uit, laat los. Er verschijnt een klein balkje met een niveaumeter, zodat je meteen ziet of je microfoon daadwerkelijk geluid oppikt. Even later staat de tekst op je klembord en plak je hem met ⌘V.
Kort tikken in plaats van vasthouden schakelt de opname aan en uit: één tik start, de volgende tik stopt. Dat is prettiger voor langere stukken, waarbij je je vinger niet op de toets wilt houden.
Eén ding om te weten voordat je denkt dat het stuk is: bij een bluetooth-headset duurt het ongeveer anderhalve seconde voordat de microfoon van luisterstand naar gespreksstand is geschakeld. Houd je de toets korter ingedrukt, dan neem je vooral stilte op. Met een bekabelde of de ingebouwde microfoon speelt dat niet.
De sneltoets instellen
De combinatie ligt niet vast: je legt hem in de instellingen op de toets die jou het beste ligt. Twee praktische tips. Kies iets wat niet botst met wat je al gebruikt — Spotlight, een launcher als Raycast of Alfred, en de emoji-kiezer bezetten samen al aardig wat combinaties. En kies iets wat je met één hand kunt vasthouden, want je houdt hem tijdens de hele zin ingedrukt.
De eerste keer vraagt macOS toestemming voor de microfoon. Weigerde je die per ongeluk, dan zet je hem alsnog aan via Systeeminstellingen › Privacy en beveiliging › Microfoon.
Bestaande opnames volgen dezelfde route
Sleep je een bestand in het venster — een m4a uit Spraakmemo’s, een mp3, een wav, de geluidsband van een mp4 of mov — dan doorloopt dat dezelfde keten, alleen zonder microfoon en met meer rekentijd. Je krijgt dan geen los stukje tekst maar een transcript met tijdcodes en gescheiden sprekers. Dat pad staat uitgebreider beschreven bij audio naar tekst omzetten.
Wat dat model is en waar het staat
Het “model” is een bestand van enkele honderden megabytes tot ruim anderhalve gigabyte, afhankelijk van de grootte die je kiest. Het wordt één keer gedownload tijdens het instellen en staat daarna gewoon op je schijf. Vanaf dat moment heb je geen internetverbinding meer nodig.
De afweging is simpel: een groter model is nauwkeuriger en trager, een kleiner model sneller en foutgevoeliger. Voor korte dicteerzinnen volstaat een kleiner model vaak; voor een gesprek van een uur vol vaktaal loont het grootste.
Een detail dat vaak voor verwarring zorgt: de eerste transcriptie na het opstarten duurt langer, omdat het model dan van schijf in het geheugen wordt geladen. Daarna gaat het merkbaar vlotter. Wij plakken er bewust geen “x keer sneller dan typen” op: dat hangt volledig af van je Mac, je model en je opname.
99 talen en automatische taalherkenning
Er worden 99 talen herkend en de taal wordt automatisch bepaald — je hoeft niets om te zetten om na een Nederlandse mail een Engelse te dicteren. Je kunt de herkenning wel begrenzen tot de talen die je echt gebruikt, bijvoorbeeld Nederlands en Engels. Dat is aan te raden: hoe kleiner de verzameling, hoe kleiner de kans dat een kort of zacht fragment als een heel andere taal wordt aangezien. Voor Nederlandstaligen is dat geen theoretisch geval, want Nederlands, Duits en Afrikaans liggen akoestisch dicht genoeg bij elkaar om een korte zin te laten kantelen.
Wat er tussen herkenning en uitvoer gebeurt
Ruwe modeluitvoer is nog geen bruikbare tekst. Daartussen zit een aantal stappen: interpunctie en hoofdletters, en daarna jouw eigen tekstvervangingen — afkortingen die automatisch worden uitgeschreven, vaste formuleringen, namen die je altijd op dezelfde manier gespeld wilt zien. Dat laatste is de goedkoopste manier om vaktaal onder controle te krijgen: een naam die je model structureel verkeerd schrijft, corrigeer je één keer als regel in plaats van elke keer met de hand.
Daarnaast zit er een filter op herhalingslussen: het bekende verschijnsel waarbij een model in een stiltemoment dezelfde zin blijft herhalen. En je kunt per programma andere instellingen laten gelden, zodat je in een chatvenster andere gewoontes hebt dan in een tekstverwerker.
Als je microfoon niet wordt gehoord
- Geen uitslag op de meter. Kijk in Systeeminstellingen › Privacy en beveiliging › Microfoon of de app toestemming heeft, en in Geluid → Invoer of het juiste apparaat geselecteerd staat.
- Wel uitslag, geen tekst. Meestal staat het invoerniveau erg laag. Zet de schuif in Geluid → Invoer hoger en spreek dichter bij de microfoon; heel zacht opgenomen spraak is veruit de meest voorkomende oorzaak van een leeg resultaat.
- De eerste woorden ontbreken bij een headset. Dat is de bluetooth-vertraging hierboven: tik om te starten in plaats van vasthouden, of wacht een tel voordat je begint.
- Verkeerde taal in de uitvoer. Beperk de herkenning tot de talen die je daadwerkelijk gebruikt.
Waar de kwaliteit vanaf hangt
Afstand tot de microfoon is de grootste knop waar je aan kunt draaien — groter dan welke instelling ook. Daarna komt achtergrondgeluid: een café, een ventilator of een openstaand raam kost meer dan je denkt. En spreek in hele zinnen: het model gebruikt de context van de zin om woorden te kiezen, dus losse woorden met lange stiltes ertussen leveren juist slechtere tekst op dan gewoon doorpraten.
Als er anderen op de opname staan
Dicteren doe je alleen; zodra je een gesprek opneemt, komen er anderen bij kijken. In Nederland is het opnemen van een gesprek waaraan je zelf deelneemt niet strafbaar — artikel 139a Sr gaat over het heimelijk opnemen van gesprekken waar je géén deelnemer aan bent. Dat is geen vrijbrief: in werkverband heb je een grondslag onder de AVG nodig, heeft de ondernemingsraad een stem bij het monitoren van medewerkers, en kan het delen van een stiekeme opname alsnog onrechtmatig zijn. Meld het daarom aan het begin en leg de instemming vast. Meer daarover staat bij notulen maken van een vergaderopname.
Systeemeisen en kosten
Lesskeys draait vanaf macOS 13 (Ventura) en vereist een Mac met Apple Silicon (M1 of nieuwer); Intel-Macs worden niet ondersteund. Downloaden is gratis, de volledige versie schakel je vrij met een eenmalige in-app-aankoop van $49,99 (in de Nederlandse App Store in euro’s) — geen abonnement, geen afrekening per minuut. In de gratis versie zit 5 minuten dictaat per dag plus 5 audio- en 5 videotranscripties in totaal; opnemen en opnieuw laten uitwerken zijn onbeperkt.
Gratis te downloaden. Eenmalig betalen. Geen abonnement. · Pro eenmalig $49,99 (in de Nederlandse App Store in euro's) · macOS 13 of nieuwer
Veelgestelde vragen
Hoe zet ik spraak om in tekst op mijn Mac?
Je zet je cursor waar de tekst moet komen, houdt de sneltoets ingedrukt, spreekt je zin uit en laat los. Een lokaal taalmodel herkent de spraak, de tekst komt op je klembord en je plakt hem met ⌘V. Bestaande opnames sleep je in het venster en krijg je terug als transcript met tijdcodes en sprekers.
Werkt spraak naar tekst zonder internetverbinding?
Ja. Het taalmodel wordt één keer gedownload tijdens het instellen en staat daarna op je schijf. Daarna werkt het herkennen zonder verbinding, ook in de vliegtuigmodus of op een afgeschermd netwerk.
Typt de app de tekst automatisch in mijn programma?
Nee. De herkende tekst komt op je klembord en jij plakt hem zelf met ⌘V. De app zet niets buiten je om in een ander venster.
Waarom duurt de eerste transcriptie langer?
Bij de eerste keer na het opstarten moet het model van schijf in het geheugen worden geladen. Daarna is dat al gebeurd en gaat het merkbaar sneller. Hoe lang het precies duurt, hangt af van je Mac, de gekozen modelgrootte en de lengte van de opname.
Moet ik de taal instellen voordat ik dicteer?
Nee, de taal wordt automatisch bepaald binnen 99 talen. Het is wel verstandig om de herkenning te beperken tot de talen die je echt gebruikt, bijvoorbeeld Nederlands en Engels: dan wordt een kort of zacht fragment minder snel voor een andere taal aangezien.
Welke Mac heb ik nodig en wat kost het?
Minimaal macOS 13 (Ventura) en een Mac met Apple Silicon, dus M1 of nieuwer; Intel-Macs worden niet ondersteund. De app is gratis te downloaden en de volledige versie kost eenmalig $49,99 als in-app-aankoop, zonder abonnement. Gratis krijg je 5 minuten dictaat per dag plus 5 audio- en 5 videotranscripties in totaal; opnemen en opnieuw laten uitwerken zijn onbeperkt.