Forside › Lokal talegenkendelse
Grundbegreber · talegenkendelse på Mac
Lokal talegenkendelse: hvad det teknisk betyder
Lokal talegenkendelse betyder, at sprogmodellen kører på din egen computer: optagelsen bliver omsat til tekst dér, og lydfilen forlader ikke maskinen. Du støder også på ordene on-device talegenkendelse og offline transskribering om det samme.
Hvad talegenkendelse er
Talegenkendelse er den automatiske omsætning af tale til skrevet tekst. Teknologien er ikke ny — den har været brugt i årevis i blandt andet sundhedsvæsenets journalskrivning — men den er blevet markant bedre, og den er flyttet fra store centrale systemer ud på almindelige computere. Det interessante spørgsmål er derfor ikke længere, om det virker, men hvor det foregår.
I den ene model optager programmet din stemme, sender lydfilen op til en server hos leverandøren, lader en model regne dér og henter teksten tilbage. I den anden model ligger den samme slags model som en fil på din egen harddisk, og udregningen sker i din maskines hukommelse og på dens grafikkerne. Det er den anden model, der kaldes lokal talegenkendelse — på engelsk on-device, som mange danskere også søger på. Vejen bliver kort: lyd ind, tekst ud, intet netværk imellem.
Forskellen er ikke en detalje for teknikere. Den afgør, hvem der får fingre i din optagelse, om programmet overhovedet virker uden forbindelse, hvad det koster i drift, og hvor kraftig en maskine du skal have.
Cloud eller lokalt: hvor bliver lyden af
Begge tilgange giver brugbare resultater i dag. Forskellen ligger i alt det, der sker ved siden af selve teksten.
| Lokalt (on-device) | Cloud | |
|---|---|---|
| Hvor beregningen sker | På din egen computer | På leverandørens server |
| Lydfilen forlader maskinen | Nej | Ja |
| Virker uden internet | Ja | Nej |
| Kræver en konto | Nej | Som regel ja |
| Betalingsmodel | Ofte engangskøb | Typisk pr. minut eller abonnement |
| Krav til hardwaren | Høje — der skal en moderne grafikkerne til | Lave |
| Tid på lange optagelser | Afhænger af din maskine | Afhænger af serverens belastning |
De to nederste rækker er den ærlige bagside: lokal talegenkendelse flytter regnearbejdet over til dig. Et interview på to timer holder din Mac beskæftiget, mens det bliver skrevet ud, og blæseren kan godt gå i gang undervejs. Til gengæld opstår der ikke en kopi af optagelsen et sted, du ikke har kontrol over.
Hvorfor det kræver Apple Silicon
En moderne sprogmodel til talegenkendelse består af flere hundrede millioner og op til nogle få milliarder parametre. For at udskriften kan blive færdig hurtigere, end optagelsen varer, skal udregningerne køre på grafikkernen, og modellen skal kunne ligge i den hukommelse, som processor og grafikkerne deler.
Det er præcis dét, Apple Silicon giver: processoren og grafikkernen deler den samme hukommelse, så modellen ikke skal kopieres frem og tilbage mellem to adskilte lagre. Den forudsætning findes ikke på Intel-Mac'er. Derfor er Lesskeys udelukkende et Apple Silicon-program: en Mac med M1 eller nyere er et krav, ikke en anbefaling, og Intel-Mac'er understøttes ikke. Styresystemet skal være macOS 13 (Ventura) eller nyere. Begge dele kan du tjekke under Apple-menuen › »Om denne Mac«, inden du køber noget.
Hvad der reelt afgør præcisionen
Vi opgiver bevidst ikke et procenttal for nøjagtighed. Et sådant tal siger næsten ingenting, fordi resultatet afhænger fuldstændig af lyden i netop din optagelse — og det gælder, uanset om modellen kører lokalt eller i skyen. Det, der flytter noget, er dette:
- Mikrofonen og afstanden. En mikrofon tæt på den, der taler, slår enhver model. Rumklang og en telefon, der ligger midt på et mødebord, koster mere præcision end valget af software.
- Krydstale. Når to personer taler i munden på hinanden, bliver den ene gengivet dårligt. Sådan er det i alle systemer.
- Baggrundsstøj. Ventilation, kaffemaskiner og trafik æder af genkendelsen, især når stemmeføringen er lav.
- Fagsprog og egennavne. Personnavne, virksomhedsnavne, stednavne og forkortelser bliver ofte stavet lydret, men forkert. Det er dér, du skal læse efter.
- Dialekt og accent. Rigsdansk genkendes mere sikkert end udpræget dialekt, og dansk talt med kraftig accent er sværere end dansk uden.
- Sprogblanding. Enkelte engelske fagord i en dansk sætning er uproblematisk; skifter samtalen sprog i længere passager, bliver resultatet blandet.
Konklusionen er den samme for al automatisk talegenkendelse: du får et råudkast. Det sparer størstedelen af tastearbejdet, men det erstatter ikke en gennemlæsning — særligt ikke, hvis du senere skal citere teksten.
Hvad »lydfilen forlader ikke din Mac« betyder — og ikke betyder
Det er en beskrivelse af, hvordan programmet er bygget: der er ingen upload af lydfilen, ingen server der tager imod den, ingen konto og ingen leverandør, der behandler dine optagelser på dine vegne. Appen virker i flytilstand, og den fungerer bag en lukket firewall.
Det, der ikke følger af det, er en vurdering af, om din konkrete behandling er i orden. En optagelse af andre mennesker er personoplysninger, uanset hvor den behandles, og om du må optage, gemme og bruge den, afhænger af formålet, af hjemlen og af de personer, det handler om. Vi påstår hverken godkendelse, certificering eller overholdelse af noget regelsæt — den vurdering hører hjemme hos din databeskyttelsesrådgiver, din DPO eller din advokat. Arkitekturen tager kun ét spørgsmål af bordet: hvor optagelsen ender.
Når du optager andre
Reglerne i Danmark ser anderledes ud, end mange tror, og anderledes end i for eksempel Tyskland. Efter straffeloven § 263 er det strafbart at aflytte eller ved hjælp af et apparat optage samtaler, man ikke selv deltager i. At optage en samtale, du selv er part i, er derimod ikke i sig selv strafbart.
Det gør det hverken uproblematisk eller i orden. Tre ting gælder stadig. At videregive eller offentliggøre optagelsen kan rammes af straffeloven § 264 d om andres private forhold. At optage kolleger, borgere eller kunder er behandling af personoplysninger, hvor du skal have et grundlag og skal oplyse folk om det, og skjult optagelse på arbejdspladsen er gentagne gange blevet kritiseret. Og ansættelsesretligt er skjult optagelse af kolleger eller ledelse blevet behandlet som en alvorlig sag, også hvor der ikke var begået noget strafbart.
Den praktiske anbefaling er enkel: sig højt, at du optager, inden du trykker på knappen, skriv det i referatet, og lad være, hvis nogen siger nej. Det er en oplysning, ikke juridisk rådgivning.
Talegenkendelse, stemmegenkendelse og diktering
Ordene bruges i flæng, og det gør det unødigt svært at søge. Talegenkendelse handler om, hvad der bliver sagt — tale bliver til tekst. Stemmegenkendelse handler om, hvem der taler, altså identifikation af personen ud fra stemmen; det er den funktion, der deler en optagelse op efter taler, og den beskriver vi under hvem siger hvad i en optagelse. Diktering er en brugssituation: du taler, og teksten skal ind i et dokument nu og her. Transskribering er den anden: der findes allerede en optagelse, og du mangler udskriften. Endelig er stemmestyring noget helt tredje — dér udfører computeren kommandoer i stedet for at skrive løbende tekst.
Lokal talegenkendelse på din Mac
Lesskeys er en macOS-app, der udelukkende arbejder lokalt. Den kan to ting: diktering overalt i systemet via en tastaturgenvej, og transskribering af samtaler, møder, interviews og eksisterende lyd- og videofiler med automatisk opdeling efter taler. Der genkendes 99 sprog, og sproget bestemmes automatisk. Dikteret tekst lægges i udklipsholderen, og du sætter den selv ind med ⌘V — appen skriver aldrig af sig selv i andre programmer.
Appen er gratis at hente i Mac App Store. Den fulde version låses op med et engangskøb i appen på 49,99 $, altså ikke et abonnement. Gratisversionen giver 5 minutters diktering om dagen samt 5 lyd- og 5 videotranskriptioner i alt — ikke pr. dag. Selve optagelsen er aldrig begrænset, og en optagelse, du allerede har transskriberet, kan køres igennem igen, uden at det bruger af kvoten.
Vil du se forløbet trin for trin, kan du læse videre under tale til tekst på Mac.
Gratis at hente. Betal én gang. Intet abonnement. · Fuld version 49,99 $ som engangskøb (vises i kroner i App Store) · macOS 13 eller nyere
Ofte stillede spørgsmål
Hvad er lokal talegenkendelse?
Lokal talegenkendelse omsætter tale til tekst direkte på din egen computer. Sprogmodellen ligger som en fil på harddisken og regner på maskinens grafikkerne, og lydfilen bliver ikke uploadet. Det kaldes også on-device talegenkendelse eller offline transskribering.
Hvad er forskellen på lokal og cloudbaseret talegenkendelse?
I en cloudtjeneste sendes optagelsen til leverandørens server og behandles dér, som regel med en konto og betaling pr. minut eller et abonnement. Lokalt regner din egen Mac, lydfilen forlader ikke maskinen, og det virker uden internet — til gengæld kræver det kraftigere hardware, og lange optagelser tager tid på din egen maskine.
Er lokal talegenkendelse lige så præcis som en cloudtjeneste?
Det kommer an på optagelsen, ikke på hvor beregningen sker, og vi påstår ikke, at den ene er bedre end den anden — det må du afprøve på din egen lyd. De største fejlkilder er de samme begge steder: mikrofonens placering, krydstale, baggrundsstøj samt egennavne og fagudtryk. Vi opgiver bevidst ikke et procenttal, fordi resultatet afhænger helt af lyden i din optagelse. Regn under alle omstændigheder med at læse udskriften igennem.
Hvilken Mac kræver lokal talegenkendelse?
Lesskeys kræver en Mac med Apple Silicon, altså M1 eller nyere, og mindst macOS 13 (Ventura). Intel-Mac'er understøttes ikke, fordi modellen har brug for den hukommelse, som processor og grafikkerne deler. Du kan se din model under Apple-menuen og »Om denne Mac«.
Betyder lokal behandling, at jeg frit må optage og gemme samtaler?
Nej. Lokal behandling er en beskrivelse af softwarens opbygning: lydfilen forlader ikke din Mac, og der er ingen leverandør, der får adgang til den. Om du må optage, gemme og bruge en bestemt samtale, afhænger af formålet og af de personer, det handler om, og den vurdering hører hjemme hos din databeskyttelsesrådgiver eller advokat. Vi påstår hverken godkendelse eller overholdelse af et regelsæt.
Er talegenkendelse det samme som stemmegenkendelse?
Nej. Talegenkendelse handler om, hvad der bliver sagt, og laver tale om til tekst. Stemmegenkendelse handler om, hvem der taler, og bruges til at dele en optagelse op efter person. I en udskrift af et møde er det de to funktioner tilsammen, der giver et referat, man kan læse.