Forsiden › Lokal talegjenkjenning

Grunnbegreper · Talegjenkjenning på Mac

Lokal talegjenkjenning: hva det faktisk betyr

Lokal talegjenkjenning vil si at språkmodellen kjører på din egen maskin: opptaket gjøres om til tekst der, og lydfilen forlater aldri Mac-en. På norsk brukes også «on-device talegjenkjenning» og «offline transkribering» om det samme.

100%lokalt på Mac-en — lyden lastes aldri opp
Gratiså laste ned — Pro låses opp for 49,99 $ én gang
99språk, gjenkjennes automatisk
macOS 13+Apple Silicon (M1 eller nyere)

Hva lokal talegjenkjenning er

Talegjenkjenning er automatisk omgjøring av tale til skrevet tekst. Det avgjørende på denne siden er ikke om det virker, men hvor det skjer. I en skytjeneste tar programmet opp stemmen din, sender lydfilen til en server hos leverandøren, en modell regner der, og teksten kommer tilbake. I en lokal løsning ligger modellen som en fil på din egen disk, og regnearbeidet gjøres i maskinens minne og på grafikkprosessoren. Veien dataene tar blir kort: mikrofon eller lydfil inn, tekst ut, ingen nettforbindelse imellom.

Det er ikke en detalj i markedsføringen, men et arkitekturvalg med konkrete følger: for fortroligheten, for om programmet virker uten nett, for hva det koster over tid, og for hva maskinen din må tåle.

Tre begreper som stadig blandes

Norsk språkbruk på området er upresis, og det gjør det vanskelig å søke etter riktig verktøy. Disse tre betyr ikke det samme:

BegrepHva det gjørTypisk bruk
TalegjenkjenningGjør tale om til tekstDiktering, transkribering, undertekster
StemmegjenkjenningKjenner igjen hvem som snakkerInndeling av et opptak etter taler
TalesynteseLeser skrevet tekst opp som taleOpplesing, skjermleser, lydbok

Denne siden handler om det første. Det andre — å skille talerne fra hverandre i et opptak — er en egen operasjon som kjøres i tillegg, og som er beskrevet under hvem sa hva i opptaket. Talesyntese går motsatt vei og hører ikke hjemme her. En fjerde ting igjen er talestyring i macOS, som utfører kommandoer i stedet for å skrive løpende tekst.

Sky eller lokalt: forskjellen i praksis

Begge tilnærmingene gir brukbare resultater i dag. De skiller seg i alt som skjer ved siden av selve teksten.

LokaltSkytjeneste
Hvor behandlingen skjerDin egen MacLeverandørens server
Lydfilen forlater maskinenNeiJa
Virker uten nettJaNei
Krever kontoNeiSom regel ja
BetalingsmodellOfte engangskjøpOftest per minutt eller abonnement
Krav til maskinvareHøyt — moderne GPU nødvendigLavt
Tid på lange opptakAvhenger av din maskinAvhenger av serverbelastningen
Antall databehandlereIngen ekstraÉn til, med egen avtale

De to nederste linjene peker hver sin vei, og begge er ærlige. Lokal kjøring flytter regnearbeidet til deg. Til gjengjeld oppstår det ingen kopi av opptaket et sted du ikke rår over.

Hva som faktisk skjer på maskinen

Språkmodellen lastes ned én gang. Det er den eneste gangen nett er nødvendig, ved siden av selve nedlastingen fra Mac App Store. Modellen er en fil på disken, alt fra noen hundre megabyte til et par gigabyte avhengig av hvilken du velger.

Når du så tar opp, eller åpner en lydfil, gjøres lyden om til et 16 kHz monosignal, deles i biter, og hver bit kjøres gjennom modellen på GPU-en. Ut kommer tekst med tidsmarkører. Er det flere stemmer i opptaket, kjøres en egen inndeling etter stemme i tillegg. Ingenting av dette krever en server, en konto eller en pålogging. Slår du av wifi midt i en transkribering, fortsetter den som før.

Derfor er Apple Silicon et krav

En moderne talegjenkjenningsmodell har fra noen hundre millioner til noen milliarder parametere. For at transkriberingen skal gå raskere enn opptaket varer, må regneoperasjonene kjøres på grafikkprosessoren, og modellen må ligge i et minne som både prosessoren og GPU-en når.

Det er nettopp dette Apple Silicon gir med delt minne: prosessor og GPU bruker samme minneområde, slik at modellen slipper å kopieres frem og tilbake. Intel-Macer mangler denne forutsetningen. Derfor er en Mac med M1 eller nyere et krav, ikke en anbefaling — på Intel-maskinvare kjører Lesskeys ikke i det hele tatt. Operativsystemet må være macOS 13 (Ventura) eller nyere. Du sjekker din egen maskin under Apple-menyen › «Om denne maskinen».

Hva lokal kjøring koster deg

Regnekraften er ikke gratis, den er bare flyttet. Under en lang transkribering merker du det: modellen legger beslag på minne, GPU-en går varm, viften kan starte, og på batteri går strømmen fortere. Et to timer langt intervju holder Mac-en opptatt en god stund, og på en maskin med lite minne bør du la den jobbe uten femten andre programmer åpne samtidig.

Det finnes heller ingen serverpark å skalere på. En skytjeneste kan kaste maskinvare etter en kø; her er kapasiteten den Mac-en du sitter ved. Det er avveiningen: du bytter litt fart og bekvemmelighet mot at ingen andre får lyden.

Hvor nøyaktig er det?

Vi oppgir ingen prosenttall, fordi vi ikke har egne målinger å vise til, og tall fra andres testsett sier lite om ditt møterom. Det som derimot er godt kjent, er hva feilene skyldes — og det handler nesten alltid om lyden, ikke om modellen:

Konklusjonen er den samme uansett leverandør: et maskinelt transkript er et råutkast. Det fjerner mesteparten av skrivearbeidet, men erstatter ikke korrekturen — særlig ikke der du senere skal sitere teksten.

Hva «lyden forlater ikke Mac-en» betyr — og ikke betyr

Det er en påstand om arkitektur: det finnes ingen opplasting av lydfilen, ingen tjeneste som tar imot opptaket, og dermed ingen ekstra databehandler. Lesskeys krever ingen konto og virker i flymodus.

Det som ikke følger av dette, er en vurdering av om nettopp din behandling er lovlig. En annen persons stemme er en personopplysning, og om du kan ta opp, lagre og bruke en bestemt samtale avhenger av formålet, av hvem som er med og av hvilken virksomhet du er i. Vi hevder ingen sertifisering og intet samsvar med personvernregelverket; den vurderingen hører hjemme hos personvernombudet eller juridisk avdeling, og Datatilsynet er tilsynsmyndighet. Arkitekturen tar bare unna ett spørsmål som ellers kommer først: hvor lyden blir av.

Når andre er med i opptaket

Å ta opp en samtale du selv deltar i, er ikke straffbart i Norge. Å ta opp i skjul en samtale du ikke deltar i, rammes derimot av straffeloven § 205. Men «ikke straffbart» er ikke det samme som greit. I arbeidslivet regnes skjult opptak av kolleger som brudd på lojalitetsplikten og har vært grunnlag for oppsigelse, og systematisk opptak som kontrolltiltak utløser drøftingsplikt med tillitsvalgte etter arbeidsmiljøloven kapittel 9. Har du taushetsplikt — helsepersonelloven § 21, advokaters fortrolighet, kommunal saksbehandling, HR eller kildevern — er det den plikten som setter grensen, ikke programvaren. Praktisk: si fra før du starter, noter samtykket, og la være å ta opp hvis noen sier nei. Dette er veiledning, ikke juridisk rådgivning.

Lokal talegjenkjenning på Mac

Lesskeys er en macOS-app som utelukkende arbeider lokalt: diktering med hurtigtast over hele systemet, og transkribering av samtaler, intervjuer, lyd- og videofiler med automatisk inndeling etter taler. 99 språk gjenkjennes, og språket bestemmes automatisk per opptak. Diktert tekst legges på utklippstavlen, og du limer den inn selv med V — appen skriver ikke inn i andre programmer på egen hånd.

Nedlastingen er gratis. Gratisversjonen gir 5 minutter diktering per dag og 5 lyd- og 5 videotranskripsjoner totalt — totalt, ikke per dag. Opptak er alltid ubegrenset, og å transkribere på nytt noe du allerede har transkribert, koster ingenting. Pro låses opp med ett engangskjøp i appen på 49,99 $, uten abonnement. Vil du se fremgangsmåten steg for steg, les tale til tekst på Mac.

Last ned i Mac App Store

Gratis å laste ned — gratisversjonen har grenser. Uten abonnement. · Pro låses opp med ett engangskjøp på 49,99 $ (norsk App Store viser beløpet i kroner) · macOS 13 eller nyere

Ofte stilte spørsmål

Hva er lokal talegjenkjenning?

Lokal talegjenkjenning gjør tale om til skrevet tekst direkte på din egen maskin. Språkmodellen ligger som en fil på disken og regner på GPU-en, og lydfilen lastes ikke opp noe sted. «On-device talegjenkjenning» og «offline transkribering» betyr det samme.

Hva er forskjellen på talegjenkjenning og stemmegjenkjenning?

Talegjenkjenning gjør tale om til tekst, altså hva som blir sagt. Stemmegjenkjenning handler om hvem som snakker, og brukes til å dele et opptak inn etter taler. Talesyntese er den motsatte veien: den leser skrevet tekst opp som tale.

Hvor nøyaktig er lokal talegjenkjenning?

Vi oppgir ingen prosenttall, fordi vi ikke har egne målinger å vise til. Feilene skyldes stort sett lyden: mikrofonavstand, bakgrunnsstøy, overlappende tale, samt fagord, egennavn og dialekt. Regn med et råutkast som må korrekturleses før du siterer det.

Hvilken Mac trengs for lokal talegjenkjenning?

Lesskeys krever en Mac med Apple Silicon, altså M1 eller nyere, og minst macOS 13 (Ventura). Intel-Macer støttes ikke, fordi modellen er avhengig av at prosessoren og GPU-en deler minne. Sjekk maskinen under Apple-menyen › «Om denne maskinen».

Betyr lokal behandling at personvernet er i orden?

Nei. Lokal behandling er en beskrivelse av arkitekturen: lydfilen forlater ikke Mac-en, og ingen ekstern leverandør får opptaket. Om du kan ta opp og bruke en bestemt samtale, avgjøres av formålet og av regelverket du er underlagt. Vi hevder ingen sertifisering eller samsvar — avklar bruken med personvernombudet eller juridisk avdeling.

Kan jeg ta opp en samtale jeg selv deltar i?

Å ta opp en samtale du selv deltar i, er ikke straffbart i Norge; skjult opptak av en samtale du ikke deltar i rammes av straffeloven § 205. I arbeidslivet er skjult opptak av kolleger likevel illojalt og har vært grunnlag for oppsigelse. Si fra før du starter, og la være å ta opp hvis noen sier nei. Dette er veiledning, ikke juridisk rådgivning.

Les også