Start › Lokal taligenkänning

Grunderna · Taligenkänning på Mac

Lokal taligenkänning – vad det tekniskt innebär

Lokal taligenkänning betyder att språkmodellen ligger på din egen dator, att beräkningen sker där och att ljudet aldrig skickas iväg. Andra ord för samma sak är taligenkänning på enheten, on-device-taligenkänning och offline-transkribering.

100%lokalt på din Mac — ljudet laddas aldrig upp
Gratisatt hämta — Pro låses upp för 49,99 US$ en gång
99språk, identifieras automatiskt
macOS 13+Apple Silicon (M1 eller senare)

Först en ordning på begreppen: taligenkänning eller talsyntes

Det vanligaste snedsteget i svenska sökningar är själva ordet. Taligenkänning är tal som blir text: du talar, eller spelar in, och datorn skriver ut det som sades. Talsyntes är motsatsen, text som blir tal – en uppläsande röst. Den här sidan handlar uteslutande om taligenkänning.

Några angränsande ord som du också stöter på: transkribering är att skriva ut en färdig inspelning i efterhand, diktering är att tala in text direkt medan du sitter vid datorn, och röststyrning i macOS är något helt annat igen – den utför kommandon i stället för att producera löptext. Och talarigenkänning svarar på vem som talade, inte på vad som sades.

Vad lokalt betyder rent praktiskt

Taligenkänning finns i två arkitekturer, och skillnaden ligger inte i om det fungerar utan i var beräkningen görs.

I molnvarianten spelar appen in dig, laddar upp ljudfilen till en server hos leverantören, en modell räknar där, och den färdiga texten kommer tillbaka. I den lokala varianten ligger samma sorts modell som en fil på din hårddisk, och beräkningen sker i datorns eget minne och på dess grafikprocessor. Datavägen blir kort: mikrofon eller ljudfil in, text ut, inget nätverk emellan.

Det är ingen marknadsföringsdetalj utan ett arkitekturval med mycket konkreta följder – för sekretessen, för om det går att arbeta utan nät, för kostnadsmodellen och för vad som krävs av din hårdvara.

Moln eller lokalt: skillnaden i vardagen

Båda vägarna ger användbar text i dag. Det är allt annat som skiljer.

LokaltMoln
Var beräkningen skerDin datorLeverantörens server
Ljudfilen lämnar datornNejJa
Fungerar utan uppkopplingJaNej
Konto krävsNejOftast ja
KostnadsmodellOfta ett engångsköpOftast per minut eller prenumeration
Krav på hårdvaranHögt – modern GPU behövsLågt
Tid för långa filerBeror på din datorBeror på serverlasten
Modellen uppdaterasNär du uppdaterar appenLöpande hos leverantören

De tre sista raderna är den ärliga baksidan. Lokal taligenkänning flyttar räknearbetet till dig: en två timmar lång intervju sysselsätter din Mac ordentligt medan den skrivs ut, och du får inte en tystare, bättre modell varje vecka utan att göra något. I gengäld uppstår ingen kopia av din inspelning på en plats du inte råder över.

Varför Apple Silicon är ett krav och inte en rekommendation

En modern taligenkänningsmodell består av flera hundra miljoner parametrar. För att utskriften ska gå fortare än inspelningen själv måste de beräkningarna köras på grafikprocessorn, och modellen måste samtidigt rymmas i ett minne som både processor och GPU når.

Det är precis vad Apple Silicon ger genom sitt delade minne: processorn och grafikdelen använder samma arbetsminne, så modellen behöver inte kopieras fram och tillbaka mellan två minnesområden. Den förutsättningen saknas på Intel-Macar. Därför är Lesskeys ett rent Apple Silicon-program – en Mac med M1 eller senare är ett krav, inte en rekommendation. Det handlar alltså inte om att det går långsamt på äldre hårdvara; appen körs inte där alls. Operativsystemet ska vara macOS 13 (Ventura) eller senare.

Hur bra blir det?

Vi publicerar inga träffsäkerhetssiffror, eftersom vi inte har egna mätningar att luta oss mot och inte tänker hitta på några. Däremot går det att säga var felen brukar uppstå, och de ligger nästan alltid i ljudet snarare än i modellen:

Räkna alltså med att det maskinen levererar är ett råtranskript. Det tar bort merparten av knapptryckningarna men ersätter inte korrekturläsningen, särskilt inte där texten senare ska citeras.

Svenska bland 99 språk

Svenska ingår bland de 99 språk som känns igen, och språket bestäms automatiskt per inspelning. Svenska med inströdda engelska fackord – sprint, deploy, workshop, onboarding – går bra, eftersom språkvalet avgörs av inspelningen som helhet. Det som blir rörigt är inspelningar som byter språk i längre partier, till exempel ett möte där en halvtimme hålls på engelska och resten på svenska. Kan du begränsa urvalet till de två eller tre språk du faktiskt arbetar på blir korta yttranden märkbart stabilare.

Vad ”ljudet lämnar aldrig datorn” betyder – och inte betyder

Lokal bearbetning är ett påstående om arkitekturen: det finns ingen uppladdning av ljudfilen, ingen servertjänst som tar emot inspelningen och därmed ingen underleverantör som behandlar materialet åt dig. Det krävs inget konto, och allt fungerar i flygplansläge.

Vad som inte följer av detta är ett omdöme om din egen behandling. Att inget ljud lämnar datorn tar bort ett personuppgiftsbiträde ur kedjan, men syfte, rättslig grund, information till de berörda och lagringstid är fortfarande dina frågor. Vi hävdar ingen regelefterlevnad och ingen certifiering; den bedömningen hör hemma hos ditt dataskyddsombud eller din jurist, och tillsynsmyndigheten du vänder dig till heter IMY, Integritetsskyddsmyndigheten. Arkitekturen avlastar dig bara en fråga som annars ställs först: vart tar inspelningen vägen.

Om du spelar in andra

Så fort andra människor hörs på inspelningen är tekniken den mindre frågan. I Sverige är det inte brottsligt att spela in ett samtal du själv deltar i – olovlig avlyssning enligt 4 kap. 9 a § brottsbalken träffar den som i hemlighet avlyssnar eller spelar in ett samtal hen inte deltar i. Men lagligt är inte detsamma som lämpligt: att spela in kollegor i smyg har prövats i Arbetsdomstolen och har kostat människor förtroendet och anställningen. Och när en arbetsgivare inför inspelning som rutin uppstår förhandlingsskyldighet enligt 11 § MBL, så facket ska in tidigt. Den praktiska regeln är enkel: fråga innan du startar, notera samtycket, och spela inte in om någon säger nej. Det här är upplysning, inte juridisk rådgivning.

Lokal taligenkänning på Mac

Lesskeys är en macOS-app som arbetar uteslutande lokalt: diktering i hela systemet via ett kortkommando, och vid sidan av det transkribering av samtal, intervjuer, möten samt ljud- och videofiler med automatisk uppdelning av talare. Dikterad text kopieras till Urklipp och klistras in av dig med ⌘V – appen skriver aldrig in text åt dig i andra program.

Appen är gratis att hämta och Pro låses upp med ett engångsköp på 49,99 USD, som svenska App Store visar i kronor. Ingen prenumeration. I gratisversionen ingår 5 minuters diktering per dag samt 5 ljud- och 5 videotranskriberingar totalt, alltså sammanlagt och inte per dag; själva inspelningen är aldrig begränsad, och att transkribera om något du redan transkriberat är gratis och drar inte av kvoten.

Vill du se hela kedjan steg för steg finns den på Tal till text på Mac: så fungerar det.

Hämta i Mac App Store

Gratis att hämta. Betala en gång. Ingen prenumeration. · Pro 49,99 US$ som engångsköp, visas i kronor i svenska App Store · macOS 13 eller senare

Vanliga frågor

Vad är lokal taligenkänning?

Lokal taligenkänning omvandlar tal till text direkt i din egen dator. Språkmodellen ligger som en fil på hårddisken och räknar på datorns grafikprocessor, och ljudfilen laddas aldrig upp. Andra ord för samma sak är taligenkänning på enheten och offline-transkribering.

Vad är skillnaden mellan taligenkänning och talsyntes?

Taligenkänning är tal som blir text – du talar eller spelar in och datorn skriver ut det. Talsyntes är motsatsen, text som blir tal med en uppläsande röst. Lesskeys gör taligenkänning: diktering och transkribering. Appen läser inte upp text.

Hur skiljer sig lokal taligenkänning från molnbaserad?

I molnet laddas inspelningen upp till leverantörens server och bearbetas där, oftast med konto och betalning per minut. Lokalt räknar din egen Mac, ljudet lämnar aldrig datorn och det fungerar utan uppkoppling – men det ställer högre krav på hårdvaran och långa filer tar den tid din dator behöver.

Fungerar taligenkänningen på svenska?

Ja. Svenska ingår bland de 99 språk som känns igen, och språket bestäms automatiskt per inspelning. Svenska med inströdda engelska fackord går bra. En inspelning som byter språk i längre partier blir däremot blandad, och då är det bättre att begränsa urvalet till de språk du faktiskt arbetar på.

Vilken Mac krävs för lokal taligenkänning?

En Mac med Apple Silicon, alltså M1 eller senare, och minst macOS 13 (Ventura). Apple Silicon är ett krav och inte en rekommendation – Intel-Macar stöds inte, eftersom modellen behöver det minne som processorn och grafikdelen delar.

Är lokal bearbetning automatiskt förenlig med dataskyddsreglerna?

Nej. Att bearbetningen sker lokalt är ett påstående om arkitekturen: ljudet lämnar inte din Mac och ingen underleverantör får en kopia. Om du får spela in, spara och analysera ett visst samtal beror på syfte, rättslig grund och lagringstid, och den bedömningen gör ditt dataskyddsombud eller din jurist. Vi hävdar ingen regelefterlevnad och ingen certifiering.

Läs vidare