Pagina iniziale › Riconoscimento vocale offline
Guida · Come funziona
Riconoscimento vocale offline: come funziona
Il riconoscimento vocale offline — detto anche riconoscimento vocale sul dispositivo — converte il parlato in testo usando soltanto la potenza di calcolo del computer che hai davanti. Non c'è un caricamento, perché non c'è un server dall'altra parte. Questa pagina spiega come funziona la catena completa, che cosa cambia davvero rispetto ai servizi in cloud, dove invece il cloud resta più comodo, e che cosa serve per farlo girare su un Mac.
Che cosa significa «offline» in questo contesto
Un sistema di riconoscimento vocale ha bisogno di due cose: un modello — cioè una rete neurale addestrata a mettere in corrispondenza suoni e parole — e una macchina che lo esegua. Nei servizi in cloud il modello sta su server remoti: l'applicazione registra l'audio, lo spedisce in rete, attende e riceve indietro il testo. Nel riconoscimento vocale offline il modello viene scaricato una volta sola e resta sul disco, e l'esecuzione avviene sul tuo computer: la rete serve soltanto per quel primo scaricamento. In inglese lo stesso concetto si trova come offline speech to text o on-device speech recognition: sinonimi della stessa architettura.
Da questa differenza discende tutto il resto. Senza connessione il sistema continua a funzionare — in aereo, in treno, in una sala senza campo, in un ufficio con la rete chiusa verso l'esterno. Non serve un account, perché non c'è nulla a cui accedere. Non c'è un costo al minuto, perché non stai comprando tempo macchina da qualcun altro. E l'audio non lascia il dispositivo, che è il motivo per cui questa architettura interessa a chi lavora con registrazioni riservate.
Riconoscimento vocale offline: dalla voce al testo
La catena è la stessa in locale e in remoto, e conviene conoscerla perché spiega dove nascono gli errori:
- Acquisizione. Il microfono, o l'audio di sistema del Mac, produce un flusso digitale che viene portato a una frequenza di campionamento standard e a un solo canale, perché è così che il modello si aspetta di riceverlo.
- Rappresentazione. Il segnale viene trasformato in una rappresentazione tempo-frequenza: in pratica un'immagine del suono, in cui si vede come cambia l'energia alle varie frequenze mentre parli.
- Inferenza. La rete neurale legge quella rappresentazione e produce una sequenza di parole tenendo conto del contesto. È per questo che distingue due parole quasi identiche in base a ciò che le sta intorno — e anche per questo che, se il contesto è povero o rumoroso, sbaglia in modo plausibile invece che in modo evidente.
- Ricostruzione. Al testo grezzo vengono aggiunte la punteggiatura e la divisione in frasi e, se la registrazione contiene più voci, la separazione per interlocutore.
La differenza fra locale e cloud non sta in questi passaggi, che sono identici, ma soltanto in dove avviene il terzo. È un dettaglio di architettura con conseguenze molto concrete.
Perché serve un Mac Apple Silicon
L'inferenza è un carico pesante e molto parallelo: milioni di moltiplicazioni fra matrici per ogni secondo di audio. Su una CPU generica si può fare, ma è molto più lento. Sui Mac Apple Silicon il modello gira sulla GPU integrata, che è progettata esattamente per questo tipo di calcolo e che condivide la memoria con il processore, evitando la copia continua dei dati avanti e indietro.
Per questo motivo un Mac con Apple Silicon (M1 o successivo) è un requisito, non un consiglio: Lesskeys non si installa e non funziona sui Mac Intel. Se non sei sicuro del tuo modello, apri il menu Apple e scegli «Informazioni su questo Mac»: il chip compare nella prima riga. Il sistema operativo minimo è macOS 13 (Ventura).
Locale e cloud a confronto, onestamente
Un confronto utile deve dire anche dove il cloud vince, altrimenti è un dépliant.
| Aspetto | In locale sul Mac | Servizio in cloud |
|---|---|---|
| Dove finisce l'audio | resta sul tuo disco | viene caricato sui server del fornitore |
| Serve la connessione | solo per lo scaricamento iniziale del modello | sempre |
| Requisiti hardware | Mac Apple Silicon obbligatorio | nessuno: basta un browser |
| Modello di costo | acquisto una tantum | quasi sempre a minuto o ad abbonamento |
| Potenza di calcolo | quella del tuo Mac | macchine molto più grandi |
| Aggiornamenti del modello | quando aggiorni l'app | immediati, lato fornitore |
| Conservazione dei dati | decidi tu che cosa tenere e che cosa cancellare | dipende dai termini del fornitore |
| Lavoro senza rete | sì | no |
La sintesi ragionevole è questa. Se devi trascrivere da un tablet, da un PC datato o da un browser qualsiasi, un servizio online è più pratico e non c'è motivo di fingere il contrario. Se invece il vincolo è la riservatezza del materiale, o il fatto di pagare ogni minuto trascritto, o semplicemente lavorare senza connessione, l'elaborazione locale è l'unica che risolve il problema alla radice anziché mitigarlo con una clausola contrattuale.
Quanto è precisa
Nessun sistema, locale o remoto, trascrive senza errori. La qualità dipende molto meno dal fornitore e molto più da cinque variabili: distanza dal microfono, riverbero della stanza, rumore di fondo, persone che parlano sopra, densità di sigle, nomi propri e termini tecnici. Un'ora registrata con un microfono a clip in una stanza silenziosa dà un risultato migliore di un'ora registrata con il microfono del portatile in fondo a una sala riunioni, qualunque software si usi.
Quello che esce è una bozza da rileggere. I nomi propri e le sigle vanno controllati, la punteggiatura è un'interpretazione del sistema e non una trascrizione di qualcosa che hai detto, e quando due persone si sovrappongono l'attribuzione delle battute si sporca. Chi promette un trascritto pronto da consegnare senza revisione sta vendendo un'aspettativa sbagliata.
99 lingue, riconosciute da sole
Il modello copre 99 lingue e determina da solo quale si sta parlando: non devi impostare nulla prima di registrare. La lingua viene stabilita per registrazione, quindi un discorso in italiano infarcito di termini inglesi di lavoro non crea problemi; se invece una riunione cambia lingua per lunghi tratti, il risultato diventa più disomogeneo. Chi lavora sempre nelle stesse due o tre lingue può restringere l'elenco, così un passaggio breve o poco chiaro non finisce assegnato a una lingua lontana.
Che cosa resta sul Mac
Con un'elaborazione locale le registrazioni, i trascritti e gli eventuali profili vocali stanno nella libreria dell'app, sul tuo disco. Non c'è un account, non c'è un caricamento, non c'è un fornitore terzo che riceve il materiale per conto tuo, e non c'è un archivio remoto da cui chiedere la cancellazione.
Questa è una descrizione dell'architettura del software, non un parere legale e non una certificazione. Se tratti registrazioni che riguardano altre persone, la liceità dipende dalla finalità, dalla base giuridica e dai soggetti coinvolti — non dallo strumento che usi. Verifica il tuo trattamento con il tuo responsabile della protezione dei dati o con il tuo consulente legale.
Se nella registrazione ci sono altre persone
In Italia registrare una conversazione alla quale partecipi è lecito, ma questo riguarda l'atto in sé: l'uso e la diffusione dell'audio e del trascritto sono un'altra questione, e captare una conversazione fra terzi a cui non prendi parte è un fatto penalmente rilevante (artt. 615-bis e 617 c.p.). Sul luogo di lavoro c'è un limite ulteriore: l'art. 4 dello Statuto dei lavoratori (L. 300/1970) subordina i controlli a distanza sull'attività dei dipendenti a un accordo sindacale o a un'autorizzazione dell'Ispettorato del lavoro. La regola pratica è semplice: avvisa prima, annota che i presenti sono stati informati, e se qualcuno dice di no non registrare. Questa è un'indicazione, non consulenza legale.
Requisiti e prezzo
| Voce | Dato |
|---|---|
| Sistema operativo | da macOS 13 (Ventura) |
| Processore | Apple Silicon (M1 o successivo) — obbligatorio |
| Mac Intel | non supportati |
| Connessione | solo per lo scaricamento dall'App Store e per il modello, una volta sola |
| Lingue | 99, riconosciute automaticamente |
| Prezzo | download gratuito; Pro con un acquisto in-app una tantum da 49,99 $ — nessun abbonamento |
| Versione gratuita | 5 minuti di dettatura al giorno, 5 trascrizioni audio e 5 video in totale; registrare e ritrascrivere non consumano quota |
| Account | non serve; nessuna telemetria |
La versione gratuita esiste per provare l'app sul tuo materiale prima di decidere: 5 minuti di dettatura al giorno e 5 trascrizioni audio più 5 video complessive, non al giorno. Registrare non viene mai conteggiato, e ritrascrivere una registrazione già elaborata — per esempio con un modello più grande — è gratuito e non intacca il conteggio. I 49,99 $ sono il prezzo di listino in dollari: l'App Store italiano mostra l'importo in euro, e l'acquisto passa da Apple come qualsiasi altro acquisto in-app, rimborsi compresi.
Da qui in poi
Se hai già un file da convertire, la sequenza completa delle operazioni è in come trascrivere un audio; i formati accettati e quelli esportabili in audio in testo. Per l'aspetto della riservatezza c'è trascrizione senza cloud, mentre per scrivere a voce nelle applicazioni di tutti i giorni la pagina è dettatura vocale sul Mac.
Download gratuito, versione gratuita con limiti. Nessun abbonamento. · Versione Pro: acquisto in-app una tantum da 49,99 $ (l'App Store italiano mostra l'importo in euro) · da macOS 13
Domande frequenti
Che cos'è il riconoscimento vocale offline?
È la conversione della voce in testo eseguita interamente sul computer che stai usando, con un modello scaricato una volta sola e conservato sul disco. Non c'è un caricamento verso un server, non serve un account e il sistema funziona anche senza connessione: la rete serve solo per lo scaricamento iniziale dell'app e del modello.
Il riconoscimento vocale offline è meno preciso di quello in cloud?
Non per il fatto di essere offline. La qualità dipende soprattutto dalla registrazione: distanza dal microfono, riverbero, rumore di fondo, persone che parlano sopra e densità di sigle e nomi propri. Un risultato automatico resta comunque una bozza da rileggere, in locale come in cloud.
Serve la connessione a internet per usarlo?
Solo per scaricare l'app dal Mac App Store e per scaricare il modello la prima volta. Dopo di che il riconoscimento funziona anche in modalità aereo o su una rete chiusa verso l'esterno, perché non deve interrogare nulla.
Perché non funziona sui Mac Intel?
Il modello viene eseguito sulla GPU integrata dei chip Apple Silicon, che condivide la memoria con il processore. Per questo un Mac con Apple Silicon (M1 o successivo) è un requisito e non un consiglio, e i Mac Intel non sono supportati. Il sistema minimo è macOS 13 (Ventura).
Quante lingue riconosce e vanno impostate a mano?
Le lingue sono 99 e vengono riconosciute automaticamente, quindi non devi impostare nulla prima di registrare. Se lavori sempre nelle stesse due o tre lingue puoi restringere l'elenco, così i passaggi brevi o poco chiari non vengono assegnati a una lingua lontana.
Quanto costa e che cosa include la versione gratuita?
Il download è gratuito. La versione gratuita comprende 5 minuti di dettatura al giorno e 5 trascrizioni audio più 5 video in totale; registrare è sempre senza limiti e ritrascrivere una registrazione già elaborata non consuma quota. Pro si sblocca con un acquisto in-app una tantum da 49,99 $, senza abbonamento.