Início › Reconhecimento de voz offline

Guia técnico

Como funciona o reconhecimento de voz offline

Reconhecimento de voz offline é o mesmo trabalho que um serviço online faz — só que inteiro na sua máquina. Esta página descreve o caminho completo, do microfone até o texto na tela, e diz também o que o app não faz.

100%roda no seu Mac — o áudio nunca é enviado
Grátisgrátis para baixar; Pro em compra única, sem assinatura
99idiomas, detectados automaticamente
macOS 13+Apple Silicon (M1 ou mais recente)

O caminho do microfone até o texto

São quatro etapas, e nenhuma delas passa por um servidor:

Vale ser explícito sobre a etapa 4, porque muita gente espera outra coisa: o app não digita sozinho dentro do aplicativo em que você está. Ele copia e você cola. É um gesto a mais e uma permissão a menos.

Como o idioma é escolhido

O modelo é multilíngue e cobre 99 idiomas. Numa gravação, o idioma é detectado automaticamente a partir do áudio — você não precisa dizer que aquilo é português. Se você trabalha em dois ou três idiomas fixos, dá para restringir a detecção a essa lista, o que reduz a chance de um trecho curto ou com muito ruído ser classificado errado. Um detalhe honesto: a detecção se apoia no início do arquivo, então uma gravação que abre com meio minuto de silêncio ou de conversa paralela é um caso em que vale fixar o idioma na mão.

O modelo é baixado uma vez

Na primeira execução o app baixa o modelo de fala — é o único momento em que a internet é necessária. O arquivo fica guardado no seu Mac e é reutilizado em todas as transcrições seguintes. A partir daí você pode desligar o Wi-Fi e o app continua funcionando igual: é assim que se testa a afirmação, e é o teste que recomendamos fazer no primeiro dia.

Existem modelos de tamanhos diferentes. Os menores carregam rápido e ocupam pouca memória; os maiores acertam mais em áudio difícil e custam mais tempo de processamento. Não citamos fornecedores de modelo aqui de propósito — o que importa para você é que o arquivo mora no seu disco e roda no seu hardware.

Por que exige Apple Silicon (M1 ou mais recente)

A decodificação acontece na GPU. Nos chips da Apple, GPU, CPU e Neural Engine compartilham a mesma memória, então os pesos do modelo e os blocos de áudio não precisam ser copiados de um lado para o outro a cada janela processada — é essa arquitetura de memória unificada que faz uma gravação de uma hora ser processada em minutos num laptop.

Por isso, Apple Silicon (M1 ou mais recente) é obrigatório, não recomendado. Se o seu Mac é Intel, o app não vai rodar — e é melhor saber disso antes de instalar do que depois. Para conferir: menu Apple → Sobre Este Mac; se o chip aparece como M1, M2, M3, M4 ou superior, está tudo certo.

Por que macOS 13 é o mínimo

O mínimo é macOS 13 (Ventura). Abaixo disso faltam as APIs de captura de tela e de áudio do sistema no formato que a gravação de chamadas usa, além de partes do suporte a GPU de que o motor depende. Vale notar que 13 é um piso baixo de propósito: Macs com M1 de 2020 rodando um sistema antigo continuam atendidos.

O que o app não faz

E numa chamada, como funciona?

Numa reunião do Meet, Teams ou Zoom, o app grava dois fluxos no seu próprio Mac — o áudio que sai pelo sistema (as outras pessoas) e o seu microfone — e transcreve os dois. Não há um convidado extra entrando na sala: nada aparece na lista de participantes, porque não existe bot nenhum. Depois da transcrição, a separação de falantes marca quem falou em cada trecho.

Aqui entra o cuidado com as outras pessoas: no Brasil, a lei trata de forma diferente a gravação feita por um dos participantes e a captação feita por quem está de fora da conversa — mas isto é informação geral, não orientação jurídica — ainda assim, avise os participantes no início da chamada. É boa prática, e muitas empresas exigem em política interna ou nos termos da própria plataforma.

Como conferir que é offline mesmo

Depois do primeiro download do modelo: ative o modo avião ou desligue o Wi-Fi, grave trinta segundos falando e mande transcrever. Se o texto aparece, a conta fecha — não existe transcrição sem conexão que tenha ido a algum lugar. É a checagem mais rápida que existe, e você não precisa acreditar em nenhuma frase de marketing para fazê-la.

O Lesskeys é grátis para baixar; o Pro é liberado por uma compra única de US$ 49,99 dentro do app, sem assinatura. Roda em macOS 13 ou mais recente com Apple Silicon. O download gratuito inclui uma cota inicial: 5 minutos de ditado por dia e 10 transcrições no total — 5 de áudio e 5 de vídeo. Gravar nunca é limitado, e retranscrever não consome cota. O Pro remove os limites.

Baixar na Mac App Store

Baixe grátis. Pro em compra única de US$ 49,99. · Sem assinatura · macOS 13+

Perguntas frequentes

Como o reconhecimento de voz funciona sem internet?

O modelo de fala é baixado uma vez e fica no seu Mac. A partir daí a captura, a detecção de fala e a decodificação rodam na GPU da própria máquina, sem contato com servidor, inclusive em modo avião.

Por que é obrigatório um Mac com Apple Silicon?

A decodificação roda na GPU, e a memória unificada do Apple Silicon evita copiar os pesos do modelo e o áudio entre CPU e GPU. Por isso Apple Silicon (M1 ou mais recente) é obrigatório e Macs com Intel não são suportados.

Preciso baixar alguma coisa antes de usar offline?

Sim, o modelo de fala é baixado na primeira execução — é o único momento em que a internet é necessária. Depois disso ele é reutilizado localmente.

O texto ditado é digitado automaticamente no app em que estou?

Não. O texto vai para a área de transferência e você cola com ⌘V. O app não digita por você.

Como o app sabe em que idioma eu falei?

O idioma é detectado automaticamente a partir do áudio, entre 99 idiomas. Se você trabalha com poucos idiomas fixos, é possível restringir a lista para reduzir erros de detecção em trechos curtos ou ruidosos.

Qual a versão mínima do macOS?

macOS 13 (Ventura) ou mais recente, sempre em um Mac com Apple Silicon (M1 ou mais recente).

Veja também