Início › Reconhecimento de voz offline
Guia técnico
Como funciona o reconhecimento de voz offline
Reconhecimento de voz offline é o mesmo trabalho que um serviço online faz — só que inteiro na sua máquina. Esta página descreve o caminho completo, do microfone até o texto na tela, e diz também o que o app não faz.
O caminho do microfone até o texto
São quatro etapas, e nenhuma delas passa por um servidor:
- 1. Captura. O áudio entra pelo microfone (ou pela captura do áudio do sistema, no caso de uma chamada) e é convertido para o formato que o modelo espera: mono, 16 kHz. É aqui também que o volume é normalizado, para que uma fala baixa não chegue fraca demais ao modelo.
- 2. Detecção de fala. Antes de gastar processamento, o app separa os trechos com voz dos trechos de silêncio. Isso corta o tempo de processamento de uma gravação longa e evita que o silêncio vire texto inventado.
- 3. Decodificação. O modelo de fala roda na GPU do Mac e transforma o áudio em texto, janela por janela. É a etapa cara, e é exatamente a que o Apple Silicon tornou viável fora de um data center.
- 4. Entrega. O texto é limpo, pontuado e entregue: no ditado, ele vai para a área de transferência e você cola com ⌘V; numa gravação, ele vira uma transcrição com marcas de tempo que fica salvo no seu Mac.
Vale ser explícito sobre a etapa 4, porque muita gente espera outra coisa: o app não digita sozinho dentro do aplicativo em que você está. Ele copia e você cola. É um gesto a mais e uma permissão a menos.
Como o idioma é escolhido
O modelo é multilíngue e cobre 99 idiomas. Numa gravação, o idioma é detectado automaticamente a partir do áudio — você não precisa dizer que aquilo é português. Se você trabalha em dois ou três idiomas fixos, dá para restringir a detecção a essa lista, o que reduz a chance de um trecho curto ou com muito ruído ser classificado errado. Um detalhe honesto: a detecção se apoia no início do arquivo, então uma gravação que abre com meio minuto de silêncio ou de conversa paralela é um caso em que vale fixar o idioma na mão.
O modelo é baixado uma vez
Na primeira execução o app baixa o modelo de fala — é o único momento em que a internet é necessária. O arquivo fica guardado no seu Mac e é reutilizado em todas as transcrições seguintes. A partir daí você pode desligar o Wi-Fi e o app continua funcionando igual: é assim que se testa a afirmação, e é o teste que recomendamos fazer no primeiro dia.
Existem modelos de tamanhos diferentes. Os menores carregam rápido e ocupam pouca memória; os maiores acertam mais em áudio difícil e custam mais tempo de processamento. Não citamos fornecedores de modelo aqui de propósito — o que importa para você é que o arquivo mora no seu disco e roda no seu hardware.
Por que exige Apple Silicon (M1 ou mais recente)
A decodificação acontece na GPU. Nos chips da Apple, GPU, CPU e Neural Engine compartilham a mesma memória, então os pesos do modelo e os blocos de áudio não precisam ser copiados de um lado para o outro a cada janela processada — é essa arquitetura de memória unificada que faz uma gravação de uma hora ser processada em minutos num laptop.
Por isso, Apple Silicon (M1 ou mais recente) é obrigatório, não recomendado. Se o seu Mac é Intel, o app não vai rodar — e é melhor saber disso antes de instalar do que depois. Para conferir: menu Apple → Sobre Este Mac; se o chip aparece como M1, M2, M3, M4 ou superior, está tudo certo.
Por que macOS 13 é o mínimo
O mínimo é macOS 13 (Ventura). Abaixo disso faltam as APIs de captura de tela e de áudio do sistema no formato que a gravação de chamadas usa, além de partes do suporte a GPU de que o motor depende. Vale notar que 13 é um piso baixo de propósito: Macs com M1 de 2020 rodando um sistema antigo continuam atendidos.
O que o app não faz
- Não envia áudio. Não há upload do seu áudio nem da sua transcrição para um servidor nosso ou de terceiros.
- Não tem servidor de apoio. Não existe um modo híbrido em que "os arquivos difíceis vão para a nuvem". Não vão.
- Não pede conta. Não há login, e-mail nem sincronização de conta.
- Não digita por você. No ditado o texto é copiado; quem cola é você, com ⌘V.
E numa chamada, como funciona?
Numa reunião do Meet, Teams ou Zoom, o app grava dois fluxos no seu próprio Mac — o áudio que sai pelo sistema (as outras pessoas) e o seu microfone — e transcreve os dois. Não há um convidado extra entrando na sala: nada aparece na lista de participantes, porque não existe bot nenhum. Depois da transcrição, a separação de falantes marca quem falou em cada trecho.
Aqui entra o cuidado com as outras pessoas: no Brasil, a lei trata de forma diferente a gravação feita por um dos participantes e a captação feita por quem está de fora da conversa — mas isto é informação geral, não orientação jurídica — ainda assim, avise os participantes no início da chamada. É boa prática, e muitas empresas exigem em política interna ou nos termos da própria plataforma.
Como conferir que é offline mesmo
Depois do primeiro download do modelo: ative o modo avião ou desligue o Wi-Fi, grave trinta segundos falando e mande transcrever. Se o texto aparece, a conta fecha — não existe transcrição sem conexão que tenha ido a algum lugar. É a checagem mais rápida que existe, e você não precisa acreditar em nenhuma frase de marketing para fazê-la.
O Lesskeys é grátis para baixar; o Pro é liberado por uma compra única de US$ 49,99 dentro do app, sem assinatura. Roda em macOS 13 ou mais recente com Apple Silicon. O download gratuito inclui uma cota inicial: 5 minutos de ditado por dia e 10 transcrições no total — 5 de áudio e 5 de vídeo. Gravar nunca é limitado, e retranscrever não consome cota. O Pro remove os limites.
Baixe grátis. Pro em compra única de US$ 49,99. · Sem assinatura · macOS 13+
Perguntas frequentes
Como o reconhecimento de voz funciona sem internet?
O modelo de fala é baixado uma vez e fica no seu Mac. A partir daí a captura, a detecção de fala e a decodificação rodam na GPU da própria máquina, sem contato com servidor, inclusive em modo avião.
Por que é obrigatório um Mac com Apple Silicon?
A decodificação roda na GPU, e a memória unificada do Apple Silicon evita copiar os pesos do modelo e o áudio entre CPU e GPU. Por isso Apple Silicon (M1 ou mais recente) é obrigatório e Macs com Intel não são suportados.
Preciso baixar alguma coisa antes de usar offline?
Sim, o modelo de fala é baixado na primeira execução — é o único momento em que a internet é necessária. Depois disso ele é reutilizado localmente.
O texto ditado é digitado automaticamente no app em que estou?
Não. O texto vai para a área de transferência e você cola com ⌘V. O app não digita por você.
Como o app sabe em que idioma eu falei?
O idioma é detectado automaticamente a partir do áudio, entre 99 idiomas. Se você trabalha com poucos idiomas fixos, é possível restringir a lista para reduzir erros de detecção em trechos curtos ou ruidosos.
Qual a versão mínima do macOS?
macOS 13 (Ventura) ou mais recente, sempre em um Mac com Apple Silicon (M1 ou mais recente).