Início › Identificar quem falou

Guia

Transcrição que identifica quem falou

Uma transcrição em bloco único é quase inútil quando havia cinco pessoas na sala. A separação automática de falantes divide o texto por voz — quem disse o quê, e em que minuto — e faz isso no seu próprio Mac.

100%roda no seu Mac — o áudio nunca é enviado
Grátisgrátis para baixar; Pro em compra única, sem assinatura
99idiomas, detectados automaticamente
macOS 13+Apple Silicon (M1 ou mais recente)

O que a separação de vozes faz na prática

Depois de transcrever, o app compara as características acústicas de cada trecho e agrupa os que vieram da mesma pessoa. O resultado deixa de ser um parágrafo de mil palavras e passa a ser um diálogo:

Você renomeia "Falante 1" para o nome real uma vez e a transcrição inteira é atualizada. É a diferença entre um arquivo que dá para ler e um arquivo que você vai reouvir inteiro para achar um trecho.

O termo técnico para isso é diarização — aparece na literatura em inglês como speaker diarization. Fora de um artigo acadêmico, quase ninguém usa a palavra: as pessoas procuram "identificar quem falou" ou "separar as vozes". Usamos as duas daqui em diante, sem cerimônia.

As mesmas vozes entre gravações diferentes

Separar as vozes dentro de um arquivo é o básico. O que economiza tempo de verdade é o passo seguinte: guardar uma impressão de voz de cada pessoa que você já nomeou e reconhecê-la nas gravações seguintes.

Na prática, se você entrevista a mesma fonte quatro vezes, ou grava a reunião semanal do mesmo time, a partir da segunda gravação os nomes já aparecem preenchidos. Quem faz pesquisa qualitativa com dez participantes ao longo de um mês sente essa diferença mais do que qualquer outro recurso.

E como tudo aqui, essas impressões de voz ficam só no seu Mac. Elas não sobem para um servidor, não formam um banco de vozes compartilhado e podem ser apagadas por você. Vale dizer o óbvio: uma impressão de voz é um dado sensível, e é por isso que a arquitetura local importa mais nesta função do que em qualquer outra.

Onde isso realmente resolve

Como a separação é feita, em uma passada

Sem jargão: o áudio é primeiro cortado nos pontos em que alguém está falando, descartando o silêncio. Cada trecho de fala vira um vetor numérico que resume o timbre daquela voz — não as palavras, só as características acústicas. Esses vetores são então agrupados: os que estão próximos entre si vêm, muito provavelmente, da mesma pessoa. Cada grupo recebe um rótulo, e o rótulo é colado no texto correspondente.

Duas consequências práticas saem daí. A primeira é que o número de pessoas é uma estimativa, e é por isso que informar quantos participantes havia melhora tanto o resultado. A segunda é que o vetor de uma voz pode ser guardado e comparado depois — é exatamente o mecanismo que faz o app reconhecer a mesma pessoa em outra gravação.

O que atrapalha a separação

Ser honesto aqui poupa frustração. A separação de vozes é estatística, não mágica, e há situações previsíveis em que ela erra:

SituaçãoEfeitoO que ajuda
Duas pessoas falando ao mesmo tempoO trecho pode ir para o falante erradoAtivar a detecção de sobreposição e revisar o trecho
Vozes muito parecidasDois falantes fundidos em umInformar o número de participantes
Alguém fala três segundos na reunião todaPode não virar um falante próprioÉ o limite da técnica
Sala com eco, microfone distantePiora tudo, inclusive o textoAproximar o microfone da fonte
Áudio muito comprimido (mensagem encaminhada)Menos informação acústica, mais erroUsar o arquivo original

Quando você já sabe quantas pessoas havia na sala, informar esse número melhora bastante o agrupamento — é o ajuste com maior retorno.

Por que fazer isso localmente muda alguma coisa

As gravações que mais precisam de separação de falantes são justamente as que menos deveriam circular: entrevistas com fonte, sessões de pesquisa com participantes identificáveis, reuniões internas com números. Num serviço em nuvem, esse material precisa ser enviado e passa a existir numa conta de terceiro.

Aqui o áudio, a transcrição e as impressões de voz ficam no seu computador, e a transcrição funciona com a internet desligada. Descrevemos a arquitetura, e só isso: se você precisa avaliar tratamento de dados pessoais na sua organização — LGPD, política interna, contrato com o cliente —, leve essa arquitetura ao jurídico ou ao DPO e deixe a conclusão com eles.

Antes de gravar outras pessoas

No Brasil, a lei trata de forma diferente a gravação feita por um dos participantes e a captação feita por quem está de fora da conversa — mas isto é informação geral, não orientação jurídica. De toda forma, avise os participantes no início: é boa prática, muitas empresas exigem em política interna, e os termos do Meet, do Teams e do Zoom frequentemente pedem o aviso. Em pesquisa acadêmica, o consentimento formal do participante segue valendo do jeito de sempre. E não fazemos promessa nenhuma sobre o uso da transcrição em processos ou disputas — isso é conversa para o seu jurídico.

Como fazer no Mac

O Lesskeys grava e transcreve chamadas, entrevistas e arquivos com separação automática de falantes, tudo no dispositivo, em 99 idiomas com detecção automática. Requisitos: macOS 13 ou mais recente e Apple Silicon (M1 ou mais recente), obrigatório. Preço: grátis para baixar, com o Pro liberado por uma compra única de US$ 49,99 dentro do app, sem assinatura. O download gratuito inclui uma cota inicial: 5 minutos de ditado por dia e 10 transcrições no total — 5 de áudio e 5 de vídeo. Gravar nunca é limitado, e retranscrever não consome cota. O Pro remove os limites.

Baixar na Mac App Store

Baixe grátis. Pro em compra única de US$ 49,99. · Sem assinatura · macOS 13+

Perguntas frequentes

Como saber quem falou em uma transcrição?

O app compara as características acústicas de cada trecho e agrupa os que vieram da mesma pessoa, marcando o falante e o horário. Você renomeia Falante 1 para o nome real uma vez e a transcrição inteira é atualizada.

O que é diarização?

É o termo técnico para a separação automática de falantes: dividir uma gravação por voz para indicar quem disse o quê. No dia a dia as pessoas chamam de identificar quem falou ou separar as vozes.

O app reconhece a mesma pessoa em gravações diferentes?

Sim. Uma impressão de voz de cada pessoa já nomeada é guardada e reutilizada nas gravações seguintes, então os nomes aparecem preenchidos a partir da segunda gravação.

As impressões de voz vão para algum servidor?

Não. Elas ficam no seu Mac, não formam um banco compartilhado e podem ser apagadas por você.

Quantos falantes ele consegue separar?

Reuniões com vários participantes funcionam bem. A precisão cai quando duas pessoas falam ao mesmo tempo, quando as vozes são muito parecidas ou quando alguém fala poucos segundos na gravação inteira. Informar quantas pessoas havia na sala melhora o agrupamento.

Posso gravar uma reunião para transcrever com nomes?

Pode, e a transcrição sai com os falantes separados. Avise sempre os participantes no início: é boa prática, muitas empresas exigem em política interna e as plataformas têm regras próprias de aviso. Não damos orientação jurídica sobre gravação — se houver dever de sigilo profissional ou uso do material em disputa, fale com o seu jurídico.

Veja também