Accueil › Identifier les locuteurs

Guide · Qui parle, et quand

Identifier les locuteurs d'un enregistrement

Un entretien à deux voix transcrit en un seul bloc de texte est presque inexploitable : on ne sait plus qui a dit quoi. L'identification des locuteurs — la diarisation, dans le jargon — découpe l'enregistrement par intervenant et étiquette chaque prise de parole. Sur un Mac, cela peut se faire entièrement en local.

100%en local — aucun envoi de votre audio
Gratuitversion gratuite limitée, Pro en achat unique, sans abonnement
99langues, détectées automatiquement
macOS 13+Apple Silicon (M1 ou plus récent)

Ce que fait l'identification des locuteurs

Il faut distinguer deux opérations que l'on confond souvent. La reconnaissance vocale répond à la question « quels mots ont été prononcés ? ». L'identification des locuteurs répond à une question différente : « à quel moment change-t-on de voix ? ». Les deux tournent séparément, puis leurs résultats sont fusionnés pour produire une transcription de la forme :

Techniquement, le traitement se déroule en quatre temps : détection des zones de parole (par opposition aux silences), extraction d'une empreinte acoustique sur chaque zone, regroupement des empreintes qui se ressemblent, puis attribution des segments transcrits aux groupes obtenus. Les étiquettes sont d'abord anonymes — « Locuteur 1 », « Locuteur 2 » — parce que le logiciel entend des voix distinctes sans savoir à qui elles appartiennent.

Mettre de vrais prénoms

C'est l'étape qui rend le document utilisable. Vous écoutez quelques secondes, vous remplacez « Locuteur 1 » par « Claire », et l'ensemble du transcript se met à jour d'un coup. Si le fichier est mal découpé sur un passage — un chevauchement, une voix mal captée — vous pouvez réattribuer manuellement les segments concernés, fusionner deux étiquettes qui désignaient en réalité la même personne, ou en séparer une qui en recouvrait deux.

Les empreintes vocales enregistrées restent sur votre Mac. Elles servent à reconnaître un intervenant récurrent d'un enregistrement à l'autre — utile quand vous transcrivez chaque semaine la même réunion d'équipe — et ne sont transmises à aucun serveur.

Pourquoi le faire en local change quelque chose ici

L'identification des locuteurs s'applique par nature à des enregistrements qui contiennent plusieurs personnes : entretiens de recherche, réunions internes, rendez-vous clients, tables rondes. Ce sont précisément les fichiers qu'on préfère ne pas voir partir sur un serveur tiers — d'autant que la décision de téléverser engage aussi des personnes qui ne l'ont pas prise.

En local, la question ne se pose pas : le fichier reste sur votre disque, il n'y a pas de copie chez un prestataire, et rien n'est transmis hors de votre Mac pour être transcrit. C'est une description d'architecture, pas un statut juridique : ce que cela implique dans votre organisation se tranche avec votre DPO ou votre conseil.

Prévenir les participants : la règle française

Enregistrer plusieurs personnes suppose que ces personnes le sachent. En France, capter les paroles prononcées à titre privé sans le consentement des participants constitue une infraction pénale (article 226-1 du Code pénal), passible d'un an d'emprisonnement et de 45 000 € d'amende. La règle pratique : annoncez l'enregistrement avant de le lancer, et faites confirmer l'accord au tout début du fichier — c'est aussi la trace la plus simple à retrouver plus tard.

En contexte professionnel, la doctrine de la CNIL ajoute une exigence : l'employeur doit informer les salariés concernés et, lorsqu'il en existe, consulter les représentants du personnel avant de mettre en place un dispositif d'enregistrement. Un enregistrement réalisé à l'insu des participants expose l'employeur à un contentieux. Ce rappel est d'ordre pratique et ne constitue pas un conseil juridique ; aucun outil de transcription, celui-ci compris, n'offre de garantie quant à la valeur juridique ou probante du texte produit.

Ce qui fait la qualité du découpage

Autant le dire franchement : la séparation des voix est plus fragile que la reconnaissance des mots. Voici ce qui pèse réellement.

ConditionEffet sur l'identification
Un micro par personneLe meilleur cas de figure, très net
Micro unique, voix bien distinctesGénéralement fiable
Deux à quatre intervenants disciplinésBon résultat
Paroles qui se chevauchentPoint faible principal, corrections manuelles à prévoir
Voix très proches (timbre, âge, accent)Risque de fusion de deux personnes en une étiquette
Fond sonore continu, micro éloignéDégrade le découpage plus vite que la transcription
Huit intervenants ou plusAttendez-vous à des reprises manuelles

Deux réglages aident quand vous savez à l'avance ce que contient le fichier : indiquer le nombre attendu d'intervenants évite au regroupement de créer des locuteurs fantômes, et un mode plus précis, plus lent, améliore le découpage sur les enregistrements difficiles.

Qui s'en sert, et pour quoi

En pratique sur un Mac

Dans Lesskeys, l'identification des locuteurs s'applique aussi bien à un fichier importé qu'à un appel ou une visio captés directement depuis le son du système, sans robot invité dans la réunion. Le déroulé complet — import, langue, transcription, export — est décrit sur la page transcrire un audio en texte ; le cas particulier des réunions est traité sur retranscription de réunion.

Le transcript obtenu s'exporte en texte avec les étiquettes, ou en sous-titres SRT ou WebVTT. Chaque ligne reste liée à sa position dans l'audio : un clic relance la lecture au bon endroit, ce qui rend la vérification des attributions rapide.

Configuration nécessaire : un Mac Apple Silicon (M1 ou plus récent) sous macOS 13 (Ventura) minimum. Les 99 langues sont détectées automatiquement. L'application est gratuite au téléchargement, avec une version gratuite limitée à 5 transcriptions audio et 5 transcriptions vidéo au total (plus 5 minutes de dictée par jour) ; la version Pro se débloque par un achat intégré unique de 49,99 $ US (prix en euros définitif affiché par l'App Store), sans abonnement ni compte à créer.

Télécharger sur le Mac App Store

Téléchargement gratuit, version gratuite limitée. Sans abonnement. · Version Pro : achat intégré unique de 49,99 $ US (prix en euros définitif affiché par l'App Store) · macOS 13+

Questions fréquentes

Qu'est-ce que l'identification des locuteurs ?

C'est le découpage d'un enregistrement par intervenant : le logiciel détecte les changements de voix et étiquette chaque prise de parole, ce qui produit une transcription indiquant qui a dit quoi et à quel moment. On parle aussi de diarisation.

Le logiciel connaît-il le nom des personnes ?

Non. Il distingue des voix différentes et les nomme d'abord « Locuteur 1 », « Locuteur 2 ». Vous remplacez ensuite ces étiquettes par de vrais prénoms et toute la transcription se met à jour.

L'identification fonctionne-t-elle hors ligne ?

Oui. La séparation des voix comme la transcription s'exécutent sur votre Mac ; l'enregistrement n'est envoyé à aucun serveur et une connexion n'est nécessaire que pour télécharger le modèle la première fois.

Que se passe-t-il quand deux personnes parlent en même temps ?

C'est la principale limite. Sur les passages où les paroles se chevauchent, les attributions peuvent être imprécises et demandent une correction manuelle ; vous pouvez réattribuer, fusionner ou séparer les étiquettes concernées.

Combien d'intervenants peut-on distinguer ?

De deux à quatre intervenants disciplinés donnent en général un très bon résultat. Au-delà de huit voix, ou avec des timbres très proches, prévoyez des reprises manuelles. Indiquer le nombre attendu d'intervenants améliore le découpage.

Ai-je le droit d'enregistrer un entretien à plusieurs voix ?

Prévenez toujours les participants avant de lancer l'enregistrement : en France, capter des paroles privées sans leur consentement est une infraction pénale. En entreprise, l'employeur doit en outre informer les salariés et, lorsqu'il en existe, consulter les représentants du personnel. Ces indications ne remplacent pas l'avis de votre conseil.

À lire aussi