首页 › 说话人分离
说话人分离
说话人分离转写:自动标出谁在说话
一段多人录音转成文字后,如果只是一大坨连续文本,几乎没法用。说话人分离(也就是大家常说的区分说话人、分角色、标出谁说的)会把录音按发言人切开,逐句标注,让文稿变成能读、能引用、能检索的对话记录。识别和分离全部在你的 Mac 上完成,音频与声纹都不上传。
说话人分离到底做了什么
“说话人分离”是技术圈的叫法,英文是 diarization;普通用户搜的往往是“区分说话人”“转文字能不能标出谁说的”。三种说法指的是同一件事,可以拆成两步来理解:
- 切分——先按声音特征把录音切成一段一段,判断“这里换人了”。
- 聚类——再把属于同一个人的片段归到一起,编成“说话人 1 / 说话人 2 / 说话人 3”。
注意它和语音识别是两条独立的处理:识别负责“说了什么”,分离负责“谁说的”。两者合起来,才是一份可用的带说话人的逐字稿。
还有一点要分清:分离出的是“不同的人”,不是“这个人叫什么”。系统不认识你的同事,它只能判断出录音里有三种不同的声音;名字要你自己填。填一次之后,全篇会一起更新。
谁最需要它
记者是最典型的场景。采访录音里问答交替,没有说话人标记的文稿在写稿时几乎无法直接引用;有了标记,一段两人对话就是清清楚楚的一问一答,找引语的时间能省下大半。多次采访同一位受访者时,声音命名的价值会进一步放大。
做质性研究的研究生同样如此。深度访谈、焦点小组的转录是论文工作量的大头,扎根理论那一套编码流程要求先有准确的分角色文稿;先跑一遍机器分离,再人工校对,通常比从零逐字敲要快得多。
播客和视频剪辑用它来定位。知道每一句是谁说的,加上时间轴,就能直接跳到要剪的那一段,也方便生成分角色的字幕。
HR 的面试记录也是常见场景:面试官和候选人的发言分开之后,复盘和交叉评估会容易很多。这一场景涉及他人的个人信息,请务必先取得候选人的同意,并遵守贵司的招聘与信息处理规定。
销售复盘客户拜访是另一类:把自己和客户的发言分开之后,回头看“对方到底关心什么、异议出在哪一句”,比凭记忆写拜访小结准确得多。同样地,录音前请先取得客户同意,并遵守贵司关于客户沟通记录的规定。
给声音命名:下次还能认出同一个人
这个功能很省时间,值得讲细一点。第一次处理某段录音时,你把“说话人 1”改成“李工”。系统会把这个人的声纹特征保存下来,下一次导入另一段录音,如果李工也在里面,他的发言会被直接标成“李工”,不必再手动改一遍。
对于每周开同一个例会、长期跟踪同一批受访者、固定嘉宾的播客来说,这意味着从第二次开始,说话人标注基本不用管了。
关于声纹,有几件事必须写清楚:
- 声纹只保存在你的 Mac 上,不会上传,也不会同步到任何服务器。
- 随时可以删除。在应用的“说话人”页面里删掉某个人,对应的声纹特征就从本机移除了。
- 它是敏感个人信息。按《个人信息保护法》,声纹属于生物识别信息一类的敏感个人信息,处理这类信息需要取得单独同意。因此,在采集同事、受访者、候选人的声纹之前,请先明确告知并取得对方同意——即便全部处理都发生在你自己的电脑上。
需要强调:以上是对功能行为和法律常识的说明,我们不因此声称本软件“合规”。我们能确认的只是架构事实——音频和声纹不离开本机。你的具体使用方式是否满足要求,请以贵司法务/信息安全部门的判断为准。
为什么“在本机做”对这件事格外重要
说话人分离天然要处理声音的个体特征,这正是最敏感的那一部分数据。云端方案的链路是:把完整录音上传,在服务器上提取特征、聚类,结果回传,音频和特征在对方那里留存一段时间。
本机方案里没有上传这一步:
| Lesskeys(本机) | 云端转写服务 | |
|---|---|---|
| 音频在哪里处理 | 你自己的 Mac | 服务商的服务器 |
| 声纹存在哪里 | 本机,可随时删除 | 取决于各家条款 |
| 是否需要注册账号 | 不需要 | 基本都需要 |
| 断网能否使用 | 可以 | 不可以 |
| 费用形态 | 一次性买断 | 包月或按分钟计费居多 |
它会在什么情况下分错
说话人分离不是稳定输出正确答案的功能,把预期讲清楚更有用。以下几种情况会明显出错,需要人工调整:
- 抢话和重叠——两个人同时说,重叠段通常只会归给其中一个人,另一个人的那句话可能整段丢失。争论激烈的会议是重灾区。
- 音色相近——两位年龄、性别、口音都接近的说话人,容易被合并成同一个人。
- 串音与共用话筒——几个人围着一支免提话筒,或者远处的人声通过别人的话筒进来,切分点会变得模糊。
- 只说一两句的人——全程只讲了十秒的参会者,样本太短,往往被并进别人里。
- 电话与网络会议的压缩音质——窄带压缩会丢掉不少可用于区分个体的信息。
因此,界面里可以手动改:合并被拆成两个的同一个人、拆开被并在一起的两个人、把某几句重新指派给正确的发言人。改动会同步到整篇文稿。
想提高分离质量,最有效的仍然是录音阶段的动作:让每个人尽量靠近话筒、减少同时说话、关掉持续底噪。
实际怎么用
- 把音频或视频文件拖进窗口,或者直接在会议进行时用 Mac 录制。
- 开启说话人分离;如果知道有几个人,把预期人数填上,通常能减少分错。
- 等转写跑完,文稿会按“说话人 1 / 说话人 2”分好段。
- 把编号改成真实姓名,全篇一次更新;系统会记住这些声音。
- 处理明显分错的地方,然后导出 TXT 正文或 SRT / VTT 字幕。
录制他人时请注意:国内职场的通行做法是在会议开始时口头说明“本次会议将录音”。未经同意录制他人的私密活动或私密谈话,可能侵犯《民法典》第 1032—1033 条项下的隐私权。转写与分离结果都是自动处理的产物,我们不对法律用途做任何保证;重要内容请对照原始录音核对,必要时咨询律师。
运行环境与价格
macOS 13 或更高版本,必须是 Apple Silicon(M1 及以上)的 Mac,Intel 机型无法使用。支持 99 种语言,自动识别语种。除首次下载识别模型外不需要联网,也不需要注册账号。
在 Mac App Store 下载免费,先拿一段自己的多人录音试试分离效果;继续使用时在应用内一次性买断 Pro,$49.99,不是订阅(人民币价格以中国区 App Store 显示为准)。免费额度:音频转写共 5 次、视频转写共 5 次(终身额度,不是每天刷新),语音输入每天 5 分钟;录音本身不计次,对已经转写过的内容重新转写也不计次——所以调整预期人数后重跑同一段录音,不会消耗额度。
下载免费,一次买断,不是订阅。 · Pro 解锁 $49.99 一次性内购(中国区 App Store 以人民币结算) · 需 macOS 13 或更高版本
常见问题
转文字能自动标出谁在说话吗?
可以。开启说话人分离后,录音会按发言人切分并逐句标注成“说话人 1 / 说话人 2”,你再把编号改成真实姓名,全篇会一起更新。识别和分离全部在你的 Mac 上完成。
说话人分离和语音识别是一回事吗?
不是。语音识别负责“说了什么”,说话人分离负责“谁说的”。两者是独立的处理步骤,合起来才能得到带说话人标记的逐字稿。分离出的是不同的人,不是他们的名字,姓名需要你自己填一次。
声纹会上传吗?可以删除吗?
不会上传。声纹特征只保存在你的 Mac 本机,不会同步到任何服务器,也可以随时在应用的说话人页面里删除。需要提醒的是,声纹在《个人信息保护法》下属于敏感个人信息,采集他人声纹前请先明确告知并取得对方同意。我们不因此对合规性作任何声称,具体请以贵司法务或信息安全部门的判断为准。
下次录音还能认出同一个人吗?
可以。给某个声音命名之后,再导入包含同一个人的录音时,他的发言会被直接标注为那个名字,不需要重新指定。固定例会、长期跟踪同一批受访者、有固定嘉宾的播客,从第二次起基本不用再手动标注。
什么情况下会分错?
抢话重叠、音色相近的两个人、几个人共用一支免提话筒的串音、全程只说了一两句话的参会者,以及电话或网络会议的压缩音质,都会导致分错。界面里可以手动合并、拆分或重新指派发言人,改动会同步到整篇文稿。
多少人的录音能分?
两人访谈到多人会议都可以。人数越多、发言越零碎,出错概率越高;如果事先知道有几个人,把预期人数填上通常能减少分错。录音时让每个人尽量靠近话筒、减少同时说话,比事后调整更有效。
免费版能试几次?
音频转写共 5 次、视频转写共 5 次,均为终身额度而不是每天刷新;语音输入是每天 5 分钟。录音本身不计次数,对已经转写过的内容重新转写也不计次,所以调整参数重跑同一段录音不会消耗额度。超出后在应用内一次性买断 Pro,$49.99,不是订阅。