首页 › 说话人分离

说话人分离

说话人分离转写:自动标出谁在说话

一段多人录音转成文字后,如果只是一大坨连续文本,几乎没法用。说话人分离(也就是大家常说的区分说话人分角色、标出谁说的)会把录音按发言人切开,逐句标注,让文稿变成能读、能引用、能检索的对话记录。识别和分离全部在你的 Mac 上完成,音频与声纹都不上传。

100%本机处理 — 音频不会上传
免费下载免费,Pro 解锁 $49.99 一次买断,无订阅
99种语言,自动识别
macOS 13+Apple Silicon(M1 及以上)

说话人分离到底做了什么

“说话人分离”是技术圈的叫法,英文是 diarization;普通用户搜的往往是“区分说话人”“转文字能不能标出谁说的”。三种说法指的是同一件事,可以拆成两步来理解:

注意它和语音识别是两条独立的处理:识别负责“说了什么”,分离负责“谁说的”。两者合起来,才是一份可用的带说话人的逐字稿

还有一点要分清:分离出的是“不同的人”,不是“这个人叫什么”。系统不认识你的同事,它只能判断出录音里有三种不同的声音;名字要你自己填。填一次之后,全篇会一起更新。

谁最需要它

记者是最典型的场景。采访录音里问答交替,没有说话人标记的文稿在写稿时几乎无法直接引用;有了标记,一段两人对话就是清清楚楚的一问一答,找引语的时间能省下大半。多次采访同一位受访者时,声音命名的价值会进一步放大。

做质性研究的研究生同样如此。深度访谈、焦点小组的转录是论文工作量的大头,扎根理论那一套编码流程要求先有准确的分角色文稿;先跑一遍机器分离,再人工校对,通常比从零逐字敲要快得多。

播客和视频剪辑用它来定位。知道每一句是谁说的,加上时间轴,就能直接跳到要剪的那一段,也方便生成分角色的字幕。

HR 的面试记录也是常见场景:面试官和候选人的发言分开之后,复盘和交叉评估会容易很多。这一场景涉及他人的个人信息,请务必先取得候选人的同意,并遵守贵司的招聘与信息处理规定。

销售复盘客户拜访是另一类:把自己和客户的发言分开之后,回头看“对方到底关心什么、异议出在哪一句”,比凭记忆写拜访小结准确得多。同样地,录音前请先取得客户同意,并遵守贵司关于客户沟通记录的规定。

给声音命名:下次还能认出同一个人

这个功能很省时间,值得讲细一点。第一次处理某段录音时,你把“说话人 1”改成“李工”。系统会把这个人的声纹特征保存下来,下一次导入另一段录音,如果李工也在里面,他的发言会被直接标成“李工”,不必再手动改一遍。

对于每周开同一个例会、长期跟踪同一批受访者、固定嘉宾的播客来说,这意味着从第二次开始,说话人标注基本不用管了。

关于声纹,有几件事必须写清楚:

需要强调:以上是对功能行为和法律常识的说明,我们不因此声称本软件“合规”。我们能确认的只是架构事实——音频和声纹不离开本机。你的具体使用方式是否满足要求,请以贵司法务/信息安全部门的判断为准

为什么“在本机做”对这件事格外重要

说话人分离天然要处理声音的个体特征,这正是最敏感的那一部分数据。云端方案的链路是:把完整录音上传,在服务器上提取特征、聚类,结果回传,音频和特征在对方那里留存一段时间。

本机方案里没有上传这一步:

Lesskeys(本机)云端转写服务
音频在哪里处理你自己的 Mac服务商的服务器
声纹存在哪里本机,可随时删除取决于各家条款
是否需要注册账号不需要基本都需要
断网能否使用可以不可以
费用形态一次性买断包月或按分钟计费居多

它会在什么情况下分错

说话人分离不是稳定输出正确答案的功能,把预期讲清楚更有用。以下几种情况会明显出错,需要人工调整:

因此,界面里可以手动改:合并被拆成两个的同一个人、拆开被并在一起的两个人、把某几句重新指派给正确的发言人。改动会同步到整篇文稿。

想提高分离质量,最有效的仍然是录音阶段的动作:让每个人尽量靠近话筒、减少同时说话、关掉持续底噪。

实际怎么用

  1. 把音频或视频文件拖进窗口,或者直接在会议进行时用 Mac 录制。
  2. 开启说话人分离;如果知道有几个人,把预期人数填上,通常能减少分错。
  3. 等转写跑完,文稿会按“说话人 1 / 说话人 2”分好段。
  4. 把编号改成真实姓名,全篇一次更新;系统会记住这些声音。
  5. 处理明显分错的地方,然后导出 TXT 正文或 SRT / VTT 字幕。

录制他人时请注意:国内职场的通行做法是在会议开始时口头说明“本次会议将录音”。未经同意录制他人的私密活动或私密谈话,可能侵犯《民法典》第 1032—1033 条项下的隐私权。转写与分离结果都是自动处理的产物,我们不对法律用途做任何保证;重要内容请对照原始录音核对,必要时咨询律师。

运行环境与价格

macOS 13 或更高版本必须是 Apple Silicon(M1 及以上)的 Mac,Intel 机型无法使用。支持 99 种语言,自动识别语种。除首次下载识别模型外不需要联网,也不需要注册账号。

在 Mac App Store 下载免费,先拿一段自己的多人录音试试分离效果;继续使用时在应用内一次性买断 Pro,$49.99,不是订阅(人民币价格以中国区 App Store 显示为准)。免费额度:音频转写共 5 次、视频转写共 5 次(终身额度,不是每天刷新),语音输入每天 5 分钟录音本身不计次,对已经转写过的内容重新转写也不计次——所以调整预期人数后重跑同一段录音,不会消耗额度。

前往 Mac App Store 下载

下载免费,一次买断,不是订阅。 · Pro 解锁 $49.99 一次性内购(中国区 App Store 以人民币结算) · 需 macOS 13 或更高版本

常见问题

转文字能自动标出谁在说话吗?

可以。开启说话人分离后,录音会按发言人切分并逐句标注成“说话人 1 / 说话人 2”,你再把编号改成真实姓名,全篇会一起更新。识别和分离全部在你的 Mac 上完成。

说话人分离和语音识别是一回事吗?

不是。语音识别负责“说了什么”,说话人分离负责“谁说的”。两者是独立的处理步骤,合起来才能得到带说话人标记的逐字稿。分离出的是不同的人,不是他们的名字,姓名需要你自己填一次。

声纹会上传吗?可以删除吗?

不会上传。声纹特征只保存在你的 Mac 本机,不会同步到任何服务器,也可以随时在应用的说话人页面里删除。需要提醒的是,声纹在《个人信息保护法》下属于敏感个人信息,采集他人声纹前请先明确告知并取得对方同意。我们不因此对合规性作任何声称,具体请以贵司法务或信息安全部门的判断为准。

下次录音还能认出同一个人吗?

可以。给某个声音命名之后,再导入包含同一个人的录音时,他的发言会被直接标注为那个名字,不需要重新指定。固定例会、长期跟踪同一批受访者、有固定嘉宾的播客,从第二次起基本不用再手动标注。

什么情况下会分错?

抢话重叠、音色相近的两个人、几个人共用一支免提话筒的串音、全程只说了一两句话的参会者,以及电话或网络会议的压缩音质,都会导致分错。界面里可以手动合并、拆分或重新指派发言人,改动会同步到整篇文稿。

多少人的录音能分?

两人访谈到多人会议都可以。人数越多、发言越零碎,出错概率越高;如果事先知道有几个人,把预期人数填上通常能减少分错。录音时让每个人尽量靠近话筒、减少同时说话,比事后调整更有效。

免费版能试几次?

音频转写共 5 次、视频转写共 5 次,均为终身额度而不是每天刷新;语音输入是每天 5 分钟。录音本身不计次数,对已经转写过的内容重新转写也不计次,所以调整参数重跑同一段录音不会消耗额度。超出后在应用内一次性买断 Pro,$49.99,不是订阅。

相关内容