首页 › 什么是本地语音识别
概念解释
什么是本地语音识别?(离线、端侧转写的原理)
本地语音识别,是指把语音转文字的模型直接跑在你自己的电脑里,音频不上传到任何服务器。中文里同一件事有三种说法:普通用户说“本地”“离线”,技术文档里说“端侧”。它的反面是云端转写——录音先传到服务商那边算完,再把文字回传给你。这篇文章讲清两者的实际差别,以及各自适合什么场景。
先把词理清:本地=离线=端侧
你在不同地方会看到三个词,指的其实是同一件事:模型运行的位置是你手上这台设备。
- 本地语音识别——最常见的用户说法,强调“在我自己的电脑上”。
- 离线语音识别——强调“断网也能用”,是同一件事的另一个侧面。
- 端侧 AI 转写——行业和厂商文档里的说法,“端侧”对应的是“云端”。
有一点必须先讲清楚,因为很多人会混:“加密传输”不等于本地处理。链路加密只保证传输途中别人截不走,音频最后仍然落在对方的服务器上,仍然要问“存多久、谁能看、怎么删”。本地识别的不同之处在于,根本不存在“上传”这一步——比较的维度从“传得够不够安全”,直接变成了“压根不传”。
它是怎么跑起来的
原理并不神秘。语音识别模型本质上是一个训练好的文件,把声音波形映射成文字。本地方案做的事情,就是先把这个模型文件下载到你的电脑上,之后每次转写时把它读进内存,用芯片算完,结果直接留在本地。
在 Mac 上,这个计算主要交给 Apple Silicon 的 GPU 来做。M1 之后的芯片把统一内存和 GPU 算力放在一起,几 GB 的识别模型可以整个装进内存跑,这正是本地转写这几年从“能用”变成“好用”的技术前提。也正因为如此,这类应用普遍要求 Apple Silicon,Intel 芯片的 Mac 跑不了。
把两条链路并排放,差别一眼可见:
- 云端:录音 → 上传文件 → 在服务器排队 → 转写 → 下载结果 → 音频和文字在服务器上留存(留多久看各家条款)
- 本地:录音 → 本机转写 → 完成。音频和文字从头到尾都在这台电脑里
只有第一次下载模型需要联网,之后飞行模式、断网、公司内网都照常工作。
本地和云端到底差在哪
| 本地(端侧) | 云端服务 | |
|---|---|---|
| 音频在哪里处理 | 你自己的电脑里 | 服务商的服务器 |
| 是否需要注册账号 | 不需要 | 基本都需要手机号或邮箱 |
| 音频是否离开本机 | 不离开 | 离开 |
| 是否需要联网 | 首次下载模型时需要,之后不用 | 全程需要 |
| 单个文件时长限制 | 取决于你的硬盘和耐心 | 多为套餐时长或按分钟计费 |
| 费用形态 | 买断居多 | 包月或按量计费居多 |
| 大批量处理 | 受本机性能限制 | 服务器可并行,处理量大时更快 |
| 准确率 | 取决于所用模型与录音质量 | 取决于所用模型与录音质量 |
公平地说,云端也有它明显更合适的场合:几百小时的存量音频要一夜之间跑完、只想开个网页不装软件、团队要在同一个后台里共享和协作。本地方案的优势集中在另外三种条件——音频不能外发、没有网络、不想按分钟一直付费。
“不用注册账号”为什么排在很前面
在中文用户的顾虑清单里,账号问题的位置比很多人预想的要靠前。云端转写通常要手机号注册、要同意一份用户协议、要接受“为改进服务可能使用你上传的数据”这类条款;在公司里用,还要走信息安全或法务的审批流程,如果录音里有客户、候选人、当事人的声音,往往还得先问过对方。
本地方案把这一整条讨论去掉了:没有账号,就没有“数据存在谁名下”;没有上传,就没有“存多久、能不能删干净”。这在实际工作里省下的不是几分钟,而是几周的沟通。
需要强调的是,以上只是架构层面的事实描述,不构成任何合规声明。一款软件是否满足贵司的信息安全或个人信息处理要求,请以贵司法务/信息安全部门的判断为准。
本地方案的代价,也要说清楚
只讲好处就不诚实了。本地转写确实有它的成本:
- 第一次要下载模型——识别模型是几百 MB 到 1.6 GB 不等的文件,装完之后才能离线用。
- 吃你自己的算力——转写时风扇可能会转,长文件跑的时候电脑会热,笔记本用电池会掉得快一些。
- 硬件有门槛——需要 Apple Silicon(M1 及以上)的 Mac,系统需要 macOS 13 或更高版本;Intel 芯片的 Mac 无法使用。
- 长音频要等——两小时的会议录音不会秒出结果,虽然通常比实时播放快不少,但仍然需要几分钟到十几分钟。
- 批量不是强项——一次性处理几百个文件,服务器的并行能力仍然更有优势。
准确率会不会比云端差
几年前的分工确实是“重活交给服务器,端上只跑简化版”,但 Apple Silicon 出现之后这个前提变了:完整尺寸的识别模型可以直接在 Mac 上跑,端上和云上用的往往是同一量级的模型。
更值得关注的是,准确率受录音质量的影响,比受“本地还是云端”的影响大得多。真正决定结果的是这几件事:
- 话筒离说话人的嘴有多远(会议桌正中间放一支手机,效果一定不好)
- 有没有空调、投影仪、键盘敲击这类持续底噪
- 是不是经常几个人同时抢话
- 专有名词、公司内部黑话、缩写多不多(这部分基本要靠人工校对)
换成云端不会解决这些问题;把录音方式改一改,效果提升往往更明显。
什么场景该用哪种
适合本地:涉及商业敏感信息的内部会议、客户商务洽谈、记者采访、面试与人事沟通、律师与当事人的沟通记录、出差途中或飞机上没有网络的时候,以及每个月用量说不准、不想被按分钟计费的长期使用。
如果录音里有其他人,请注意:国内职场的通行做法是在会议开始时口头说明“本次会议将录音”。未经同意录制他人的私密谈话,可能侵犯《民法典》第 1032—1033 条项下的隐私权。请先取得对方同意,并遵守贵司的相关规定。
不适合本地:只有 Windows 电脑(本文提到的应用仅支持 macOS)、还在用 Intel 芯片的 Mac、需要团队在同一个云端后台里协作编辑,或者要一次性消化几百小时的存量音频。
在 Mac 上做本地语音识别
Lesskeys 就是完全按这个思路做的 macOS 应用:语音输入和录音转写都在本机完成,音频和转写结果都不会离开你的 Mac,不需要注册账号,也没有遥测。支持 99 种语言,自动识别语种。语音输入的结果会复制到剪贴板,你在需要的位置按 ⌘V 粘贴(应用不会替你自动输入文字)。
运行环境:macOS 13 或更高版本,必须是 Apple Silicon(M1 及以上)的 Mac。
在 Mac App Store 下载免费,先用自己的录音试过再决定;需要继续用时,在应用内一次性买断 Pro,$49.99,不是订阅(人民币价格以中国区 App Store 显示为准)。免费版本身也能干活:语音输入每天 5 分钟,音频转写共 5 次、视频转写共 5 次(终身额度,不是每天刷新);录音本身不计次,对已经转写过的内容重新转写也不计次。
想看具体怎么操作,可以读《录音怎么转文字》;手里已经有音频文件的,直接看《音频文件转文字》。
下载免费,一次买断,不是订阅。 · Pro 解锁 $49.99 一次性内购(中国区 App Store 以人民币结算) · 需 macOS 13 或更高版本
常见问题
什么是本地语音识别?
本地语音识别是指把语音转文字的模型跑在自己的电脑里,音频不上传到任何服务器。中文里也叫离线语音识别或端侧转写,指的是同一件事:模型运行的位置是你手上这台设备,而不是服务商的服务器。
本地转写和云端转写有什么区别?
云端转写会先把录音上传到服务商的服务器,算完再把文字传回来,通常需要注册账号并保持联网。本地转写没有上传这一步,音频和文字全程留在本机,首次下载模型之后断网也能用,也不需要账号。
加密上传算不算本地处理?
不算。链路加密只保证传输途中不被第三方截取,音频最终仍然存放在服务商的服务器上。本地处理的区别在于根本没有上传这一步,因此不存在“数据存在别人那里多久”的问题。
离线跑,准确率会不会比云端差?
在 Apple Silicon 的 Mac 上可以直接运行完整尺寸的识别模型,日常会议和采访录音的效果与云端服务处在同一量级。准确率更多取决于录音质量——话筒距离、环境底噪、是否多人抢话,而不是取决于在本地还是在云端计算。
本地语音识别需要联网吗?
只有第一次下载识别模型时需要联网。模型装好之后,飞行模式、断网环境或不通外网的公司内网里都可以照常转写。
本地处理是不是就符合我们公司的数据要求了?
我们不做任何合规声明。可以确认的只是架构事实:音频和转写结果不会离开你的 Mac,应用不需要账号,也不上传遥测数据。是否满足贵司的信息安全或个人信息处理要求,请以贵司法务/信息安全部门的判断为准。
免费版能用到什么程度?
语音输入每天 5 分钟,音频转写共 5 次、视频转写共 5 次,后两项是终身额度而不是每天刷新。录音本身不计次数,对已经转写过的内容重新转写也不计次。超出这个范围后,在应用内一次性买断 Pro,$49.99,不是订阅。