首页 › 什么是本地语音识别

概念解释

什么是本地语音识别?(离线、端侧转写的原理)

本地语音识别,是指把语音转文字的模型直接跑在你自己的电脑里,音频不上传到任何服务器。中文里同一件事有三种说法:普通用户说“本地”“离线”,技术文档里说“端侧”。它的反面是云端转写——录音先传到服务商那边算完,再把文字回传给你。这篇文章讲清两者的实际差别,以及各自适合什么场景。

100%本机处理 — 音频不会上传
免费下载免费,Pro 解锁 $49.99 一次买断,无订阅
99种语言,自动识别
macOS 13+Apple Silicon(M1 及以上)

先把词理清:本地=离线=端侧

你在不同地方会看到三个词,指的其实是同一件事:模型运行的位置是你手上这台设备

有一点必须先讲清楚,因为很多人会混:“加密传输”不等于本地处理。链路加密只保证传输途中别人截不走,音频最后仍然落在对方的服务器上,仍然要问“存多久、谁能看、怎么删”。本地识别的不同之处在于,根本不存在“上传”这一步——比较的维度从“传得够不够安全”,直接变成了“压根不传”。

它是怎么跑起来的

原理并不神秘。语音识别模型本质上是一个训练好的文件,把声音波形映射成文字。本地方案做的事情,就是先把这个模型文件下载到你的电脑上,之后每次转写时把它读进内存,用芯片算完,结果直接留在本地。

在 Mac 上,这个计算主要交给 Apple Silicon 的 GPU 来做。M1 之后的芯片把统一内存和 GPU 算力放在一起,几 GB 的识别模型可以整个装进内存跑,这正是本地转写这几年从“能用”变成“好用”的技术前提。也正因为如此,这类应用普遍要求 Apple Silicon,Intel 芯片的 Mac 跑不了。

把两条链路并排放,差别一眼可见:

只有第一次下载模型需要联网,之后飞行模式、断网、公司内网都照常工作。

本地和云端到底差在哪

本地(端侧)云端服务
音频在哪里处理你自己的电脑里服务商的服务器
是否需要注册账号不需要基本都需要手机号或邮箱
音频是否离开本机不离开离开
是否需要联网首次下载模型时需要,之后不用全程需要
单个文件时长限制取决于你的硬盘和耐心多为套餐时长或按分钟计费
费用形态买断居多包月或按量计费居多
大批量处理受本机性能限制服务器可并行,处理量大时更快
准确率取决于所用模型与录音质量取决于所用模型与录音质量

公平地说,云端也有它明显更合适的场合:几百小时的存量音频要一夜之间跑完、只想开个网页不装软件、团队要在同一个后台里共享和协作。本地方案的优势集中在另外三种条件——音频不能外发没有网络不想按分钟一直付费

“不用注册账号”为什么排在很前面

在中文用户的顾虑清单里,账号问题的位置比很多人预想的要靠前。云端转写通常要手机号注册、要同意一份用户协议、要接受“为改进服务可能使用你上传的数据”这类条款;在公司里用,还要走信息安全或法务的审批流程,如果录音里有客户、候选人、当事人的声音,往往还得先问过对方。

本地方案把这一整条讨论去掉了:没有账号,就没有“数据存在谁名下”;没有上传,就没有“存多久、能不能删干净”。这在实际工作里省下的不是几分钟,而是几周的沟通。

需要强调的是,以上只是架构层面的事实描述,不构成任何合规声明。一款软件是否满足贵司的信息安全或个人信息处理要求,请以贵司法务/信息安全部门的判断为准

本地方案的代价,也要说清楚

只讲好处就不诚实了。本地转写确实有它的成本:

准确率会不会比云端差

几年前的分工确实是“重活交给服务器,端上只跑简化版”,但 Apple Silicon 出现之后这个前提变了:完整尺寸的识别模型可以直接在 Mac 上跑,端上和云上用的往往是同一量级的模型。

更值得关注的是,准确率受录音质量的影响,比受“本地还是云端”的影响大得多。真正决定结果的是这几件事:

换成云端不会解决这些问题;把录音方式改一改,效果提升往往更明显。

什么场景该用哪种

适合本地:涉及商业敏感信息的内部会议、客户商务洽谈、记者采访、面试与人事沟通、律师与当事人的沟通记录、出差途中或飞机上没有网络的时候,以及每个月用量说不准、不想被按分钟计费的长期使用。

如果录音里有其他人,请注意:国内职场的通行做法是在会议开始时口头说明“本次会议将录音”。未经同意录制他人的私密谈话,可能侵犯《民法典》第 1032—1033 条项下的隐私权。请先取得对方同意,并遵守贵司的相关规定。

不适合本地:只有 Windows 电脑(本文提到的应用仅支持 macOS)、还在用 Intel 芯片的 Mac、需要团队在同一个云端后台里协作编辑,或者要一次性消化几百小时的存量音频。

在 Mac 上做本地语音识别

Lesskeys 就是完全按这个思路做的 macOS 应用:语音输入和录音转写都在本机完成,音频和转写结果都不会离开你的 Mac,不需要注册账号,也没有遥测。支持 99 种语言,自动识别语种。语音输入的结果会复制到剪贴板,你在需要的位置按 ⌘V 粘贴(应用不会替你自动输入文字)。

运行环境:macOS 13 或更高版本,必须是 Apple Silicon(M1 及以上)的 Mac

在 Mac App Store 下载免费,先用自己的录音试过再决定;需要继续用时,在应用内一次性买断 Pro,$49.99,不是订阅(人民币价格以中国区 App Store 显示为准)。免费版本身也能干活:语音输入每天 5 分钟,音频转写共 5 次、视频转写共 5 次(终身额度,不是每天刷新);录音本身不计次,对已经转写过的内容重新转写也不计次

想看具体怎么操作,可以读《录音怎么转文字》;手里已经有音频文件的,直接看《音频文件转文字》。

前往 Mac App Store 下载

下载免费,一次买断,不是订阅。 · Pro 解锁 $49.99 一次性内购(中国区 App Store 以人民币结算) · 需 macOS 13 或更高版本

常见问题

什么是本地语音识别?

本地语音识别是指把语音转文字的模型跑在自己的电脑里,音频不上传到任何服务器。中文里也叫离线语音识别或端侧转写,指的是同一件事:模型运行的位置是你手上这台设备,而不是服务商的服务器。

本地转写和云端转写有什么区别?

云端转写会先把录音上传到服务商的服务器,算完再把文字传回来,通常需要注册账号并保持联网。本地转写没有上传这一步,音频和文字全程留在本机,首次下载模型之后断网也能用,也不需要账号。

加密上传算不算本地处理?

不算。链路加密只保证传输途中不被第三方截取,音频最终仍然存放在服务商的服务器上。本地处理的区别在于根本没有上传这一步,因此不存在“数据存在别人那里多久”的问题。

离线跑,准确率会不会比云端差?

在 Apple Silicon 的 Mac 上可以直接运行完整尺寸的识别模型,日常会议和采访录音的效果与云端服务处在同一量级。准确率更多取决于录音质量——话筒距离、环境底噪、是否多人抢话,而不是取决于在本地还是在云端计算。

本地语音识别需要联网吗?

只有第一次下载识别模型时需要联网。模型装好之后,飞行模式、断网环境或不通外网的公司内网里都可以照常转写。

本地处理是不是就符合我们公司的数据要求了?

我们不做任何合规声明。可以确认的只是架构事实:音频和转写结果不会离开你的 Mac,应用不需要账号,也不上传遥测数据。是否满足贵司的信息安全或个人信息处理要求,请以贵司法务/信息安全部门的判断为准。

免费版能用到什么程度?

语音输入每天 5 分钟,音频转写共 5 次、视频转写共 5 次,后两项是终身额度而不是每天刷新。录音本身不计次数,对已经转写过的内容重新转写也不计次。超出这个范围后,在应用内一次性买断 Pro,$49.99,不是订阅。

相关内容