首页 › 音频文件转文字
音频转文字
音频文件转文字:在 Mac 本机完成,不用上传
手里已经有一个录音文件——会议的 m4a、录音笔导出的 wav、剪辑用的 mp4——想把它变成能编辑、能检索的文字。在 Lesskeys 里,音频文件转文字就是把文件拖进窗口:转写在你的 Mac 上完成,文件不会上传到任何服务器。视频文件也可以直接拖,不用先自己提取音轨。
支持哪些格式
常见的音频和视频格式基本都能直接拖进来,不用先转码:
| 类型 | 常见格式 | 典型来源 |
|---|---|---|
| 音频 | mp3、m4a、wav、aac、aiff、caf、flac | 手机备忘录、录音笔、会议软件导出的音轨 |
| 视频 | mp4、mov、m4v | 会议录像、课程回放、要配字幕的成片 |
视频文件会自动读取里面的声音轨道,你不需要先用别的软件抽出音频。如果录音笔导出的是厂商自有的压缩格式,在配套软件里另存为 wav 或 mp3 再拖进来即可。
音频文件转文字怎么操作
- 拖进窗口——把一个或多个文件直接拖到应用窗口里。
- 确认语言范围——支持 99 种语言自动识别;如果录音开头有较长的寒暄或空白,事先把常用语言限定成“中文、英文”这样的小集合,可以避免整段跑错语种。
- 需要的话开启说话人分离——多人对话会按发言人分段,标出谁在说话,之后可以改成真实姓名。
- 等它跑完——在 Apple Silicon 的 Mac 上通常比实时播放快,一小时的录音大致十几分钟。
- 校对并导出——导出 TXT 正文、SRT / VTT 字幕,历史记录可导出 TXT、JSON、CSV。
更细的分步说明在《录音怎么转文字》,这一页主要讲工具本身和格式支持。
长音频不用切段
在线转文字网站常见的限制是单个文件不能超过多少分钟或多少 MB,于是用户只好先把三小时的会议切成十几段,转完再手动拼回去,说话人编号还全乱了。
本机处理没有这个环节。限制你的是硬盘空间和耐心,不是服务器的配额:一整场三小时的研讨会、一次两小时的深度访谈,都可以作为一个文件一次跑完,说话人标记在全篇内保持一致。
需要留意的现实约束只有两条:转写期间让 Mac 保持唤醒(合盖会进入睡眠并中断任务),笔记本处理长文件时最好插着电源。
和“免费在线转文字”网站相比
不少人在找工具时第一步会搜“免费在线转文字”。在线服务确实有它合适的场合:不用装软件、换台电脑就能用、Windows 和手机上也能开。下面只做可核实的差别对比,不涉及对任何服务的指控。
| Lesskeys(本机处理) | 在线转写网站 | |
|---|---|---|
| 文件在哪里处理 | 你自己的 Mac 里 | 服务商的服务器 |
| 是否需要上传文件 | 不需要 | 需要 |
| 是否需要注册账号 | 不需要 | 多数需要手机号或邮箱 |
| 单文件时长限制 | 取决于你的硬盘 | 常见按分钟或文件大小设限 |
| 是否需要联网 | 首次下载模型后不需要 | 全程需要 |
| 费用形态 | 一次性买断 | 免费额度+按分钟或包月 |
| 跨平台 | 仅 macOS(Apple Silicon) | 浏览器打开即可 |
| 大批量并行处理 | 受本机性能限制 | 服务器端可并行 |
结论很直白:如果只是转一段公开的播客,用什么都行;如果文件里有客户、候选人、当事人或未公开的商业信息,“不上传”这件事本身就是选择依据。
带说话人的文稿
纯文字块和带说话人标记的文稿,可用性差别很大。开启说话人分离后,一段两人访谈会变成清晰的一问一答,而不是一大坨连续文本。给声音命名之后,下次导入同一位受访者的录音时还能认出来。
局限也要说清楚:抢话重叠、串音、音色相近的两个人,分离会出错,需要人工调整;如果录音是几个人共用一支免提话筒,效果会明显下降。详见《说话人分离转写》。
如果文件里有其他人的声音,请注意先取得对方同意再录制和处理;国内职场的通行做法是在会议开始时口头说明“本次会议将录音”。未经同意录制他人的私密谈话,可能侵犯《民法典》第 1032—1033 条项下的隐私权。转写结果是自动处理的产物,我们不对法律用途做任何保证,重要内容请对照原始录音核对。
给视频配字幕
把 mp4 或 mov 直接拖进来,转写完导出 SRT 或 VTT,可以直接导入剪辑软件或上传到视频平台。时间轴由转写结果生成,你要做的主要是校对专有名词和数字,以及按阅读节奏合并过短的句子。
课程回放、产品演示、访谈成片这类内容,字幕通常也顺便解决了检索问题——有了逐字稿,半年后想找“当时是谁说要砍掉那个功能的”,搜一下就行。
想让结果更准,先看录音本身
转写质量受录音条件的影响,比受工具的影响更大。如果结果不理想,按这个顺序排查:
- 话筒距离——放在长桌正中间录六个人,最远的那位几乎一定会错。
- 持续底噪——空调、投影仪风扇、咖啡厅背景音会明显拉低准确率。
- 抢话重叠——同时说话的部分,机器通常只能识别出其中一个人。
- 专有名词——人名、公司名、项目代号是错得最多的一类,可以用文本替换规则让常错的词每次自动改对。
价格与运行环境
运行环境:macOS 13 或更高版本,必须是 Apple Silicon(M1 及以上)的 Mac,Intel 机型无法使用。
在 Mac App Store 下载免费,可以先用手里的录音试一试;继续使用时在应用内一次性买断 Pro,$49.99,不是订阅(人民币价格以中国区 App Store 显示为准)。免费额度:音频转写共 5 次、视频转写共 5 次(终身额度,不是每天刷新),语音输入每天 5 分钟;录音本身不计次,对已经转写过的内容重新转写也不计次,所以换个模型档位重跑同一个文件不会消耗额度。
下载免费,一次买断,不是订阅。 · Pro 解锁 $49.99 一次性内购(中国区 App Store 以人民币结算) · 需 macOS 13 或更高版本
常见问题
支持哪些音频和视频格式?
音频支持 mp3、m4a、wav、aac、aiff、caf、flac 等常见格式,视频支持 mp4、mov、m4v。视频会自动读取其中的声音轨道,不需要你先用别的软件抽取音频。录音笔的厂商自有格式,请先在配套软件里另存为 wav 或 mp3。
单个文件有时长或大小限制吗?
单个文件的时长和大小没有服务器端的配额限制,限制来自你的硬盘空间和等待时间。三小时的会议录音可以作为一个文件一次跑完,不需要切段,说话人标记在全篇内保持一致。需要区分的是文件“多长”和“多少个”:长度不受限制,但免费下载可转写的文件数量有限——音频 5 次、视频 5 次,均为终身额度。
文件会被上传到服务器吗?
不会。转写在你的 Mac 本机完成,音频文件和转写结果都不会离开这台电脑。除了第一次下载识别模型之外不需要联网,也不需要注册账号。
视频文件可以直接转吗?
可以。把 mp4 或 mov 直接拖进窗口即可,应用会读取其中的声音轨道,转写完可以导出 SRT 或 VTT 字幕,直接导入剪辑软件或上传到视频平台。
能自动分出录音里的不同说话人吗?
可以。开启说话人分离后会按发言人分段并标注,之后可以改成真实姓名。需要注意抢话重叠、串音、音色相近的说话人会分错,需要人工调整。如果录音涉及他人,请先取得对方同意。
免费版可以转几个文件?
音频转写共 5 次、视频转写共 5 次,都是终身额度而不是每天刷新;语音输入是每天 5 分钟。录音本身不计次数,对已经转写过的内容重新转写也不计次。超出后在应用内一次性买断 Pro,$49.99,不是订阅。