识别引擎
打开 设置 → 语音识别。页面顶部始终显示当前使用的引擎,下面的标签只改变你看到的内容,不会改变引擎本身。
本地模型(推荐)
Section titled “本地模型(推荐)”识别在你的 Mac 上完成,不上传任何内容,也不需要账号。模型在应用内下载,每个都有校验,可以随时删除。
| 模型 | 大小 | 适合 | 说明 |
|---|---|---|---|
| SenseVoice(推荐) | 约 164 MB | 中文、英文、日文、韩文、粤语 | 自带标点和数字格式,速度快 |
| FireRedASR2(实验性) | 下载约 520 MB | 普通话和英文 | 我们的测试里准确度和 SenseVoice 相当,但不输出标点,速度约慢 4 倍 |
| Parakeet TDT v3(实验性) | 下载约 490 MB | 25 种欧洲语言 | 不含普通话 |
不确定哪个适合你的声音?用你自己的声音比较。
识别设置标签里有语言、数字规整、人声检测灵敏度和 CPU 使用方式。
- 语言:“自动”会让 SenseVoice 对每段录音自己判断。应用设为中文时会直接用普通话,因为自动判断有时会把短句的普通话听成日语或韩语。
- 人声检测灵敏度:说话很轻、句子开头被切掉时往“更灵敏”调;背景噪声被当成说话时往“不易误触发”调。
云端服务(可选)
Section titled “云端服务(可选)”讯飞、火山引擎、腾讯云、阿里云、百度、Deepgram。使用你自己的账号和凭据,凭据保存在 macOS 钥匙串。只有你对该服务商同意后,音频才会发送给它。取消录音会停止后续上传,但无法撤回已经发出去的音频。
云端失败或没有网络时,随言可以改用本地模型继续(“云端服务”标签里的“云端失败时”设置)。
Apple 自带识别
Section titled “Apple 自带识别”使用 macOS 的语音识别。另有一个开关决定是否允许使用 Apple 的服务器:可能更准,但音频会发给 Apple。
页面顶部的开关会隐藏云端服务和 Apple 自带识别,应用也不会自动建立任何网络连接。需要先下载好本地模型。
在合成普通话语音的基准测试里,SenseVoice 整体字错误率约 10%,短句约 1%;FireRedASR2 约 10.6%。合成语音比真人干净,基准也测不出你的声音和口音,所以数字只能作参考。详见准确度基准(英文)。