你对设备说“把灯关掉”,理想情况是话音刚落,它就听懂、执行并回应;现实里,这三步往往由不同工具完成,等待和接线都很麻烦。开源项目 Moonshine Voice 把语音识别、意图判断——识别用户想执行什么动作——以及语音合成(TTS,把文字变成人声)放进同一套工具链,面向实时语音 Agent。
它的关键思路是端侧运行,也就是音频在手机、电脑或嵌入式设备本地处理,无需账号、API Key 或云端调用。系统还采用流式处理:用户尚未说完,就开始分段处理声音,以缩短对话中的停顿。项目提供从 Python 到 iOS、Android、Windows、Raspberry Pi、微控制器和可穿戴设备的同一套库,并支持多种语言。
Moonshine 还提供转写、语义匹配指令、TTS、声音克隆和说话人识别等高层接口。项目方称,其语音识别模型从零训练,高端版本准确率可超过 Whisper Large V3,最小模型则可缩至 1MB;不过材料未披露统一测试条件,性能结论仍应以实际设备和场景验证为准。