让语音助手说得开心一点,它却可能只照着文字自行发挥。NeuTTS-2E想解决这个问题:用户可以明确指定情绪,模型再按要求念出内容。它是一款开源的端侧 TTS——也就是直接在本地设备上把文字变成语音,文字和音频不必离开设备,适合看重低延迟与隐私的语音 Agent。
据开发团队 TeamNeuphonic 自述,NeuTTS-2E支持七种可控情绪,例如愤怒、恐惧和开心;切换表达方式时,还会尽量保留选定说话人的音色。模型每次生成仅调用125M激活参数——即实际参与这次计算的参数,较能反映单次推理负担——并内置四种声音,目前生成英语语音。
这仍是一次 alpha 版早期发布,采用 NeuTTS Open License。团队也坦言,情绪语音数据有限、标签不可靠,以及如何把说话情绪与文字含义分开,都是训练难点;材料尚未披露延迟、设备占用或独立评测结果。