Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.024 — 2026-07-28
NEWS 约 1 分钟

音频大模型只激活18亿参数

10B规模只激活1.8B参数,让原生语音交互有了更省算力的新选择。

IMAGE — r/LocalLLaMA 日榜

你让 AI 听一段长录音,再问“某件事发生在第几分钟”,它不仅要听懂内容,还得记住声音与时间的对应关系。GigaChat 3.1 Audio 瞄准的正是这类原生语音任务:音频不先转成文字,而是经过 Conformer——一种兼顾局部声音特征和长距离关系的语音编码器——直接送进语言模型。

它最值得注意的是计算方式。模型共有 10B(100 亿)参数,但每次只激活 1.8B(18 亿)。这是因为底层采用 Mixture-of-Experts(MoE,混合专家)结构:模型像一个大型专家组,处理一次请求时只请少数相关专家出场。语音编码结果还会经过模态适配器,也就是一层“小翻译”,变成语言模型能接收的输入。

据项目页面介绍,它支持音频问答、分类、摘要和时间定位,还能给事件描述加上时间戳;这部分能力使用带时间对齐标注的长音频数据集 TimeGround-1M 训练。换句话说,它试图在保留大模型容量的同时压低单次计算量,为成本更可控的语音交互提供一种新选择。不过,现有材料未披露具体速度、成本或基准测试成绩。


供稿材料 SOURCES — 1

← 返回 2026-07-28 · 开源板块