Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER HF 42 约 8 分钟

Qwen3.8-Next:稀疏模型如何跑稳

125B稀疏模型每词元只激活6B:Qwen用混合注意力、门控残差与外置词表兼顾能力、成本和稳定性。

Qwen3.8-Next:稀疏模型如何跑稳

你去一座有上百亿本书的图书馆查一句话,真正决定效率的,不是馆藏有多大,而是每次要搬多少书、能不能迅速找到对的书,以及忙起来会不会乱套。超大语言模型面对的也是这组问题:既想保留庞大的知识容量,又不想每生成一个词都动用全部参数。

Qwen3.8-Flash-Next给出的答案,是把模型做成稀疏的Mixture of Experts(MoE,混合专家):模型包含许多“专家”模块,每个Token——也就是模型处理文字时的基本单位——只调用其中少数模块。论文报告其主体有125B参数,每个Token激活6B;加速器之外还放着51B参数的n-gram embedding tables,即记录常见连续词元组合的查找表。它追求的不是单项纪录,而是同时处理能力、训练成本、推理速度和训练稳定性。

本文数据与结论均来自论文材料的单一转载来源hf-daily-papers,尚未获得原论文、官方博客或代码仓库的独立交叉印证;专题暂称“Qwen3.8-Next”,材料中的正式模型名则是“Qwen3.8-Flash-Next”。

大仓库,每次只开几排货架

MoE的关键数字不是只有总参数,还有“激活参数”——处理当前Token时真正参与计算的部分。Qwen3.8-Flash-Next以6B激活参数运行125B参数的稀疏主体。相较397B-A17B前代模型,它每个Token调用的参数约为三分之一,训练Token数约为三分之一,训练FLOPs——衡量计算量的浮点运算次数——约为九分之一。

缩减计算没有带来全面退步。论文称,在14项覆盖知识、STEM、推理、代码和多语言能力的预训练基准中,新模型有8项领先前代,其余6项最多落后2.6分。不过材料没有给出这14项的完整名称、逐项分数和统计显著性,因此这些数字更适合视为架构报告中的总体证据,而不是已经独立验证的结论。

这项工作的价值,也不只是“用更少算力得到相近分数”。作者把每项改动放在三把尺子下检查:损失值和下游任务表现、训练与推理成本,以及最佳超参数和稳定性。换句话说,一种设计即便考试分数不错,如果生成太慢或训练容易崩,也不能算成功。

长文不能每次都从头翻

模型处理当前Token时,需要从前文寻找相关信息。全局注意力可以直接查看完整上下文,像随时翻回长文中的任意一句,但文章越长,计算和内存负担越重。

论文采用Gated DeltaNet(GDN)与全局注意力交错的结构:每四层安排一层完整注意力,其余三层使用GDN。GDN属于线性注意力路线,它把前文压缩进固定大小的循环状态,不必每次逐一回看所有Token;周期性的全局注意力则保留直接检索远处原文的能力。两者像“平时看摘要,定期查原件”。

在一组25B-A3B消融实验中,GDN混合架构在9项基准中的8项超过全注意力Transformer,在7项超过滑动窗口混合架构;九项平均分分别为53.81、49.87和51.15。这说明混合路线有优势,但论文也明确提醒:这组比较不能单独确定每一项提升究竟来自哪个组件。

到了continued pretraining(继续预训练,即在已有模型上追加一阶段训练),完整注意力又被Qwen Sparse Attention(QSA,Qwen稀疏注意力)替换。QSA先用轻量索引器把上下文切成micro-block——小块文本——并压缩、评分,只把更相关的块交给注意力计算。它不是让模型翻完整本书,而是先看目录卡,再打开少数可能有答案的页。

QSA先学习模仿完整注意力的分布,再让整个主体适应稀疏选择。在8项短上下文基准上,它将平均分从75.9提高到76.8,8项中有7项持平或更高。在更长的上下文测试中,MRCR得分在512K长度由30.66升至40.53,在1M长度由20.71升至26.44。论文还报告,QSA从64K上下文起出现内核级速度收益,且文本越长收益越大;但材料缺失部分具体加速倍数,不能据此给出精确速度承诺。

给信息流多修几条车道

普通残差连接可以理解为模型内部持续传递的一条主干道。层数增加后,早期写入的信息会和后续内容挤在同一条路上。Gated Residual(GR,门控残差)把这条信息流扩成四个分支,再用逐元素门控决定每一层从各分支读取什么。门控不是对整条分支只设一个总开关,而是能对不同信息维度分别调节。

消融实验中,普通pre-norm残差的九项平均分为50.91;仅拓宽残差流的静态设计达到52.49;加入动态读写后为54.47;最终GR为54.66。GR还删除了额外的分支混合操作,减少读取整份残差状态造成的内存流量。作者的内部分析显示,四个分支中会有一个承担较长距离的信息传递,其余三个更偏向局部路径。

这部分也揭示了论文最重要的方法论:训练损失低,不一定代表实际任务更好。静态残差改成动态读写时,损失只从1.596降到1.594,平均基准分却从52.49升到54.47。另一个反例来自n-gram词表:扩大词表会持续降低损失,但下游准确率逐渐饱和。只盯着损失曲线,可能会继续为没有明显任务收益的容量付费。

稳定不是训练结束后再补救

GR的门控也参与解决训练稳定性。论文将新架构与Muon优化器结合。优化器是训练时调整参数的规则;Muon主要用于二维线性权重,embedding、输出头、MoE路由器和GR的低秩投影等部分仍使用AdamW。

作者重新拟合了学习率和批量大小,发现新组合适合更高的最佳学习率与更大批量。逐步增加batch size的warmup——训练初期从小批量慢慢升到目标批量——没有比直接使用目标值更好,反而增加了优化步骤,因此最终没有采用。

在压力测试中,作者把学习率提高到最优值的四倍并保持恒定。旧结构频繁出现损失尖峰,新方案则全程稳定。论文还称,完整规模训练没有出现一次损失尖峰或梯度范数异常波动,也未依赖显式裁剪方法。这个结果很有分量,但它来自特定训练配置和作者设计的压力测试,不能外推为所有模型规模、数据和硬件上的普遍保证。

为什么值得关注

这份报告最有意思的地方,是没有把“稀疏”简化成少算几个参数。它把四个瓶颈拆开处理:MoE减少每个Token实际调用的主体参数;GDN与QSA降低长上下文成本;外置n-gram表增加容量而尽量少增加每Token计算;GR和Muon共同扩大稳定训练的空间。

更重要的是,消融结果多次显示几把尺子会互相打架:损失下降,下游准确率可能不再增长;预训练阶段看不出区别的设计,可能在后续生成时暴露问题;看似几乎免费的近似,也可能随着继续训练而退化。所谓“跑稳”,因此不只是曲线不爆炸,而是模型能力、计算账单和训练行为能在同一套设计里成立。

局限与未知

  • 参数口径仍有歧义。材料一面称模型有125B参数,一面又称另有51B外置n-gram表,尚不能确认应否将总量写成176B,也不能确认“每Token激活6B”是否完全排除查表参数。
  • 与前代比较缺少绝对训练Token数、FLOPs计算口径和完整实验条件;“九分之一训练FLOPs”不能直接等同于九分之一训练费用或时间。
  • 全部关键论断目前只有同一来源支持。作者总结其方案同时更高效、更强、更稳定,但现有材料更适合把它视为一套有消融支撑的设计主张,仍待独立复现。

供稿材料 SOURCES — 1

← 返回 2026-09-03 · 学术板块