一桌厨师接到一批订单,备菜时人手越全越好;真正逐盘出菜时,却可能把时间耗在来回找厨师上。MoE(混合专家模型)也有类似问题:它为每个词挑少数“专家”子网络,但批量生成时,一轮仍可能触及几乎全部专家,搬运权重反而成了瓶颈。
SlimWise不再用同一套剪枝规则贯穿推理。Prefill——一次读完输入并建立缓存——保留完整模型,因为这一阶段主要受计算能力限制,论文实验中剪枝后的吞吐量没有稳定提升。Decode——随后逐词生成——则裁掉部分专家,减少权重搬运,并直接沿用完整模型生成的KV Cache,也就是模型为避免重复计算而保存的中间结果,无需转换。
作者在Qwen3.6-35B-A3B上的结果显示,剪掉50%的专家后,解码吞吐量最高提升至完整模型的1.81倍,同时仅有很小的准确率损失。论文也提醒,准确率可能掩盖回答变得过短或过长的问题,因此又加入轻量蒸馏来校正生成行为。值得注意的不是“剪得更多”,而是承认推理的两个阶段根本不是同一种负载。