Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
PAPER H 1 约 1 分钟

代码MoE砍掉一半专家

代码MoE一次剪掉约半数专家仍保住编程表现,但剪法不能跨模型照搬。

一台电脑若只拿来写代码,却要常年背着聊天、写作等整套能力,多少有些浪费。Anik Jha 研究了两款代码 MoE——内部设有大量子网络“专家”,再由路由器为每个词挑少数专家工作。作者尝试一次性领域剪枝:根据一轮统计直接删除对代码任务较不重要的专家,以缩小模型和内存占用。

论文在 Qwen3.6-35B-A3B 与 Gemma-4-26B-A4B 上报告,删掉一半专家后,主要代码生成基准没有出现统计上可检测的损失,能力代价主要落在编程之外。更值得留意的是,剪谁并无通用答案:REAP 策略在 Qwen 上领先路由质量 2.4 个百分点,到了 Gemma 却反落后 12.8 个百分点;Gemma 的优胜策略在 Qwen 更深度剪枝时还会崩溃。说白了,庞大专家池在垂直部署中确有明显冗余,但每款模型仍须用真实代码任务单独验收,不能照搬剪枝配方。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 学术板块