Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER HF 124 约 1 分钟

多个专家蒸馏,先消除领域偏科

把多位专家教给同一模型前,先校准反馈尺度,避免强势领域带偏训练。

让数学、编程和指令专家一起教一个学生模型,听起来像是集各家之长。问题是,有的老师“嗓门”天然更大:即使题目数量相同,它的反馈也可能主导训练,学生最后仍然偏科。论文发现,在初始的 Qwen3.5 4B 学生中,指令遵循专家贡献了合并梯度的 94%,数学能力则没有被充分学到。

作者提出 DN-MOPD。它沿用多教师在线策略蒸馏——学生先按当前能力作答,再由对应领域的专家逐词反馈——但会先做领域归一化:把各领域反馈的波动尺度拉到可比水平,像把难度不同科目的分数换算后再计入总评。这个调整不需要增加教师调用,也不改变题目分配。

据作者实验,在三种尺寸的 Qwen3.5 上,DN-MOPD 相比原方法将六项基准平均分提高 1.17 至 3.08 个百分点,并找回大部分丢失的数学收益。对照实验显示,关键主要不是抬高数学反馈,而是压低过强的指令遵循反馈。


供稿材料 SOURCES — 1

← 返回 2026-10-01 · 学术板块