Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER 2 信源 约 1 分钟

两篇研究重画在策略蒸馏地图

两项研究重审在策略蒸馏:教师概率怎么传,比单点奖励更关键。

老师批改作文时,只说“这个词不该用”还不够,最好也告诉学生“更合适的词是什么”。在策略蒸馏(OPD)也有类似问题:学生模型先按自己的习惯生成内容,教师再逐词指导。常见方法把教师对所有候选词的概率偏好,压成单个 Token 的加减分,却没有说明减少的概率该转给谁。

第一篇工作提出 RouteOPD,把训练改写成“概率搬运”:从学生过度偏爱的词移出概率,明确送到教师更偏爱的词。它用成对词语的相对概率来更新,并以共享的有界目标约束多条搬运路线,避免各条指令互相冲突。作者称,在四组师生模型和四个数学推理基准上,该方法持续优于采样式 reverse-KL OPD;把接收方换成随机词后,效果也会下降,说明“搬到哪里”确实重要。

第二篇 TV-OPD 则追问“搬多少”。作者发现,Token 级优势信号——类似逐字标记概率应升还是应降——只保留正负方向,也能达到与标准 OPD 相近的表现。于是他们用总变差(衡量两套概率分布整体差距)把信号限制得更平滑、更有界,并报告训练后期更稳定、波动更低。两篇论文合起来给出的判断很清楚:蒸馏不只是打分,关键还在概率往哪走,以及更新是否受控;第二篇摘要未披露具体增益数字。


供稿材料 SOURCES — 2

← 返回 2026-09-12 · 学术板块