Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.066 — 2026-09-08
PAPER HF 9 约 6 分钟

RISE:模型给自己造老师

RISE沿模型自己的训练轨迹外推“未来老师”,把只判对错的奖励变成逐词指导。

你批改一份解题作业,只在末尾写“对”或“错”,学生很难知道究竟是哪一步出了问题。大模型的后训练也有这个麻烦:模型生成整段答案后,系统可以检查最终结果,却未必告诉它哪个词、哪一步推理值得保留。

RISE想做的,是让模型根据自己最近的进步方向,虚拟出一个“走得更远的自己”,再从这个合成老师那里取得逐词指导。这里的“老师”只是便于理解的说法,并非另造一个独立模型。论文报告称,这套方法不需要更强的外部教师,也不要求给教师偷看正确答案等额外信息。

只有分数,还不够会改错

大模型读完海量文本后,通常还要接受后训练——用任务反馈或示范,把它调整得更会解题、更符合要求。RISE关注其中一种方法:RLVR,即“可验证奖励强化学习”。模型先回答数学题、写代码或完成任务,系统再用可以客观检查的结果给分。

问题在于,这个分数很粗。一段回答有几百个生成位置,最终奖励却只有一个。论文指出,在常见算法中,同一回答里的各个词可能得到相同的优势信号。它能告诉模型“这条路结果不错”,却不能精确区分哪一步推理有用、哪一步只是碰巧没有坏事。

知识蒸馏可以补上这块。所谓蒸馏,就是让“学生”学习“教师”在每个位置给出的完整输出倾向,而不只抄最终答案。它像逐句批改,信号更密。但新的问题随即出现:老师从哪里来?

外部强模型可能不熟悉学生已经走到一半的陌生推理路径。让模型自己当老师、同时给它正确解答或环境反馈,又受限于模型能否真正利用这些额外上下文。RISE因此换了一个问题:与其忍受一个不合适的老师,能不能从训练过程本身构造老师?

把最近的进步,再往前推一步

训练会不断保存 checkpoint,也就是途中版本。RISE保留当前版本和一个较早的“锚点”,观察两者之间发生了什么变化,再沿同一方向向前外推。

可以把它想成在地图上看两次定位:较早的点是锚点,当前点是模型刚走到的位置。两点之间给出最近的行进方向。RISE不声称知道真正的终点,只是假设这段局部方向仍有参考价值,于是在前方放置一个合成教师。

外推有两种做法。一种直接在模型参数空间里移动,也就是沿权重变化方向构造教师;另一种在 output logit space 中操作。logit可以理解为模型在选择下一个词之前,为各种候选词打出的原始分数。后者放大当前版本相对锚点的概率变化,由此形成逐词目标。

关键不只在“往前推”,还在于方向由什么决定。RISE每轮先运行RLVR,让可验证的结果奖励推动模型更新;再沿这次更新外推教师,并用 on-policy distillation(OPD,在学生自己生成的数据分布上进行蒸馏)把教师的逐词分布教回学生。下一轮学生变强后,教师也随之刷新。

所以,它不是凭空自我暗示。结果奖励负责确认大方向,蒸馏负责细化每一个生成决定。论文还专门做了反例:若去掉RLVR,只沿自蒸馏产生的变化反复外推,训练在60步内崩溃,MATH-500准确率降至2.4%,回答长度从约2K膨胀到8K上下文上限,训练奖励归零。模型会放大自己的偏差,而不是自动找到正确方向。

反过来,直接采用外推后的权重也几乎没有稳定收益。在Qwen3-8B上,数学平均分只从GRPO的60.0升至60.3;Qwen3-1.7B则从45.4升至45.6。论文据此认为,真正有用的不是简单迈出更大一步,而是通过蒸馏把外推方向变成细粒度监督。

提升有多大?

论文在数学推理、多领域STEM、代码生成和多轮智能体任务上测试了RISE,模型规模覆盖1.7B至8B参数。结果显示,两种外推版本在各组实验中整体优于只做RLVR的GRPO,以及使用额外正确解答等信息的自蒸馏基线。

最显眼的结果来自竞赛数学。OLMo3-7B使用RISE的logit版本后,AIME 2024成绩从GRPO的30.2升至46.9,数学基准平均分从47.6升至56.4。Qwen3-1.7B的数学平均分从45.4升至50.2;Qwen3-8B的权重版本则从60.0升至62.7。不同空间没有始终胜出的一个,这反而支持了论文的核心判断:收益可能主要来自“沿训练轨迹外推教师”这个原则。

在数学与STEM混合训练中,Qwen3-4B-Base的权重版本把数学平均分从40.2提高到44.8,STEM平均分从45.5提高到47.5。多轮任务上,权重版本相对GRPO在ALFWorld提高9.4分,在WebShop准确率提高10.9分。

代码实验更克制:两种版本前期收敛更快,但最终准确率与GRPO相近。其中logit版本在第50步达到GRPO第90步的最终HumanEval+准确率。它更像节省训练进程,而不是抬高最终上限。

为什么值得现在看

RISE瞄准的是后训练里的一个硬约束:如果逐词监督必须来自更强老师,学生最终会被老师的能力和分布限制。它提供了另一条路——不预测标准答案,而是利用模型已经发生的、经奖励验证的更新,把稀疏的“结果对不对”重新组织成密集的逐词目标。

这也让蒸馏的角色发生变化。传统蒸馏常被视为一次性的能力转移或压缩;RISE则每轮重建教师,让教师随学生共同前移。实验中,它复用了RLVR已经采样的回答,因此没有增加采样成本;代价是多一次蒸馏梯度阶段和锚点计算,每轮墙上时间约为GRPO的1.3至1.6倍。

更重要的是,论文划出了边界:外推并非越远越好。模型接近较优状态时,安全范围会收窄,因此RISE让外推幅度随训练递减。这里的“递归提升”应理解为教师随迭代刷新,不能延伸为模型可以无限、自主地变强。

局限与未知

  • 这些结论均来自RISE论文自身。虽然论文给出多任务、不同模型和多随机种子的实验,但仍需要独立复现来确认稳定性与适用范围。
  • “不需要外部模型”只排除了外部教师和 privileged conditioning——即教师额外看到正确答案等学生不可见信息。它不等于训练完全不需要数据、奖励检查器或任务环境。
  • RISE依赖最近的更新方向确实代表进步。论文的崩溃实验已经表明,一旦没有可验证奖励提供方向,递归外推会放大错误;而且训练越靠后,允许的外推幅度越小。

供稿材料 SOURCES — 1

← 返回 2026-09-08 · 学术板块