Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER 约 1 分钟

GRPO开始对抗分布坍缩

ReCo给GRPO的热门答案降权,尽量留住少见但正确的推理路径。

像学生刷题时只背最顺手的一套解法,AI也可能越训练越偏爱少数答案。GRPO(让模型为同一道题生成一组答案,再按组内表现更新的强化学习方法)虽能提高常见正确答案的命中率,却可能把概率进一步挤向这些答案,使少见但正确的推理路径更难被抽到。ReCo正是给这种“分布坍缩”打补丁。

它在两个位置重新分配训练权重。答案层面,某条回答原本越容易生成,就越可能在一组样本中反复出现、主导更新;ReCo按其预期出现次数降权,并用长度归一化后的生成概率,减少长答案天然概率较低带来的偏差。词元层面,它也不再继续放大已经占优的选择,而把更多更新留给仍有多种选择的分岔点。作者在三个模型、五个数学推理基准上的实验称,ReCo在较大的 Pass@k——尝试 k 次、至少答对一次的概率——上优于 GRPO,小 k 时则表现相当。这意味着它试图提升常用解法的同时,不把基础模型原有的解题可能性过早剪掉。


供稿材料 SOURCES — 1
01
ReCo: Reweighting GRPO Against Distributional Concentration arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-02 · 学术板块