你让两名学生解同一道题。一个用十行答对,另一个绕了上千行却答错。批改规则只看最终答案,但训练时还要决定:这两份答案各该影响模型多少。按篇幅平均,可能扭曲原本的奖惩;不按篇幅平均,长答案又可能凭字多获得更大话语权。
这正是 Fei Ding、Yongkang Zhang、Yuhao Liao、Zijian Zeng 与 Huiming Yang 研究的问题。他们讨论 GRPO(Group Relative Policy Optimization)——让模型一次生成一组答案,再按组内相对得分更新的强化学习方法。强化学习可以理解为用奖惩训练习惯:模型得到分数后调整自己,让高分行为以后更常出现。
论文的结论很直接:在标准的“结果奖励 + GRPO”设定中,只靠回答长度设计权重,无法同时做到梯度无偏和长度不变。前者要求训练更新平均而言忠实反映原目标;后者要求一条回答的贡献不因 token 数量——模型处理文本时的基本单位——而改变。两件看似都公平的事,在这里互相冲突。
本文所有结果与数字均来自这篇 arXiv 论文,尚无独立信源交叉验证。
两种公平,为什么会打架?
结果奖励(outcome reward)只看最终答案是否正确,不逐步评价中间推理。它容易执行,却无法指出推理链中究竟哪一步有用。论文把一次回答看成一条“轨迹”,其中每生成一个 token,都会留下一个影响模型更新的信号;整条轨迹的信号再汇总起来。
问题出在汇总方式。
GRPO会按每条轨迹的长度做归一化。说白了,一篇一千字的回答先除以一千,一篇十字的回答先除以十,尽量让两者的总贡献处在相近尺度。论文称,GRPO因此近似满足长度不变性 P2,但它改变了原始策略梯度——也就是模型本应沿哪个方向调整——所以不满足梯度无偏性 P1。
Dr. GRPO走向另一端。它移除逐轨迹长度归一化,并曾把由此得到的优化器称为“unbiased”。本文确认:在论文的设定与假设下,它确实满足 P1。但移除归一化后,每个 token 的信号直接累加,长回答便可能仅凭包含更多 token,对更新产生更大影响,因此不满足 P2。
这像两种计票方法。按每份答卷平均,答卷无论长短都只有一票,但会改动逐项计票本来的总和;逐项原样相加,保住了总和,却让项目更多的答卷天然拥有更多票。这里没有一种只看长度的换算方式,能同时保住两套规则。
不可能性到底证明了什么?
论文把长度为 的权重写成 。证明的关键分两步。
第一,如果要求 P1,那么在其政策类别与固定长度可实现等假设下,必须是常数。否则,不同长度会以不同倍数改写原本的策略梯度,更新便不再无偏。
第二,如果固定训练信号下,一条轨迹汇总后的典型规模确实随长度变化,那么要满足 P2,就必须随长度调整。常数权重无法抵消这种变化。
于是矛盾出现了:P1要求权重不随长度变,P2又要求它随长度变。论文由此证明,两者不能同时成立。
作者进一步用一个参数族描述中间地带:
当 时,它对应 GRPO;当 时,对应 Dr. GRPO;介于两者之间,则同时接受一部分梯度偏差和一部分长度依赖。论文称,梯度估计偏差与 成比例,长度偏差与 成比例。重点不是找到了一个万能参数,而是把原先“哪个算法修对了”的争论,改写成“训练时愿意承担哪种代价”。
长答案能占多大便宜?
论文用二元结果奖励举例:同一道题生成两条回答,一条正确、一条错误。在 Dr. GRPO 下,若两条轨迹的长度比为 ,长轨迹占据的梯度规模份额为:
长度比为 2:1 时,长轨迹占 66.7%;10:1 时占 90.9%;100:1 时占 99.0%。GRPO在这个例子中则让两者各占 50%。
论文还给出一个极端案例:正确回答长 10 tokens,错误回答长 10,000 tokens。在 Dr. GRPO 的单步分析里,后者几乎淹没前者的强化信号;在 GRPO 下,两者贡献仍各占一半。这不等于现实训练必然按同样比例演化,因为最终行为还受裁剪、学习率和多步优化影响,但它把长度不平衡可能有多强展示得很清楚。
作者另引述 Liu 等人的数据:DeepSeek-R1-Zero正确答案平均为 4,965 tokens,错误答案平均为 8,206 tokens。按本文推导,在相应的两轨迹 Dr. GRPO 情形中,较长的错误轨迹约占 62.3%的梯度,而不是均衡的50%。这是基于论文假设的计算,不是对完整训练过程的实测结论。
为什么值得现在关注?
GRPO被用于 DeepSeek-R1;Dr. GRPO发表于 COLM 2025。论文还称 GRPO是训练大语言模型推理能力的主导强化学习算法,但材料没有提供采用率或市场份额,因此这一概括仍需谨慎看待。
更重要的是,这项工作动摇了一个很自然的期待:只要把“偏差”修掉,算法就会得到唯一正确的版本。论文认为,GRPO与 Dr. GRPO并非“错误”和“正确”的关系,而是在两个合理目标之间选择了不同位置。
这也让训练策略更具体。回答长度差异小时,两端的区别可能很小;差异很大时,权重选择会明显改变谁主导更新。作者没有提出新算法,只建议根据训练阶段和长度分布选择 :更担心长轨迹支配更新时靠近 GRPO,更在意梯度无偏时靠近 Dr. GRPO,甚至可以随训练阶段调整。
局限与未知
- 定理只覆盖标准结果奖励、组均值基线及仅依赖长度的权重。依赖 token 位置、上下文、梯度几何或更细粒度信用分配的方法不在排除范围内。
- 过程奖励会给不同推理步骤不同信号,结构不再相同;论文没有证明此时仍然不可兼得。
- 分析聚焦单步梯度估计。长度偏差如何经过裁剪、学习率和多步训练转化为模型行为,仍需进一步验证。