一次长推理答对了,奖金该发给哪一步?平均分看似公平,却可能错过真正改变结果的岔路。强化学习可验证奖励(RLVR——按最终答案是否正确打分)正面临这个信用分配难题:只知道结局,不知道中间哪一步值得奖惩。
论文提出 EAPO,借助策略熵——模型生成下一个词时的犹豫程度——重新分配奖励。它不把犹豫一概视为好或坏:答案正确时,更奖励高熵步骤,让偶然走通的探索路线变得稳定;答案错误时,更重罚低熵步骤,纠正模型深信不疑却反复出错的路径,同时少罚仍有其他可能的岔路。
最具体的依据来自一次重采样实验。作者在 Qwen3-4B/8B-Base 各选取 20 道数学题,从高、低熵的连续 32-token 区间前重新生成 64 次。以 8B 为例,原本答对的推理从低熵区间续写,正确率为 0.625;从高熵区间续写仅为 0.418。原本答错时则相反:高熵区间续写的正确率为 0.159,低熵区间只有 0.032。换句话说,犹豫后的成功不易复现,但犹豫中的失败仍可能翻盘。作者称 EAPO 无需额外模型或监督,并在多类推理任务上取得最佳综合表现;这些效果仍以论文自述为准。