Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER H 19 约 1 分钟

训练推理模型,算力该投向哪一步

先少量试答,再把算力追投给更有学习价值的题目,最高省下约57%轨迹。

训练推理模型,有点像给学生安排练习:如果一道题每次都答对或都答错,继续做许多遍,得到的新信息往往有限。问题是,常用的 GRPO——让模型对同一道题生成一组回答,再按组内表现更新——通常给每道题相同次数的尝试,算力也就花得不够精细。

Jiang 等人提出 VIGOR。它先让每道题生成少量 rollout(一次包含推理过程和答案的完整尝试),再观察同组答案的奖励方差,也就是结果有多大分歧。分歧越大的题,说明模型正处在“有时会、有时不会”的位置,系统便继续给它追加尝试,直到用完固定预算。这样无需先大量生成再筛选,也不改变原有 GRPO 训练框架。

作者在数学与编程任务上的实验称,VIGOR 达到目标数学准确率时,rollout 效率最高提升 2.3 倍,相当于少用约 57% 的生成轨迹;这提示后训练省钱的关键,未必只是少算,而是把计算留给仍能提供有效反馈的题目。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块