你先让一个学生读很多棋谱,再教他写出思考过程,最后按解题成败给奖励。等他棋力提高,功劳该算给哪一步?过去,大模型的推理进步常在强化学习阶段被观察到,但强化学习接手的从来不是一张白纸。《Understanding Reasoning from Pretraining to Post-Training》把问题往前推了一步:后训练究竟创造了多少能力,又只是把预训练留下的潜能调动出来多少?
论文用国际象棋搭了一个受控实验场。国际象棋的合法动作明确,答案可以核验,研究者也能逐步查看模型怎样改变选择。相比自然语言里庞杂而难追踪的数据,这更像一间能控制教材、课时和考试题的教室。本文的结果与数字均来自论文单一信源,尚无独立复现材料。
把三段训练放在同一张图里
预训练(pretraining)像让学生先广泛阅读:模型从大量材料中学习常见模式。研究团队收集了 Lichess 在 2022 年产生的 Blitz 和 Rapid 人类对局,组成一个 540 亿 token 的语料库。token 是模型处理信息的基本片段;在这里,棋步被拆成一串 token。团队训练了从 500 万到 10 亿参数的模型。参数可以粗略理解为模型内部可调的“记忆旋钮”。
接下来是监督微调(supervised fine-tuning,SFT):研究者直接提供示范,让模型学会针对棋题给出推理轨迹和答案。这里的推理不是自然语言自言自语,而是若干可能的棋局延续。模型先展开候选走法,再提交最终选择。论文比较后发现,只教目标走法能改善第一次作答的正确率,却没有改善多次尝试时的答案覆盖;加入合成推理轨迹,则能改善论文采用的各项 pass@ 指标。pass@1 指模型一次作答成功的比例,pass@8、pass@16 则考察多次采样中是否至少出现一次正确答案。
最后才轮到强化学习(reinforcement learning,RL)。它根据行为得到的奖励调整策略,让高回报行为以后更容易出现。模型面对棋题时,每一步都必须与标准解法一致;任何一步走错,整条轨迹的奖励就是零。研究者使用了 15.6 万道经过质量筛选的训练棋题,并用 1480 道互不重叠的战术题评估模型。整个实验覆盖 36 种预训练与 RL 组合,目的不是造出最强棋手,而是观察训练阶段之间怎样接力。
预训练不只决定起跑线
最重要的发现是:在给定 RL 计算投入时,RL 之后的表现可以由预训练损失较好地预测。预训练损失是模型预测训练数据时的误差指标,通常越低,说明它越能把握数据规律。换句话说,强化学习并没有抹平起点差异。预训练学得更扎实的模型,经过相同数量的 RL 计算后,通常仍然更强。
预训练还与“学习速度”相关。论文在尚未饱和的局部训练区间里发现,RL 奖励曲线的斜率与预训练 token 数量呈近似线性改善。说白了,读过更多棋谱的学生不只是起点高,接受奖励反馈时往往也进步得更快。模型规模还有较弱的正向修正,但作者强调,这只是所研究计算区间内的经验趋势,不是放之四海而皆准的定律。
这也改变了如何分配计算投入(compute)的讨论。计算投入指训练使用的运算资源总量。预算较小时,实验中的最佳方案倾向先把模型的基础打牢:太早从较弱的预训练检查点转入 RL,多出的 RL 计算不足以弥补较差的初始化。随着总预算上升,继续预训练的边际收益下降,更大的计算比例才适合交给 RL。论文据此拟合了一个贯穿预训练与 RL 的缩放关系,但没有给出一条可直接套用到所有大模型的固定配方。
RL既会放大,也会“捞出”答案
另一个问题更接近争论的核心:RL 到底只是把模型原本偏爱的答案推得更高,还是能找到原先几乎不会选择的答案?
论文的回答是:两种情况都有,而且取决于题目难度。在简单棋题上,RL 主要放大 SFT 策略已经偏好的正确走法。这很像学生本来就倾向选对,奖励只是让他更坚定。
在困难棋题上,RL 有时会把 SFT 阶段处于低概率尾部、几乎不出现的正确走法推到前列。这说明“模型原先最常给出的答案里没有它”,不等于强化学习永远找不到它。但论文同时观察到另一面:RL 也会强化错误走法。它不是一台只负责发现真理的机器,而是在重新分配选择概率;奖励信号可能捞出被埋住的正确答案,也可能把错误偏好固化。
这解释了论文里一个看似矛盾的现象:RL 能持续改善 pass@1,却不总能改善 pass@16。它可能让第一次作答更准,同时压缩答案的多样性。推理轨迹分析也显示,模型在 RL 后更擅长提出和筛选候选走法,但搜索主要变宽,没有明显变深;面对需要超过 5 步延续的棋局,它仍然吃力。
为什么值得关注
这项工作的价值,不是宣布“推理来自预训练”或“推理来自 RL”,而是把二选一改成了可测量的连续问题。预训练决定了模型拥有什么样的起点,也影响它能从后续奖励中学得多快;RL 则会按题目状态重新整理这些可能性,有时放大已有优势,有时让低概率正确答案浮出水面,也可能放大错误。
团队还做了一次有限的跨领域检查:他们在数学领域文本上训练一个 10 亿参数的 OLMo-2 模型,从 100 亿到 2000 亿预训练 token 之间取出 14 个检查点,再进行 SFT 和 RL。结果出现了相似模式:预训练更久的检查点在相同 RL 计算下表现更高,RL 阶段提升也更快。这让国际象棋中的观察多了一层现实关联,但还不足以证明它适用于所有模型和推理任务。
局限与未知
- 主要证据来自国际象棋。它的动作空间清楚、奖励可验证,和开放式语言推理仍有明显距离。
- 数学实验只涉及一个 10 亿参数模型及特定数学文本与题集,不能据此外推到不同规模、数据分布和任务。
- 全部效果论断来自论文自身。材料未提供误差范围及部分拟合指标;“近似线性”和“较好预测”应理解为局部经验关系。“几乎不出现的正确走法”也不等于模型此前完全没有这项能力,更不能单凭这一点断言 RL 创造了全新知识。