像前台不停收答卷、后台同时修改评分标准,异步强化学习让 AI 一边生成尝试、一边更新模型,训练更快,但迟到的答卷可能来自旧版模型。更麻烦的是,一段很长的回答甚至会横跨多个模型版本。这样的过期数据若偏得太远,可能让训练失稳。
论文提出 Entropy-Scaled Trust Region(ESTR,熵缩放信赖域):不再用同一道门槛判断旧数据是否可信,而是看每个输出位置的熵——也就是模型当时有多犹豫。作者发现,传统方法容易保留低熵位置被放大的采样噪声,却误删高熵位置由模型更新带来的有效探索。ESTR因此按熵动态收紧或放宽安全范围,也不需要额外运行模型或识别版本切换。作者报告,在 BrowseComp-Plus 上,ESTR 的 avg@1 为 37.3,高于此前最佳异步方法的 34.9;这些效果目前来自论文自述。