Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 1 分钟

异步强化学习给旧数据系安全带

异步强化学习跑得快,却会混入旧策略数据;ESTR按模型犹豫程度动态划定安全范围。

像前台不停收答卷、后台同时修改评分标准,异步强化学习让 AI 一边生成尝试、一边更新模型,训练更快,但迟到的答卷可能来自旧版模型。更麻烦的是,一段很长的回答甚至会横跨多个模型版本。这样的过期数据若偏得太远,可能让训练失稳。

论文提出 Entropy-Scaled Trust Region(ESTR,熵缩放信赖域):不再用同一道门槛判断旧数据是否可信,而是看每个输出位置的熵——也就是模型当时有多犹豫。作者发现,传统方法容易保留低熵位置被放大的采样噪声,却误删高熵位置由模型更新带来的有效探索。ESTR因此按熵动态收紧或放宽安全范围,也不需要额外运行模型或识别版本切换。作者报告,在 BrowseComp-Plus 上,ESTR 的 avg@1 为 37.3,高于此前最佳异步方法的 34.9;这些效果目前来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块