Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.079 — 2026-09-21
PAPER H 10 · HF 28 约 1 分钟

别把环境反馈从Agent训练里抹掉

让Agent连环境反馈也学着预测,会改变强化学习后的探索方式。

你让 AI 在终端里执行一条命令,屏幕随后返回结果。通常训练只批改它写出的命令,不批改它能否预判屏幕会出现什么。这篇论文挑战了这个惯例:环境反馈虽然部署时不用 Agent 生成,却可能帮助它理解“做这一步会发生什么”。

作者提出 ActObs,只改训练时的“损失掩码”——也就是决定哪些 Token(模型处理信息的基本小块)需要计错的规则,把轨迹中已有的环境观察也纳入监督,不增加数据、参数或计算轮次。两种方法在监督微调后表现接近,但经过 GRPO(一种按任务成败继续训练策略的强化学习方法)后开始分化。作者报告,在 Qwen3-4B 上,ActObs 在 Terminal-Bench 2.0 的各个采样次数下都更强;单次成功率为 7.2%,传统方案为 5.6%。在 Qwen3-8B 上,它牺牲了一些单次稳定性,却把 16 次尝试内的成功率提高了 3.4 个百分点。

论文的关键解释是:学习预测环境后果,让模型在强化学习中保留了更多不确定性,因此命令参数、选项和路径仍有更多候选可试。换句话说,训练起点看似差不多,却会把 Agent 带向不同的探索方式;这些结果目前来自作者在终端与代码编辑任务上的实验。


供稿材料 SOURCES — 1

← 返回 2026-09-21 · 学术板块