你让一位助理完成一项复杂任务。除了助理本人的能力,任务清单怎么写、资料如何传递、出错后是否重试,也会直接影响结果。AI Agent也是如此:模型像助理,包在外面的执行框架则像工作手册。现在,一篇新论文尝试让Agent根据自己的工作记录,反过来修改这本手册。
这项工作叫 Recursive Harness Self-Improvement(RHI,递归式脚手架自我改进)。它值得关注,不只是因为脚手架改好后,Agent可能当场表现更好。更重要的是,Agent每次执行留下的记录,还可能成为训练未来模型的材料。脚手架因此不再只是模型外面的一层包装,而开始进入“运行、反馈、再训练”的闭环。
本文依据论文《Recursive Harness Self-Improvement》披露的信息。所有效果均来自作者在30个合成任务上的实验,目前没有第三方复现或生产环境证据。
改的不是模型,而是模型的工作方法
Agent脚手架(harness)是包在模型外面的程序,负责整理上下文、调用工具、检查结果和安排重试。它不等于模型,却会显著影响模型最终能做成什么。
例如,同一个模型处理一项研究任务时,脚手架可以要求它先列计划,再把不同子任务交给多个Agent,最后统一核对;也可以让它从头到尾独自完成。底层模型没有变化,实际表现却可能很不一样。
RHI把这套脚手架表示成一份“提示词层面的Agent循环说明”。换句话说,它没有直接修改模型参数,也没有声称Agent会改写任意程序代码。它调整的是一套可用文字表达的执行规则:Agent如何循环工作、怎样传递信息,以及如何组织上下文。
论文的方法是让脚手架查看自己的修订历史,并通过成对反馈继续迭代。所谓成对反馈,就是把两个版本放在一起比较,看哪个版本带来的结果更好。这个过程有点像修改工作流程:先比较两版操作手册,再把较好的做法带进下一版,而不是每次从空白开始设计。
“递归”也由此而来。脚手架参与任务执行,执行结果又成为修改脚手架的依据。作者希望只用少量更新轮次,就得到针对具体任务的改进,同时避免持续维护由模型提供方统一制作的脚手架所需的人力和计算成本。
少想一点,也可能做得更好
作者在30个合成的机器学习研究任务上测试RHI,任务来自 quantitative finance(量化金融)、robotics(机器人学)和 pharmacy(药学)三个领域。这里的“合成任务”意味着它们是为实验构造的任务,不能直接等同于真实机构中的研究流程。
按论文报告,经过少量RHI迭代,采用较低推理投入的Agent,其性能上限得到明显提高,甚至超过了对应的最高推理投入设置。推理投入可以简单理解为模型为一次回答分配多少思考与计算资源。这个结果若能成立,意味着提升Agent不一定只靠“让模型想得更久”,也可以靠重新安排它怎么工作。
成本结果也指向同一件事。论文称,RHI在最佳情形下可把推理成本降低最多60%。这个数字是“up to 60%”,不是平均降幅,更不能理解为所有任务都能稳定省下六成成本。材料也没有披露各项任务的完整成本分布。
作者进一步把性能提升主要归因于两点:更贴合任务的上下文管理,以及更有效的Agent间信息流动。上下文可以理解为模型当前能看到的任务说明、资料和中间结果。多个Agent协作时,如果关键信息没有传给下一位,或者无关内容塞得太多,再强的模型也容易走偏。论文的判断是,RHI主要改善了这种信息组织,而不是单纯生成更长的推理过程。
不过,现有材料没有给出支持这一归因的具体消融实验。消融实验是研究者逐项移除系统组件、观察性能如何变化的方法,用来判断提升究竟来自哪里。因此,“信息流比长推理更重要”目前应视为作者结论,而不是已经得到独立验证的普遍规律。
真正重要的是训练闭环
本刊此前介绍过TTHE:Agent可在测试时依据运行痕迹,改写负责工具调用、验证和重试的执行框架,但不改变模型参数。RHI又向前推了一步。它关注的不只是这次任务能否完成,还把脚手架视为训练数据的生产者。
Agent完成任务时会留下执行轨迹(execution trace),包括采取过哪些步骤、调用了哪些工具、遇到什么错误,以及怎样重试。这些记录如果被用于训练后续模型,那么脚手架决定的不只是眼前的答案,也决定未来模型会看到怎样的学习材料。
于是,一个更完整的循环出现了:模型能力影响脚手架如何设计;脚手架组织Agent执行任务;执行产生新的轨迹;这些轨迹又可能塑造后续模型。论文称之为 model–harness co-evolution,也就是模型—脚手架共同演化。
作者还用信息论假说来描述RHI的隐式优化目标。这里的“隐式”是说,系统未必直接写下一条简单规则来规定好脚手架是什么,而是通过版本比较逐步偏向更有用的信息组织方式。现有材料没有提供这一形式化假说的公式和推导,因此还无法进一步判断它解释了什么、又能预测什么。
RHI最有意思的地方,也正在这里。过去谈Agent改进,注意力通常落在模型是否更强、推理是否更长。论文把问题换成了:谁在安排模型工作,谁又在决定未来训练数据长什么样?一旦执行框架同时影响当前表现和未来数据,脚手架就从临时工具变成了学习系统的一部分。
局限与未知
- 实验只有30个合成任务。覆盖三个专业领域,不等于已经在真实金融、机器人或药学工作流中得到验证。
- 摘要没有披露“少量迭代”的确切次数,也没有给出具体指标、基线、方差和统计显著性;超过最高推理投入设置等结论仍需完整实验与独立复现支持。
- 论文所说的 continual learning(持续学习),更接近持续改进脚手架及其生成的轨迹。现有材料不足以说明模型会自行更新参数,也不能据此称Agent已经能够普遍“改造自己的代码”。