你请同一个人做事,换一套工作流程,结果可能完全不同。AI Agent也是如此:模型没有变,但如果工具怎么调用、出错后怎么恢复、什么时候交付都安排得更合理,表现也可能明显改善。上海人工智能实验室团队提出Self-Harness,尝试让模型根据自己的失败记录,修改并验证包在模型外面的运行框架。
这项工作的意义在于,它把Agent调优的对象从模型本身扩到了Harness。需要先说明的是,目前材料只有量子位一篇二手报道,所有技术结论均来自这一独立信源;尤其是“提升104%”,原始分数和计算口径尚不清楚。
先找错,再改工作流程
Agent Harness——也就是包在模型外面的运行装置——负责系统提示词、工具调用、文件访问、状态管理和权限控制。我们7月17日报道Grok Build开源时介绍过这个概念。这次的新意不是公开Harness,而是让系统自己搜索和验证修改。
据量子位报道,Self-Harness分三步运行。
第一步是Weakness Mining,即“挖弱点”。系统让固定模型完成一批任务,记录运行轨迹——Agent做过的判断、工具调用及其结果。它再结合验证器反馈,从失败中归纳重复出现的机制,例如反复执行无效命令、工具报错后没有恢复,或一直探索却迟迟不提交产物。
第二步是Harness Proposal。同一个模型针对这些弱点提出修改,但不能随意重写整个系统,只能改动预先声明的范围。每项提案还要说明想改变什么行为,以及可能造成什么退化。
第三步是Proposal Validation,也就是用回归测试拍板。回归测试会重跑既有任务,检查新修改是否修好问题,又破坏了原本能力。候选方案只有在held-in或held-out至少一组任务上提升、另一组不退化时,才会被保留。held-out指调优时没有直接使用的测试任务,用来观察改进能否迁移到未见样例。
这像是让员工自己复盘并修改操作手册,但新版手册必须通过考试,不能只靠本人觉得“应该更好”。
同一套药方并不适合所有模型
量子位称,在Terminal-Bench-2.0上,团队保持底层模型、工具环境和评测协议不变,只修改Harness,MiniMax M2.5、Qwen3.5-35B-A3B和GLM-5最终都获得held-out提升。
Self-Harness给三种模型留下的改动也不同。MiniMax M2.5的问题偏向“找到线索却不及时交付”,因此修改强调尽早创建必需产物,并从长时间调用转向实现和验证。Qwen3.5-35B-A3B容易在工具失败后循环,改动集中于依赖预检查、避免重复执行相同命令,以及恢复必需文件。GLM-5则更需要管理shell——也就是命令行环境——的状态,并及时从探索转入实现。
这说明Self-Harness并非给所有模型追加同一段提示词,而是根据各自的失败轨迹提出不同修补方案。
为什么值得关注
过去,Harness主要靠工程师手工调试:读轨迹、找原因、改提示词或工具规则,再跑评测。Self-Harness把这套经验活整理成了一个闭环:模型参与找错和提案,benchmark回归测试负责筛选。
量子位报道的汇总数字分别是MiniMax M2.5提升28%、Qwen3.5-35B-A3B提升104%、GLM-5提升24%。但报道没有披露基线、最终分数、计算公式、迭代次数、样本量或显著性,因此“104%”可能是相对增幅,不能理解成提升104个百分点,更不能直接等同于模型整体能力翻倍。
真正值得看的不是一个醒目的百分比,而是调优思路的变化:不换模型,也可以系统地搜索外层运行流程。论文和项目代码据报道已经公开;Harrison Chase曾转发该工作,Lilian Weng也将其收入自进化Agent相关博客,但这些传播事实并不构成独立技术验证。
局限与未知
- 现有证据主要来自Terminal-Bench-2.0,不能外推为通用Agent能力提升。
- “不换模型”只表示固定模型后端,不代表训练、推理或搜索成本没有增加。
- 这里的“自我进化”有明确边界:系统只能修改预先开放的Harness部分,最终仍由回归测试决定是否采用。