同一道棘手的客户请求,Agent 今天解决了,明天却可能又从头摸索。这项工作给它配了一本“经验笔记”:底座模型的权重——训练后形成的内部参数——保持冻结,每次任务结束后,系统把成功、失败或事后纠正提炼成自然语言规则,存进外部记忆,遇到相似任务时再检索调用。这样,学习发生在模型之外,不必频繁重新训练。
作者在 τ-bench 的银行任务上测试了这套方法。作为对照的 Agent 已能检索约 700 份完整政策文件,因此新增收益主要来自经验记忆,而非补充资料。按作者报告,只给任务“成功或失败”这一比特的反馈,单次成功率便达到静态 RAG——即只从固定资料库检索信息——基线的 1.6 倍;若失败后再提供正确处理方式,则达到 2.6 倍,并解决了基线始终做不出的 84 项任务中的 22 项。结果也在第二个模型上复现。
更有意思的是,两种模型还能读取对方积累的记忆,并超过各自没有记忆时的表现。这说明经验有机会从单个 Agent 的临场所得,变成可共享的组织知识。不过,这些效果目前来自论文所设银行基准,能否在更杂乱的真实部署中长期保持,材料尚未给出答案。