你让一个很能干的人独立修复软件故障,又让另一支同等预算的小组来做。小组可以分头查线索、互相挑错,但也要开会、同步进度,还可能把一个人的误判传给所有人。最后谁做得更好,不能只看人数。
一项发表于 Nature 子刊的研究,试图为 AI Agent 回答同样的问题。Agent(智能体)是能分解任务、调用工具、观察结果并继续行动的语言模型系统。多个 Agent 组队,可能获得更多思路,也会付出沟通和错误传播的代价。研究的核心发现是:判断组队是否有益,最可靠的线索不是“团队有几个人”,而是单个 Agent 原本已经有多强。
这一结论来自论文单一信源,具体数字尚未得到供稿簇内的独立交叉验证。
把人数之外的条件固定下来
过去比较单智能体与多智能体,容易碰到一个问题:团队往往同时得到更多计算资源、不同工具或不同提示。成绩提高后,很难判断究竟是协作有效,还是资源变多。
这项研究采用控制实验——一次只改变关心的因素。研究者保持任务提示、工具和计算预算不变,只调整协调结构与模型能力。他们测试了260种配置,覆盖六个基准、五种架构和三个大语言模型家族。
这里的“架构”可以理解为团队的组织方式:由一个 Agent 独立完成,或让多个 Agent 分工、讨论和校验。固定总预算尤其重要。它比较的不是“一个人对一群拥有更多工时的人”,而是同样一笔工时应该集中给一个强手,还是拆给一个团队。
研究还区分了静态题目和真正需要持续行动的任务。后者要求 Agent 多轮接触外部环境,在信息不完整时继续搜集线索,并根据反馈调整策略。例如,真实的软件工程不只是一次写出代码,还涉及浏览代码库、反复调试和修改方案。论文认为,静态代码题上随人数增长的成绩,并不能直接代表这类任务中的协作收益。
单体越强,协作空间越小
研究拟合了一个预测模型,用来判断多智能体协调会提升还是降低成绩。在六个基准的比较中,最稳健的预测指标是单智能体基线性能,也就是不组队时,一个 Agent 已经能做到什么程度。
直觉并不复杂。如果单体能力较弱,其他 Agent 可能补充不同方案、承担子任务或提供检查;如果单体已经能把上下文和行动过程处理得很好,团队可补足的空间就会缩小。此时,信息还要被压缩成 Agent 之间的消息,成员可能掌握不同的任务状态,沟通和同步也会占用预算。
论文据此识别出一个经验性的“能力饱和阈值”:当单智能体表现超过这条线,增加 Agent 通常不太可能继续提升性能。它在 SWE-bench Verified 和 Terminal-Bench 的验证配置中,以94%的准确率预测了多智能体协调会带来正面还是负面影响。
但这不是一条“模型够强就永远不必合作”的定律。论文把它明确解释为特定领域内选择架构的实用规则,而非普遍适用的扩展规律。94%也只来自上述两个基准的验证配置,不能外推到全部六个基准或所有任务。
团队也会放大错误
多智能体的另一个风险,是错误不会自动被多数意见消除。在需要连续操作的任务中,一个 Agent 的早期误判可能改变后续环境;其他 Agent 接手时,面对的已经是被改变过的状态。错误会沿执行链传播。
论文把相关现象称为“按基线缩放的错误放大”。该效应在采用聚类稳健推断后仍达到统计显著,,并支持论文提出的失败模式分类。不过,现有供稿没有展开分类内容,因此无法进一步判断不同错误分别由何种协调环节触发。
它给出的不是万能公式
这项工作的价值,在于把“要不要组队”从经验偏好变成一个可以测量的问题。论文的拟合模型在87%的留出配置中选出了最佳架构。这里的87%是架构选择命中率,不是 Agent 完成任务的成功率,也不是模型回答问题的准确率。
模型本身的解释力也有限。交叉验证的 为0.373;换用与任务相联系的能力指标后升至0.413。换句话说,它捕捉到了一部分稳定规律,但仍有相当多的差异没有解释。比起宣布“强模型不再需要团队”,更准确的说法是:单体能力越接近任务的饱和区间,协作越需要证明自己足以抵消沟通、重复劳动和错误传播的成本。
局限与未知
- 全部实验数字来自同一篇论文,尚无供稿范围内的外部复现;作者机构和260种配置在各基准间的分布也未披露。
- 经验阈值是领域内的选择规则。材料不足以判断它能否迁移到其他模型、任务、工具或计算预算。
- 预测模型的 最高为0.413,说明单智能体基线很重要,但不是决定协作成败的唯一因素。