你给两个 AI 同样的模型和差不多的算力。一个只直接回答,另一个能搜索资料、调用工具、保存中间步骤,再根据结果调整计划。即使它们的训练损失很接近,真正办事时也可能判若两人。
问题就在这里。传统 Scaling Law(扩展规律)主要研究:模型参数、训练数据和计算量增加后,预测误差会怎样下降。训练损失(Loss)就是衡量预测与目标相差多远的数字,通常越低越好。但模型被装进 Agentic Harness——负责整理上下文、调用工具、记录步骤和安排下一步的执行框架——之后,我们关心的不再只是它“猜下一个词有多准”,还包括它会不会推理、检索、规划和适应。
Syed Ali Raza Zaidi 与 Maryam Hafeez 的论文《The Capability Manifold and ML Scaling Laws》试图为这种变化换一套坐标系。两位作者提出 capability manifold(能力流形),也就是一张多维能力地图:把不同阶段投入的资源,与模型最终表现出的多种能力放在同一个框架里观察。需要先说明的是,目前证据全部来自这篇论文;作者把它称为一次“initial application”,文中没有给出可供独立核查的模型规模、基准成绩或拟合指标。
别再只盯着一个 Loss
过去的扩展规律,常把模型看成一条曲线:横轴是资源,纵轴是损失。Kaplan-type 和 Chinchilla-type scaling laws 都在处理这类关系,只是对模型参数、数据和计算量应如何搭配有不同描述。
能力流形把纵轴展开了。论文列出的能力包括知识、推理、规划、工具使用、记忆、适应和多主体协调。它们不是对“智能本质”的定义,而是操作性指标:例如,规划可以看成一串行动最终达成目标的概率;工具使用可以看成能否选对并正确调用外部工具;适应则看模型收到反馈后能否改善表现。
于是,一个模型不再只有一个分数,而有一组能力坐标。可以把它写成能力向量:
其中, 是资源向量,覆盖预训练、后训练和测试时资源; 则记录各项能力。说白了,传统做法像用“总分”评价学生,这篇论文想同时看数学、阅读、资料检索和项目规划,而且追问每门能力究竟受哪种投入影响。
同样加算力,可能长出不同能力
这套框架最关键的变化,是把资源按生命周期拆开。
预训练资源包括模型参数、训练数据和计算量。后训练则包括监督微调、偏好数据、反馈和优化计算。测试时资源发生在模型已经开始回答之后,例如给它更多推理步骤、重复采样、搜索机会、外部工具或更长的交互过程。
作者的判断是,不同投入即使都能改善某个汇总指标,也未必带来相同的能力变化。增加预训练资源,可能抬高基础能力;增加测试时搜索,则可能更多影响推理或解决任务的过程。不同能力也可能以不同速度增长,在不同位置趋于饱和,或者依赖多种资源的组合。
为表达这种关系,论文先把已有扩展规律转换成有界缩放函数。“有界”意味着能力不会随着资源增加而无限直线上升,而可以逐渐逼近上限。随后,框架为每项能力配置不同的资源权重,并允许资源之间出现交互。例如,某项能力可能既依赖模型本身,也依赖测试时搜索;两者一起增加时,效果不能简单拆成两项独立贡献。最后,作者使用 sigmoid——一条先慢、后快、再趋于平缓的 S 形函数——把中间结果映射成能力值。
这使 Kaplan 型、Chinchilla 型预训练规律以及 test-time compute(测试时计算)可以被表示为同一张能力地图上的不同轨迹。它们不是彼此取代的三条定律,而是不同资源配置沿着不同方向移动。
Jacobian 是一张“局部价目表”
论文还解析推导了 Jacobian(雅可比矩阵)。名字听起来很硬,其实它回答的是一个朴素问题:在当前资源配置附近,再增加一点某种资源,各项能力会变化多少?
可以把它写成:
每一项都表示能力 对资源 的局部敏感性。若某个方向的数值很小,意味着继续追加这项资源,对对应能力的边际帮助可能已经有限。框架还纳入资源交互,因此可以讨论“增加模型规模”和“增加搜索”组合起来时,能力轨迹怎样改变。
不过,这张“价目表”只在框架和既定函数附近成立。它描述数学模型中的局部敏感性,不等于已经测出了真实 Agent 的能力,更不能直接当成因果效应。
为什么这套坐标系值得看
它抓住了 Scaling Law 正在面对的对象变化。模型不再总以一个裸接口出现,而会被搜索、记忆、工具调用和多步执行包裹起来。如果仍只用训练损失比较系统,就可能把能力结构不同的模型压成同一个数字。
能力流形还提供了一种更贴近设计问题的问法:不是“怎样把损失再降一点”,而是“满足目标能力组合时,哪种资源配置成本最低”。论文据此讨论了几类可能用途:知识蒸馏可以被写成在削减模型资源时尽量保留指定能力;安全干预可以改变某些行为维度,同时约束其他能力;推理阶段则可以比较追加搜索与追加预训练资源,哪一种更合适。
这也是标题所说“开始衡量 Agent 能力”更准确的含义:研究的重心开始从单一损失转向多维下游能力。但论文讨论的是部署在 agentic harness 中的模型及其资源配置,还不能概括为已经找到了完整 Agent 系统的经验扩展规律。
局限与未知
- 论文没有披露具体实验基准、模型规模、数据规模、拟合优度或显著性结果,因此无法判断这套表示能否稳定预测真实系统。
- 文中的应用主要说明既有缩放关系可以被嵌入同一框架。“统一表示”不等于已经验证了一条新的 Agent 能力 Scaling Law。
- 能力坐标采用操作性定义,并非通用基准。如何可靠测量规划、记忆或协调,以及不同测量方式能否落在同一张地图上,仍是开放问题。