你让一个人形机器人搬起箱子,它不能只把手伸出去。双腿要站稳,躯干要配合转动,手臂还得及时响应指令。任何一处慢半拍,整套动作都会变形,甚至失去平衡。这就是人形机器人的全身控制:腿、躯干和手臂不是各管各的,而要作为一副相互牵连的身体协同运动。
一篇 7 月 16 日提交至 arXiv 的论文,把基础模型常见的规模化问题带到了这里:如果增加动作数据、训练采样和模型容量,机器人的控制能力会不会稳定提高?作者提出一套 Behavior Foundation Model(行为基础模型,简称 BFM)缩放方案,并在仿真和真实世界部署中报告了更低的动作误差。不过,现有证据全部来自论文作者,尚无外部复现;论文材料也不足以证明严格意义上的“缩放律”。更准确地说,这项工作展示了一条有潜力的缩放路线。
不是把模型做大就够了
BFM 可以理解为机器人的通用动作底座。它从大量动作记录中学习可复用的行为,再根据指令或场景调用。它和语言基础模型的角色有些相似,只是输出不再是文字,而是身体动作。
问题在于,机器人控制不是单纯的模式识别。模型既要知道一个动作大致长什么样,也要在连续执行中维持整副身体的协调,还要及时纠正偏差。论文关注的因此不是某一个模型尺寸,而是三个因素怎样配合:学习任务如何定义、训练时生成多少实际执行轨迹、参考动作有多丰富,以及模型架构能否随规模增长。
作者的核心判断是,这些部分不能各自扩张。只有把学习范式、数据与训练采样、模型架构放在一起设计,扩大投入才更可能转化为控制能力。
先把不同任务翻译成同一种练习
第一步是运动跟踪。简单说,就是给机器人一段参考动作,让它尽可能准确地复现。论文把多种人形机器人控制问题重新表述为:在全局坐标框架中,重现一套完整的全身行为。
这个角度的价值在于统一。原本看起来不同的任务,可以被翻译成同一种练习:机器人现在的身体状态,与目标动作之间还有多大差距,下一步应该怎样调整。这里的“全局框架”强调完整动作在整体空间中的复现,而不只是分别对齐局部关节。
不过,供稿没有披露具体任务清单,也没有进一步说明这种统一表述适用于哪些控制场景。因此,我们能确认的是作者采用了这一学习范式,不能据此推断它已经覆盖一般意义上的人形机器人任务。
训练轨迹和动作菜单要一起增加
第二步涉及 on-policy rollout。这个术语指模型按照自己当前的策略实际运行,生成一批训练轨迹。它有点像练习骑车:只看标准动作不够,还要真的骑起来,观察自己会在哪里偏离,再据此调整。
论文强调,rollout 的数量要与参考动作的多样性形成配合。参考动作像训练菜单,决定机器人见过多少种行为;rollout 则记录模型面对这些动作时实际做成了什么样。只增加前者,模型未必学会处理执行中的偏差;只增加后者,也可能只是在有限动作上反复练习。作者认为,两者协同扩展是性能提升的关键组成部分。
供稿没有给出 rollout 数量、参考动作规模或二者的配比,也没有提供跨数量级的对照结果。所以这部分更像一条经过实验支持的设计原则,而不是已经公开了精确公式的规模规律。
Humanoid Transformer 承接更大的训练规模
第三步是 Humanoid Transformer。Transformer 是一种能够处理序列关系的模型架构;放到机器人控制中,它面对的是随时间连续变化的身体状态与动作。作者将这套面向人形机器人的架构描述为可扩展,并称其会“自然涌现”结构化的行为表征。
所谓行为表征,是模型在内部形成的动作组织方式。它不只是记住某个姿势,还要把身体各部分及前后时刻的关系编码出来。不过,“自然涌现”是作者的概括性表述。现有材料没有展示这些内部表征的分析方法,也没有说明结构化具体体现在哪里,因此暂时不能把它当成独立验证过的结论。
两个误差降幅说明了什么?
论文使用 Mean Per-Keypoint Position Error(平均关键点位置误差,MPKPE)衡量动作复现的准确度。直观地说,它计算机器人若干身体关键点与目标位置之间的平均偏差;数值越低,说明动作跟踪越接近参考。
据论文报告,在测试集的 local mode 下,这套方法相比现有人形机器人控制器将 MPKPE 降低超过 10%;在 global mode 下,相对降幅为 82%。作者还报告,方法经过仿真实验和真实世界部署验证,并提升了控制保真度与任务泛化能力。行为泛化指机器人不只背下训练动作,而能把学到的能力迁移到新指令、新环境或新的身体状态。
其中,82% 是相对误差降幅,不能直接改写成“总体性能提升 82%”。供稿没有解释 local mode 与 global mode 的定义,也没有列出比较对象、MPKPE 绝对值、误差区间、样本规模和统计显著性。两个数字显示结果差异很大,但还不足以判断这种优势在多广的任务范围内成立。
真正值得追问的是可预测性
这项工作的意义,不只在于又做出了一个误差更低的控制器。它提出了一个更重要的问题:人形机器人的行为能力,能否像部分基础模型那样,随着数据、模型和训练计算增加而呈现可预测的改善?
严格的缩放律需要说明规模与性能之间是否存在稳定的函数关系,例如跨多个数量级实验并进行规律拟合。现有材料只表明,作者协调三项核心要素后获得了明显提升,并称 Humanoid Transformer 能随规模扩展。论文没有在供稿中展示规模—性能曲线、幂律拟合或跨数量级证据。因此,“人形机器人也有缩放律”目前更适合作为研究假设,而不是已经确立的规律。
但这条路线仍值得关注。如果未来研究能证明,增加动作多样性、训练轨迹和模型容量会以稳定方式改善行为泛化,那么研发者就不必只靠逐项试错,而能更有根据地判断下一份数据和下一轮计算是否值得投入。这也是基础模型思路进入机器人控制后,最有价值、也最需要验证的部分。
局限与未知
- 全部效果来自同一篇 arXiv 论文,尚无外部复现、第三方评测或同机构之外的交叉印证。
- 供稿未披露具体基线、实验规模、绝对误差、统计显著性,以及 local mode 和 global mode 的定义,两个降幅只能按作者报告理解。
- 真实世界部署的平台、任务范围、安全性和泛化边界没有交代;现有结果不能证明系统已经具备通用人形机器人控制能力。