Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
PAPER HF 7 约 7 分钟

世界动作模型开始拆分模态

ModAR 把机器人未来拆成运动、语义和几何再规划动作,RGB 不再是唯一答案。

世界动作模型开始拆分模态

你让机器人把几个碗叠起来,它不能只认出“这是碗”。它还得判断碗离机械臂多远、正在往哪里移动,以及下一步动作会把场景变成什么样。过去,世界动作模型常把这些问题统统压进未来的 RGB 画面里:先想象一段彩色视频,再据此决定动作。新论文提出的 ModAR 换了一个思路。它先后预测点如何移动、场景有什么、物体有多远,最后才生成机器人动作。

这项工作值得看,不是因为它已经证明 RGB 应当退出世界模型,而是因为它认真追问了一个更基础的问题:机器人想象未来时,究竟应该想象什么?目前全部效果都来自论文作者的实验,尚无第三方复现;文中的领先性结论也应按这个范围理解。

别把所有未来都画成彩色视频

世界动作模型(World-Action Model,WAM)同时学习两件事:环境接下来会怎样变化,以及机器人应该采取什么动作。它像是一边预演未来,一边安排动作。

多数 WAM 用 RGB 表示未来,也就是预测由红、绿、蓝三种颜色通道组成的画面。这个接口很直观,也方便承接视频生成模型。但像素会把大量精力花在外观细节上,而机器人操作还关心另外三类信息:

  • 点轨迹(point tracks):画面中特定点随时间如何移动,突出运动和对应关系。
  • DINO features:预训练视觉模型 DINO 提取的内部数字表示。它舍弃部分像素细节,更侧重物体语义和场景结构。
  • 深度图(depth maps):画面各处离相机有多远,直接表达空间几何。

同一个拿瓶子的场景,RGB 告诉模型瓶子长什么样;深度告诉它瓶子在哪里;点轨迹告诉它瓶子正在往哪儿走;DINO 特征则提供较稳定的物体与场景线索。ModAR 的核心判断是:这些表示不必同时混在一起猜,也不必都还原成彩色画面。

像接力一样预测未来

ModAR 采用“自回归去噪”。自回归,就是按既定顺序逐项生成,后一项可以参考前面的结果;去噪,则是从被扰乱的表示逐步恢复目标。可以把它理解成一场接力:每一棒完成一种未来表示,再把结果交给下一棒。

论文采用的顺序是:点轨迹 → DINO 特征 → 深度 → RGB → 动作。作者把更紧凑、更结构化的表示放在前面,把细节更多的表示放在后面。动作最后生成,因此可以参考此前得到的全部未来信息。最后这一步相当于“逆动力学模型”——从预测出的场景变化反推,要造成这种变化应该执行什么动作。

模型内部用同一套主干处理各类信息,再用面向不同模态的小型模块分别输出结果。训练时,它会故意给较早生成的模态加入噪声。原因很实际:推理时,前一步的预测不可能永远正确;如果模型训练时只看完美答案,早期的一点误差就可能沿着接力一路放大。

消融实验支持了这两个设计选择。在包含 250 条示范的数据规模上,完整模型的平均成功率为 75%;取消这种“上下文噪声”后降至 63%。把顺序反过来,先生成 RGB,再生成深度、DINO 和点轨迹,成功率降至 65%。不过,论文只测试了这一种反向顺序,尚未系统比较所有排列。

RGB 在这里没有成为关键一棒

模拟实验覆盖六项 RoboTwin 任务,每项保留 50 条带动作标签的机器人示范,再加入不同数量的不带动作标签示范。所谓“不带动作标签”,就是只有场景变化,没有机器人该怎么动的标准答案。它不能直接教动作,却仍能训练模型预测未来。

论文实验显示,在三种数据规模下,ModAR 的总体平均成功率分别为 66%、75% 和 76%,均高于同一套实现中的其他 WAM 组织方式。增加 1200 条无动作示范后,ModAR 从 66% 提升到 76%;对照方法 Unified 只提高了 1 个百分点。作者据此认为,顺序生成能更充分利用没有动作标注的数据。

不同模态的对照更能说明论文标题中的“拆分”。在最大数据规模上,依次加入点轨迹、DINO 和深度后,平均成功率达到 77%;再加入未来 RGB,结果为 76%。在 250 条示范的设置中,两者都是 75%。逐项移除实验里,拿掉点轨迹、DINO 或深度,成功率分别降到 61%、65% 和 70%;拿掉 RGB 则仍为 75%。

这不能推出“RGB 对机器人无用”。更准确的结论是:在这篇论文的任务、数据和训练设置中,点轨迹、DINO 特征与深度提供了互补信息,而额外预测未来 RGB 没有带来稳定收益。作者推测,RGB 引入了变化很大的外观细节,却没有补充足够的新信息。

小模型比较也要看清边界

论文还把从零训练的 3010 万参数 ModAR,与由视频模型初始化、拥有 60 亿参数的 Flex-π 放在相同数据上比较。观察到的平均成功率分别是 75% 和 72%。ModAR 不需要预训练,训练 FLOPs——训练中浮点计算量的粗略计数——约为 Flex-π 的二十分之一。

这个结果说明,在这些分布内任务上,更大的视频模型并非唯一可行路线。但它不是严格的架构对照:两者的规模、预训练、预测目标和训练配方都不同。论文摘要也没有给出这组 75% 对 72% 的方差、置信区间或显著性,因此更适合说“观察值略高”,不能据此确认稳定领先。二十分之一的 FLOPs 也不宜直接解释成完整生命周期成本低二十倍。

真机结果给出另一条线索

在叠杯子、折叠揉皱的毛巾,以及把物体放入抽屉后关上抽屉这三个双臂任务中,ModAR 不再预测 RGB,只使用点轨迹、DINO 和深度。每项任务有 100 条遥操作机器人示范;评估时,每种方法在每项任务上运行 30 次。

论文报告,ModAR 的总体成功率为 83.3%,Unified 为 66.7%,只预测动作的基线为 52.2%。加入每项任务 200 条同域人类示范后,ModAR 从 70.0% 提升到 81.1%;再加入 1000 条域外 EgoDex 示范,升至 83.3%。这显示了拆分模态的另一个潜在价值:即使人类视频没有机器人动作标签,模型仍可从场景运动、语义和几何变化中学习。

为什么值得关注

ModAR 真正改变的不是某个模块,而是世界模型的表示顺序。过去常见的问题是“怎样把未来视频生成得更好”;这篇论文把问题改写成“机器人做决定前,最需要预测未来的哪些侧面,以及应当按什么顺序预测”。如果结构化模态能比完整像素更直接地承载操作信息,那么训练路线就可能从追求更大的视频生成器,转向选择更合适的未来表示。

不过,“世界动作模型开始拆分模态”目前更像一个值得跟踪的研究方向,而不是已经形成的行业趋势。现有材料只支持 ModAR 这一篇论文提出并验证了多模态顺序生成方案。

局限与未知

  • 实验任务数量有限,而且使用离散任务标签,不是语言指令,尚不能证明模型能跨任务、物体或场景广泛泛化。
  • 顺序生成需要逐个处理模态。论文中 ModAR 为四种未来模态和动作共执行 40 个采样步骤,其他对照通常只需 8 步,因此推理更慢;把对照提高到 40 步也没有追平 ModAR,但延迟代价仍然存在。
  • 最佳模态及其顺序可能随任务变化。论文尚未系统搜索所有排列,也没有第三方复现来确认这些结果。

供稿材料 SOURCES — 1

← 返回 2026-09-18 · 学术板块