普通视频能让 AI 看见“杯子怎样被拿起”,却不会告诉它机械臂各关节该转多少。NAVA-WAM 想跨过这道坎:直接用这类只有画面、没有控制指令的视频,预训练机器人的动作策略。它面向世界动作模型——一种既预测未来画面、又决定机器人如何行动的模型。意义在于,动作标注轨迹需要真机运行并同步记录控制指令,成本远高于普通视频。
最巧的一步发生在预训练阶段。研究者冻结负责视频的 Video-DiT,只让负责动作的 Action-DiT 学习;虽然视频里没有动作标签,模型仍要预测画面如何从当前状态变化到未来状态,这份训练信号会通过两个模块之间的联合注意力传给动作模块。换句话说,它从“东西后来怎么动了”反推常见的互动规律,形成动作先验,再用少量带动作标注的机器人演示适配具体机械臂。实际运行时,它只输出动作,不必生成未来视频。作者称,该方法在分布内、分布外及低动作标签预算下均优于对照方法,并在 Franka FR3 真机任务上展示了泛化能力;但所给材料未披露具体成功率。