机器人每做一个动作,都要先生成一段清晰的“未来视频”吗?这就像端杯子前先拍完一部预演片,可能更稳,却也让每次决策更慢。世界动作模型(World-Action Model,WAM)会同时学习未来场景和机器人动作;争议在于,训练时预测未来有帮助,实际运行时是否还得继续生成。
作者在统一设置下比较后发现:若测试时完全跳过未来建模,模型在熟悉任务上可与显式生成未来的版本相当,但面对环境扰动、较少演示数据和未参与动作训练的任务时,泛化能力都会落后。反直觉的是,模型不必把未来画清楚:让视频分支只处理一次完全加噪的未来视频信息,就能补回大部分差距,无须反复“去噪”生成清晰画面。
据此提出的 Simple-WAM 把这些噪声状态的未来信息留在决策上下文中,只做一次前向计算。作者报告,它在八项比较中全面领先不使用测试时未来信息的方案,并在七项中领先显式生成方案。结论不是“未来无用”,而是机器人或许只需保留对未来的内部参照,不必真的把未来视频生成出来。