机器人做动作前,也可以先在“脑内”试几遍:推一下杯子会不会倒,换个方向是否更稳。问题是,常用的扩散世界模型要像反复擦除、重画那样,经过多轮去噪才能生成一次未来画面。机器人若要比较成百上千套方案,时间大多耗在这些预演上。
DriftWorld改用“漂移”——训练时学会把随机初始状态沿特定方向直接推向目标画面,并结合当前观察与候选动作预测后续视频。这样,每次 rollout(把一套行动方案及其后果预演到底)只需一次前向计算。作者报告,它能以每秒 30 帧以上生成,平均比扩散基线快 17 倍,同时在五个机器人操作基准上达到相当或更好的预测质量。更关键的是,速度确实转化成了规划收益:在 Push-T 任务中,用它筛选候选动作后,IoU——预测结果与目标区域的重合度——从 0.635 升至 0.781。上述效果均来自论文作者实验,尚不能直接等同于真实机器人在所有场景中的表现。