人用手推盒子,机器人用夹爪推盒子,身体结构完全不同,但真正让盒子移动的,都是接触的位置和方向。ContactFlow抓住这一共同点:它不记录手指外形或机器人关节指令,而用三维接触点随时间的轨迹表达动作,让视频世界模型——机器人动手前用来“预演”结果的模型——不再绑定某一种身体。
最巧的一点是,它刻意只描述主动接触,不提前泄露结果。比如转门把手时,ContactFlow记录手指按住把手的哪里、接触面怎样转动,却不记录随后门被推开的画面。研究团队据此用同一种动作条件——生成未来画面时输入的“准备怎么做”——混合训练人手与机器人操作视频;执行前再生成候选动作的视频,由视觉语言模型判断是否成功,通过后才交给机器人。
作者在DROID数据集和真实桌面任务中报告了人到机器人、以及不同机器人身体之间的迁移。不过,现有材料未给出可比较的成功率数字,因此更稳妥的看点仍是这套表达:它把“谁在动手”换成“接触如何移动”。