机器人伸手抓东西时,窗外晃过的影子不该让它忘记机械臂在哪。问题在于,世界模型——在内部预演“这样做以后会怎样”的模型——仍可能被无关画面带偏。即便 JEPA 不重画下一帧,只预测画面的内部特征,也不天然会忽略背景。
CF-JEPA 的关键做法,是把潜在空间——模型对画面的数字化摘要——拆成两块:一块记录行动能改变的对象,预测时接收动作;另一块容纳不受动作控制的背景,自行演化。控制任务只使用前一块。这个分工看似简单,却针对了“表示坍塌”:不同场景被压成几乎相同的模糊摘要,模型因此失去预测和控制线索。
按作者实验,在加入两个视觉干扰物的 Reacher 任务中,SMWM 的成功率降至 0.10,CF-JEPA 保持在 0.48;诊断解码还显示,后者的可控表示保留了智能体本身,而基线模型将其丢失。作者也提醒,这种拆分适合背景噪声,却无法处理直接遮住任务对象的干扰。