球被扣在杯子下,几个杯子来回交换,再让 AI 指出球在哪里。人能靠“看不见也还存在”的直觉一路追踪;视频世界模型却可能把画面拍得很真,揭晓时仍找错杯子。这项工作用动作条件的“猜球游戏”测试对象恒存——物体离开视野后,模型能否继续记住并更新它的状态。
据论文作者报告,多类模型都能学会训练时最多 5 次交换,但面对更长的交换链,准确率会跌向随机猜测,生成的视频却依然合理;增加扩散模型的去噪步骤也没有帮助。问题在于,像素训练只监督看得见的画面,并不直接告诉模型球藏在哪。Transformer 的 KV Cache——保存历史计算结果的临时记忆——又只能不断追加,难以把“球的位置”原地改写。
真正能外推到更长过程的两种设计,都带着一份可持续修改的内部状态:一种让线性注意力允许负特征值,以表达交换所需的翻转;另一种用 TTT(测试时训练)在生成过程中更新一个小型非线性网络。这个结果提醒我们:画面连贯只说明模型会拍,能否记住镜头外的世界,还要单独考试。