让 AI 用视频演示走迷宫,它可能每一步看着都合理,最后却走进死胡同。问题在于,自回归视频模型像逐词续写文章,只根据已有画面生成下一帧或下一小段;它擅长接得自然,却未必记得最终要去哪里。ProAR 想让这种模型学会“前瞻推理”:先惦记终点,再安排眼前一步。
它最巧的一点,是在生成每段视频时,同时预测一张代表最终结果的“目标帧”。一种非对称注意力机制——控制哪些信息能互相影响的规则——允许目标帧指导当前画面,却不让当前画面反过来干扰目标判断。训练时,模型还会让当前内部状态提前贴近下一段的状态,学习短期变化;这部分无需外部编码器或额外运行一次主模型,推理时辅助预测器也会移除。
作者在 13 项视觉推理任务上测试了该方法。其中,10 项 VBVR 任务的平均分由标准自回归模型的 0.663 升至 0.801;只用完整训练步数的 25%,也超过了训练完毕的基线。效果数字均来自论文作者报告,能否推广到更开放、复杂的视频仍待验证。