你在游戏里捡到一把钥匙,转身走过几个房间,再回来开门。画面可以稍有变化,但钥匙不能突然消失,门也不能忘记自己已经打开。今天的视频世界模型擅长生成看起来合理的下一幕,却不一定可靠地保存这些事实。Programmable World Model 想解决的正是这个问题:把“世界现在是什么状态、接下来按什么规则变化”交给可执行程序,把“这些变化看起来是什么样”交给视频生成模型。
标题里的“可以写规则”需要说得更准确一些。并不是视频模型自己学会了可靠执行规则,而是一个智能体把自然语言要求转换成程序,再由外置的轻量级引擎运行。以下方法与效果均来自论文作者披露的材料;除论文实验外,目前没有第三方复现可供交叉验证。
先更新后台,再生成画面
这套框架最重要的变化,是把世界状态演化与视觉观察生成拆开。
世界状态,可以理解成游戏后台保存的一张总表。里面记录每个实体是谁、在哪里、属于哪个阵营,以及生命值、物品归属、任务进度等属性。所谓“持久”,是指角色走出镜头,或者互动持续很久之后,这些事实仍然有效。状态转移规则则规定动作带来的后果,例如攻击会扣除生命值,生命值降到特定条件后角色进入死亡状态。
用户先用自然语言描述世界。基于视觉语言模型的编程智能体——也就是能同时理解图像和文字、并生成代码的智能体——结合一张初始画面,识别其中的实体,为它们分配状态、关系和可执行规则。轻量级引擎随后检查玩家动作是否合法,更新实体属性,并处理被触发的事件。
这很像传统游戏的基本分工:后台先把数据算清楚,画面系统再呈现结果。区别在于,这里不要求开发者事先准备完整的三维资产、动画和物理系统,而是让预训练视频模型充当“生成式渲染器”,补全人物外观、材质、动作细节、光照和次级运动。
一个刚好够用的“盒子世界”
难点是,后台状态怎样准确告诉视频模型:谁应该出现在哪里,又应该呈现什么状态?
只写一句文字太含糊。二维框和遮罩虽然能圈出物体,却依赖当前视角;镜头一转,它们的位置和形状都会变化。完整三维模型更精确,但系统必须同时处理骨骼、姿势、局部形变等大量细节,训练数据和推演成本都会上升。
作者选择了中间路线:state-augmented 3D oriented bounding boxes(带状态的三维有向包围盒,OBB)。它不是精细的人物模型,而是一个带方向的三维盒子,记录实体的位置、大小和朝向;盒子还绑定固定身份、语义类别、动态状态和外观信息。
这个取舍的直觉很简单。假设一个角色中弹倒地,规则系统只需确定“角色已死亡”,并更新其大致位置、方向和占据空间,不必逐帧设计手臂怎样摆动、衣服怎样变形。低层视觉细节留给视频模型完成。
随后,一个确定性的“状态编译器”根据目标相机轨迹,把三维盒子投影到每一帧画面,并生成与像素位置对齐的时空控制信号。它分别告诉渲染器:这里是哪一个具体实体、它属于什么类别、它自身朝哪个方向运动。运动方向来自世界坐标中的速度,而不是物体在屏幕上的位移,因此可以区分“角色真的在移动”和“只是镜头移动造成看起来在动”。
渲染器建立在预训练的 LingBot-World-v1 上。原有分支负责相机运动,新加入的 Structured Spatial ControlNet——一种把结构化空间条件注入生成模型的控制分支——负责约束实体的位置、身份、类别与运动。训练时,预训练主干被冻结,只优化新控制分支。
镜头外的角色也不能被忘掉
显式状态的价值,在长时间互动里尤其明显。一个敌人离开画面后,引擎仍会保存它的身份、位置、生命值和阵营;这些不一定能从当前像素中看见,却会影响后续互动。实体重新进入镜头时,固定的身份槽位还能帮助渲染器恢复对应关系。
画面连续性则由两类记忆辅助。第一类是多尺度时间历史:近期画面保留较细的信息,更早的画面以较粗形式保存,初始观察始终作为锚点。第二类是与几何对齐的空间记忆:系统利用估计的深度和相机参数,把已经生成的画面放回世界坐标;当镜头再次看向某处,再将相关旧画面投影到新视角。模型按视频片段逐段生成,每一段只使用此前已经完成的信息。
作者还建立了一条自动训练数据管线,从无标注视频中恢复相机参数、深度、实体分割、持续身份、语义类别和三维轨迹,再转成上述控制信号。论文使用了来自 Cyberpunk 2077、Forza Horizon 6 和 Grand Theft Auto V 的无 HUD 游戏视频,覆盖第一与第三人称视角。
它为什么值得关注?
这项工作的意义不只是“多一种视频控制方式”,而是重新划定了生成模型的职责边界。模型不必既当裁判又当摄影师:程序负责保存可检查的事实、执行明确规则,生成模型负责把结果变成自然画面。规则还可以继续通过自然语言修改,再由编程智能体改写程序。
作者为此提出 CombatStateBench。这个基准包含 50 个战斗片段,场景覆盖不同的镜头和实体运动,也包含最初位于镜头之外的实体。它重点检查两件事:画面中仍存活的角色数量是否正确,以及死亡状态是否真正呈现在视频里。
论文报告的方法达到 94% Count Accuracy 和 98% State Accuracy,并称其明显优于现有交互式视频世界模型,也能支持连贯的长时程生成。这里的数字更适合解读为:在作者设计的受控战斗任务中,显式状态确实较容易传递到画面。它们不能直接证明系统已经能处理任意开放世界规则。
局限与未知
- “规则可靠”目前主要指外置引擎能按程序更新权威状态。最终视频是否每次都忠实呈现这些状态,仍受生成模型影响。
- CombatStateBench 只有 50 个战斗片段,指标集中在存活数量和死亡表现,尚未覆盖门锁、库存、任务链或更复杂的多人关系。
- 论文给出了 94% 和 98% 的结果,但现有材料没有完整展开对照模型的逐项成绩、误差范围与独立复现,因此不宜把它泛化成整体世界模型能力。
所以,更克制的结论不是“视频模型终于学会了世界规则”,而是:研究者开始把规则从像素预测里拿出来,放进一个可以编写、执行和检查的状态系统。若这条路线继续成立,生成世界或许不必在“像真的”和“讲规矩”之间二选一。