你把一杯水放进冰箱,然后关上门。过一会儿再打开,水应该继续变冷,而不是因为没人看它就停止变化。今天不少“世界模型”却更像一台只会接着画视频的机器:镜头外发生了什么、物体归谁、角色状态如何,它未必真正记得。CoDeR 换了一个思路:先用代码把世界及其运行规则搭起来,再让视频生成模型负责把它画出来。这项工作的全部效果与数字均来自论文作者报告,尚无第二个独立信源交叉验证。
世界先运行,镜头再跟上
世界模型,是一种表示环境状态和演化规律的模型。它要回答的不只是“下一帧长什么样”,还包括“采取这个动作后,环境会怎样”。Agent——能够观察、决策并行动的智能体——可以先在模型里推演,再决定是否真的行动。
许多视频式世界模型把规律藏在神经网络参数中。输入一段视觉历史,它继续生成后面的画面。这种“隐式表征”能做出逼真的视频,却很难直接指出某条规则在哪里。更麻烦的是,画面只展示了世界的一部分。交通规则、角色健康值、资源所有权,乃至镜头外仍在发生的变化,都不一定能从像素中看出来。
CoDeR 因此把工作拆成两层。底层是“可执行世界”:物体、状态和变化规则都写成程序,像游戏引擎一样持续运行。上层是视觉渲染:扩散式视频模型根据底层状态生成画面。扩散模型通常从噪声出发,经过多步修整得到清晰图像或视频;在这里,它不负责决定世界的根本规则,而是负责把规则规定的状态呈现出来。
说白了,代码回答“世界发生了什么”,视频模型回答“这件事看起来怎样”。
五个角色接力造世界
CoDeR 用五类角色把一个模糊想法变成可游历的环境。
“God of Concepts”接收文字或图像描述,也就是用户最初想要什么世界。“Creator”由大语言模型驱动,把这个愿望细化为主题、共同规则和设计蓝图,并提前定义视觉中不易看见的状态。“Executors”是一组编程智能体,按照蓝图生成可执行代码,搭出朴素的三维白模。“Artists”由视频生成模型担任,把白模转成写实、动画等更丰富的视觉风格。“Travelers”则进入世界探索和互动;它既可以是有外形的角色,也可以只是一个摄像机视角。
论文实现中,白模使用 Three.js 构建;涉及人体时采用 SMPL-H 表示动作、手与物体的交互以及视角绑定。Creator 和 Executors 使用 GPT-6 Astra,Artist 则基于 MiniMax H3。论文还报告,Artist 使用 32 张 NVIDIA A800、全局批量 16,训练 200 步;视频片段包含 124 帧。
分工写代码,也要共用一套法律
复杂世界不能交给一个编程智能体从头写到底。交通系统就同时包含车辆、道路和交通规则。CoDeR 提出“Logical Spaces”:把世界拆成若干逻辑模块,每个模块都有明确的输入、输出和约束,再分配给不同 Executor 并行开发。
这里的“空间”不一定是一块地理区域,更像一个职责范围。车辆外观和碰撞体可以分别制作,但两者必须绑定到同一个车辆状态;驾驶舱也能单独开发,再把摄像机位置绑定到车辆姿态。共同规则先写进接口契约,模块完成后再通过状态映射、空间变换或事件连接组装起来。它的关键不是多智能体本身,而是让分工后的代码仍服从同一个世界。
画过的地方,要成为世界的一部分
代码搭出的白模结构明确,却往往颜色单调、材质粗糙。Artist 可以把它改造成漂亮视频,但逐段生成又会带来新问题:同一栋楼从不同方向看,外观可能改变。
CoDeR 的办法叫“Observation as World Registration”,即“把观察结果登记回世界”。Artist 生成一段画面后,系统利用已知的相机参数、几何结构和深度信息,把部分像素反投影到对应物体表面。以后另一个视角再次看到那里,先前生成的颜色会成为新的输入;尚未覆盖的区域则继续保留白模,等待补画。
这像给三维布景逐块上色。已经刷过的墙会留下记录,下一位画师不能把它当成一面全新的墙。论文还用 Canny 边缘和深度图等视觉线索训练 Artist,称之为“Visual Cue Hacking”,目的是让生成画面既保留白模结构,又摆脱生硬的渲染感。
它带来了什么能力?
论文用几个场景展示这套分工的意义。相机旋转一整圈后,CoDeR 能回到起点,并保持建筑几何和标记外观一致;作者报告,ABot-World 出现明显画质下降,Matrix-Game 3.0 丢失建筑结构,LingBot-World 则未能准确跟随轨迹。
交互也不必局限于预先固定的动作按钮。Creator 可以定义新动作,再由 Executors 写成代码。论文展示了从开门到驾驶飞船的交互,并称在开门测试中,EgoSim 未能打开门,CoDeR 则执行了动作并呈现门后的环境。
更能体现差异的是倒水实验。杯子移出视野后,底层状态仍继续更新;杯子再次出现时,水位已经升高。作者报告,HyDRA 的水柱在连续画面中近乎静止,LiveWorld 虽表现出部分水流动态,却有明显视觉瑕疵,也没有正确更新离开镜头后的杯中水位。
在多 Traveler 场景里,一个角色改变共享环境,另一个角色也能看到结果。这说明它模拟的不是几条彼此独立的视频,而是多个视角共同访问同一个可执行状态。
量化结果同样亮眼。论文在 WorldScore 基准的 10项指标上比较 ABot-World、Matrix-Game 3.0 和 LingBot-World。CoDeR 的平均分为 87.88,三个对手分别为 69.24、74.20 和 74.79;作者报告其在全部指标上均为最高。消融实验——也就是逐项移除组件看性能怎样变化——也显示两项设计都重要:完整模型的内容对齐分为 98.44,去掉 Visual Cue Hacking 后降至 82.48;主体一致性为 96.31,去掉世界登记机制后降至 84.63。
为什么值得关注
CoDeR 的价值不只是把画面做得更好,而是重新划分责任。过去,视频模型既要记住世界,又要推断规则,还要生成像素。CoDeR 把可检查、可修改、需要持续执行的部分交给代码,把难以手工制作的视觉细节交给生成模型。
这条路线也更容易扩展动作和系统。要增加一种交互,可以补充规则与代码,而不必把希望完全寄托在视频模型是否从训练数据中隐约学过它。世界即使不在镜头里,也能继续演化。对于需要长期记忆、开放式互动和多角色共享状态的环境,这是一种比单纯续写视频更可控的组织方式。
局限与未知
- 论文的定量优势来自作者自己的实验。材料没有提供统计显著性、更多独立复现或完整失败案例,因此“全面领先”目前应理解为论文报告的结果。
- 开放式交互和自主演化仍受 Creator 能否设计规则、Executors 能否正确写出代码所约束。论文展示了代表性场景,但没有明确能力边界、最长持续时间以及复杂世界中的错误率。
- 代码和模型权重尚未公开;论文只承诺未来发布。外界目前还无法据此复现成本、验证实现细节,或判断这套流程在更大规模世界中是否仍然稳定。