想象机器人要把桌上的杯子推到一旁。它预测出的每一帧都很逼真,杯子的材质、光影也挑不出毛病;可连起来看,杯子中途忽然多出一个,随后又淡掉了。对普通视频生成,这也许只是穿帮。对机器人学习,它意味着用来预演动作后果的“脑内模拟器”给出了一段不可信的未来。
EVEWorld要处理的正是这种“看着真、动起来假”。具身世界模型,是一种预测机器人采取动作后环境如何变化的模型。它可以低成本模拟抓取、推动和碰撞,辅助机器人学习、规划与测试。但单帧好看,不等于物体随时间发生的位置、形状和状态变化合理。论文作者把模型忽视这段物理演化、只顾局部画面过关的倾向称为“Model Laziness”,即“模型偷懒”。
这个命名带有鲜明的论题包装色彩,不过它指向的问题很具体:被操作的目标物体可能凭空复制或消失,也可能在相邻画面间变形、褪色、突然跳位。EVEWorld的思路,是把监督从“最后生成得像不像”推进到“变化过程是否连贯”。以下结果均来自作者团队的论文及其公开材料,尚无独立评测交叉印证。
为什么普通训练会放过穿帮
常规监督微调(SFT——用带答案的样本继续训练模型)主要要求模型重建视频。问题在于,目标物体往往只占画面的一小块。即使这块区域出了错,桌面、背景和机械臂仍然重建得很好,整体误差也可能不高。
作者做了一项扰动实验:人为改动目标后,标准SFT在不同设置下仍保留了92%至99%的注入目标面积。换句话说,模型没有认真纠正物体数量,却依然能靠大面积正确的背景拿到不错的重建结果。局部错误被全局平均掉了。
而且,数量正确还不够。一个杯子始终是一个杯子,它仍可能在连续画面里逐渐变形或身份漂移。这里涉及“实例一致性”:画面中的某个具体物体,跨越多个时刻后,仍应保持可辨认的身份与连贯状态。EVEWorld因此把问题拆成两层:先防止物体凭空增减,再让同一个物体沿时间连续演化。
先故意添错,再让模型改回来
第一部分叫 Instance-Guided Restoration(IGR,实例引导恢复)。训练时,系统先在一段干净的示范视频里额外贴入一个目标物体,制造数量错误,再要求模型恢复原视频。
这很像给学生一道故意抄错条件的题,让其找出多出来的条件并还原正确题面。模型不能只学会把画面修得顺眼,还得识别哪个实例不该存在。为了避免这处局部信号再次被背景淹没,IGR把与恢复相关区域的重建权重设为普通区域的三倍,再对整张权重图做归一化。
目标物体的位置和轨迹由语言模型与 GroundingDINO 辅助确定。GroundingDINO是一种能按文字描述在图像中定位物体的检测模型。它们只在训练阶段帮助构造和标注监督;实际生成时,EVEWorld仍只接收初始图像与指令。
消融实验支持了这部分设计的针对性:在相同初始化、训练数据和250步优化预算下,只加入IGR,就把 Model Laziness Rate 从11.11%降到4.76%。这说明“主动制造数量错误并要求修复”确实强化了物体数量的一致性。
还要把前后两帧的同一件东西对上
第二部分叫 Temporal Instance Alignment(TIA,时间实例对齐)。它处理的是另一类问题:物体数量没变,但在相邻画面间变了样。
TIA会在模型内部寻找前后帧里属于同一目标的特征,并把上一帧的信息传到下一帧。直观地说,它给物体系上一根看不见的线:下一帧可以发生合理变化,却不能毫无来由地换身份、突然跳位或淡出。
具体做法分两步。系统先在局部邻域里寻找目标在下一帧最可能对应的位置,再根据相似度分配传递权重,把上一帧的目标特征写入下一帧。训练时,GroundingDINO提供离线对齐监督;推理时,匹配与传递直接依靠模型的隐藏特征,不需要外部跟踪器或目标定位工具。
作者也没有声称TIA单独包办一切。在以GigaWorld-0为基础的架构上,IGR主要改善物体数量,TIA主要改善跨帧一致性及整体指令遵循;两者合用,MLR降到1.59%,Gemini-IF指令遵循分数达到60.85%。这组消融更重要的含义,是两种错误需要两种监督,不能指望一个总的画面重建目标自然解决。
“偷懒”怎么量出来
作者同时提出 Model Laziness Rate(MLR,模型偷懒率)。它检查一段生成轨迹中,目标物体的数量是否相对初始画面发生不应有的变化,而且要求违规持续至少两帧,以减少单帧检测失误造成的误报。机器人遮挡导致的少计会另行排除,多计则保留。
这个指标比只看某一帧更贴近论文的问题意识:它衡量的不是偶然闪烁,而是生成过程中持续存在的实例一致性违规。不过,它只适用于目标数量本应保持不变的任务。切割或组装这类有意改变数量的操作,被明确排除在当前定义之外。
在主要使用的 DreamGenBench 上,作者报告EVEWorld相较标准SFT把MLR从11.11%降至1.59%,相对下降85.7%。与此同时,Qwen-IF从73.81%升至80.16%,Gemini-IF从53.57%升至60.85%。这至少说明在该设置下,减少物体穿帮没有以更差的指令遵循为代价。
论文摘要还给出相对 GigaWorld-0 的87.5% MLR降幅。这个数字针对特定基线和特定指标,不能写成“整体性能提高87.5%”。作者还在WorldArena 1.0、EWMBench、PBench及不同骨干模型上测试:WorldArena 1.0中,MLR由27.39%降至13.38%,EWMScore-local-8从53.95升至56.76;PBench的六组配对试验均有改善,但供稿中的具体平均增幅缺失。
换用FlowWAM架构后,完整模型仍优于标准SFT,但IGR与TIA的贡献大小发生变化,说明最佳组合依赖模型架构。这个版本以SupervisionWM之名参加WorldArena 2.0 Track 1,EWMScore-P为70.17,JEPA Similarity排第6,综合排第17。这个成绩能说明方法进入了有竞争力的区间,却不等于总体领先。
为什么值得关注
我们此前报道WorldCrafter时,关心的是模型离开一个场景再返回后,能否维持结构与外观。EVEWorld把一致性问题推进到机器人交互过程:物体不只要“还是原来那个”,还要在被推动或抓取时连续、合理地变化。
它更值得留意的地方,不是又做出了一段更漂亮的视频,而是改变了训练时批改作业的方式。过程级监督就像批改解题步骤,不只看最后答案。只要机器人要依据模拟结果学习动作,过程中的一次复制、消失或身份漂移,都可能比画面略显粗糙更要紧。
论文还测试了五种替代方案,但没有一种同时改善模型偷懒与指令遵循。例如 PhysicsLatent 降低了模型偷懒,却让指令保真度损失11.9%;EAG让指令保真度提升10.0%,模型偷懒反而增加150.0%。这进一步说明,视觉生成里的不同目标并不会自动同向改善,需要专门设计监督信号。
局限与未知
- 当前监督主要是局部、相邻帧之间的配对,尚未显式覆盖长时间状态依赖和复杂的多物体互动。它改善的是特定形式的一致性,不能据此断言模型已经掌握一般性的物理推理。
- MLR只检查目标数量相对初始状态的持续违规,并排除本来就要改变数量的切割、组装任务。物体数量正确,也不代表所有运动、接触和形变都符合物理规律。
- 实验结果和榜单信息目前都来自作者团队。WorldArena排名还可能随榜单更新;现有材料没有提供榜单快照时间、参赛数量,也没有真实机器人部署结果。