Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.022 — 2026-07-26
PAPER HF 11 约 7 分钟

世界寄存器:多智能体共享记忆

WorldWeaver 给多智能体装上共享账本,让不同视角记住同一个持续变化的世界。

你和朋友在游戏里搬走一块石头。你的画面里,它已经不在原地;朋友转过身,却又看见它凭空出现。画面单独看都像真的,但两个人看到的不是同一个世界。多智能体世界模型——同时模拟多个行动者及其视角的生成模型——最容易在这里穿帮。

WorldWeaver(简称 W2)想解决的正是这个问题。它不再要求模型只靠最近几帧猜测世界发生过什么,而是在生成过程里维护一份跨智能体共享、不断更新的内部状态。论文把这份记忆称为世界状态寄存器(World State Registers,WSR)。可以把它理解成多人游戏服务器上的公共账本:每个玩家看到的画面不同,但物体位置、玩家状态和场景变化都应写进同一份记录。

画面不是世界本身

流式自回归生成,是指模型一边接收玩家动作,一边连续生成下一小段画面,而不是一次性做完整段视频。常见做法会把最近的历史帧当作上下文。问题在于,画面只是某个观察者在某一刻看到的局部投影。模型每生成一段,都要从有限的画面历史里重新推断世界状态。

这在单一视角下已经可能遗忘物体和位置。换成多个智能体,难度又多一层:一个玩家没看到的变化,仍可能由另一个玩家触发;等镜头切回来,变化必须继续存在。所谓跨视角一致性,就是同一事物换了观察者后,身份、位置和变化历史仍然对得上。

WorldWeaver 的角度很直接:既然画面历史不等于世界状态,就把世界状态本身写进生成流程。

给生成模型一本公共账

WSR 是一组可学习 token——模型内部可以通过训练形成用途的信息单元。它们与画面 token 一起进入 Transformer,并在所有智能体之间共享。每生成一个视频片段,模型就结合上一版寄存器和新画面更新状态;更新后的寄存器再参与下一段画面的生成。

因此,生成过程变成一个循环:根据旧状态和动作生成画面,再根据新画面刷新状态。寄存器被安排在下一帧之前,使下一帧明确读取已经提交的世界状态。局部历史仍然存在,但不再独自承担长期记忆。

只给模型一块“记忆区”还不够,因为画面生成损失不会告诉它究竟该记什么。论文为寄存器加入三类监督信号:玩家的位置、速度和朝向,用来约束个体运动;鸟瞰图,用来提供两个玩家共享的整体空间布局;场景文字,用来保留物体类别、属性和高层语义。用于预测这些信息的模块只在训练时使用,推理时会被移除,因此不会增加实际生成阶段的这部分开销。

先学会看全局,再练习面对自己的错误

训练分三步。第一步让一个能看到完整时间上下文的双向模型学习两个玩家之间的场景关系。第二步把它转成只能依据过去生成未来的因果模型,并加入寄存器监督。第三步采用 Self-Forcing——让模型在训练中读取自己生成的画面和寄存器,而不总是依赖正确答案。

这一步很重要。实际运行时,模型早期生成的一点偏差会进入后续上下文,寄存器本身也可能越记越偏。让它提前接触自己的错误,是为了缩小训练与实际使用之间的差距。论文使用四步去噪流程,并在这一阶段继续加强部分寄存器监督,以抑制画面与状态共同漂移。

WorldWeaver 还采用 Mixture-of-Transformers(MoT)。它不是常见的 Mixture-of-Experts,而是让世界状态 token 和视觉帧 token 使用不同的 Transformer 权重,同时仍通过共同注意力交换信息。说白了,记账与画画需要不同的能力,不必强迫同一套参数同时做好两件事。

数字说明了什么?

作者收集了约 126 小时的同步双人 Minecraft 视频,并在 Solaris 的原始测试集上评估。输入是两名玩家的第一帧和完整动作序列,模型生成其余画面。主要指标包括 VLM accuracy——用视觉语言模型判断生成视频是否保持指定世界关系——以及衡量视觉分布接近程度的 FID。论文另给出辅助排名指标 WorldScore,但也明确提醒,该分数无上界且受 FID 尺度影响,不能替代两项主要指标。

与使用相同训练数据重新训练的 Solaris 相比,WorldWeaver 在几类依赖状态记忆的任务上提升明显:Grounding 从 81.3 升至 93.8,Building 从 9.4 升至 28.1,Consistency 从 57.8 升至 76.6;综合 WorldScore 达到 105.1。

消融实验进一步拆开了“有记忆”和“记什么”的作用。仅加入寄存器、不提供显式状态监督,WorldScore 就从 Solaris 的 81.0 升到 93.8。单独加入场景文字监督时达到 103.2;三类监督合用后达到 105.1。这说明专门留出共享状态通道本身已有帮助,而明确约束其中的信息还能继续改善结果。

MoT 的效果则更有条件。没有显式监督时,它并未胜过普通的密集 Transformer;加入场景文字监督后,密集模型的 WorldScore 为 91.3,MoT 达到 103.2。作者据此认为,当寄存器开始承载与视觉帧明显不同的语义信息时,分开参数才真正有价值。第三阶段训练到 1500 步后,作者冻结视觉分支、只更新寄存器分支,平均 VLM accuracy 从 63.8 提升到 68.1。

为什么值得关注?

这项工作的意义不只是一组 Minecraft 分数。它把多智能体生成中的一致性问题,从“让每路视频看起来连贯”改写为“让所有视频共同服从一份持续变化的世界状态”。前者容易把一致性当成画面质量的副产品;后者则给共享记忆安排了明确位置、更新规则和可检查的监督目标。

论文还测试了半监督训练:固定 1000 个带鸟瞰图标注的视频片段,再加入无标注视频。没有无标注数据时,WorldScore 为 63.2;加入 5000 和 10000 个无标注片段后,分别升至 82.3 和 90.3。这至少说明,在少量状态标注负责固定寄存器含义时,更多普通视频仍能帮助生成。不过,这只是对未来真实数据条件的模拟,还不是现实环境验证。

局限与未知

  • 实验集中在双人 Minecraft。结果能否推广到更多智能体、真实视频和更复杂的动态世界,论文没有证明。
  • 关键收益依赖位置、鸟瞰图和场景文字等额外监督;现实世界的完整状态通常无法直接取得,作者也把这一点列为主要限制。
  • 本文事实与效果数字均来自该论文,尚无独立复现或第三方评测。寄存器被设计为保存持续状态,不等于它已被证明能够长期、准确地记住完整世界。

供稿材料 SOURCES — 1

← 返回 2026-07-26 · 学术板块