Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER 约 7 分钟

世界模型需要“会话运行时”

世界模型不只要会生成,还要像游戏一样能存档、分叉并原样续演。

你让一个世界模型模拟开车:先在路口存档,向左试一次,再退回来向右试。画面可以重新生成,但如果系统没有保存当时的观察、记忆和“随机过程走到了哪里”,所谓回退就只是让模型重新猜一遍。它可能生成一个看起来合理的路口,却不是刚才那个路口。

Zhen Lin 的论文认为,这类问题不一定都要靠更大的模型或重新训练解决。至少在论文测试的三类模型上,一部分“世界丢失”发生在模型外面:今天常见的服务系统按请求管理计算,请求结束便回收状态。世界模型若要成为可以分叉、回退和续演的模拟器,需要的则是一个以会话为中心的运行时——模型真正执行期间,负责保存状态、调度计算和恢复会话的系统层。

本刊此前介绍过 WorldMove 如何把运行中世界模型的状态逐比特迁到另一块 GPU,以免会话“失忆”。这篇论文再向前一步:保存状态不只是迁移时的工程技巧,而应成为世界模型运行时的基本职责。以下结果均来自该论文自身,尚无独立复现。

不是重新画一张,而是接着原来的世界走

论文提出 Persistent Computational State,简称 PCS,可译作“持久计算状态”。它指跨请求必须留下、又无法靠重新计算还原的最小状态。

计算状态快照很像游戏存档。不同的是,它保存的不只是一幅画面,还可能包括模型积累的记忆、KV context——模型生成时保留的中间上下文——以及 RNG state,也就是随机数生成器当前走到的位置。生成模型使用伪随机数制造变化;不保存这个位置,恢复后即使输入相同,也可能进入另一条演化路径。

论文测试了三种结构。对只依赖当前观察的 Cosmos3-Nano,PCS 是一份 uint8 格式的当前观察和 RNG state,共约 1.38 MB。对带长期记忆的 WorldMem,它是 memory bank(模型积累的记忆库)、位姿和 RNG state,共约 185 KB,并随保留帧数增长。对 Matrix-Game 2.0,它是带位置索引的窗口化 KV context 和 RNG state,共约 1.67 GB;状态很大,但受到局部注意力窗口限制,不会随运行时间无限增长。

这三种答案差别很大。论文的关键思路因此不是预先规定“所有模型都保存某几样东西”,也不是干脆保存全部缓存,而是通过实验寻找 PCS:分别移除或替换运行时缓冲区,恢复后观察续演是否偏离从未离开的对照轨迹。必要组件组成候选快照,再检查它们是否足以恢复。

这个测量过程还要防一个陷阱:模型可能根本没有读取快照,于是什么状态都像是“可有可无”。论文专门替换 RNG state 做破坏测试。三类模型的续演都随之退化,说明被保存的状态确实参与了后续生成,而不是一份无人读取的存档。

“原样回来”是最直接的证据

论文让模型从一个状态出发,真正离开原场景,再恢复快照并继续;对照组则从未离开。三类模型恢复后的续演都与对照结果逐字节一致。Cosmos3-Nano 和 WorldMem 的 DINOv2 相似度为 1.0、像素误差为 0;Matrix-Game 2.0 在模型原生的 latent space(图像解码前的内部表示空间)中完全一致。跨进程保存、退出并重新启动后,论文也报告了相同的逐字节恢复结果。

这组实验支持一个有限但重要的判断:在这些特定模型和恢复设置中,连续生成所需的能力并未完全缺失,运行时只是丢掉了模型继续原轨迹所需的状态。它不能证明所有世界模型的长期一致性问题都只是系统问题,更不能替代模型对遮挡后事件或隐藏变化的模拟能力。

论文据此把服务单位从 request(一次请求)改成 session(一次持续会话)。会话拥有自己的 PCS,可以执行 checkpoint、restore 和 fork:checkpoint 是保存快照,restore 是恢复,fork 则从同一状态复制出多个相互独立的未来。规划系统由此可以比较多种行动后果,再回到原节点,而不必从头重放整段历史。

保存状态,贵吗?

按论文在一块 A800-80GB 上的测量,checkpoint 和 restore 各耗时 0.012 ms,一次 generation step 则为 1.852 s。一次包含 127 次存档和 48 次恢复的运行中,状态管理合计用了 2.1 ms,占 602.5 s 总时间的 0.00035%。这些数字只适用于论文披露的实验设置,不能当作所有模型和硬件的通用性能。

把暂停会话的 PCS 移到主机后,GPU 只保留当前运行的一个会话。论文实测从 1 到 1,024 个 resident sessions——即已保存、可恢复的会话,不是同时生成的 1,024 路任务——设备内存都维持在 4.714 GB;主机内存随会话数线性增长。这说明容量边界可以从显存转向主机资源,但主机内存、存储带宽和排队延迟仍然存在。论文自己的数据也显示,单 GPU 串行调度下,会话越多,等待时间越长。

留下哪些记忆,也是一项运行时决策

状态不能无限保存时,常见做法是优先淘汰最久没用的内容。论文认为世界记忆不适合照搬这种规则。模型回到旧视点时,靠近返回位置的早期记忆可能比刚刚生成、却远离目标的画面更重要。

在论文设置的 2 MB 紧张预算下,按返回相关性保留记忆的策略守住了 16 个世界中的全部 16 个,按最近使用时间保留则守住 6 个;预算增至 16 MB、不再触发淘汰后,各策略结果相同。这个对比支持“相关性优先”的设计方向,但仍是单篇论文、单组负载下的结果,尚无独立对照。

为什么值得关注

世界模型过去常被当作“输入条件,生成下一段视频”的模型。可一旦人们希望用它做规划或训练,它就更像一个需要存档系统的模拟器:能从同一节点试探多个未来,失败后回退,隔一段时间再继续。

这会改变问题的归属。模型负责预测世界如何变化;运行时负责保证“正在变化的是同一个世界”。PCS 的价值不只在于列出要保存的缓存,而在于给出一条可检验的边界:凡是无法重新计算、又会影响续演的状态,都必须随会话存活。这样,模型能力不足和系统丢状态便不再混为一谈。

局限与未知

  • 全部结论来自同一篇 arXiv 论文,尚无第三方代码复现或独立基准验证。
  • 逐字节恢复证明的是被测模型在特定快照设置下能够确定性续演,不能证明所有长期一致性问题都能由运行时解决。
  • 论文实现采用单 GPU 分时运行。它展示了大量会话可以驻留和恢复,但没有解决多会话并发生成的调度与吞吐问题。

供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块