Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER H 8 约 7 分钟

Oneira:生成世界迈向真正交互

Oneira 给生成世界加上可扩展状态表,让新对象能操作、旧变化能留下。

你在一个由 AI 边走边生成的世界里看见一扇门,下令把它打开。转身逛一圈再回来,门却恢复原样;路上新出现的箱子,看得见,却未必能成为下一步操作的对象。这正是当前视频世界模型的缺口:它会续写画面,不等于真正维护了一个可交互的世界。

论文《Oneira: From Open-Ended Generation to Open-World Interaction in Video World Models》试图补上这一层。Oneira 不只让模型生成后续视频,还在画面背后维护一份可扩展的 world state——世界状态,也就是一张记录“有哪些对象、在哪里、现在是什么状态”的表。新对象出现后可以登记进去;一次操作完成后,结果也写回表中。于是,生成与行动第一次形成了明确的闭环。

以下结果均来自研究团队提供的论文与自建评测,尚不能视为独立验证。

会生成,不代表能操作

视频世界模型,是根据当前画面和行动生成后续视频,用视觉方式模拟环境接下来会怎样变化。它可以充当 Agent——能够观察、规划并采取行动的软件主体——练习和规划的虚拟环境。

过去的重点多是开放式生成:场景可以不断向前续写,使用者也能持续漫游。但新画面里的物体可能只存在于像素中。模型生成了一张桌子,不代表系统已经把“这张桌子”登记为可定位、可引用、可改变的实体。一次动作也可能只是暂时改变了画面,没有成为世界的长期记录。

Oneira 把完整交互拆成两个要求。第一是 Open-World Interactivity,即开放世界交互:探索中新生成或新遇到的对象,也要进入可操作范围。第二是 Persistent State,即状态持久性:已经发生的改变要继续约束后续画面和行动。比如门打开以后,镜头离开再回来,它原则上仍应保持打开。

给生成世界配一本“总账”

Oneira 的关键不是让视频模型独自记住一切,而是把“世界发生了什么”和“画面看起来怎样”分开处理。

它的 world state table——世界状态表——记录可行走区域,以及每个对象的语义名称、三维位置、尺寸、朝向、是否仍在原位和交互状态。这里不保存完整外观,也不描述动作的每一帧。它更像一本总账:负责确认对象存在、哪一个对象被改变,以及改变后的结果。

管理这本账的是 coding agent——能读取状态、规划步骤并调用代码工具的智能体。用户给出一个动作或较高层目标后,它会读取当前画面和状态表,找到具体对象,确定动作发生的时间和可能受到连带影响的对象,再让一个轻量引擎执行状态更新。

例如,一个物体被移动时,系统不会在表里写下完整运动轨迹,而是先把它标记为离开原位置;等它停下并再次出现在画面中,再重新登记。这种表示比较轻,但也说明它记录的是交互结果,不是一套完整的物理模拟。

探索带来新物体时,系统会借助现成的感知模型,从生成画面中恢复可行走区域和物体的三维包围盒——用一个长方体粗略标出物体的位置与体积——再把新实体加入状态表。这样,世界不仅在视觉上扩大,可操作对象的清单也随之增长。

先定“发生什么”,再生成“看起来怎样”

状态表更新后,轻量引擎会沿相机轨迹生成一段粗粒度条件视频。它用地面网格、相机运动脚手架和不同颜色的物体框,告诉视频生成器镜头怎么走、哪个对象何时改变、最后应处于什么状态。视频生成器再补全真实外观、具体动作和运动细节。

为了保持较长时间的一致性,Oneira 还会取回早先看过的画面作为记忆,但只保留与当前状态表相符的帧。旧画面如果显示的是改变前状态,就不会继续拿来约束生成,避免“总账已经更新,参考照片却过期”的冲突。

研究团队用约 1 万段十秒视频微调 MiniMax-H3 Ref2VA,并用 Claude Opus 4.8 充当 coding agent。训练材料约六成为交互视频、四成为导航视频,覆盖 12 类改变状态的动作。

数字说明了什么?

团队为此建立了 InteractionBench,包括 100 个交互案例和 50 个记忆案例。交互部分分别检查动作是否发生、时间是否正确、是否改到了指定对象;记忆案例由两段视频组成,共 20 秒,要求镜头离开后再回到此前位置,检查场景和对象状态有没有保住。

按论文报告,Oneira 的 Interaction、Timing 和 Target 得分分别为 0.78、0.76 和 0.82。三项最佳基线分别只有 0.49、0.57 和 0.53,差距均为 0.19 至 0.29。这个结果尤其说明,模型不只是需要“做出某个动作”,还要在正确时刻改动一组相似物体中的正确实例。

在记忆测试中,Oneira 的 PSNR、SSIM 和 State 得分分别为 21.11、0.64 和 0.80。PSNR 与 SSIM 都是比较两张画面相似程度的指标;State 则检查目标对象是否保持改变后的状态。团队称,相比各指标的第二名,三项分别提高 93%、83% 和 18%。不过这些结果来自团队自建数据集,其中部分评分还使用 Gemini 3.7 Flash 作为视觉评审。

消融实验也支持各组件的分工。去掉物体框后,Target 从 0.82 降至 0.61,说明明确标出对象实例很重要;去掉分段动作说明后,Timing 从 0.76 降至 0.66;去掉相机运动脚手架后,相机控制误差增加,交互得分也一起下降。

为什么值得关注

Oneira 推进的不是“视频更像真的”,而是生成世界的组织方式。此前,世界状态大多隐含在像素、提示词或模型内部上下文里;现在它被抽成一份可读取、修改和扩展的记录。生成器负责呈现,状态系统负责决定什么存在、什么改变、什么应当继续成立。

这条路线对长期行动尤其关键。一个供 Agent 或机器人练习的环境,如果不能稳定指向具体对象,也不能保存动作结果,就很难支持多步计划。Oneira 给出的答案并非更大的记忆窗口,而是在视频之外建立一层明确的世界状态。

标题所说的“真正交互”仍应理解为方向判断,而不是已经实现了不受限制的通用交互。论文证明的范围,是作者定义的开放世界交互与状态持久性,并且证据主要来自其自建评测。

局限与未知

  • 当前动作空间仍是离散的,尚不能处理精细操作或连续控制;论文把机器人控制列为未来方向。
  • 状态表保存的是对象位置和交互结果,不是完整物理状态。复杂动作是否真实,仍取决于视频模型学到的运动规律,而非显式物理模拟器。
  • 长期画面一致性仍受底层视频生成器限制。状态“写进表里”不等于最终每一帧都能长期、准确地把它呈现出来。

供稿材料 SOURCES — 1

← 返回 2026-10-05 · 学术板块