Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER H 13 · HF 17 约 7 分钟

Wonder:视频世界变成实时游乐场

Wonder 把生成视频变成可操纵镜头、能离开再返回的持续世界,关键在控制、记忆与加速的协同设计。

你对着一张街景照片按下“向前”,镜头穿过路口,再转进原本看不见的小巷;几分钟后折返,先前的门窗和道路还大致留在原位。普通生成视频擅长做一段好看的片段,却很难同时做到听从镜头、持续生成和记住来路。Wonder 想把这三件事接起来:让视频不再只是播放完就结束的成片,而更像一个能边走边生成的世界。

论文把 Wonder 称为通用视频世界模型——它根据已有画面和用户给出的镜头动作,预测世界接下来会呈现什么。输入可以是一张图,也可以是一段视频;用户可以移动镜头、探索未见区域,并回到之前看过的地方。作者报告称,系统能以 16 FPS 生成分钟尺度的视频。需要先说明:这些能力和效果目前都来自论文作者自己的实验,尚无独立复现或第三方评测交叉验证。

难点不只是“把视频做长”

可探索的世界首先要听懂镜头。用户说向左转,画面就应呈现相应的视角变化;用户向前走,近处和远处景物的移动幅度也应有所区别。其次,它要有空间一致性:离开一处再回来,门、道路和物体不能随意换位。最后,生成还得足够快,否则每次操作都要等很久,“可玩”就只剩下演示意义。

这些要求彼此牵制。保留全部历史有利于记忆,却会拖慢生成;压缩或丢弃历史能提速,又可能让模型忘掉旧场景。高质量视频模型通常还要反复去噪——从噪声中多步修出清晰画面——这也不适合即时响应。Wonder 的核心不是单独发明一个部件,而是把镜头控制、长期记忆和训练加速放在一起改。

先把镜头动作“画”给模型看

以往的镜头条件控制,常把位置、方向或轨迹编码成一串数字,再交给模型理解。问题在于,模型还得自己学会这些抽象坐标会怎样改变每个像素。另一类方法先从输入画面重建三维结构,再从新视角渲染;它在已观察区域有明确参照,但镜头走出原画面后,控制信号可能变空,而且还依赖额外的深度、姿态或重建模块。

Wonder 改用像素空间坐标场。简单说,它先搭一个合成的三维参照物:近似脚手架的密集结构负责表达平移和视差,远处的彩色环境图负责表达旋转。系统沿目标镜头轨迹渲染这些参照物,得到与待生成视频逐帧对齐的控制画面。于是,镜头怎样移动,不再只是一组坐标,而成了模型可以直接“看见”的视觉证据。

这个参照场是合成的,并非从输入图像重建,所以镜头走到原画面之外时仍能提供方向提示。论文称其轻量 OpenGL 渲染器可达 150 FPS,开销可忽略。这里的 150 FPS 只是控制画面的渲染速度,不等于完整视频生成速度。

历史全保存,每次只翻几页

长期探索需要记忆。Wonder 保存完整的历史 KV Cache——可把它理解为模型生成过程中留下的“视觉笔记”,免得每一步都从头回看。但若每次生成都阅读全部笔记,历史越长,延迟就越高。

它的做法像保留整本档案,同时为每一段做一张索引卡。系统先用压缩后的查询与键摘要,挑出少量相关历史片段;真正计算时,再读取这些片段中未经压缩的完整信息。最初片段和最近片段始终保留:前者提供起点锚点,后者维持短期动作连续;中间历史则按内容相关性检索。

这样一来,在固定检索预算下,每一步实际关注的历史 token——模型处理视频时使用的信息单位——数量不随完整上下文增长。完整记忆仍会继续存储,但活跃注意力的规模保持固定。它不意味着总存储、计算或显存成本全部恒定,只意味着核心注意力不会随着旅程不断加长。

模型还必须在训练时习惯这种“只拿到部分历史”的状态。为此,作者提出 sparse context forcing:训练时随机切断部分较远的历史联系,同时保留自身、首帧锚点和最近上下文。否则模型若一直在完整历史上学习,推理时突然只给几段记忆,很容易失稳。

把慢老师压成快学生

Wonder 建立在 Wan2.1-I2V-14B 上。训练先得到一个双向视频扩散“老师”:它能同时参考一段视频的前后信息,控制较准,但生成慢。随后再把能力蒸馏给因果自回归“学生”——学生按时间顺序一段段往后生成,并把去噪压缩为四步,以适应流式输出。

压缩会带来两个损失。第一,单个学生很难同时负责粗略构图和细节修复,生成模式也可能收缩。Wonder 因而使用三个学生生成器:第一步形成大体结构,第二步细化结构,后两步补细节。它们沿用相同的流式接口,并复用第一位学生产生的 KV Cache。论文称,这增加了学生侧容量,却没有增加去噪步数或额外推理延迟。

第二,蒸馏后的镜头容易逐步漂移。作者加入 camera-aware GAN control regularization——一种针对镜头控制的对抗约束。它借用冻结教师模型的中间特征,重点比较低频的布局与运动是否符合目标轨迹,而不是只盯着边缘和纹理。说白了,常规训练容易把“画面看起来真不真”管得很细,却忽略“镜头究竟走对没有”;这项约束专门补后者。

训练数据也配合这套目标。图生视频部分使用 DL3DV 的真实导航视频,并用 Unreal Engine 合成更急的转弯、横移和后退轨迹。视频重拍需要同一动态场景在不同镜头下的配对素材,作者用 Blender 制作较长数据,包括不同速度和类似“子弹时间”的序列。素材被切成 5、10、20 秒,训练也从短到长逐步推进。

为什么值得关注

Wonder 最有意思的地方,是它把生成视频的评价标准向前推了一步。画面是否精美仍然重要,但一个“世界”还要经得起操作:镜头能否准确响应,走远后会不会忘记,返回时场景能否接得上,延迟是否随历史增长。

它还支持 video-conditioned generation,即以现有视频为条件重新选取镜头。原视频负责锚定场景外观和运动,用户轨迹指定新的观看位置。作者将其描述为对动态场景的实时“重新拍摄”。如果这项能力能在更多场景中得到验证,生成模型处理的就不只是从无到有的视频,也包括对已有事件进行可控的视角改写。

局限与未知

  • 论文报告 16 FPS 和分钟尺度生成,但未披露分辨率、硬件配置、端到端延迟及“分钟尺度”的确切时长。16 FPS 本身不足以证明操作体验已经达到稳定实时。
  • 材料没有给出可在此核对的具体评测基准、对比模型分数或独立复现结果。“几何、外观和动态保持一致”等结论目前仍是作者报告。
  • 完整历史 KV Cache 会持续增长。稀疏检索稳定的是每步活跃注意力规模,并不等于长期运行的存储与总体资源成本完全不变。

供稿材料 SOURCES — 1
01
Wonder: Video World Model Done Better arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-01 · 学术板块