你按下 W 键,画面里的人物向前走;看到路口后,你再按 A 转向。普通视频生成更像提前拍好一段短片,播出后不能临时改剧情。ABot-World-0 想做的,是让模型一边生成画面,一边接收你的操作,再根据新画面继续生成。它把这个循环压到一张 NVIDIA RTX 5090 桌面显卡上,因此值得关注。
这类系统叫世界模型(world model)——它根据当前画面和动作,预测世界接下来会怎样变化。ABot-World-0 更具体地说是一种动作条件视频模型:用户的操作和已有画面共同决定后续视频。生成结果又成为下一次操作的依据,这就是闭环交互。
本文所有性能和效果均来自 ABot-World Team 论文,尚无第三方评测或复现。
难点不是生成一段,而是一直接着生成
一段看起来不错的视频,不等于一个可玩的世界。后者至少要同时处理四件事:操作能否及时改变画面;人物和场景能否保持一致;连续生成后是否逐渐失真;整套系统能否在普通工作站上跑起来。
问题会随着时间放大。模型生成的新画面会成为下一轮输入。一次很小的错误,可能在后续反复被继承:人物外观慢慢改变,运动逐渐停滞,甚至最后只剩近似静止的画面。论文把这种现象称为长程漂移。
ABot-World-0 因而不是单独换了一个模型结构,而是同时改造数据、训练、控制和部署。
先让不同来源的数据说同一种“动作语言”
训练可交互世界需要的不只是视频,还要知道每一帧对应什么操作。互联网视频足够多样,却通常没有同步按键;游戏可以记录准确输入,但画面风格受具体作品限制;模拟引擎可以精确控制环境,却需要专门设计路线。
论文把三类来源放进同一套基础设施:AAA games、simulation engines 和 internet videos。游戏与模拟环境由 WorldExplorer 自动探索,并同步记录画面、控制信号和环境信息。系统还根据训练反馈调整采集比例,更多收集模型表现薄弱的场景与动作组合。互联网视频无法反向取得真实按键,团队便从估计出的相机运动生成带噪声的“伪动作”。
数据进入训练前,要经过覆盖六类质量问题的 14 项确定性检查,例如文件是否完整、帧数是否一致、画面与动作是否对齐。VLM(视觉语言模型,即能同时理解图像和文字的模型)还会筛查界面遮挡、加载画面和渲染异常,并生成场景描述与语义标签。
最后,不同来源的控制都被转换成统一动作。模型直接使用八维键盘输入:W/A/S/D 控制人物或镜头移动,I/J/K/L 控制镜头旋转。每个按键都描述相对于当前状态的一小步变化,不需要长期维护一条不断延伸的全局相机轨迹。对使用者来说,这也是现成而直观的接口。
在第三人称场景里,论文还加入 reference-character memory——一份持续提供人物外观线索的参考记忆,用来减少长时间生成后角色“换脸”或换装。训练数据为人物整理正面、背面和左右侧面的参考图,并补充标准化正脸表示。
先请“全局教师”看完整段,再教学生逐帧走
在线系统只能看到已经发生的内容,因此必须采用因果生成:模型根据过去继续往后写,不能偷看未来。但只看过去更容易累积错误。
团队先训练一个 bidirectional teacher,也就是能同时利用整段视频前后信息的“双向教师”。它不适合实时输出,却更容易学到完整动作、画面和时间关系。随后再把能力逐步蒸馏给 causal student——只能依赖过去、但可以持续流式生成的“因果学生”。蒸馏可以理解为让较轻的学生模仿昂贵教师,把能力压进更适合部署的模型。
这套训练分三步。teacher forcing 先让学生在给定正确历史的情况下学习续写;ODE distillation 再把原本需要多次去噪的生成过程压缩为少数步骤;最后的 LongForcing 让教师检查学生自己连续生成出来的长序列。
最后一步最关键。只纠正短片中的单步错误,就像练车时每次只开十米,无法暴露连续转弯后的偏差。LongForcing 把监督延伸到学生已经自行行驶较久的位置,让模型在误差真正累积起来的上下文中接受纠正。论文据此报告,扩展交互测试中的长期演化更连贯;但材料没有给出独立评审、明确对手和完整量化差距,因此目前只能视为作者结论。
单卡运行,是这项工作的工程信号
实时体验同时受两个指标限制。吞吐量决定画面能否持续更新,延迟决定按键后多久看到回应。ABot-World-0 按一小段一小段生成视频,以摊薄注意力计算和 VAE 解码成本。VAE 是把模型内部的压缩画面还原成可观看视频的组件。
部署端还组合了轻量 VAE、按显存安排模块运行的调度、低比特 DiT 推理、低精度注意力,以及有长度上限的 KV Cache。KV Cache 可以理解为模型续写时保留的计算草稿,避免每次从头处理全部历史;限制其长度则可控制显存增长。
按论文自报结果,在优化过的低比特配置下,系统可在一张 RTX 5090 上流式生成最高 16 FPS 的 720P 视频。从收到动作到第一张解码画面可用,延迟为 1.2 秒;峰值显存约 19 GiB。这里的 1.2 秒覆盖生成与解码的完整路径,不只是模型内部采样。
这些数字还称不上操作与画面完全同步:16 FPS 是吞吐率,1.2 秒才是用户首次看到回应所需的等待。但它们说明,交互式世界模型开始从依赖昂贵计算资源的展示,转向能在单张桌面 GPU 上完整运行的系统。真正重要的不是某个单项指标,而是控制、长期稳定、生成速度和显存第一次被当作同一个工程问题处理。
“无限”仍应加引号
论文标题使用了“Infinite Interactive World Rollout”。现有材料只展示 long-horizon 和 extended interactive rollouts,没有定义何为“无限”,也没有披露最长无重置运行时间或持续稳定性数据。更准确的说法是,它面向长程、持续续写,而不是已经证明可以永不崩坏。
另外仍有三处未知:
- 最高 16 FPS 只适用于优化后的低比特配置;论文材料未说明具体量化位宽、720P 宽高、测试场景和画质代价。
- WorldRoamBench 上的“competitive controllability”和“coherent”属于作者定性表述,缺少对手名称、具体指标与第三方主观评测。
- 数据包含 AAA 游戏、互联网视频及非公开资产,但现有材料没有交代具体来源、授权和版权安排。
所以,ABot-World-0 眼下最可靠的意义不是证明了“无限世界”,而是给出一条清楚的系统路线:用统一动作组织多源数据,用长程教师监督减少续写漂移,再用低比特推理、缓存和解码优化把闭环装进一张桌面显卡。世界还谈不上无限,但运行它的门槛,确实向普通机器迈了一步。