你让一位画师想象车辆接下来十几秒会看到什么。如果要求他从第一笔起就画清路面纹理、车身反光和远处招牌,他很可能顾着细节,反而弄错车辆会往哪走。更稳妥的办法是先画草图:道路怎样延伸,车辆大致在哪里;临近时再补齐画面。
Orbis 2做的正是这种拆分。它是一种驾驶世界模型——学习道路环境会怎样随时间和车辆动作变化,并在内部预测未来场景。以往不少模型只在一个抽象层级上逐帧生成,容易把“画得像”放在首位,却没有同样重视空间关系和场景含义。Orbis 2把预测分成高低两层,让一层负责较远的整体结构,另一层负责较近的画面细节。
这是University of Freiburg团队的一项早期研究。以下数字均来自论文自己的实验,尚无第二个独立信源复核。
先看远处,再补眼前
Orbis 2的高层预测器每秒处理2帧。它读取过去3秒内的5帧信息,预测下一个较抽象的场景状态。这个状态不是高清画面,更像一个“子目标”:道路、车辆和场景结构接下来大致会变成什么样。
低层生成器则以每秒10帧工作。它读取5帧上下文,并在高层子目标的约束下生成接下来的5帧。换句话说,高层看得远、画得粗;低层看得近、画得细。两层不仅抽象程度不同,时间尺度也不同。
两层使用的内部表示也有分工。高层采用经过压缩、与DINOv2特征对齐的潜在表示。“潜在表示”可以理解为模型保存场景要点的内部编码;DINOv2在这里为它提供视觉结构和语义信息。研究者又压缩这些特征,因为直接在完整的高维DINO空间里连续预测,会让画面随时间逐渐退化。
低层使用以像素重建为目标训练的表示,保留纹理、外观和精细运动。于是,高层更适合回答“场景往哪里发展”,低层更适合回答“下一小段画面具体长什么样”。这并非显式的逻辑推理或类人“思考”,而是把未来生成按抽象层级分工。
本刊7月10日介绍的RynnWorld-4D,把彩色画面、深度和运动线索放进同一生成过程。Orbis 2换了一个切面:它不只区分信息类型,还区分预测世界时应该采用的尺度。
两种训练方法,各取所长
论文还处理了一个常见矛盾。Teacher forcing——训练时总把真实、干净的历史帧交给模型,让它只预测下一帧——能带来较稳定的连续生成。但模型在实际运行时必须接着自己生成的画面往后推。一旦前面出错,后面的输入就不再像训练数据。
Diffusion forcing则分别给序列中的各帧加入不同程度的噪声,让模型同时学习还原它们。论文认为,这种训练迫使模型面对不完美的上下文,因此能学到更丰富的内部表示。不过,单用它并不最利于连续生成的稳定性。
Orbis 2采用两阶段训练:先用diffusion forcing预训练,再用teacher forcing短暂微调。在线性探测实验中,研究者冻结模型表示,只训练一个简单的线性读出层,以检查内部信息是否容易用于其他任务。仅用teacher forcing时,语义分割mIoU为55.01,深度估计RMSE为4.355;仅用diffusion forcing后,两项分别为58.03和4.274;两阶段训练进一步达到58.29和4.157。mIoU越高,说明模型越能区分道路、车辆等区域;RMSE越低,说明距离估计误差越小。
最终结果仍低于原始DINOv2-Base的分割mIoU 60.01和深度RMSE 3.890。不过论文报告,Orbis 2在道路、汽车、人行道和植被等常见驾驶类别上更好,在公交车、火车和摩托车等较少见类别上较弱。
“画得像”之外,还要不跑偏
视频生成常用FVD衡量生成视频与真实视频在整体分布上的距离,数值越低通常越好。但短时FVD可能被开头共享的真实画面“照顾”。论文因此还计算FVD-slope:把长视频切成连续4秒片段,观察质量恶化的速度。
在nuPlan-turns上,Orbis 2的FVD-slope为46.45,低于Orbis的99.67、Epona的93.89和Cosmos-v2.5的189.34。它在Waymo上的6秒FVD为98.01,也是表中最低;但在nuPlan和nuPlan-turns的普通FVD上,Cosmos-v2.5分别以67.74和126.26领先Orbis 2的98.97和187.53。更准确的说法不是“全面领先”,而是Orbis 2在长时稳定性、内部表示和部分生成评测之间取得了更均衡的结果。
消融实验也支持分层设计。只用细节表示的单层模型,16秒FVD较好,但FVD-slope达到101.63,说明越往后越容易漂移;只用抽象表示的模型更稳定,FVD-slope为48.38,却缺少画面细节。高层采用2 Hz抽象表示、低层采用10 Hz细节表示时,FVD-slope为47.87,同时保留较有竞争力的FVD。若让抽象高层也以10 Hz工作,论文观察到车辆逐渐停止,推测原因是抽象表示不足以捕捉高帧率下的微小运动。
模型还能根据二维轨迹接受转向条件。研究者改变真实速度和偏航率,构造“如果车辆转得更多或更少”的反事实场景,再检查生成视频是否响应指令。在100段6秒样本、共500次生成中,Orbis 2在原始轨迹和四类反事实设置中的三类取得最低平均位移误差;Epona在其中一种速度设置上略好。这项测试比照搬原轨迹更难,因为模型不能只从开头画面猜测车辆原本的走向。
为什么值得关注
Orbis 2最有意思的地方,不是又把视频做得更逼真,而是重新安排了模型应该记住什么。远期预测主要依赖缓慢变化的道路结构和场景语义;近处生成才需要纹理与精细运动。把两者塞进同一层表示,容易让像素细节挤占结构信息。
论文还报告,完整模型约10.7亿参数,以不到6000个H100 GPU小时完成训练;推理速度为3.64 FPS,占用19 GB显存。在其对照表中,这是最快的推理速度。不过不同模型的规模、数据和硬件并不完全一致,不能把这组数字视为严格同条件的效率排名。
局限与未知
- 论文发现diffusion forcing改善了内部表示,却没有拆开验证原因。作者推测,不同噪声可能相当于数据增强,并让模型同时练习去噪、插值和预测。
- 高低两层使用各自独立、目标不同的潜在空间,分工清楚,但层间互动有限;低层训练时还使用真实的高层表示,推理时才改用高层预测,误差如何跨层传播仍值得继续研究。
- 这仍是研究阶段的驾驶视频世界模型。论文明确表示,实际社会影响取决于后续的模型改进、规模扩展、验证和系统集成;现有生成与转向实验不等同于真实道路上的安全能力。