你给机器人看一张厨房照片,它能认出桌子和柜子,却不知道镜头转到侧面后会看到什么,更不知道这个空间能否拿来练习行动。World Labs 发布的 Atlas,试图补上这部分:从一张或几张二维图片推断三维场景,再按指定机位生成新画面,甚至把真实环境转成机器人可以反复试错的模拟空间。它值得现在关注,因为这条路线追求的不只是“生成一段好看的视频”,而是建立一个能换视角、可重建、可继续模拟的世界。本文效果与规格主要来自 World Labs 官方材料的媒体转述,尚无独立复现。
先把画面放进同一个空间
Atlas 是一个面向“空间智能”的世界模型。世界模型可以理解为 AI 对环境的内部推演器:它学习场景的结构、状态变化以及接下来可能发生什么。World Labs 由计算机视觉学者李飞飞参与创办,目标正是让 AI 理解并生成可交互的三维空间,而不只是在平面上作画。
Atlas 从头预训练,原生处理文本、图像、视频和 3D 数据。它先把不同输入放进共享的“空间上下文”——也就是统一标明它们在同一空间里的位置和关系——再据此生成后续内容。比如,两张原本无关的参考图可以被指定到三维空间中的不同位置,模型再尝试把它们接成连续场景。
据量子位转述,Atlas 采用“多模态自回归扩散 Transformer”。多模态,是同一个模型能处理文字、图片、视频、相机位置和深度图等不同数据;自回归,是每次生成新内容时,都参考前面已有的输入和输出;扩散,则像从满是噪点的底稿开始,逐步还原清晰画面。Transformer 负责组织这些前后关联。说白了,它把语言模型擅长的序列处理,与图像、视频模型常用的逐步去噪结合起来。
这种设计把不同任务改写成同一件事:给模型一串带有空间位置的元素,让它续写下一项。输入可以是一张照片,输出可以是另一个机位的画面;输入也可以是一段视频,输出则是换过观察角度的后续帧。
一张图,能长出什么?
据量子位报道,Atlas 仅凭一张图片就能进行像素级相机控制,最高生成一分钟、1440p 的视频。所谓相机控制,不是让画面里的物体随意动起来,而是指定镜头在虚拟空间里怎样移动,再生成对应视角。
它也能依据一张到数十张图片进行 3D 重建——从二维观察推断场景的几何结构和外观。输出既可以是新视角图片,也可以是显式 3D 表示。开发方的评测称,Atlas 在相机控制生成任务上优于对比的 SOTA(当时最佳水平)视频模型,而且镜头轨迹越复杂,优势越明显;在稀疏视角 3D 重建中,它也超过了表现最好的专业开源模型。不过现有材料没有披露具体对手、数据集、分数或误差区间,暂时无法判断优势有多大。
Atlas 还可以根据视频同时建模空间和时间,改变已有视频的观察视角。文本生成图片和 360° 全景图也被纳入同一套模型。World Labs 表示,Atlas 的性能会随训练计算量增加而提升,并计划让它成为未来版本 Marble 及其他产品的底层模型。
与视频生成路线,分野在哪里?
普通视频生成更容易用“画面是否自然”来衡量。Atlas 强调的则是空间一致性:镜头换到另一边,桌椅、墙面和距离关系仍要接得上。这也是它与机器人发生联系的地方。
Real-to-Sim,是把真实世界的观察转成可模拟的数字环境。机器人可以先在其中大量训练和测试,再尝试把策略迁回现实。据量子位转述,Atlas 能由少量照片生成机器人训练所需的 RGB 彩色画面和深度数据。后者记录物体离相机多远,能为机器人提供比普通图片更多的空间线索。
这让 Atlas 展示出一条很有吸引力的路径:不必先耗费大量人力搭建数字场景,只需拍摄少量照片,就可能扩充训练环境。相比只负责生成视频,它更像在为机器人的“练习场”生产视觉材料。
局限与未知
- 生成连贯的新视角,不等于掌握可靠的物理规律。现有材料无法证明 Atlas 能准确模拟碰撞、摩擦或物体受力后的变化。
- 开发方没有公布机器人在 Atlas 环境中训练后迁移到真实世界的量化结果,因此 Real-to-Sim 的实际收益仍待验证。
- Atlas 目前只向部分合作伙伴提供早期访问,也可在官网申请。训练规模、成本和完整基准尚未披露;“全球首个多模态世界模型”也缺少清晰类别定义,不宜视为确定结论。