做机器人世界模型,难点不只在模型本身:数据怎么接入、多块 GPU 怎么协同训练、训练结果又怎么变成可调用的服务,往往要开发者自己拼装。NVIDIA 开源的 Cosmos-Framework,正是把这条链路接起来。世界模型会学习环境如何随动作和时间变化,用来预测后续画面或状态;这套框架则同时覆盖训练与推理——前者用数据调整模型,后者让训练好的模型生成预测或内容。
框架支持分布式训练,也就是把计算拆到多块 GPU 或多台机器上;数据可从 JSONL、WebDataset 和 LeRobot 等格式接入。推理端既能离线批量生成,也能通过 Ray 与 Gradio 做在线 Serving——把模型包装成持续接收请求的服务。它还纳入了 Cosmos3:一组可共同处理和生成语言、图像、视频、音频与动作序列的世界模型。
工程门槛仍然不低。仓库附带的训练方案按 8 张 H100 80GB 测试,但也给出了 Cosmos3-Nano 的单 GPU 推理入口。换句话说,这次开源的价值不是又发布一个模型,而是给机器人和物理 AI 开发者补上了从数据、训练到部署的直接入口。