让机器人拿杯子,它不只要看懂指令、控制手臂,还得预想“这样伸手,接下来会发生什么”。过去,这两件事通常由两套架构分工:Vision-Language-Action(VLA,接收画面和语言并输出动作)负责行动,世界模型负责预测环境变化。Devol-ONE把它们收进同一个自回归Transformer——也就是一步接一步生成后续结果的模型。
它设置三条参数独立但逐层交流的信息流:一条理解画面和指令,一条在潜空间——画面的压缩数字表示——里预测未来,一条生成连续动作。关键不只是把模块接在一起:每一层中,未来预测都能读取视觉语言信息,动作生成也能同时参考语义与预测出的物理变化。作者还用ALRT训练,让模型在训练时就沿着自己生成的多步预测继续推演,减少训练时看“标准答案”、部署时只能相信自身预测的落差。作者报告其在LIBERO上平均成功率为98.4%,在无需针对扰动数据微调的LIBERO-Plus上为71.4%;这些效果仍限于论文所列基准与Flexiv机器人测试。