机器人收拾餐桌,难点不只是夹起勺子,而是要记住先倒掉碗里的汤,再收碗、擦桌子,并在动作出错后继续调整。这叫“长程操作”——连续完成多个相互依赖的步骤。黎曼动力发布的 Riemann-1.0,试图靠大规模人类劳动视频补上这项能力。
据量子位报道,模型使用23.2万小时训练数据,其中20万小时以上是人类第一视角视频,另有1.2万小时以上 UMI 与外骨骼手套数据,以及2万小时以上机器人真机和仿真轨迹。人类视频没有机械臂角度等动作标签,团队先重建手部姿态和运动轨迹,把“人怎么干活”转换成机器可读的3D坐标,再逐步用机器人数据对齐真实控制动作。
最值得注意的是一组消融实验——即逐项加入训练材料,观察哪部分真正有效。在长序列家务基准 RoboCasa-365 上,加入机器人和 UMI 数据后,成功率为48.2%;继续加入人类视频后升至62.6%,增加14.4个百分点。团队据此认为,人类视频带来的不只是更多样本,还包含更丰富的物体交互和任务经验。不过,这些结果目前来自报道所引团队实验,公开材料未交代更多独立复现情况。