拧螺母时,机器人把扳手套上去还不算完:如果抓得不稳、插得太浅,眼下看似成功,下一步一旋转就会脱落。这正是长链条装配的难点。VLA(Vision-Language-Action,把画面、指令和动作连起来的通用机器人模型)能完成基本操作,却未必会为后续步骤留下好姿势。
这项工作在冻结的VLA上加入Residual RL(残差强化学习,即不重练原模型,只学习动作修正),并让纠偏模块带一点“前瞻”:研究者先根据当前步骤结束时的图像,离线预测从这个状态继续操作的成功概率,再把它用于训练奖励。训练还从最后一步向前推进,目的不是让每一步更容易过关,而是挑出更利于下一步的过关姿势。
在Isaac Gym模拟的三阶段扳手拧螺母任务中,作者报告完整任务成功率为85.6%,高于普通分步骤残差强化学习的54.5%;有意思的是,单个步骤的成功率基本没变。它说明真正的增益来自“成功得更有后劲”。不过结果目前来自单一模拟装配任务,真实机器人上的效果尚未由这份材料展示。