让机器人完成一串长操作,如果它每次都从头计算关节怎么动,就像做菜时逐字重读菜谱:经验难复用,前面的小错也会一路累积。REFACTOR-VLA想把这些零散动作整理成“动作程序”——可反复调用的动作套路。它面向VLA(同时看画面、理解指令并控制机器人的模型),无需人工逐段标注技能,就能从示范轨迹中归纳程序库。
系统会比较两段动作在学习到的环境模型中是否产生相近结果,而不只看动作轨迹是否相似;再把重复结构编成“带类型”的程序,像规定积木接口,只有输入输出匹配才能组合。候选程序还须通过压缩收益和任务回报保持两道检查。论文称,在LIBERO基准上,系统最终收录了3个抽象动作程序,其中2个被控制器实际调用,并用程序库改写了抽取的全部256条示范。这说明VLA不只能输出原始控制量,也可能开始积累可组合的动作经验;不过这些效果目前仅据论文作者报告。