让机器人接住递来的物体,最怕的不是它不会,而是它想得太久:等大模型算完动作,物体早已换了位置,像司机照着几秒前的路况打方向盘。这项工作瞄准的正是这种时间差。VLA(Vision-Language-Action,把画面和文字指令直接变成机器人动作的大模型)能力强,但推理较慢;若强化学习——让模型根据交互结果获得奖励并继续调整——仍基于过时画面,训练出的策略很难可靠落地。
Real-Time EXPO-FT 的关键做法是“慢规划、快纠偏”:大型 VLA 提前生成一段候选动作,轻量编辑策略则根据执行当下的最新画面,迅速修改尚未完成的动作,并选择预期回报最高的方案。作者报告,在 Kinetix 模拟基准的 10 个环境中,带延迟的策略均取得最佳表现;在递物、平衡球、桌上足球射门和动态抓取四项真实任务上,在线机器人数据限制为 10 分钟时,平均表现由 42% 提升至 97%,训练期间无需人工干预。这些数字来自论文作者的实验,核心意义不只是“跑得更快”,而是让强化学习真正针对现实中的计算延迟来训练。