机器人一次规划好一串动作,就像端着水杯闭眼走完几步:省事,但杯子滑了、手碰到障碍,它仍可能照旧执行。πR²针对的正是这个问题。动作分块——一次生成未来一小段连续动作——能减少大模型调用,却容易变成开环控制,也就是执行途中不根据新反馈纠正。
它最关键的一步,是把传感输入拆成快慢两路。视觉和语言交给较慢的大模型异步更新,用来把握整体任务;关节位置、速度、力矩和接触力等本体感觉,则在每个控制周期刷新,负责及时修正局部动作。生成动作时,πR²还采用按延迟调整的流策略——从粗略动作序列逐步细化的生成方法——把已经在执行的动作当作已知条件,每次调用只做一步细化。
作者将其用于 GR00T-N1.7,并在 A5000 GPU 上以 25 Hz 闭环重规划,即每 40 毫秒使用一次新观测;论文举出的常规分块重规划频率约为 7 Hz。换句话说,它没有丢掉大模型和动作分块,却让机器人在动作块尚未跑完时重新“听见”身体反馈。