机器人看见杯子后,还要先在内部反复“打草稿”,才决定手该怎么伸;算得越久,动作就越慢。Kinematic MeanFlow(K-MF)要省掉这段等待:让机器人基础模型——能按视觉和指令处理多种任务的通用模型——只计算一次,直接生成接下来的一段动作。
现有流匹配通常从随机噪声出发,多轮修正出合理动作。普通 MeanFlow 虽能把过程压成一步,直接用于机器人基础模型却会性能崩塌。作者发现,模型内部用于指示“下一步往哪修正”的速度场,在去噪后段变化突然加剧,而且不同样本间的差距越来越大,早期小误差因而容易被放大。K-MF最关键的一步,是在生成途中设置一个可学习的中间点,把前后阶段分开估计;实验中,固定中点也明显优于随机取点,说明锚点放在哪里比覆盖更多切分方式更重要。
作者报告,K-MF在多数设置下优于多步流匹配;用于 GR00T-N1.6 时,动作头延迟降低67.5%—74.4%,端到端延迟降低30.3%—54.9%。这些效果目前来自论文作者的实验。