Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
PAPER H 72 约 7 分钟

移动目标逼机器人学会反事实规划

机器人追不上移动目标,未必不会抓;DPP用反事实场景唤出旧技能,再接回现实执行。

想象一台机器人正在伸手抓传送带上的盒子。盒子向前滑了一截,机器人也看见了变化,却仍固执地抓向原来的位置。问题可能不是它没学会“抓”,而是它只在静止盒子上练过:手臂一旦启动,后续动作就像固定剧本,很难临场改戏。

这篇论文研究的正是这道坎。作者提出 Dynamic Predictive Planning(DPP,动态预测规划):先估计真正接触物体时,物体会移动到哪里;再虚构一个机器人熟悉的场景,让它针对那个未来位置生成计划;最后把这份计划接到机器人此刻的真实姿态上。换句话说,它没有用动态数据重新训练机器人,而是用反事实规划把已有技能“叫出来”。

本文的结果与机制解释均来自研究团队提供的论文,尚无第二个独立信源验证。

看见目标移动,为什么还不改动作?

论文使用的 World-Action Model(WAM,世界动作模型),会同时预测未来画面和机器人动作。它不只决定下一步怎么动,也会想象“这样动下去,场景将怎样变化”。按直觉,只要不断送入最新画面,模型就应该能追着目标修正计划。

但静态示范留下了一个缺口。训练时,机器人往往从相近的初始姿态出发,分别抓取不同位置上的静止目标。刚开始时,同一种机器人姿态能与许多目标位置搭配;动作推进后,手臂姿态会越来越像某一条特定抓取路线。现实中目标突然换位,就形成了训练里少见的组合:手臂已经走到路线后半段,物体却出现在另一处。

作者把由此出现的失灵称为“target-response collapse”,即目标响应坍缩。这个名称和归因是论文提出的机制解释,并非已经确立的通用结论。它的意思是:执行越往后,模型越倾向于续写已经开始的动作,对目标位置变化反而越来越不敏感。

论文用“目标响应增益”衡量这种变化:目标挪动后,模型预测的抓取点跟着移动多少。数值接近 1,说明抓取点会追随目标;接近 0,则说明模型几乎不改方向。在 ImageWAM 的滚动物体抓取任务中,执行 48 个动作后,平均增益从 0.885 降到 0.063。另一项测量中,同一组 34 个静态可达位置上的预测抓取响应面积,只剩初始值的 1.47%。

双瓶操作也出现类似趋势。在两只夹爪尚未接触物体之前,执行 24 个动作就使目标换位后的成功率从 100%降至 FastWAM 的 66.7%和 ImageWAM 的 72.9%;没有换位的对照任务则仍全部成功。这支持了作者的判断:模型可能拥有操作技能,却无法从当前这个陌生的“手臂姿态—目标位置”组合中调用它。

先在假场景里规划,再接回现实

DPP的关键不是要求模型直接挽救眼前的尴尬姿态,而是把“在哪里想计划”和“从哪里执行计划”拆开。

第一步,模型从当前场景向未来展开一段预测,也就是 rollout——让模型连续想象后续画面与动作。DPP从动作序列中找出抓取或释放预计发生的时刻。同时,它根据连续观测估计目标怎样移动,并推算到那个时刻时,目标会在哪里。

这里预测的不是“几步以后”这个固定时间点,而是与具体技能有关的交互时刻。抓取动作准备得久,预测就看得更远;动作来得快,预测距离就更短。作者也强调,这个时刻只是从静态技能推得的实用先验,并非针对移动目标优化出的最佳接触时间。

第二步,DPP构造一张反事实观察:保留一个模型熟悉的机器人姿态和场景,却把目标放到预测的未来位置。它像是在问模型:“假设你还处在熟悉的起手式,而物体就在将来需要接触的位置,你会怎样完成这项操作?”模型据此生成一条“标准计划”。规划期间,机器人不必原地等待,可以先执行已有动作。

第三步是把想象接回现实。此时真实机器人已经移动,不能直接照搬从熟悉姿态生成的路线。DPP会在标准计划中选取合适的切入点,用一段受关节速度限制的过渡轨迹,把机器人当前状态连接过去。接轨后,它再读取新画面和真实关节状态,重新规划余下动作,以减小预测积累的偏差。

这三步各有作用。论文在同一组300个仿真场景上的消融实验中报告:完整DPP成功率为83.33%;不让机器人在规划期间先行执行,成功率降至50.33%;不使用熟悉的标准姿态生成计划,则降至51.67%;拿掉接轨后的当前状态重规划,影响较小,成功率为80.00%。最关键的两件事因此相当清楚:先行动、后接轨,以及从模型熟悉的上下文中调用技能。

它真的追上移动目标了吗?

团队在动态双臂抓取和动态取放任务中测试了DPP,共包含300个 Bimanual Grasp 回合和192个 Pick-and-Place 回合,覆盖不同目标位置、速度、方向与物体配置。

在动态双臂抓取中,DPP配合 FastWAM 和 ImageWAM 的成功率分别为83.33%和78.67%。只把固定16步之后的未来画面交给同一骨干模型,成功率均为18.33%;即使使用仿真器给出的未来画面,相应结果也只有27.00%和22.67%。这说明“看见未来”本身还不够,交互时刻、熟悉的规划上下文和现实状态之间的衔接同样重要。

在动态取放中,两种组合的成功率分别达到80.73%和91.15%,也高于论文评测的其他方法。额外使用动态数据训练的 DynamicWAM,在两项任务中的成功率为52.00%和53.13%;DPP没有为策略增加动态训练。

真实机器人实验各进行了30次。任务A要求抓住移动的小猪存钱罐并放入盆中,DPP成功率为76.7%,Reactive(反应式重规划)和固定时距的 Future-Conditioned 方法均为0%。任务B要求放置球门状物体去拦截移动小球,DPP完成26次,成功率86.7%;共享同一策略的 Reactive(Hybrid)为40.0%。

系统以标称10 Hz控制异步运行。论文报告,仿真中的学习式推理使用单张 RTX 5090,真实机器人使用单张 RTX 4090;仿真渲染另用一张GPU。因此,“单张消费级GPU实时操控”准确说来是指学习式规划与真实机器人推理配置,不等于全部仿真计算只使用一张卡。

为什么值得关注

这项工作的启发不只在“会抓移动物体”。它提出了另一种看待模型失败的方式:能力可能已经存在,只是当前输入不容易把它调出来。

DPP没有逼模型在陌生组合上即兴补救,而是主动重写问题:先把未来目标位置放进模型熟悉的情境,取得一条它会生成的计划,再解决这条计划如何落到现实。反事实观察因此很像一次对既有技能的检索请求。这里所谓“机器人学会反事实规划”,更准确地说,是规划框架利用反事实场景调用机器人已有的静态技能,并非机器人通过新训练重新学会动态操控。

局限与未知

  • DPP依赖目标在规划时间范围内仍可预测。论文展示了非匀速运动和位置突变的扩展方案,但这需要延后标准规划,并加入空间修正。
  • 方法只能调用骨干模型已经掌握的静态技能;如果机器人原本就不会完成操作,反事实场景不能凭空补出能力。
  • 交互时刻来自模型原有技能,是实用先验而非动态场景下的最优选择。运动估计和反事实图像合成也仍有改进空间:使用真实目标速度及仿真器生成的观察后,成功率可从83.33%升至94.00%。

供稿材料 SOURCES — 1

← 返回 2026-10-02 · 学术板块