Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.064 — 2026-09-06
PAPER 约 1 分钟

世界动作模型先检查未来再行动

机器人先比较多个“想象中的未来”,再选更可信的方案行动。

同一个机器人面对同一件事,只因随机“脑补”出的未来不同,就可能做出截然不同的动作。World Action Model(世界动作模型,先预测接下来会看到什么,再据此控制机器人)因此有个麻烦:多想几种未来,并不等于一定选得更好。这篇论文提出 World-Coherent Decoding(WCD),让模型在行动前先检查候选未来是否可信。

每一步,WCD 都让冻结的原模型生成多个“视觉未来—动作”组合,再用两类内部信号排序:一是 surprisal(意外度),判断画面是否像模型学过的正常世界;二是动作生成路径的费力度,衡量动作是否稳定。最巧的一步发生在执行后:真实画面会回来检验刚才的想象,二者差距再训练一个轻量预测器,帮助下一次在行动前避开不可靠候选。它不更新主模型,也不依赖奖励或外部验证器。

作者在 RoboTwin 2.0 和真实 Franka 机械臂的视觉变化测试中报告了改善,并强调收益来自筛选,而非单纯增加采样。不过,所给原文中的关键成功率数字缺失,因此目前无法判断提升幅度。


供稿材料 SOURCES — 1

← 返回 2026-09-06 · 学术板块