Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
PAPER HF 6 约 1 分钟

世界动作模型学会分开语义与时序

ST-WAM把任务语义与画面细节分开学,让机器人换背景、光照后仍能按顺序做事。

给机器人看着桌面完成操作,训练时是白桌布,部署时换成木纹,它可能连任务都“忘”了。问题不一定出在动作,而在世界动作模型(WAM——同时学习未来画面与机器人动作的模型)常靠像素生成监督:预测下一帧长什么样,再从误差中学习。这样一来,模型既学“该做什么”,也被迫记住背景、光照等无关细节。

论文发现,两种视频生成式 WAM 遇到背景、照明和视角变化时,预测画面会逐渐漂回训练环境。作者称之为“训练分布幻觉”。他们又分析了 290 组画面:每组包含任务状态相同但视觉条件不同的两帧,以及一帧任务状态不同的参照。作者报告称,DINOv3 特征——一种更侧重物体与场景含义的视觉表示——比用于重建画面的 Wan-VAE 潜表示更能忽略外观变化,同时区分任务进度。

ST-WAM 因此保留 VAE 对细节和动态的刻画,同时用 DINOv3 学未来的语义变化,并从近期画面历史中找回“做到哪一步”的证据。推理时无需真的生成未来视频。论文称,这种设计提升了视觉变化下的模拟与真机操作表现;但原文抓取内容缺失关键成功率数值,具体增幅暂无法核对。


供稿材料 SOURCES — 1

← 返回 2026-08-06 · 学术板块