Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.083 — 2026-09-25
PAPER 约 7 分钟

动作换种写法,世界模型就失灵

同一机器人动作只换一种数字写法,世界模型表现就会骤降,问题不在信息,而在模型把记法当成了事实。

你让机器人把关节转到 30 度,可以直接写“目标是 30 度”,也可以写“从当前位置再转 5 度”。只要知道当前位置,两句话指向同一个动作。但这篇论文发现,机器人世界模型可能不这么看:训练时见过其中一种写法,测试时换成另一种,哪怕命令轨迹没有变,它对未来的判断也会大幅改变。

这值得现在关注,因为世界模型的任务正是预测“机器人执行某个动作后,世界会变成什么样”。如果预测结果取决于命令采用哪套记法,它学到的就不只是物理变化,还混进了数据管线的书写习惯。本文所有实验数字均来自 Ahmed Karim 和 Leon Chlon 的这篇论文,目前没有外部复现,适合视为一项明确的可靠性警报,而不是已经得到普遍验证的结论。

动作没变,模型看到的却像两件事

论文检验的是“动作参数化”——把机器人命令写成数字的方式。第一种是 absolute joint targets,即关节的绝对目标位置;第二种是 deltas,即相对当前状态的增量。

两者可以这样理解:导航软件既可以说“前往东经某个坐标”,也可以说“从这里向东走 500 米”。表达不同,但结合当前位置后,目的地相同。论文在联合输入中同时给出机器人状态和动作,因此两种编码可以相互换算。研究者用重建实验得到 R2=0.996。这说明在所用数据分布和重建方法下,两种写法几乎可以互相恢复;但它不等于严格证明转换完全没有信息损失。

这里要检验的是“不变性”:同一件事换一种等价表示,模型的判断是否保持一致。论文使用潜在动力学模型——它不逐像素预测未来画面,而是在压缩后的内部表示中,预测动作会把世界带到哪里。图像编码器被冻结,也不参与更新,因此实验尽量把问题限定在状态和动作组成的转换数据,而不是画面生成质量。

模型并不会天然知道“这只是记法”。训练目标只要求它根据输入预测未来。只要某种数字格式在训练数据里有用,它就可能把格式本身当成线索。测试时改写动作,输入的数值分布随之变化,模型便遇到分布偏移——现实含义相同,数字却落进了它不熟悉的范围。

换一种写法,预测差了多少

研究者在 3 个机器人数据集、2 种机器人形态上训练模型,再把相同的命令轨迹改用另一种参数化输入。衡量指标之一是 retrieval rank:模型预测一个未来内部表示,再看真实未来在候选结果中排第几;排名越小越好。

跨数据集看,改写动作后,排名指标恶化了约 2.6 至 13.4 倍。两个 ALOHA 双臂机器人数据集尤其明显:cabinet 任务从 6.19 变为 61.5,coffee 任务从 3.97 变为 53.3。PushT 是二维推物任务,排名从 66.2 变为 169.8。

更直观的是模型对“同一个未来”的内部判断。论文用余弦相似度衡量两个预测方向是否接近:1 表示高度一致,0 表示近乎正交,负数意味着方向相反。在 PushT 上,两种动作写法产生的未来表征平均只有 0.067,最差样本为 -0.377。换句话说,它不是只变得稍微模糊,而是可能对同一条轨迹形成相反判断。

这也影响动作选择。论文让模型在多个候选动作里判断哪个最可能达到目标,即 goal-conditioned action selection。使用训练时的动作编码,成功率为 53%;换成等价编码后降至 15%。不过论文没有在供稿中给出样本量、误差区间和完整统计口径,这两个百分比不宜被理解为适用于所有机器人系统。

先确认是“改写”,再谈强制一致

论文较有价值的一点,是没有看到差异就立刻要求模型保持一致。因为有些输入变化确实会改变信息量。例如两个摄像头可能看到不同区域;把一串动作压缩成平均值,也可能丢掉先后顺序。此时强行让预测相同,相当于要求模型忽略有用信息。

作者因此提出一套检验。核心有两问:不同表示是否具有相当的预测能力;结合模型实际接收的全部输入后,它们能否相互重建。研究团队最初考察了 4 个候选“变化轴”,检验拒绝了其中 3 个,包括不同相机、动作窗口摘要等。绝对目标与相对增量则通过了联合输入下的重建检验。

“联合输入”很关键。只看动作数字,两种编码无法互换,因为“增加 5 度”没有告诉你最后是多少;加入当前关节状态后,换算才成立。论文报告,只检查动作通道会得到错误的否定结论。

修复不只是把两个答案取平均

既然有两种等价写法,一个自然办法是把它们都用于训练。论文把同一任务损失分别在两种编码上计算,再求平均,称为 objective averaging。说白了,就是要求模型在每种写法下都把答案做对,而不是先生成两个预测、再把预测值混在一起。

后者未必安全。若输出是概率,平均后的概率预测可以借助凹性得到保障;但这里的预测是潜在空间中的方向。两个方向向量先平均再归一化,结果可能比原来的每个方向都更差。论文给出了相应构造,并报告 output averaging 的学生模型在排名指标上明显落后于直接平均训练目标的方法。

按论文的一步预测结果,objective averaging 本身可以恢复平均任务表现,但两种编码在最差样本上的一致度仍约为 0.78。再加入 disagreement penalty——专门惩罚两种写法产生不同预测的项——最差一致度可提高到 0.995。这个惩罚没有明显改善平均准确率;它主要修补尾部,让最难样本也尽量一致,并可能以少量常用编码下的准确率为代价。

长时间滚动预测时,这一区别更重要。论文称,两个 ALOHA 数据集上的平均一致度都较稳定,但最差情况会逐步恶化;一致性惩罚能更好地守住下限。PushT 的结果则更复杂:作者一处称平均训练目标可以恢复任务表现,另一处又称在 PushT 上仅靠 averaging 无法修复参数化轴。现有材料没有把对应指标和适用范围解释清楚,因此不能笼统地说“平均一下就能解决”。

为什么值得关注

这项工作的提醒很具体:世界模型的可靠性检查不能只盯着图像变化。裁剪、颜色扰动和相机视角容易被注意,动作通道的书写约定却可能悄悄进入模型。绝对位置与相对增量原本是控制接口和数据采集中的工程选择,却可能决定模型能否正确使用命令。

论文还观察到,增加数据没有自动消除这种差异。模型在熟悉编码上的预测变好,面对另一种编码却没有同步改善。因此,常用格式上的更高准确率不一定意味着模型真正理解了动作含义。

更稳妥的流程是:先检验两种表示是否真的等价,再决定是否进行联合训练;若应用在意极端样本或连续滚动,还要单独检查最差一致度。这里最难的不是写出一个平均损失,而是辨认哪些变化只是记法,哪些变化真的改变了信息。

局限与未知

  • 实验使用冻结潜在表示上的小型 MLP,机器人结果只有 3 个随机种子;论文也承认容量实验存在过拟合干扰,因此更适合相信趋势,而不是把幅度当成稳定常数。
  • 评估全部离线完成。动作选择只是控制代理指标,滚动实验也只在潜在表示中闭环,不能等同于真实机器人长期执行。
  • 可重建性使用线性 ridge regression 检验。它适合这里近似线性的编码转换,却可能错过更复杂的非线性等价关系。

供稿材料 SOURCES — 1

← 返回 2026-09-25 · 学术板块