教机器人学会“拿起绿杯子”,它却可能把“绿色”也当成动作口诀:换成粉色杯子,即使指令改了,仍照旧伸手。问题出在微调——用少量示范继续训练模型——可能冲掉预训练阶段形成的语义结构。两项新工作都在尝试给这种训练加一根“安全绳”,让 VLA(同时看画面、听指令并输出动作的模型)学会新动作,却别忘了如何理解颜色、位置和语言。
Anchor-Align 保留一份冻结的原模型作为老师,在微调时逐层约束新模型的视觉和文字表征;同时把连续动作转成“向左、向右”等离散方向,让语言判断与动作预测在同一段机器人观察上接受训练,避免模型嘴上说“左”、手却往右。另一项工作则把动作表征拆成共享的语义通道和私有通道,再将前者锚定到预训练编码器的“语义地图”;这些辅助结构部署时全部移除,不改变最终模型。
两篇论文都报告了不同 VLA 骨干、仿真与真实机器人上的改善。其中第二项工作作者称,真实场景常规任务最高提升 18.7%,未见分布下的泛化最高提升 21.5%。共同信号很明确:机器人微调不只是把动作练准,还要保护它原本理解世界的坐标系。