你让机器人“把红色积木放到左边”,它却可能根本没听颜色和方向,只因桌上向来只有一件东西可拿、一个位置可放,照旧动作也能得高分。RoboFollow要检查的正是这种错觉:任务完成了,不等于机器人真的遵循了指令。
这个诊断基准刻意提高“场景熵”——也就是让同一场景包含多条合理任务分支,迫使机器人依靠语言作选择。它设置了75个训练任务标签和6类初始场景,并用L0至L3四级测试逐步改变物体布局、语义组合,或同时改变两者。评分还拆成“意图”和“执行”:先看机器人是否选对对象、关系或行动分支,再看动作有没有做成,从而区分“没听懂”和“手没做好”。
作者在9种VLA与WAM策略上发现:即使模型在熟悉设置L0表现较强,也不能可靠迁移到L1至L3。更强的视觉语言模型、问答联合训练等改进也未补上差距。它提醒我们,机器人基准若只看最终成功率,可能把会钻场景空子的系统误判成会听话的系统。