让机器人去拿桌上的杯子,它可能“知道”不能撞到障碍,却仍规划出一条会碰撞的路线。问题在于,Vision-Language-Action(VLA)模型把画面、语言指令直接变成机械动作,安全不能只停留在口头拒绝,还要判断下一步是否真的做得到、做得安全。
ShieldVLA的关键,是先估计当前位置能否继续保持安全。它用 Hamilton-Jacobi 可达性——一种判断系统是否还存在安全后续路径的控制理论方法——训练“安全评审器”。如果状态仍在安全区域,模型专心完成任务;接近危险区域时,训练目标才切换为脱险。相比把违规统一换成罚分的拉格朗日软约束,这种做法试图避免机器人长期在任务表现与安全之间拉扯,既留下偶发违规,也可能变得过分保守。
逐帧安全标签很难人工制作,因此作者还让冻结的视觉语言模型按碰撞风险、危险距离和机动空间等量表给画面评分,再把结果用于训练安全评审器。作者自述,该方法在五个导航与操作基准、多个VLA骨干上改善了安全与任务成功率的平衡;但论文也明确表示,评审器会继承有限数据和视觉模型评分带来的误差,因此这里的“安全”仍是经验结果,而非绝对保证。