让机器人拿杯子时,动作已经想清楚了,却还要机械地“多想几轮”,反应自然会慢半拍。AdaVLA解决的正是这类浪费:它不重新训练模型,而是在动作生成过程中判断任务难度,简单情况少算几步,复杂情况再多花算力。这种即插即用的方式,尤其适合拿不到训练数据或训练配方的部署方。
这里的对象是VLA(Vision-Language-Action)模型——同时读取画面和文字指令,再直接控制机器人的“大脑”。它常用流匹配(Flow Matching)生成动作:从随机起点出发,经过多轮修正得到最终动作。论文在Jetson AGX Orin设备上的分析显示,10轮流匹配耗时557.78毫秒,约占总推理时间的58%,比VLM主干更突出。AdaVLA据生成轨迹的弯曲程度估计把握大小,动态调整修正步数,同时裁剪部分MLP计算。
据论文作者自述,AdaVLA在LIBERO基准上将两种VLA的延迟缩短至约1/1.87—1/2.24,成功率仅有轻微下降,并在SmolVLA真实机器人任务中验证。关键意义不在改造一个更小的新模型,而在于给现有策略增加一只按难度分配算力的旋钮。