让机器人先看一眼物品原来的位置,再追着移动物体操作,难点不只是“看准”,还要它别把早先线索忘掉。D²-VLA面向这种长时程操作:它把视觉、文字指令和动作相连的 VLA 模型,改造成一套“慢记长期、快盯眼前”的系统。
作者发现,大型视觉语言模块需要较广的历史来判断任务含义,负责具体动作的模块却更关注近期、包含运动变化的信息。于是,D²-VLA为两者分别挑选历史记录,并以不同频率更新。历史保存在 KV cache——模型处理信息时留下的中间“速记”——里;完整理解模块周期性刷新,两次刷新之间则用轻量组件加入最新画面,让动作模块快速重做计划,不必每次都重新运行整套大模型。
作者还设计了十项任务的 DOMINO-Long,要求机器人记住早先的空间、顺序或颜色线索,同时处理持续移动的物体。论文报告,D²-VLA完整任务成功率为60.0%,高于对比方法的35.4%和20.6%。这些结果仍是作者自述,但它的关键价值很清楚:机器人需要的并非一块越大越好的记忆,而是按用途分工、按变化速度更新的记忆。