同一台机器人,用久了关节会偏,换个工作台也可能失准:原本接近满分的动作策略,到了现场甚至几乎次次失败。Self-Adaptive VLA 想解决的正是这个问题。VLA(视觉—语言—动作模型,即看画面、听指令并控制机器人)通常近乎“无记忆”,很难从反复失手中判断机械臂是否总向一侧偏。
研究团队让模型在部署后利用自己的 rollout——机器人连续执行一次任务留下的观察、动作与结果——进行测试时适应。一个轻量编码器把画面、机器人自身状态和动作压缩成“上下文 token”,再用它调节原策略;多次尝试的 token 还能合并,让机器人逐步修正补偿过头或不足的问题。
作者在四项高精度双臂及灵巧操作任务中注入执行偏差和关节编码器偏移。基础策略成功率从接近 100% 跌至接近 0%;该方法一次尝试后恢复 46%—49%,合并最多六次尝试后恢复 80%—84%,且上下文 token 算好后不增加推理计算开销。结果仍来自论文作者自述,但它提供了一个实际方向:机器人不必每次磨损或换环境都依赖人工重新校准。