把书插进书架时,光看画面不一定知道它是卡住了,还是已经对准。机器人也一样:视觉可能被遮挡,细小的受力变化更难看出来。LIFT给已有的视觉-语言-动作模型(VLA——把画面和文字指令直接变成动作的模型)补上一条力觉反馈通道,让它在接触发生后及时修正动作,而不是把原定动作一路执行到底。
关键设计是把“慢看”和“快调”分开。系统先缓存较慢的视觉和语言信息,再反复读取机械臂末端最近的六维力与力矩,逐个刷新动作。新加入的反应式动作模块复制原模型参数,力觉通道则从零输出开始训练,尽量避免一上来破坏原有能力。训练时,LIFT还让机器人实际执行,并用人工纠正它偏离示范后遇到的状态。
作者在毛巾折叠、书本插入和汉诺塔圆环放置三项真实任务中报告,LIFT比只用视觉的后训练学得更快、最终表现更高;在线纠正也在三项任务中都优于纯离线适配。