机器人做长任务,常像只记得刚才几步:装配做到后半程,前面的操作和失误已经淡出视野。RoboTTT想解决这个问题。它把视觉运动上下文——机器人看到的画面、自身状态和做过的动作——扩展到8K个时间步,让策略能参考更长的经历。
关键做法是测试时训练(Test-Time Training, TTT):模型部署后仍会根据当前经历更新一组“快权重”,相当于边做边记笔记,把冗长历史压进参数,而非每次重新翻阅全部记录。因此,作者称推理延迟不会随上下文变长。训练时,团队还限制反向计算的跨度,以免更长序列持续抬高显存需求。
最直观的结果来自一项真实机器人装配实验:RoboTTT完整做完了持续五分钟、包含十个阶段的任务,而基线方法均未完成。论文还报告,8K上下文版本的任务完成分数比同模型的1K版本高63%。这些效果目前均为作者在论文中的实验结论,但它提示了一条值得关注的新路线:上下文长度或许也会成为机器人基础模型的“扩展轴”。