你让机器人“把桌上的红色杯子拿起来”,它不只要听懂“红色杯子”,还得不断看画面、判断位置,再及时修正手臂动作。很多 VLA(Vision-Language-Action,视觉—语言—动作)模型能完成这套流程,却要让每一次控制都经过一个庞大的语言模型。像是搬个杯子,也要先请一位全科顾问逐句审阅。效果可以很好,代价是慢、占显存,也难装进成本有限的机器人。
TurboVLA 想做的是撤掉这个中转站。它分别读取画面和指令,让两类信息直接交流,再一次预测一小段连续动作。论文报告称,这个只有 0.2B、即约 2 亿参数的模型,在 RTX 4090 上单次策略推理耗时 31.2 ms,峰值推理显存为 0.9 GB,并在 LIBERO 机器人操作基准上取得 97.7% 平均成功率。下文数字均来自研究团队论文,尚无第二个独立信源复核。
不是什么任务都需要大语言模型
传统的 LLM-centric VLA 采用一条间接路径:先把相机画面转换到大语言模型的内部表示空间,再把它与文字指令一起送入语言模型,最后生成机器人动作。语言模型因此不只是负责理解文字,还成了视觉通往动作的必经桥梁。
这种设计能利用大模型的语义知识与推理能力,但问题也在这里。机器人执行一个已经说清楚的动作时,通常不需要开放式写作,也不一定需要重新拆解任务。它更需要知道:指令指向画面里的哪个物体,以及当前状态下该怎么动。让数十亿参数的语言模型参与每一次低层控制,能力可能超出需求,计算和内存开销却会如数发生。
TurboVLA 因此把常见的“视觉→语言模型→动作”改成“视觉+语言→动作”。它用 DINOv3 编码画面,用轻量的 BERT 编码指令。BERT 在这里不是负责生成句子,而是保留物体、属性和空间关系等信息。机器人自身的关节等状态则单独编码,等到预测动作时再加入。
让画面和指令直接对话
分别看懂画面和文字还不够。模型必须知道,“红色杯子”对应画面里的哪一块,“放到左边”又该怎样改变动作。TurboVLA 用轻量级的双向跨模态交互完成这一步。
所谓“双向”,是指语言会反过来筛选视觉重点,画面也会帮助模型校准指令含义。研究团队的消融实验——即拿掉或替换某个部件,看性能如何变化——显示,只把两类特征直接拼接,LIBERO 平均成功率为 95.2%;只做单向交互时为 96.1% 或 96.5%;双向交互达到 97.7%。这说明它的关键并非简单删掉大模型,而是用更小、更专门的模块接手视觉与语言的对齐工作。
语言本身也不是装饰。去掉语言后,平均成功率从 97.7% 降至 70.8%;其中 LIBERO-Goal 从 97.4% 降至 11.6%。换成只表示任务编号的向量,可以恢复到 95.4%,但仍低于完整的自然语言指令。也就是说,TurboVLA 没有放弃语义,只是认为执行层不必为此保留一个生成式大语言模型。
最后,模型用一个轻量 Transformer 解码器预测连续 action chunks,也就是一次给出未来若干步的动作片段。LIBERO 设置中,每个片段包含 12 步、每步为连续的 7 自由度动作。所有步骤并行产生,不必像写句子那样逐个生成动作 token(离散符号)。这进一步缩短了等待时间。
32 Hz、0.9 GB,分别意味着什么
论文在 batch size 为 1 的 RTX 4090 上,从接收多模态输入到产出动作片段测得 31.2 ms 延迟。按倒数换算,约为每秒 32 次策略推理。控制频率越高,机器人越有机会在物体滑动或位置出现偏差后及时调整。
但标题里的“跑满 32 Hz”需要准确理解。论文测量的是在线策略从输入到输出动作片段的延迟,不等于整台机器人端到端稳定维持 32 Hz。相机预处理、通信和机械动作等环节是否计入,文中没有充分拆分。
显存数字同样有边界。0.9 GB 是完整在线策略的峰值推理 VRAM——即显卡存放模型权重与中间计算结果所用的高速内存,不是训练显存,也不是机器人整套软件的总占用。不过它仍然重要:模型占得少,消费级显卡更容易承载它,也能给相机处理等任务留下余量。
在 LIBERO 的 40 个语言条件任务、共 2,000 次测试中,TurboVLA 平均成功率为 97.7%。对照论文采用的统一 RTX 4090 测量,3.4B 参数的对比模型为 96.9%、93.6 ms 和 12.8 GB;TurboVLA 则是 0.2B、31.2 ms 和 0.9 GB。它击中的不只是速度,而是性能、延迟和内存三者之间的部署取舍。
结果还延伸到更复杂的设置。在 RoboTwin 2.0 的 50 个双臂任务中,0.4B 参数版本取得 60.2% 平均成功率,推理延迟为 43.4 ms。研究团队也在 AgileX Piper 实机上测试了四项任务,报告成功率分别为 92.5%、80%、90% 和 87.5%。这些结果至少说明,这条直接路径不只在单臂基准上可用。
为什么值得关注
TurboVLA 最有意思的地方,不是又把模型压小了一点,而是重新划分了机器人的“思考”和“执行”。大语言模型适合处理开放式理解、规划和任务拆解;低层执行则可以由更轻、更快的专门控制器负责。论文给出的证据表明,在指令已经明确的操作任务中,后者未必需要每一步都绕经大模型。
这是一种架构判断:部署瓶颈不一定只能靠量化、剪枝或压缩缓解,也可以通过移除不必要的中枢来解决。若后续结果能够复现,VLA 的竞争标准也会从“成功率有多高”进一步转向“在什么硬件上、用多快速度、占多少内存完成”。
局限与未知
- 97.7% 是 LIBERO 模拟基准的平均成功率,不能外推为开放真实环境中的普遍成功率。实机实验也只有四项任务。
- TurboVLA 面向指令明确的执行层控制。论文明确承认,它可能不具备高层任务规划所需的复杂语义理解与推理能力。
- 31.2 ms 和 0.9 GB 来自团队自己的 RTX 4090 测量。代码虽由论文指向 GitHub 仓库
H-EmbodVis/TurboVLA,但发布状态、速度与显存结果仍待独立复现。