让 AI 学开车,不只是认出画面里有行人和车辆,还要判断它们在三维空间中的位置,接着规划自己怎么走。Qwen 释出的 Qwen-Drive-1.0-4B,正尝试用一个约 40 亿参数的视觉语言模型(VLM——同时理解图像和文字的模型),把这些步骤串进同一套框架。4B 的规模相对较小,因此更值得车端开发者关注,但模型小并不等于驾驶可靠。
它最具体的设计,是在共享的模型表示之外接入一个鸟瞰视角(BEV)感知模块:像从车顶上方向下看路,同时完成三维物体检测、空间占用预测和地图分割。这个模块不只提供空间信息,也给研究者留下一个可检查的接口,看看模型究竟理解了怎样的道路结构。另一套 Planning Expert 则据此生成车辆未来轨迹。
Qwen 采用分阶段微调——在通用模型上继续用驾驶数据训练,并混入通用视觉语言数据,以尽量保留原有的图像理解和指令跟随能力。作者称其在多种测试设置中展现出有竞争力的运动规划表现;现有材料未给出具体分数或真实道路部署结果。