Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.019 — 2026-07-23
PAPER 约 1 分钟

自动驾驶学会慢想快做

让大模型每秒想5次、小模型每秒控车20次,兼顾路况理解与及时反应。

开车时,想清楚路线可以慢一点,但看到红灯、修正方向不能等。传统自动驾驶大模型若来不及处理新画面,只能重复上一条指令。论文把这两件事拆开:70亿参数的视觉语言模型负责低频理解导航和路况,每秒运行5次;较轻的动作模块每秒运行20次,根据最新画面持续预测路径点。

两者靠 KV Cache 连接——它像慢速模型留下的“思考笔记”,动作模块可以直接读取,不必每次重算全部历史。由于笔记可能稍旧,训练时还会随机模拟信息延迟,让动作模块学会结合当前画面补偿。

作者在 CARLA 模拟器的 LangAuto-Short 路线上报告:系统每50毫秒产生一次新控制,路线完成率从跳帧基线的37.0升至94.0。只比较同一动作模块时,把控制从10 Hz提高到20 Hz,也让完成率从82.1升至94.0,并使闯红灯次数减少约三分之一。结果来自两次运行,说明方向很实用,但稳定性仍需更多实验确认。


供稿材料 SOURCES — 1

← 返回 2026-07-23 · 学术板块