Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER H 4 约 1 分钟

HyWorldVLA让驾驶同时想像素与语义

HyWorldVLA先用像素教细节,再用潜表示抗噪,让驾驶预演兼顾画面与语义。

雨雾、光线变化或摄像头噪声,会让逐像素猜未来画面的驾驶模型分心;但若只看压缩后的抽象特征,又可能漏掉细节,也不容易解释。HyWorldVLA想兼顾两头:让自动驾驶既能看清未来画面,也能抓住真正影响动作的结构与语义。

它是一套VLA——把摄像头画面、文字信息变成驾驶动作的模型,并加入“世界模型”,也就是在内部预演接下来可能发生什么。最关键的设计在训练顺序:预训练时,它一边预测视频的潜表示——画面压缩后的内部数字,一边重建原始视频帧,用像素监督把细节钉牢;之后联合微调时,只预测更紧凑、较抗表面噪声的潜特征,再交给动作模块生成行驶轨迹。论文作者称,它在NAVSIM v1和v2基准上超过纯像素与纯潜表示方案;但现有材料未给出具体提升数字。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 学术板块