Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
PAPER H 10 约 1 分钟

视频LLM答对了,未必真的看了视频

审计20个视频模型:答题正确率高,不等于答案真的依赖画面。

让 AI 看一段视频再答题,它答对了,不一定真“看懂”了:题目措辞、语言常识或数据偏差,也可能泄露答案。Jae Joong Lee 审计了20个、横跨10类架构的视频 LLM——把视频画面与问题一起交给语言模型的系统,发现榜单正确率与真实的视觉依赖可能是两回事。

作者提出 Visual Dependency Gap(视觉依赖差距):比较同一道题在原视频和黑屏下的对错变化,并用 McNemar 检验判断这种成对变化是否显著。更反直觉的是,在16个开放权重模型中,从黑屏、单帧、打乱帧到原视频的逐级测试显示,多样的画面贡献了大部分收益,帧的时间顺序带来的正确率提升接近于零;把采样率从每秒0.5帧提高到24帧后,这一现象仍然存在。

这意味着,一个模型即使在“时间推理”题上得分不错,也可能主要靠文字线索或零散画面,而非理解事件先后。论文因此建议,视频榜单除了报总正确率,还应加入黑屏等反事实检查,确认答案能否追溯到视频证据。


供稿材料 SOURCES — 1

← 返回 2026-07-19 · 学术板块