你把桌上的支撑物抽走,杯子应该落下。视频模型若能生成杯子坠落的画面,它是真的理解了“失去支撑会下落”,还是只见过太多相似镜头,顺手续写了最常见的下一幕?这正是论文《Thinking in Video》要拆开的疑问。它不再只看视频是否逼真,而是分别检查模型能否认出因果关系,以及能否把相应后果稳定地画出来。这个问题值得现在看,因为视频生成正被赋予更大的角色:不只是制作画面,还要充当可以预演现实的“世界模型”。本文所述结果均来自论文作者的一项研究,尚无代码、第三方复现或其他独立信源可供交叉核验。
好看的下一幕,不等于想明白了
世界模型(World Model)可以理解为一套内部预演机制:给定当前状态和某个行动,它要预测世界接下来怎样变化。视频天然适合承载这种预演,因为它能把变化直接铺在时间轴上。
但问题也恰恰在这里。视频生成模型会根据文字、图片或前几帧合成后续画面,擅长复现常见的外观与运动规律。画面流畅,并不能自动证明它掌握了事件为何发生。因果推理要求更高:改变一个条件,结果也应随之系统性改变。拿走支撑物与保留支撑物,不能通向同一个结果。
作者把这种更强的用法称为 Thinking in Video——“用视频思考”。在这个设想里,视频不只是答案的包装,而是构建、延展和检查因果思路的媒介。论文没有直接接受这个设想,而是提出一套 Causal-Generative Dual-Judge(CGDJ,因果—生成双重评判)来审计所谓的 World Model Consistency,也就是模型理解的因果规律,是否与它生成的未来一致。
一道题,分成“会说”和“会做”
CGDJ 的关键不是发明另一种画质分数,而是把能力拆成两关。
第一关叫 Explicit Causal Perception,即显式因果感知。它问:模型能不能先看懂眼前发生了什么,并指出正确的因果进程?研究采用 Video-MME 的全部 900 段视频,覆盖短、中、长时长,以及知识、生活记录、体育竞赛、艺术表演、影视和多语言六类内容。
视频生成器通常不能像多模态大语言模型那样直接接收交错的视频与文字问题。作者因此设计了 Flatten Temporal Video:均匀抽取多帧,把它们按时间顺序排成一张网格,再把问题和选项渲染成图片中的文字块,放在网格上方。说白了,就是把“看一段视频再答题”改造成“一次看完一张带题目的连环画”。模型生成的视频中若带有口头答案,研究还用 whisper-large-v2 转写音轨,再交给 Gemini-3-Pro,结合原题、标准答案和生成画面判断对错。
为检查这种展平方式是否丢失了太多信息,作者还让 Qwen3-VL-Instruct 的 2B、4B、8B 版本,以及 GPT-5、Gemini-3-Flash 分别读取原生视频和展平图像。视频生成模型则统一使用展平输入;受测者包括开源的 Wan-2.2-14B、HunyuanVideo-1.5,以及通过官方 API 使用的 Veo-3.1 和 Sora-2。
第二关叫 Implicit Generative Prediction,即隐式生成预测。它不让模型选答案,而是要求模型把因果后果真正生成出来。数据包含 600 段视频,自然科学与社会人文各 300 段。前者涉及物理力学、生命科学、材料结构、场与能量;后者涉及交通、生活、职业、公共行为和体育活动。
标注者为每段视频人工确定“因果拐点”——条件积累到足以触发事件或状态变化的时刻。拐点之前是输入,之后的真实录像是 Gold Video,也就是参照答案。模型根据前半段关键帧和由 Gemini-3-Pro 生成的详细描述续写未来。评判时,Gemini-3-Pro 将生成结果与真实后半段比较,检查对象和动作是否正确、事件发展是否一致,以及有没有闪烁或物理违背。论文原文在所供材料中未完整呈现评分区间,因此这里不补写具体上下限。
最大的裂缝:模型会续写,却未必会判断
据论文作者报告,Wan-2.2-14B 和 HunyuanVideo-1.5 等开源模型在显式因果感知测试中接近失效,却仍能生成“中等程度上看似合理”的因果续篇。作者把这种错位称为 Perception-Prediction Gap:模型在明确判断一道因果题时表现很弱,但落实到动态画面时,表面上又像是做对了一部分。
这组现象有两种解释。乐观的解释是,生成器掌握了某些难以用明确答案表达的动态知识。更谨慎的解释则是,它记住了高频的视觉搭配:玻璃之后常跟着碎裂,失衡之后常跟着跌落。仅凭一段顺眼的 rollout——也就是模型向未来展开的视频——无法区分这两者。
论文称,Sora-2 和 Veo-3.1 等闭源系统的显式感知与生成预测更一致,但整体对齐仍然有限。材料没有给出具体分数,因而不能把“更强”解释为已经具备可靠推理,也不能据此概括所有开源或闭源模型。
研究还发现另一道裂缝:模型用语言说出正确因果逻辑,比把该逻辑稳定渲染为视频更可靠。论文称之为 audio-visual misalignment。这里并不是传统意义上的声音与口型不同步,而是“嘴上知道结果,画面却没有做到”。它提醒我们,知道一句规则、选对答案和在连续像素中维持物体、动作及后果,是三种不同难度的能力。
为什么值得关注
过去常见的感知质量评测主要看清晰、自然和流畅;语义逻辑评测则看事件与关系是否合理。一段视频可以在前者表现很好,却让物体凭空变化,或漏掉关键物理后果。CGDJ 的价值,在于把“看起来像未来”和“因果上是这个未来”明确分开,再检查模型的理解与生成能否彼此印证。
这并未证明视频生成器不可能成为世界模型。它只是削弱了一条常见的捷径:不能因为模型会产出有说服力的下一幕,就直接断言它在内部模拟了现实。现有系统可能已经学会世界动态的一部分,较强模型也开始缩小理解与生成之间的距离;但论文提供的证据仍不足以把逼真续写等同于稳健的因果推演。
局限与未知
- 所有结论来自同一篇论文。材料虽称代码和数据将公开,但未提供第三方复现,自动裁判与人类判断的具体验证结果也未出现在所供正文中。
- 现有材料没有披露完整成绩表、统计显著性或“接近零”的数值阈值。开源与闭源比较还可能受模型选择、输入接口、提示策略和版本不可复现影响。
- 展平视频解决了生成器不能直接读视频加文字的问题,却也改变了任务形态。虽然作者用多模态模型比较原生视频与展平输入来检查信息保留,所供材料没有给出这项比较的具体结果。