Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.030 — 2026-08-03
PAPER H 4 · HF 160 约 7 分钟

PhiZero:用物理语言预测世界

PhiZero先用离散“物理语言”推演状态变化,再生成画面,为世界模型探索非像素路线。

PhiZero:用物理语言预测世界

你把一只球推向桌边,让 AI 接着生成视频。画面可能很逼真,球却没有按预期掉下去。问题在于,直接续画下一帧,不等于真正掌握“球移动、越过边缘、随后下落”这串变化。

PhiZero 想换一种做法:先用一套紧凑的离散符号推演世界如何变化,再把推演结果画成视频。作者称这套符号为 physical language(物理语言)。它不是写成公式的物理定律,也不是给人阅读的自然语言,而是模型从视频中学到的状态转移编码。

这条路线值得关注,因为它把“想清楚会发生什么”和“把画面做出来”拆成了两件事。不过,本文所有结果都来自 PhiZero 论文,尚无独立复现;论文中的“物理一致”仍主要是作者依据现有基准作出的判断。

先推演,再作画

世界模型(World model),可以理解为让 AI 在内部预演“采取某个动作后,环境接下来会怎样”。许多相关方法直接在像素空间预测未来,也就是逐格生成画面。这样能保留丰富的视觉细节,但物体、运动和因果关系都藏在大量数值里,很难单独拿出来推理。

PhiZero 的核心是 reason-then-render:先推理,再渲染。模型先根据当前画面和文字描述的动作意图,预测一串物理语言;随后,视频生成器依据当前画面和这串符号生成未来视频。

可以把它理解成拍电影前先写动作分镜。分镜只规定“什么发生了变化”,不必重新描述墙面纹理或杯子颜色;具体光影和材质留到拍摄阶段处理。PhiZero 也试图让符号专注于变化,把静态外观交给第一帧和已有的视频生成能力。

这里的“语言”容易引起误解。它使用的是 离散表征——把连续、复杂的视频变化编码成有限符号。符号由模型自己学习,并不保证某一个符号就能被人直接翻译为“碰撞”或“倒下”。它更像机器内部使用的紧凑词表。

这套“词表”怎么学出来?

PhiZero 包含两个主要部分。

第一个是 Physical Language Tokenizer(物理语言分词器)。它观察视频中相邻时刻的状态,把每段局部变化压缩为离散符号。训练不需要人工逐条标注,而采用 自监督学习:模型从视频本身构造学习目标,再尝试重建原视频。

为了避免符号把背景和纹理也一股脑记下来,系统同时提供视频第一帧,并使用预训练的 Wan2.2-5B 扩散模型作为解码器。第一帧负责固定场景外观,解码器负责补回细节,容量有限的符号通道因而更有动力记录状态变化。训练初期,作者还把未来帧潜变量全部换成纯噪声,迫使解码器依赖物理语言,而不能只靠原有的去噪能力走捷径。

数据方面,作者从约 5 万小时真实视频开始,去重并过滤损坏画面、水印和突然转场等问题,得到约 1 万小时无标注视频用于预训练。之后再结合筛选过的真实与模拟视频,组成约 500 万段、每段 4 秒的素材进行微调。

第二个部分是 Physical Language Reasoner(物理语言推理器)。它以 Qwen3-VL-4B 为起点,读取第一帧和文字动作意图,按顺序预测物理语言符号。训练标签不由人书写,而由已经冻结的分词器从视频中提取。其训练同样分两步:先使用约 500 万段通用素材,再使用约 100 万段运动明显、物理变化更丰富的素材做专门微调。

紧凑表示真的够用吗?

论文用 500 段四秒真实视频测试重建。PhiZero 用 256 个离散符号表示第一帧之后的状态变化,PSNR 为 28.9、SSIM 为 0.903。相比之下,Wan2.2 VAE 的重建质量更高,PSNR 达 37.7,但使用了 44,800 个连续视觉 token。与同属高压缩路线的方法相比,PhiZero 在论文列出的重建指标上最好。

这个结果不能说明 256 个符号包含了完整世界状态。它说明的是:在第一帧和预训练解码器共同提供外观信息时,一小串离散符号足以支持较高质量的视频重建。

消融实验也支持这种分工。换掉预训练扩散解码器后,PSNR 从 28.9 降到 26.6;取消纯噪声预热后降到 27.9。也就是说,物理语言并非单独完成全部工作,它依赖第一帧与生成器补齐视觉细节。

基准成绩说明了什么?

在 Physics-IQ Verified 上,PhiZero 的 IQ-Score 为 41.2,高于表中次高的 Cosmos3-Super 39.5,也明显高于其解码器基础模型 Wan2.2-5B 的 21.2。该基准用规则指标比较生成视频与真实参考视频的物理结果。

在 PhyGround 上,PhiZero 的 Physics Score 为 3.01,是表中最高;总体分为 2.97,略高于 Wan2.2-14B 的 2.95。值得注意的是,它的一般画质得分为 2.93,低于 Veo3.1 的 3.01和 Wan2.2-14B 的 3.00。结果更像是物理表现与视觉质量之间的侧重变化,而不是所有维度都领先。

PhiZero 还把物理语言用于视频理解:分别编码一对“合理视频”和“违规视频”,再看推理器认为哪一串符号更可能出现。在论文给出的其中一项理解结果中,它的总体分为 56.34,高于 Gemini-2.5 Flash 的 55.63,但在 Hard 子集上为 52.38,并非最佳。这说明优势存在,但幅度有限,也不均匀。

为什么这条路线值得看?

PhiZero 最有意思的地方,不是又生成了一批更逼真的视频,而是提出了一个可复用的中间接口。作者把一段视频的物理语言保留不变,只替换第一帧中的主体或外观,再让解码器重建。论文展示了倾倒、黏性铺展和液体流动等变化跨外观迁移,也展示了把人体或手部动作迁移到不同机器人形态,以及从模拟画面迁移到真实风格的案例。

同一个接口还可以接收连续控制信号。论文在自动驾驶和机器人操作场景中展示了不同转向幅度、夹爪动作及连续视角移动。不过这些属于能力演示,适合视为应用线索,不能据此断言系统已经能承担可靠的交互式模拟。

更长远的启发是:世界模型未必只能靠不断扩大视频生成器来获得物理能力。也可以先把“世界如何变化”压缩成一种专门表示,让预测发生在这个空间,再把结果翻译回画面。PhiZero 给出了这条路线的一套完整实现。

局限与未知

  • 所有效果都来自同一篇论文,尚无第三方评测或独立复现;“物理一致”不能仅凭作者展示的案例下定论。
  • 物理语言是机器学习到的符号,不是可直接阅读的物理规则。论文展示了聚类结构与迁移现象,但没有证明每个符号具有稳定、清晰的人类语义。
  • 当前实验主要处理四秒视频。材料没有给出更长时间推演时的误差累积、稳定性和计算成本,因此其长期模拟能力仍不明确。

供稿材料 SOURCES — 1
01
PhiZero: A World Model Built Around Physical Language arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-03 · 学术板块