Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER 约 7 分钟

TourPhysics:单图世界也要懂物理

从一张照片出发,让世界模型分清“换个角度看”和“真的动手改变”。

你拿手机绕着一把椅子走半圈,椅子没有变,只是你看见了它的侧面和背面。可如果你伸手推它,椅子的位置、接触关系和运动状态都会改变。对人来说,这两件事泾渭分明;对生成式 AI 来说,它们最后都表现为“下一帧画面变了”,很容易混为一谈。

TourPhysics 想解决的正是这个问题。它从一张图片出发,让系统既能移动相机、持续探索场景,也能推拉物体、模拟接触与形变。关键不只是生成一段看起来合理的视频,而是让镜头移动归镜头移动,物理变化归物理变化,并在多轮操作后仍保留同一个世界。

这项工作的全部结果目前来自作者发布的 arXiv 论文,尚无第二个独立信源。论文称 TourPhysics 扩展自团队的 PhysOmni,并将后者描述为一项“ACM Multimedia 2026 work”;这一说法本身没有进一步明确正式发表、接收或待刊状态。

一张照片,先搭出一个可操作的假设

单图建世界有一个绕不过去的难题:照片只展示一个视角。被遮住的区域长什么样,物体背面是什么形状,彼此相距多远,都没有唯一答案。TourPhysics 因而没有声称从照片中恢复“真实世界原样”,而是结合照片与一份声明式物理配置,搭出一个持续可控的物理假设。

所谓声明式配置,就是用户先说明“有什么、怎么动”,包括可控制的物体、材料类别、边界条件、外力、干预方式和相机动作。初始化时,系统分割选定物体,把它们提升为显式网格,并放进统一、考虑重力方向的场景坐标中。论文使用 SAM 3 和 SAM 3D Objects 获得物体蒙版与局部三角网格,再用 LaMa 补掉前景,留下相机移动时可供补全的背景底板。原始图片则始终保留,作为不可改写的外观参照。

这里的“世界模型”,可以理解为机器对环境变化的内部模拟器:给它当前状态和一个动作,它要预测接下来会发生什么。TourPhysics 让刚体、布料、弹性体、颗粒和流体代理分别走相应的模拟路线,以重力、碰撞、接触和材料形变等物理先验约束后续变化。

先把事情算完,再决定画面怎么长

TourPhysics 最重要的设计,是明确划分状态由谁说了算。

每次收到动作后,模拟器先复制当前已确认的状态,计算一个有限时间窗口内的物体轨迹和相机轨迹。轨迹一旦算好,生成器才据此合成视频观察。也就是说,视频模型负责把既定过程“拍出来”,不能在生成途中顺手改变物体位置、碰撞关系或场景几何。

这像是先由舞台监督排定演员走位和摄影机路线,再让摄影组完成画面。摄影可以补足灯光、纹理和未见区域,却不能临时改剧本。

每个窗口包含一个与上段共享的边界帧和 80 个新帧,共解码 81 帧。生成后还有一道质量门。只有观察通过检查,窗口终点的物理状态、相机状态和新增外观记忆才会一起提交;如果失败,候选结果全部丢弃,系统回到原检查点,用相同动作、轨迹、几何记录和控制条件重试,只允许更换采样随机种子。

这个“原子提交”很关键。它避免生成失败时,物理世界已经偷偷向前走了一步,也避免坏画面混进记忆,污染后面的生成。论文所称的在线框架,指的就是这样一轮轮执行“模拟—生成—检查—提交”,而不是一次性吐出整段视频。

两种深度,各管一件事

TourPhysics 还刻意维护两套深度表示。

第一套是模拟器一致的度量深度,即带有场景尺度含义的空间距离。它负责投影、遮挡判断、跨视角对应和轨迹评估,也决定哪些表面在某个机位真正可见。第二套是提供给视频生成器的相对深度,只表达前后层次,不承担物理裁决。

为什么要分开?生成模型需要的是有利于合成画面的条件,模拟器需要的却是稳定的空间证据。若让生成画面反过来改写碰撞几何,模型一次看似自然的补全,就可能变成下一轮错误的物理事实。TourPhysics 允许已接受的观察补全生成器所用的深度控制,但明确禁止它覆盖模拟器深度、碰撞表面或物理状态。

重访旧地方,不能每次换一张脸

长时间生成还有一种常见故障:模型绕场景走一圈再回来,墙面纹理、物体颜色或局部细节已经悄悄漂移。只靠相邻帧缓存,错误也可能被一路传下去。

TourPhysics 因此保留原始图片作为永久锚点,并为已经接受的静态区域建立外观记忆。系统借助几何跨视角对应,判断新视角中的某个位置是否能可靠对应到旧视角里的同一表面。只有可见、静态、深度一致且置信度足够的区域才能读取历史信息;移动或发生形变的物体被排除。

历史特征也不会直接接管生成。论文采用“有界残差”:可以把它理解为在生成器原本结果旁边加一笔受限修正。没有可靠对应时,这笔修正严格归零,系统退回原生的参考图条件路径。这样,记忆负责提醒“这里以前长什么样”,但不能凭模糊匹配强行复制旧画面或改变当前布局。

为什么值得关注

这项工作的价值,不在于把物理模拟器简单接到视频生成器前面,而在于给不同信息划定权限:模拟器拥有物理状态,模拟器几何拥有空间判定权,生成器负责外观,只有通过检查的观察才能进入记忆。

这套分工正面回应了单图世界的核心矛盾。移动相机只扩展系统对同一场景的认识;推、拉、碰撞才改变物理状态。TourPhysics 把两者写进同一个持续循环,而不是把所有变化都交给视频模型猜。

论文的评测包含 108 条由模拟器定义的交互序列,来自 61 个源图像身份,覆盖纯相机漫游以及刚体、布料、弹性体、颗粒和流体代理的操控。作者将其与 LingBot-Cam、LingBot-Act、minWM-Wan、Wan2.1-I2V、Sora-2、MotionCtrl 和 Tora-Initiator 等系统比较,并声称 TourPhysics 更贴合预设的相机与物体轨迹,更能保留输入场景,也减少了长程重访时的外观漂移。

局限与未知

  • 上述优势均为作者在单篇论文中的比较性结论。现有材料没有给出对应实验表格、具体指标、提升幅度或统计显著性,因此不能视为已经独立验证。
  • 系统从单图建立的是一个受配置约束的物理假设,不是对遮挡几何、真实尺度和材料参数的唯一恢复。初始假设若有偏差,后续一致性只能保证围绕这套假设展开。
  • 论文使用“persistent exploration”和“long-horizon”等表述,但材料没有给出统一的时长边界。质量门也主要检查可解码帧数、黑帧、边界跳变和冻结运动等问题,并不等同于全面验证物理真实性。

供稿材料 SOURCES — 1

← 返回 2026-09-10 · 学术板块