Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER H 41 约 7 分钟

动作中途变了,世界模型也能接住

ActionSplice让世界模型在视频生成途中接住新动作,不必等下一段,也不用回滚重算。

你正操控一个由 AI 实时生成的世界:镜头向前移动,你忽然要求它左转。画面却还要沿旧方向走完这一小段,下一段才肯转弯。问题不一定是视频生成得慢,而是模型无法在生成途中及时改主意。

ActionSplice处理的正是这段控制延迟。它让交互式世界模型在一个视频块尚未生成完时接收新动作,修正正在计算的内部状态,再从原进度继续生成。模型不用等到下一个视频块,也不用退回起点重算。论文作者将这种能力称为“in-flight action editing”,即生成途中的动作编辑。

以下结果均来自ActionSplice论文作者的实验。论文没有提供独立复现,部分实验规模、硬件和指标口径也需结合具体设置理解。

视频很快,为什么操作仍会迟钝?

世界模型(world model)会根据当前画面和动作预测下一幕,像是在脑中预演接下来会发生什么。这里的模型用它实时生成可交互的视频环境。

这类系统常采用“分块自回归”方式:先生成一小段视频,再接着生成下一段,类似一句一句续写故事。一个视频块通常绑定一个动作。模型还要经过多轮“采样”或“求解步骤”,逐渐把内部表示变成可显示的视频。

于是,一个新动作如果在这些步骤中途到达,系统面前有三种不理想的选择。

第一,等到下一块再执行。计算没有浪费,但操作反馈来得晚。第二,直接把后续计算的条件换成新动作。这样最快,可内部状态已经被旧动作塑形,像车身仍朝前,却突然把导航目的地改到左边,轨迹容易接不上。第三,完整回滚:回到这一块的开头,按新动作重新计算。结果更接近“如果一开始就收到新动作”的情况,却要重复已经完成的工作。

ActionSplice选择第四条路:不重跑过去,而是把当前状态搬到新动作本应到达的位置。

不重来,先把状态“扶正”

论文把这个问题表述为Counterfactual State Transport,简称CST,可译作“反事实状态迁移”。反事实问的是:如果其他条件完全相同,只把旧动作换成新动作,模型在当前求解步骤本来会处于什么状态?

训练时,研究者会真的执行回滚,构造一对严格匹配的状态。两条分支使用相同的提示词、初始状态、已确认历史、求解进度,以及适用时相同的随机输入;唯一差别是动作。旧动作分支给出需要修正的状态,新动作分支给出目标答案。

一个轻量级corrector——专门校正中间状态的小模型——据此学习两者之间的差值。推理时,新动作中途到达,corrector只需做一次校正,把旧轨迹上的内部表示推向同一步骤的新轨迹。随后,原世界模型从这里继续完成剩余计算。

关键在“同一步骤”。ActionSplice既不把成品视频事后修饰一下,也不重新生成整个视频块。它直接修改主模型原生、可恢复计算的内部表示。不同世界模型的内部状态并不相同,因此论文分别为每个主模型和编辑方式训练corrector;corrector权重不能直接跨模型复用。世界模型与采样器本身则保持冻结,不需要修改或重新训练。

整段改道,还是只改后半段?

ActionSplice提供两个版本。

CST_R是整块重定向。比如左转指令突然到达,而且用户希望它立即影响当前视频块,corrector就更新这一块的全部活动状态。

CST_T是时间拼接。它保留视频块前半段已经属于旧动作的部分,只修正指定时间边界之后的后缀。可以把它理解为剪辑时锁住前几帧,再让后面的镜头改走新路线。论文使用硬掩码——明确禁止模型修改前缀——来保证这部分在收到动作时原样保留。

消融实验支持了这两个设计。去掉硬掩码后,前缀保持和动作边界的连续性都变差;如果训练时不再使用只差动作安排的匹配状态对,各项报告指标均明显恶化。这说明corrector并非只要见过“旧动作变新动作”就够了,它需要尽量排除场景、历史和随机性等其他差异,才能学到真正由动作改变引起的状态迁移。

数字说明了什么?

作者在minWM–Wan Action2V和HY-WM1.5两个独立实现的世界模型上测试。两者都使用四步采样器。数据按提示词划分为150个场景,其中120个用于训练、30个留作评估;不同动作转换和时间边界经过平衡。计时分别在NVIDIA A100和H100上完成,因此只能在同一主模型内部比较。

先看整块重定向。相较于只替换动作条件、却不校正当前状态的做法,CST_R在两个模型上的rollback-relative LPIPS分别下降61.5%和75.9%。LPIPS用来衡量两段画面在感知特征上的差异,这里参照的是完整回滚产生的反事实轨迹,通常越低表示越接近该参照。换句话说,ActionSplice保留了直接换条件的快速响应,同时更接近“从头按新动作生成”的结果。

再看只改后缀的CST_T。它相对直接换条件,在两个模型上的suffix LPIPS分别下降56.1%和77.5%。作者还报告,它相较于等待下一视频块,在pixel-ready latency——第一帧响应新动作的画面准备完成所需时间——上分别获得2.73倍和1.69倍加速。这个数字不是系统整体吞吐量,也不能泛化为固定的端到端延迟改善。

在人类盲标的HY-WM1.5实验中,CST_RCST_T的动作跟随率分别为94.7%和100%,平均陈旧帧数分别为1.05帧和0.40帧;完整回滚参照均为100%和0帧。五次连续动作更新的测试中,corrector只在三次中断的轨迹上训练过,但两个版本在每次中断后的各项报告指标上仍比直接换条件更接近连续完整回滚。

为什么值得关注?

实时生成不只关乎每秒能产出多少帧,还关乎系统多久真正听从用户。以前,一段视频生成得再快,只要动作必须卡在视频块边界生效,交互仍会有明显的节拍感。ActionSplice把控制粒度从“每个视频块一次”推进到“视频块生成途中也能改”。

它的价值还在于工程路径相对克制:保留现有世界模型和采样器,只在中间增加一个针对特定主模型训练的校正器;完整回滚只负责生成训练目标和评估参照,实际推理不执行回滚。这让它更像一个可附加的推理框架,而不是要求从头设计世界模型。

局限与未知

  • 所有效果数字目前都来自同一篇论文。虽然作者称代码和训练后的corrector权重已开源,材料没有提供第三方复现;结果能否推广到更多模型、动作类型和交互场景,仍需验证。
  • CST_RCST_T使用的主要LPIPS口径不同:前者是rollback-relative LPIPS,后者是suffix LPIPS,61.5%与56.1%等数字不能直接横向比较。
  • corrector需要针对每个主模型和编辑类型分别训练,且训练依赖完整回滚构造的配对状态。论文展示了推理时节省重算,但这套监督数据的生成成本以及扩展到更多控制方式的成本,仍是实用化时需要衡量的问题。

供稿材料 SOURCES — 1

← 返回 2026-09-12 · 学术板块