让 AI 接龙生成几分钟视频,开头一个小偏差,往后可能变成换脸、背景漂移或镜头布局失控。过去的 Self Forcing 会让模型用自己生成的片段继续训练,减少“练习时看真视频、上场时看自己输出”的错位;但这些旧片段一旦写入 KV 缓存——供后续画面读取的临时记忆——就被冻结了。后面出了错,只能教模型怎样读记忆,不能反过来教它怎样把早期内容记得更有用。
Self Gradient Forcing(SGF)用两遍训练补上这条反馈路径。第一遍照实际生成过程向前滚动,不计算梯度,只记下自生成历史和某个去噪步骤的输入;第二遍并行重算这些历史的 KV 表示,让未来画面的损失能够修正“写入记忆”的方式,同时避免为整段串行生成保留庞大的计算过程。作者称,SGF 在 5 秒视频上与 Self Forcing 相当,在 60 秒和 240 秒外推中则更能维持人物身份、背景布局与时间稳定性;仅用 5 秒训练窗口也能生成数分钟视频。这些效果目前均来自论文作者的实验。