让 AI 像接龙一样生成长视频,前面一点色差或动作偏差,都会被当成下一段的依据,越滚越大:画面可能逐渐变色,人物也像被“冻住”。FreqForcing 盯住了一个具体信号——频域,也就是把画面拆成不同变化速度的成分。作者发现,长期失真会伴随低频能量明显漂移;低频大致对应大片颜色、明暗和整体布局。
它的巧思是同时保留两套参照:锚点分支提供稳定的低频信息,像画长卷时不断核对整体色调;局部分支保留高频信息,也就是近期动作、边缘和细节。两者在频域中融合,既纠正整体漂移,又尽量不压住运动。该方法无需额外训练;作者称,它把只在 5 秒片段上预训练的 Self-Forcing 延伸到 2 分钟生成。120 秒测试中,其动态程度得分为 58.97,高于论文比较的其他免训练方法,但画质、主体与背景一致性并非各项最高,效果仍以作者实验为准。