给视频模型一张人物照、一段动作,再指定一个场景,它可能每样都“看懂”了,合成后却把动作套错人,或悄悄改了长相。OmniVBench想为这类参考到视频生成建立统一考卷:也就是检验模型能否按人物、物体、动作、风格等参考素材生成视频,而不只听一句文字描述。
最值得注意的是,它没有只算成片与参考素材“整体像不像”,而是为具体案例拆出检查清单,逐项确认身份、动作和背景是否保留,彼此有没有串扰,又是否被准确用到目标对象上。论文称,这套基准覆盖7类任务、18项细分任务,共含12,172条案例专属检查项;同时发布34万条处理后的训练样本。作者测试多款开源与闭源模型后称,不同任务和评分维度仍有明显差距,但所给材料未披露具体排名与分数。