做视频模型,难点不只在“喂多少视频”,还在于哪些片段被留下、哪些被删掉。过去,这套挑选过程往往藏在实验室内部,外界看到模型,却看不清数据怎样塑造了它。VidaForge把这部分基础设施开放出来,让研究者不必先自建一整套流水线,就能检查和比较不同选择。
它把“数据配方”——从原始视频到训练集的一整套规则——拆成五步:导入、按场景切片、筛选、加注释和打包。每一步都保存结果、参数和单条样本的处理记录。比如研究者改变清晰度门槛时,可以复用此前的评分,不必从头处理,还能追溯某个训练片段为何入选。
最值得注意的是,作者用 Wan 2.1 和 V-JEPA 2.1 从头进行早期预训练时发现:覆盖面更广、质量较混杂的配方,在两类模型的下游测试中得分最高;但只看训练损失,结论会偏向别的配方。换句话说,“模型学得更顺”未必等于“最后更有用”。团队同时发布 VidaForge-3M,含 314 万个场景级片段、共 6475 小时;上述结论仍限于论文所设的早期预训练比较。