看一段长视频时,关键线索未必在画面里:门外响起警报、人物停下动作,合起来才说得清发生了什么。AV-Flamingo正是为这种任务设计的音画联合模型——同时利用画面和声音,并记住相隔较远的事件,而不是只“看”几个短片段。
它最值得注意的一步,是把音频和画面按时间切成同步片段,再依照时间戳交错送入语言模型。音频由滑动窗口分成互不重叠的30秒片段,因此长录音不必直接截断;推理时,中间步骤也会对应到具体时间点,方便模型梳理“先发生什么、后发生什么”。团队还整理了700万条描述和问答训练实例,其中包括480万组问答,用三阶段训练把模型从短距离感知逐步带到长视频、多事件推理。
作者称,AV-Flamingo在15项以上相关基准中优于相近规模的开放模型,并开放模型、训练与推理代码;这些效果目前仍以论文自述为准。