和 AI 角色聊久了,画面常会像接坏的电影:人物刚做完动作,下一段就变脸、跳位置,镜头也突然一抖。DiVA 想解决的正是这个问题。它把视频生成模型——根据已有画面不断续写后续影像的系统——接入长期、开放式互动,让用户用语言或点击影响角色,而不是只观看一段预先确定的短片。
它最关键的设计,是不让一个模型从头硬撑到底。多模态大语言模型(MLLM,能同时理解文字和画面)先充当“调度员”,再把画面拆成等待、行动和过渡三段。角色说话和做动作后,Anchored Video Continuation(AVC,锚定式视频续写)会读取上一段动作,并把角色带回预设的高质量“锚点”状态,像每轮互动后重新站稳,避免小误差越积越多。这也让坐下再起身等大幅姿态变化,不必受语音同步的严格限制。作者称该方案能减少镜头抖动和身份漂移;不过现有材料未给出可独立判断实际优势的完整量化结果。