让 AI 看一段带声音的长视频,它不仅要记画面和对话,还要保存大量中间计算结果。这个“草稿本”叫 KV 缓存:免去生成时反复重算,却会随输入变长迅速吞掉显存。论文称,一分钟音视频就可能超过 1 万个输入片段,缓存甚至会比模型参数更占内存。
OmniKVQuant 把文本大模型常用的缓存量化——用更少比特、较粗刻度保存数值——扩展到同时处理音频、视频和文字的 Omni-LLM。关键不只是压缩,而是分别处理两类差异:模型的“键”会随时间漂移,因此每 32 个片段重新确定量化范围;“值”在不同模态中的结构不同,因此为文字、声音和画面分别校准旋转方式。它无需重新训练模型。
作者在 Qwen2.5-Omni 和 Qwen3-Omni 上把 KV 缓存压到 2 比特;其中 Qwen2.5-Omni 在七项音视频基准上保留了 FP16(16 位精度)平均表现的 98.1%。不过实验受 FP16 显存限制,只评测了最长一分钟的样本。