你让 AI 读一篇很长的文章,它为了省显存,会删掉一些看似不重要的旧词。但许多“小线索”加起来仍可能很关键,而且删掉一项,还会改变其他内容分到的注意力权重。KV Cache——模型保存上下文中间结果的“草稿纸”——过去一旦淘汰某个token,通常也就永久丢掉了它对后续回答的影响。
Zhan、Chen和Shang提出的 ResKV,把固定容量分成两部分:主缓存原样保留关键token;残差缓存则用少量条目,近似重建被删内容的聚合贡献。巧妙之处在于,残差条目直接参与同一次 Softmax 归一化——也就是把相关性分数变成总和为1的权重——因此补回的不只是内容本身,也包括被删除项原本占据的权重份额,同时不改写保留下来的精确记录。
作者报告,在相同KV预算下,ResKV改善了 LongBench 展示的全部32组配置,以及 RULER 的64组配置中的63组;其残差分配还会按层和注意力头验证,并在生成时动态调节。效果目前来自论文作者自述。