长对话越聊越慢,不只是因为 AI 要“想”得更多,也因为它得反复翻阅越来越厚的笔记。KV 缓存——模型保存旧词中间结果的“速查本”——会随上下文增长,读取本身就可能拖慢生成。GLIDE 的思路是:别让模型每一层都用同一种翻阅方式。
作者发现,前层对精确注意力更敏感,后层则更能承受近似处理。于是 GLIDE 让前层保留较完整的滑动窗口注意力——精确查看附近文本;越往后,越多采用线性递归聚合——把较早历史压成持续更新的摘要。这样既保留关键层的细致查找,也减少整体 KV 缓存读写和计算。
据作者在 Llama-3-8B、Mistral-7B 及六项推理基准上的实验,GLIDE 接入 Liger、LoLCats 后,最多减少 62% 的 KV 缓存 I/O,并实现 3.3 倍解码加速,同时保留基线 92%—94% 的准确率。结果尚属论文自述,但“不同层不必一刀切”是这项工作的核心信息。