让 AI 反复查同一批资料,每次都从头读一遍很费算力。RAG(检索增强生成,先找资料再据此作答)因此会预存文档的 KV 缓存——模型读文档时留下的“阅读笔记”。再用量化把数值改成较粗的刻度,还能继续节省存储。但这篇论文提醒:笔记压得太狠,AI 可能悄悄换掉答题依据。
作者在 Qwen2.5-7B-Instruct、RGB 和 HotpotQA 上比较 BF16、INT8 与 INT4 缓存,并固定检索材料、提示词和生成方式。结果显示,INT8 在准确率与忠实度上接近未压缩基线;INT4 则不只让更多答案出错。即使筛出答案对错状态没有变化的样本,超过 90% 的忠实度变化仍朝坏的方向发展。这里的忠实度,是指答案能否由给定材料推出;模型也可能凭原有知识碰巧答对,却没有真正依据检索证据。
这种损伤在无关文档更多、检索片段更多时还会放大,不过检索深度实验只有三个档位,作者将其视为趋势性证据。对工程团队来说,结论很直接:评估离线量化 KV 缓存,不能只看压缩率和最终答案是否正确,还要检查回答是否仍有据可依。