Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
PAPER 约 1 分钟

量化KV也能逐请求监测风险

WitCert给KV量化装上运行时风险表,逐请求判断是否需要回退。

给 AI 的“草稿纸”压缩后,平均考试成绩没变,不代表每道题都安全:某个请求仍可能因舍入误差而答坏,系统却毫无察觉。WitCert要解决的正是这个盲点。KV Cache(模型保存历史信息的中间结果)量化能用更少比特节省显存和带宽;WitCert则在模型运行时,逐层、逐注意力头、逐生成步骤估算当前请求受损的上限。

它关注总变差距离,也就是压缩前后注意力分布移动了多少。关键做法是,在写入缓存时记录量化残差的分频段范数;这份简短“证据”不依赖尚未到来的查询,也不受位置旋转影响。系统据此生成上界证书——在明确假设下有数学保证的误差界;风险过高时,可回退到更精确的计算。论文还提供了适用于受控 INT8 量化的概率性证书,并为整条请求设定失败概率预算。

作者在 SGLang 服务框架中接入了这套监测与门控机制,并自述:在困难的 RULER 任务上,原始 fp8 量化得分从未压缩时的 79.7 跌至 22.8,门控后恢复到 79.7。它的意义不只是又一个平均分更好的量化方案,而是让系统第一次能问:眼前这一条请求,是否正在被压缩伤害。


供稿材料 SOURCES — 1

← 返回 2026-08-06 · 学术板块