本地跑大模型时,聊得越长,显存越容易吃紧。一个主要原因是 KV 缓存——模型保存先前文字的注意力中间结果,免得每生成一个词都从头计算。BeeLlama.cpp v0.4.0 给这块“草稿纸”增加了 q2_0 到 q3_1,以及 q6_0、q6_1 等量化格式:用更少的比特记录数据,换取更低的内存占用。位数越低通常越省,但误差也可能增加,不能只看格式名称判断是否划算。
这次更新值得看,在于作者 Anbeeld 没把“格式更多”直接等同于“效果更好”,而是用 Qwen 3.6 27B 和 Gemma 4 31B 做 KLD 基准测试,衡量量化前后输出分布的偏差。作者还据此前测试移除了 TurboQuant,理由是它相比普通量化没有带来精度提升;TCQ 虽有一定价值,却要付出明显性能成本。新版同时完善了 KVarN——一种按方差归一化的 KV 缓存量化。作者称,它在相同比特宽度下精度更高,且对预填充、生成速度和内存的额外影响很小或没有;但在 Gemma、GPT-OSS 使用的 SWA 架构上仍未达到生产可用状态。供稿未给出各格式具体节省比例和精度数字,因此目前更适合把它看作一份有基准依据的工程选项扩充。