把模型权重从高精度小数压成 4 比特近似值,就像把每笔金额都四舍五入:单次偏差不大,但经过几十层计算,误差理应像传话游戏一样越滚越大。可现实中,训练后量化(PTQ——模型训练完再降低权重精度)往往只让性能小幅下降。这篇论文追问的正是:误差为什么没有失控?
作者比较了完整精度与量化模型逐层产生的隐藏状态——模型处理文字时在内部传递的“工作笔记”。关键发现是,预训练模型每一层新引入的误差,往往与前面继承的误差方向相反,两者会部分抵消;随机初始化的模型即使有近似的权重量化误差,也会更快积累隐藏状态偏差。这说明,抗量化能力不只是因为舍入前后的权重足够接近,而是预训练过程中形成了某种误差抑制结构。
剩余误差抵达 LM head——把内部表示转换成下一个词得分的输出层——之后,其几何结构还会优先稳定排名靠前、也就是模型最有把握的候选词。作者在 Qwen3、OLMo3、Gemma3 和 OLMoE 等模型及多种量化设置中验证了这两道机制。它为“量化为何有效”补上了机制解释,不过相关效果与结论目前均来自论文作者的实验。