把模型数字压到4比特,像把连续色阶缩成约16档。问题是,少数特别大的激活值——模型运算中的中间数字——会拉宽整把“尺子”,让普通数值挤在有限档位里。W4A4同时压缩权重和激活,因此尤其容易失真。Narita 与 Sato 的工作,试图解释这种误差究竟该从哪里下手。
他们把单层的局部量化误差精确拆成两部分:一部分是“激活引导的权重补偿”,可通过调整量化权重减小;另一部分是正交残差,在变换方式固定后,单靠调权重无法消除,必须重新设计坐标变换。分析还指出,随机符号能抑制多个持续异常通道彼此叠加,尝试多组符号再择优,也可能改善旋转效果。这里的正交旋转,就是在不丢失原始信息的前提下换一套坐标,把极端值摊开。
作者称,这套理论指导的配置无需反向传播,在8个Llama和Mistral模型上可与需要梯度训练的SpinQuant竞争;但论文讨论的是单层局部重建误差,不能直接等同于对整套模型失效机制的完整解释。