你把一张高清照片压缩后,肉眼看不出差别,通常就会说它“没有损失”。大模型量化也面临类似问题:用更少的位数保存模型权重,可以降低内存、存储和计算成本,但压缩后的模型究竟还算不算“原来那个模型”?这项工作试图把答案从“跑分看起来没怎么掉”,推进到可检验的“统计无损”。这里的无损并非每次计算、每个输出都完全相同,而是量化前后的差异小到无法与正常的随机波动可靠区分。
不过,目前供稿只有一篇 Reddit 帖文对论文的转述,没有论文正文、实验表或独立复现。下文涉及的定义、数字与结论均来自这一单一信源,应视为作者团队主张,而非已经交叉验证的事实。
先问清楚:什么叫“没损失”?
常见的 GPTQ 和 AWQ 都属于训练后权重量化方法。前者通过近似误差优化来减少压缩损失,后者借助模型运行时的激活信息保留重要权重。它们追求的是实用压缩,并不保证量化后与原模型等价。
据帖子转述,论文提出了三种互补的“无损”概念,但供稿节选只完整说明了两种,第三种并不清楚。
第一种是 task-lossless,即“任务无损”。它比较量化前后模型在零样本评测中的准确率。零样本评测,是不给模型额外示例或训练,直接让它完成任务。如果准确率差异仍处在自然采样方差内,论文便把它视为任务无损。
这并不意味着模型在所有任务上都一样,也不意味着每个 token——模型生成文字时逐个选择的基本单位——都会相同。它只说明:在所选评测和统计标准下,跑分差距没有明显超过自然波动。
第二种是更严格的 distribution-lossless,即“分布无损”。模型每生成一个 token,都会给候选项分配一组概率。分布无损要求量化模型的“下一个 token 概率分布”与原模型在实践中难以区分。换句话说,它不只看最终答题分数,还检查模型每一步的选择倾向有没有被压缩悄悄改变。
EAR 把“有多像”变成一个数
论文提出 Expected Acceptance Rate(EAR,预期接受率)衡量这种保真度。帖子将它定义为:在 optimal coupling(最优耦合)下,两个概率分布能够取得的最大 token 一致概率。
可以把它理解为给两副略有不同的牌设计一种最有利的配对方式,看最多有多少次能翻出相同的牌。EAR ≥ 0.99,表示在这种最优配对条件下,理论上可达到 99% 的 token 一致概率。它不能直接解释为两个模型各自正常、独立采样时,有 99% 的输出 token 必然相同。
这个角度值得注意。过去讨论量化,常问的是“榜单掉了几分”;EAR 则试图回答更细的问题:压缩后,模型内部的概率判断到底偏移了多少。
为什么非对称量化成了关键?
帖子称,论文证明了一条“ 方差定律”:与非对称量化相比,对称量化会把噪声方差放大到 倍。
对称量化,是让数值范围围绕零点采用对称刻度;非对称量化则允许刻度随实际数值范围偏移。论文据此主张:非对称量化对于达到分布无损是必要的,但如果目标只是保住任务层面的跑分,则未必必要。
论文进一步提出 SLQ。按帖子描述,它会逐层选择不同的量化设置,而不是让整个模型统一使用同一位宽;同时采用非对称量化,并在更宽的位宽范围内搜索。可以把它理解为搬家时按物品分别打包:普通衣物可以压得紧些,易碎品则多留保护,而不是所有箱子都套用同一种规格。
数字诱人,但还不能外推
据帖子转述,SLQ 可在低于每参数 4 bit 时实现任务无损,部分模型最低达到 3.3 bit;达到分布无损则平均需要每参数 5—6 bit。配合优化后的计算内核,推理速度相对 FP16——用 16 位浮点数表示参数的常见基线——提高 1.7—3.6 倍。
这些数字说明,任务无损与分布无损的门槛可能明显不同:榜单成绩不变,不代表模型的概率分布也没有可辨认的变化。若这一结论成立,本地部署就不能再用一句“几乎不掉分”概括所有压缩质量,而要先说明自己关心的是任务成绩,还是更严格的行为保真。
局限与未知
- 供稿没有给出具体模型、数据集、硬件、计算内核、基线、误差区间和逐项实验结果,因此 3.3 bit、5—6 bit及 1.7—3.6 倍不能写成普遍规律。
- “统计无损”取决于指标、样本量和判定阈值。task-lossless 只覆盖所选零样本评测;EAR 衡量的则是最优耦合下的理论一致概率。
- 论文声称有三种无损概念,但供稿只清楚呈现两种;相关 GitHub 仓库当时还标注“Code coming soon”,可复现性仍待核查。