给大模型贴上“1比特”标签,不等于它真的只占1比特:就像压缩行李后又外挂几个收纳袋,缩放系数、分组信息和异常权重索引仍会占空间,一些既有方案实际会落入每个权重2至4比特的区间。AF1瞄准的正是这笔隐藏账。它采用后训练量化——模型训练完再压缩,不必从头训练,并把目标线性权重的有效开销严格控制在每权重1.0比特。
为尽量保住模型能力,AF1一边用两个二值因子重建权重,并把部分误差引向不影响计算输出的“零空间”;一边借助Shapley值——衡量各部分对整体结果贡献的方法,把有限的表示能力分给更敏感的层和子模块。论文作者称,在测试的LLaMA、Qwen和Gemma模型上,AF1相较BF16平均带来2.5倍推理加速和超过90%的内存缩减,同时优于既有二值后训练量化方法。值得留意的是,这些效果来自论文自述,且“严格1比特”限定于目标线性权重,并非模型运行时的全部开销。