模型文件压得很小,不等于跑起来也快,就像把行李塞进真空袋,搬运时仍要看有没有合适的推车。llama.cpp 现已合入 Q2_0 的 CUDA 后端:CUDA 是 NVIDIA 的 GPU 计算平台,Q2_0 则用 2 比特封装 Bonsai 原生三值权重,也就是把参数限制在负、零、正三个档位。对应的 GPU kernel——实际执行运算的底层程序——到位后,Ternary-Bonsai 1.7B、4B、8B 和 27B 才能沿 llama.cpp 主线直接调用消费级 NVIDIA GPU。
这一步的意义,是把关注点从“模型文件能压多小”推进到“真实设备上能否高效执行”。提交者称已用新构建进行速度测试,并以 Q2_0 与 F16 输出分布的 KL 差异检查正确性;但材料没有给出具体速度数字。边界也很清楚:本次合入只覆盖常规解码,配套的实验性 dspark drafter 仍不能在主线 llama.cpp 加载,尚需等待相关支持成熟。