本地跑大模型,省显存和等得少往往不能兼得。这次 Qwen3.6-27B 测试发现一个反直觉现象:模型权重越“重”,投机解码带来的相对加速反而越大。投机解码就是先让更快的草稿模型猜出一串 Token——模型处理文字的小片段——再交给目标模型批量验收,猜得准才有赚头。
作者自述,在测试的 10 种投机配置中,加速倍率全部呈现 Q8 高于 Q6、Q6 高于 Q4。Q8、Q6、Q4 指权重使用的数值位数;位数越高,通常占用更多显存。原因并非高位量化更容易接受草稿:相同草稿深度下,候选接受率基本不受量化等级影响。真正拉开差距的是,高位权重让普通生成步骤变慢,但草稿和验证的额外开销没有同步增加,于是投机解码更划算。
这给本地调参一个直接提示:不能只看绝对速度,也要看量化等级与解码方式的组合。测试中 nvfp4/SGLang 仍是整体最快的量化与引擎组合,DFlash 则是整体最快的通用算法;但结果仅来自单一硬件、短输出、贪心解码和 batch 1,作者称其更接近投机解码的理想上限,并未进行准确率对比。