在电脑或手机上跑大模型,常遇到两道墙:算得慢,显存也不够。SpecQuant把两种省资源办法接在一起。量化像把精密尺换成粗刻度尺,用更少位数保存模型;投机解码则是先快速猜出几个词,再由更可靠的模型一起核验,减少逐词生成的等待。
它最值得注意的一步,是从同一个 Qwen2.5 基础模型生成 INT4、FP8 和 FP16 三种精度版本。系统先按提示词长度、句法复杂度和专有名词密度判断难度:简单问题交给轻量版本,复杂推理或长输入交给高精度版本。由于这些版本共享基础权重,低精度版本可以承担“猜词”工作,高精度版本负责验证,不必另训、另存一个独立的草稿模型——也就是传统投机解码中专门负责先猜答案的小模型。
作者在 MMLU、AlpacaEval 和 GSM8K 上报告,SpecQuant带来 35%—43% 的加速,准确率下降不超过 2%。这些结果来自论文作者,全文未在所给材料中披露各硬件配置下的细分数据;但它瞄准的问题很实际:端侧设备的算力和显存会同时吃紧,加速方案不能只顾其中一头。