投机解码像让小助手先写几句,再由大模型一次核对;但小助手也要带一套“草稿纸”。这套KV缓存——保存既往文本的中间计算结果——会随文本长度和并发请求增加,占掉更多显存。论文测得,现有并行草稿器可把每个词的KV内存增至仅运行目标模型时的1.1至1.8倍。
H-Spec的关键不是简单共用目标模型的KV缓存,因为作者发现,这会让候选块越往后越不准。它改用两路信息互补:注意力模块直接读取目标模型已有的KV;Mamba模块则只接收最后一个输入位置的隐藏状态,把它当作整段前文的压缩摘要。这样既保留逐位置细节,也无需为草稿器另建KV缓存,同时仍能并行生成整块候选词。作者报告称,在三个目标模型和多类任务上,H-Spec相较最佳基线将平均接受长度提高5.0%至13.3%,并在单请求测试中把词间延迟加速幅度再提高5.3%至12.6%;这些效果尚以论文自述为准。