AI 写字通常像接龙:每次只写一个词,再把新结果交给下一步。线性注意力模型虽不保存越积越长的 KV Cache——可理解为生成时的“历史草稿”——而是把历史压进一份持续更新的内部状态,但仍要逐词读取、改写这份状态。SpecLA 要解决的,就是如何把投机解码搬到这种模型上:先由较小的草稿模型提出多个候选词,再让目标模型一次核验,从而摊薄反复搬运状态的成本。
难点在于,候选一旦分叉,每条路都会产生不同的状态,系统最终又只能保留真正被接受的那条。SpecLA 的关键做法不是保存多份完整状态,而是在核验时记录较紧凑的更新因子,选定答案后只取出被接受路径,并把状态更新推迟到下一次核验中完成。作者在 NVIDIA H100 和公开的 GDN-1.3B 模型上测试,称其相较逐词生成在综合任务、GSM8K 与 HumanEval 上分别提速 1.42、1.70 和 1.06 倍。这说明即使没有传统的增长型 KV Cache,投机执行仍可能减少逐词状态读写。