让大模型写一段话,通常像排队接龙:先生成一个Token——也就是字、词的一部分或标点——才能继续下一个。前后强依赖,让计算设备很难同时开工。这项工作尝试用离散扩散打破队列:先面对一批尚未确定的位置,再经过多轮共同修正,一次处理多个Token。
作者提出的 Uno 保留原模型负责“下一个Token预测”的主体参数,另加一组轻量扩散参数,专门学习并行生成。训练只需一次 Diffusion Distillation(把原模型的生成规律教给扩散部分);配套的 Ψ-Spec 采样器不需要额外的草稿模型。这里的“无损”不是压缩文件,而是仍从原自回归模型定义的概率分布取样,不靠近似分布换速度。
据论文作者报告,Uno 在所有测试批量下的吞吐量都高于其比较的领先推测解码方法,相对基础自回归模型最高提速 3 倍,在设备支持的最大批量下也有效。结果来自论文自身实验,尚不能说明它在所有模型、硬件和任务上都能获得同等收益。