Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
NEWS 约 1 分钟

循环模型也能并行做推测解码

WaveFront把循环模型的起草与验证并行推进,最高自述加速4.81倍。

IMAGE — r/LocalLLaMA 日榜

循环语言模型像让同一位编辑反复审一段文字:不用多请人,却要多轮排队。它让同一组网络层反复处理内部状态,以共享参数换取更深计算;代价是生成每个 token(可理解为词或字的片段)都要顺序运行多次,拖慢回答。WaveFront Decoding(WFD)瞄准的正是这段等待时间,而且无需重新训练模型。

它利用中间轮次的输出先猜后续 token,再用完整轮次验证。关键不只是“推测解码”——先便宜地提出候选、再集中核验——而是把不同位置、不同计算深度的状态排成一条斜向推进的“波前”:较浅的计算继续起草新位置,较早的位置同时走向完整验证。由于循环模型共享权重,这些工作可以塞进同一次批量计算;猜错时,再用完整深度的结果纠正。

作者称,在 Spec-Bench 六类任务上,WFD 相比逐 token 的自回归解码,在 Ouro-2.6B 和 Huginn-3.5B 上分别加速 2.42 倍和 3.54 倍;加入跨循环 KV 共享、减少中间状态搬运后,Huginn-3.5B 达到 4.81 倍。值得关注的是,它为“省参数但多步骤”的循环架构补上了推理加速的一环;这些效果目前仅据作者材料,实际收益仍取决于候选命中率与并行开销。


供稿材料 SOURCES — 1

← 返回 2026-10-08 · 开源板块