Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
PAPER H 1 约 1 分钟

投机解码给草稿模型配了导师

让快速草稿在大模型约束下适度“越界”,以更小质量代价换取更多提速空间。

像编辑审稿:助理先快速起草,主编不必逐字重写,只要划定偏离底线,并重点纠正不靠谱的部分。Mentored Decoding把这套思路用于投机解码——先由轻量草稿模型生成词元,再让大模型批量检查。传统方案要求最终输出严格服从大模型,草稿能被采纳多少因此存在上限;它则允许输出适度偏离,争取更高采纳率和更低延迟。

论文最值得注意的结论是:对一大类衡量两种输出差异的指标,最优结果都沿着一条从大模型分布通往草稿模型分布的路径移动,而且这条路径不随具体指标改变。作者还证明,在传统投机解码的起点附近,提高草稿采纳率所增加的偏离成本最初近乎为零。换句话说,严格复刻大模型未必是最划算的边界,稍微放宽就可能换来可观的提速空间。

所谓“导师”,来自Boosting——让后来的学习者重点纠正前面的错误。论文据此分析两个模型何时能互补,甚至让组合输出优于目标大模型;不过这篇工作的核心是形式化证明与算法分析,材料未提供端到端速度或质量实验数字。


供稿材料 SOURCES — 1
01
Mentored Decoding: Faster Inference meets Boosting arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-01 · 学术板块