让 AI 读一部长篇小说再回答问题,它每写一个词,都可能要重新翻看前文。前文越长,从显存读取 KV 缓存——模型保存的历史内容中间结果——就越费时间。稀疏注意力通常只翻少数几页,却可能错过关键线索。Elastic Threshold Attention(ETA)换了一种办法:模型根据当前问题动态预测筛选阈值。常规步骤少读,困难的检索或推理步骤多读,不再套用固定额度。
这项工作最值得注意的细节,是训练时“压低而非删除”。低于阈值的信息不会被直接清零,而是把相关性分数平滑地压向零。作者称,这层均匀的弱背景既让开头位置容易吸走注意力的现象消失,也让模型更能容忍 GPU 按整块读取时顺带带入的次要内容;到了推理阶段,系统才真正跳过不重要的 KV 块。作者在一个 1.45B 参数模型上报告,ETA在语言建模、常识推理和长文本“藏针”检索中可接近密集注意力,并用定制 Triton 内核在最长 512K token 的序列上获得解码加速;供稿文本未保留具体加速倍数与训练数据量。