和人翻聊天记录一样,AI 回答长对话时未必每句话都要从头重读。但常见的完整注意力——模型生成当前词时扫描全部历史——每一步都会这么做,上下文越长,成本越高。On-Demand Attention(ODA,按需注意力)改成先只看最近一段,再由“召回头”判断这一步是否值得回查完整历史;它像一道门卫,只在预计能改善预测时开启更昂贵的全局注意力。
最关键的是,这个判断器只读取模型当下已有的状态,不改动预训练模型参数,完整的历史 KV Cache——模型保存的上下文中间结果——也始终留着,随时可查。作者报告,在 Qwen3-1.7B 的 RULER16K 测试中,单用局部注意力得分为 19.23;ODA 仅在 41.6% 的路由步骤调用完整注意力,得分达到 81.17,接近始终读取全部历史的 81.94。结果仍来自论文作者在特定模型与测试上的实验,但它提示了一条实用方向:让模型自己决定何时“翻旧账”,可能减少长推理和 Agent 任务中的反复扫描。