AI写很长的“思考过程”时,麻烦不只在字多:它每生成一步,还要不断回看前文。标准自注意力——给前文各处分配关注程度的机制——会让大量位置两两比较;长度翻倍,计算量大约变成四倍。LISA想做的,是不再把所有内容都同等精算。
它把回看分成两路:线性注意力把全部历史压进一份持续更新的长期记忆;Lightning Indexer则从完整上下文中挑出最值得细看的词,再交给固定规模的稀疏自注意力精确处理。可以把它理解为一边记住全书大意,一边按索引翻查关键页。两路结果由门控机制合并,而且无需从头预训练模型。
作者在DeepSeek蒸馏的Qwen模型上报告:16K token上下文中,推理速度提升50%;在AIME、MATH-500等数学推理基准上,平均成绩还比完整自注意力基线高5.6%。这组结果说明“少看”未必等于“少想”,但速度与质量能否在更多模型和任务上同时保住,仍有待验证。