读长文时,AI 既想记住前文,又不想让“草稿纸”越堆越厚。线性注意力选择把漫长历史压进固定状态;这项研究却发现,更朴素的办法可能更好:只让模型回看最近一小段文字,就像读书时只摊开手边几页。
作者比较了改造并继续训练过的线性注意力模型,与无需额外训练的滑窗注意力。后者把回看窗口设为 64 个 Token——Token 是模型处理文字的基本单位——同时始终保留开头 4 个“注意力汇点”。这些开头位置像固定的缓冲区;论文指出,若把它们一并滑出窗口,模型表现会严重下降。
结果颇有工程意味:在知识与推理任务的 11 组对照中,滑窗方案有 9 组平均表现最佳;在 Needle-in-a-Haystack 和 BABILong 两类长上下文推理测试中,作者报告其成绩达到线性注意力的 2 至 10 倍。它仍会失去直接查看遥远细节的能力,但这组对照提醒团队:在投入额外训练改造模型前,带 4 个汇点的滑窗应先作为低成本基线认真测试。