让一张常见的24GB显卡读完超长文档,难点不只是模型大:上下文越长,保存和调用前文的成本也越高。LongCat-Flash-Lite-Sparse给出了一条“用内存换显存”的路线:把约30B参数规模的n-gram查找表——预存局部词元组合、辅助寻找相关内容的索引——卸载到系统内存,让显卡侧只承担更关键的计算,从而运行256K上下文。
据项目模型卡,这个模型共有69B参数,但采用MoE(混合专家)稀疏结构,每处理一个Token只激活约3B参数;它还用稀疏注意力减少需要回看的内容,并原生支持最高1M Token上下文。值得看的不是又一个更大的窗口数字,而是它把压力拆开了:少量参数参与当下计算,大型索引留在容量更大的内存里。代价也很直接——内存卸载的实际速度会受CPU、内存带宽和数据传输影响;现有材料未给出24GB显卡跑满256K窗口的速度与完整验证结果。