你让 AI 读一份很长的材料,常见办法是把前文一直塞进上下文窗口——也就是模型当下能直接读取的文字范围。历史越长,计算和缓存成本越高。Fractale-350M-base 换了一条路:它不保存全部原文,而是把每512个 token(模型处理文字的基本单位)压成一个摘要向量,写进仅有8格的“记忆库”;最旧的一格会被新内容顶掉。
这个386M参数模型从零预训练,使用了100亿个 code 与英文网页 token。记忆会展开成 fast weights——处理序列时快速更新、临时保存信息的动态权重——直接参与后续计算,而不是检索旧文本。训练还刻意要求模型只凭记忆库预测下一段陌生文档的开头,逼它真正学会“记住”。作者报告,在留出文档上,保留记忆相较清空记忆,代码数据的交叉熵改善9.4 nats,网页数据改善7.3 nats;写入2到8段时没有出现明显的先进先出淘汰断崖。更值得注意的是,训练越往后,模型越依赖这套记忆。项目同时公开模型、论文和完整研究日志,但这些效果目前来自作者自述。