Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER HF 254 约 7 分钟

Metis:把记忆做成基础模型

Metis 把 Agent 记忆从外挂检索变成模型可训练、可迁移的原生能力。

你告诉 AI:“Bob 已经从伦敦搬到波士顿。”聊过一阵后再问住址,它要么忘了,要么得先去外部数据库翻记录。今天多数 AI Agent——能围绕目标连续查资料、调用工具并调整行动的系统——就是这样管理记忆的:模型负责思考,数据库负责记事。

Metis 想换一种做法。它不再把记忆只当成模型外面的档案柜,而是把“记住什么、何时更新、怎样调用”做进模型自身的计算过程。论文作者把这类模型称为 memory foundation model(记忆基础模型):像普通基础模型一样,先通过大量数据学习一种通用能力,再把它迁移到不同 Agent 场景。作者称 Metis 是这一方向的首个原型;这一定位及下文效果均来自论文作者的单一信源,尚不能视为独立验证。

记忆不再只是外挂

传统外部记忆通常分成几步:把信息写入模型参数之外的存储,需要时检索相关文本,再把文本塞回提示词。论文认为,这种分工有三个问题。

第一,记忆系统和语言模型各做各的。检索器努力找“相关内容”,但相关不等于对当前回答最有用;语言模型也未必能正确利用取回的材料。第二,写入、删除、检索和拼接往往是离散操作,很难让整个流程一起训练。第三,检索、拼接和重新读取文本都会增加推理环节与延迟。

Metis 提出的“原生记忆”包含两部分。

一部分是 持久记忆状态——跨多轮互动保留、又会随新经历变化的信息状态,像一本不断修订的个人笔记。它不同于当前对话窗口里暂时可见的上下文。论文严格区分了知识和记忆:训练前获得、存进固定模型权重的是知识;互动开始后才收到、与具体经历有关的信息,才算记忆。

另一部分是 原生记忆过程。模型不再依赖外部规则分别执行“写入”“删除”和“查询”,而是在正常的前向计算中自主完成记住、忘记、更新和调用。所谓前向计算,就是输入穿过模型并产生输出的那一遍运算。推理期间,Metis 已经学到的模型权重保持冻结;变化的是专门的动态记忆状态,更新不需要梯度,也不需要现场重新训练模型。

它把过去压进一组动态参数

Metis 在 Transformer——今天语言模型常用的主干结构——内部加入了 Metis block。每个 block 又分成两部分。

local memory block(局部记忆块)保存当前的稠密记忆状态。“稠密”可以理解为:它不保存一段人能直接阅读的文字,而是把信息压缩成模型能计算的数值表示。hyper memory block(超记忆块)则负责决定怎样改写这份状态。前者像笔记本,后者像已经学会整理笔记的方法。

每轮互动结束后,超记忆块会给当前内容的重要性打分,挑出更值得保留的位置,再把它们投影成用于记忆的 key 和 value——可以粗略理解为“索引线索”和“实际内容”。这些信息随后更新进固定大小的记忆网络。

调用时,模型使用 memory attention(记忆注意力)读取过去。注意力是模型判断“当前问题应该看哪些信息”的计算机制;记忆注意力则专门让当前输入与持久记忆状态发生联系。它与处理本轮文本的普通注意力并行,最后把两路结果合并。

这一步的关键不是单纯缩短记录,而是让“怎样压缩、怎样读取”都能从数据里学。比如,“Alice 今年 24 岁”暗含记住年龄;“Bob 从伦敦搬到波士顿”暗含覆盖旧地址。作者把记忆描述成一种预测问题:信息刚出现时,系统并不知道未来会怎样问,因此必须预测哪些部分值得保存、将来会以何种方式被使用。

先教模型怎样记事

Metis 不是从头训练。团队从通用基础模型出发,在 mid-training(中期训练)阶段加入记忆专项训练。这个阶段位于通用预训练之后,目的是让模型获得新的基础能力。

论文设计了三类目标。记忆重建目标考察固定大小的状态最多能保留多少信息;记忆操作目标训练模型执行记住、忘记、更新和反思;正则化目标则用于提高复杂场景下的稳健性。

训练数据由公开数据集合成。论文列出 27 个公开 benchmark——用于统一测试模型能力的数据集——并从三个方向组织样本:记忆操作类型、指令是否明确,以及是否混入无关信息。样本按时间顺序排列,而且后面的回答必须与此前操作形成的最新状态一致。例如,更新样本会先给出旧事实,再提供新事实,最终问题只能用更新后的状态回答;反思样本则要求把多条单步事实组合起来。

这种训练设置也说明了 Metis 与 test-time training(测试时训练)的差别。后者通常为了适应当前输入,在单个序列内临时更新参数;Metis 面向多轮互动,动态状态要跨轮保留,并且模型专门学习了带语义的记忆操作。它也不同于传统 memory-augmented neural network(记忆增强神经网络):后者通常由独立控制器读写外部记忆槽,Metis 则让记忆状态直接参与主干模型计算。

为什么值得关注

真正值得看的,不是 Metis 又做了一套记忆模块,而是它重新划定了 Agent 与记忆的边界。

如果这条路线成立,记忆就不只是工程人员在模型外面搭建的数据库、检索器和规则,而会成为一种可训练、可针对领域继续优化、也可能迁移到不同任务的基础能力。模型学习的不只是答案,还包括怎样处理时间不断流入的信息。

它在计算路径上也有明确取舍。Metis 用固定大小的状态保存历史,而不是把取回的文本不断拼回上下文。论文称,普通注意力、记忆读取和面向未来的记忆更新大体可以并行;更新只需一次前向计算。不过,这不等于已经证明低延迟、低显存或低总成本。作者没有在所给材料中提供足以支撑这些结论的端到端数字。

论文报告进行了广泛实验,并称结果显示 Metis 具备原生记忆能力;项目代码与模型 checkpoints——训练完成后保存的模型权重——也已发布。但材料没有给出可用于报道的基准分数、模型规模、训练数据量或效率提升幅度,因此目前更适合把 Metis 看作一个方向明确、实现完整的研究原型,而不是已经定型的 Agent 记忆方案。

局限与未知

  • 固定大小的记忆状态必然要压缩历史。论文明确承认,任务时间拉长后会因信息损失而退化,这条路线并不等于“无限上下文”。
  • 多段信息被混入同一潜在空间——模型内部不可直接阅读的数值表示——有时会发生语义混淆。训练能缓解问题,但材料没有证明长期记忆已经可靠。
  • “首个 memory foundation model 原型”是作者自述,尚缺独立文献核验;论文也未在供稿范围内给出生产部署所需的延迟、显存、总计算成本和长期稳定性证据。

供稿材料 SOURCES — 1
01
Metis: Memory Foundation Model arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-02 · 学术板块