Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.089 — 2026-10-01
NEWS 约 4 分钟

OpenAI披露模型蒸馏攻防战

OpenAI首次系统披露模型推理窃取战:攻击者如何套取“思考过程”,平台又如何封堵。

如果有人想模仿一位名厨,成品菜当然有用,但更有价值的是后厨记录:先放什么、火候怎样、失败后如何补救。对 AI 也是如此。最终答案只是“成品”,模型内部的推演记录才更接近“菜谱”。9月30日,OpenAI 披露了一场针对这类受保护推理的协同提取行动,并称已将其阻断。

这让模型蒸馏从长期流传的行业猜测,变成了一场由平台公开描述的安全攻防。不过,目前全部事件信息都来自 OpenAI 单方,尚无独立信源验证其规模、归因和防御成效。

“蒸馏”为什么变成了攻防

模型蒸馏原本是一种正常训练方法:让较强的“教师模型”提供示范,再训练较小的“学生模型”模仿。它能降低成本,也可以在获得授权后迁移能力。OpenAI 自己也在2024年推出过正式的 Model Distillation 工作流。

边界在于授权。当一方绕过访问限制,通过大量、协同的请求套取闭源模型的输出或隐藏推理,再用于复制其能力,这就进入了“对抗式蒸馏”的范畴。

受保护推理,是模型完成任务时产生、通常不会原样展示给用户的内部推演记录。它比最终答案包含更多过程信息,因而可能更适合拿来训练模仿者。防守也不能只盯某一句提示词,而要同时观察账户、访问基础设施、流量模式和模型输出。

攻击者没有“闯进数据库”

据 OpenAI 披露,相关活动始于7月1日,并在7月24日至25日达到高峰:约4,000名用户发出了16,000次符合提取模式的请求。这里的16,000次是尝试请求,不代表成功取得了16,000份推理内容。

进一步调查把相关提示词模式归入一个超过15,000名用户的集群。这个数字同样不能理解为15,000名已经确认的攻击者。OpenAI 称,它在7月28日前完成了对该集群的处置。

这次行动也不是破解加密、入侵数据库,或直接读取平台保存的用户对话。攻击者利用的是模型交互本身。其中一种做法,是把某次对话里的加密推理复制到另一段对话,再要求模型“解密”并转写其中的隐藏内容。换句话说,他们没有撬开保险柜,而是试图诱导负责看守保险柜的人把内容复述出来。

OpenAI 将一个“核心活动集群”归因于与 Moonshot AI(月之暗面,Kimi 的开发者)有关联的个人。但它同时承认,无法确认同期所有操作者是否属于同一个行为方。因此,这不能写成“月之暗面组织了全部行动”。

防线不只是一道补丁

OpenAI 称,它封禁或限制了欺诈账户,加强了注册与基础设施控制,并扩大了对关联网络的监测。针对具体漏洞,公司表示已经关闭一条“重放他人加密推理并恢复其内容”的路径,还增加了检查:当模型以流式方式逐段输出答案时,系统会检测并拦截可能泄露推理的内容。

这些措施对应着对抗式蒸馏的三个环节:谁在访问、许多账户是否协同行动,以及模型究竟输出了什么。只修补单个提示词,很难应对攻击者更换账户或改写问法。

OpenAI 还称,已通过 Frontier Model Forum 和适当的政府信息共享渠道通报发现。Frontier Model Forum 是多家前沿 AI 公司参与的行业组织,在这里充当跨公司共享攻击手法和防御经验的渠道。

为什么值得关注

最值得注意的,不是某个提示词技巧,而是攻击形态的变化:竞争不再只发生在训练芯片、数据和人才上,也发生在产品入口。一个公开提供服务的模型,必须回答用户问题;但每次回答又可能成为别人研究和复制它的样本。平台既要保持模型可用,又要判断哪些看似普通的请求正在组成一次协同行动。

OpenAI 认为,这类操纵并非自家模型独有的漏洞,而是行业需要共同应对的安全问题。此次披露也给出了一幅更具体的防御图景:账户治理、流量关联、输出拦截与跨机构通报需要同时工作。模型安全因此不只是“保护模型文件”,还包括管理模型每天与外界发生的交互。

局限与未知

  • 事件规模、归因和“完全阻断”的说法均来自 OpenAI,尚无第二个独立信源验证;公司同时表示调查和缓解工作仍在继续。
  • 材料没有披露多少请求真正取得了受保护推理,也没有说明提取内容是否已被用于训练其他模型。
  • OpenAI 只把核心集群关联到与 Moonshot AI 有关的个人,无法确认全部操作者的身份或关系。

供稿材料 SOURCES — 1

← 返回 2026-10-01 · 科技板块