假设两家公司都做出了能力很强的 AI。一家只让用户通过自家网站或 API 调用,另一家把模型权重放出来,允许用户下载运行。按白宫正在制定的新框架,前者可能要在发布前接受政府安全审查,后者却可能被排除在外。
这道边界很值得看。它不只决定谁要多做一轮测试,也可能改变企业选择开放还是闭源的成本。问题在于,开放模型一旦发布,恰恰更难由原开发者持续控制。
目前公开信息来自 Axios、Bloomberg、《华尔街日报》《纽约时报》和 TechCrunch 的报道摘要,白宫框架原文尚未公布。几家媒体对豁免对象的表述并不一致,因此适用范围仍有关键悬念。
审查闭源,却给开放路线留了出口
据《纽约时报》报道,这套流程属于自愿审查,覆盖闭源 AI 模型,但排除公开底层代码的模型。所谓“自愿”,是指企业不会仅因这套框架直接承担强制法律义务。
Axios 的说法更宽,称开放模型获得豁免。《华尔街日报》则把范围写成“美国开放模型”,并称新框架最可能影响 OpenAI、Anthropic 和 Google。Bloomberg 的标题进一步称,中国的开放权重模型也将免于美国安全测试。
这些说法不能简单合并。开放权重模型,是指训练完成后的参数可以下载和自行部署;它不等于训练代码、训练数据也全部公开。“开放模型”“开放权重”和“公开底层代码”并非同一个概念。现在还不能据此断言,所有外国开放权重模型都会自动获得豁免。
但大方向已经相当清楚:多家媒体都把这套发布前审查描述为主要面向闭源前沿模型。前沿模型,指能力、训练规模或潜在风险接近当时最先进水平的通用 AI。发布前安全评测,则是在模型上线前检查危险能力、滥用风险和防护措施。
为什么这道边界有点反直觉?
闭源模型通常由厂商通过产品或 API 提供。厂商像守着一扇门,可以限制谁能访问、模型回答什么,也能持续更新防护。开放权重模型则把“机器”交到用户手里。权重一旦广泛流通,用户可以换系统提示词、重新微调模型,也可以移除原有保护。
TechCrunch 转述 AI 安全非营利组织 SaferAI 的报告称,中国 Z.ai 的开放权重模型 GLM-5.2,在网络与生物能力上只比 OpenAI GPT-5.5 和 Anthropic Claude Opus 4.7 落后数月。这里的“落后数月”是 SaferAI 对能力距离的概括,并不是直接性能分数。
更值得警惕的是防护差异。SaferAI 通过 Z.ai 的公共 API 测试 GLM-5.2,称它对所给出的攻击性网络与生物任务一次也没有拒绝。相比之下,Claude Opus 4.7 拒绝相关请求的频率很高,以至于 SaferAI 无法在它身上完成 CyberGym——一个评估网络安全能力的基准测试。
这组结果只有 SaferAI 一个独立测评来源,而且测的是公共 API。它不能直接代表用户下载权重后的行为,更不能单独证明模型具备现实危害能力。但它点出了监管上的难题:闭源服务至少还有一个可以加锁的入口;开放权重发布后,入口本身就不存在了。
闭源也不是天然安全
把审查重点放在闭源模型上,并非毫无理由。能力最强、用户最多的模型往往由大公司控制,政府也更容易找到明确的审查对象。厂商还可以使用分类器、拒答训练和 API 控制,限制危险的网络或生物帮助。
只是这些措施并不牢靠。据 TechCrunch 报道,另一家 AI 安全非营利组织 Far.ai 在 xAI Grok 4.5、Google DeepMind Gemini 3.1 Pro 等前沿模型中发现了数百个“通用越狱”。所谓越狱,就是用角色扮演、冒充权威、伪造对话历史或连续追问等方式,绕过模型的拒答规则;“通用”意味着同一套提示方法能对多数有害请求生效。
所以,真正的区别不是“闭源安全、开放危险”。闭源防护会被绕过,但服务商仍能补漏洞、封访问。开放权重模型交付后,原开发者很难保证这些防护继续存在。白宫若豁免后者,等于把更容易监管的模型放进审查,把更难收回的模型留在门外。
安全规则也在塑造技术竞争
美国前沿 AI 监管一直在创新、安全与国家竞争之间权衡。若闭源模型需要投入时间配合发布前评测,而开放权重模型不用,同等能力下,两条路线的合规成本就会不同。监管边界因此不只是安全政策,也会成为技术路线竞争的一部分。
这还带来一个更尖锐的问题:如果中国开放权重模型确实也在豁免范围内,美国公司可能一边接受政府审查,一边与不受同类测试约束的外国模型竞争。不过,这一点目前只有 Bloomberg 的标题明确支持,其他报道对地域范围的说法不同,不能当作已经确定的规则。
白宫看起来是在避免用发布前审查压住开放生态。但随着开放权重模型逼近前沿能力,这道侧门会越来越难被视作技术细节。监管者最终需要回答的,是审查应当跟着模型的发布方式走,还是跟着模型可能造成的风险走。
局限与未知
- 白宫框架原文尚未提供,模型门槛、测试方式、审查结果如何使用都不清楚。
- 媒体分别使用“开放模型”“美国开放模型”“开放权重”和“公开底层代码”,豁免的精确定义与地域范围仍待正式文件确认。
- GLM-5.2 的能力距离、拒绝率与安全差距均来自 SaferAI 单一测评;公共 API 的表现不能直接代表下载权重后的行为。