你反复向一个很强的AI提问,把答案攒成教材,再用它训练自己的模型。这不等于下载了对方的模型,却可能让“学生”学到“老师”的部分本事。如今,美国安全机构指控六家中国AI公司把这种做法变成了工业流水线。争议的重点不是蒸馏技术本身,而是谁有权调用模型、调用到什么程度,以及这些输出能否拿来训练竞争产品。
这场交锋值得现在关注,是因为它已经越过企业之间的服务条款争议,进入国家安全政策。美方的说法仍是指控,尚未经过司法程序确认;供稿也没有给出具体证据,不能把“蒸馏”直接写成“窃取”。
美方到底指控了什么?
据美国国家安全局(NSA)发布的信息,NSA、联邦调查局(FBI)和网络安全与基础设施安全局(CISA)于2026年9月8日联合发布网络安全公告,点名DeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun和Z.AI。三家机构称,这六家公司自至少2024年末起,对美国前沿模型开展了工业规模的蒸馏活动。
“前沿模型”指当时能力最强一档、训练成本和潜在风险都较高的通用AI模型。CISA称,相关活动涉及Claude、GPT、Gemini和Grok的不同版本,通过数百万次交互收集了数十亿Token。Token是模型处理文字时切分出的基本单位;所谓“Token抽取”,不是直接拿走模型参数,而是大量收集模型生成的内容,再把这些内容变成另一套模型的训练材料。
据Associated Press报道,美国机构称,请求可能被分散到多家模型服务商、云平台和API聚合商——API可以理解为程序调用模型的标准入口——还可能利用由团队共享的大批量高级订阅,以降低调用成本并避开限制。零散来看,每次操作都像普通提问;连成数百万次请求后,美方认为它形成了一条能力提取流水线。
蒸馏不是问题,边界才是
知识蒸馏原本是常见的模型压缩和能力迁移技术:让较小的“学生模型”学习较强“教师模型”的输出。它可以降低运行成本,也能让能力更强的模型帮助较小模型成长。NSA的公告也承认,蒸馏本身是合法且有用的AI研究方法。
分歧出现在获取训练材料的方式。美国机构把其所指的未授权、大规模调用定性为对美国模型专有能力的提取。换句话说,美方并不是说所有“学生向老师学习”都有问题,而是认为有人绕过访问限制,把商业服务批量转成了竞争模型的训练原料。
这一区分很重要。“蒸馏”“违反服务条款”“侵犯知识产权”和“违法”并不是同一个判断。现有材料没有说明具体行为分别触碰了哪项合同或法律,也没有提供足以验证这些指控的请求记录。
商业争端变成了安全议题
据Axios梳理,这场争议在2025年1月已经露出端倪。DeepSeek-R1走红后,OpenAI称发现有人利用其模型输出训练竞争系统,并表示DeepSeek可能“不恰当地”使用了蒸馏。如今,提出指控的主体从模型公司变成NSA、FBI和CISA,同一种训练手段也随之被放进国家安全框架。
这可能改变模型服务商的风控方式。CISA建议美国AI公司同时加强行为和基础设施层面的检测,对疑似蒸馏请求调整响应,并在相关机构之间共享威胁情报。未来的限制未必只落在芯片和算力上,也可能落在模型访问、账户订阅和API调用路径上。
部分被点名公司的模型以开放权重形式传播。开放权重意味着开发者可以下载并自行运行模型参数,但不代表训练数据和完整训练代码也会公开。因此,一旦能力来源成为政策争论,模型如何训练、使用过哪些外部输出,就可能影响其后续获得算力和模型服务的条件。
中国方面给出了相反叙事。据Associated Press报道,中国商务部称美方说法毫无根据,认为蒸馏是全球AI企业普遍采用的做法,并指责美国试图维持行业垄断。DeepSeek、Alibaba、Moonshot AI和Z.AI当时未立即回应媒体的置评请求。
局限与未知
- 联合公告提出了公司名单、调用规模和可能的访问路径,但供稿没有提供原始请求记录或其他可独立核验的证据。
- 现有材料没有说明六家公司各自采用了哪些具体做法,也不能据此判断它们是否违反合同、侵权或违法。
- 美方建议已经指向更严格的检测与情报共享,但是否会进一步转化为算力、模型访问或出口限制,目前尚无定论。