你可以把企业排查漏洞想成一次复杂会诊:有人翻代码找病灶,有人判断风险,有人设计修复方案,还要复查补丁有没有引入新问题。微软这次想做的,不只是给这群专家增加一个 AI 助手,而是搭出一支能分工协作的 AI 安全团队。
微软发布了网络安全专用模型 MAI-Cyber-1-Flash,以及多 Agent 安全平台 Perception。前者负责理解复杂代码、寻找漏洞;后者负责组织模拟攻击、调查和修复。它们还可以通过 MDASH 串在一起,把单次模型问答变成一套安全工作流。
目前具体功能、性能和效率数据主要来自微软说法及 TechCrunch 的单一报道,尚未见基准原始结果或第三方测试。
不只是一个会读代码的模型
微软称,MAI-Cyber-1-Flash 是其首个网络安全专用模型。所谓安全专用模型,就是针对漏洞代码、攻击手法和防御任务训练或调优的 AI 模型。它的目标不是回答一般问题,而是在复杂代码库中发现较难定位的漏洞。
但找到一段可疑代码,只是漏洞治理的开头。团队还要验证它是否真的能被利用、判断优先级、生成补丁,再检查修改是否有效。微软因此把模型放进 MDASH。MDASH 属于 Agent harness——包在模型外面的执行框架,负责提供工具、安排步骤、保存状态并检查结果。在这里,它会组织多个模型和 Agent,完成扫描、验证、去重和可利用性证明等工作。
这一区别很重要。模型像负责分析的专家,MDASH 则像项目经理加工作台:它决定先做什么、调用谁、如何核对结果。微软公布的 Cyber Gym 基准成绩,也来自 MAI-Cyber-1-Flash 与 GPT 5.4 在 MDASH 内的组合,而不是前者单独运行。
微软 AI CEO Mustafa Suleyman 称,这套组合在 Cyber Gym 上超过 Gemini、GPT 5.5 Cyber、GPT 5.6 Sol 和 Mythos 5,并称新模型更强、成本效益更高。不过微软没有披露具体分数、评测配置或成本口径。因此,这一结果既无法独立复核,也不能直接归功于 MAI-Cyber-1-Flash 单模型。报道中的部分竞品名称和版本同样只有这一条信源支撑。
Perception 把问答变成安全团队
Perception 进一步解决“谁来协作”的问题。多 Agent 安全平台会让不同 Agent 分担调查、验证和修复,并按权限共同完成任务。微软为它设置了三类角色。
红队 Agent 模拟潜在攻击,补充攻击者和可能利用的漏洞信息;蓝队 Agent 检测现有缺陷并进行分流,也就是判断哪些问题更紧急;绿队 Agent 则采取修正措施。Perception 还能接入 MDASH,把代码漏洞处理纳入同一流程。
微软 Perception 首席工程师 Dave Weston 称,这套平台能把过去需要多名安全专家工作数小时的任务压缩到数分钟,并给出问题检测、优先级、系统安全状态修正和代码修复结果。这仍是微软自己的效率描述,报道没有提供测试规模、误报率或修复正确率。
为什么现在值得看?
这次发布的看点,不是又多了一个“能找漏洞”的模型,而是微软同时拿出了模型、执行框架和多 Agent 平台。网络安全 AI 因而从通用模型的零散试用,向独立产品栈推进。
微软本身又横跨云服务、企业软件和网络安全。安全专用模型与 Agent 平台,理论上可以和代码托管、身份管理及云安全产品衔接。对企业而言,真正有价值的也不是模型答对一道题,而是它能否进入日常流程,持续调查、验证和修复,同时把误报与错误修改控制住。
局限与未知
- 微软没有公开 Cyber Gym 的具体得分、评测配置和成本算法,领先及成本优势暂时无法独立验证。
- Perception 的效率来自公司说法;误报率、补丁正确率、人工审核方式和适用代码规模均未披露。
- 发布信息一面称相关模型“立即投入生产”,一面称新工具将在 11 月 3 日开放 preview。两种说法分别适用于哪些产品或用户,目前并不清楚。