你让AI修一栋房子,普通助手可能只会指出墙上有裂缝;更能干的助手会继续找出漏水源头、制定施工顺序,再检查补丁有没有引出新问题。Google此次发布的Gemini 3.8,想把这种“连续干活”的能力同时用在两件事上:写软件,以及替防御者找漏洞、打补丁。
这次更新包含Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两个变体。Gemini是Google的通用大模型家族;Flash通常扮演速度较快、成本较低的主力型号,Cyber则针对网络安全场景调整。它们共享同一套基础智能,但开放范围不同:普通Flash已经面向开发者,Cyber目前只通过Fairwind Program提供给受信任的防御者。
具体成绩、价格和安全能力主要来自Google官方披露,缺少完整基准表、评测条件和统计误差。外部报道只能独立印证其编程能力有所进步,不能证明Google列出的每项具体成绩。
Flash这次选择“多做几步”
Gemini 3.8 Flash主要瞄准长流程编程和Agentic Tasks——也就是AI围绕一个目标自行规划、调用工具,并根据结果继续行动,而不是回答一次就停。修复一项复杂软件问题时,它需要先读代码、定位原因、修改文件、运行检查,再根据报错返工。
Google称,新模型的核心变化可以概括为“更努力”:遇到复杂任务时增加推理步骤,并反复调用工具。推理模型会在作答前投入更多计算,把问题拆开处理;代价是可能消耗更多token——模型处理文字与代码时使用的计量单位。开发者可以通过较低的effort level减少消耗,也可以继续使用更偏效率的3.7 Flash。
第三方工具llm-gemini 0.34已经接入gemini-3.8-flash,并提供low、medium、high三档Thinking Level。这个设置像给模型调节“思考预算”:档位越高,通常越适合复杂任务,但延迟或成本也会增加。
《华尔街日报》援引Google内部测试称,3.8 Flash在Google此前落后于Anthropic和OpenAI的编程能力上取得进展,措辞是“缩小差距”,并不等于已经领先。Google自己的说法更积极:在长流程软件工程测试DeepSWE v1.1上,它胜过多数体量更大的前沿模型;在HLE-Verified多步推理测试中取得54.9%;在金融与法律代理测试中也超过3.7 Flash及其他前沿模型。但官方没有在材料中给出完整对手名单与评测细节,这些排名不宜当成无条件结论。
价格倒是明确:3.8 Flash沿用3.7 Flash的首发价,每百万输入token 0.75美元,每百万输出token 3.75美元。Google希望它保留Flash的速度和成本定位,同时把编程与专业任务能力向更昂贵的模型靠近。
Cyber不只报警,还要动手修
Flash Cyber走得更远。它面向“主动防御”:不只监测风险和发出告警,还主动搜索漏洞、验证问题并协助修复。Google称,两款模型都经过长时间agentic loops——让AI反复评估结果并改进模型——而网络安全训练也反过来推动了共享核心的编程与推理能力。
这条路线并非突然出现。据Google Project Zero介绍,它的前身Project Naptime,名字来自“让AI替研究员翻代码,好让人类睡个午觉”,后来升级为Google DeepMind与Project Zero合作的Big Sleep。2024年,该系统在SQLite数据库中发现一个可利用的内存漏洞,并在漏洞进入正式版本前报告。Google称,这是首个公开披露的、由AI agent发现真实软件未知可利用漏洞的案例。
在这次发布中,Google把重点放在漏洞发现和自动补丁,而非利用漏洞等进攻能力。官方称,Flash Cyber在覆盖20种编程语言的内部漏洞测试中成功率超过70%;在外部补丁基准CWE-Bench上,pass@1——只给一次机会时成功通过的比例——为47.2%,接近某领先前沿模型的47.8%,但成本显著更低。
Google还披露了内部和合作方结果:Chrome安全团队测试中,它生成的正确补丁数量是最佳大型商业模型的2.6倍;Wiz的内部渗透测试里,其召回率高7.5至9.7个百分点,成本低2.3至5.2倍;Google Cloud漏洞研究团队则用它在不到两小时内找到一项关键基础漏洞。这些数字都来自官方单一信源,材料没有提供复现条件。
为什么这次“双发”值得看
它把模型竞争与安全产品竞争拧在了一起。同一套基础能力,一边争夺日常编程和企业代理任务,另一边进入权限更高、风险也更大的漏洞处置。网络安全训练不再只是一个垂直应用,还被Google描述成提升通用编程能力的训练场。
与此同时,攻防双方都在使用AI。据Associated Press报道,Google在2026年追踪到犯罪团伙借助AI发现并武器化未知漏洞,以绕过一款流行系统管理工具的双重认证。调查人员从代码里过度详细的注释、凭空捏造的严重性评级和典型生成习惯判断AI参与其中。Google安全分析师John Hultquist据此称,人们以为尚未到来的“AI漏洞竞赛”其实已经开始。
这也解释了为何Cyber没有直接公开。普通3.8 Flash带有针对网络攻击等滥用的防护;Cyber为了让专业防御者使用更完整的安全能力,采用更宽松的网络安全限制,因此只向受信任对象开放。这里的产品边界,本身就是此次发布的重要信息。
局限与未知
- 主要性能结论来自Google,材料没有完整基准表、对手名称、评测条件、统计误差或可复现实验。
- Cyber的公开价格没有披露。“Flash speed and cost”不能据此理解为它与普通Flash完全同价。
- Cyber目前是受限项目中的防御工具,不等于已经通过API向所有开发者普遍开放。