Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.018 — 2026-07-22
NEWS 3 信源 约 6 分钟

Gemini三箭齐发:快、廉、懂安全

Google一口气补齐主力、低价与安全模型,真正值得看的是产品分工,以及仍未现身的3.5 Pro。

IMAGE — NYT Technology

你让 AI 批量整理文件、修改代码,再操作电脑完成后续步骤。单次回答聪不聪明当然重要,但真正跑上几千、几万次后,另外三件事会迅速冒出来:每次要等多久、生成多少文字碎片、出错或被滥用的风险有多大。Google DeepMind 周二发布三款 Gemini 模型,瞄准的正是这些生产环境——企业真正面向员工或客户运行的系统——里的现实问题。

Gemini 是 Google 的通用 AI 模型家族。Flash 系列负责速度、成本和大规模部署,旗舰 Pro 则通常承担更复杂的推理与编码任务。这次登场的是 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber:一款做主力,一款压低成本和延迟,一款专攻网络安全。本文数字主要来自 Google 官方博客;其中速度、价格和多项基准成绩属于厂商自报结果,适合用来理解产品定位,不宜直接当作独立验证。

主力模型先做“减法”

Google 把 Gemini 3.6 Flash 称为“workhorse model”,也就是日常承担大量任务的主力型号。它重点改善编码、知识工作和多模态能力。多模态指模型同时处理文字、图片、音频等不同形式的信息,这决定了它能否覆盖文档解析、图表分析和报告起草等真实业务。

这次最值得注意的不是模型能写得更多,而是它尝试用更少的输出完成任务。token 是模型读写信息时使用的计量单位,可以粗略理解为文字碎片。输出 token 越少,通常意味着成本更低、等待更短。据 Google 引述的 Artificial Analysis Index,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token;Google 还称,在 DeepSWE 等部分基准上,降幅最高可到 65%。后一个数字只见于官方材料。

价格也沿着同一方向调整:每百万输入 token 1.50 美元,每百万输出 token 7.50 美元,输出单价低于 3.5 Flash。Google 表示,新模型完成多步骤任务时还会减少推理步骤和工具调用。换句话说,它不只是少说话,也试图少绕路。

官方公布的成绩显示,3.6 Flash 在 DeepSWE 上由 3.5 Flash 的 37% 升至 49%,在 MLE Bench 上由 49.7% 升至 63.9%,在 OSWorld-Verified 上由 78.4% 升至 83.0%。这些测试分别指向软件工程、机器学习研究和电脑操作能力。数字的共同指向很清楚:Google 希望证明,减少 token 并没有以明显牺牲任务表现为代价。

Flash-Lite 把规模放在第一位

Gemini 3.5 Flash-Lite 的任务更单纯:处理数量巨大、又不值得动用昂贵模型的工作,例如智能体搜索和文档处理。Google 称它是 3.5 系列中速度最快、成本最低的型号。这个范围限定很重要,它不是在宣称自己是整个市场上最快或最便宜。

据官方博客引述的 Artificial Analysis 数据,它每秒可输出 350 个 token。定价为每百万输入 token 0.30 美元、每百万输出 token 2.50 美元。开发者还能调整模型的“思考等级”:批量简单任务优先低延迟和低成本,多步骤任务则允许投入更多计算。这像是给同一辆车提供不同挡位,而不是每趟路都踩到底。

“懂安全”不只是一款 Cyber 模型

Gemini 3.5 Flash Cyber 是在通用模型上做过微调的专用模型。微调指用特定领域数据继续训练,让模型更擅长某类任务。它面向发现和修复网络安全漏洞,并与 CodeMender 代码安全智能体配套使用。Google 的判断是,安全工作不能只靠一个会找漏洞的模型,还需要智能体基础设施负责安排检查、验证和修复流程。

据 TechCrunch 转述 Google 的说法,Flash Cyber 暂时只通过有限访问试点,提供给政府和受信任合作伙伴。这种开放方式本身也说明了安全模型的两面性:发现漏洞的能力可以用于修复,也可能被用于攻击。

主力 3.6 Flash 同样加入了安全措施。官方称,它加强了对化学、生物、放射性与核风险,以及网络攻击滥用的防护,并提高了抵抗“越狱”的能力——也就是防止用户用绕过规则的提示诱导模型输出危险内容。同时,Google 表示模型经过训练,以减少对正当用途的误拒绝。不过这些效果在现有材料中没有给出可供核对的具体测试数字。

三箭齐发,也照出一个空位

这套组合传递的信号比单项跑分更重要。Google 正把 Flash 拆成三种角色:3.6 Flash 平衡质量与效率,Flash-Lite 承接高吞吐量任务,Flash Cyber 处理边界更敏感的专业场景。共同目标是让大规模 AI 智能体获得更高效率、更低延迟和更可靠的表现。

但发布会上最显眼的产品或许是没有发布的 Gemini 3.5 Pro。Google DeepMind 产品负责人 Logan Kilpatrick 表示,该模型仍在与合作伙伴测试,希望尽快推出。Google 同时已经启动 Gemini 4 的预训练,并称这是公司迄今“最具雄心”的预训练项目。后一句属于官方定性,目前没有更多结果支撑。

因此,这次更新不宜被理解成 Google 推出了新的全公司最强模型。现有信源对此说法存在冲突,而通常承担最高能力定位的 Pro 仍然缺席。更准确的判断是:Google 先把可大规模使用的产品层补得更细,却尚未交出新旗舰。

局限与未知

  • 速度、token 降幅、价格和基准成绩主要来自 Google 官方披露,尚不足以代表不同真实业务中的稳定表现。
  • Flash Cyber 的训练细节、评测方法和试点规模没有在现有材料中完整公开,其“前沿竞争力”仍是官方表述。
  • Gemini 3.5 Pro 没有明确发布日期;Gemini 4 也只确认已开始预训练,能力与产品形态仍未知。

供稿材料 SOURCES — 3

← 返回 2026-07-22 · 科技板块