Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.090 — 2026-10-02
NEWS HN 1623 · 9 信源 约 8 分钟

Gemini 4 Argon:谷歌押注受控开放

谷歌旗舰 Argon 跑分领先、长输出激进,却先交给少数安全团队试用:能力与开放边界同样值得看。

IMAGE — InfoQ 中文
Gemini 4 Argon:谷歌押注受控开放

你让 AI 接手一个大型软件项目,它不能只写几段代码就停下。它得先读懂旧系统,再修改、测试、检查性能,发现问题后还要回头重做。整个过程可能持续许多步骤。今天多数模型最容易在这里掉链子:单步表现不错,流程一长,就可能忘记目标或带着错误继续走。

Google 于 9 月 30 日发布 Gemini 4 Argon,试图把这种“长流程推理”向前推进——也就是让模型围绕同一目标持续规划、调用工具、检查结果,并完成一连串彼此依赖的任务。它瞄准软件工程、法律与金融工作,以及网络安全防御。但更值得看的不只是跑分,而是发布方式:普通开发者和消费者目前用不到它,首批访问者只有经过筛选的安全防御团队。

这篇报道中的成绩与工程案例,多数仍源自 Google 自报,尚缺公开复现或大范围独立实测。因而,Argon 现在更像一份能力很强、但仍待外界验货的产品说明书。

一百万 Token,买的是连续工作空间

Argon 最醒目的变化,是把单次输出上限从 64K Token 提高到 100 万。Token 是模型处理文字的基本单位,可以粗略理解为字词片段。这里的“100 万”指输出上限,不是输入上下文窗口,也不代表模型一定能稳定写出同样长且始终正确的内容。

这项设计服务于长任务。传统对话常要把一个大项目拆成许多轮,再不断要求模型“继续”。Argon 则获得了更大的单次执行空间,可以容纳更多分析、工具调用、修改和验证过程。不过,纸张变多不等于思路一定清楚。模型能否长期守住目标、正确使用工具并及时纠错,仍比输出长度本身重要。

价格也体现了 Google 推动实际使用的意图:首发优惠价为每百万输入 Token 2 美元、每百万输出 Token 10 美元,缓存输入比普通输入便宜 95%。缓存输入可以理解为重复使用模型已经处理过的材料,避免每次从头计算。只是这些价格目前还没有多少普通用户可以真正采用。

跑分领先,但不是全面领先

在 DeepSWE v1.1——一项考察真实、长流程软件工程任务的评测——Argon 得分 77.9%,高于 Claude Opus 5.5 的 74.2%和 GPT-6 Astra 的 74.1%。领先约 3.7 至 3.8 个百分点,值得注意,但谈不上“碾压”。

在衡量漏洞修复能力的 CWE-bench v1 上,Argon 得分 68%,与 GPT-6 Astra 并列第一。它还以 68.90%位居 Vals Index 首位;这个指数覆盖金融、编程、法律和税务工作,并按各行业对美国 GDP 的贡献加权。

其他成绩需要更谨慎地看。Google 称 Argon 在 Zapier AutomationBench 上以 51.3%排名第一,在长视频理解评测 LVBench 上得到 91.7%,但两项目前都只有单一信源支持。它在 Text Arena 以 1525 分居首,在偏重网页开发的 Code Arena 却只排第八。换句话说,Argon 展示了很强的综合能力,却还不能据此断言它在所有编程任务上都领先。

据 Bloomberg News 报道,Google 内部也存在分歧:一些员工认为模型在实际编程和前端任务中的表现不如公开基准给人的印象,怀疑它可能过度适应榜单;另一些员工则认为它已达到前沿水平。Google 否认“编程表现不佳”的说法。在外部开发者尚不能亲自测试时,这场争论暂时没有裁判。

真正有分量的是工程现场

比跑分更具体的,是 Google 公布的内部案例。Argon 智能体——能自行规划并调用工具执行任务的模型系统——正在协助把 C/C++ 代码库迁移到 Rust,范围从 re2、libgav1 扩展到 Fuchsia 的 Zircon 内核,后者涉及超过 80 万行代码。

但“参与迁移”不等于迁移已经完成。Google 明确表示,这些改写仍要经过自动化与人工审计、仿真测试和评审,尚未投入生产。

在视频解码软件 libgav1 上,Argon 智能体基于已有的 Rust 移植版,替换了约 3.2 万行 SIMD 代码。SIMD 是让处理器一次对多份数据执行相同运算的技术,常用于提高图像和视频处理速度。模型反复查看性能分析和编译器输出,再生成可由编译器自动加速的安全 Rust 代码。Google 称,新版本保持相同视频输出,速度达到原 Rust 移植版的 2.7 倍。比较对象是旧的 Rust 版本,不是优化后的 C++ 实现。

另一个案例更有画面感。一组 Argon 智能体分析 Google 数据中心的性能遥测——也就是服务器运行时持续产生的测量数据——寻找可以回收的内存。Google 称,已经部署的优化释放了超过 300 TiB,预计最终可节省 500 TiB 至 1 PiB。它没有添置硬件,而是在现有基础设施里找出了被浪费的空间。

Google 还称,Argon 在一个量子算法优化案例中,几分钟内做出了比已发表基线好 40%的结果。不过官方没有披露完整任务和实验条件,这个数字目前无法细查。

越会找漏洞,越不能随便发

网络安全能力具有双重用途:同一种能力既能帮助防守者找出并修补漏洞,也可能被用于寻找攻击路径。Google 宣称 Argon 可以自主发现、验证并修复关键软件漏洞。因此,它首先通过 Fairwind Program 向经过筛选的安全防御团队开放;这些受信任团队还可使用不带网络安全护栏的版本。

据 Google 官方博客,Wiz 的 Scan for Good 计划曾用 Argon 找到一个关键漏洞,涉及全球医院使用的医疗软件和敏感个人信息泄露。但该案例没有公开完整任务与验证材料。关于 Argon 在 Google 内部多语言漏洞基准及 Wiz 黑盒渗透测试中的优势,现有说法也存在“20 种”与“20 多种语言”的差异。

Google 计划根据首批测试反馈完善防滥用、提示注入防御、对齐偏差监测和运行环境加固,再逐步扩大 API、企业和消费者访问。分阶段开放不是附带安排,而是 Argon 这次发布的核心:Google 一面展示更长的执行能力,一面承认这种能力不能像普通聊天产品那样立即全面放出。

为什么值得关注

Argon 把前沿模型竞争从“回答得多聪明”推向“能否连续把事情做完”。代码迁移、数据中心优化和漏洞修复,都要求模型进入真实流程,并接受性能、资源消耗或功能一致性的检验。若这些案例经得住外部验证,模型的角色会更接近能够执行项目的协作者,而不只是生成文字的助手。

与此同时,受控开放制造了一个现实矛盾:最需要独立验证的能力,恰恰只有少数伙伴能够接触。Google 得到了观察风险和补强护栏的时间,开发者却只能先看厂商成绩单。Argon 最重要的考题因此有两个:它是否真能稳定完成长流程任务,以及 Google 能否把这种能力安全地交给更多人。

局限与未知

  • 绝大多数性能数字和内部工程成果仍来自 Google,缺少公开复现和广泛独立测试。
  • 100 万 Token 只是最高输出上限,材料没有证明模型能稳定完成百万 Token 的长任务。
  • Google 尚未公布扩大开放的具体时间,Zircon 迁移也仍处于审计、测试与评审阶段。

供稿材料 SOURCES — 9

← 返回 2026-10-02 · 科技板块