一句话总结
Google 在 9 月 30 日发布 Gemini 4 Argon,官方称这是它新一代的前沿模型:输出上限从 64K 一口气提到 100 万 token,入门价 $2 / $10 每百万输入输出 token,在 DeepSWE v1.1 上拿到 77.9%、CWE-bench v1 以 68% 并列第一。但它不是一次公开上线——Argon 目前只通过 Google 的 Fairwind 计划发放给网络安全防御方,Google 甚至写明会为可信防御者「去掉网络相关护栏」以用满能力,之后再考虑放开给开发者和消费者。
数据来源:Google 官方博客《Gemini 4 Argon: our next era of frontier intelligence》(2026-09-30,Google DeepMind);Google 官方评测图表(CWE-bench v1、漏洞发现、Gray Swan IPI);TechCrunch《Google releases Gemini 4 Argon, called its most powerful model yet》(2026-09-30)。
Argon 是什么:三个必须先讲清的前提

Google 在官方博客里的定位是「前沿性能」:覆盖真实软件工程、法律与财务这类企业知识工作,以及网络安全防御。Koray Kavukcuoglu(Google DeepMind 高级副总裁、首席 AI 架构师)的口径是:Argon 为「长程、复杂工作流中的深度推理」而建,已经在改变 Google 内部的工作方式。
但有三件事比参数更重要:
- 它还没有公开可用。今天是 Fairwind 计划里的可信网络安全防御方在内测,Google 在博客里同时说明「正在配合美国政府的前置模型访问自愿流程」,会先扩大访问范围、迭代护栏;
- 官方给出的后续路径是「付费 API 客户与 Google AI Ultra 订阅者先拿到」,然后是开发者、企业和消费者;
- 它的强项被明确写成「防御性网络安全」——官方原话是能「自主发现、验证并修补关键软件漏洞」,并且对可信防御者和 Google 内部团队「去掉网络相关护栏」发布。

价格与上下文是这一代最容易被忽略的变动:输出上限 100 万 token,是上一代 64K 的十几倍;入门价每百万 token 输入 $2、输出 $10,缓存输入再打 95% 折扣,入门期结束后回到 $4 / $20。
官方给的安全成绩单:68%、85.8%、0.7%
Google 这次把网络安全相关的评测摊得比较开,三张官方图值得逐一看。
第一张是 CWE-bench v1——衡量模型「修复安全漏洞」的能力。Argon 的 68% 是并列第一:Grok 4.7 同样是 68%,GPT-6 Astra 也是 68%,Claude Opus 5.5 是 67%。也就是说,这是并列而非独占,官方博客的措辞是「ties for first place」。

第二张是漏洞发现能力,分两个场景:扫源码(覆盖 20 种编程语言)Argon 拿 85.8%,而上一代的 Gemini 3.8 Flash Cyber 是 71.0%;在黑盒渗透测试基准(不读源码、直接打线上系统)上 Argon 是 70.9%,上一代 58.2%。

第三张是间接提示注入(IPI)——攻击者把恶意指令藏在网页或文档里,试图劫持模型行为。这个指标越低越好,Argon 在 K=15 次尝试下的攻击成功率只有 0.7%,是图上所有模型里最低的:Claude Opus 5.5 与 Fable 51 都是 1.0%,GPT-6 Astra 8.5%,GPT-6.1 Sol 10.1%,而 Grok 4.6 与 Kimi K3 分别是 51.8% 和 52.7%。

其余官方点名的数字还有:DeepSWE v1.1(真实长程软件工程)77.9%,官方称新 SOTA;LVBench 长视频理解 91.7%;Zapier 的 AutomationBench 上以 51.3% 排第一;Google 还称 Argon 在 Vals 指数(按对美国 GDP 的贡献加权衡量金融、编程、法律、税务工作的经济影响)上处于领先。TechCrunch 的表述是:Google 声称 Argon 在多项基准上显著高于 OpenAI 的 GPT-6 Astra 与 Anthropic 的 Fable、Opus。
它在 Google 内部已经干了什么
这些案例是官方博客里少见的「自报战果」,也是理解 Argon 定位的最好材料:
- 量子算法优化:Argon 帮量子计算团队优化子程序的时空资源(qubit × gate),其中一个例子在几分钟内把已发表的基线提升了 40%;
- 数据中心内存优化:一队 Argon Agent 分析了全机群的 profiling 数据,自主定位并应用内存优化,已释放超过 300 TiB 内存,Google 估计全部落地后总节省在 500 TiB 到 1 PiB 之间;
- C/C++ 到 Rust 的大规模迁移:从 re2、libgav1 这类核心库的几万行,到 Fuchsia Zircon 内核的 80 万行以上,都由 Argon Agent 参与;Google 强调这类改写要过自动化与人工审计、模拟测试才会进生产;
- libgav1 的具体结果:Argon 替换了 3.2 万行 SIMD 代码,产出的内存安全 Rust 版解码器比原来的 Rust 移植版快 2.7 倍,视频输出完全一致。
另外,网络安全公司 Wiz 通过它的免费公益项目 Scan for Good 用 Argon 找漏洞,官方举的例子是:模型发现了一个暴露敏感个人信息的严重漏洞,涉及全球多家医院在用的医疗软件,而之前的前沿模型都没发现。
分阶段发布与四层护栏:为什么「最强」还轮不到你用
Google 在博客里用一整节解释「为什么不一次放开」,理由集中在四个方向:

- 滥用防护:拒绝网络与 CBRN(化学、生物、放射、核)类有害请求,同时保留正当的双用途科研;官方称这一轮加强了激活值监控,用于发现滥用;
- 提示注入:官方称 Argon 是自家「最抗间接提示注入」的模型,依据就是上面的 Gray Swan 榜单;
- 失准(misalignment)监控:部署了盯住思维链与动作的机制,必要时中断执行;训练期也用类似系统向专门的应急响应团队告警,并刻意避免把监控发现回流进训练,以免模型学会规避监控;
- 沙箱加固:高风险训练与评测开始前,把隔离环境封闭起来。
这里有一条值得单独记下来的话:Google 在博客里公开建议整个行业在能力提升的关口保留推理透明度,让模型的想法仍然能用来识别和诊断失准。这句话在当下的语境里分量不轻——它相当于反对「把思维链藏起来」。
谁现在能用,谁只能等
- 能用的人:Fairwind 计划里的网络安全防御伙伴,以及 Google 内部团队(无网络相关护栏);官方后续会先放开给付费 API 客户与 Google AI Ultra 订阅者;
- 只能等的人:普通开发者、企业和消费者。官方措辞是「会尽快」,但没有给日期;
- 想现在就用前沿模型的人:选择依然在 GPT-6 Astra、GPT-6.1 Sol、Claude 系列以及你手上已有的模型之间。
有一点值得冷静看待:Argon 目前所有成绩都由 Google 自己公布,Vals 等第三方指数虽然被引用,但完整的复现评测还要等它真正放开之后。官方在同一天也承认,这次发布是「分阶段」的——这句话的另一层意思就是,现在没人能独立验证它到底有多强。
总结
- Gemini 4 Argon 是 Google 新一代前沿模型,官方称最强,强项明确指向防御性网络安全;
- 输出上限 100 万 token、入门价 $2/$10、DeepSWE v1.1 77.9%、CWE-bench v1 68%(并列第一)、Gray Swan IPI 攻击成功率 0.7%(最低);
- 它没有公开上线:先给 Fairwind 计划的安全防御伙伴,且对可信伙伴去掉网络相关护栏;之后才轮到付费 API 客户与 Google AI Ultra 订阅者;
- Google 把四层护栏(滥用、提示注入、失准监控、沙箱)和「保留推理透明度」的行业建议一起写进了发布文,这是这次发布里信息量最大的部分。
数据来源:Google 官方博客《Gemini 4 Argon: our next era of frontier intelligence》(2026-09-30,Google DeepMind,作者 Koray Kavukcuoglu)及其官方评测图表(CWE-bench v1、Real-world Vulnerability Discovery / Wiz Penetration Test Benchmark、Gray Swan IPI,方法学页 deepmind.google/models/evals-methodology/gemini-4-argon);TechCrunch《Google releases Gemini 4 Argon, called its most powerful model yet》(2026-09-30,Lucas Ropek)。
图片出处:封面、关键数字图、发布路径与护栏图由 UU AI Hub 自制;主视觉与三张评测图取自 Google 官方博客原文(版权归 Google 所有)。