Google 发布 Gemini 4 Argon:首款生成式模型,聚焦网络安全与代码重构
Google 正式推出了其 Gemini 4 系列的首款模型——Gemini 4 Argon。该模型在初期仅限受信任的网络安全防御团队及 Google 内部使用。9 月 30 日,公司通过“Fairwind 计划”宣布了 Argon 的发布。该计划旨在向选定的政府机构及可信合作伙伴提供 Google 高级网络安全模型的访问权限。
Google 表示,Argon 能够自主发现、验证并修补关键软件漏洞。目前,出于持续测试模型及完善安全措施的考虑,公司暂时限制了更广泛的公众访问权限。付费 API 用户及 Google AI Ultra 订阅用户将在稍后获得访问权限,但具体开放日期尚未公布。
性能基准对比
在软件工程任务基准测试 DeepSWE v1.1 中,Argon 取得了 77.9% 的成绩。相比之下,Anthropic 的 Claude Opus 5.5 得分为 74.2%,OpenAI 的 GPT-6 Astra 得分为 74.1%。
在评估 AI 模型识别和修复软件漏洞能力的 CWE-bench v1 测试中,Argon 得分 68%,与 GPT-6 Astra 持平。需要注意的是,这些基准结果源自 Google 自身的评估,尚不能独立证明 Argon 在实际工作负载中的全面表现。
突破性的输出能力
Argon 的单次响应最大输出量可达 100 万个 Token,而此前模型的输出限制仅为 64,000 个 Token。Token 是 AI 模型处理和生成的基本文本单位。这一大幅扩展的输出限制旨在让 Argon 能够处理更长的软件工程及其他复杂任务,无需反复提示继续生成。
内部应用现状:从代码迁移到数据中心优化
目前,已有数千名 Google 员工在内部使用 Argon 进行编码、研究及其他专业任务。据报道,Argon 正被用于将 C 和 C++ 代码库迁移至 Rust 语言。Google 的 Argon 代理正在处理规模从数万行到超过 80 万行的代码库,其中包括其 Fuchsia 操作系统的 Zircon 内核。
对于大规模的代码迁移,公司在将其部署到生产环境之前,会进行自动化和人工审计、模拟测试以及审查。
此外,Google 还利用 Argon 代理分析数据中心性能数据,以识别内存优化方案。据公司预计,一旦全面部署,这些更改将释放超过 300 TiB(tebibytes)的内存,总节省空间估计在 500 TiB 到 1 PiB(pebibyte)之间。
Google 的量子计算研究人员也在利用 Argon 优化算法。在一个案例中,Argon 在短短几分钟内便将某项量子计算任务的基准性能提升了 40%。
为何限制访问?
Argon 的网络安全能力是其分阶段 rollout 的主要原因。Google 指出,该模型能够在极少人工干预的情况下识别并修复漏洞。随着此类能力日益普及,既带来了防御优势,也潜在地增加了安全风险。因此,Google 首先通过 Fairwind 计划向受信任的网络防御者开放模型,以便收集反馈并继续完善安全措施。
Google 表示,随着访问范围的扩大,Argon 最终将面向开发者、企业和消费者开放。
定价策略
Google 将为 Argon 推出入门级价格:每百万输入 Token 2 美元,每百万输出 Token 10 美元。在入门期结束后,价格将调整为每百万输入 Token 4 美元,每百万输出 Token 20 美元。缓存的输入 Token 将获得输入 Token 价格 95% 的折扣。
此次发布正值 Google 与 OpenAI 及 Anthropic 等公司在开发具备更强能力的 AI 模型方面展开竞争,这些模型主要应用于编码、网络安全、研究及企业工作负载领域。目前,Google 自身的基准测试仍是 Argon 主要的公开性能衡量标准,而更广泛的访问权限将使独立用户和研究者能够在更多工作负载下对模型进行测试。