Google 发布 Gemini 4 Argon 前沿模型
Gemini 4 Argon: our next era of frontier intelligence
Google 发布新一代前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
官方给出 Gemini 4 Argon 的基准成绩、内部落地案例与分阶段开放路径,可据此判断前沿模型在长周期工程与安全防御上的进展。
2026年9月30日
|
Gemini 4 Argon 在真实世界软件工程、法律和金融等企业知识工作以及网络安全防御等复杂工作流中提供前沿性能。
本文内容
- 推出 Gemini 4 Argon
- 改变我们在 Google 的工作和构建方式
- 更努力地解决您最复杂的问题
- 跨领域支持编码和企业工作流
- 在防御性网络安全领域保持领先
- 在广泛可用之前加强前沿保障措施
- 即将推出
今天,我们宣布推出新的前沿模型 Gemini 4 Argon,该模型正通过我们的 Fairwind 计划向一组受信任的网络防御者推出。Argon 旨在在复杂、长周期的工作流中维持深度推理,正在从根本上改变我们在 Google 的工作和构建方式。它在真实世界软件工程、法律和金融等企业知识工作以及网络安全防御等复杂工作流中提供前沿性能。
安全地发布这一级别的前沿能力需要分阶段推进。我们正积极参与美国政府关于发布前模型访问的自愿流程,同时逐步扩大访问范围。我们将继续收集早期测试者的反馈,并在护栏方面进行迭代,以便尽快让开发者、企业和消费者使用 Argon。
Argon 将以每百万输入 token 2 美元、每百万输出 token 10 美元的 introductory price 推出 1 ,缓存输入 token 的价格为输入 token 价格的 95% 折扣。
改变我们在 Google 的工作和构建方式
Gemini 4 Argon 已经在为我们的内部工作流提供支持,数千名 Google 员工强调了该模型在专业编码任务、开展更深入研究和写作质量方面的优势。它正在帮助团队更快地构建,推动工程生产力的边界,并加速突破:
- 量子算法优化: Argon 正在帮助我们的量子计算研究人员优化对重要应用造成瓶颈的子程序的时空资源(量子比特 × 门)。在一个例子中,它在几分钟内就比已发布的基线提高了 40%。
- 内存效率: 一个由 Argon 智能体组成的团队分析了全集群性能分析遥测数据,自主识别并在 Google 数据中心范围内应用内存优化,全面推出后释放了超过 300 TiB 内存,预计总节省量可达 500 TiB 至 1 PiB。
- Large Scale Codebase Migrations and Optimizations: Argon agents are working on migrating C/C++ codebases to Rust across Google — scaling from tens of thousands of lines in core libraries like re2, libgav1 up to 800K+ lines for the Fuchsia Zircon kernel. Given the criticality of many of these systems, such large-scale rewrites are undergoing rigorous automated and manual auditing, emulation testing, and review before rolling out to production.
对于 libgav1——Google 用于解码视频的开源软件——Argon 智能体接手了现有的 Rust 移植版本,并通过运行多轮性能分析引导的实验、研究编译器输出、生成安全的 Rust 以便编译器自动向量化,替换了 32K 行 SIMD 代码。最终结果是一个内存安全的视频解码器,运行速度比 Rust 移植版本快 2.7 倍,视频输出完全相同,使其更接近优化后的 C++。
在最复杂的问题上投入更多努力
为了支持 Gemini 4 Argon 在更长、更复杂用例中的能力,我们将模型的输出 token 上限大幅提升至行业领先的 100 万 token,此前为 64K token。当模型有足够的空间深入思考并在单次轨迹中生成数十万 token 时,它便为推理增添了新的深度层次,从而一次性解决棘手问题。
赋能跨领域的编码与企业工作流
Gemini 4 Argon 在编码、推理和多模态方面的能力,以及其维持长时间、多步骤任务的能力,使其能够出色应对各类企业工作流。
Google 工程师一直在日常任务中使用 Argon,从日常调试到大规模代码库迁移和算法设计。它在 DeepSWE v1.1(77.9%)上树立了新的最先进水平,该基准衡量模型在真实世界长周期软件工程任务中的表现。
除编码之外,Argon 还是 Vals Index 上的领先模型,该指数衡量金融、编码、法律和税务工作方面的经济影响,每个领域按其对美国 GDP 的贡献加权。我们在其他领域特定评估中也看到同样领先的表现,例如 Vals Finance Agent v2(多步骤金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究与起草)。在 Zapier 衡量核心业务职能端到端执行的基准 AutomationBench 上,Argon 以 51.3% 的得分排名第一。
当知识工作需要进行视觉理解时,Argon 也展现出独特的强大能力。它能够驱动专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解的 LVBench 上,Argon 以 91.7% 的得分达到最先进水平。
在防御性网络安全领域领先
为了更好地让网络防御者应对网络攻击的新时代,我们训练 Gemini 4 Argon 在网络安全防御方面具备高度能力。Argon 能够自主发现、验证并修补关键软件漏洞。对于受信任的防御者以及 Google 内部团队,我们将发布不带网络防护限制的 Argon,以便他们充分利用其前沿级网络安全防御能力。
Wiz 已通过其 Scan for Good 计划将 Argon 用于网络安全防御——该计划致力于免费保护关键公共基础设施,通过发现并修复高风险暴露。在其影响力的早期演示中,该模型发现了一个关键漏洞,暴露了全球医院所使用的医疗软件中的敏感个人信息,识别出此前前沿模型遗漏的严重风险。
在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分并列第一,延续了 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现。
Gemini 4 Argon 在漏洞发现方面相较 3.8 Flash Cyber 展现出令人瞩目的飞跃。例如:
- 在 Google 内部综合漏洞基准上,Argon 在涵盖 20 种编程语言的复杂代码库中发现了广泛的暴露。
- 在 Wiz 的内部黑盒渗透测试基准中,该基准测试模型在没有源代码的情况下分析实时 Web 系统的能力,Argon 在发现攻击面、识别漏洞以及生成概念验证证据以验证漏洞方面,表现优于 3.8 Flash Cyber。
在广泛开放之前加强前沿防护措施
在广泛推出 Gemini 4 Argon 之前,我们将继续在四个主要领域加强关键的前沿防护措施:
防御滥用:为防止恶意行为者利用 Argon 进行网络或化学、生物、放射和核(CBRN)攻击,该模型被设计为拒绝有害请求,同时保留合法的双重用途科学研究,这符合我们的前沿安全框架。我们正在为此次发布加强防护措施的稳健性,包括改进我们监控模型内部激活以发现滥用的技术。这些防护措施经过了内部和外部红队的稳健性测试,使用了手动和自动化攻击方法的组合。
防御提示注入攻击:Argon 也是我们迄今为止对间接提示注入最具韧性的模型,间接提示注入是指利用恶意指令或上下文劫持模型行为。这些是复杂的攻击,需要持续警惕和多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准上处于提示注入稳健性领先地位。
监控失准:为了防止 Argon 越界,以超出用户意图的方式尝试完成任务,我们部署了失准缓解措施,监控 Argon 的思维链和行动,并在必要时停止执行。
我们使用类似的系统来监控我们的训练运行,并向专门的事件响应团队发送警报,同时采取谨慎的预防措施,避免将发现结果反馈到训练中,以免有塑造 Argon 推理以逃避我们监控的风险。我们强烈鼓励业界其他各方在能力增强的关键时刻、在应对对齐风险的同时,保持推理透明度,以便模型思维仍有助于识别和诊断失准。
加固系统:随着前沿模型能力日益增强,安全测试它们需要能够跟上系统本身的安全环境。根据我们的智能体控制路线图,我们正在通过在开始高风险训练或评估之前隔离和封闭沙盒环境来加固它们。我们致力于与合作伙伴分享这些智能体安全最佳实践,以改善整个生态系统的安全性。
即将推出
我们构建 Gemini 4 Argon 时,在编码、知识工作、网络安全防御和创意写作方面具备前沿级能力,旨在成为开发者、专业人士和企业在应对最困难问题时的伙伴。我们感谢首批网络防御者和可信测试者,他们的真实世界评估和反馈将帮助我们在向开发者、企业和消费者发布之前加强我们的系统,首先从付费 API 客户和 Google AI Ultra 订阅者开始。
来源:Google Gemini Blog · blog.google