跳到正文
Google Gemini Blog·· 2026-09-02精选AI 评分82

Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

AI 导读

Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。

推荐理由

官方给出两个变体的基准表现与定价,可据此判断长程编码与网络安全场景的性价比取舍。

正文 · AI 翻译

2026年9月2日

|

我们最新的 Gemini 模型为智能体工作流和网络安全带来下一代智能。


Raluca Ada Popa

Google DeepMind Gemini 安全负责人


a hero image reading "Gemini 3.8 Flash and 3.8 Flash Cyber"

继三周前 3.7 Flash 的势头,并标志着我们在短短六周内的第三次 Flash 发布,今天我们推出 Gemini 3.8,这是我们迄今最强的推理和编码模型,速度与低成本与 3.7 相同。Gemini 3.8 推出 2 个变体:

  • Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务以及专业领域的关键多步推理方面相较 3.7 Flash 带来显著提升。它以与 3.7 Flash 相同的介绍性价格 1 提供,即每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
  • Gemini 3.8 Flash Cyber:我们能力最强的网络安全模型,在漏洞检测和自动修补方面具备前沿级性能,通过我们全新的 Fairwind Program 提供给受信任的防御者。

虽然针对不同的部署环境量身定制,但今天发布的两款产品都由相同的基础智能驱动,并进一步通过长时间运行的智能体循环加速,这些循环旨在递归地评估和优化底层模型。这一共享核心在编码和推理方面的显著提升,源于多项创新,包括在要求极高的网络安全领域进行的严格训练。

Gemini 3.8 Flash:为长周期编码和自主智能体而构建

Gemini 3.8 Flash 相较 3.7 Flash 带来大幅提升,往往接近成本更高的前沿模型的性能。

comparison chart showing Gemini 3.8 Flash and other models

在 DeepSWE v1.1(长周期软件工程)上,3.8 Flash 在自主端到端解决复杂工程问题方面优于大多数更大的前沿模型,而成本仅为其一小部分。

chart showing Gemini 3.8 Flash DeepSWE v1.1

此外,3.8 Flash 在专业知识领域展现出关键企业自主性所需的可靠性。在需要高级分析和报告的定量与专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中优于 3.7 Flash 和其他前沿模型。3.8 Flash 还在 HLE-Verified 上取得 54.9% 的成绩,展示了其处理 STEM、人文学科和专业领域多步推理的能力。

chart showing Gemini 3.8 Flash Vals Finance Agent v2

a chart showing Gemini 3.8 Flash Harvey's Legal Agent Benchmark

a chart showing Gemini 3.8 Flash HLE-Verified

这些性能提升源于一个核心设计选择:3.8 Flash 更加努力。在复杂任务上,它表现出更高的勤勉度——执行额外的推理步骤,并迭代调用工具。有时,模型可能会使用更多 token 以最大化性能,尤其是在更高努力级别下。

对于计算效率是主要约束的应用,开发者可以利用较低的努力级别来最小化 token 开销,或继续依赖 Gemini 3.7 Flash,它仍为效率优先的工作负载提供全面支持。

Gemini 3.8 Flash Cyber:专家级网络性能

Gemini 3.8 Flash Cyber 通过 Fairwind Program 提供给一组受信任的防御者,在当今复杂的网络安全格局中提供决定性优势,其 Flash 级速度和成本支持快速迭代。

自主漏洞发现

在发现漏洞的标准行业基准 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞发现方面展现出前沿水平的性能。它超越了 3.5 Flash Cyber 以及规模显著更大的前沿模型。

a chart showing Gemini 3.8 Flash Cyber CyberGym Pass@1

为了更好地把握现实世界的防御需求——这些需求并不像 CyberGym 那样仅限于 C/C++ 代码库——我们还针对一个全面的内部基准对 Gemini 3.8 Flash Cyber 进行了评估,在该基准中,模型必须在涵盖 20 种编程语言的复杂代码库中发现各种漏洞。在这里,该模型相较我们之前的模型展现出令人瞩目的飞跃,成功率超过 70%。

Chart showing Gemini 3.8 Flash Cyber real world vulnerability discovery

自动修补

借助 Gemini 3.8 Flash Cyber,我们特别专注于为防御者配备专家级能力,使其相较攻击者占据优势。正因如此,我们从一开始就投入于漏洞修复,并将其置于利用等攻击性能力之上。

由 Collinear 运营的 CWE-Bench 是修补能力方面一项颇具挑战性的外部基准。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但成本显著更低。

Chart showing Gemini 3.8 Flash Cyber StaticBench Pass@1 vs Cost Per Rollout

现实世界影响:保护 Google 的代码

我们已经在使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:

  • Chrome 安全团队发现,与规模大得多的最佳商用模型相比,3.8 Flash Cyber 为 Chrome 中的漏洞生成的正确补丁数量多出 2.6 倍。
  • Wiz 发现,与其他领先的前沿模型相比,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率高出 7.5-9.7%,而成本低 2.3-5.2 倍。
  • Google 云漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键的基础性漏洞,而该漏洞的研究和发现通常需要数月时间。

我们的 Fairwind 计划合作伙伴如是说

quote from David Slater, Founder and Chief Architect, Armadin

quote from Charlie Sestito, Director, Office of the CTO, Palo Alto Networks

quote from Mayank Upadhyay, CSTO, Snowflake

quote from Gal Nagli, Head of Threat Exposure, Wiz

以安全为设计理念

根据我们的 前沿安全框架,3.8 Flash 内置了针对化学、生物、放射和核(CBRN)以及网络攻击领域的滥用防护措施,同时支持有益的用例。3.8 Flash Cyber 针对网络安全配备了一套更为宽松的缓解措施,因此仅向需要更全面网络能力的可信防御者提供。

根据 Gray Swan 的衡量,Gemini 3.8 模型在提示注入鲁棒性方面也取得了显著飞跃,保护 Gemini 模型用户免受与提示注入相关的恶意攻击。

a chart showing Gemini 3.8 Flash Cyber Gray Swan IPI Benchmark

Gemini 3.8 Flash 和 Cyber:立即开始使用

来源:Google Gemini Blog · blog.google