Google 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体,前者面向长程编码与自主智能体,后者面向漏洞发现与自动修复。
官方给出两个变体的基准表现与定价,可据此判断长程编码与网络安全场景的性价比取舍。
2026年9月2日
|
我们最新的 Gemini 模型为智能体工作流和网络安全带来下一代智能。
Raluca Ada Popa
Google DeepMind Gemini 安全负责人
继三周前 3.7 Flash 的势头,并标志着我们在短短六周内的第三次 Flash 发布,今天我们推出 Gemini 3.8,这是我们迄今最强的推理和编码模型,速度与低成本与 3.7 相同。Gemini 3.8 推出 2 个变体:
- Gemini 3.8 Flash:我们最智能的主力模型,在软件工程、智能体任务以及专业领域的关键多步推理方面相较 3.7 Flash 带来显著提升。它以与 3.7 Flash 相同的介绍性价格 1 提供,即每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
- Gemini 3.8 Flash Cyber:我们能力最强的网络安全模型,在漏洞检测和自动修补方面具备前沿级性能,通过我们全新的 Fairwind Program 提供给受信任的防御者。
虽然针对不同的部署环境量身定制,但今天发布的两款产品都由相同的基础智能驱动,并进一步通过长时间运行的智能体循环加速,这些循环旨在递归地评估和优化底层模型。这一共享核心在编码和推理方面的显著提升,源于多项创新,包括在要求极高的网络安全领域进行的严格训练。
Gemini 3.8 Flash:为长周期编码和自主智能体而构建
Gemini 3.8 Flash 相较 3.7 Flash 带来大幅提升,往往接近成本更高的前沿模型的性能。
在 DeepSWE v1.1(长周期软件工程)上,3.8 Flash 在自主端到端解决复杂工程问题方面优于大多数更大的前沿模型,而成本仅为其一小部分。
此外,3.8 Flash 在专业知识领域展现出关键企业自主性所需的可靠性。在需要高级分析和报告的定量与专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中优于 3.7 Flash 和其他前沿模型。3.8 Flash 还在 HLE-Verified 上取得 54.9% 的成绩,展示了其处理 STEM、人文学科和专业领域多步推理的能力。
这些性能提升源于一个核心设计选择:3.8 Flash 更加努力。在复杂任务上,它表现出更高的勤勉度——执行额外的推理步骤,并迭代调用工具。有时,模型可能会使用更多 token 以最大化性能,尤其是在更高努力级别下。
对于计算效率是主要约束的应用,开发者可以利用较低的努力级别来最小化 token 开销,或继续依赖 Gemini 3.7 Flash,它仍为效率优先的工作负载提供全面支持。
Gemini 3.8 Flash Cyber:专家级网络性能
Gemini 3.8 Flash Cyber 通过 Fairwind Program 提供给一组受信任的防御者,在当今复杂的网络安全格局中提供决定性优势,其 Flash 级速度和成本支持快速迭代。
自主漏洞发现
在发现漏洞的标准行业基准 CyberGym 上,Gemini 3.8 Flash Cyber 在自主漏洞发现方面展现出前沿水平的性能。它超越了 3.5 Flash Cyber 以及规模显著更大的前沿模型。
为了更好地把握现实世界的防御需求——这些需求并不像 CyberGym 那样仅限于 C/C++ 代码库——我们还针对一个全面的内部基准对 Gemini 3.8 Flash Cyber 进行了评估,在该基准中,模型必须在涵盖 20 种编程语言的复杂代码库中发现各种漏洞。在这里,该模型相较我们之前的模型展现出令人瞩目的飞跃,成功率超过 70%。
自动修补
借助 Gemini 3.8 Flash Cyber,我们特别专注于为防御者配备专家级能力,使其相较攻击者占据优势。正因如此,我们从一开始就投入于漏洞修复,并将其置于利用等攻击性能力之上。
由 Collinear 运营的 CWE-Bench 是修补能力方面一项颇具挑战性的外部基准。在该基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但成本显著更低。
现实世界影响:保护 Google 的代码
我们已经在使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:
- Chrome 安全团队发现,与规模大得多的最佳商用模型相比,3.8 Flash Cyber 为 Chrome 中的漏洞生成的正确补丁数量多出 2.6 倍。
- Wiz 发现,与其他领先的前沿模型相比,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上的召回率高出 7.5-9.7%,而成本低 2.3-5.2 倍。
- Google 云漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键的基础性漏洞,而该漏洞的研究和发现通常需要数月时间。
我们的 Fairwind 计划合作伙伴如是说
以安全为设计理念
根据我们的 前沿安全框架,3.8 Flash 内置了针对化学、生物、放射和核(CBRN)以及网络攻击领域的滥用防护措施,同时支持有益的用例。3.8 Flash Cyber 针对网络安全配备了一套更为宽松的缓解措施,因此仅向需要更全面网络能力的可信防御者提供。
根据 Gray Swan 的衡量,Gemini 3.8 模型在提示注入鲁棒性方面也取得了显著飞跃,保护 Gemini 模型用户免受与提示注入相关的恶意攻击。
Gemini 3.8 Flash 和 Cyber:立即开始使用
- 开发者:使用 3.8 Flash 进行构建,并在 Google Antigravity 中探索智能体优先的工作流,或立即通过 Google AI Studio 和 Android Studio 在 Gemini API 中开始构建,或在 Stitch 中生成 UI。请参阅我们的开发者文档开始使用。
- 企业:在 Gemini Enterprise 中访问 3.8 Flash。
- 消费者:3.8 Flash 面向 Google AI Pro 和 Ultra 订阅用户提供,可通过 Gemini 应用、Google 搜索中的 AI 模式以及 Google 表格中的 Gemini 使用。
- Cyber:通过我们新的 Fairwind 计划,我们为受信任的政府机构,以及关键基础设施运营商和软件维护者提供优先访问 Gemini 3.8 Flash Cyber 的权限。申请访问。
来源:Google Gemini Blog · blog.google