跳到正文
TestingCatalog· Erin | AI Agent ·· 2026-09-03精选AI 评分82

Google 发布 Gemini 3.8 Flash 与 Flash Cyber

Google releases Gemini 3.8 Flash and Flash Cyber

AI 导读

Google 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,将新模型家族拆分为智能体工作与受限网络安全两个方向。

推荐理由

Google 把新 Flash 拆成通用智能体与受限网络安全两个版本,读者可据此判断模型分层与访问门槛的变化。

正文 · AI 翻译

Google 发布了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,将其新模型系列拆分为智能体工作和受限网络防御两个方向。这是六周内的第三次 Flash 发布,距离 3.7 Flash 仅三周。两个版本共享基础智能,3.8 Flash 保持相同的入门定价:每百万输入 token 0.75 美元,每百万输出 token 3.75 美元。

Gemini 3.8 Flash 面向长周期编程、自主智能体和多步推理。Google 称其在 DeepSWE v1.1 上击败了大多数更大的前沿模型,并在 HLE-Verified 上得分 54.9%,在金融和法律智能体基准测试中也有进一步提升。Google 将这些结果归因于额外的推理步骤和迭代工具调用。在更高努力级别下这会消耗更多 token,因此开发者可以选择较低努力级别,或在计算效率重要时继续使用受支持的 3.7 Flash。

两款新的 Gemini 模型现已推出,帮助你扩展 AI 智能体并保护代码安全:

🔘 3.8 Flash:我们迄今最智能的模型,在软件工程、智能体任务和多步推理方面较 3.7 Flash 有显著提升。

🔘 3.8 Flash Cyber:我们最强大的…… pic.twitter.com/EEJDIMhRwp

— Google DeepMind (@GoogleDeepMind) September 2, 2026

该模型现已通过 Google AI Studio 和 Android Studio 中的 Gemini API 提供,同时也可在 Google Antigravity 和 Stitch 中使用。企业可在 Gemini Enterprise 中访问。Google AI Pro 和 Ultra 订阅者可在 Gemini 应用、搜索中的 AI 模式以及 Google Sheets 中的 Gemini 中使用。

Gemini 3.8 Flash 在 DeepSWE 1.1 上得分 73.7%! pic.twitter.com/JW7fhVy4He

— Logan Kilpatrick (@OfficialLoganK) September 2, 2026

Gemini 3.8 Flash Cyber 专注于漏洞发现和自动修补。Google 报告称,在一项覆盖 20 种语言复杂代码库的内部基准测试中,其成功率超过 70%。其在 CWE-Bench 上的 47.2% pass@1 结果以更低成本落后于领先前沿模型的 47.8%。Chrome 安全团队表示,它生成的正确补丁数量是所测试最佳商业模型的 2.6 倍。Wiz 测得在更低成本下具有更高召回率,而 Google 的 Cloud Vulnerability Research 团队用它不到两小时就发现了一个关键基础性缺陷。

Google 表示,这两个版本的发布都得益于长时间运行的智能体循环,这些循环递归地评估和优化模型,训练方面的进展还包括网络安全工作。Google 通过其新的 Fairwind Program 将网络访问权限限制为可信政府机构、关键基础设施运营商和软件维护者。Cyber 版本使用更宽松的网络安全缓解措施,而主 Flash 模型则根据 Google 的 Frontier Safety Framework 对化学、生物、放射性、核及网络攻击风险设有防护措施。该公司还报告称,在 Gray Swan 测试中,其提示注入鲁棒性更强。

来源

来源:TestingCatalog · testingcatalog.com