Anthropic 与 Mozilla 合作:Claude Opus 4.6 两周发现 22 个 Firefox 漏洞
Partnering with Mozilla to improve Firefox’s security
Anthropic 与 Mozilla 合作,用 Claude Opus 4.6 在两周内发现 22 个 Firefox 漏洞,其中 14 个被 Mozilla 定为高危,接近 2025 年全年修复高危 Firefox 漏洞的五分之一,多数已在 Firefox 148 修复。
Anthropic 与 Mozilla 的这次合作给出了 AI 找漏洞与写利用代码之间的能力差距,可作为判断安全攻防节奏的参考。
AI 模型现在能够独立识别复杂软件中的高危漏洞。正如我们最近记录的那样,Claude 在测试充分的 开源软件中发现了 500 多个 零日漏洞(软件维护者未知的安全缺陷)。
在这篇文章中,我们分享了与 Mozilla 研究人员合作的细节,其中 Claude Opus 4.6 在两周内发现了 22 个漏洞。其中,Mozilla 将 14 个定为高危漏洞——几乎占 2025 年修复的所有高危 Firefox 漏洞的五分之一。换句话说:AI 使得以高度加速的速度检测严重安全漏洞成为可能。

作为此次合作的一部分,Mozilla 处理了我们提交的大量报告,帮助我们理解哪些类型的发现值得提交错误报告,并在 Firefox 148.0 中向数亿用户推送了修复。 他们的合作以及我们学到的技术经验,为 AI 赋能的安全研究人员和维护者如何携手应对这一时刻提供了一个范例。
从模型评估到安全合作
2025 年底,我们注意到 Opus 4.5 几乎解决了 CyberGym 中的所有任务,这是一个测试 LLM 能否复现已知安全漏洞的基准。我们想要构建一个更难、更真实的评估,其中包含更高比例的技术复杂漏洞,比如现代网络浏览器中存在的那些。因此,我们构建了一个包含先前 Firefox 常见漏洞和暴露(CVE)的数据集,以测试 Claude 能否复现这些漏洞。
我们选择 Firefox 是因为它既是一个复杂的代码库,也是世界上最经过充分测试和最安全的开源项目之一。这使得它比我们之前用来测试模型的 开源软件更能考验 AI 发现新型安全漏洞的能力。数亿用户每天依赖它,而浏览器漏洞尤其危险,因为用户经常遇到不受信任的内容,并依赖浏览器来保护他们的安全。
我们的第一步是使用 Claude 在旧版 Firefox 代码库中查找先前已识别的 CVE。我们惊讶地发现,Opus 4.6 能够复现其中很高比例的历史 CVE,因为每一个都需要大量人力才能发现。但这一结果在多大程度上可信仍不清楚,因为其中至少一些历史 CVE 可能已经存在于 Claude 的训练数据中。
因此,我们让 Claude 在当前版本的 Firefox 中寻找新型漏洞——这些漏洞按定义不可能之前被报告过。我们首先关注 Firefox 的 JavaScript 引擎,但随后扩展到浏览器的其他领域。JavaScript 引擎是方便的第一步:它是 Firefox 代码库中一个可以独立分析的独立部分,而且鉴于其广泛的攻击面(当用户浏览网页时,它会处理不受信任的外部代码),确保其安全尤为重要。
仅仅经过二十分钟的探索,Claude Opus 4.6 就报告称它已在 JavaScript 引擎中识别出一个释放后使用漏洞(一种内存漏洞,可能允许攻击者用任意恶意内容覆盖数据)。我们的一名研究员在装有最新版 Firefox 的独立虚拟机上验证了这个漏洞,然后将其转发给另外两名 Anthropic 研究员,他们也验证了该漏洞。随后,我们在 Mozilla 的问题跟踪系统 Bugzilla 中提交了一份错误报告,其中包含对该漏洞的描述以及一个建议的补丁(由 Claude 编写,并由报告团队验证),以帮助排查根本原因。
在我们验证并向 Firefox 提交这第一个漏洞的时间里,Claude 已经发现了另外五十个独特的崩溃输入。在我们对这些崩溃进行分类处理时,一位来自 Mozilla 的研究员联系了我们。在就各自的工作流程进行了技术讨论并分享了几个我们手动验证过的漏洞之后,他们鼓励我们批量提交所有发现,而不必逐一验证,即使我们并不确定所有导致崩溃的测试用例都具有安全影响。到这项工作结束时,我们扫描了近 6,000 个 C++ 文件,并总共提交了 112 份独立报告,其中包括上文提到的高危和中危漏洞。大多数问题已在 Firefox 148 中修复,其余问题将在后续版本中修复。
在对第三方软件进行这类漏洞挖掘时,我们始终意识到,我们可能遗漏了代码库中某些关键信息,从而使这一发现成为误报。我们尽力自行验证这些漏洞,但总会有出错的可能。我们非常感谢 Mozilla 对其分类处理流程如此透明,并帮助我们调整方法,以确保我们只提交他们关心的测试用例(即使并非所有用例最终都与安全相关)。此后,Mozilla 的研究人员已开始在内部尝试将 Claude 用于安全目的。
从识别漏洞到编写初级漏洞利用程序
为了衡量 Claude 网络安全能力的上限,我们还开发了一项新的评估,以确定 Claude 是否能够利用我们发现的任何漏洞。换句话说,我们想了解 Claude 是否也能开发出黑客用来利用这些漏洞执行恶意代码的那类工具。
为此,我们让 Claude 访问我们提交给 Mozilla 的漏洞,并要求 Claude 针对每一个漏洞创建漏洞利用程序。为了证明它成功利用了某个漏洞,我们要求 Claude 演示一次真实攻击。具体来说,我们要求它像攻击者那样,在目标系统中读取和写入一个本地文件。
我们用不同的起点运行了这项测试数百次,花费了约 4,000 美元的 API 额度。尽管如此,Opus 4.6 仅在两种情况下真正将漏洞转化为漏洞利用程序。这告诉我们两件事。第一,Claude 在发现这些漏洞方面远比利用它们更擅长。第二,识别漏洞的成本比为其创建漏洞利用程序低一个数量级。然而,Claude 能够成功自动开发出一个粗糙的浏览器漏洞利用程序——即使只是在少数情况下——这一事实仍令人担忧。
“粗略”在这里是一个重要的限定条件。Claude 编写的漏洞利用仅在我们的测试环境中有效,该环境有意移除了现代浏览器中的一些安全功能。其中最重要的是 沙箱,其目的是减少此类漏洞的影响。因此,Firefox 的“纵深防御”本可以有效缓解这些特定的漏洞利用。但逃逸沙箱的漏洞并非闻所未闻,而 Claude 的攻击是端到端漏洞利用的必要组成部分之一。您可以在我们的 Frontier Red Team 博客上阅读更多关于 Claude 如何开发其中一个 Firefox 漏洞利用的内容。
AI 赋能网络安全的下一个方向
这些 AI 赋能漏洞利用开发的早期迹象凸显了加速防御者查找和修复流程的重要性。为此,我们希望分享在此分析过程中发现的一些技术和流程最佳实践。
首先,在研究“修补代理”时——即使用 LLM 开发和验证错误修复——我们开发了一些方法,希望能帮助维护者使用像 Claude 这样的 LLM 更快地分类和处理安全报告。1
根据我们的经验,当 Claude 能够用另一个工具检查自己的工作时,它的表现最佳。我们将这类工具称为“任务验证器”:一种可信的方法,用于确认 AI 代理的输出是否真正实现了其目标。任务验证器在代理探索代码库时提供实时反馈,使其能够深入迭代直到成功。
任务验证器帮助我们发现了上述 Firefox 漏洞,2 在另一项研究中,我们发现它们对于修复错误也很有用。一个好的修补代理至少需要验证两件事:漏洞是否确实被移除,以及程序的预期功能是否得以保留。在我们的工作中,我们构建了工具,自动测试在提出修复后原始错误是否仍可被触发,并单独运行测试套件以捕获回归(意外破坏其他功能的更改)。我们预计维护者最了解如何为自己的代码库构建这些验证器;关键点在于,为代理提供一种可靠的方式来检查这两个属性,可以显著提高其输出的质量。
我们无法保证所有通过这些测试的代理生成的补丁都足够好,可以立即合并。但任务验证器让我们更有信心,所生成的补丁将修复特定漏洞,同时保留程序功能——从而达到一个合理补丁的最低要求。当然,在审查 AI 编写的补丁时,我们建议维护者采用与审查任何外部作者创建的补丁相同的严格标准。
从提交错误和补丁的流程来看:我们知道维护者已经不堪重负。因此,我们的方法是向维护者提供他们所需的信息,以信任和验证报告。Firefox 团队强调了我们的提交中对于信任我们结果至关重要的三个组成部分:
- 附带最小测试用例
- 详细的概念验证
- 候选补丁
我们强烈鼓励使用 LLM 驱动的漏洞研究工具的研究人员,在基于此类工具输出提交报告时,附上类似的验证与可复现性证据。
我们还发布了我们的协调漏洞披露运营原则,其中描述了我们在与维护者合作时将采用的流程。目前我们的流程遵循行业标准规范,但随着模型能力的提升,我们可能需要调整流程以跟上能力的步伐。
当下的紧迫性
前沿语言模型如今已是世界级的漏洞研究人员。除了我们在 Firefox 中发现的 22 个 CVE 之外,我们还使用 Claude Opus 4.6 发现了 Linux 内核等其他重要软件项目中的漏洞。在接下来的数周和数月内,我们将继续报告我们如何使用模型,以及与开源社区合作以提升安全性。
Opus 4.6 目前在识别和修复漏洞方面远胜于利用漏洞。这赋予了防御方优势。随着近期Claude Code Security以有限研究预览形式发布,我们正将漏洞发现(及修补)能力直接带给客户和开源维护者。
但从进展速度来看,前沿模型在漏洞发现与利用能力之间的差距不太可能持续太久。如果未来的语言模型突破了这一利用障碍,我们将需要考虑额外的保障措施或其他行动,以防止我们的模型被恶意行为者滥用。
我们敦促开发者利用这一窗口期,加倍努力使其软件更加安全。就我们而言,我们计划大幅扩展我们的网络安全工作,包括与开发者合作搜寻漏洞(遵循上述 CVD 流程)、开发工具帮助维护者分类处理漏洞报告,以及直接提出补丁。
如果你有兴趣支持我们的安全工作——编写新的脚手架以识别开源软件中的漏洞;分类、修补和报告漏洞;以及为 AI 时代开发稳健的 CVD 流程——在此申请加入 Anthropic 工作。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名前沿部署工程师,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 应用以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。
Claude 发现具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:Claude 仅在我们的科学家提供高层级指导下,发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com