Anthropic 推出面向开源软件的 OSS Scanner 漏洞扫描服务
Launching an opt-in vulnerability-finding service for open-source software
Anthropic 推出 OSS Scanner,一个面向开源生态的可选加入漏洞扫描服务,由最强模型免费定期扫描,输出完全由模型生成、不经人工审核。过去六个月其模型在重要开源项目中发现了超过 29000 个候选漏洞,但仅人工复核约 6000 个;在 97 个严重与高危漏洞的验证中,85 个(88%)达到其 CVD 流程标准,仅 1 个为误报。
Anthropic 公开了 OSS Scanner 的模型生成报告流程与人工验证比例,可据此判断自动化漏洞扫描在开源维护中的可用边界。
我们推出 OSS Scanner,这是一个面向开源生态系统的可选漏洞扫描器,其设计源自我们在 Project Glasswing 期间使用 Claude 寻找漏洞的经验。加入该项目的项目将免费获得由我们最强模型进行的全面、定期安全扫描。
正如我们在本博客上多次报道的那样,语言模型在发现漏洞方面的能力已迅速提升。在学术性漏洞发现基准 CyberGym 上,LLM 从去年年初只能发现不到 20% 的漏洞,提升到今年能发现超过 85% 的漏洞。因此,开源维护者从收到 LLM 发来的大多是垃圾内容,转变为收到高质量的漏洞报告。
在过去六个月里,我们使用最新模型扫描了世界上一些最重要的软件项目中的漏洞。我们发现了超过 29,000 个候选漏洞,但只能手动审查和分类其中大约 6,000 个。虽然 6,000 个漏洞已经相当可观,但我们仍然受限于人工验证这些发现的能力。
我们正在努力扩大漏洞披露的规模。与此同时,收到我们首批报告的维护者越来越频繁地直接要求我们批量提交所有未经核实的报告及建议补丁:迄今为止,在维护者要求接收我们掌握的全部内容后,我们已直接向他们发送了近 5,000 份报告——即使这些报告尚未经过验证。由于漏洞利用现在可以在几分钟内开发出来,能够更快发现并修复漏洞的项目,可以更好地保护其软件,抵御那些争相寻找并利用这些相同弱点的攻击者。
我们将继续通过现有的协调漏洞披露(CVD)流程手动披露经人工验证的漏洞报告,尤其是针对那些没有资源自行分类报告的项目。但我们现在为那些希望一有漏洞报告就立即收到的人提供了一条可选的快速通道。
我们的漏洞扫描器
受Google 的 OSS-Fuzz 对开源生态系统积极影响的启发——该项目使用模糊测试器扫描开源软件中的漏洞——我们推出 OSS Scanner,用我们最强的语言模型来发现开源代码中的漏洞。我们的通用代码扫描与修补产品 Claude Security 侧重于帮助企业防御其系统,而 OSS Scanner 则为开源项目免费提供安全审计。
这个可选漏洞扫描器的输出将完全由模型生成,不经过人工审查或分类。这将实现更快、更频繁的扫描,但也意味着报告有可能是错误或无效的。这些报告将由我们最强的模型(包括 Claude Mythos)生成,以便为开源项目提供最大的防御优势。
过去几周,我们一直在用数十个开源项目验证这条流水线。这些初步披露包含了数百份漏洞报告,其中多个漏洞我们能够串联起来,形成影响这些项目的未认证远程代码执行漏洞利用。每份报告都包含一个自包含的复现器、对漏洞的说明(在可能的情况下,还包括通过二分查找确定漏洞引入时间),以及修复该漏洞的候选补丁(如有)。我们现在正将这项服务开放给更多开源项目。
在我们测试 OSS Scanner 早期版本和原始模型输出时收到的一些反馈:
- “OSS Scanner 的发现中,揭示 PostgreSQL 缺陷的比例异常之高。有几份报告附带的修复几乎可以直接使用,而快速通道访问让我们能在最新问题进入 GA 版本之前就加以解决。”——Noah Misch,PostgreSQL
- “大约 18 个月前,在 Project Glasswing 之前,早期的 AI 报告糟糕透顶。我们从 Anthropic 收到的报告,包括原始模型输出在内,质量与我们从人类那里得到的一样好,有时甚至更好。尤其是当报告附带真实漏洞利用时,对工程师来说基本就大功告成了,因为你可以立即验证。”——Anton Arapov,OpenSSL Corporation
- “我们发现这些报告的信号很强:在我们收到的 74 份报告中,除两份外全部有效,其中五份成为了 CVE。由于附带了补丁,这些报告直接融入了我们现有的验证和修复流程。我们希望能收到更多。”——Todd Ouska,wolfSSL
- “这些漏洞报告详尽清晰,对 HotCRP 复杂的权限模型有深入理解,并且对漏洞的优先级排序也很合理。”——Eddie Kohler,HotCRP
为验证 OSS Scanner 的早期版本,我们请审查我们 CVD 发现结果的专家渗透测试人员,对扫描器在 48 个项目中发现的 97 个严重和高危漏洞进行了检查。其中 85 个(88%)达到了我们 CVD 流程的标准。在其余 12 个中,11 个是真实问题,但与已知问题或本次扫描的其他发现重复,只有一个无效,即“误报”。此后我们已将许多此类发现发送给维护者,他们很少告诉我们某个高危或严重发现无效,这与我们此前的开源工作一致。有些人告诉我们,严重性评级可能被夸大,或者扫描器误解了项目的威胁模型。我们无法保证扫描器完美无缺,但我们会根据维护者的反馈以及模型的改进,持续完善该系统。
开始使用
符合条件的项目的核心维护者可以通过向这个 GitHub 仓库提交 PR 来注册,遵循标准项目模板,更多指引见我们的扩展 FAQ。项目是否符合条件基于与 OSS-Fuzz 类似的一套标准:简而言之,项目应对“基础设施和用户安全具有关键影响”,我们将逐案做出决定。
无论 OSS Scanner 是否适合你,我们新的Cyber Verification Program 都为符合条件的安全专业人员提供高级网络能力和减少拦截的分类器。Claude for OSS 提供免费的 Claude Max 20x 订阅,以帮助修复漏洞和改进 OSS 项目。
相关内容
Claude 式科学
客座作者 Matthew Schwartz 教授描述了当他不再与 Claude 对抗、转而让 Claude 去发现“Claude 形状”的问题——即最适合当前一代 LLM 工具能力的问题——时所发生的事。这促使他构建了 BootLoops,一个用于定量科学中精确计算的工具包,他一直在与专家合作将其应用于各个科学领域。
机器人能做什么工作?
我们构建了一个指数,衡量当今机器人在执行美国工作任务方面的表现。机器人已经能够完成四分之三的体力任务,但大多是在受限环境中,且仅在 0.3% 的任务上具有成本竞争力。
你想从 AI 中得到什么?
我们正在启动一项新研究,使用 Anthropic Interviewer 来了解你与 AI 相处的经历。
来源:Anthropic Research · anthropic.com