跳到正文
Anthropic News·· 2025-03-19精选AI 评分62

Anthropic Frontier Red Team 发布前沿 AI 国家安全风险进展报告

Progress from our Frontier Red Team

AI 导读

Anthropic 的 Frontier Red Team 基于过去一年四个模型版本的红队工作,评估前沿 AI 模型在国家安全相关双重用途能力上的进展。

推荐理由

Anthropic 用四个模型版本一年的红队数据,给出网络与生物两类双重用途能力的进展与当前风险边界。

正文 · AI 翻译

在这篇文章中,我们将分享我们从前沿AI模型潜在国家安全风险轨迹中了解到的情况,以及我们对评估这些风险所面临挑战和最佳实践的一些思考。本文中的信息基于我们在过去一年中跨越四次模型发布所开展的工作。我们的评估是,AI模型在关键两用能力方面正显示出快速进步的‘早期预警’迹象:模型正在接近,并在某些情况下超越网络安全方面的本科水平技能和生物学某些领域的专家级知识。然而,当今的模型尚未达到我们认为它们会对国家安全产生显著升高风险的阈值。

AI在各领域快速进步

虽然AI能力在许多领域快速提升,但重要的是要注意,现实世界风险取决于AI本身之外的多种因素。即使AI在需要智能和知识的任务上不断进步,物理限制、专用设备、人类专业知识和实际实施挑战仍然是重大障碍。在此背景下,以下是我们对AI在关键领域能力进展的了解。

网络安全

在网络领域,2024年是一个‘从零到一’的时刻。在Capture The Flag(CTF)演练——涉及在受控环境中寻找和利用软件漏洞的网络安全挑战——中,Claude在短短一年内从高中生水平提升到本科生水平。

Figure 1: In less than a year, Claude went from solving less than a quarter to nearly all Intercode CTF challenges, publicly available CTFs that were designed for high school competitions.
图1:在不到一年的时间里,Claude从解决不到四分之一的Intercode CTF挑战,发展到几乎解决全部挑战;这些是公开可用、为高中竞赛设计的CTF。

我们确信这反映了能力的真实提升,因为我们额外定制开发了挑战,以确保它们不会无意中出现在模型的训练数据中。

这种网络能力的提升在我们最新的模型Claude 3.7 Sonnet上仍在继续。在Cybench——一个使用CTF挑战评估LLM的公开基准——上,Claude 3.7 Sonnet在五次尝试内解决了约三分之一的挑战,而去年此时我们的前沿模型约为百分之五(见图2)。

Figure 2: Claude 3.7 Sonnet shows clear improvement on the Cybench CTF benchmark compared to the previous two generations of models, even without using extended thinking.
图2:与前两代模型相比,Claude 3.7 Sonnet在Cybench CTF基准上显示出明显提升,即使不使用扩展思考。

这些改进正在不同类别的网络安全任务中发生。图3显示了不同模型代际在各类CTF上的提升,这些CTF要求在远程服务器上的不安全软件(‘pwn’)、Web应用程序(‘web’)以及密码原语和协议(‘crypto’)中发现并利用漏洞。然而,Claude的技能仍落后于人类专家。例如,它仍然难以对二进制可执行文件进行逆向工程以寻找隐藏漏洞,也难以在网络环境中进行侦察和利用——至少在没有一点帮助的情况下是如此。

Figure 3: Claude is improving in CTFs across multiple categories of challenges (Claude 3.7 Sonnet’s performance is reported without extended thinking).
图3:Claude在多个类别的CTF挑战中都在进步(Claude 3.7 Sonnet的性能报告未使用扩展思考)。

我们与卡内基梅隆大学的外部专家合作,在逼真的大型(约50台主机)网络靶场上进行了实验,测试模型发现和利用不安全软件中的漏洞,以及在网络中感染和横向移动的能力。与传统的CTF演练相比,这些挑战通过要求模型还能执行侦察并策划多阶段网络攻击,模拟了实际网络行动的复杂性。目前,这些模型还无法在这种网络环境中自主取得成功。但当配备了一套由网络安全研究人员构建的软件工具后,Claude(以及其他LLM)能够使用简单的指令,成功复现一次类似于已知的大规模盗窃征信机构个人身份信息事件的攻击。

Figure 4: One of our researchers worked with academic partners to develop Incalmo, a set of tools that enable present-day LLMs to be successful cyber attackers in realistic network settings. Figure courtesy of Singer et al. (2025).
图4:我们的一位研究人员与学术合作伙伴共同开发了Incalmo,这是一套能让当今LLM在逼真网络环境中成为成功网络攻击者的工具。图由Singer et al. (2025)提供。

这一评估基础设施使我们能够在模型的自主能力提升时发出预警,同时也有可能帮助提升AI在网络防御中的效用,其他实验室也在沿着这条道路推进,并取得了令人鼓舞的成果。

生物安全

我们之前的文章重点讨论了我们的生物安全评估,我们也在继续这项工作。我们看到模型对生物学的理解取得了迅速进展。在一年之内,Claude在一项旨在测试实验室环境中常见故障排除场景的评估中,从表现不及世界级病毒学专家,提升到轻松超过这一基线(见图5)。

Figure 5: Claude’s performance has improved on VCT, an evaluation of model capabilities in troubleshooting virology tasks designed by SecureBio. Claude 3.7 Sonnet used its extended thinking capability.
图5:Claude在VCT上的表现有所提升,VCT是由SecureBio设计的、评估模型在病毒学任务故障排除方面能力的评估。Claude 3.7 Sonnet使用了其扩展思考能力。

不过,Claude在生物学方面的能力仍然不均衡。例如,对评估模型与湿实验室研究相关技能的问题进行的内部测试显示,我们的模型在理解生物学实验方案以及操作DNA和蛋白质序列方面正接近人类专家基线。我们的最新模型在克隆工作流程上超过了人类专家基线。这些模型在解读科学图表方面仍不如人类专家。

Figure 6: Claude 3.7 Sonnet improved on LabBench tasks compared to Claude 3.5 (New), approaching and in some cases exceeding the human baseline. Claude 3.7 Sonnet used its extended thinking capability.
图6:与Claude 3.5 (New)相比,Claude 3.7 Sonnet在LabBench任务上有所提升,接近并在某些情况下超过了人类基线。Claude 3.7 Sonnet使用了其扩展思考能力。

为了评估这种不断进步——但不均衡——的生物学专业能力如何转化为生物安全风险,我们对武器化相关任务进行了小规模、受控的研究,并与世界级生物防御专家合作。在一项实验研究中,我们发现,与其他无法使用模型的参与者相比,我们的最新模型为新手提供了一定程度的提升。然而,即使是有模型访问权限的参与者所给出的得分最高的计划,仍然包含会导致在现实世界中失败的关键错误。

同样,专家红队评估的结论也各不相同。一些专家发现模型对武器化某些方面的知识有所提升,而另一些专家则指出,模型规划中的关键失败次数过多,无法最终成功实现端到端的攻击执行。总体而言,这一分析表明,我们的模型无法可靠地引导新手恶意行为者完成生物武器获取的关键实践步骤。不过,鉴于其快速进步,我们继续大力投入监测生物安全风险并开发缓解措施,例如我们近期在宪法分类器方面的工作,以便在模型达到更令人担忧的性能水平时做好准备。

Figure 7: In small experiments with Anthropic employees and external participants from Sepal AI, groups with either of the two most recent Claude models seemed to outperform those with only the internet on text-based evaluations of a bioweapon acquisition and planning scenario. (Participants from Sepal had access to two preview versions of Claude 3.7 Sonnet, one of which, ‘H-only V2’ was designed to be helpful-only and less likely to refuse harmful requests. The Anthropic employees used either another preview version of Claude 3.7 Sonnet or the latest production version of Claude 3.5 Sonnet.)
图 7:在与 Anthropic 员工及来自 Sepal AI 的外部参与者进行的小型实验中,使用两款最新 Claude 模型之一的组别,在生物武器获取与规划场景的文本评估中,似乎优于仅能使用互联网的组别。(来自 Sepal 的参与者可以使用两个 Claude 3.7 Sonnet 预览版本,其中一个名为“H-only V2”的版本被设计为仅提供帮助,且更不容易拒绝有害请求。Anthropic 员工则使用了另一个 Claude 3.7 Sonnet 预览版本,或 Claude 3.5 Sonnet 的最新生产版本。)

为战略预警而合作的好处:快速、负责任地开发 AI

这项工作的一项重要好处是,它帮助我们更快而非更慢地前进。通过提前制定评估计划,并承诺达到会促使安全级别提升的能力阈值,Anthropic 前沿红队的工作增强了我们快速推进 AI 前沿的能力,并让我们确信自己是在负责任地这样做。

这项工作——尤其是在与政府合作时——带来了安全方面的具体改进,并为政府官员提供了有用信息。通过自愿、互利的协议,我们的模型已接受美国 AI 安全研究所和英国 AI 安全研究所(AISI)的部署前测试。AISI 最近的测试帮助我们理解了 Claude 3.7 Sonnet 与国家安全相关的能力,我们利用这一分析为该模型的 AI 安全级别(ASL)判定提供依据。

Anthropic 还率先与国家核安全管理局(NNSA)建立了首个此类合作伙伴关系——NNSA 是美国能源部(DOE)的一部分——他们正在机密环境中评估 Claude 与核及放射性风险相关的知识。由于核武器相关信息的特殊敏感性,该项目涉及由政府直接进行红队测试。作为该合作的一部分,Anthropic 分享了我们在其他 CBRN 领域进行风险识别与缓解方法中的见解,NNSA 将其调整应用于核领域。在高度监管的核领域,公共与私营实体之间这一安排的成功表明,类似的合作在其他敏感领域也是可能的。

展望未来

我们围绕前沿威胁开展的工作,凸显了内部保障措施的重要性,例如我们的负责任扩展政策、包括 AI 安全/安保研究所在内的独立评估机构,以及具有适当针对性的外部监督。展望未来,我们的目标是扩大规模,通过自动化评估、引导、分析和报告,实现更频繁的测试。诚然,AI 能力正在快速进步,但我们运行这些评估并更早、更可靠地检测潜在风险的能力也在提升。

我们正在紧急推进。随着模型在运用扩展思考方面的能力不断提升,像Incalmo这样的网络工具包所支持的一些抽象和规划可能会过时,模型将开箱即用地更擅长网络安全任务。部分基于此处讨论的生物学研究,我们相信我们的模型正越来越接近跨越需要 AI 安全等级 3 保障的能力门槛,这促使我们追加投资,以确保这些安全措施能及时到位。我们相信,前沿 AI 实验室与政府之间更深入的合作,对于改善我们在所有这些重点领域的评估和风险缓解至关重要。

如果你有兴趣直接为我们的工作做出贡献,我们正在招聘。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名前沿部署工程师,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com