Anthropic 发布前沿威胁红队研究:生物风险实测与缓解方法
Frontier threats red teaming for AI safety
Anthropic 发布前沿威胁红队(frontier threats red teaming)研究,介绍其与生物安全专家合作评估模型输出有害生物信息能力的做法与发现。
Anthropic 公开了前沿威胁红队的方法与生物风险实测结论,并给出训练与分类器层面的缓解方向。

“红队测试”,即对抗性测试,是一种公认的衡量和提高系统安全性的技术。虽然Anthropic 此前的研究报告了使用众包工作者进行红队测试的方法和结果,但一段时间以来,AI 研究人员已经注意到,AI 模型最终可能在涉及国家安全的领域获得能力。例如,研究人员已呼吁衡量并监测这些风险,并撰写了论文提供风险证据。Anthropic CEO Dario Amodei 也在最近的参议院证词中强调了这一话题。在此背景下,我们很高兴倡导并加入了 7 月 21 日在白宫宣布的承诺,其中包括对“[我们的] AI 系统进行内部和外部安全测试”,以防范“AI 风险的一些最重要来源,例如生物安全和网络安全”。然而,在这些专业领域进行红队测试需要投入大量时间和专业知识。
在这篇文章中,我们分享了我们在“前沿威胁红队测试”方面的方法、我们作为测试项目开展的生物风险项目的高层发现、经验教训,以及我们在这方面的未来计划。
我们这项工作的目标是评估风险基线,并创建一种可重复的方式,在多个主题领域开展前沿威胁红队测试。就生物学而言,虽然我们发现的细节高度敏感,但我们认为分享这项工作的要点很重要。总之,与专家合作,我们发现如果不加缓解,模型可能很快就会对国家安全构成风险。然而,我们也发现有一些缓解措施可以大幅降低这些风险。
我们现在正在扩大这项工作,以便可靠地识别风险并构建缓解措施。我们相信,改进前沿威胁红队测试将带来直接益处,并有助于长期 AI 安全。我们一直在与政府、实验室和其他利益相关者分享我们的发现,我们希望看到更多独立团体开展这项工作。
开展前沿威胁红队测试
前沿威胁红队测试需要投入大量精力来揭示模型的底层能力。对我们来说,最重要的起点是与拥有数十年经验的领域专家合作。我们共同从定义威胁模型开始:什么样的信息是危险的,这些信息如何组合造成危害,以及需要何种程度的准确性和频率才会使其危险。例如,要造成危害,通常需要将许多准确信息串联起来,而不仅仅是生成一个听起来有害的输出。
按照明确的研究计划,主题专家和 LLM 专家需要共同投入大量时间(即 100 小时以上),与模型密切合作,以探查并理解其在目标领域的真实能力。例如,领域专家可能需要学习与模型交互或“越狱”模型的最佳方式。
一个重要的目标是基于专家知识构建新的自动化评估,以及运行这些评估的工具,使其可重复且可扩展。然而,一个挑战是这类信息可能较为敏感。因此,这种红队测试需要与可信第三方合作,并具备强大的信息安全保护措施。
红队测试生物学方面的发现
在过去六个月里,我们与顶尖生物安全专家一起花费了150多个小时,对我们的模型输出有害生物信息(例如设计和获取生物武器)的能力进行红队测试和评估。这些专家学会了与我们的模型对话、越狱并评估它。我们开发了对模型能力的定量评估。专家们使用了一个定制的、安全的模型接口,该接口没有我们公开部署中启用的信任与安全监控和执行工具。
我们发现了一些关键问题。第一,当前的前沿模型有时能够产生专家级别的复杂、准确、有用且详细的知识。在我们研究的大多数领域中,这种情况并不经常发生。在其他领域中,则会发生。然而,我们发现有迹象表明,模型随着规模增大而变得更有能力。我们还认为,模型获得工具访问权限可能会提升其在生物学方面的能力。综合来看,我们认为,与仅拥有互联网访问权限相比,未经缓解的LLM可能会加速恶意行为者滥用生物学的努力,并使他们能够完成没有LLM就无法完成的任务。这两种影响今天可能还很小,但增长相对较快。如果不加以缓解,我们担心这类风险是近期的,意味着它们可能在未来两到三年内成为现实,而不是五年或更久。
然而,研究这些风险的过程也使得发现和实施缓解措施成为可能。例如,我们发现,训练过程中的直接改变能够通过让模型更好地区分生物学的有害和无害用途,从而显著减少有害输出(例如,参见我们关于Constitutional AI的工作)。我们还发现,基于分类器的过滤器可以让恶意行为者更难获得造成伤害所需的那种多重、串联且专家级别的信息。这些现已部署在我们面向公众的前沿模型中,并且我们已经在模型开发和部署路径的每一步确定了一系列缓解措施,我们将继续对其进行实验。
未来研究
在项目结束时,我们现在想要运行的实验和评估比开始时更多。例如,我们认为一个非常重要且需要反复运行的实验,是衡量LLM相较于例如搜索引擎,在产生伤害方面可能提供的加速程度。而且我们不应只对当今的前沿模型这样做,还应对未来的模型这样做——例如下一代模型、使用工具的模型和多模态模型。
鉴于我们发现当今的前沿模型提供了对近期风险的警示,前沿模型开发者应共同且紧迫地开展更多分析,并开发更多、更强的缓解措施,与负责任的行业开发者分享这些信息,以便他们能为自己的模型添加保障措施,并与选定的政府机构分享。
我们还应为可能发布的、未经前沿威胁红队测试的模型做好准备。我们怀疑,如果发布了能力足够强的基座模型,在没有新的缓解方法的情况下,恶意行为者可能利用从公开可用模型权重微调而来的更小、经过微调或针对特定任务的模型,提取出有害的生物能力。
我们正在扩大规模并支持这项工作
这项实证工作证实,在国家安全领域开展前沿威胁红队测试既重要又及时。当前模型仅显示出此类风险的最早期迹象,这为我们提供了窗口期,可以在这些风险变得严峻之前评估并缓解初现的风险。在使用新工具的下一代模型出现之前加大努力非常重要。幸运的是,国家安全界已经拥有丰富的专业知识可供借鉴,有助于构建威胁模型、评估和缓解措施。
这也是各国政府天然熟悉的领域。这意味着国家安全是一个政府、实验室和其他利益相关方可以合作的领域。首先,我们正在建立一套披露流程,使实验室和其他利益相关方能够向其他相关方报告这些风险及其缓解措施。最终,我们认为非常重要的是设立新的第三方,在这些利益相关方之间开展国家安全评估。这些第三方将保持公正,并需要具备适当的保障措施来处理敏感信息。
前沿威胁红队测试研究议程可能对预计将在更长时间尺度上出现的其他类型风险也有用,例如欺骗。为了识别和缓解这些风险,开发者必须识别模型不应具备的未来能力,对其进行测量,并构建缓解措施或对齐技术。因此,我们将了解对齐、安全措施以及“警示信号”。
Anthropic 正在组建我们的前沿威胁红队测试研究团队。该团队将针对未来能力进行实验,以理解即将到来的风险,并构建可扩展的评估和缓解措施。你可以在此处了解更多关于这项工作以及如何申请加入团队的信息。我们正在寻找具有强烈使命驱动的技术研究人员,能够快速在我们的基础设施上进行原型开发。
我们也在向政府和实验室通报我们所发现内容的细节。我们愿意向适当的受众分享我们当前和未来的发现,并正在社区利益相关方之间试行一套负责任的披露流程,以报告风险和缓解措施。我们尤其有兴趣支持其他团体——特别是实验室或新的第三方评估组织——开展更多此类工作。如果你是这些利益相关方之一并有兴趣,请联系我们。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名前沿部署工程师,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com