跳到正文
Anthropic News·· 2025-05-22精选AI 评分66

Anthropic 随 Claude Opus 4 发布启用 ASL-3 防护标准

Activating AI Safety Level 3 protections

AI 导读

Anthropic 宣布在发布 Claude Opus 4 的同时启用负责任扩展政策中的 AI 安全等级 3(ASL-3)部署与安全标准。ASL-3 部署措施聚焦限制模型协助 CBRN 武器相关任务,通过 Constitutional Classifiers 实时拦截有害输入输出;安全措施包含 100 多项控制,如模型权重访问双人授权和出口带宽限制。

推荐理由

Anthropic 首次在发布新模型时启用 ASL-3 防护,读者可了解前沿模型安全分级如何落地及对部署的影响。

正文 · AI 翻译

我们已结合 Claude Opus 4 的发布,激活了 Anthropic 负责任扩展政策(RSP)中描述的 AI 安全等级 3(ASL-3)部署与安全标准。ASL-3 安全标准涉及增强的内部安全措施,使模型权重更难被窃取;而相应的部署标准则涵盖一组针对性极强的部署措施,旨在限制 Claude 被专门用于开发或获取化学、生物、放射性和核(CBRN)武器的风险。这些措施不应导致 Claude 拒绝查询,除非是在非常狭窄的主题范围内。

我们以预防性和临时性措施的方式,在 ASL-3 标准下部署 Claude Opus 4。需要明确的是,我们尚未确定 Claude Opus 4 是否已明确通过需要 ASL-3 保护的能力阈值。相反,由于 CBRN 相关知识和能力的持续提升,我们认定对于 Claude Opus 4 而言,无法像此前每一个模型那样明确排除 ASL-3 风险,需要更详细的研究才能最终评估该模型的风险水平。(我们已排除 Claude Opus 4 需要 ASL-4 标准,这是 RSP 的要求;同样,我们也已排除 Claude Sonnet 4 需要 ASL-3 标准。)

对 AI 模型进行危险能力评估本身就充满挑战,随着模型接近我们的关注阈值,确定其状态所需的时间也更长。主动启用更高标准的安全与保障,可以简化模型发布流程,同时让我们通过迭代改进防御措施并减少对用户的影响,从经验中学习。

本文及随附的报告讨论了这些新措施及其背后的理由。

背景

能力日益增强的 AI 模型需要越来越强的部署与安全保护。这一原则是 Anthropic 负责任扩展政策(RSP)的核心。1

  • 部署措施针对特定类别的滥用行为;特别是,我们的 RSP 侧重于降低模型被滥用于最危险武器类别——CBRN——攻击的风险。
  • 安全控制旨在防止模型权重被盗——权重是 AI 智能与能力的本质所在。

Anthropic 的 RSP 包含模型的能力阈值:如果模型达到这些阈值(或者我们尚未确定它们已充分低于阈值),我们就必须实施更高等级的AI 安全等级标准。迄今为止,我们所有模型都是在 AI 安全等级 2(ASL-2)标准的基线保护下部署的。ASL-2 部署措施包括训练模型拒绝危险的 CBRN 相关请求。ASL-2 安全措施包括针对机会性窃取权重企图的防御。ASL-3 标准要求对部署和安全威胁提供更高水平的防御,足以应对复杂的非国家行为体。

理由

我们尚未确定 Claude Opus 4 的能力是否真的需要 ASL-3 标准的保护。那么,我们为什么现在就实施了这些保护措施?我们在发布上一个模型 Claude Sonnet 3.7 时,就预计到可能会这样做。当时,我们确定该模型不需要 ASL-3 标准的保护。但我们承认,鉴于进展速度,近期未来的模型很有可能需要这些增强措施。2 事实上,在发布 Claude Opus 4 之前,我们就主动决定在 ASL-3 标准下启动它。这种方法使我们能够在需要这些保护之前,就专注于开发、测试和完善它们。

这种方法也与 RSP 一致,该框架允许我们谨慎行事,在比我们确信需要的更高标准下部署模型。在这种情况下,这意味着主动执行 ASL-3 安全和部署标准(并排除了需要更高级保护的可能性)。我们将继续评估 Claude Opus 4 的 CBRN 能力。如果我们得出结论,Claude Opus 4 尚未超越相关的 Capability Threshold,那么我们可能会移除或调整 ASL-3 保护措施。

部署措施

新的 ASL-3 部署措施 narrowly 专注于防止模型协助与关注的 CBRN 武器相关任务,3 特别是防止以对没有大型语言模型时已经可能实现的功能具有附加价值的方式,协助扩展的、端到端 CBRN 工作流程。这包括限制通用越狱——即允许攻击者绕过我们的护栏并持续提取长链工作流程增强型 CBRN 相关信息的系统性攻击。与我们基本的威胁模型一致,ASL-3 部署措施并不旨在解决与 CBRN 无关的问题,防御非通用越狱,或阻止提取常见的单一信息,例如“沙林的化学式是什么?”的答案(尽管它们可能附带阻止这一点)。鉴于不断变化的威胁形势,我们预计会发现新的越狱方法,并且我们需要随着时间的推移快速迭代和改进我们的系统。

我们开发了一种三部分的方法:使系统更难被越狱,在越狱发生时检测到它们,并迭代改进我们的防御。

  • 使系统更难被越狱。 我们实施了 Constitutional Classifiers——这是一个系统,其中实时分类器守卫,基于代表有害和无害 CBRN 相关提示和完成的合成数据进行训练,监控模型输入和输出,并介入以阻止一小类有害的 CBRN 信息。我们的生产前测试表明,我们可以大幅降低越狱成功率,同时仅给正常操作增加适度的计算开销(超出模型推理所需的额外处理成本)。
  • 在越狱发生时检测到它们。 我们还建立了一个更广泛的监控系统,包括一个漏洞赏金计划,专注于对我们的 Constitutional Classifiers、离线分类系统和威胁情报合作伙伴关系进行压力测试,以快速识别和响应可能导致 CBRN 滥用的潜在通用越狱。
  • 迭代改进我们的防御。我们相信可以通过多种方法快速修复越狱,包括生成合成越狱,使其与我们发现的越狱相似,并利用这些数据训练新的分类器。

所有这些措施都需要持续改进,既要提高其有效性,也因为它们可能仍会偶尔影响合法查询(即可能产生误报)。4 尽管如此,它们代表着在防御 AI 能力被灾难性滥用方面取得了实质性进展。5

安全

我们的针对性安全控制侧重于保护模型权重——这些关键数值参数一旦被泄露,可能使用户在缺乏部署保护的情况下访问我们的模型。我们的方法涉及 100 多种不同的安全控制,将预防性控制与检测机制相结合,主要针对来自复杂非国家行为者的威胁6,覆盖从初始入口点、横向移动到最终提取的全过程。其中许多控制措施,例如模型权重访问的双人授权、增强的变更管理协议,以及通过二进制允许列表实现的端点软件控制,都是遵循其他具有安全意识组织所建立的最佳实践的范例。

然而,有一项控制措施对于保护模型权重这一目标尤为独特:我们已实施了初步的出站带宽控制。出站带宽控制限制数据从 AI 模型权重所在的安全计算环境中流出。模型的权重总和体量巨大。通过限制出站网络流量的速率,这些控制措施可以利用模型权重的体积来创造安全优势。当通过异常带宽使用检测到模型权重的潜在外泄时,安全系统可以阻止可疑流量。随着时间的推移,我们期望达到这样的程度:速率限制足够低,以至于在被检测到之前外泄模型权重变得非常困难——即使攻击者在其他方面已严重入侵我们的系统。实施出站带宽控制一直是理解和治理数据流出我们内部系统方式的推动力,这为我们的检测和响应能力带来了益处。

与部署保护措施一样,我们正在继续努力改进安全控制的覆盖范围和成熟度,始终考虑不断演变的威胁态势。特别是,我们将继续改进出站控制、针对更复杂内部威胁的缓解措施,以及我们的整体安全态势。

结论

正如我们上文所强调的,对前沿 AI 模型应用哪些部署和安全措施这一问题远未解决。我们将继续内省、迭代和改进。在 ASL-3 标准下运营的实践经验将帮助我们揭示新的、或许是意想不到的问题和机遇。

我们将持续与 AI 行业的其他参与者、Claude 的用户以及政府与公民社会的合作伙伴合作,改进我们守护这些模型的方法。我们希望我们的详细报告能对 AI 行业中尝试实施类似保护措施的其他机构有所帮助,并帮助我们所有人准备好迎接更强大 AI 所带来的希望与挑战。

阅读完整报告。

相关内容

Anthropic 投资 1 亿美元培训 1 万名工程师,以弥合企业 AI 人才缺口

Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 1 万名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩大 Claude 应用规模,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:Claude 仅在我们科学家提供高层级方向的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com