Anthropic 发布 Responsible Scaling Policy 3.0
Anthropic’s Responsible Scaling Policy: Version 3.0
Anthropic 发布第三版 Responsible Scaling Policy(RSP),将公司自身计划采取的缓解措施与面向整个行业的建议分开列出。新版引入 Frontier Safety Roadmap,要求公开安全、对齐、防护和政策方面的具体目标并公开评估进展;同时要求每 3-6 个月发布 Risk Reports,在特定情形下由第三方专家对外部评审。
Anthropic 公开复盘 RSP 两年半的得失,并给出把公司承诺与行业建议拆开的新框架,可供观察前沿实验室安全治理的演进。
我们正在发布第三版《负责任扩展政策》(RSP),这是我们用来缓解 AI 系统灾难性风险的自愿性框架。
Anthropic 实施 RSP 已有两年多,我们对其优势和不足有了大量了解。因此,我们正在更新该政策,以强化迄今为止行之有效的部分,在必要时改进政策,并实施新措施以提高我们决策的透明度和问责制。
你可以在这里阅读新版 RSP 的全文。在这篇文章中,我们将讨论这些变更背后的一些思考。
最初的 RSP 与我们的变革理论
RSP 是我们为解决这样一个问题所做的尝试:如何应对在政策制定时尚不存在、但可能随着技术的指数级进步而迅速出现的 AI 风险。当我们在 2023 年 9 月撰写最初的 RSP 时,大型语言模型本质上还只是聊天界面。如今,它们可以浏览网页、编写和运行代码、使用计算机,并采取自主的多步骤行动。随着这些新能力的出现,新的风险也随之而来。我们预计这一模式将持续下去。
我们将 RSP 聚焦于有条件的,即如果-那么,承诺这一原则。如果某个模型超过了特定的能力水平(例如可能协助制造危险武器的生物科学能力),那么政策规定我们应当引入一套新的、更严格的保障措施(例如针对模型滥用和模型权重被盗)。
每一套保障措施都对应一个“AI 安全等级”(ASL):例如,ASL-2 指一套必需的保障措施,而 ASL-3 则指能力更强的 AI 模型所需的更严格的一套保障措施。
早期的 ASL(ASL-2 和 ASL-3)被定义得相当详细,但对于仍相隔数代的模型,要准确规定正确的保障措施则更为困难。因此,我们有意将较晚的 ASL(ASL-4 及以后)基本留作未定义,并希望在更清楚地了解更高 AI 能力水平将意味着什么之后,再更详细地制定它们。
以下是对我们“变革理论”的粗略描述——即我们希望通过 RSP 影响整个生态系统的机制:
- 一种内部强制机制。在 Anthropic 内部,我们希望 RSP 能促使我们将重要的保障措施视为发布(和训练)新模型的要求。这使这些保障措施的重要性在这个庞大且不断壮大的组织中变得清晰明确,推动我们更快地取得进展。
- 一场逐顶竞赛。我们希望公布我们的 RSP 能鼓励其他 AI 公司推出类似政策。这就是“逐顶竞赛”(与“逐底竞赛”相反)的理念,即不同的行业参与者被激励去改进、而非削弱其模型的保障措施和整体安全态势。随着时间推移,我们希望 RSP 或类似政策能成为自愿性的行业标准,或进而为旨在鼓励 AI 模型开发中的安全性和透明度的 AI 法律提供参考。
- 建立更多关于风险的共识。 我们将能力阈值视为行业中可能重要的时刻。如果我们达到了一个重要的能力阈值(例如 AI 模型能够支持生物武器的端到端生产),我们将自行实施适当的保障措施,并利用我们获得的关于 AI 能力的证据,倡导其他公司和政府也采取行动。换句话说,我们认为能力阈值可能是超越单边行动(Anthropic 要求对其自身模型实施保障措施)并鼓励多边行动(其他 AI 公司和/或政府也要求此类保障措施)的良好节点。
- 展望未来。我们认识到,在一些较晚的能力阈值上,我们所设想的反制措施的强度(例如,实现对国家级行为者滥用 AI 模型的高度鲁棒性)可能很难或不可能由 Anthropic 单方面完成。我们希望当达到这些更高能力时,世界能够清楚地看到危险,并且我们能够与世界各国政府协调,实施单个公司难以独自实现的保障措施。
评估我们的变革理论
两年半后,我们诚实的评估是,这一变革理论的部分内容如我们所希望的那样发展,但其他部分则没有。以下是 RSP 取得成功的领域:
- 我们的 RSP 确实激励我们开发更强的保障措施。例如,为了遵守我们的 ASL-3 部署标准(主要涉及资源和技术专长相对有限的行为者带来的化学和生物武器风险),我们开发了越来越复杂和准确的方法(具体而言,输入和输出分类器)来阻止令人担忧的内容。
- 更广泛地说,ASL-3 标准的整体实施确实被证明是可行的。我们于 2025 年 5 月为相关模型激活了 ASL-3 保障措施,并一直在努力改进它们。
- 我们的 RSP 确实鼓励了其他 AI 公司采用有些类似的标准:在宣布我们的 RSP 后的几个月内,OpenAI 和 Google DeepMind 都采用了大致类似的框架。一些公司还实施了与我们的 ASL-3 防御类似的生物武器相关分类器。这些自愿标准背后的原则,包括 RSP 中的原则,帮助为早期 AI 政策的制定提供了信息。我们看到世界各国政府(例如加利福尼亚州的 SB 53、纽约州的 RAISE Act,以及欧盟 AI 法案的 Codes of Practice)开始要求前沿 AI 开发者创建并发布评估和管理灾难性风险的框架——Anthropic 通过包括其 Frontier Compliance Framework 在内的公开文档来满足这些要求。鼓励行业建立这类严格的透明度框架,正是我们的 RSP 所设定的目标。
然而,我们变革理论的其他部分并未如我们所希望的那样实现:
- The idea of using the RSP thresholds to create more consensus about AI risks did not play out in practice—although there was some of this effect. We found pre-set capability levels to be far more ambiguous than we anticipated: in some cases, model capabilities have clearly approached the RSP thresholds, but we have had substantial uncertainty about whether they have definitively passed those thresholds. The science of model evaluation isn’t well-developed enough to provide dispositive answers. In such cases, we have taken a precautionary approach and implemented the relevant safeguards, but our internal uncertainty translates into a weak external case for taking multilateral action across the AI industry.
- 生物风险就是这种“模糊地带”的一个例子。我们的模型现在展现出足够的生物学知识,能够通过我们快速、简便运行的大多数测试,因此我们无法再有力地论证某个给定模型的风险很低。但仅凭这些测试,也不足以有力地论证风险很高。我们寻求了额外证据,例如支持一项广泛的湿实验室试验,但结果仍然模糊不清,尤其是因为这些研究耗时足够长,等到完成时更强大的模型已经问世。
- 尽管过去三年 AI 能力快速进步,政府在 AI 安全方面的行动却进展缓慢。政策环境已转向优先考虑 AI 竞争力和经济增长,而安全导向的讨论在联邦层面尚未获得实质性推进。我们仍然坚信,政府在 AI 安全方面的有效参与既必要又可实现,我们旨在继续推动一场以证据、国家安全利益、经济竞争力和公众信任为基础的对话。但事实证明这是一个长期项目——并非随着 AI 能力增强或跨越某些门槛就会自然发生。
如上所述,我们能够单方面实施 ASL-3 保障措施,且对公司运营的成本合理。然而,对于更高能力水平和更高 ASL,这可能不再成立。虽然我们的更高 ASL 在很大程度上尚未定义,但我们在先前 RSP 中提出的强有力缓解措施,若无集体行动,可能根本无法实施。为说明这一挑战的规模,一份关于模型权重安全的兰德报告指出,其旨在阻止最具网络能力的机构实施最高优先级行动的“SL5”安全标准“目前不可能实现”,且“很可能需要国家安全界的协助”。
(a) 模糊地带使风险在公众层面的论证变得混乱,(b) 反监管的政治气候,以及 (c) 更高 RSP 级别下极难单方面满足的要求,这三者结合给当前的 RSP 带来了结构性挑战。我们本可以通过以易于合规的方式定义 ASL-4 和 ASL-5 保障措施来应对——但这会削弱 RSP 的初衷精神。
相反,我们选择透明地承认这些挑战,并在达到这些更高水平之前重构 RSP。修订后的 RSP 旨在采用更现实的单方面承诺,这些承诺在当前环境下虽然困难但仍可实现,同时继续全面梳理我们认为整个行业需要多边应对的风险。
更新我们的负责任扩展政策
新版 RSP 有三个关键要素。
1. 将我们作为公司的计划与我们对行业的建议分开
我们的 RSP 现在概述了两套缓解措施:第一,无论他人如何行动我们都计划采取的缓解措施;第二,一份雄心勃勃的能力到缓解措施映射图,我们认为如果在整个 AI 行业实施,将有助于充分管理先进 AI 带来的风险。
阅读完整的负责任扩展政策。
2. 前沿安全路线图
我们新的 RSP 引入了一项要求:制定并发布一份前沿安全路线图,其中将描述我们在安全、对齐、防护和政策等领域的具体风险缓解计划。路线图中描述的目标旨在雄心勃勃但又可实现——提供我们认为 RSP 过去成功的那种强制函数。
这些并非硬性承诺,而是我们将公开评估进展的公开目标。这种“不具约束力但公开声明”的目标策略借鉴了我们一直倡导的前沿 AI 立法透明度方法(尽管它向公众提供的细节远超现有立法要求),也借鉴了我们之前 RSP 版本的成功经验。
我们当前前沿安全路线图中的一些示例目标包括:
- 启动“登月研发”项目,探索雄心勃勃、可能非常规的方式,以实现前所未有的信息安全水平;
- 开发一种对我们的系统进行红队测试的方法(可能涉及大量自动化),其效果超越我们 漏洞赏金 项目中数百名参与者的集体贡献;
- 实施一系列系统性措施,确保 Claude 按照其 宪法 行事;
- 建立全面、集中的记录,涵盖我们所有关键 AI 开发活动,并利用 AI 分析这些记录,以发现内部人员(包括人类和 AI)的可疑行为以及安全威胁等问题;
- 发布一份政策路线图,提出“监管阶梯”的具体建议——即随风险增加而扩展的政策,可帮助指导政府的 AI 政策。
阅读 前沿安全路线图 以了解更多这些目标及其他目标。
3. 风险报告与外部审查
风险报告是我们改进之前 RSP 有效之处的另一种方式。我们发现,制作一份原型风险报告——我们 2025 年 5 月的 防护报告——对于我们的内部理解和风险的公开沟通都很有用。风险报告将此扩展为更系统、更全面的实践。
风险报告将在发布时提供有关我们模型安全状况的详细信息。它们不仅描述模型能力,还将解释能力、威胁模型(模型可能构成威胁的具体方式)和主动风险缓解措施如何相互配合,并提供对整体风险水平的评估。风险报告将每 3-6 个月在线发布(部分内容会删减1)。
新的 RSP 还要求在某些情况下对风险报告进行外部审查。我们将任命深度熟悉 AI 安全研究、有动力对 Anthropic 的安全立场保持公开诚实、且不存在重大利益冲突的第三方专家审查员。他们将获得未删减或极少删减的风险报告访问权限,并将对我们的推理、分析和决策进行全面的公开审查。尽管我们当前的模型尚不需要外部审查,但我们已经在进行试点并朝着这一目标努力。
风险报告将探讨我们当前的安全与安保措施与我们对全行业安全的更宏大建议之间的任何差距。我们希望通过描述和公开这些差距,能够有助于提升公众意识,从而在未来推动有益的政策变革。
阅读初始风险报告。
结论
负责任扩展政策一直被视为一份活的文件:一项能够随着AI模型能力提升而灵活调整的政策。这第三次修订强化了上一版RSP中行之有效的内容,承诺在计划和风险考量方面提高透明度,并将我们对整个行业的建议与作为单个公司所能实现的目标区分开来。
本着同样的务实精神,随着技术的发展,我们将继续修订和完善我们的RSP,以及我们评估和缓解风险的方法。
相关内容
Anthropic投资1亿美元培训10,000名工程师,以弥合企业AI人才缺口
Anthropic正在向Claude Frontier Academy投资1亿美元,计划到2027年底培训10,000名前沿部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱银行扩展Claude应用,以升级运营并改善客户体验
英国全能银行巴克莱正在扩大与Anthropic的战略合作,将安全的企业级AI系统整合到其全球运营中。
Claude发现了一种具有类CRISPR重复序列的新型酶系统
我们宣布在Anthropic成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们科学家仅提供高层级指导的情况下,Claude发现了一种特性令人联想到CRISPR的新型酶系统。
来源:Anthropic News · anthropic.com