Dario Amodei 在 AI 安全峰会讲解 Anthropic 负责任扩展政策
Dario Amodei’s prepared remarks from the AI Safety Summit on Anthropic’s Responsible Scaling Policy
Anthropic CEO Dario Amodei 在 AI 安全峰会上介绍公司的负责任扩展政策(RSP),该政策于 9 月发布,是首个由主要 AI 公司发布的此类政策。
Anthropic CEO 在 AI 安全峰会上系统讲解 RSP 的分级逻辑与落地经验,可了解前沿实验室如何把安全承诺写进产品与研究流程。

在我深入介绍 Anthropic 的负责任扩展政策(RSP)之前,有必要先解释一下围绕衡量 AI 风险的一些独特挑战,正是这些挑战促使我们制定了 RSP。关于 AI,最重要的一点是要理解它发展得有多快。几年前,AI 系统几乎连一个连贯的句子都拼不出来。如今它们能通过医学考试、写诗、讲笑话。这种快速进步归根结底是由可用算力驱动的,而算力正以每年 8 倍的速度增长,且在未来几年内不太可能放缓。快速进步的总体趋势是可预测的,然而,要预测 AI 何时获得特定技能或知识实际上非常困难。不幸的是,这包括危险技能,例如构建生物武器的能力1。因此,我们正面临若干与 AI 相关的潜在威胁,尽管以今天的系统来看这些威胁相对有限,但在不久的将来某个未知时刻,它们很可能会变得非常严重。这与大多数其他行业截然不同:想象一下,如果每一款新车型都有可能自发地长出一种新的(且危险的)能力,比如能够发射火箭助推器或加速到超音速。
我们既需要一种方法来频繁监测这些新兴风险,也需要一套在风险出现时做出适当响应的协议。负责任扩展政策——最初由对齐研究中心提出——试图满足这一需求。Anthropic 于 9 月发布了其 RSP,是首家这样做的大型 AI 公司。它有两个主要组成部分:
- 首先,我们设计了一套名为AI 安全等级(ASL)的系统,大致仿照国际公认的用于处理生物材料的 BSL 系统。每个 ASL 等级都有一个如果-那么结构:如果某个 AI 系统表现出某些危险能力,那么在落实某些保障措施之前,我们将不会部署它,也不会训练更强大的模型。
- 其次,我们沿着算力扩展曲线,按固定间隔频繁测试这些危险能力。这是为了确保我们不会在甚至不知道自己已经创造出危险能力的情况下盲目地创造出它们。
在我们的系统中,ASL-1 代表几乎没有风险的模型——例如一个专门下棋的 AI。ASL-2 代表我们今天的处境:模型具有广泛的当下风险,但尚未表现出真正危险的能力,即若应用于生物学或化学等领域可能导致灾难性后果的能力。我们的 RSP 要求我们对 ASL-2 模型实施当下最佳实践,包括模型卡、外部红队测试和强大的安全性。
ASL-3 是 AI 模型在 CBRN 领域变得可被实际用于灾难性滥用的节点,这由这些领域的专家界定,并与现有能力和概念验证相比较。当这种情况发生时,我们要求采取以下措施:
- 异常强大的安全措施,使得非国家行为者无法窃取权重,而国家行为者也需要付出巨大努力才能做到。
- 尽管(从定义上讲)本质上能够提供在操作上增加 CBRN 风险的信息,但我们部署的 ASL-3 模型绝不能产生此类信息,即使是由该领域的世界专家与 AI 工程师合作进行红队测试时也是如此。这需要研究上的突破,但我们认为这是安全的必要条件。
- 在达到 ASL-3 时,必须严格定义 ASL-4。
ASL-4 代表了 ASL-3 灾难性滥用风险的升级,并且还增加了一个新风险:对脱离人类控制并对社会构成重大威胁的自主 AI 系统的担忧。大致而言,当 AI 系统具备接近人类水平的自主能力,或成为世界上至少一种严重全球安全威胁(如生物武器)的主要来源时,就会触发 ASL-4。在 ASL-4 阶段,我们很可能需要对模型内部发生的情况有详细而精确的理解,以便提出模型安全的“肯定性论证”。

接下来,我将简要提及我们的一些关键实践和经验教训,我们希望这些对其他人制定 RSP 有所帮助。首先,高管的深度参与至关重要。作为 CEO,我本人在 3 个月里亲自将 10-20% 的时间投入到 RSP 上——除了设计和提出 ASL 系统外,我还从零开始撰写了多份草案。我的一位联合创始人将 50% 的时间投入到 RSP 的制定中,持续了 3 个月。这共同向员工发出了一个有意义的信号:Anthropic 的领导团队认真对待 AI 安全问题,并坚定致力于在前沿进行负责任的扩展。
其次,将 RSP 中概述的协议转化为产品和研究要求,使其融入公司规划并推动团队路线图和扩展计划。设定预期:错过 RSP 截止日期会直接影响公司继续训练模型和按时交付产品的能力。在 Anthropic,安全、信任与安全、红队和可解释性等团队不得不大幅增加招聘,以便在我们拥有 ASL-3 模型时,有合理的机会实现 ASL-3 安全措施。
第三,问责制是必要的。Anthropic 的 RSP 是其董事会的正式指令,董事会最终对我们的长期利益信托负责,该信托是一个外部专家小组,在 Anthropic 中没有经济利益。在运营方面,我们将在达到 ASL-3 之前制定举报人政策,并且已经有一名官员负责确保遵守 RSP 并向我们的长期利益信托报告。随着风险增加,我们预计将需要更强形式的问责制。
最后,我想讨论一下 RSP 与监管之间的关系。RSP 并非旨在替代监管,而是监管的一个原型。我并不是说我们希望 Anthropic 的 RSP 被逐字写入法律——我们的 RSP 只是解决一个难题的首次尝试,几乎肯定在许多方面都不完美。重要的是,当我们开始执行这第一个迭代版本时,我们期望能学到大量关于如何合理地落实此类承诺的知识。我们希望 RSP 的总体理念能在各公司之间得到完善和改进,并且与此同时,世界各地的政府——比如在座各位所代表的政府——能够汲取各方的最佳要素,将其转化为精心设计的测试和审计制度,并配有问责与监督机制。我们希望鼓励在 RSP 式框架中形成一种“力争上游”的态势,让公司和各国相互借鉴彼此的想法,最终为世界开辟一条道路,以明智地管理 AI 风险,同时不过度损害其带来的益处。
脚注
1. https://www.anthropic.com/inde...
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种具有类似 CRISPR 特性的新型酶系统。
来源:Anthropic News · anthropic.com