跳到正文
Anthropic News·· 2023-09-19精选AI 评分67

Anthropic 发布负责任扩展政策 RSP

Introducing Anthropic's Responsible Scaling Policy

AI 导读

Anthropic 发布负责任扩展政策(RSP),提出参照美国政府生物安全等级设计的 AI Safety Levels(ASL)框架,按模型潜在灾难性风险高低要求相应的安全、安保与运营标准。

推荐理由

Anthropic 首次公开其分级安全框架,读者可了解前沿实验室如何把灾难性风险纳入发布流程。

正文 · AI 翻译

今天,我们发布我们的负责任扩展政策(RSP)——一系列技术和组织协议,我们采用这些协议来帮助我们管理开发能力日益强大的 AI 系统所带来的风险。

随着 AI 模型能力越来越强,我们相信它们将创造重大的经济和社会价值,但也会带来日益严重的风险。我们的 RSP 关注灾难性风险——即 AI 模型直接导致大规模毁灭的风险。此类风险可能来自对模型的故意滥用(例如被恐怖分子或国家行为者用于制造生物武器),也可能来自模型以违背其设计者意图的方式自主行动而造成破坏。


我们的 RSP 定义了一个名为 AI 安全等级(ASL)的框架,用于应对灾难性风险,其大致仿照美国政府处理危险生物材料的生物安全等级(BSL)标准。基本思路是要求与模型潜在灾难性风险相适应的安全、安保和运营标准,更高的 ASL 等级要求越来越严格的安全证明。

ASL 系统的简要总结如下:

  • ASL-1 指不构成任何有意义灾难性风险的系统,例如 2018 年的 LLM 或只会下棋的 AI 系统。
  • ASL-2 指显示出危险能力早期迹象的系统——例如能够提供如何制造生物武器的说明——但由于可靠性不足或未提供例如搜索引擎也能提供的信息,这些信息尚不实用。当前的 LLM,包括 Claude,似乎属于 ASL-2。
  • ASL-3 指与非 AI 基线(例如搜索引擎或教科书)相比大幅增加灾难性滥用风险的系统,或者显示出低水平自主能力的系统。
  • ASL-4 及更高(ASL-5+)尚未定义,因为距离当前系统太远,但很可能涉及灾难性滥用潜力和自主性方面的质变升级。

每个 ASL 等级的定义、标准和安全措施在主文档中有详细描述,但概括而言,ASL-2 措施代表我们当前的安全和安保标准,并与我们最近的白宫承诺有大量重叠。ASL-3 措施包括更严格的标准,需要大量研究和工程努力才能及时遵守,例如异常强大的安全要求,以及承诺如果 ASL-3 模型在世界级红队人员的对抗性测试下显示出任何有意义的灾难性滥用风险,则不部署该模型(这与仅仅承诺进行红队测试形成对比)。我们的 ASL-4 措施尚未编写(我们的承诺是在达到 ASL-3 之前编写它们),但可能要求目前尚未解决的研究问题的方法来提供保证,例如使用可解释性方法从机制上证明模型不太可能参与某些灾难性行为。

我们设计 ASL 系统,旨在有效针对灾难性风险与激励有益应用和安全进展之间取得平衡。一方面,ASL 系统隐含地要求我们,如果 AI 扩展速度超出我们遵守必要安全程序的能力,就暂时暂停训练更强大的模型。但它这样做的方式直接激励我们解决必要的安全问题,以此解锁进一步的扩展,并允许我们使用上一 ASL 级别中最强大的模型作为开发下一级别安全功能的工具。1 如果被前沿实验室采纳为标准,我们希望这可能创造一种“逐顶竞争”的动态,让竞争激励直接导向解决安全问题。

从商业角度来看,我们想明确表示,我们的 RSP 不会改变 Claude 当前的使用方式,也不会扰乱我们产品的可用性。相反,它应被视为类似于汽车或航空行业进行的上市前测试和安全功能设计,其目标是在产品投放市场之前严格证明其安全性,最终使客户受益。

Anthropic 的 RSP 已获得其董事会正式批准,变更必须经董事会与 Long Term Benefit Trust 磋商后批准。在完整文件中,我们描述了一系列程序性保障措施,以确保评估过程的完整性。

然而,我们想强调,这些承诺是我们目前的最佳猜测,是一个我们将在此基础上继续构建的早期迭代。AI 作为一个领域的快速步伐和诸多不确定性意味着,与相对稳定的 BSL 系统不同,快速迭代和路线修正几乎肯定是必要的。

完整文件可在此处阅读。我们希望它为政策制定者、第三方非营利组织以及面临类似部署决策的其他公司提供有用的启发。

我们感谢 ARC Evals 为我们 RSP 承诺的制定提供的关键见解和专业知识,特别是在自主能力评估方面。我们发现他们在 AI 风险评估方面的专业知识在我们设计评估程序时发挥了重要作用。我们也认可 ARC Evals 在发起和引领其更广泛的 ARC Responsible Scaling Policy 框架开发方面的领导作用,这启发了我们的方法。

脚注

  1. 总体而言,Anthropic 一直发现,与前沿 AI 模型合作是开发新方法以减轻 AI 风险的必要组成部分。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究团队和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一个具有类似 CRISPR 特性的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com