Anthropic 发布更新版负责任扩展政策 RSP
Announcing our updated Responsible Scaling Policy
Anthropic 发布负责任扩展政策(RSP)的更新版本,引入更灵活的风险评估方式,并新增能力阈值与所需保障措施两部分框架。更新后的政策定义了两个关键能力阈值:模型若能自主开展复杂 AI 研发任务,需提升至可能为 ASL-4 或更高的安全标准;若模型能实质协助具备基础技术背景的人制造或部署 CBRN 武器,则需达到 ASL-3 标准。
Anthropic 公开了 RSP 更新后的能力阈值与 ASL 分级思路,可对照其一年实施中暴露的合规缺口。
今天我们发布了对我们的负责任扩展政策(RSP)的一次重大更新,这是我们用来缓解前沿 AI 系统潜在灾难性风险的风险治理框架。此次更新引入了一种更灵活、更细致的方法来评估和管理 AI 风险,同时保持我们的承诺:除非我们已实施充分的保障措施,否则不会训练或部署模型。主要改进包括新的能力阈值,用以表明我们将在何时升级保障措施;改进的流程,用于评估模型能力以及我们保障措施的充分性(受安全案例方法论启发);以及针对内部治理和外部输入的新措施。通过从我们的实施经验中学习,并借鉴其他高后果行业所使用的风险管理实践,我们旨在更好地为 AI 的快速进步做好准备。
先进 AI 的前景与挑战
随着前沿 AI 模型不断进步,它们有可能为我们的社会和经济带来变革性益处。AI 可以加速科学发现、革新医疗保健、增强我们的教育体系,并为人类的创造力和创新开辟全新的领域。然而,前沿 AI 系统也带来了新的挑战和风险,值得仔细研究和有效保障。
2023 年 9 月,我们发布了负责任扩展政策,这是一个用于管理能力日益增强的 AI 系统风险的框架。经过一年的实施和学习,我们现在分享一个大幅更新的版本,它反映了实践中的洞见,并考虑到了不断进步的技术能力。
尽管这项政策聚焦于下文所列类别等灾难性风险,但它们并不是我们监测和防范的唯一风险。我们的使用政策规定了我们产品的使用标准,包括禁止使用我们的模型传播虚假信息、煽动暴力或仇恨行为,或从事欺诈或滥用行为。我们持续完善技术措施,以大规模执行我们的信任与安全标准。此外,我们开展研究,以理解我们模型更广泛的社会影响。我们的负责任扩展政策补充了我们在这些领域的工作,有助于我们理解当前和潜在的风险。
一个按比例实施保障的框架
和以往一样,我们保持核心承诺:除非我们已实施将风险保持在可接受水平以下的安全与安保措施,否则不会训练或部署模型。我们的 RSP 基于按比例保护的原则:保障措施随潜在风险而扩展。为此,我们使用 AI 安全级别标准(ASL 标准),这是一组分级的安全与安保措施,随着模型能力提高而变得更加严格。受生物安全等级启发,这些标准从适用于能力非常基础的模型(例如下棋机器人)的 ASL-1 开始,并依次推进到 ASL-2、ASL-3 等。
在更新后的政策中,我们改进了评估特定能力(及其相关风险)和实施按比例安全与安保措施的方法。我们更新后的框架有两个关键组成部分:
- 能力阈值:特定的 AI 能力,一旦达到,就需要比我们当前基线更强的保障措施。
- 必需保障措施:一旦达到能力阈值,为降低风险所需的具体 ASL 标准。
目前,我们所有的模型都在 ASL-2 标准下运行,这反映了当前的行业最佳实践。我们更新后的政策定义了两个关键能力阈值,达到这些阈值将需要升级保障措施:
- 自主 AI 研发:如果模型能够独立完成通常需要人类专业知识的复杂 AI 研究任务——可能以不可预测的方式显著加速 AI 发展——我们要求提高安全标准(可能是 ASL-4 或更高标准)并增加额外的安全保证,以避免发展速度超过我们应对新兴风险的能力。
- 化学、生物、放射性和核(CBRN)武器:如果模型能够切实帮助具有基础技术背景的人制造或部署 CBRN 武器,我们要求加强安全和部署保障措施(ASL-3 标准)。
ASL-3 保障措施包括增强的安全措施和部署控制。在安全方面,这将包括内部访问控制和更强大的模型权重保护。对于部署风险,我们计划实施多层方法来防止滥用,包括实时和异步监控、快速响应协议以及全面的部署前红队测试。
实施与监督
为促进政策的有效实施,我们已建立:
- 能力评估:基于我们的能力阈值进行常规模型评估,以确定我们当前的保障措施是否仍然适当。(过往评估的摘要可在此处获取。)
- 保障评估:对我们安全和部署安全措施的有效性进行常规评估,以评估我们是否达到了必需保障措施的标准。(这些决定的摘要将在此处提供。)
- 文档记录与决策:受高可靠性行业常见程序(如安全案例方法)启发,用于记录能力评估和保障评估的流程。
- 内部治理与外部输入措施:我们的评估方法将得到内部压力测试的支持,此外还有我们现有的安全问题内部报告流程。我们还在就我们的方法论征求外部专家反馈。1
从经验中学习
在上一版 RSP 生效的第一年里,我们学到了很多,并利用这次更新来反思哪些做法行之有效,以及政策中哪些内容适合更新。作为其中的一部分,我们首次审查了我们遵守该框架的情况,并发现少数未完全达到其要求的情况。这些问题包括程序性问题,例如比计划晚三天完成一组评估,或者对于应如何以及在哪里记录占位评估的任何变更缺乏明确性。我们还标记了一些评估,在这些评估中,我们或许能够通过实施标准技术(如思维链或 best-of-N)获得略好的模型表现。
在所有情况下,我们发现这些实例对我们的模型安全性构成的风险极小。我们利用额外的三天时间完善并改进了我们的评估;我们使用的不同评估集比占位评估提供了更准确的评估;而且我们的评估方法仍然表明我们距离阈值还有足够远的距离。由此,我们学到了两条宝贵的经验,并将其纳入我们更新后的框架:我们需要在政策中引入更多灵活性,并且需要改进我们跟踪 RSP 合规性的流程。你可以在此了解更多。
自从一年前我们首次发布 RSP 以来,我们的目标一直是提供一个框架范例,供其他人在制定自己的人工智能风险治理政策时借鉴。我们希望,主动分享我们实施自身政策的经验,将有助于其他公司实施自己的风险管理框架,并促进整个人工智能生态系统最佳实践的建立。
展望未来
人工智能的前沿正在迅速发展,这使得预测未来系统适合采取哪些安全措施变得具有挑战性。我们安全计划的各个方面都将持续演进:我们的政策、评估方法、保障措施,以及我们对潜在风险和缓解措施的研究。
此外,联合创始人兼首席科学官 Jared Kaplan 将担任 Anthropic 的负责任扩展官,接替在过去一年中担任该职位的联合创始人兼首席技术官 Sam McCandlish。Sam 监督了 RSP 的初始实施,并将继续专注于其作为首席技术官的职责。在我们努力扩大实施 RSP 的工作规模之际,我们也在招聘一名负责任扩展负责人。该职位将负责协调众多团队,以迭代并成功遵守 RSP。
如果你想为 Anthropic 的人工智能风险管理做出贡献,我们正在招聘!我们的许多团队现在都通过 RSP 为风险管理做出贡献,包括:
- 前沿红队(负责威胁建模和能力评估)
- 信任与安全(负责制定部署保障措施)
- 安全与合规(负责安全保障措施和风险管理)
- 对齐科学(包括负责制定 ASL-3+ 安全措施、开展以失准为重点的能力评估,以及负责我们内部对齐压力测试计划的子团队)
- RSP 团队(负责政策起草、保证和跨公司执行)
在 anthropic.com/rsp 阅读更新后的政策,并在 anthropic.com/rsp-updates 阅读补充信息。
我们衷心感谢许多外部团体,他们为我们负责任扩展政策的制定和完善提供了宝贵的反馈。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名前沿部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com