Anthropic 与 Accenture 合作开展前沿 AI 嵌入式评估
Partnering with Accenture on embedded evaluation
Anthropic 宣布与 Accenture 合作,对其前沿模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估以及模型防护措施测试。
Anthropic 与 Accenture 合作推进嵌入式评估,读者可了解这一新型独立评估机制的运作方式与资金安排。
我们正与埃森哲合作,对前沿AI进行独立评估。这是朝着我们CEO在文章《我们必须把控前沿》中所作承诺迈出的重要一步——将评估人员嵌入Anthropic内部。
该合作将由埃森哲旗下专业AI业务部门Faculty牵头,内容包括评估和红队测试模型、开展对齐评估以及测试模型防护措施。埃森哲帮助众多行业的企业和政府部署AI。他们对企业如何在实践中使用AI的理解为其安全方法提供了依据,他们也将把这一视角带入对我们模型的评估中。
Anthropic和埃森哲各自预计将在未来五年内投入至少10亿美元,用于建设这一领域的能力。
嵌入式评估是一种新做法,关于其如何运作的许多细节仍在制定中。与如今的外部评估人员不同,嵌入式评估人员将在AI公司内部工作,拥有与员工相当的访问权限。这种权限使他们能够观察模型在训练中逐步成形,跟踪决定这些模型如何构建和部署的决策,并直接与员工交流。从这个有利位置,嵌入式评估人员可以评估一家公司如何运作,核实其是否履行安全承诺,并识别盲点。他们还可以报告事件,并向公众提供关于收益和风险的更知情说明。
需要明确的是,独立的嵌入式评估人员并不会减轻我们的责任,而是有助于让责任更可验证。我们模型的安全仍然是我们的责任。
目前,对于嵌入式评估人员应有权访问哪些信息,或他们应如何报告所发现的情况,尚无标准。也没有一套固定的独立评估资助体系。从长远来看,我们认为资金应来自 pooled 或政府来源,正如我们在6月的Advanced AI Framework中所呼吁的那样。由于这两者目前都不存在,我们计划以不同的资助安排与不同的评估方合作。
鉴于这项工作的重要性和紧迫性,Anthropic将直接资助埃森哲的工作。我们也在与METR及其他非营利评估机构对话,以利用他们自己的资金试点嵌入式评估的各个要素。最终,我们认为前沿AI需要一个按照共同标准运作的评估方生态系统。
我们预计前沿实验室会同时与多家组织合作。我们的合作是非排他性的;Anthropic将与其他评估方合作,具体将在未来几周内公布,而埃森哲也将以类似身份与其他AI开发者合作。
我们将继续训练和发布前沿模型,我们希望独立评估人员在我们这样做时与我们并肩工作。我们现在分享这些早期努力,是为了让人们和其他AI开发者看到我们的流程。我们预计随着该领域成熟,我们的方法也会演变,我们将在工作开始以及引入更多评估方时分享更多信息。
相关内容
Anthropic投资1亿美元培训1万名工程师,以弥合企业AI人才缺口
Anthropic正在向Claude Frontier Academy投资1亿美元,计划到2027年底培训1万名前沿部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱扩展Claude以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com