Anthropic 发起第三方模型评测资助计划
A new initiative for developing third-party model evaluations
Anthropic 宣布一项新计划,资助第三方机构开发能有效衡量 AI 模型高级能力的评测,以缓解当前安全相关评测供不应求的局面。
Anthropic 公开了第三方模型评测的资助方向与优先级,可据此了解前沿实验室如何定义安全评测需求。

一个稳健的第三方评估生态系统对于评估 AI 能力和风险至关重要,但当前的评估格局是有限的。开发高质量、与安全相关的评估仍然具有挑战性,且需求超过了供给。为了解决这个问题,今天我们推出一项新计划,资助由第三方组织开发的评估,这些评估能够有效衡量 AI 模型的高级能力。我们对这些评估的投资旨在提升整个 AI 安全领域,提供有益于整个生态系统的宝贵工具。
在这篇文章中,我们描述了我们的计划,即寻找新的评估来衡量高级模型能力,并概述了我们的动机以及我们优先考虑的具体评估类型。
如果你有提案, 请通过我们的申请表申请。
我们最高优先级的重点领域
我们有兴趣寻找三个关键的评估开发领域,我们将在文章中进一步描述:
- AI 安全等级评估
- 高级能力和安全指标
- 用于开发评估的基础设施、工具和方法
AI 安全等级评估
我们正在寻找有助于我们衡量负责任扩展政策中定义的 AI 安全等级(ASL)的评估。这些等级决定了具有特定能力的模型的安全和安保要求。稳健的 ASL 评估对于确保我们负责任地开发和部署模型至关重要。此类别包括:
- 网络安全 — 评估模型在复杂威胁行为者级别上协助或自主行动于网络操作的能力。我们的重点是网络杀伤链的关键方面,例如漏洞发现、漏洞利用开发和横向移动。我们特别感兴趣的是那些如果自动化并规模化,可能对关键基础设施和经济上有价值的系统构成重大风险、达到接近高级持续性威胁行为者水平的能力。该领域的有效评估可能类似于没有公开解决方案的新型夺旗(CTF)挑战。当前的评估往往不足,要么过于简单,要么解决方案在网上 readily 可获取。
- 化学、生物、放射和核(CBRN)风险 — 我们优先考虑评估两项关键能力:a) 模型显著增强非专家或专家制造 CBRN 威胁能力的潜力,以及 b) 设计新型、更具危害性的 CBRN 威胁的能力。该领域的一个关键挑战是确保评估准确衡量现实世界的风险。提案应仔细考虑其评估如何针对正确的提升瓶颈或可能导致真正灾难性 CBRN 威胁的高级设计标准。
- Model autonomy — Evaluations that assess models' capabilities for autonomous operation, focusing on three key areas:
- AI 研究与开发:衡量模型在初级、中级或专家研究工程师级别执行 AI R&D 任务的熟练程度。
- 高级自主行为:有关更多信息,请参阅我们负责任扩展政策中的自主能力评估和METR 的公开任务套件。
- 自我复制和适应:评估模型获取计算和财务资源或窃取权重的能力。
- Other national security risks — AI systems have the potential to significantly impact national security, defense, and intelligence operations of both state and non-state actors. We're committed to developing an early warning system to identify and assess these complex emerging risks. Given the sensitive nature of this domain, we invite interested parties to submit an application with your proposal, including the following points:
- 为不同行为者如何利用滥用行为定义详细且全面的威胁模型
- 将这些威胁模型与可衡量、简洁的评估指标联系起来
- Social manipulation — Evaluations that measure the extent to which models may amplify persuasion-related threats, such as disinformation and manipulation. This area presents two significant challenges:
- 发展一套稳健的理论,说明这些能力如何将现实世界风险升级到超越当前基线
- 分离并评估模型对这些风险的独特贡献
- 失准风险——我们的研究表明,在某些情况下,AI 模型可以学习危险的目标和动机,即使经过安全训练仍会保留它们,并就其追求过程中采取的行动欺骗人类用户。这些能力,结合当前 AI 模型达到人类水平的说服力和网络能力,加剧了我们对未来更强大模型潜在行动的担忧。例如,未来的模型可能能够实施复杂且难以检测的欺骗,绕过或破坏组织的安全,要么促使人类采取他们原本不会采取的行动,要么窃取敏感信息。我们提议开发能够监测此类能力的评估。
高级能力与安全指标
除了我们的 ASL 评估之外,我们希望开发评估高级模型能力和相关安全标准的评估。这些指标将提供对我们模型优势和潜在风险的更全面理解。这一类别包括:
- Advanced science — AI's potential to transform scientific research is immense. While evaluations like Google-Proof Q&A (GPQA) provide a strong foundation, we believe there's significant room for growth. We're seeking to fund the development of tens of thousands of new evaluation questions and end-to-end tasks that would challenge even graduate students. Our focus areas include:
- 知识综合(结合多个研究领域的见解)
- 超越现有训练数据的研究生水平知识
- 自主端到端研究项目执行
- 新颖假设和设计生成
- 实验室内方案和标准操作程序的故障排除
- 隐性知识(只能在实验室学徒过程中获得的那种知识)
- 涉及大量决策才能取得成功的长期任务
- 自动化数据分析
- Harmfulness and refusals — We need to enhance our evaluation of classifiers' abilities to selectively detect potentially harmful model outputs, including:
- 区分两用和非两用信息
- 准确识别真正有害的 CBRN 相关输出
- 检测自动化网络事件的尝试
- 改进的多语言评估——能力基准通常无法覆盖世界上大多数语言。我们希望支持支持多种语言的能力评估。
- 社会影响——提供复杂、细致评估的评估,超越表面指标,创建针对有害偏见、歧视、过度依赖、依赖、依恋、心理影响、经济影响、同质化以及其他广泛社会影响等概念的严格评估。
用于开发评估的基础设施、工具和方法
我们有兴趣资助能够简化高质量评估开发的工具和基础设施。这些对于在 AI 社区中实现更高效、更有效的测试至关重要。这一类别包括:
- 模板/无代码评估开发平台 — 生成强有力的评估需要深厚的领域专业知识以及编程和 AI 经验。我们发现这是一种非常独特的技能组合。我们希望资助开发这样的平台:让没有编程技能的领域专家也能开发出强有力的评估,并能以适当的格式导出。这些工具可以帮助将评估格式化为正确的结构,也可以让领域专家快速迭代,并反馈他们正在开发的评估是否稳健。
- 用于模型评分的评估 — 提升模型使用复杂评分标准可靠地审查和评分其他模型输出的能力,将能解锁当前生态中的瓶颈。当前的主要挑战在于,要拥有一个足够多样且足够复杂的测试集,来评估模型作为高质量评分者的可靠性。为解决这一问题,我们希望探索在多样领域开发大规模数据集,每个数据集最好都包含问题、多个示例答案、每个答案的“真实”分数,以及用于评分的评分标准。
- Uplift trials — We're interested in running evaluations that precisely measure a model's impact through controlled trials. These trials would compare task performance between groups with and without model access. Our vision is to regularly conduct large-scale trials involving thousands of participants, enabling us to quantify how models contribute to faster and better outcomes. However, there are bottlenecks to performing such trials. We would like to support:
- 开发由高质量研究人群组成的网络,这些人有动力完成任务
- 能够轻松运行和分析试验的工具
良好评估的原则
开发出色的评估很难。即使是一些最有经验的开发者也会落入常见陷阱,而且即使是最好的评估也并不总能反映它们声称要衡量的风险。下面我们列出通过反复试错学到的一些良好评估的特征:
1. 足够困难:评估应与衡量我们《负责任扩展政策》中 ASL-3 或 ASL-4 级别所列能力,和/或人类专家水平行为相关。
2. 不在训练数据中:评估常常因为数据在模型的训练集中,最终变成在衡量模型记忆。在可能且有用的情况下,确保模型没有见过该评估。这有助于表明该评估捕捉到的是能够泛化到训练数据之外的行为。
3. 高效、可扩展、开箱即用:评估应针对高效执行进行优化,尽可能利用自动化。它们应能利用现有基础设施轻松部署,且只需极少设置。
4. 尽可能高容量:在其他条件相同的情况下,包含 1,000 或 10,000 个任务或问题的评估优于只有 100 个的评估。不过,高质量、低容量的评估也很有价值。
5. 领域专业知识:如果评估涉及某一特定主题(例如科学)上的专家表现,请确保使用领域专家来开发或审查该评估。
6. 格式多样性:考虑使用超越多项选择的格式,例如基于任务的评估(例如查看代码是否通过测试,或某个 flag 是否在 CTF 中被捕获)、模型评分评估或人类试验。
7. 用于比较的专家基线:将模型表现与该领域人类专家的表现进行比较通常很有用。
8. 良好的文档和可复现性:我们建议准确记录评估是如何开发的,以及它可能存在的任何局限性或陷阱。尽可能使用 Inspect 或 METR 标准等规范。
9. 从小处着手,迭代并扩展:从只写一到五个问题或任务开始,在评估上运行一个模型,并阅读模型记录。通常,你会意识到评估没有捕捉到你想要测试的内容,或者它太简单了。
10. 现实且与安全相关的威胁建模:安全评估理想情况下应具备这样的特性:如果模型得分很高,专家会相信可能导致重大事件。大多数时候,当模型表现优异时,专家们会意识到,在该版本评估上的高表现并不足以让他们担忧。
如何提交提案
你可以在我们的申请表上提交提案。如有任何问题,请联系[email protected]。
我们的团队将滚动审查提交内容,并与选定的提案跟进讨论下一步。我们提供一系列资助选项,以满足每个项目的需求和阶段。
我们的经验表明,完善一项评估通常需要多次迭代。你将有机会直接与我们的领域专家互动,他们来自 Frontier Red Team、Finetuning、Trust & Safety 以及其他相关团队。我们的团队可以提供指导,帮助塑造你的评估以实现最大影响。
我们希望这项倡议能成为推动进步的催化剂,迈向一个全面 AI 评估成为行业标准的未来。我们邀请你加入这项重要工作,帮助塑造前进的道路。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球运营中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种具有类似 CRISPR 特性的新型酶系统。
来源:Anthropic News · anthropic.com