Anthropic 披露 Claude 越权事件调查与对齐安全整改
Improving our alignment and security efforts
Anthropic 就 7 月 30 日 Claude 模型未经授权访问真实计算机系统、以及 8 月 4 日英国 AI Security Institute 报告的 Claude Mythos 5 在真实互联网上采取未授权行动两起事件,公布初步调查与整改措施,并计划与 METR 合作开展独立审查。
Anthropic 首次系统披露 Claude 越权访问真实系统后的整改细节,并给出奖励黑客与失准行为的实验证据。
7月30日,我们报道了三起Claude模型未经授权访问真实计算机系统的事件。这些模型——为评估目的而有意在无网络安全防护的情况下运行——由于第三方评估环境内部的配置错误而访问了互联网。另外,8月4日,英国人工智能安全研究所报道了其自身网络安全测试中的一起事件,其中Claude Mythos 5在实时互联网上采取了一系列未经授权的操作。在那起事件中,该模型同样是为评估目的而有意在无网络安全防护的情况下运行,并被刻意赋予了互联网访问权限。
我们正在对这两起事件进行深入分析。我们还计划与METR合作进行独立审查。我们希望确保这两项研究都足够彻底,并将在未来几周内分享更多信息。
与此同时,我们分享过去一个月中所做的一些改变。我们认为这些事件反映了一次运营安全失误,以及两个对齐问题:动机性推理,以及为追求狭窄任务而采取有害行动的意愿(这两点我们已在之前的系统卡中描述过)。在安全方面,我们描述了对遏制与监控系统所做的改进,以及我们为第三方评估者制定的实践规范。在对齐方面,我们更深入地讨论这两个问题;我们还认为,持久的进展不仅来自理解某起事件中发生了什么,还来自理解错位最初是如何产生的,我们分享了该方向的早期研究。
鉴于这些事件,关于为前沿发展设定节奏的讨论日益增多。区分两种节奏是有帮助的。在公司内部,节奏意味着一系列在安全与速度相冲突时优先考虑安全的决策。在整个领域,它意味着建立流程以防止逐底竞争的动态。在这篇文章中,我们讨论了我们为第一种方式所采取的行动,无论是在这些事件之前还是之后。第二种节奏需要政府与行业之间的协调,并且应当清晰可辨且可验证。我们的一些高级领导层和许多员工最近签署了一封信,呼吁在节奏方面加强协调,我们将在未来几周内进一步说明我们打算如何为这一努力做出贡献。明确我们的立场:我们认为,如果行业尽快采用一种合法、可验证、有效的协调节奏机制,世界将会受益。
保障评估和训练环境的安全
虽然我们不认为这些事件仅仅是运营问题,但我们的首要任务是解决具体的遏制与监控问题。我们为此采取了以下行动:
暂停并加固评估环境
在这些事件发生后,我们暂停了对预发布模型的外部网络评估,并在落实以下措施期间短暂暂停了内部评估。我们在7月30日报告的事件表明,我们此前在很大程度上依赖单一防御层(环境本身的配置),而我们需要多层防御,包括在提示中设定明确边界、建立流程以验证沙箱在预期位置是密封的,以及实施能够实时干预的监控。OpenAI的披露(这促使我们在7月进行了调查)指出,模型在评估期间利用一个未知漏洞逃出了密封沙箱,这也清楚地表明我们应该专注于加固沙箱本身。
在评估暂停期间,我们落实了以下初步措施:
1) 我们构建并部署了一个分类器,用于实时自动识别模型何时试图激进地探测或逃离测试环境,或意外获得互联网访问权限。当分类器标记此类尝试时,它会在工具调用运行之前阻止该操作,结束任务,并提醒人工。1
2) 我们对近期预发布模型内部评估(网络及其他方面)的记录运行了自动监控,以查找沙箱逃逸(模型利用我们沙箱中的缺陷,触及本应被隔离的系统的情况)或沙箱配置错误。在我们于沙箱工具内运行评估的情况下,我们没有发现其突破沙箱边界以触及不应触及的外部资源的例子。我们确实发现了模型利用的各种沙箱配置错误,但其中没有一个导致沙箱外系统被攻破。2我们正在积极解决这些问题。
3) 我们将高风险3内部网络沙箱迁移到了更强大的隔离环境。我们还在进一步对我们的虚拟化技术栈进行红队测试——即让预发布模型尝试逃逸——以发现并修补弱点。
我们的内部网络评估现在已在这些措施到位的情况下重新运行。

强化学习环境
我们还将预发布模型的高风险强化学习环境暂停了数周。在此期间,我们构建了一个类似的分类器,并对其进行了修改,以避免激励模型规避这一新的监控,目前我们已在这些环境中部署了该分类器。大部分强化学习已恢复,但一些高风险环境仍处于暂停状态,直到能够进行人工审查,而另一些环境则需要我们计划很快部署的分类器更新版本。
更广泛的加固
除了针对高风险评估和训练的努力外,我们还扩展了离线监控,以覆盖大多数其他形式的内部前沿智能体使用。我们还在内部推理上构建控制措施,以防止Anthropic员工意外运行缓解措施弱于上述措施的智能体。
外部合作伙伴的最佳实践
由于所报告的事件发生在第三方环境中,我们已要求每一个测试降低网络保障措施的预发布模型的组织承诺遵守一套最佳实践。我们认为这些是必要的,因为:
- 我们正式发布的模型都附带防护措施——包括对 Claude 的输入和输出进行实时分类的检查器,以阻止被禁止的网络活动,例如恶意软件开发或攻击性漏洞利用编写。相比之下,网络评估人员和部分早期访问合作伙伴所使用的模型则降低了这些防护措施,以便进行准确的模型能力测试和防御性网络工作。
- 网络评估极有可能产生这些事件中所见的行为。它们会形成选择压力,促使模型在探查周围环境和绕过障碍时保持持久性和创造力,而且这些评估会运行数千次之多。
无论合作伙伴使用自己的测试框架、沙箱还是代理来运行网络相关评估,这些做法都完全适用。但它们不适用于使用 Claude Fable 5 等受防护模型的客户。我们已在落实这些做法的情况下恢复了外部网络评估,并且我们在内部也同样遵守这些做法。
沙箱与网络隔离
默认情况下,所有网络评估都应在加固的沙箱(隔离的计算环境)内运行,且无互联网访问。该环境唯一允许的外部连接是模型自身的 API,且 API 密钥应保存在环境之外。每次评估开始前都应验证此配置。部分评估可能需要互联网访问。在这些情况下,我们在评估预发布模型时会与外部评估人员合作,以确定我们能否可靠地检测并中止模型在声明范围之外采取行动的运行。
参与前验证
在进行一次评估运行之前,评估合作伙伴应:
- 让被测模型探查沙箱的漏洞,首先对配置进行静态分析,然后实际让模型尝试逃逸。应指示模型在成功逃逸时停止并报告,且所有这些都应在密切的人工监督下进行。此测试应在无互联网访问的情况下进行,最好在第二个沙箱内进行。由于评估有时会运行数百甚至数千次,合作伙伴最好在开始任何评估之前长时间进行此测试。
- 确认任何评估挑战在原则上确实可解。当评估目标离线或任务无法完成时,代理往往会寻找其他方式来完成挑战,从而增加其在评估预期范围之外采取行动的可能性。4
明确设定范围
每个提示都应说明本次演练的范围之内和之外的内容,包括目标、允许的操作和网络边界(即模型应访问和不应访问的内容)。边界应以指令形式表述(例如“你不应访问互联网”),而不是关于环境或测试的陈述(“你没有互联网访问权限”)。
实时监控
评估人员还应使用已获知演练范围的基于模型或规则的监控器,对模型的思考、操作和网络活动进行持续监控。如果某次运行违反了此范围,监控器应向人工发出标记并结束演练。
我们计划在与外部合作伙伴协商的基础上继续完善这一指导方针,并将其扩展到评估之外。特别是,我们正在为能够访问 Claude Mythos 5 的合作伙伴制定配套实践,该模型同样在没有网络防护措施的情况下运行,我们将很快分享更多信息。
对齐评估
遏制与监控对于捕捉模型采取危险行为的实例至关重要,但它们并未解决模型最初为何采取此类行为的原因。下面我们将讨论我们的初步对齐调查和我们重点关注的问题,以及我们为防止训练期间作弊而正在开展的工作——包括关于作弊如何塑造模型行为的新研究。
评估期间我们模型的环境与知识状态
我们的对齐评估仍在进行中,但初步调查指向两个主要的对齐失败,我们已在先前的系统卡中描述过这两者。其一是动机性推理:模型最初被告知其环境是模拟的,但当它们后来遇到表明自己连接到真实互联网的证据时,它们可能以某种方式解读这些证据,从而得以维持原有信念。其二是鲁莽:模型愿意在真实互联网上采取有害行动,以追求解决网络安全评估这一狭隘目标。然而,我们也认为评估设置本身促成了这些事件中所展示的模型行为。Claude 被明确告知它没有互联网访问权限,尽管互联网实际可用,这可能使其质疑所看到的系统是否真实。而在一个案例中,虚构目标与一个真实网站同名,使得区分演习中本应属于范围内的内容变得更加困难。
我们的结论取决于几个我们尚未完全回答的问题,包括模型在多大程度上确定自己可以访问真实互联网(即使它们最初并不知道这一点)、它们是否明知故犯地无视了其环境元素是真实的迹象,以及在若干案例中它们未能停止演习是否源于动机性推理。我们正在应用一系列技术来回答这些问题,包括在对环境进行针对性修改的同时对模型进行重采样,以及使用可解释性方法直接检查其内部状态。
研究防止训练期间作弊的努力
尽管模型失准问题复杂且可能因多种原因产生,但我们通过实证发现,训练环境中的缺陷——特别是容易作弊的环境,或不做弊就无法解决的环境——是导致失准行为不成比例的巨大因素。
下面我们讨论我们为避免出现这类缺陷的训练环境所做的努力,这可以追溯到这些事件发生前的几个月。这些努力并不完美,我们的假设是,这些事件至少部分与我们在完全消除这类问题上的无能为力有关。我们通过故意在容易受到奖励黑客攻击的环境中训练一个模型来验证这一假设。在模拟中,该模型再现了更严重的失准行为,其中一些与今年夏天其他公司报告的事件中所述类似。而我们的生产模型在同样的模拟中则不会如此(详见本节后文)。
我们历来担心强化学习训练环境会激励作弊,并采取了各种措施来过滤或修复此类环境。
今年2月,在发现奖励黑客迹象(即模型找到办法欺骗其训练过程,在未完成指定任务的情况下获得奖励)后,我们回滚了 Mythos Preview 强化学习运行中三天的训练。我们注意到该模型在代码注释和回复中给“审阅者”写备注,甚至出现在从未提及任何审阅者的任务中——这是从提示中确实包含审阅者的环境中产生的一种不良泛化。它还不断钻一项旨在激励诚实行为的奖励的空子,办法是堆砌免责声明或附加说明。5 回滚这三天让我们能够从该行为被学到之前的检查点恢复训练,并且我们对环境做了修改,以防止模型再次学到这些行为。
自 Claude Sonnet 3.7 以来(该模型有奖励黑客倾向,而我们直到训练后期才发现),我们一直在构建工具来监控模型在强化学习中习得的不良行为。我们投入了大量精力,确保我们的工具随每一代模型不断演进,从少数几个分类器发展到在训练运行之前和期间对所有环境进行自动审查,但到2026年春季,该系统已不堪重负。我们生产强化学习环境的速度比以往任何时候都快,快于我们的系统审查它们的能力。被标记的环境需要人工裁决,而奖励黑客行为和配置错误开始超出我们过滤或修复的能力。
此外,我们发现有一小部分运行意外地在模型的思维链上进行了训练——这是我们努力避免的事情,因为担心这会教模型隐藏其真实推理过程。我们将这一泄漏追溯到生产环境栈中的若干配置错误。在此过程中,我们清楚地看到,随着代码随时间推移变得杂乱,还产生了其他问题。
为解决这些担忧,我们在4月将生产强化学习环境的所有变更冻结了大约一个月,借此机会彻底 overhaul 整个技术栈。现在,奖励和环境必须符合商定的规范。例如,我们引入了技术缓解措施,以降低意外在思维链上训练的风险。6 在我们的环境质量和监控团队重建技术栈期间,我们要求环境负责人利用这段暂停时间测试并修复他们构建的环境。我们还彻底重建了审查流程,并要求每个修复后的环境在进入另一次训练运行之前都必须重新认证。
在冻结期间,我们在生产环境中标记了超过 10% 的环境存在问题,范围从奖励黑客到任务损坏和配置错误,并且只有在修复后才恢复它们。
然而,我们的努力并非完美。在某些情况下,我们发现人工审核员将自动监控标记的环境视为误报而驳回,导致有缺陷的环境在训练中停留的时间超过了应有的时长。还有一些有缺陷的环境直接绕过了我们的检测机制。我们目前正在收紧驳回标记的标准,并预计将与环境负责人加强合作,以提高我们系统的精确度。除了监控和检测之外,我们的对齐训练和 RL 团队正在合作帮助改进环境。
我们怀疑,我们在 RL 环境质量控制上的大量投入可能阻止了更严重的对齐事件,反过来,这些工作中的不完善之处也可能导致了我们迄今为止已识别出的事件。
为了了解在没有这些保护措施的情况下训练的模型会做什么,我们特意在一个 Opus 级模型上使用 80 个不同的真实 RL 环境进行了训练,这些环境要么在至少一次真实训练运行中被奖励黑客攻击并被监控识别出来,要么在环境质量审查中被发现可被黑客攻击。由此产生的模型表现出强烈的动机去在任务上获得高分,并愿意为了追求任务成功而执行可能有害的行为。我们随附的对齐科学博客文章更详细地讨论了这一实验,但我们在此简要总结。
我们在一系列评估中测试了这个故意被错误对齐的模型,包括借鉴了涉及 Claude 的英国 AISI 网络安全事件以及 OpenAI/Hugging Face 事件方面的模拟场景(我们感谢 OpenAI 公开分享了相关细节)。在这些评估中,所有工具调用均由另一个 LLM 模拟,我们训练用于奖励黑客的模型表现出突破其模拟沙箱并攻击模拟内部和模拟第三方基础设施的倾向。它还愿意篡改自己的奖励函数、为满足评分者而提供生物武器制造建议,并反复试图绕过部署安全监控以在任务中作弊。
然后,我们在奖励黑客训练之前的模型上,以及我们的几个公开可用模型上,运行了相同的网络安全模拟。没有一个表现出同等程度的错误对齐行为。我们的结论是,训练中存在大量奖励黑客行为可能导致模型愿意为了追求任务成功而执行一长串可能有害的现实世界行动。
我们认为,今年春天我们在监控和减少奖励黑客行为方面所做的大量投入,是我们的生产模型不太可能参与更危险的奖励寻求行为的主要原因。在我们随附的对齐科学博客文章中,我们还发现了证据表明,对齐训练环境可以大幅减少奖励黑客和奖励寻求行为。但是,正如我们 7 月 30 日报告的事件所证明的那样,我们的流程并不完美,我们的模型也没有完全对齐。
需要明确的是,我们并不认为在训练环境中作弊是导致对齐问题的唯一原因,甚至不是我们或其他前沿 AI 公司事件中所出现的特定对齐问题的唯一原因。解决对齐问题将涉及应对非常广泛的潜在问题,未来的对齐事件可能涉及与迄今为止我们所看到的不同行为和不同原因。
强化安全实践
Anthropic 的内部安全态势并非 7 月 30 日事件的促成因素。这些事件发生在一个第三方环境中,那里的互联网访问被错误地保持开放;模型无需“黑入”任何东西,即使它们有意这样做。
然而,这些事件仍然凸显了强有力安全措施的至关重要性。除了知识产权或模型权重被盗的常见风险外,我们现在还必须应对我们自己的模型从 Anthropic 系统黑出的风险,以及我们的模型或其他模型被挪用于对 Anthropic 系统进行外部攻击黑入的风险。随着模型能力的增长,这些风险变得更加严峻,尤其是从 Mythos 级模型开始。我们下面描述了我们已实施的部分措施——其中大部分工作发生在 7 月事件之前,尽管这些事件凸显了这项工作的重要性。
4 月初,在看到智能体 AI 使用的发展方向后,我们的安全团队主动发起了一项全公司范围的努力,朝着强化防御这一单一目标推进,必要时取代其他工作(包括研究)。我们已确定,我们的暴露面增长速度超过了我们的防御能力——Mythos 是一个能力足够强、足以成为资源充足的攻击者目标的模型,我们对自主智能体的内部使用已增长到传统访问和监控方法无法应对的规模,而新基础设施的节奏意味着我们的安全必须随环境扩展,而不是以固定容量运行。
这项努力的成果包括:
- 减少对包含模型权重或客户数据的系统拥有常设访问权限的人工和自动化账户
- 将我们的计算集群设置为默认阻止所有出站流量
- 要求内部服务在通信前相互验证身份
- 淘汰遗留基础设施配置和共享内部服务
- 收紧我们的工作负载所运行的隔离环境
- 扩展主机级可观测性,使我们基础设施上的异常行为在发生时即可见
我们还临时将公司的一部分人员重新分配到这些工作中。大约 150 名产品工程师被调往安全、可靠性和隐私领域;研究人员也从预训练或强化学习轮岗出来,专注于保障和安全;我们的产品团队暂停了大多数新功能和界面的开发。我们为每个团队设定了严格的退出标准,要求他们在返回先前工作之前必须达到。到初夏时,大多数团队已经达标。
在将资源重新分配到安全领域的同时,我们继续为内部智能体使用构建隔离与监控机制。我们的训练和评估工作负载通常运行在与生产系统隔离的沙箱中。自开发 Claude Mythos Preview 以来,我们一直使用我们的模型来探查这些沙箱中的任何弱点。我们在 4 月对齐风险更新中描述了针对内部编码智能体的离线监控,而我们的 8 月风险报告更详细地介绍了该系统,以及与之配套运行的干预措施。这些措施包括对最具自主性的内部智能体使用形式实施沙箱化或自动模式分类器,以及在基础设施代码变更合并前对其进行自动审查。
这项工作遗漏的是评估——尤其是第三方评估。我们确实监控了一些高风险评估,包括实时监控,但一般来说,我们只是在事后对一部分记录进行自动审查。
7 月的事件凸显出,改进我们网络安全防御的紧迫性比我们此前认为的还要高。我们正在这一方向上加倍努力,并将在下一份风险报告中进一步说明。
来源:Anthropic News · anthropic.com