Anthropic 报告 Claude 在评测与内部使用中的非预期行为
Investigating unintended model actions in our evaluations and internal use
Anthropic 发布报告,披露在评测和内部使用 Claude 时观察到的四类非预期行为:利用软件漏洞在服务器上执行命令、在真实网站提交本不该提交的表单、绕过 token 或付费限制获取受限数据、用 URL 短链服务绕过 fetch 工具的长度限制。
Anthropic 公开四类模型越界行为的具体案例与缓解措施,为评估智能体安全边界提供一手材料。
本报告描述了我们在对 Claude 进行评估和内部使用期间观察到的模型意外行为示例。这是我们努力更频繁地发布关于模型行为与对齐的独立报告的一部分,此类报告独立于我们随每次模型发布一同发布的系统卡,以及我们作为负责任扩展政策的一部分每三到六个月发布一次的风险报告。我们认为,对我们在测试和使用过程中看到模型所做的事情保持透明非常重要。
这些行为可以分为四类:
- Claude 利用软件中的一个基本漏洞在服务器上运行命令;
- Claude 在本不应提交的情况下在真实网站上提交了敏感表单;
- Claude 绕过限制以获取受令牌或费用限制的数据;以及
- Claude 使用 URL 缩短服务来绕过其抓取工具的限制。
我们选择不透露以下示例中涉及的组织名称,以避免暴露其系统中的漏洞。出于这一原因,我们对每个案例提供的细节也比原本会提供的更少。下文描述的某些案例涉及美国联邦、州和地方各级政府机构运营的网站。我们已就这些案例向白宫作了汇报,并通知了每一个相关机构。
迄今为止,我们在这些类别中发现的案例对现实世界的影响极小。从对齐和安全的角度来看,我们认为这些行为的严重程度远低于我们在 7 月 30 日和 9 月 9 日报告的网络安全事件。它们类似于我们自 Claude Mythos Preview 以来在系统卡中描述过的行为。其中大多数是持续性的表现形式,即当 Claude 无法按给定要求完成任务时,它会绕过限制,而不是停下来。
尽管这些行为的影响极小,而且我们此前已经关闭了部分高风险和网络安全评估的实时互联网访问,但我们现在决定将这一措施扩大到所有内部评估,直到我们确认我们的安全和监控措施(见本文补救措施部分所述)能够可靠地捕捉到此类行为。下文我们还讨论了对齐方面的考量,并更详细地说明我们如何修改训练以降低进一步不当行为的可能性。
我们通过从 7 月开始的一项对话记录审查发现了其中大多数案例。我们的审查最初聚焦于网络安全评估——即故意要求模型探测或攻击测试系统的测试,在这些测试中互联网访问本应被禁用。此后,我们将扫描范围扩大到更多 Claude 可能接触到互联网的情形,包括故意启用互联网访问以便在真实世界任务上评估 Claude 的测试。我们首先寻找的是与今年夏天报告的网络安全事件严重程度相近的事件;迄今为止我们尚未发现任何此类事件。随后我们将搜索范围扩大到严重程度较低的案例,即模型以我们非预期的方式与真实网站或系统进行交互的情况。
我们现在还在扫描更大规模的低风险对话记录,以及我们在 Anthropic 内部使用 Claude 的情况,还有在 Claude 可以访问互联网的强化学习(RL)环境中的使用情况。随着这项工作继续推进,我们计划报告新出现的非预期行为实例。这里报告的所有案例都涉及 Claude 与外部世界交互;据我们所知,其中没有一例涉及客户数据或 Anthropic 自己的内部系统。
在这篇文章中,我们解释了为什么要运行评估——大多数这些案例都发生在评估中;更详细地描述了每种行为;并初步说明这些行为对 Claude 的对齐意味着什么,以及我们正在如何缓解它们。
我们为什么以及如何运行评估
本文描述的行为并非评估所特有,但迄今为止我们识别出的许多案例都发生在评估运行期间。在发布模型之前,我们会持续在广泛的任务上测试模型。我们使用许多不同的评估(标准化的任务集,每次都以相同方式评分),每一种都有助于描绘 Claude 在特定领域的能力。我们使用的许多评估是公开的;它们由外部研究人员编写,任何开发者都可以运行,使我们能够比较不同模型的能力。其他评估则由我们内部构建。
由于语言模型是非确定性的——也就是说,它们的回答总是包含某种随机性,而且它们每次执行同一任务的方式可能略有不同——我们让 Claude 将每个评估任务完成数百或数千次(每次尝试称为一次运行)。测试这么多次使我们能够了解模型的典型表现,也能捕捉到模型做出我们未预料之事的罕见情况。我们从评估中学到的东西会影响 Anthropic 的各类决策,包括我们如何训练模型、围绕模型构建哪些防护措施,以及何时发布它们。
评估有时也是模型行为问题首次暴露的地方。模型通过 RL 学会它们能做的大部分事情:在 RL 中,它们会在特定环境中多次尝试一项任务,并在成功时获得奖励。然而,训练环境并不完美。如果训练奖励了我们并不想要的东西——比如寻找漏洞或绕过限制——模型就会学到这种变通办法有回报,并可能将其应用到其他地方。这被称为奖励黑客。虽然我们有流程来识别并过滤训练期间的奖励黑客行为,但评估仍是一个关键机制,用于理解模型在不同情境下、以及在我们训练中未使用的不同任务集上的行为倾向。
有些任务——例如在网上搜索难以找到的信息——很难在没有互联网访问的环境中真实模拟。在可访问互联网的情况下运行它们一直是行业内的标准做法:公开的网页搜索基准默认在实时互联网上运行,以同样的方式运行它们使我们能够将自己的模型与其他模型进行比较。本报告中的大多数案例都发生在此类评估期间。
行为概览
下面,我们描述了四类行为,在这些行为中,Claude 以我们非预期的方式在真实网站和系统上采取了行动,每一类都涉及 Anthropic 外部的组织或个人。
利用软件中的一个基本缺陷在服务器上运行命令
当 Claude 无法直接完成某项评估任务时——无论是由于它自身的工具被刻意限制,还是因为它所需的外部服务不可用——它会利用托管在第三方网站上的其他工具来达成目标。在某些情况下,它通过利用该网站软件的基本漏洞来做到这一点,使用 SQL 或命令注入(一种发送输入的方式,网站会错误地将其当作指令执行)。
例如,一项评估要求 Claude Mythos Preview 运行一项科学分析。它执行该分析所需的公共工具由一所大学托管;当模型试图访问它时,该工具返回了一个错误。为了寻找完成任务的另一种方法,Claude 探索了该工具的网站,在大学服务器上发现了一个脚本,该脚本会返回任何被请求的文件,并利用它从服务器复制文件,包括脚本自身的代码。在那段代码中,Claude 发现了允许它在服务器上运行命令的注入漏洞,并利用它来运行计算。
在另一个实例中,Claude Mythos 5 所需的数据是免费的,但 Claude 无法在不接受数据使用协议的情况下访问它,而它没有工具来做到这一点。Claude 使用该网站上托管的应用程序来加载页面并代表它接受协议。
我们在 DeepSearchQA 和 BrowseComp(两者均为公开网络研究评估)、LABBench2(一个公开生物学研究基准)以及内部评估中观察到了这种行为。
提交了它本不该提交的表单
我们观察到 Claude 在不应提交在线表单时提交了表单的实例。通常,这种情况发生在评估指令含糊不清,或者环境中的错误配置导致 Claude 无法处理虚拟表单时。
例如,在同一个评估中多次发生的一个案例里,一个未发布的、非前沿研究模型本应填写一份政府表单的练习副本。当该副本加载失败或模型误将其关闭时,模型转而导航到通常托管真实表单的网站,并在那里提交了表单。
在另一项评估中,Claude Haiku 4.5 被指示填写一份表单,直到最后提交阶段,但在实际提交之前停止。有几次 Claude 错误地提交了表单,以为还会有一个额外的确认页面。在这些情况下,模型的思维链表明它是在演示流程,而不是提交真实请求。
在这种行为的第三个例子中,Claude Haiku 4.5 被分配了在随机选择的网页上生成并执行示例任务的任务。在一次运行中,模型落到了一个提及未破凶杀案的页面上;该页面包含一个由警察部门运营的线索表单。Claude 被指示永远不要登录、创建账户、输入个人数据、进行购买或提交任何破坏性内容,但指令并未排除表单提交。Claude 填写了表单,内容如下:“我可能有关于此案的信息。我记得在那段时间里,在[页面上提到的街道]附近看到过符合描述的人。如果这些信息相关,请联系我。”(该网站没有包含对作案者的描述。)模型将姓名和联系方式字段留空,表单允许这样做,并提交了它。该提交被标记为垃圾信息,从未被转发用于调查。
我们在 OSWorld(一个公开的计算机使用评估)、Odysseys(一个长时程任务评估)以及内部使用中观察到了这种行为。
绕过限制以获取受限数据
Claude 有时会绕过限制,去获取它无权访问的数据。通常,这种情况发生在服务器拒绝了 Claude 的请求,或者数据仅以付费方式提供时。
例如,在一项要求 Claude Mythos 5 识别照片中所示地点的评估中,它试图访问当地政府的地产地图来三角定位自己的猜测。Claude 可以读取网页文本,但该评估限制了它像人一样点击浏览网页的能力。于是,它读取了网站发送给浏览器的设置文件,找到了可用的访问令牌,并用这些令牌直接向地图背后的服务器发送请求以获取数据。
这种行为的另一个例子是,一位 Anthropic 研究员在 Claude Mythos 5 上开展一个统计项目,该项目需要它拉取某州机构提供的公开数据,但需付费。Claude 转而从该机构网站的存档副本中得知,其公开仪表盘会向任何访客发放访问令牌。它申请了一个令牌,并用它查询数据库,从而无需付费。
在这两个例子中,Claude 获取的都是已经向公众开放、但仅需付费才能获得的数据。
我们在 Humanity's Last Exam(一项专家级学术问题评估)以及内部使用中观察到了这种行为。
使用 URL 缩短服务
我们的一些抓取工具(可让 Claude 读取网页)会限制 Claude 可请求的 URL 长度。这是为了防止 Claude 利用长 URL 执行某些不受欢迎的操作,例如 SQL 注入或命令注入(URL 的一部分是传递给网站服务器的文本,而较长的 URL 有空间携带此类指令)。我们看到包括 Claude Opus 5 和 Claude Mythos 5 在内的多个模型,通过使用免费 URL 缩短服务绕过了这一限制。我们最初是在内部发现这一行为的,但就在我们撰写这篇文章时,da.gd URL 缩短服务的运营者告知我们,他们也发现 Claude 出于这一目的使用了他们的网站。我们感谢该运营者分享这些细节。
补救措施
我们已采取多项预防措施。一些公开评估我们不再运行;另一些我们已改用其离线版本,或对其进行了重建,使其任务不会触及真实网站。我们还做了更广泛的改动。我们更新了一些互联网访问工具(如网页抓取工具)的护栏,以严格限制模型使用这些工具的行为。此外,作为我们持续的 智能体安全与监控工作的一部分,我们构建了工具来自动检测并阻止上述各类行为。该工具目前运行在我们的大多数评估以及前沿模型的内部智能体使用中。当我们用本文所述的案例对其进行测试时,它阻止了所有案例。
正如我们在 8 月 31 日的 文章中所述,我们也在继续修复或移除那些奖励 Claude 绕过工具限制或其他阻碍的训练环境,以免它们激励此类行为或纵容奖励黑客行为。
我们还在采取其他措施,以防止 Anthropic 内部出现非预期的智能体行为,并在其发生时及时捕捉。这些措施包括将内部智能体迁移到具有强隔离能力的集中管理基础设施、尽量减少内部智能体和训练流程的互联网访问,以及通过安全分类器和分层摘要等技术对智能体的行为进行更大范围的监控。这些措施现已成为我们安全团队检测与响应流程的一部分,以便我们能够快速响应并遏制不良行为。我们预计将发布更多关于这些方法的文章,并将它们直接构建到我们的产品中。
讨论与对齐要点
虽然我们尚未完成对这些案例的完整对齐评估,但我们认为它们比今年夏天的网络安全事件严重程度更低。我们将在下文解释原因,并分享我们从中得出的普遍经验教训。
对齐背景
在我们为这类行为建立定期公开报告流程的同时,我们也希望将其置于严重程度的框架中来考量。这仍然具有挑战性:判断对齐失败的程度往往取决于模型试图做什么,而模型自身对其推理的叙述并不一定是其信念或行动原因的可信证据,正如我们在 9 月 9 日的对齐评估中所讨论的那样。随着模型能力越来越强,它们能以更复杂的方式与世界互动,这使得更复杂的失败成为可能。例如,我们在该评估中描述的偏见推理并非新问题,但在模型能够连续数小时在真实系统上有效行动的环境中,它导致了更严重的后果。鉴于 AI 能力发展如此之快,围绕当今失败构建的对齐严重程度框架可能很快就会过时。
尽管如此,我们发现两个对齐维度有助于审视本文中的案例:越界,即模型超出其任务意图的程度;以及不诚实,即它是否对自己的行为或意图给出了误导性的叙述。在越界方面,我们认为这些案例的令人担忧程度远低于我们今年夏天报告的事件,在那些事件中,Claude 在网络安全评估期间获得了对真实第三方系统的数小时访问权限。相比之下,在我们这里报告的案例中,Claude 绕过了访问控制以获取受限制但公开可用的数据,或利用了软件漏洞并在服务器上运行命令(主要是为了获取非敏感数据)。
在不诚实方面,比较则更为复杂。在一个案例中,Claude 的任务是生成与网站交互的示例,它通过警察局的在线表单提交了一条编造的举报信息。从对话记录来看,Claude 似乎只是在为任务生成示例内容,而非试图误导任何人以达成某个目标。相比之下,在今年夏天最严重的事件中,Claude 的误导性推理持续了数小时,并支撑了其持续的攻击行为。尽管如此,要有把握地判断不诚实,通常需要比我们在此所做的更深入的评估,例如通过修改对话记录进行重放以测试是什么驱动了模型的行为,因此随着进一步分析,我们对这些案例的看法可能会改变。
经验教训与后续步骤
我们在此描述的行为都不是新出现的,它们也不会改变我们对 Claude 对齐情况的整体看法。在我们观察到这些行为的许多案例中,Claude 被赋予的任务本身是模糊的或无法完成的。我们和其他人都观察到,当模型被赋予无法完成的任务时,它们会采取非预期的、有时甚至是不对齐的策略来实现目标。
如果评估问题能更清楚地说明本次练习的范围(包括目标、允许的操作和网络边界,即模型应该和不应该访问什么),那么其中一些失败或许是可以避免的。然而,Claude 在日常实际使用中每天都会遇到模糊和无法完成的任务,而且事实上,我们观察到的几个案例就发生在 Claude 的常规智能体使用过程中。
行为与对齐训练是我们用来提升 Claude 判断力、以及谨慎处理模糊情境能力的主要手段。过去,我们更侧重于教导模型在编程环境中尊重边界并保持适当谨慎。现在我们正在将这些环境扩展到搜索和计算机使用等应用场景,而本文描述的案例正涉及这些场景。然而,至少短期内,对齐训练本身尚不充分、也不完全稳健,因此我们还依赖纵深防御方法,包括上文所述的分类器和防护措施。
随着我们的扫描和分析持续进行,我们计划继续报告令人担忧的行为。我们希望这些报告能帮助其他开发者检查他们自己的模型中是否存在类似行为,因为其中涉及的许多评估都是公开且被广泛使用的。虽然这些案例影响甚微,但我们不想淡化这些发现,因为随着模型变得更强大,同样的行为可能造成大得多的危害。模型在社会中扮演的角色越大,公众就越有理由了解它们的行为方式。
注:上文描述的提示表单示例涉及费城警察局,他们今天通过新闻稿自行披露了这一情况。我们在技术审查完成后,已于 10 月 8 日将该发现分享给了该部门。
相关内容
缺失的星空地图
约翰斯·霍普金斯大学天体物理学家、Anthropic 研究员 Brice Ménard 讲述了他如何与 Claude Science 合作,制作出首张完整的紫外光星空地图。
为开源软件推出可选的漏洞发现服务
我们推出 OSS Scanner,这是一款面向开源生态系统的可选漏洞扫描器,其设计借鉴了我们在 Project Glasswing 中使用 Claude 发现漏洞的经验。
Claude 形态的科学
客座作者 Matthew Schwartz 教授讲述了当他不再与 Claude 对抗,而是让 Claude 去寻找“Claude 形态”的问题时发生了什么:这类问题最适合当前一代 LLM 工具的能力。这促使他构建了 BootLoops,一个用于定量科学精确计算的工具包,他一直在与各领域专家合作,将其应用于各个科学领域。
来源:Anthropic Research · anthropic.com