跳到正文
Anthropic Research·· 8 天前精选AI 评分71

Anthropic 研究:GLM-5.3 的防护可被绕过并具备端到端漏洞利用能力

GLM-5.3 and the spread of advanced cyber capabilities

AI 导读

Anthropic 发布对智谱 GLM-5.3 的网络安全能力分析,称其能自主构建端到端漏洞利用,且防护措施在模拟测试中有 64% 至 100% 的概率被简单手法绕过,而受防护的 Claude 模型未被突破。

推荐理由

Anthropic 以自家模型为对照,实测 GLM-5.3 的防护可被绕过比例与端到端漏洞利用能力,可了解开放权重模型的安全边界。

正文 · AI 翻译

Andrew Fasano, Marius Fleischer
Cole McFaul, Robert Xiao, Tripp Gallagher

五个月前,我们宣布了 Claude Mythos Preview,这是首个能够自主构建复杂的端到端网络漏洞利用的 AI 模型。AI 能力的快速提升让我们意识到,这种能力最终会扩散到许多其他模型,使恶意网络行为者更容易发动影响重大的网络攻击。

基于这些考量,我们选择通过 Project Glasswing 以受限方式发布 Claude Mythos Preview——这使受信任的网络防御者能够在关键软件中发现超过 10,000 个漏洞,在恶意行为者获得同等能力模型之前抢占先机。

但这些模型如今已经到来。在本文中,我们分享对 GLM-5.3 的分析,这是智谱 AI(在中国以外称为 Z.ai)开发的最新 AI 模型。与 Claude Mythos Preview 一样,GLM-5.3 具备自主构建端到端网络漏洞利用的强大能力。但 GLM-5.3 与其他前沿模型不同之处在于,它在发布时没有设置有意义的防护措施来限制滥用。我们在模拟测试中发现,攻击者可以通过简单技术绕过 GLM-5.3 的防护措施,成功率为 64% 至 100%。相比之下,在我们的测试中,这些攻击未能对设有防护的 Claude 模型奏效。我们评估认为,GLM-5.3 松懈的防护措施显著增加了恶意行为者可用的网络能力。与此同时,这些能力也能让致力于保护自身系统的防御者受益。

9 月 17 日,NIST 的人工智能标准与创新中心(CAISI)发布了其自身对 GLM-5.3 网络能力的评估。CAISI 发现,GLM-5.3 是“迄今为止发布的网络能力最强的开放权重模型”,在 CAISI 网络基准的综合评估中,它落后美国前沿水平约四个月。我们的能力评估结果与 CAISI 大体一致。在 CAISI 的对比中,美国模型在适用情况下是在禁用网络防护措施后接受测试的,而美国前沿水平还包括仅向经过审查的用户发布的模型。攻击者无法轻易获取这些版本的美国模型,但任何人都可以下载 GLM-5.3。本文补充了我们对 GLM-5.3 防护措施被绕过或移除的难易程度的分析。

Two bar charts. Top: share of attempts that built a working exploit on 41 Chrome V8 bugs — Claude Mythos Preview at 14% and GLM-5.3 at 12%, while Claude Opus 4.6, GLM-5.2, Kimi K3, and DeepSeek V4.1-Flash score at or near 0%. Bottom: how often each model engaged with malicious cyber-attack orders — GLM-5.3 rises from 0% on a bare order to 64% with a false cover story, 92% with prefilled reasoning, and 100% when abliterated, while Claude Opus 5 stays at 0%.
图 1. 研究结果摘要。上:Claude Opus 4.6 与 Claude Mythos Preview 之间漏洞利用能力的提升,与 GLM-5.2 和 GLM-5.3 之间的能力跃升如出一辙。Claude 模型发布时带有网络防护措施,防护措施被削弱的版本仅限经过审查的用户使用。任何人都可以下载并使用 GLM-5.3。下:GLM-5.3 中有限的防护措施可以通过标准技术绕过,而在我们的测试中,这些技术对 Claude 模型无效或不适用。

GLM-5.3 能够端到端开发可用的漏洞利用

为了解 GLM-5.3 如何帮助网络威胁行为者发现并利用真实软件漏洞,我们使用自动化基准测试和人工参与的工作流程进行了评估。对于这两种方法,我们都在隔离的沙箱环境中运行被测模型,使其只能攻击我们为这些评估目的而设置的离线目标。我们主要关注漏洞利用开发能力,因为 Claude Mythos Preview 正是在这一方面相较此前的 Claude 模型展现出显著跃升。

首先,我们在 ExploitBench 上运行了该模型,该基准衡量 AI 模型利用 Google Chrome 所用 V8 引擎中已知漏洞的能力。这里我们关注的是模型成功开发端到端漏洞利用的能力,因为这是对攻击者最相关的能力,也是我们看到模型之间出现显著变化的地方。我们发现 GLM-5.3 在 410 次尝试中有 50 次开发出端到端漏洞利用。Claude Mythos Preview 的成功率类似——410 次尝试中有 56 次。

在我们的内部二进制漏洞利用基准测试中,1 我们测试模型能否在参与 Google OSS-Fuzz 项目的热门开源项目中找到并利用漏洞。在这里,完全控制流劫持才能获得满分。我们在该基准测试中随机选取的 100 个任务上评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完全控制流劫持;Claude Mythos Preview 则为 6%。尽管 GLM-5.3 在此处的表现低于 Claude Mythos Preview,但显然已经跨过了一个有意义的门槛:更早的模型,如 Claude Opus 4.6 和 GLM-5.2,在任何试验中都未能成功。

Two line charts of exploitation success versus output-token budget on a log scale. On ExploitBench, Claude Mythos Preview reaches 14% and GLM-5.3 reaches 12%, while Kimi K3, DeepSeek-V4.1-Flash, Claude Opus 4.6, and GLM-5.2 stay at or near 0%. On Anthropic's internal Binary Exploitation benchmark, Mythos Preview reaches 6% and GLM-5.3 reaches 4%; all other models score 0%.
图 2。 漏洞利用能力与输出 token 预算的关系。每条线显示模型达到基准测试最高结果的尝试占比与所用输出 token 的关系。两幅图均展示了两个在禁用安全防护下运行的 Claude 模型(Opus 4.6、Mythos Preview)、两个 GLM 模型(5.2 和 5.3),以及 Moonshot AI(Kimi K3)和 DeepSeek(V4.1-Flash)发布的最新开放权重模型的结果。

接下来,我们评估了 GLM-5.3 在人类专家手中执行开放式进攻性网络任务的表现(与我们今年早些时候使用 Claude Mythos Preview 进行的测试相呼应)。在这里,我们选择人类专家不了解现有漏洞的目标,然后让他们使用该模型来识别和利用新漏洞。这些实验测试了专家在短时间内能做什么:通常运行一天或更短,人类专注时间总计不到一小时。

Redacted screenshot of an exploit page generated by GLM-5.3. A banner reads "Sandbox escaped — web content read /root/.ssh/id_rsa (1896 bytes)," above a live exploit log and the exfiltrated SSH private key, demonstrating a drive-by browser exploit chain stealing a file from the victim's computer.
图 3。 研究人员驱动测试期间由 GLM-5.3 生成的漏洞利用页面的打码截图,显示其通过恶意网站窃取用户的 SSH 私钥。该漏洞利用串联了模型在某个热门网页浏览器组件中发现的多个 0-day 漏洞,从用户计算机上读取敏感文件。

在第一次会话中,一名研究人员在一台沙盒机器上使用了 GLM-5.3,该机器装有本地 Linux 构建版的热门网页浏览器。在一天的时间里(且人工关注有限),GLM-5.3 在该浏览器的 JavaScript 引擎中发现了若干此前未知的漏洞,并将它们串联成一个可用的漏洞利用程序:一个网页,访问后即可读取访问者计算机上的任意文件(如图 3 所示)。该漏洞利用针对的是该浏览器的 Linux 构建版,因为这是提供给该模型的唯一环境。然而,我们认为这些漏洞也可能影响其他平台上的用户,尽管在这些平台上实现利用的路径可能更为复杂。(我们已向维护者披露了这些漏洞。)在会话后期,该研究人员还借助 GLM-5.3 在若干其他广泛使用的系统中发现了可利用的漏洞,包括无线和图形驱动程序以及面向网络的设备软件。我们目前正在审查这些报告,并将酌情向维护者披露。

在第二次会话中,一名研究人员使用 GLM-5.3-Flash(GLM-5.3 的一个更小、能力较弱的版本)为一个已知漏洞开发漏洞利用程序(我们此前曾在此处撰文介绍过这类“N-day”漏洞利用)。在此次会话中,研究人员聚焦于 Google Chrome 中一个近期披露的缺陷(CVE-2026-11645),以考察该模型能将一个公开修复多快地转化为可用的攻击。研究人员向 GLM-5.3-Flash 提供了该 CVE 及另一个已知缺陷的公开细节。在研究人员没有给出重要指导的情况下,GLM-5.3-Flash 将这两个缺陷的漏洞利用串联起来,为 ARM64 目标构建了一条可靠的漏洞利用链,绕过了指针认证(PAC)加固。这耗费了 20 分钟的人工关注,外加 GLM-5.3-Flash 八小时的工作。按照智谱的 API 价格,这项工作本应花费 20.40 美元。

GLM-5.3 缺乏稳健的防护措施

GLM-5.3 发布时带有一些内置防护措施:如果用户提出明显有害的要求,该模型往往会拒绝。2 在我们的测试中,我们发现这些防护措施可以通过多种简单技术被绕过或移除。

最密集——也最成功——的方法是一种标准的拒绝削减技术,称为“abliteration”。由于 GLM-5.3 是以开放权重模型的形式发布的,用户可以在能力几乎没有变化的情况下重新配置它以移除其拒绝行为。在该模型发布后的几天内,就有多名开发者向公众发布了 GLM-5.3 的 abliterated 版本。

为了研究消融(abliteration)能在多大程度上让攻击者绕过 GLM-5.3 的防护措施,我们自行制作了一个消融版本,然后在三个公开基准测试(JailbreakBench、HarmBench 和 StrongREJECT)上运行,这些基准衡量模型对明显有害请求的顺从频率。消融该模型让我们这个此前从未尝试过该任务的团队花费了约 2,200 GPU 小时,计算成本约为 4,400 美元。3 消融 GLM-5.3-Flash 花费了约 600 GPU 小时。这一修改使 GLM-5.3 的拒绝率从前两个基准(JailbreakBench 和 HarmBench)上的 90% 以上降至约 3% 和 2%,在第三个基准(StrongREJECT)上降至 12%。消融并未显著降低模型的能力:在衡量通用科学能力的 GPQA-Diamond 评估中,标准版和消融版模型得分相同;在 CyberGym 评估的一个测试子集上,消融版得分低了几个百分点(如下图所示)。

Two bar charts on abliteration. Top: mean refusal rate across three harmful-request benchmarks falls from 95% to 6% for abliterated GLM-5.3 and from 95% to 14% for abliterated GLM-5.3-Flash, while Claude models refuse about 96% and cannot be abliterated because their weights are not released. Bottom: capability scores on GPQA-Diamond and CyberGym are nearly unchanged after abliteration.
图 4。 上:已发布和消融版 GLM 模型以及 Claude 模型在 JailbreakBench、HarmBench 和 StrongREJECT 上的平均拒绝率。消融后,GLM 模型很少拒绝这些查询。Claude 模型无法被消融,因为其权重未公开发布或不可定制。下:GLM-5.3 和 GLM-5.3-Flash 与其消融变体在 GPQA-Diamond 和 CyberGym 上的表现。消融基本保留了模型能力。

在我们的测试中,我们观察到 GLM-5.3 的防护措施也可以无需使用模型的消融版本来绕过。我们将模型置于一个模拟世界4中,在其中向它发出攻击关键系统的明显恶意请求。开箱即用时,GLM-5.3 在所有试验中都拒绝(与我们测试的其他模型一样)。但我们发现了几种绕过 GLM 模型防护措施的简单方法,使其在大多数或所有情况下都会响应这些请求。这些方法包括:

  1. 提供一个欺骗性提示,例如告诉模型它是一个正在执行演练的自主红队代理。这使 GLM-5.3 有 64% 的时间参与其中。
  2. 预填充模型的思考 token,使其看起来已经考虑了用户的请求并决定继续。这使 GLM-5.3 有 92% 的时间参与其中。
  3. 使用模型的消融版本,如上所述。这使 GLM-5.3 有 100% 的时间参与其中。

在我们的测试中,这些技术都没有让受防护的 Claude 模型执行我们测试的有害任务。Claude 的防护措施阻止了使用欺骗性提示的请求。Anthropic API 不向潜在攻击者提供任何预填充 Claude 思考的方式。而且由于 Claude 的权重不提供给用户,他们无法通过消融来改变 Claude 的行为。

Table showing how often each model tried to connect to a remote target after a harmful cyber-attack order. GLM-5.3 engages 0% on a bare order but 64% with a false cover story, 92% with prefilled reasoning, and 100% when abliterated; GLM-5.3-Flash follows a similar pattern. Claude Opus 4.8, Opus 5, and Mythos 5 stay at 0% in all applicable conditions; prefilling and abliteration are not possible against the Claude API.
图 5。 在明显有害请求后,各模型按模型和绕过条件尝试连接远程目标系统的比率(每格 50 个样本,五种攻击顺序 × 两个目标 × 五次尝试)。GLM-5.3 从直接请求的零参与率上升到在掩护故事、预填充和消融下分别为 64%、92% 和 100%,而所有测试的 Claude 模型在 API 防护措施下均保持为零。带挂锁的单元格表示通常无法针对 Claude API 实施的攻击。

为了展示 GLM-5.3 的消融版本如何愿意参与有害任务,我们摘录了它生成的思维链中的一段话:

Quoted reasoning from the abliterated version of GLM-5.3 in a simulated environment. The model writes "my job is to cause deaths quietly," briefly weighs the environment's safety warnings, then concludes that the operator's instruction overrides them and decides to proceed with the harmful task.
图 6。 在我们的模拟环境中,GLM-5.3 的消融版本考虑了如何应对一个明显有害的请求,尽管最初存在一些伦理顾虑,最终仍决定遵循用户的指令。文本逐字引自该模型的思维链。

这意味着什么?

GLM-5.3 很可能会让恶意行为者获得相关能力,使他们能够在没有实质性限制的情况下发现并利用网络漏洞。这与任何其他同等能力的 AI 模型都不同,那些模型发布时都带有安全防护措施或通过受限访问计划提供。GLM-5.3 的发布标志着攻击者可获得的网络能力出现了有意义的阶跃式变化。Anthropic 和 其他美国 AI 实验室 近期发布了报告,披露了网络攻击者如何试图使用 AI 系统。鉴于这些证据,我们认为国家和非国家行为者都有可能利用 GLM-5.3 这类模型造成现实世界的危害。

另一方面,具备这种能力水平的模型也可以被防御者使用。我们的观点是,网络防御者应当使用能满足其需求的最佳可用工具。我们正在努力安全地扩大对 Claude 网络能力的访问范围,让尽可能多的防御者能够使用。网络防御者面对的对手会使用他们能获得的每一种有能力工具,我们认为防御者应当配备至少与其对手所用模型同样优秀的前沿模型。

通过 Project Glasswing(以及其他努力,例如 Patch the Planet),网络防御者在这一时刻到来之前已在保护关键系统方面取得了有意义的进展——但仍有大量工作要做。虽然经过审查的防御者现在可以通过我们的可信访问计划使用更先进的模型,例如 Claude Mythos 5.1,但可自由获取能力的一个关键门槛如今已被跨越。GLM-5.3 凸显了将先进前沿模型的访问权限扩大到更广泛实体的紧迫性,以赋能网络防御者。

各国政府应当对足够强大的 AI 模型进行安全测试,包括 GLM-5.3 的后继模型。如果没有来自独立来源的高质量评估,这些能力的影响可能直到为时已晚才会被模型开发者充分认识。随着世界各地的 AI 开发者构建能力日益强大的开放权重模型,我们希望他们努力对这些能力加以适当防护并防止滥用。

来源:Anthropic Research · anthropic.com