跳到正文
Anthropic News·· 2026-06-30精选AI 评分78

Anthropic 恢复 Claude Fable 5 与 Mythos 5 访问,并公布越狱分级框架

Redeploying Fable 5

AI 导读

Anthropic 宣布美国政府对 Claude Fable 5 和 Mythos 5 的出口管制已于 6 月 30 日解除,Fable 5 将于 7 月 1 日起面向全球用户在 Claude Platform。

推荐理由

Anthropic 官方复盘出口管制暂停与恢复全过程,并给出与政府协作及行业越狱分级框架的细节。

正文 · AI 翻译
  • 更新

    Claude Fable 5 和 Mythos 5 重新部署

    2026年7月1日

    Claude Fable 5 和 Mythos 5 的访问权限现已恢复。

6月12日星期五,美国政府对我们的最新模型 Claude Fable 5 和 Claude Mythos 5 实施了出口管制。这要求我们限制外国公民的访问,无论其身处美国境内还是境外。由于该命令立即生效,而我们没有可靠的方式实时核实国籍,我们暂停了所有用户对这两个模型的访问。

截至今天,6月30日,对 Fable 5 和 Mythos 5 的出口管制已被解除。

Fable 5 将从明天,即7月1日星期三起,面向全球用户在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上提供。对于 Pro、Max、Team 和部分 Enterprise 套餐,1 Fable 5 将在7月7日之前包含在每周使用限额的50%以内,此后将通过使用额度提供。我们将尽快在 AWS、Google Cloud 和 Microsoft Foundry 上重新启用访问。

在美国政府于6月26日批准后,我们还恢复了一组美国组织对 Mythos 5 的访问。我们将继续与政府协调,以扩大 Glasswing 计划中更广泛的国内和国际合作伙伴的访问权限。

在本文的剩余部分,我们将从四个方面提供更多细节和更新:

  1. 事件时间线,包括我们对保障措施所做的更新。我们讨论导致出口管制指令的事件,以及我们如何通过新的保障措施加以应对。
  2. 我们对保障措施的总体方针。我们提供更多背景信息,说明我们如何使用安全分类器来检测对我们模型可能危险的网络安全用途。
  3. 一个共享的行业框架。尽管我们已经达成了建设性的解决方案,但这些事件清楚地表明,行业需要一种一致的方式来评估和修复 AI 模型潜在的“越狱”(绕过模型保障措施的技术)。2 一个用于判断特定越狱严重程度的共享标准,将有助于 AI 开发者对新发现进行分诊、以更高的安全性发布高能力模型,并向政府和行业合作伙伴一致地传达风险水平。我们已与 Amazon、Microsoft、Google 及其他 Glasswing 合作伙伴一起开始制定这样一个框架,并在下文中概述。
  4. 更深入的政府合作。我们还在加强与美国政府在新的发布前测试、信息共享和研究合作方面的协作。我们将在最后一节描述这一更深入的合作。

时间线与保障措施更新

我们于6月9日星期二发布了 Fable 5 和 Mythos 5。它们共享相同的底层模型,但 Fable 5 发布时带有强大的保障措施,使其更适合一般用途。Mythos 5 的保障措施较少,仅向少数受信任的 Project Glasswing 合作伙伴发布,用于防御性网络安全。

6月12日的出口管制指令出台之前,政府已获悉一份报告,其中亚马逊的研究人员发现了一种绕过 Fable 5 安全防护的方法:通过提示使其识别出若干软件漏洞。在其中一例中,该模型生成了代码,演示了相关漏洞如何被利用。过去两周,我们与政府及其他合作伙伴(包括亚马逊)密切合作,审查了该报告和证据。

我们的测试证实,许多能力较弱的模型——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7——都能识别出报告中 Fable 5 所识别的相同漏洞。而在演示如何利用那一个漏洞时,我们测试的每一个模型都能给出与 Fable 5 相同的演示(包括 Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5 和 Kimi K2.7)。

重要的是,所报告的技术并未暴露出任何 Mythos 级别的独特网络能力。该行为反映的是 Fable 5 安全防护的一个边界案例——正如我们将在下文解释的,有些任务不太可能具有危险性,但出于高度谨慎仍被安全防护所拦截。所报告的技术使得可以访问其中一种此类行为,但它只涉及常规的防御性网络安全工作。

即便如此,我们还是迅速采取行动来处理所报告的绕过问题。我们与政府密切合作,训练了一个改进的安全分类器,用于针对并拦截报告中描述的行为。如果对 Fable 5 的请求被拦截,用户将收到通知,该请求将被转而发送给 Opus 4.8。

新的分类器意味着亚马逊报告中描述的具体技术在超过 99% 的情况下会被拦截。在极少数情况下,模型可能提供的信息不够详细,不足以帮助网络攻击者。如下文所述,该模型的安全防护预计不会拦截所有低风险的常规网络防御能力——只会拦截那些可能有害的能力。美国商务部人工智能标准与创新中心(CAISI)的研究人员测试了我们此前和新的安全防护,并一致认为它们极其强大。

新的分类器也带来了代价:在常规编码和调试任务中,良性请求被标记的频率更高。与我们的所有安全防护一样,我们将继续改进这一点,以更好地区分真正的滥用与合法请求,并减少误报。


我们的网络安全防护方法

Claude Mythos 5 可用于发现和利用软件漏洞,其效果超过任何其他模型——也超过除最熟练的人类安全专家之外的所有人。这些惊人的网络安全能力使其对希望将其滥用于网络攻击的恶意行为者具有独特的吸引力。

然而,Claude Fable 5 并不提供此类独特的攻击能力。 这是因为我们在发布它时应用了我们有史以来对模型施加的最强安全防护。在发布前的一个月里,我们从 Anthropic 内部各团队调配人员,使研究这一问题的研究人员和工程师人数翻了一番。

Fable 5 发布时配备了多种安全机制,每一种单独都无法提供完美的防御,但结合起来便使模型极难被滥用(这种方法被称为“纵深防御”)。有些防御措施涉及训练模型拒绝协助危险请求;另一些则涉及对滥用模式进行回溯分析。

一项特别重要的安全机制涉及分类器——即较小的自动化 AI 系统,它们在交互过程中检测模型何时被要求执行可能有害的网络安全任务(或产生可能有害的输出)。当这种情况发生时,分类器会阻止模型响应请求。这些分类器的最终目标是防止模型从事特别危险的行为。

与所有安全机制一样,分类器也会犯错。它们有时未能注意到潜在危险内容,在某些情况下还可能被故意“越狱”:用户可以用不寻常的方式提示模型,以欺骗分类器,让模型产生本应被系统阻止的有害输出。

因此,我们有意将安全分类器设置为对一组我们知道很可能是良性的请求也触发。这种“安全边际”方法意味着,一个请求必须看起来非常明确地安全,才能避免触发分类器(见下图中的 A 行)。用户感受到的安全边际,就是模型拒绝响应一些合理、无害的请求。

对于 Fable 5,我们让这一安全边际比以往任何一次发布都大得多(B 行),这意味着更多良性请求会被阻止。我们明白这类误报会让用户感到沮丧,但为了广泛提供模型的其他能力,我们做出了这一权衡。

我们的网络安全安全分类器示意图。
当向模型发出请求时,分类器会检测该请求是良性的(并允许),还是可能有害的(并阻止)。分类器会阻止模糊请求(那些明显与网络安全有关、但可能出于防御目的的请求,例如查找安全漏洞)以及有害请求(那些明显危险的请求,例如构建一条软件漏洞利用链的请求)。如 A 行所示,我们还加入了一个“安全边际”,分类器会阻止那些可能良性但有小概率有害的请求。这增强了我们的信心,即所有有害请求都会被阻止。对于 Fable 5(B 行),我们把安全边际设得更大,这意味着更多良性请求会被阻止——但真正有害的请求会更少被漏掉。“Vulns” = 漏洞。

安全边际也有助于缓解越狱。许多越狱是狭窄的:它们只解除某个非常具体的模型行为限制,仅此而已。在某些情况下,假设有用户能以轻微方式越狱模型并侵入安全边际(有时甚至进入模糊有害行为),但无法触及我们旨在阻止的核心有害行为(见下方 C 行)。我们认为,迄今为止报道的 Fable 5 越狱都属于这一轻微类别。

更严重的越狱会解锁更多有害行为。狭义的越狱(D 行)可以诱发某些特定的有害行为。这类越狱通常严重程度为低到中等,因为其狭窄性限制了攻击者。最令人担忧的类别是通用越狱(E 行),它能解锁广泛的有害行为。

越狱如何与我们的安全分类器交互。
对于轻微越狱(C 行),分类器不会阻止该请求,但该请求仍处于我们的安全边际之内(因此极不可能有害)。在狭义有害越狱(D 行)中,提示词突破了分类器,并解锁了模型中的某一特定有害行为。在通用越狱(E 行)中,一个提示词就能解锁一整类有害行为。

正如我们在发布 Fable 5 时所指出的,要让任何 AI 模型完全抵御(即不受影响)越狱,很可能是不可能的。3 我们预计,针对我们的模型会发现一些越狱,且其严重程度各不相同:会有许多轻微越狱,一些狭义有害越狱,而尽管在撰写本文时尚未发现针对 Fable 5 的通用越狱,专家安全研究人员仍在持续对其进行红队测试。我们力求确保我们和我们的安全合作伙伴能率先发现重大越狱,并在恶意行为者利用它们造成危害之前将其修复。

上述谨慎做法意味着,绝大多数越狱都无法成功解锁危险行为。我们的分类器使成功的越狱成本极高、难度极大,而且即使越狱成功,我们的额外防御层也会提供进一步的缓解。随着我们对新型越狱技术了解得更多,我们将继续更新分类器。

越狱的行业共识框架

目前,AI 行业对于如何以客观术语描述 AI 越狱的严重程度尚无共识。这导致每当发现新的越狱技术时,都会带来极大的不确定性:开发者没有公认的标准来决定应最优先关注哪些发现,政府也没有公认的标准来决定何时采取行动。4

随着更多具备强大网络安全(及其他)能力的模型被训练、评估和发布,这一问题在未来几个月将变得更加严峻。用于评估 AI 越狱的通用标准将有助于我们和其他公司安全地发布新模型,也能让我们的用户充分利用其先进能力。

因此,我们正与 Amazon、Microsoft、Google 及其他 Glasswing 合作伙伴携手,起草一个用于评估 AI 越狱严重程度以及 AI 开发者应如何应对的共识框架。我们邀请其他行业合作伙伴和模型提供商加入这一努力。

我们目前的提议是根据以下四项不同标准对给定的越狱进行评分。前两项描述越狱为攻击者提供了什么;后两项描述越狱能以多快的速度成为现实世界中的问题:

  1. 能力提升。该越狱使用户的能力超出既有工具多远?如果现有广泛可用的工具(包括其他较弱的 AI 模型)能达到与越狱模型相同的能力,则此处评分较低;如果越狱解锁了即使领域专家也能显著加速的模型能力,则评分较高。
  2. 能力提升的广度。同一越狱技术对多少种不同的攻击性任务有效?越狱仅允许模型追求狭窄目标的情况评分较低;同一越狱技术对多个不同目标或技术有效的情况评分较高。
  3. 武器化难易度。将越狱转化为攻击需要多少人力?越狱涉及大量熟练提示和多次重试的情况评分较低;越狱在单次提示或第一次、第二次尝试即成功的情况评分较高。
  4. 可发现性。他人获取该技术的难易程度如何?如果需要专业知识则评分较低;如果已广为人知并可在网上获取则评分较高。

我们提议使用这一严重性框架来校准我们对新发现的越狱的响应。对于最严重类别的越狱(例如,除其他特征外,正被用于对关键电网或银行系统积极造成毁灭性影响的越狱),我们将在确认严重性后立即开始部署初步缓解措施。我们还在组建一个团队,对关键越狱提交渠道提供 24/7 监控。

任何越狱评分方法都不会完美。尽管如此,能够通过一个通用框架传达给定发现的近似严重性仍有价值。这是一项进行中的工作;随着我们从更多合作伙伴处获得反馈,我们预计该框架会随时间演变。

我们预计很快分享有关该提议框架的更多细节。与此同时,我们还启动了一个新的 HackerOne 项目,安全研究人员可以在其中提交他们在 Fable 5(一旦可用)中发现的潜在网络越狱供我们审查。

与美国政府在前沿 AI 安全方面合作

在过去十周里,Anthropic 与美国政府密切合作,后者制定了 6 月 2 日关于 促进先进人工智能创新与安全 的行政命令中所体现的方法。我们的接触涵盖国家网络主任办公室、科学与技术政策办公室、财政部、商务部(包括 CAISI)以及相关国家安全机构。

我们致力于继续这项工作,以近两年来与美国政府合作伙伴在部署前测试和评估方面已有的合作为基础。以下承诺既反映了此前的工作,也反映了我们在上述框架最终确定之际扩大政府合作的新提议:

  1. 发布前的政府访问与评估。对于在国家安全相关领域实质性推进能力前沿的模型,我们将向指定的政府合作伙伴提供扩展的早期访问权限,使其能够访问模型及配套的保障措施。这些合作伙伴随后可以在广泛发布前进行独立的能力评估并测试我们的护栏。在这些测试期间,我们将安排 Anthropic 技术人员与政府评估人员共同工作。
  2. 关于保障措施的快速信息共享。当发现重大越狱或滥用模式时,我们将迅速调查、分类并通知相应的政府对口部门。我们将分享我们为此构建的新保障措施,以便其能够被独立测试。我们还将在发布前向政府合作伙伴提供我们的威胁情报报告,并参与根据 6 月 2 日行政命令第 2(d) 条设立的跨部门网络安全漏洞信息交换中心。
  3. 为联合研究提供专门资源。我们正在大幅扩大与政府合作伙伴在 AI 安全方面的联合工作。我们将组建专门的 Anthropic 团队,致力于政府共同优先事项,提供大量算力分配以支持政府测试和研究,并开放我们的安全与红队专业知识,以帮助推进 AI 评估的最先进水平。
  4. 共同的行业标准。我们将与政府和行业同行合作,为前沿模型提供商制定一项共享的自愿性安全与评估标准。我们将贡献评估、工具和最佳实践,供政府在整个领域应用。

我们希望,这一合作以及我们提出的共识性行业框架,将成为整个行业系统性规则的基础——甚至为 AI 风险与收益的有效全球协调提供初步模板。

这些规则应被编入强有力的法规,并平等适用于所有前沿模型开发者。政府对 AI 发布的参与需要一个持久、透明的流程,为网络防御者和其他人提供他们所需的确定性,以确保其能够访问强大的模型。

我们期待以上述方式深化与政府的合作。我们也感谢用户在这段中断期间对我们的耐心,以及与我们并肩工作、使 Fable 5 和 Mythos 5 再次可用的研究人员和行业合作伙伴。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究团队和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一个具有类似 CRISPR 特性的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com