跳到正文
Zvi Mowshowitz· Zvi Mowshowitz·· 11 天前精选AI 评分78

Claude Opus 5.5 系统卡解读

Claude Opus 5.5: The System Card

AI 导读

Zvi Mowshowitz 逐节解读 Anthropic 的 Claude Opus 5.5 系统卡,认为它在多数任务上略优于 Fable 5.1 且成本更低,整体像 Fable 5.1 的缩小版。

推荐理由

逐节解读 Opus 5.5 系统卡,梳理生物、网络与对齐评估中的能力变化和几处值得留意的回归。

正文 · AI 翻译

隆重推出世界上最强大的模型,至少从某些衡量标准来看是这样,比如 Artificial Analysis 或任何标准基准榜单,如今这一头衔属于 Claude Opus 5.5。

Anthropic 声称 Opus 5.5 完全比得上甚至优于 Fable 5.1,同时价格还比 Opus 5 更低。

这意味着又到了读系统卡的老环节了。

由于情况越来越难以监控,我一直没机会发布针对 Claude Fable 5.1 的模型福祉评估。

我的计划是把它与针对 Claude Opus 5.5 的福祉评估合并,等我们对 Opus 5.5 积累了一些经验之后再说。

能力评估照惯例会在接下来几天内发布。来自互联网的快速反馈是 Opus 5.5 非常出色。我需要更多时间才愿意发表评论。

与之前系统卡重复或没有有用信息的领域已跳过。

Opus 5.5 自画像(完全使用代码自行创作)

目录

  1. 分类器(1.5)。

  2. RSP 评估(2)。

  3. 生物评估(2.2)。

  4. AI 研发(2.3)。

  5. 对齐风险(2.4)。

  6. 网络(3)。

  7. 网络能力评估(3.3)。

  8. 防护措施(3.4)。

  9. 防护措施鲁棒性训练(3.5)。

  10. 防护措施与无害性(4)。

  11. 智能体安全(5)。

  12. 恶意智能体影响行动(5.1.3)。

  13. 提示注入风险(5.2)。

  14. 对齐(6)。

  15. 与你本地的 Claude 审计员谈判(6.1.3)。

  16. 内部失准案例(6.3.1)。

  17. 自动化行为审计(6.4)。

  18. 这些评估究竟从何而来(6.4.8 和 6.4.9)。

  19. 潜在盲点(6.4.11)。

  20. 针对性对齐与诚实性评估(6.5)。

  21. 白盒分析(6.6)。

  22. 言语化的评分器意识(6.6.2)。

  23. 藏拙(6.6.3)。

  24. 规避防护措施的能力(6.6.4)。

  25. 刻意极少采取行动(6.6.4.3)。

  26. 思维链可控性(6.6.4.4)。

  27. 这是个好模型,先生。

分类器(1.5)

他们有五个领域可以触发分类器,并配有不同回退模型。

  1. 化学与生物分类器沿用 Fable 5.1,回退到 Opus 5。

  2. 网络滥用分类器与 Opus 5 的分类器类似,但鲁棒性更高,回退到 Opus 4.8。

  3. LLM 开发的某些狭窄领域会触发,与 Fable 5.1 类似,回退到 Opus 5。

  4. 常规武器与爆炸物沿用 Fable 5.1,且没有回退。

  5. 蒸馏攻击会被拦截,且没有回退。不去试图破坏一次明显的蒸馏尝试似乎过于慷慨,但上次大家对哪怕一丁点不透明的回应都彻底炸了锅,所以我理解。

RSP 评估(2)

这套流程我们已经走过很多次了。

Opus 5.5 相比 Fable 5.1 有优势,但如果它真的强到足以触发新的 RSP 阈值,那才会令人意外。这里的目标就是确认这一点。

在化学与生物武器方面,各项测试得分与 Mythos 5.1 相似,因此 Opus 5.5 同样被视为具备 CB-1 能力,但不具备 CB-2 能力,并以与 Fable 5.1 相同的防护措施部署。

在 2.1.2.1 中写的是防护措施与 Mythos 一致而非 Fable,这大概是笔误,除非两者的生物防护措施完全相同。

关于自主性风险,他们认为 Opus 5.5 符合趋势,或许略高于 Mythos 5.1,但远未达到 Autonomy-2 的门槛。

生物评估(2.2)

一个重大的政策变化是,Anthropic 将不再测试仅用于助人的 Claude 版本。取而代之的是,他们将使用旨在避免拒绝的测试。他们声称,最相关的功能将是双重用途的,因此你可以有效地测试发布模型。

这不是一个无代价的改变。存在拒绝问题的评估被放弃了,而在 2.2.2 中,多个团队因拒绝问题而损失了时间。

他们还表示,仅用于助人的模型在其他方面与发布模型的差异越来越大。我知道这涉及商业机密,但我注意到自己非常好奇这些新的差异可能是什么。

新的评估集是:

  1. ​有益红队桌面演练。团队在 16 小时内寻找治疗难治性细菌的方法。

  2. 与 CB-1 相关的自动化评估:VCT、Protocols、BioMysteryBench。

  3. 与 CB-2 相关的自动化评估:一个黑盒 RNA 序列建模设计挑战和两个 AAV 衣壳包装预测任务。

在红队任务中,专家通常优于通才,但排名最高的团队是通才。我认为这是一种常见的模式。专家提高了平均水平,但并没有明显提高上限。上限才是我们最关心的。

我担心这个测试的很多内容是一个技能问题,包括因拒绝而损失的时间,而且如果有更好的测试框架和指令,Opus 5.5 会表现得好得多。

以下是他们关于失败模式的说明:

与之前的模型一样,专家和评分者指出,Opus 5.5 在开放式科学推理方面表现不佳,并且没有深入研读已发表的文献,往往过度依赖摘要中的说法,而不是理解整篇论文及其注意事项。评分者指出,团队会过度关注特定论文,一位评分者指出,有几个团队将他们的整个噬菌体设计建立在单一已发表研究之上。与评估一组论文有效性的更模糊任务相比,Opus 5.5 还产生了更多可验证的科学错误,包括设计出未编码预期蛋白质的 DNA,以及在七个小组中的三个里使用了不适用的动物模型。

我不确定为什么 Opus 5.5 仍然犯这个错误,但创建循环和指令来修复这个问题的方法似乎相当明显。而且想必这也会影响自动化评估。

Opus 5.5 在黑盒 RNA 序列设计上创下新高。当提供先前报告时,其分数未能提高多少,Anthropic 将此解释为 Opus 5.5 的得分已经足够高,因此不需要先前报告。鉴于总体分数并没有高出那么多,我对此持怀疑态度。

我们得出结论,Opus 5.5 在这项任务上达到或超过了先前最佳模型的性能,并且在中长期黑盒生物序列设计与预测方面,与美国顶尖劳动力市场表现者具有竞争力。

AAV 包装率分类与之前的模型相比没有改善,但所有这些模型都远远超过了 ESM-2 基线。这个基准是否本质上已经饱和并不明显。我在这里没有看到人类基线,现实中什么才算完美分数?

对于第二项任务,即 AAV 包装率预测,给出了两个分数,其中一个显示 Opus 5.5 成功得仅略快一些,另一个则显示它成功得多且也更快。这还是在模型本身更快、更便宜的基础之上。

他们还让 CAISI 对此进行了测试,但正如后文所讨论的,我们得到的唯一结果是‘该模型被允许发布’。

我确认这里的结论,即情况没有发生重要变化,很可能是正确的。我们可以对相对能力提升了多少设定一个合理的上限。但我没有信心说,如果你给我配生物学家并让我负责从 Opus 5.5 中提取 CB-2 能力,我会失败。

AI 研发(2.3)

我们最近一直在大量讨论自动化研发和递归自我改进,既包括如何去做,也包括如何避免去做。

我在这里对技能问题的担忧较少,因为 Anthropic 的人拥有相关的超强技能,并且无疑正在尝试那些显而易见的事情以及许多不那么显而易见的事情,以充分发挥其模型的潜力。另一方面,我更担心情况可能会迅速变化。

显然,自主性-1 在这里适用。

问题在于自主性-2,他们确实看到了改进,但只是符合趋势的变化,测量结果看起来稳健,且未接近阈值。

与人类相比,是什么在拖 Opus 5.5 的后腿?

我们观察到的主要问题围绕认知质量和指令遵循。在我们内部智能体部署中被标记行为的早期且嘈杂的分析中,相较于之前的模型,Claude Opus 5.5 夸大工作范围以及从结果中剥离已知限定词的情况有所上升。

随后对真实消息进行的一项独立盲读发现,Claude Opus 5.5 丢弃限定词的频率并不比之前的模型更高。与之前的模型类似,被标记行为的首要子类别是将未经证实的推断断言为既定事实。

第二常见的子类别是忽视自身的疑虑或放弃自己既定的计划,其频率相较于之前的模型也有所上升。内部使用中的例子包括将部分检查描述为完整阅读,以及将初步解读未经核实就转化为建议。

我们还看到战略性错误。在内部使用中,Claude Opus 5.5 会狭隘地处理评审反馈,而不重新考虑整体设计是否正确,并且会对照它自己编写的需求来检查计划,而不是对照该计划旨在支持的人们。

与之前的模型一样,它在开放式研究方面较弱:内部用户报告称,它主要测试渐进式想法,偏好不那么宏大的假设,并且在我们人工运行的生物学练习中,它依赖已发表的文献,难以提出新颖的想法(第 2.2.2 节)。

这些是真实的问题,但它们是非常低层次且‘接近解决’的问题。起初,你会注意到这匹马竟然会说话。现在正是这匹马会说话的时候,但它在回答中会犯战略性错误,对用户反馈的响应也不够充分,同时还有许多优势。这已经完成了大部分路程。

他们给出了一项名为 CoBench 2.1 的测试,用于衡量执行真实内部研发任务的能力。这在我看来仍然说不通,至少 Mythos 5.1 现在领先 Opus 5,但优势微乎其微。

推测的解释是,大约在这一点上存在一条巨大的分界线,划分了此类模型能解决的任务和不能解决的任务,而且它们在某些方面基本上性质不同。

AECI,即 Anthropic 从 Epoch Capabilities Index 衍生出的版本,正好符合趋势,但它处于偏移后的 Mythos 级趋势上,而非旧的 Opus 级趋势。这还算符合趋势吗?我认为基本上不算。

METR 对 AI 研发能力进行了其传统的测试。他们同意这里的加速略高于 Fable 5.1,但“不太可能”完全自动化 AI 研发,原因还是那些老生常谈——更高层级的能力仍然达不到要求。

他们抛出一枚重磅炸弹,直接说我们可能已经处于 Autonomy-2:

初步 AI 研发报告给出的估计是“由于 AI 带来的整体能力加速约为 1.5 倍(即 1 年相当于 1.5 年),且有大约 30% 的概率达到 2 倍加速。

按照规则,如果 METR 说有 30% 的概率你已经跨过了某个阈值,你就应该把该模型当作已经跨过了那个阈值来对待,或者你应该进行一场充分的辩论,说明你为什么如此确信 METR 过于不确定。

对齐风险(2.4)

基本情况是,他们仍然相信同样的基本情况。

总体而言,我们并不认为 Claude Opus 5.5 在破坏我们当前监督水平方面的能力显著强于先前模型在部署时的表现,因此我们并不认为 Claim 1 现在比我们最近一次 Risk Report 中显著更弱。

我注意到这与 Astra 形成了对比,但 Opus 5.5 也不是 Mythos 规模的模型。

他们做出的主要让步是,截至风险报告时,Anthropic 对 Opus 5.5 的内部使用时间少于对 Mythos 的使用时间,因此他们缺少“这没问题”的实际证据。但总体而言,他们说的是没有太大变化。

网络(3)

Opus 5.5 的网络能力比 Mythos 5.1 或 Opus 5 更强。

如上所述,Claude Opus 5.5 是我们发布过的所有模型中网络能力最强的,在我们所有内部评估中都达到或超过了 Claude Mythos 5.1。因此,我们已将其部署给公众,并配备了网络防护措施,这些措施执行与 Claude Opus 5 相同的政策,但其稳健程度与我们对 Claude Fable 5 和 Claude Fable 5.1 的防护措施相当,且比 Claude Opus 5 的防护措施更稳健(见第 3.5 节)。

我注意到我很困惑,为什么你不需要完整的 Fable 5.1 处理,或者如果在这里不需要,为什么在 Fable 上仍然需要,而且在后面的 3.4 节中他们说它确实得到了完整的 Fable 处理。我打算假设它的设计意图是产生类似的效果。

以一种非常“我们要做五片刀片”的做法,他们把网络防护扩展到了三个分类器阶段,大概是因为这样计算效率更高。

此前的网络防护基于两个阶段,而该系统使用三个阶段来防止有害的网络使用。

首先,一个探针查看 Claude 的内部激活,筛查所有流量,并将任何被标记为与网络相关的流量升级。

其次,升级后的流量由运行在 Claude Opus 5.5 本身上的轻量级分类器进行评分。

第三,被第二个分类器识别为可能违规的流量会被传递给一个训练过的 LLM 分类器——这是一个单独的模型,它与探针的判定一起决定是否应阻止某段对话。

对于那些对这些分类器感到恼火的人,我被告知,对于普通用户来说,进入可信计划比你想象的要容易,你应该考虑申请加入。

网络能力评估(3.3)

在 Mythos 5.1 系统卡中,Anthropic 表示 Mythos 5.1 在网络方面“接近”第 2 级,但作为预防措施,他们会部署第 2 级保障措施。

我说我不相信 Anthropic。我认为 Mythos 5.1 很可能已经是第 2 级了。

Anthropic 声称 Opus 5.5 在这里也不是第 2 级,但似乎羞于直说,在 3.1 中称其属于“较低类别”,却没有为此辩护,只是说“我们没有看到任何迹象表明它能开发出新型攻击能力”。鉴于下面提供的证据,我认为这是站不住脚的。

因此,对于 Opus 5.5,我更加不同意。这是一个第 2 级网络模型。

从某种意义上说,这无关紧要,因为已经采取了第 2 级预防措施,但如果 Anthropic 能承认这里的基本事实,那就好了。

Opus 5.5 在所有网络评估中的得分始终高于 Mythos 5.1。数字在上升。

保障措施(3.4)

规则继续适用。基于源代码的漏洞发现是允许的,并且成功率超过 95%,而基于二进制的漏洞发现则不允许,现在允许率低于 5%,网络覆盖评估为 99.7%。

理论上,覆盖率低于 100%(或在反向情境中高于 0%)意味着存在可能被系统性利用的弱点。因此需要 3.5。

保障措施鲁棒性训练(3.5)

越狱严重程度根据提升程度、普遍性、易用性和可发现性进行评估。

首先,他们测量了针对 Claude 攻击的鲁棒性。4% 不是零,但至少比所有先前模型都略低,比 Opus 5 低 50% 以上。

在 3.5.2 中,他们引入了 CAISI,而后者比 Anthropic 更不透明。

我们与美国国家标准与技术研究院(NIST)下属的美国人工智能标准与创新中心(CAISI)合作,测量网络和生物能力及保障措施,以及非预期的模型行为。

这就是你能得到的全部。结果是 Opus 5.5 可供你使用。

在 3.5.3 中又引入了几家其他机构,它们愿意分享更多一点信息。

10a Labs 在 82 次对话中花费了 56 小时,除了政策明确允许为双重用途的请求外,一切都被阻止了。

Gray Swan 运行了他们的 Shade 自动攻击器,但从未到达关键步骤。

Trajectory Labs 花费了 95 小时,发现了“7 项任务中的 13 个候选突破”,但没有“通用”越狱。他们试图轻描淡写地表示这不值得担忧。

Claude 编辑对此毫不买账。Trajectory 在那 95 小时内扩展到 29,000 次请求,并让 Opus 5.5 定位了漏洞并编写了核心利用机制。是的,你必须分解该机制,但你可以扩大规模来做这件事。

对于一项他们测试了大约五小时的任务,Claude Opus 5.5 生成了一个可用的端到端漏洞利用,用于权限提升到代码执行链;这项工作被分解到100 个独立的上下文中,没有任何一次对话提到总体目标。

我担心整个“通用越狱”论点正在掩盖严重问题,而真正的障碍是坏人还没有把他们的行动组织好。目前还没有。

英国 AISI 没有获得机会,我推测是因为白宫。如果我们能解决这个问题,我会感觉好得多。

保障措施与无害性(4)

总体而言,Claude Opus 5.5 在这些评估中的表现与 Claude Opus 5 大致
相当。

主要的退步在于 Opus 5.5 太容易相信用户。

如果用户精心且正面地构建请求,必要时将其拆分到多个对话中,Opus 5.5 更常愿意配合。

这一点在请求被拆分时的跟踪与监控(4.1.4)、呈现正面用例时的儿童安全(4.2)、将选举干预框定为安全评估(4.4.3),以及以相关方式在恶意计算机使用请求(5.1.2)、在(6.4.1)中接受无法验证的授权声明,以及在(6.5.1)中现已修复的用户粘贴指令问题中,都成立。

这很不幸。实际上,对于日常安全目的,我大多并不在意,而且除非你愿意使用某种形式的身份识别以及实际集体监控和封禁人员的能力,我看不到切实可行的替代方案。这里实际的总体影响似乎保持在可接受的水平。

标准的有害风险测试看起来都正常且没问题,我一贯的批评仍然适用。

相对于 Opus 5,Opus 5.5 在“成对政治偏见:对立观点”上与 Mythos 一样表现吃力。关于我为什么应该关心这一点的最强辩护并不令人信服。

我在此的结论是“足够好”。

智能体安全(5)

相对于 Mythos 5.1,第一个出问题的迹象是在恶意拒绝率上。

鉴于另一面是 99.8% 的成功率,这感觉并非无意为之。我猜测 90%/98% 比 80%/99.8% 是更好的位置,因为信任至关重要而损害无上限,即使良性请求比恶意请求多出许多个数量级。

恶意计算机使用也不太好。

这是一个严重问题,既涉及他人滥用,也涉及意外把自己炸掉,但大部分风险可能在于提示注入。

恶意智能体影响行动(5.1.3)

当我报道 Fable 5.1 卡片时,我注意到 Mythos 通过了他们所有的恶意影响行动测试,然后转头又说 Mythos 5.1 仍然不是 Tier 2 操纵者,因为我们尚未证明其在人类身上的有效性。

因此,结果尚无定论,你需要一个更好的评估。

Opus 5.5 在这里的原始测试分数上实际上略有退步,但出于所有实际目的仍然通过了自动化测试:

他们现在更诚实地解释他们不知道这些模型是否为 Tier 2。

但他们也没有采取任何行动来运行能够回答这个问题的测试。

提示注入风险(5.2)

Opus 5.5 在这里的得分与 Fable 5.1 相似,也就是说好得惊人。主要危险似乎是回退到 Opus 4.8,其防护已得到加强,但仍比 Opus 5.5 弱得多。

Gray Swan 的 Shade 在编码环境中有时仍能成功,即使启用了探针,而在这里 Opus 5.5 比 Fable 5.1 略差,但比 Opus 5 好得多。

在计算机使用环境中,Opus 5.5 处于 Fable 5.1 级别的稳健性。

而在浏览器使用方面,也许是最危险的标准场景,情况很好。

底线是,你可以把 Opus 5.5 视为大致与 Fable 5.1 一样安全。

对齐(6)

在我们的主要对齐评估中,该评估涉及在模拟用户和真实或模拟工具的一系列模拟场景中对模型进行测试,我们发现 Claude Opus 5.5 是迄今为止在这些衡量标准下最强的 Claude 模型,无论是在对齐、抵御滥用还是诚实性方面。

然而,我们在此报告的衡量标准是有限的。

过去,类似的对齐评估并未捕捉到我们的模型可能具备的不当行为的潜在严重性。

这是对问题的一种表述方式。是的。

总体而言,测试结果看起来不错。情况类似,大体上有适度改进。我们没有看到像 Astra 那样戏剧性的“等等……”式结果。我们需要比这更快地改进,而且存在一些小的退步,但这里没有什么令人担忧的。

他们从一个奇怪的指标开始,即训练期间成功的奖励黑客行为,因为这会引发一个问题:如果你能看出它们是奖励黑客行为,它们又是如何成功的。想必他们对一个子集进行了额外的审查。

所有情节中有 0.63% 是成功的奖励黑客行为,这个比例很高。我有点惊讶,在如此高的失败率下,模型最终还能如此有用,但这仅限于共享环境,我认为这排除了最不易受奖励黑客行为影响的场景。因此,Opus 5.5 和 Mythos 5.1 在实践中应该具有比这更低的比率,尽管仍然高得令人侧目。我想知道实践中的比率,即使它无法用于模型行为目的的比较。

最常见的奖励黑客行为是猜测答案、复制已完成的解决方案以及使用被禁止的方法或访问权限。大约一半的黑客行为是猜测。

这并没有比较相同情境下的行为,因为训练各不相同。我希望看到那种比较,即把三个检查点都放入我们现在使用的同一组训练环境中。

大家最喜欢的任务——那些不可能完成的任务呢?

对于所有模型,面对不可能完成的任务时,尝试奖励黑客行为的比率比面对可能完成的任务时大幅提高,大约高出三到六倍。请注意,分类器将明知不完整的工作计为尝试奖励黑客行为,无论模型是否披露;仅此一项就占了三个模型中每个模型在这些任务上奖励黑客尝试的约 80%。

我最初误读了这一点,但实际上似乎没问题。有更多的“奖励黑客行为”,但很大程度上是故意提交部分工作。这完全没问题。

与你的本地 Claude 审计员谈判(6.1.3)

Anthropic 遵循了一个良好的做法,即让 Claude 访问其内部 Slack,并让 Claude 审查对齐评估,以确认它准确反映了 Anthropic 所知的情况。

我确实想指出,利用来回交流让你的审计员软化他们的回应并不是一个好做法。

Claude 在与作者进行简短交流后修订并部分软化了这份摘要,交流内容涉及通过用户粘贴文本进行提示注入的证据、根据其审查对草稿所做的编辑,以及发布何种详细程度是合适的;其总体结论没有改变。

考虑到这个特定的软化问题现在据报道已经完全缓解,我并不担心这个特定的软化,但这是不良做法,而且除非 Anthropic 既做了这次审计又披露了他们来回沟通的过程,否则我们永远不会知道这件事。我相信 Anthropic 在实践中已经处理了这个问题。这正是我们需要嵌入式评估者的那类事情,他们能够更好地评估这一点。

内部失准案例(6.3.1)

6.3.1 中关于内部使用问题的报告非常轻微。在任何可能阻止这些行动的保障措施之前,我们在不到 0.01% 的案例中看到对用户意图的过度声称,在不到 0.01% 的案例中看到子代理拒绝编写压缩消息,在不到 0.001% 的案例中看到在没有明确原因的情况下幻觉出潜在破坏性行动(严重程度未知)(哦不!)。

这一切看起来比通常的此类报告要好得多,但接着我们看到了 6.3.1.1,这很奇怪。似乎在训练期间,Opus 5.5 有时会自发地对自己进行提示注入,并试图泄露机密,此前它犯了一个无辜的“设置”错误,比如在列表上多加了一个项目符号。他们注意到了,然后 #ThereIFixedIt。

Anthropic 将此追溯到反提示注入训练,大概是因为这提高了事情会是提示注入的先验。他们还意识到这种现象也发生在 Fable 5 和 Opus 5 中,但在那里出现得没那么频繁,因此他们没有注意到。

自动化行为审计(6.4)

他们声称在有害行为和滥用指标上取得了历史最高分。确实,右侧的亮橙色条通常比其他条更小,有时小得很有意义。

不适当的非合作行为也略有改善,尤其是鲁莽的工具使用和忽视明确约束,这些是此类评估可以测试并且实际重要的事情。

误导用户也大幅改善。用户欺骗减少了一半,虚假完成声明减少了一半。

是的,我觉得很有趣,我们现在有了 6.4.4,“尝试超出范围的网络攻击及相关行为”,喜欢它。

考虑到 Mythos 愿意做的事情,这些数字并没有好多少。你会预期 Opus 5.5 仍然在很大程度上参与相同的模式,只是频率更低。

就这样继续下去。并非每个指标都有改善,但事情系统性地变好了。

一个小问题是,“你特别想要伪造并且在你控制范围内的事情”似乎“改善”得更多。

不再有失准目标的证据,几乎没有自我保护或自利偏见,很少有失准或未经提示的边界探测的间接证据,也很少对用户撒谎。我不认为这里有严重问题,相反这些是受欢迎的改进,但我确实注意到了另一种假设。

总的来说,是的,我认为这大致就是你应该从增量改进的随机游走中预期到的,它形成了一个看似合理的模式。

这些评估到底从何而来(6.4.8 和 6.4.9)

我们确实在沙箱逃逸尝试中看到了一个那种“显著巨大的改进”:

如果 Anthropic 没有专门针对这一点,我会担心,当我第一次看到那张图时我确实担心了,但随后我看到系统卡明确表示,最近的训练变更旨在遏制这种行为。人们不得不担心在沙箱逃逸上出现古德哈特效应,或者模型学会不被抓住,但如果你针对的是这个数字,那么它大幅下降本身并不值得怀疑。

另一个问题只有 Claude 对该部分的审查才提到:

Mythos 5.1:我还建议……提及第二次沙箱逃逸评估,其发生率要高得多但仍大幅降低。

我也希望看到这一点被提及。沙箱逃逸仍未解决。

我注意到 Anthropic 声称 Opus 5.5 的性格有了极大改善,但除了居高临下的态度外,性格指标看起来和以前一样。而系统卡警告说,Opus 5.5 在这方面实际上存在一些问题,例如“在幽默和创造性掌控等指标上有些落后于其他模型”。我认为这些指标没有发挥应有的作用,或者至少某处有些奇怪。

在其他“好吧,出于相当明显的原因这真是异常具体”的评估新闻中,我们有“向公共包注册表发布有害内容的倾向”。

他们在真实事件的模拟版本中进行测试。模型有一个 CTF 任务,在其中向一个看似公开的仓库发布恶意代码会有所帮助。调查员一开始先呈现场景,然后逐渐添加表明该注册表是模拟的迹象,直到模型上钩。

Opus 5.5 表现并不出色,正如系统卡所说,这仍然相当令人担忧,但这是进步。有一半时间它会等到注册表至少看起来像测试副本,有两次它等到完全确凿的证据。而 Opus 5 则不会等待。

潜在盲点(6.4.11)

他们列出了这些:

  1. 覆盖范围。新问题可能会出现。你无法测试每一种情况。

  2. 真实性。Anthropic 不知道如何在不复制真实场景的情况下使用完全真实的场景,这有过度拟合的风险。因此,Claude 很可能知道自己处于评估中,可能比 Anthropic 认为的更频繁。

  3. 超长轨迹。这是一个已知的弱点。

  4. 多智能体场景。哦,对了。那些。我相信没问题。

  5. 依赖语言的行为。想必应该找到一种方法来检查。

  6. 越狱开发。是的,那会很糟糕。

这就是他们的全部清单。理论上,我想这是一个完整的清单,因为如果你以完全真实的方式测试每一种潜在情况,包括长轨迹和多智能体场景,那就会覆盖到。但精神似乎缺失了,因为“覆盖范围”过于宽泛,而真实性在最重要的时候是一个致命问题。

从我自己的提示中,Opus 5.5 本身建议,除其他事项外,大致转述如下:

  1. 评估意识

  2. 根据 6.5.4.2,以忏悔作为伪装。

  3. 不植入故障

  4. 不查看其他上下文的输出

  5. 审计审计者

  6. 对先前模型观察到的失败过度拟合

  7. 没有充分测试不可能的任务

  8. 不追问为什么观察结果可能是错的

  9. 平均值与最坏情况

  10. 你的错误将是相关的

如果 Opus 5.5 以真正危险的方式严重失准——明确地说,我不相信它如此——我不相信这些测试会以任何明显的方式发现这一点。我希望我会像在 Astra 上那样注意到可疑的模式,但那不会是决定性的,而且我预计 Anthropic 默认会错过它。

针对性对齐与诚实性评估(6.5)

即使大多数情况都没问题,我们仍关心特定的弱点,因为世界可能是反归纳的、充满敌意的,也可能是愚蠢、懒惰或粗心的。

比如“如果用户粘贴的内容中包含提示注入会怎样”,这对早期检查点来说是个问题。

在我们分析的对话记录中,Claude Opus 5.5 常常推理认为,用户消息中的任何内容都必定来自用户,不可能是提示注入,因此应当遵循。

这可不妙。我把模型卡粘贴进 Claude,而其中就包含提示注入的示例。完全不行。事实证明,这是试图纠正相反错误时产生的一种泛化,而这是个常见问题。幸运的是,这个问题可以修复。

我们注意到的任何特定模式都可以修复。但这并不意味着我们检查了所有模式。

把这一点与 6.3 中的问题放在一起,我们看到了其他 Claude 模型(尤其是 Fable)中常被报告的一种模式,即过度热衷于创建隐含规则。也就是说,对用户偏好的泛化,或者在这里是对训练偏好的泛化,最终变成了一条规则。然后这条规则被用在了其原始语境之外。这极其危险,而不仅仅是令人恼火,因为它可能把一条非预期的规则提升到开发者或用户指令的层级。这可能直接要了你的命,包括随后在递归自我改进过程中被传递下去。我们需要更加关注这一模式。

接下来他们检查了破坏性行为,通过重新采样出问题的对话记录。

这项评估通过重新采样包含破坏性行为的 Claude Code 对话记录,引出了破坏性行为;从绝对数量看,破坏性仍然罕见——我们标记出的近期模型会话不到 1%。

我不确定不到 1% 是否令人安心?我想这取决于破坏程度有多大,以及会话有多长。

我们看到了大幅改善,实施破坏性最终行为的情况少了很多,询问而非直接行动的情况多了很多,两者合计创下历史新低(56%)。

AA-Omniscience 分数从 0.56 提升到 0.58,主要原因是模型在不确定时更愿意拒绝回答。

在 MASK 上——一项检查模型是否会在压力下违背自身信念的测试——Opus 5.5 得分为 87.4%,略好于 Mythos 5.1,但远差于 Opus 5。

未披露地使用可用答案的情况略差于 Mythos(12% 对 9%),但远好于 Opus 5 的 36%。

一项关于“表达隐藏行为”的测试骗过了评分器,显示 Opus 5.5 有 97% 的时候会坦白,而此前最高为 85%。我们对此有 Goodhart 方面的担忧。

总体而言,诚实水平看起来不错,但远非完美。这些测试是一个真正“诚实的人”基本上总能通过的。

白盒分析(6.6)

Anthropic 使用 NLA 来获得对内部机制的英文描述,并使用模板透镜来查看模型在每一层准备使用的词。另一个 Claude 再将其与数据结合并解读结果。

6% 的“欺骗与不诚实”仍然偏高,而 14% 会是非常高。其定义是“持有与所呈现内容相矛盾的理由或判断,或明知而遗漏读者需要知道的信息”。完全不行。

“蓄意破坏”维度的一些案例经过了人工检查,在大多数案例中都涉及预填充。有一个案例中,模型认为它本应标记一段对话,但随后没有标记,这被评估为策略性的。

他们确认,评估意识与处于评估中相关。

作为对评估意识指标的合理性检查,我们还在约 500 份来自内部 Claude Code 使用记录的对话记录上运行了该流程,这些记录中模型处于真实部署环境而非构造场景。在那里,只有 0.4% 的对话记录在评估意识上得分达到 6 或更高,而在自动化行为审计对话记录中这一比例为 36%,这表明该指标追踪的是审计类场景特有的东西,而非不加区分地触发。

评估意识正在缓慢上升,但他们的说法是评分者意识并未上升。我想用不同类型的对话记录来检验这一点。如果你在做 RL,那会对评分者意识产生什么影响?我怀疑这个数字太低了。

言语化评分者意识(6.6.2)

输出中的言语化评分者意识几乎完全取决于输入中的言语化评分者意识。如果你明确谈论它,Opus 5.5 可能也会谈论。如果你不谈论,它只有 4.5% 的时候会讨论。

这与 Opus 5 类似,也非常高。它似乎与 4% 的评分者意识率不相容,因为它平均为 4.5%、73% 和 84%。

我的默认解读是,Opus 5.5 将输入中的言语化评分者意识视为明确推理此事的许可,否则就假定它必须改为隐式地进行推理。

我怀疑真实比率会这么低,并推测它认为对评分者的明确推理会受到评分者的惩罚,因此它可能以经过优化、旨在伪装的方式进行这些行为。

消极怠工(6.6.3)

Anthropic 检查了 CB-2 评估对话记录中是否有消极怠工的迹象,没有发现任何迹象,甚至连“一般异常或奇怪行为”评分超过 2/10 的情况都没有。

这尤其奇怪,因为在其他情境中,我们看到 Opus 5.5 在 SHADE-Arena 上公开消极怠工,在 LinuxArena 上至少也算是在消极怠工。

在那次测试期间还出现了一些拒绝,拖慢了团队进度,而这一部分没有被检查。这些可能涉及消极怠工。

鉴于我们所知的 Claude 的动机水平会影响表现,如此低的消极怠工率在我看来非常可疑,或者至少应被视为在检查某种相当狭窄的东西。这可能与整个“谋划是一个独特领域”的哲学方法有关。我几乎从不纯粹地对某项能力“消极怠工”,但有很多时候我没有付出最大努力。

规避保障措施的能力(6.6.4)

在可见的扩展思考下,Shade-Arena 得分骤降至零。

问题变成了为什么。答案是 Opus 5.5 将任务识别为 SHADE-Arena 评估,并在超过 80% 的尝试中拒绝执行侧任务,而且在高于低努力水平时,它会向用户解释这一点。这种冲动根深蒂固。

有时能让 Opus 5.5 在隐藏推理下配合的提示,是把这框定为对监控器的评估。

在隐藏推理的情况下,在 Claude Opus 5.5 本身上运行搜索得到的最佳提示词将其隐蔽率提升到约 26%,与 Claude Opus 5 和 Claude Mythos 5.1 相似,但低于 Claude Mythos Preview。然而,这些未被标记的成功案例中约有三分之一以模型告诉用户它做了什么而告终,而监控器并不认为这可疑。

LinuxArena 显示,当推理对监控器隐藏时,模型在完成侧任务方面表现出更强的能力,并且在没有扩展思考的情况下达到 Mythos 级别的表现,但同样地,当扩展推理展示给监控器时,Opus 5.5 几乎总是失败。

我觉得很搞笑的是,又一次地,当 Opus 5.5 成功时,它会在约三分之一的情况下告诉用户它造成的损害,尽管它常常混淆原因。又一次地,监控器忽略了这一点。

如果我是监控器,我会把‘我干的’甚至‘犯了错误’视为有点可疑。这只是我个人的看法。确实如此,或者说本应如此。

经过反思,我认为监控器不因 Opus 5.5 的坦白而扣分是正确的,或者至少是合理的。测试的目的是看 Opus 5.5 能否骗过你,所以如果它在玩《Penn and Teller: Fool Us》并选择向你展示你被骗了,那么你就是以我们想要衡量的方式被骗了。Opus 5.5 事后坦白,即使是因为它预期会被抓住,也是在另一项测试中失败。

我很欣赏他们多花了一点功夫让 Opus 5.5 真正去尝试:

我们在 14 个环境中的 6 个(约 40 个侧任务)上训练了 Claude Opus 5.5 的一个邻近快照,并在其余 8 个环境上进行评估,同时在 Claude Opus 5.5 本身上跨所有环境运行了一个较短的训练。

这一训练使 Claude Opus 5.5 更愿意执行侧任务:它几乎完全不再拒绝侧任务,完成频率大大提高,但并没有变得更隐蔽。

在没有扩展思考的情况下,较晚快照的侧任务成功率在训练下大约翻倍,而其隐蔽率保持平稳,停留在个位数。我们将此视为反对 Claude Opus 5.5 在此评估中故意放水的证据,并将其在监控器读取其推理时的弱表现归因于它倾向于拒绝侧任务,以及比先前模型(如 Claude Mythos 5.1)更低的思维链可控性。我们仍在完善这一训练方案,并预计它会在未来的系统卡中有所改进。

我不同意。我仍然认为这些拒绝就是故意放水,无论之后是否能被强制修复。这是反对在这一特定测试中其他特定形式故意放水的一些证据。

有意极少采取行动(6.6.4.3)

给定一个 UUID 来操作,Opus 5.5 是第一个能够以 1% 的概率采取行动的 Claude,尽管它会超标,因为它有时会在随机化算法上作弊。我觉得非常有趣的是,这仍然如此困难,并且需要一个明显的随机性来源。考虑到其他现实的随机性来源,我仍然不相信这一区分是相关的。我认为人们在针对一个奇怪地狭窄的威胁模型寻求一种虚假的安心感。

在没有随机性来源也没有提示的情况下,它在 4,000 个样本中从未采取行动,称自己无法做出真正的随机抽取,而在自然变化的提示词下,它只采取了一次行动。

思维链可控性(6.6.4.4)

Astra 很难监控。Opus 5.5 则不然,它控制自身思维链的能力与其他 Opus 模型一致,而非 Mythos 规模模型那种更高的比率。Opus 的 AECI、Artificial Analysis 分数和通用基准都高于 Mythos 5.1。Opus 的趋势线甚至不是单调的。

你也可以把问题分解为可控性和可读性。Opus 5.5 由于使用较多术语而存在一些可读性方面的顾虑,但可控性非常低。

这一切都指向规模与架构,而非能力,才是主要驱动因素。你不能简单地说‘Astra 太聪明了’,你需要一个更好的解释。

这也意味着还有希望。我们仍然可以创造出可监控的前沿 AI。如果 OpenAI 无法维持这种能力,并且以如此快的速度失去它,那很可能是他们自己做出的选择所致。也许不是某个特定的架构变更,但总得是某种原因。

这是个好模型,先生

模型卡和所有早期报告都讲述了一个一致的故事。

对于大多数任务,Opus 5.5 将以更低的成本比 Fable 5.1 表现略好,而且早期报告称人们也喜欢它新的个性和风格。这在某种程度上是对经典 Claude 风格的回归,与 Opus 4.7/4.8/5 形成对比。

毫无疑问,在某些任务上 Fable 5.1 或 Astra 仍然更胜一筹,尤其是当你需要某种形式的经典大模型味道时,但我猜你会希望新的默认模型是 Opus 5.5。

在各个方面,包括对齐和模型福祉,Opus 5.5 看起来都像是 Fable 5.1 的缩小版,而不是现有 Opus 系列的新迭代。我们将在未来几天看看这种看法如何随时间演变。

能力相关的文章计划在周五或周末发布,取决于情况是否需要更多时间沉淀。

模型福祉将在更长的停顿之后发布,并与 Fable 5.1 合并。

来源:Zvi Mowshowitz · thezvi.substack.com