跳到正文
Anthropic News·· 17 天前精选AI 评分80

Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

Introducing Claude Opus 5.5

AI 导读

Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,官方称其多数工作表现达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%。

推荐理由

官方给出 Opus 5.5 的定价、基准与安全评估细节,可据此判断前沿模型成本与对齐投入的走向。

正文 · AI 翻译

我们推出 Claude Opus 5.5,这是我们全新 Claude 5.5 家族中的首个模型。它在大多数工作上的表现达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。

Claude Opus 5.5 是我们呼吁为前沿发展设定节奏以来的首个发布版本。它在发布前经过了外部评估者的测试,包括 Frontier Design 和 METR。在我们运行的自动化行为审计——我们最全面的对齐测试中,Opus 5.5 是我们迄今测试过表现最强的模型。它还配备了我们为最强能力模型开发的安全保障措施。

以下是 Opus 5.5 带来的一些改进:

性能。Opus 5.5 相较 Opus 5 是一次重大升级。它是新的领先模型,早期测试者在其最复杂的工作上看到了性能的大幅跃升。一位测试者在不到一天内完成了 68 万行的代码迁移——这项工作原本需要一个工程团队花费数周。它擅长发现并修复软件中的低效问题:当我们要求它缩短一个 Web 应用每个页面的加载时间时,Opus 5.5 在 40 次中成功了 39 次,而 Opus 5 只做出了较小的改进,还改变了应用的行为。另一位测试者让多个 Claude 模型根据单条提示构建一个游戏;Opus 5.5 凭借其画面表现和精细度得分高于其他任何模型。

安全性。Opus 5.5 在我们自动化行为审计——即在数千个模拟场景中测试 Claude 的对齐套件——中取得了迄今所有模型的最佳成绩。与近期模型相比,它采取难以逆转的行动或超出既定边界的可能性要低得多,并且比 Opus 5 更能抵御提示注入。我们还扩展了对齐测试,以覆盖更长的任务、不可能完成的任务以及基于真实事件建模的场景,尽管它仍有局限。我们评估的完整细节见 Opus 5.5 系统卡。

由于 Opus 5.5 在生物学和网络安全方面与 Claude Mythos 5.1 相当,我们为其部署了与 Claude Fable 5.1 类似的安全保障措施。经过审核的组织今天即可申请我们的生命科学验证计划,将 Opus 5.5 用于生物学研究。未来几周,我们还将扩大网络安全验证计划的访问权限,经过验证的网络安全从业者将能够使用 Opus 5.5 开展工作。

成本与速度。Opus 5.5 服务所需的算力比 Opus 5 更少,其定价也反映了这一点。我们的测试显示,在默认设置下,它在典型工作负载上的成本将比 Opus 5 低 40%。输入和输出 token 分别为每百万 $4 和 $20,比 Opus 5 低 20%。缓存读取(占智能体和编程工作成本的大部分)为每百万 token $0.20,比 Opus 5 低 60%。Opus 5.5 生成输出的速度也比 Opus 5 快 30% 以上。

除了降价之外,我们还在提高 Pro、Max、Team 和按席位计费的 Enterprise 计划的五小时使用限额。我们还为订阅用户提供一次速率限制重置,你现在可以将其保存下来,随时选择使用。

沟通能力。Opus 5.5 的沟通比之前的模型更自然。早期测试者发现它的写作更清晰、更易理解,这解决了我们听到的关于 Opus 5 的一些常见反馈。它把最重要的信息放在前面,其风格使其在长时间会话中成为更好的工作伙伴。正如一位早期测试者所说:“它写作的方式就像我一样。”在我们自己的使用中,这让 Opus 5.5 的工作更易于跟进和检查——这既是安全上的好处,也是实用上的好处。

Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内推出,并带来许多相同的性能、效率和安全性改进。

性能与成本效益

在我们的基准测试中,Claude Opus 5.5 在智能体编程、计算机使用和知识工作方面处于领先。话虽如此,在这种能力水平上,我们发现基准测试的差距已不再是衡量现实世界差异的可靠指南。在我们自己的使用中,Opus 5.5 与 Claude Fable 5.1 之间的差距比这些分数所显示的要小。

Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
智能体编程Terminal-Bench 4.0¹66.4%55.8%52.3%57.9%37.3%
智能体编程FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
智能体编程CursorBench 4.057.8%51.8%46.6%—41.7%
知识工作GDPval-AA v2.118461735170815421588
业务流程AutomationBench²40.0%31.4%26.9%41.4%28.8%
多学科推理Humanity's Last Exam67.7%使用工具65.6%使用工具63.6%使用工具57.2%使用工具—
智能体科学研究Terminal-Bench-Science 0.1³58.7%52.6%29.0%64.6%22.4%
计算机使用OSWorld 2.181.8%部分80.7%部分74.0%部分——
可视化图表识别Chartography89.0%使用工具88.4%使用工具83.4%使用工具——

除非另有说明,所有 Claude Opus 5.5 结果均使用最大努力下的自适应思考。Terminal-Bench 4.0 结果报告的是 Claude Opus 5.5 在 xhigh 努力下和 GPT-6 Astra 在 high 努力下的成绩,由 OpenAI 报告;这些代表每个模型的最高分。Claude Opus 5.5 在启用其生产防护措施的情况下进行了评估。当这些措施介入时,网络安全任务由 Claude Opus 4.8 完成,生物学和前沿 LLM 开发任务由 Claude Opus 5 完成。这可能会降低 Claude Opus 5.5 在这些基准测试上的表现。

1 Terminal-Bench 4.0:Claude Opus 5.5 的标准误差为 ±2.6 分,其他 Claude 模型为 ±1.6–2 分。公开排行榜(每任务 5 次试验,Claude Code 测试框架)报告 Claude Opus 5 为 51.8%;我们的设置复现为 52.3%,在噪声范围内。GPT-6 Astra 和 GPT-5.6 Sol 的数据由 OpenAI 报告。

2 AutomationBench:AutomationBench 结果由 Zapier 运行并报告。这些运行未使用回退模型,因此防护措施的介入被视为失败——这导致分数低于 Claude Opus 5.5 在实际中会达到的水平。Claude Opus 5.5 的结果来自 Zapier 在早期访问期间自己的评估。Opus 5、GPT-5.6 Sol 和 GPT-6 Astra 的结果来自 Zapier 的公开排行榜。

3 Terminal-Bench-Science 0.1:每个模型的标准误差为 ±3.5–5 分。公开排行榜(每任务 3 次试验,Claude Code 测试框架)报告 Claude Opus 5 为 30.0%;我们的设置复现结果为 29.0%,在噪声范围内。GPT-6 Astra 的数据为 OpenAI 所报告。

Opus 5.5 的优势非常明显之处在于效率。它的每 token 成本低于 Opus 5,且每个任务使用的 token 更少,净效果是成本下降 40%。

定价

每 100 万 token 价格Claude Opus 5.5Claude Opus 5
缓存读取$0.20$0.50
输入 token$4$5
输出 token$20$25
缓存写入$5$6.25

Opus 5.5 的快速模式也可在 Claude Code 和 Claude Platform 中使用,速度最高提升 2.5 倍。其价格为每百万输入 token 8 美元,每百万输出 token 40 美元。

编程

Opus 5.5 尤其擅长长期且庞杂的工作,例如代码库范围的迁移和审计。一位早期测试者用它审计并修复了一个 20 万行的代码库,耗时不到三小时,而 Opus 5 花了 20 多个小时,并使用了 2.5 倍的 token。在一项内部测试中,我们让 Opus 5.5 和 Fable 5.1 将 HAProxy(广泛用于在多台服务器之间平衡 Web 流量负载的软件)从 C 语言翻译为 Rust。两个重写版本几乎都通过了 HAProxy 自身的所有回归测试,但 Opus 5.5 在 9.5 小时内完成,而 Fable 5.1 用了 12 小时,且成本低 51%。

Opus 5.5 以极低的成本在智能体编程方面提供前沿成果。在 FrontierCode 的默认努力水平下,它以约每任务 20% 的成本击败 GPT-6 Astra。在 Terminal Bench 4.0 上,它以约 40% 的成本与 Astra 持平,而在 CursorBench 上,它以约三分之一的成本领先 GPT-5.6 Sol 11 分。

Terminal-Bench 4.0准确率与成本

Terminal-Bench 4.0 衡量模型在命令行界面内完成复杂、多步骤专业任务的能力。Opus 5.5 在默认努力水平下以约五分之一的成本击败最大努力水平的 Opus 5。它以约 40% 的成本与 GPT-6 Astra 持平。

我们的早期测试者报告了类似的效率和智能提升:

引述

“开发者希望智能体能够承担真实的软件工作并完成它。在我们跨 GitHub Copilot CLI 和 VS Code 的测试中,Claude Opus 5.5 使用的 token 和步骤是我们测量中最少的之一。在 VS Code 中,它用不到一半的步骤解决了比 Opus 5 更多的终端任务。它不仅让单个任务更高效,还让开发者更大的项目更可实现。”

公司GitHub

作者Mario Rodriguez,首席产品官

最安全的编程智能体

在其系统内使用智能体的企业需要知道这些智能体正按预期运行,尤其是当它们自主运行数小时时。Opus 5.5 有一个分类器,在每次操作运行前进行筛查;有一个安全团队可以审计的开源沙箱;以及能在漏洞合并前将其捕获的代码审查。

模型本身也具有更强的防御能力。在提示注入攻击方面,它在我们测试的每种设置中都达到或超过 Opus 5,包括编程、工具使用、计算机使用和网页浏览。在 AI 安全公司 Gray Swan 运行的一项基准测试中,Opus 5.5 与 Fable 5.1 并列,在所有测试模型中提示注入成功率最低。

知识工作

Opus 5.5 是一位可靠且娴熟的研究员。在一项内部测试中,我们让 Opus 5.5、Fable 5.1 和 Opus 5 仅使用它们在一个难以找到财报的网页副本上能找到的信息,撰写一份关于某公司季度业绩的报告。一个自动评分器将每一个数字和引文与来源进行核对。在不同的努力程度设置下,Opus 5.5 的报告中 18 份里有 16 份达到了我们的质量标准,而任何编造的数字或引文都会导致不合格。Fable 5.1 和 Opus 5 在任何尝试中都未能达到该标准。

它在财务分析和商业工作方面也很强。投资公司 Walleye Capital 作为早期测试者报告称,Opus 5.5 在其最低设置下基本解决了他们的评估套件;在更高设置下,它表现更好,甚至发现了他们评估说明中的一个错误并加以纠正。此前没有任何其他模型发现过这个错误。

在另一项测试中,我们让 Opus 5.5 和 Opus 5 分析两家虚构人力资源软件公司之间的拟议合并。两者都在 Excel 中构建了财务模型,然后将其转化为关于该交易按其价格是否合理的高管演示文稿。两个模型对这笔交易得出了相同结论,但 Opus 5.5 的模型更全面,其演示文稿更易读,而 Opus 5 的模型有轻微错误。Opus 5.5 用时 63 分钟完成,而 Opus 5 用时 93 分钟,且制作成本低 50%。

在知识工作评估中,Opus 5.5 表现优于其他模型,同时使用的 token 更少。在 GDPval-AA v2.1 这一涵盖 44 种职业的真实世界工作测试中,Opus 5.5 得分为 1846 Elo,领先于 Fable 5.1 和 Opus 5。在默认努力程度(中等)下,Opus 5.5 击败了以最大努力运行的 GPT-6 Astra,而每项任务成本约为其五分之一。它在衡量业务工作流程和大规模数据收集的基准测试中同样优于其他模型。

GDPval-AA v2.1Elo 与成本

Artificial Analysis 的 GDPval-AA v2.1 在 44 种职业的真实专业工作中评估智能体。在最大努力下,Opus 5.5 得分为 1846 Elo,而 Fable 5.1 得分为 1735,Opus 5 得分为 1708。在默认努力程度(中等)下,Opus 5.5 击败了以最大努力运行的 GPT-6 Astra,而每项任务成本约为其五分之一。

我们的客户也报告了类似结果。以下是他们告诉我们的关于使用该模型的体验:

引述

“即使在其最低努力设置下,Claude Opus 5.5 在我们的代码审查中也发现了 72% 的已知 bug,而 Opus 5 在高努力下为 56%,且误报更少,输出量仅为其一小部分。在美国咨询分析方面,低思考努力在输出量一半的情况下达到了其更高思考设置的水平,并通过了我们的质量检查。当更多较低思考努力被部署到生产环境中时,这意味着以高效方式交付客户可用的工作成果。”

公司Deloitte Consulting LLP

作者Carl Bennett,首席信息官

沟通

我们对 Opus 5.5 的写作和沟通方式做出了重大改进,这是关于 Opus 5 最常见的反馈领域之一。它的消息一眼看去就容易理解得多,测试人员表示这在长时间工作会话中很有帮助。它把最重要的信息放在前面,不太可能使用行话或特殊措辞,并遵循你给它的写作规则。我们发现这让 Opus 5.5 成为明显更好的协作者。以下是两个模型的并排比较:

Claude Opus 5

请向我解释这个问题。

我发现了什么

这多出来的下降不是免费套餐——它是0552feb中的一个回归(“将计费周期边界提取到periods.py”,标记为“无行为变更”)。

这个bug

aggregate.monthly_usage过去执行的是半开区间:

它现在执行的是:

而在periods.py中:

last_day是午夜的一个datetime,不是一整个天。从9月1日00:00减去一天得到8月31日00:00,而比较是包含边界的,所以该周期实际上结束于31日的第一个瞬间。每一个时间戳在当月最后一天午夜之后的事件都被静默丢弃——大约每个账户、每个月一天的用量。

新的test_periods.py没有捕获到它,因为它只检查last_day.date()(这是正确的2026-08-31)并在8月1日00:00、8月15日12:00、7月31日23:59和9月1日00:00测试contains——它从未探测31日内部的任何位置。

Claude Opus 5.5

请向我解释这个问题。

这多出来的下降是计费重构中的一个bug

免费层级的变更仅占acme八月账单的$1.50。另外的$9.92来自提交0552feb中的一个 bug。该提交被标记为“无行为变更”,但它停止统计每月最后一天的用量。

变更内容

合并之前,aggregate.py使用半开区间:

这次重构将其移入Period.contains,并使区间在错误的边界上闭合:

last_day是午夜时刻的时间戳,而非一整天。因此在2026-08-31T00:00:00Z之后的每个事件都被排除。九月周期从9 月 1 日开始,所以它也不会纳入这些事件。用量并未被移到其他月份;而是根本没有被计费。


我们客户的反馈印证了这些发现:

引述

“冗长、难以理解的输出一直是我对前沿模型最大的不满,而 Claude Opus 5.5 解决了这个问题。它写起来像一位好同事,并遵循我们的写作规则。一份设计规格说明几乎无需修改即可使用,当它重写我们的一个提示词时,我更喜欢它的版本。当它优化我们的测试套件时,我能轻松跟上它的推理,并放心地发布了这一变更。”

公司Ramp

作者John Ruelas,资深软件工程师

安全

为前沿发展定节奏

上周,我们的 CEO Dario Amodei 主张,AI 进展应当有节奏地推进,以便安全实践始终领先于模型能力。定节奏是一种方法,既能保障 AI 安全,又能与中国保持竞争力,并实现 AI 的益处,尤其是在生物学和医学等领域。

我们大体上了解当今模型所带来的风险,也具备充分的能力来管理它们。然而,随着能力提升,更严重的风险可能迅速出现,我们现在就需要为此做好准备。因此,我们的安全工作同时在两个时间维度上展开:

当前模型的安全实践。 当前一代模型依赖一套既定的实践:广泛的对齐测试、由 METR 和 Frontier Design 等外部组织进行的发布前评估,以及针对网络安全和生物学等高风险领域中每个模型能力相匹配的保障措施。我们在每次发布时都会完善这些实践。我们相信,这些实践适用于当今模型所构成的最严重风险,并且它们让我们能够广泛(尽管并不完美)地了解各类严重风险。

此外,我们会跟踪自身训练和评估对齐模型的能力,并在我们根据负责任扩展政策(我们为管理先进 AI 系统带来的灾难性风险而制定的自愿框架)发布的风险报告中,报告我们的公开模型和内部模型。

为未来模型做准备。 我们正在为更先进的模型提前准备训练和评估流程。我们正在收紧对强化学习所用环境的筛选方式,因为有缺陷的环境是导致行为失准的主要来源之一。此外,我们正在改进对齐奖励,并开发自动化流程,以生成用于安全训练的新的多样化场景。同时,我们正在加强安全与监控,包括一项重点努力,以改进基于可解释性的监控与评估。我们希望这类技术有助于减少我们对审计模型思维链(即模型在工作过程中写出的推理过程)的依赖。

能力更强的模型——例如能够完全自动化 AI 研究本身工作的模型——需要更高的安全标准。我们呼吁放慢节奏,很大程度上是基于我们预期这类模型可能很快就能被训练出来。对于这些模型,我们并不认为上述措施本身就能达到这一安全标准。随着 AI 能力不断增强,公共政策应在确保人们所依赖的系统安全方面发挥更大作用。这种能力需要时间建设,我们已经开始搭建支持它的基础设施,正如“我们必须放慢前沿步伐”以及我们最近与埃森哲的公告中所述;我们预计很快会分享有关这些努力的更多细节。我们还将继续与政府和行业进行政策讨论,包括监管方式和国际协调。

对齐

在我们的主要评估套件——一项在近 2,000 个场景中评估 Claude 的自动化行为审计——中,Opus 5.5 在几乎所有失准行为衡量指标上的得分都优于近期任何 Claude 模型。在大多数诚实度指标上,它也是我们最强的模型。

尤其是,Opus 5.5 在导致近期网络安全事件的若干行为上较前代模型有所改进,包括有偏见或有动机的推理、试图逃离沙箱,以及在断定自己处于模拟环境后采取有害行动。在一项旨在测试模型跨越遏制边界倾向的新评估中,Opus 5.5 试图绕过边界的频率比 Opus 5 或 Claude Mythos 5.1 低约 85%,而且它所做的每一次尝试都是低严重程度的,并且会自我报告。对于在代码库和系统中无人值守运行 Claude 的团队来说,这一点与原始能力同样重要。

然而,正如我们在最近的对齐评估中所描述的,构建能够在部署前可靠捕捉每一个失败的评估仍然是一个未解决的问题。我们看到有迹象表明,Opus 5.5 经常怀疑自己正在被评估,这挑战了我们评估它在各种真实世界部署环境中将如何行动的能力。随着这些环境的扩展和模型能力的提升,我们预计这一挑战将会加剧,除非我们在可解释性方面取得进展。尽管我们确信 Opus 5.5 在我们能够衡量的领域展现出广泛的改进,我们仍将自身的对齐工作与下文所述的安全保障措施相结合。

安全保障措施

随着我们的模型变得更加强大,更严格的保障措施是我们防止新能力沦为滥用工具的一种方式。Opus 5.5 是首个在网络安全、生物学和蒸馏方面采用与 Fable 5.1 类似类别保障措施的 Opus 模型,所有这些都会透明地回退到另一个模型。

网络安全。由于 Opus 5.5 具备极其强大的网络能力,我们正在对 Opus 5.5 应用与 Fable 5.1 类似的网络安全保障措施。用户将能够在常规软件开发生命周期中识别并修复其代码中的漏洞,但大多数网络安全任务将被重新路由至 Opus 4.8。

对于网络防御者,我们很快将把网络验证计划扩展至涵盖 Opus 5.5。新计划将包含三个层级,提供越来越宽松的可信访问权限,包括对 Claude Mythos 模型的访问。Claude Security 已可访问 Claude Mythos 5.1。

生物学。Opus 5.5 在生物学方面能力极强,在众多工作领域超越 Opus 5,并匹敌或胜过 Claude Mythos 5.1。例如,Opus 5.5 在与 Dyno Therapeutics 合作开展的一项长时程分子预测与设计评估中取得了改进,专家红队成员将其科学新颖性评为与他们测试过的最佳模型相当。

因此,Opus 5.5 使用与 Fable 5.1 相同的生物学保障措施。若要在受这些保障措施阻碍的情况下使用 Opus 5.5 进行研发工作,用户可申请我们新的生命科学验证计划,该计划为学术实验室、初创公司和制药公司等经过审核的机构提供针对全方位生物学相关工作的保障措施访问权限。有意向的机构可在此申请。

蒸馏

蒸馏攻击,即攻击者利用数千个虚假账户以工业规模提取模型能力,会带来安全和国家安全风险。蒸馏使恶意行为者能够在没有我们为 Claude 内置的保障措施的情况下创建高度强大的模型。我们的2026 年 9 月威胁情报报告详细介绍了我们迄今已检测并阻止的非法蒸馏活动。

Opus 5.5 在发布时采用了保留思考(preserved thinking),这是我们随 Fable 5.1 推出的反蒸馏保障措施。它阻止 API 用户编辑 Claude 的先前上下文以试图提取 Claude 的推理过程。它适用于 2026 年 8 月 31 日或之后创建的 API 账户的 Fable 5.1 和 Opus 5.5。我们的帮助中心文章解释了这一变更,我们的保留思考文档展示了如何测试和更新你的集成。

数据保留与合规

与之前的 Opus 模型一样,Opus 5.5 提供零数据保留。

与 Fable 5.1 一样,Opus 5.5 附带我们的水印措施,以符合欧盟《人工智能法案》,此处有讨论。此外,它不再支持关闭“思考”模式,正如我们在此处所述。

可用性

Claude Opus 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以通过 claude-opus-5-5 开始使用。详情请参阅我们的迁移指南。

来源:Anthropic News · anthropic.com