跳到正文
Anthropic News·· 2026-07-24精选AI 评分88

Anthropic 发布 Claude Opus 5,编码与知识工作基准达 SOTA

Introducing Claude Opus 5

AI 导读

Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,为每百万 input tokens 5 美元、output tokens 25 美元,在 Frontier-Bench、GDPval-AA 等编码与知识工作评测上达到新的 SOTA,但在网络安全任务上仍落后 Mythos 5。

推荐理由

官方给出 Opus 5 与 Opus 4.8、Fable 5 在编码与知识工作基准上的价格性能对比,可据此判断日常主力模型是否值得迁移。

正文 · AI 翻译

Claude Opus 5 今日起可用。它是一个深思熟虑且主动的模型,智能水平接近 Claude Fable 5 的前沿水准,而价格仅为其一半。

在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评估中,Opus 5 成为新的最先进水平,不过在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它比其他模型运行得更高效。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强的模型。

性能与成本效益

Claude Opus 5 在与前代 Opus 4.8 相同的成本下提供了大幅提升的性能。本节图表展示了性能如何随模型的 effort 设置而变化,客户可利用该设置来优化智能水平,或节省 token 以获得更快、更便宜的结果。

Opus 5 在重要的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,在更低的单任务成本下性能达到 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,以最大 effort 运行时,该模型的性能与 Fable 5 的峰值得分相差不到 0.5%,但单任务成本仅为其一半;在 high、xhigh 和 max effort 下,它在给定成本下的性能也优于所有其他模型。

我们在知识工作和问题解决任务上看到了类似的结果。例如:

  • 在 ARC-AGI 3 上,这是一项要求模型解决新颖问题的评估,Opus 5 的得分是次优模型的三倍。
  • 在 Zapier AutomationBench 上,该评估衡量模型能否从头到尾完成业务任务,在相同的单任务成本下,Opus 5 的通过率约为次优模型的 1.5 倍。即使在其最低 effort 设置下,Opus 5 通过的任务也比任何其他模型都多。
  • 在 OSWorld 2.0 这一计算机使用基准上,Opus 5 在任意给定成本下都优于所有其他模型,以略高于三分之一成本超越了 Fable 5 的最佳成绩。

在若干相关评估中,它也是我们最佳且最具成本效益的模型:

在科学研究方面,Opus 5 相比 Opus 4.8 有显著提升。在我们所有的生命科学评估中,它的表现都优于 Opus 4.8,这些评估涵盖结构生物学、有机化学和生物信息学等主题。其提升在有机化学任务上最为显著,例如从光谱数据推断分子结构(在我们的内部基准上比 Opus 4.8 高出 10.2 个百分点),以及在蛋白质相关任务上,例如预测蛋白质序列变异如何影响其功能(此处高出 7.7 个百分点)。

最后,Opus 5 能够生成强得多的视觉输出:

使用 Claude Opus 5

Claude Opus 5 在验证自身工作并仔细迭代直至成功方面强得多。在评估和早期访问测试中,我们和我们的用户发现了许多体现 Opus 5 主动性和彻底性的例子:

  • 在一个 Frontier-Bench 任务中,Opus 5 拿到一张机械零件图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在该任务中,模型被有意设置为无法直接查看图纸。Opus 5 的应对方式是编写自己的计算机视觉流程,从原始像素中提取几何信息,然后重建出完整的机械零件。它反复成功做到了这一点;在相同设置下,没有任何竞争模型能在五次尝试后解决该任务。
  • 给定一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。一个竞争模型只修复了表面症状(而非底层原因),然后报告 bug 已解决。
  • 一家交易公司的工程师使用 Opus 5 在一次会话中为新交易所构建了一个市场数据源。之前的模型完全无法完成这项任务,即使工程师提供了详尽的计划。由于没有实时数据源可供验证,Opus 5 甚至构建了自己的测试框架,以检查其代码是否正确解析了交易所的数据。

以下是我们早期访问客户关于使用 Opus 5 体验的更多反馈:

 logo

在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本接近 Fable 级别的性能。在 Devin 中,它在困难的调试和根因分析任务上也表现出特别的优势。

 logo

Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能。在 CursorBench 上,它仅次于 Fable 5,并具有许多相同的行为。我们很期待看到开发者如何在 Cursor 中使用它。

 logo

Claude Opus 5 登顶了 Zapier 的 AutomationBench 排行榜,且消耗的 token 并不比之前的 Claude 模型多。它拿到一份原始账户健康工作簿,端到端地运行了完整的防流失流程:标记高风险账户、通知正确的负责人,并为留存运营做总结。之前的模型未能通过;Opus 5 达到了 100%。

 logo

在我们的基因组学分析工作中,Claude Opus 5 表现得比我们运行过的任何模型都更像一位严谨的科学家。它会选用正确的统计检验来排除混杂因素,通过独立方法交叉核对自己的结果,并在漫长的多步骤分析中保持正轨。

 logo

Claude Opus 5 在我们内部评估中超越了其家族中的每一个模型。它不仅在我们最困难的智能体编程任务上表现更好,比 Opus 4.7 提升了 22%,而且更稳定,每次运行之间的差异要小得多。对于 Lovable 上数百万的构建者来说,这种一致性就是一切。一次又一次的构建,结果都可靠。

 logo

Claude Opus 5 是 Opus 家族自 4.5 以来最大的飞跃。在相同的全栈应用构建中,前端最先体现出来:这是我们见过的 Opus 模型中最出色的动画、游戏和 3D 作品。

 logo

我们非常喜欢 Claude Opus 5。对于我们的智能体所处理的那种开放式分析工作,它相比 Opus 4.8 是严格的升级,而且提升最大的地方恰恰是最重要的地方:更难、更模糊的任务。回答更清晰、更简洁,我们还看到在更高努力水平下效率也有所提升。

 logo

对于我们的分析师每天运行的金融研究工作流,Claude Opus 5 相比 Opus 4.8 是显著的改进。它在数值推理、表格处理以及精度至关重要的更敏锐的批判性思维方面表现突出。

 logo

Claude Opus 5 提供了分析专业企业内容所必需的行业智能和准确性。Box 发现 Opus 5 比 Opus 4.8 高出 8%,并在技术、医疗和公共部门组织日常依赖的数据分析(提升 11%)和尽职调查(提升 17%)工作流中带来了显著的性能提升。

 logo

Claude Opus 5 相比 Opus 4.8 是明显的代际跃升。在一个周末里,我让它担任我的开发环境的幕僚长:它构建了自己的监控程序,驱动每一台机器,只在需要做判断时才会找我。

 logo

Claude Opus 5 对我们的 Fundamental Research Assistant 代码库进行了大规模修改,在整个智能体工作流中根据反馈进行调整,并且比我们用过的任何模型都更清晰地解释其推理过程。它处理了我们通常会拆分成更小片段的工作。

 logo

在我们一些最困难的金融建模任务上,Claude Opus 5 在准确性和效率上都明显优于 Opus 4.8。它的性能下限显著更高,尤其是在深度金融领域逻辑方面。在各个努力级别上,它平均准确率高出 9 个百分点,同时轮次和工具调用减少了三分之一,时间减少了 60%。

 logo

Claude Opus 5 会像真正的前端开发者那样检查自己的工作。在我们的基准测试中,它以桌面和手机宽度在浏览器中打开自己的页面,发现了一个隐藏在移动端折叠线以下的产品和一个屏幕外的结账按钮,并在交回工作之前修复了这两处问题。

 logo

与之前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上的性能明显提升,我们在公司治理和仲裁等实践领域看到了最大的收益。Opus 5 在较低推理级别下保持质量的能力也让我们印象深刻,与最大推理级别的 Opus 4.8 相比,它在平均生成 token 数减少 26% 的同时实现了相近的性能。

 logo

Claude Opus 5 对我们最大的提升在于更长周期的工作:构建完整的演示文稿,然后修改它。产物质量决定了我们交付哪个模型,而这是我们见过的最明显的进步——更好的视觉理解、更整洁的格式、更少的幻灯片问题。

 logo

Claude Opus 5 的判断力最为突出。在交接 PR 时,它不会急于发布:它会验证分支、检查模板,并思考测试影响,从而使交接干净利落。较旧的模型往往会贸然推进,然后被我们的检查卡住。

 logo

在一次重构会话中,Claude Opus 5 对我提出的一个设计提出了反对意见,而且在我坚持时它没有让步。相反,它准确解释了我的想法中有价值的部分,将其反对意见缩小到一个设计问题上,并提出了一个折中方案,保留了好的部分同时修复了缺陷。正是这种判断力让我们能够以更少的监督信任它。

 logo

在第一轮红线修订上,Claude Opus 5 在我们测试的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论也更好:在 NDA 上,它用更少的时间、更少的轮次完成红线修订,同时准确性保持或更好。

 logo

Claude Opus 5 写出干净、紧凑的 diff,没有死代码,而且在微妙的、特定于代码库的问题上是更强的隐患发现者。我们正在将其用于生产工作负载。

 logo

我们肯定会迁移 Cosmos(我们的统一智能体平台)中的许多用例。我们期待越来越多地将 Claude Opus 5 用于代码审查,而且我有信心说,我们宁愿人们使用 Opus 5 而不是 Opus 4.8。

 logo

Claude Opus 5 的突出之处在于判断力。它在写下一行代码之前会思考得更深入,在规划期间而不是事后发现自己的逻辑错误,并且会推理一个答案为什么正确,而不仅仅是它是否可行。这是我们从一代 Claude 模型到下一代所见过的最明显的问题解决能力跃升,我们期待看到它在 JetBrains IDE 中被采用。

 logo

Claude Opus 5 是我们交易基准测试中测试过的最强 Opus 模型,而且它只用了大约七分之一的推理 token 和不到 Opus 4.8 一半的延迟就达到了这一水平。以一小部分算力获得更好的答案。

 logo

Claude Opus 5 让监控代理在生产环境中管理自身记忆的一部分,使其在更长的时间跨度内更加自主、可靠。该代理将自己的上下文视为一份活的文档:在标记出我们某项服务中的潜在异常后,它会对照生产环境重新核验自己的假设,发现该信号是良性的,便将更正写入自己的记忆,并自行停用了其监控查询。

 logo

Claude Opus 5 是一款强大的代理式编程模型,专为长时间、多步骤的工作而打造。它深入理解你的代码库,能在复杂任务中保持思路连贯,并比 Opus 4.8 更有效地厘清功能开发和缺陷修复的需求。开发者现在可以在 Kiro 中使用 Opus 5 进行构建,借助其先进能力来攻克雄心勃勃的项目。

01 /

24

对齐与安全

对齐。在部署前测试中,我们的自动化行为审计发现,Opus 5 是我们迄今为止对齐程度最高的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵循Claude 宪法;表现出最低的欺骗行为发生率;也最不容易被诱骗而遭到滥用。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们迄今最安全的模型。

在我们的自动化行为审计中,Opus 5 的整体失准行为得分为 2.3,是我们近期模型中最低的。

安全。Opus 5 并未在具有风险的两用能力上推进前沿。在与私营部门和政府合作伙伴共同开展的严格评估中,我们发现它在生物学研究和攻击性网络安全两方面仍落后于 Mythos 5。有关这些评估的更多信息,请参见我们的系统卡。

与其前代 Opus 4.8 一样,我们有意避免在网络安全任务上训练 Opus 5。尽管如此,由于整体能力提升,该模型在这些任务上仍有了大幅改进,在发现网络安全漏洞方面已接近 Mythos 5。然而,在利用这些漏洞方面——也就是将漏洞转化为实质性网络威胁方面——它仍大幅落后于 Mythos 5。

Opus 5 在 OSS-Fuzz 上的表现说明了这一点。OSS-Fuzz 是我们开发的一项评估,用于衡量模型在缺乏大量人工指导的情况下发现并进而利用漏洞的能力。尽管 Mythos 5 和 Opus 5 发现漏洞的成功率相近,但 Opus 5 在开发漏洞利用程序方面的得分远落后于 Mythos 5。

在我们的网络安全评估之一 OSS-Fuzz 上,Opus 5 在识别软件漏洞方面接近 Mythos 5(左),但在为其开发漏洞利用程序方面成功率明显更低(右)。

Opus 5 的保障措施

Claude Opus 5 的保障措施旨在允许该模型在网络安全和生物学领域的有益用途。它们与我们应用于 Opus 4.8 的措施类似,不同之处在于对一小部分网络任务设置了更强的护栏。

网络安全。Opus 5 的网络分类器限制程度相应低于 Fable 5 上的分类器。它们允许 Opus 5 在源代码中查找漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关的方法)、渗透测试以及漏洞利用程序生成。

根据我们的测试,我们预计分类器的干预频率将比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。在 API 上也可以启用回退到 Opus 4.8。

我们的网络验证计划(CVP)为原本会因模型安全防护而受阻的网络安全工作提供便利。已经加入 CVP 的企业和研究人员可以立即访问安全限制更少的 Opus 5 版本。

生物学。由于 Opus 5 拥有与 Opus 4.8 类似的安全防护套件,它现在是我们最强大的通用可用科学研究模型。尽管如此,该模型在长时间运行的自主研究任务上仍显示出重要局限,而我们预计 AI 模型正是在这类任务上会带来最重大的生物学相关风险。(Mythos 5 仍是这类生物学工作的更强模型。)作为本次发布的一部分,在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5,而不是 Opus 4.8。

开始使用

Claude Opus 5 今天已在所有平台上线,定价为每百万输入 token 5 美元、每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始。

它还提供 Fast 模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,Fast 模式在 Claude Platform 上以 Opus 5 基础价格的两倍提供,并可通过 Claude Code 中的使用额度使用。

与 Opus 5 一同发布的还有两项测试版更新:

  • Claude Platform 上的对话中途工具更改。在对话中,开发者现在可以更改 Claude 可使用的工具,而不会使提示缓存失效。
  • API 上的自动回退。用户现在可以选择让 Opus 5(或 Fable 5)上被我们的安全分类器标记的请求自动路由到另一个模型。启用自动回退后,API 请求默认始终路由到最佳可用模型,而不是被阻止。

与之前的 Opus 模型一致,Opus 5 对一般访问没有数据保留要求。

有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示指南。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球运营中整合安全的企业级 AI 系统。

阅读更多

Claude 发现一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:Claude 仅在我们的科学家提供高层指导的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com