跳到正文
Anthropic News·· 2026-06-30精选AI 评分88

Anthropic 发布 Claude Sonnet 5,主打智能体能力与低价

Introducing Claude Sonnet 5

AI 导读

Anthropic 发布 Claude Sonnet 5,称其为迄今最具智能体能力的 Sonnet 模型,可制定计划、调用浏览器和终端等工具并自主执行,性能接近 Opus 4.8 但价格更低。

推荐理由

官方给出 Sonnet 5 与 Sonnet 4.6、Opus 4.8 的能力与价格对比,可据此判断智能体编码任务的性价比选择。

正文 · AI 翻译

Claude Sonnet 5 被打造为迄今为止最具智能体能力的 Sonnet 模型。它能够制定计划、使用浏览器和终端等工具,并以自主方式运行,其水平在几个月前还需要更大、更昂贵的模型才能实现。

对许多开发者而言,智能体 AI 时代始于 Sonnet 级模型:Claude Sonnet 3.5、3.6 和 3.7 是首批在编程和工具使用方面展现出令人印象深刻能力的模型。不过,最近智能体能力最明显的提升出现在我们的 Opus 级模型中。

Sonnet 5 缩小了这一差距:其性能接近 Opus 4.8,但价格更低。在推理、工具使用、编程和知识工作等智能体性能的重要方面,它相比前代 Sonnet 4.6 有实质性提升:

Claude Sonnet 5 benchmark table
Sonnet 5 在多项评估中的得分,与 Sonnet 4.6 和 Opus 4.8(作为参考的通用能力更强的模型)的对比。Claude Sonnet 5 系统卡详细报告了更广泛的评估结果。

我们的安全评估发现,Sonnet 5 的整体不良行为发生率低于 Sonnet 4.6,在智能体场景中使用通常也更安全。评估还显示,其执行网络安全任务的能力远低于我们当前的 Opus 模型。

从今天起,Claude Sonnet 5 已在所有套餐中可用:它是 Free 和 Pro 套餐的默认模型,Max、Team 和 Enterprise 用户也可使用。其定价为每百万输入 token 2 美元,每百万输出 token 10 美元。开发者可通过 Claude API 使用 claude-sonnet-5。

使用 Claude Sonnet 5

下图对比了 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 在不同 effort 水平下,在智能体搜索评估 BrowseComp 和计算机使用评估 OSWorld-Verified 中的表现。Sonnet 5(橙色线)相比 Sonnet 4.6(灰色线)是严格意义上的提升,并且覆盖了比 Opus 4.8(黄色线)更宽泛的成本-性能选择范围。它在中等 effort 下提供了显著改善的成本效率;其更高 effort 下的性能在某些任务上可媲美 Opus 4.8。在 Sonnet 5 和 Opus 4.8 之间,用户可以调整 effort 水平,以找到成本与性能的合适平衡。

来自我们早期访问合作伙伴的反馈是一致的:Sonnet 5 比其前代更具智能体能力。测试者描述了它如何完成此前 Sonnet 模型会中途停止的复杂任务,如何在没有明确要求的情况下检查自己的输出,以及如何以有吸引力的价格完成所有这些智能体工作:

 logo

Claude Sonnet 5 为我们的智能体提供了强大的执行层,用于多步骤软件工程工作。它能在混乱的技术环境中很好地处理持续编程、工具使用和调试,对于需要坚持到底和技术依据的工作流尤其有用。

 logo

我们交给 Claude Sonnet 5 一项分两部分的任务——更新 Salesforce 客户层级,向企业联系人发送发布公告——它端到端完成了。过去这会在中途卡住。对于日常自动化来说,这是毫无疑问的选择。

 logo

Claude Sonnet 5 用更少资源完成更多工作。输出质量相同,达成所需的步骤更少。它也能干净、一致地拒绝不安全请求。在 Lovable,我们正将强大的工具交到数百万构建者手中。一个知道何时说不的模型,与一个知道如何构建的模型同样重要。

 logo

我们将 Claude Sonnet 5 用于数十个最具挑战性的真实拉取请求,它独立地将每一个都推进到经过测试、验证的结果——让我们的工程师得以专注于判断、决策和最终签核。

 logo

我让 Claude Sonnet 5 调查一个 bug。它未经提示就编写了一个复现测试,实现了修复,然后将其暂存以确认在没有该改动的情况下 bug 会复现。全部一次完成。

 logo

借助 Claude Sonnet 5,智能体能够按计划执行、遵循我们的规范,并交付干净的多步骤变更,而且成本高效。

 logo

Claude Sonnet 5 在遗留代码上表现最佳——竞态条件、隐藏测试,那些没人愿意碰的部分。它能将故障追溯到真正的根本原因,并交付持久的修复,而不是只修补表面症状。

 logo

Claude Sonnet 5 处于 Eve 原告法律任务的帕累托前沿。我们在法律研究和分析方面看到了最明显的提升,其性价比之高让迁移的选择变得轻而易举。

 logo

ClickHouse 智能体探索实时数据并即时生成洞察,因此在测试新模型时,洞察所需时间至关重要。Claude Sonnet 5 以更紧凑的步骤进行推理,让我们的用户明显更快地得到答案。这种速度是我们的客户能感受到的差异。

 logo

在 Pace,我们的计算机使用智能体在运营团队已经在使用的系统上运行保险工作流——投保单录入、FNOL、损失运行报告。Claude Sonnet 5 始终采取正确的行动并迅速完成,这正是真实保险工作所要求的。

 logo

对于管理高容量、复杂工作负载的企业团队而言,Claude Sonnet 5 代表着真正的进步——在关键之处性能强劲,同时具备使规模化变得切实可行的速度和成本表现。在若干复杂任务上,它超越了当前的前沿水平,同时以低成本提供快速响应。对于大规模运营的企业来说,这是实实在在的运营优势。

 logo

Claude Sonnet 5 处理了我们测试的全部编码任务,同时解决了更多问题。它在质量和效率上都是显著的提升。

Kiro logo

Claude Sonnet 5 是一个强大的智能体编码模型,提供可与 Opus 级模型媲美的顶级准确性,并相较 Sonnet 4.6 有明确的阶跃式提升。它进行彻底的探索,并在复杂任务上明显更持久地保持专注。

01 /

13

安全评估

我们的部署前安全评估发现,Sonnet 5 总体上比 Sonnet 4.6 有所改进。在智能体安全方面,该模型更善于拒绝恶意请求,并抵御提示注入攻击中的劫持企图。该模型表现出比 Sonnet 4.6 更低的幻觉和谄媚率。在我们的自动化行为审计中(该审计测试包括配合滥用和欺骗在内的多种失准行为),Sonnet 5 总体得分更低(即更安全)。然而,与能力更强的 Opus 4.8 和 Claude Mythos Preview 相比,它在此评估中确实表现出略高的失准行为率。

Rates of misaligned behavior across Claude models
我们的自动化行为审计中的失准行为率,该审计测试在许多情况和情境下范围极广的不良行为(完整列表及每种具体行为的结果见 Sonnet 5 系统卡第 6.4 节)。Sonnet 5 的总体失准行为率低于 Sonnet 4.6,但高于 Mythos Preview 和 Opus 4.8。

我们并未刻意针对网络安全任务训练 Sonnet 5。它可以执行一些常规、无害的网络任务,但在测试潜在危险网络技能的评估中,例如开发软件漏洞利用程序,它的表现明显不如 Opus 4.8 和 Mythos 5 等模型。下图展示了一项评估的得分,该评估测试了模型为 Firefox 浏览器中的漏洞开发利用程序的能力。Sonnet 5 始终无法开发出完整可用的利用程序,但它的部分成功率略高于 Sonnet 4.6。后一变化可能源于通用智能的提升,而非专门的训练。

Scores measuring Claude models’ success at developing exploits for software vulnerabilities in Firefox 147
衡量模型为 Firefox 147 中的软件漏洞开发利用程序成功率的得分(该评估是与 Mozilla 合作开发的;所有漏洞均已在 Firefox 148 中修复)。对于每个模型,左侧柱形显示模型(在无安全防护措施下)开发出可用利用程序的频率;右侧柱形显示模型部分成功的频率。两个 Sonnet 模型均无法成功开发出可用利用程序(得分均为 0.0%);Sonnet 5 的部分成功率略高于 Sonnet 4.6。两个 Sonnet 模型的网络能力均明显弱于 Opus 4.8 和 Mythos 5。完整详情请参见 Sonnet 5 系统卡第 3.2.4 节。

由于 Sonnet 5 在这些任务上比其前代略强,我们在发布时默认启用了网络防护措施。这些防护措施——可实时检测并阻止危险的网络使用——与 Claude Opus 4.7 和 4.8 中的相同(因为我们判断 Sonnet 5 的整体网络安全风险水平较低,所以这些防护措施不如随 Fable 5 发布的那么严格,后者会阻止范围广得多的网络安全任务)。1

我们在众多安全与能力评估中对 Sonnet 5 的完整评估结果报告于 Claude Sonnet 5 系统卡中。

可用性与定价

Claude Sonnet 5 今日已在各处上线,价格为每百万输入 token 2 美元、每百万输出 token 10 美元2。我们提高了 Chat、Cowork、Claude Code 和 Claude Platform3 的速率限制,以适应更高努力水平带来的更高 token 用量;用户可以选择最适合其具体项目的水平。

更新日志

2026 年 8 月 10 日编辑:Sonnet 5 每百万输入 token 2 美元、每百万输出 token 10 美元的 introductory 定价现已永久生效。此前定于 9 月 1 日生效的每百万输入 3 美元 / 输出 15 美元的标准定价不再适用。本文中的定价引用已相应更新。

2026 年 6 月 30 日编辑:在本文原始版本中,我们包含了一张 BrowseComp 评估的成本-性能图表,该图表基于一种更简单方法的数据,未反映我们用于智能体搜索评估的标准方法。这导致低估了 Sonnet 5 在该评估中的表现。

我们现在已更新该图表,使其与我们在 Sonnet 5 系统卡中使用并讨论的方法一致(该方法使用 1000 万 token 预算,并配合压缩和程序化工具调用)。我们还更新了相关文字。

相关内容

Anthropic 投资 1 亿美元培训 1 万名工程师,以弥合企业 AI 人才缺口

Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 1 万名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩大 Claude 应用规模,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:Claude 仅在我们科学家提供高层级方向的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com