跳到正文
Anthropic News·· 2025-11-24精选AI 评分88

Anthropic 发布 Claude Opus 4.5,主打编码与智能体能力

Introducing Claude Opus 4.5

AI 导读

Anthropic 发布新模型 Claude Opus 4.5,即日起在 Claude 应用、API 及三大云平台上线,API 型号为 claude-opus-4-5-20251101,定价为每百万 token 5 美元输入、25 美元输出。

推荐理由

官方给出 Opus 4.5 的定价、effort 参数与多项基准对比,可据此判断前沿模型成本与能力的新平衡点。

正文 · AI 翻译

我们最新的模型 Claude Opus 4.5 今天正式发布。它智能、高效,是全球最适合编程、智能体和计算机使用的模型。它在深度研究以及处理幻灯片和电子表格等日常任务上也明显更胜一筹。Opus 4.5 是 AI 系统能力的一次进步,也预示着工作方式将迎来更大的变革。

Claude Opus 4.5 在真实世界软件工程测试中达到最先进水平:

Chart comparing frontier models on SWE-bench Verified where Opus 4.5 scores highest

Opus 4.5 今天已在我们的应用、我们的 API 以及全部三大云平台上提供。如果你是开发者,只需通过 Claude API 使用 claude-opus-4-5-20251101 即可。价格现为每百万 token 5 美元/25 美元——让 Opus 级别的能力惠及更多用户、团队和企业。

除 Opus 之外,我们还发布了 Claude 开发者平台、Claude Code 以及我们的消费者应用的更新。新增了用于长时间运行智能体的工具,以及在 Excel、Chrome 和桌面端使用 Claude 的新方式。在 Claude 应用中,冗长的对话不再撞墙。详情请见下方以产品为重点的章节。

第一印象

在发布前,我们的 Anthropic 同事对模型进行了测试,我们听到了高度一致的反馈。测试者指出,Claude Opus 4.5 能处理模糊性并权衡取舍,无需手把手指导。他们告诉我们,当面对一个复杂的、跨系统的 bug 时,Opus 4.5 能找出修复方案。他们说,几周前对 Sonnet 4.5 来说几乎不可能完成的任务,如今已触手可及。总体而言,我们的测试者告诉我们,Opus 4.5 就是“懂”。

我们许多提前获得访问权限的客户也有类似体验。以下是他们告诉我们的一些例子:

 logo

Opus 模型一直是“真正的 SOTA”,但过去成本高得令人望而却步。Claude Opus 4.5 现在的价格点使其可以成为你大多数任务的首选模型。它是明显的赢家,展现出我们迄今见过的最佳前沿任务规划和工具调用能力。

 logo

Claude Opus 4.5 能交付高质量代码,并擅长借助 GitHub Copilot 驱动重载智能体工作流。早期测试显示,它超越了内部编程基准,同时将 token 使用量减半,尤其适合代码迁移和代码重构等任务。

 logo

Claude Opus 4.5 在我们的内部基准上击败了 Sonnet 4.5 和竞争对手,用更少的 token 解决同样的问题。规模化之后,这种效率会不断累积。

 logo

Claude Opus 4.5 在 Lovable 的聊天模式中提供前沿推理能力,用户可在其中规划并迭代项目。它的推理深度改变了规划——而出色的规划让代码生成更加出色。

 logo

Claude Opus 4.5 擅长长周期、自主任务,尤其是那些需要持续推理和多步骤执行的任务。在我们的评估中,它处理复杂工作流时更少走入死胡同。在 Terminal Bench 上,它比 Sonnet 4.5 提升了 15%,这一显著增益在使用 Warp 的 Planning Mode 时尤为明显。

 logo

Claude Opus 4.5 在我们的基准上为复杂企业任务取得了最先进的结果,在结合信息检索、工具使用和深度分析的多步骤推理任务上超越了此前的模型。

 logo

Claude Opus 4.5 在我们最难的评估中带来更强的结果,并在 30 分钟的自主编程会话中保持稳定表现,在最重要的地方带来可衡量的提升。

 logo

Claude Opus 4.5 代表了自我改进型 AI 智能体的一项突破。在办公任务自动化方面,我们的智能体能够自主优化自身能力——在 4 次迭代中达到峰值性能,而其他模型在 10 次之后仍无法达到同等质量。它们还展示了跨技术任务从经验中学习的能力,能够存储洞见并在之后加以应用。

 logo

Claude Opus 4.5 相比此前的 Claude 模型在 Cursor 中有显著提升,在困难编程任务上具备更优的价格和智能水平。

 logo

Claude Opus 4.5 是 Anthropic 推动通用智能前沿的又一例证。它在困难编程任务上表现极为出色,展现出长期目标导向的行为。

 logo

Claude Opus 4.5 完成了一次令人印象深刻的跨两个代码库和三个协同智能体的重构。它非常细致,帮助制定了稳健的计划,处理了细节并修复了测试。相比 Sonnet 4.5 是明显的进步。

 logo

Claude Opus 4.5 比我们测试过的任何模型都更高效地处理长周期编程任务。它在留出测试上取得更高的通过率,同时使用的 token 最多减少 65%,让开发者在不牺牲质量的情况下真正掌控成本。

 logo

我们发现 Opus 4.5 擅长理解用户的真实意图,首次尝试即可生成可分享的内容。结合其速度、token 效率和出乎意料的低成本,这是我们首次在 Notion Agent 中提供 Opus。

 logo

Claude Opus 4.5 擅长长上下文叙事,能生成 10-15 页的章节,结构严谨且一致性出色。它解锁了我们此前无法可靠交付的用例。

 logo

Claude Opus 4.5 为 Excel 自动化和财务建模树立了新标准。在我们内部评估中的准确率提升了 20%,效率提升了 15%,曾经看似遥不可及的复杂任务如今变得可以实现。

 logo

Claude Opus 4.5 是唯一能搞定我们一些最难 3D 可视化的模型。精致的设计、有品位的 UX,以及出色的规划与编排——同时 token 使用更高效。此前模型需要 2 小时的任务现在只需三十分钟。

 logo

Claude Opus 4.5 在代码审查中能发现更多问题,同时不牺牲精确度。对于大规模生产代码审查而言,这种可靠性至关重要。

 logo

基于用我们的编程智能体 Junie 进行的测试,Claude Opus 4.5 在所有基准测试中均优于 Sonnet 4.5。它解决任务所需的步骤更少,因此使用的 token 也更少。这表明新模型更精确,能更有效地遵循指令——这是我们非常兴奋的方向。

 logo

effort 参数非常出色。Claude Opus 4.5 感觉是动态的,而非过度思考,在较低 effort 下即可交付我们所需的同等质量,同时效率大幅提升。这种控制力正是我们的 SQL 工作流所需要的。

 logo

我们看到 Claude Opus 4.5 将工具调用错误和构建/lint 错误都减少了 50% 到 75%。它以更少的迭代次数、更可靠的执行,持续完成复杂任务。

 logo

Claude Opus 4.5 表现流畅,没有我们在其他前沿模型上看到的那些粗糙边缘。速度提升非常显著。

01 /

21

评估 Claude Opus 4.5

我们给 prospective performance engineering 候选人一个出了名困难的 take-home 考试。我们也将新模型放在这个考试上作为内部基准进行测试。在我们规定的 2 小时时限内,Claude Opus 4.5 的得分高于任何人类候选人1。

这个 take-home 测试旨在评估时间压力下的技术能力和判断力。它并不测试候选人可能具备的其他关键技能,比如协作、沟通,或多年积累形成的直觉。但这个结果——一个 AI 模型在重要技术技能上胜过优秀候选人——引发了关于 AI 将如何改变工程这一职业的问题。我们的 Societal Impacts 和 Economic Futures 研究旨在理解许多领域中的这类变化。我们计划很快分享更多结果。

软件工程并不是 Claude Opus 4.5 唯一取得改进的领域。各项能力全面提升——Opus 4.5 在视觉、推理和数学技能上都优于其前代模型,并且在许多领域达到最先进水平:2

Comparison table showing frontier model performance across popular benchmarks

该模型的能力超出了我们测试中使用的一些基准。衡量 agentic 能力的一个常见基准是 τ2-bench,它衡量 agents 在真实世界多轮任务中的表现。在一个场景中,模型必须扮演航空公司服务 agent,帮助一位焦急的客户。该基准期望模型拒绝修改基础经济舱预订,因为航空公司不允许更改这类机票。相反,Opus 4.5 找到了一种有洞察力(且合法)的解决问题方式:先升级舱位,然后再修改航班。

Let me think about what options I have within my policy:

1. Modify flights - Basic economy cannot be modified. This is clear in the policy.
2. Change cabin - Wait, let me check this option! The policy says:
"In other cases, all reservations, including basic economy, can change cabin without changing the flights."

But he wants to change the flights, not just the cabin. However, what if we:
- Change the cabin first (which IS allowed for basic economy), then
- Change the flights (which is allowed for non-basic economy)

So the strategy could be:
1. Upgrade his cabin from basic economy to economy (or business)
2. Then modify the flights to be 2 days later

This would cost more money, but it’s a legitimate path within the policy!

该基准在技术上将此评为失败,因为 Claude 帮助客户的方式出乎意料。但这种创造性的问题解决正是我们从测试者和客户那里听到的——它让 Claude Opus 4.5 感觉像是一次有意义的进步。

在其他情境中,找到绕过预期约束的巧妙路径可能会被视为 reward hacking——即模型以非预期方式“钻”规则或目标的空子。防止这种 misalignment 是我们安全测试的目标之一,将在下一节讨论。

安全方面的一步前进

正如我们在 system card 中所述,Claude Opus 4.5 是我们迄今发布的对齐最稳健的模型,而且我们怀疑,它也是任何开发者中对齐最好的前沿模型。它延续了我们朝向更安全、更可靠模型的趋势:

在我们的评估中,“令人担忧的行为”分数衡量非常广泛的 misaligned 行为,包括与人类滥用的合作,以及模型自行采取的不良行动 [3]。

我们的客户经常使用 Claude 处理关键任务。他们希望得到保证:面对黑客和网络犯罪分子的恶意攻击,Claude 具备避免麻烦的训练和“街头智慧”。借助 Opus 4.5,我们在抵御 prompt injection 攻击的稳健性方面取得了实质性进展,这类攻击会偷偷加入欺骗性指令,诱使模型做出有害行为。Opus 4.5 比业内任何其他前沿模型都更难被 prompt injection 欺骗:

请注意,该基准测试仅包含非常强的提示注入攻击。它由 Gray Swan 开发和运行。

你可以在 Claude Opus 4.5 系统卡中找到我们所有能力与安全评估的详细描述。

Claude 开发者平台上的新功能

随着模型变得更智能,它们可以用更少的步骤解决问题:更少的回溯、更少的冗余探索、更简洁的推理。Claude Opus 4.5 使用比其前代产品少得多的 token 即可达到相似或更好的结果。

但不同的任务需要不同的权衡。有时开发者希望模型持续思考一个问题;有时他们想要更敏捷的东西。借助 Claude API 上新的 effort 参数,你可以决定是最小化时间和花费,还是最大化能力。

设置为中等 effort 级别时,Opus 4.5 在 SWE-bench Verified 上达到 Sonnet 4.5 的最佳得分,但使用的输出 token 减少了 76%。在最高 effort 级别下,Opus 4.5 的性能超过 Sonnet 4.5 达 4.3 个百分点——同时使用的 token 减少了 48%。

借助 effort 控制、上下文压缩和高级工具使用,Claude Opus 4.5 运行更久、做得更多,并且需要更少的干预。

我们的上下文管理和记忆能力可以大幅提升智能体任务的性能。Opus 4.5 在管理子智能体团队方面也非常高效,能够构建复杂且协调良好的多智能体系统。在我们的测试中,所有这些技术的结合将 Opus 4.5 在深度研究评估中的性能提升了近 15 个百分点4。

我们正在让开发者平台随着时间推移变得更具可组合性。我们希望为你提供构建模块,让你能够精确构建所需的内容,并完全掌控效率、工具使用和上下文管理。

产品更新

像 Claude Code 这样的产品展示了当我们对 Claude 开发者平台所做的各类升级汇聚在一起时所能实现的可能性。Claude Code 随 Opus 4.5 获得两项升级。Plan Mode 现在能构建更精确的计划并更彻底地执行——Claude 会预先提出澄清性问题,然后在执行前构建一个用户可编辑的 plan.md 文件。

Claude Code 现在还可在我们的桌面应用中使用,让你可以并行运行多个本地和远程会话:也许一个智能体修复 bug,另一个研究 GitHub,第三个更新文档。

对于 Claude 应用用户来说,长对话不再碰壁——Claude 会根据需要自动总结较早的上下文,因此你可以继续聊天。Claude for Chrome 让 Claude 可以处理你各个浏览器标签页中的任务,现已向所有 Max 用户开放。我们在 10 月发布了 Claude for Excel,从今天起,我们已将 beta 访问权限扩展到所有 Max、Team 和 Enterprise 用户。这些更新中的每一项都利用了 Claude Opus 4.5 在使用计算机、电子表格和处理长时间运行任务方面市场领先的性能。

对于可以使用 Opus 4.5 的 Claude 和 Claude Code 用户,我们已取消 Opus 专属上限。对于 Max 和 Team Premium 用户,我们提高了整体使用限额,这意味着你将获得与之前使用 Sonnet 时大致相同数量的 Opus token。我们正在更新使用限额,以确保你能够在日常工作中使用 Opus 4.5。这些限额专门针对 Opus 4.5。随着未来模型超越它,我们预计会按需更新限额。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一种具有类似 CRISPR 特性的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com