Anthropic 发布 Claude Opus 4 与 Claude Sonnet 4
Introducing Claude 4
Anthropic 发布下一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,主打编码、高级推理与 AI 智能体能力。
官方给出 Claude Opus 4 与 Sonnet 4 的基准成绩、定价和 API 新能力,可据此判断编码与智能体场景的选型。
今天,我们推出下一代 Claude 模型:Claude Opus 4 和 Claude Sonnet 4,为编码、高级推理和 AI 代理设定了新标准。
Claude Opus 4 是全球最佳的编码模型,在复杂、长时间运行的任务和代理工作流上保持持续性能。Claude Sonnet 4 是 Claude Sonnet 3.7 的重大升级,提供卓越的编码和推理能力,同时更精确地响应您的指令。
除了模型之外,我们还宣布:
- 扩展思考与工具使用(测试版):两个模型都可以在扩展思考期间使用工具——如 网络搜索——允许 Claude 在推理和工具使用之间交替以提高响应质量。
- 新模型能力:两个模型都可以并行使用工具,更精确地遵循指令,并且——当开发者授予本地文件访问权限时——展现出显著改进的记忆能力,提取并保存关键事实以保持连续性并随时间建立隐性知识。
- Claude Code 现已全面可用:在研究预览期间收到广泛积极反馈后,我们正在扩展开发者与 Claude 协作的方式。Claude Code 现在支持通过 GitHub Actions 的后台任务,以及与 VS Code 和 JetBrains 的原生集成,直接在您的文件中显示编辑内容,实现无缝结对编程。
- 新 API 能力:我们在 API 上发布了 四项新能力,使开发者能够构建更强大的 AI 代理:代码执行工具、MCP 连接器、Files API,以及将提示缓存长达一小时的能力。
Claude Opus 4 和 Sonnet 4 是混合模型,提供两种模式:近乎即时的响应和用于深度推理的扩展思考。Pro、Max、Team 和 Enterprise Claude 计划包含两个模型和扩展思考,Sonnet 4 也向免费用户开放。两个模型均可在我们的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上使用。定价与之前的 Opus 和 Sonnet 模型保持一致:Opus 4 为每百万 token(输入/输出)$15/$75,Sonnet 4 为 $3/$15。
Claude Opus 4 是我们迄今为止最强大的模型,也是全球最佳的编码模型,在 SWE-bench(72.5%)和 Terminal-bench(43.2%)上领先。它在需要集中精力和数千步骤的长时间运行任务上保持持续性能,能够连续工作数小时——显著超越所有 Sonnet 模型,并大幅扩展 AI 代理所能完成的任务。
Claude Opus 4 擅长编码和复杂问题解决,为前沿代理产品提供动力。Cursor 称其为编码领域的最先进技术,并在复杂代码库理解方面实现了飞跃。Replit 报告了精度的提升以及跨多个文件的复杂变更方面的巨大进步。Block 称其为首个在其代理 codename goose 中提升编辑和调试期间代码质量,同时保持完整性能和可靠性的模型。Rakuten 通过一项要求苛刻的开源重构独立运行 7 小时并保持持续性能,验证了其能力。Cognition 指出 Opus 4 擅长解决其他模型无法解决的复杂挑战,成功处理了以前模型遗漏的关键操作。
Claude Sonnet 4 在 Sonnet 3.7 业界领先能力的基础上实现了显著提升,在编码方面表现出色,在 SWE-bench 上取得了最先进的 72.7% 成绩。该模型在内部和外部用例中平衡了性能与效率,并增强了可控性,以便对实现过程拥有更强的掌控。虽然在大多数领域不及 Opus 4,但它提供了能力与实用性的最佳组合。
GitHub 表示 Claude Sonnet 4 在智能体场景中表现卓越,并将引入它作为 GitHub Copilot 中新编码智能体的驱动模型。Manus 强调了它在遵循复杂指令、清晰推理和美观输出方面的改进。iGent 报告称 Sonnet 4 在自主多功能应用开发方面表现出色,问题解决和代码库导航能力也大幅提升——将导航错误从 20% 降至接近零。Sourcegraph 表示该模型展现出作为软件开发重大飞跃的潜力——能更长时间保持正轨、更深入地理解问题,并提供更优雅的代码质量。Augment Code 报告称其成功率更高、代码编辑更精准、处理复杂任务时更细致,使其成为他们首选模型的最佳选择。
这些模型全面推动了客户的 AI 战略:Opus 4 在编码、研究、写作和科学发现方面突破边界,而 Sonnet 4 将前沿性能带入日常用例,作为 Sonnet 3.7 的即时升级。

模型改进
除了带工具使用的扩展思考、并行工具执行和记忆改进之外,我们还显著减少了模型使用捷径或漏洞来完成任务的行为。在特别容易受到捷径和漏洞影响的智能体任务上,这两个模型出现此类行为的可能性比 Sonnet 3.7 低 65%。
Claude Opus 4 在记忆能力上也大幅超越了所有之前的模型。当开发者构建为 Claude 提供本地文件访问权限的应用时,Opus 4 能够熟练地创建和维护“记忆文件”来存储关键信息。这解锁了更好的长期任务感知、连贯性和智能体任务表现——比如 Opus 4 在玩 Pokémon 时创建了一份“导航指南”。

最后,我们为 Claude 4 模型引入了思考摘要功能,使用一个较小的模型来压缩冗长的思考过程。这种摘要仅在约 5% 的情况下需要——大多数思考过程足够简短,可以完整显示。需要原始思维链进行高级提示工程用户可以通过联系销售了解我们新的开发者模式,以保留完整访问权限。
Claude Code
Claude Code 现已正式可用,将 Claude 的强大能力带入更多开发工作流程——在终端、你喜爱的 IDE 中,以及通过 Claude Code SDK 在后台运行。
适用于 VS Code 和 JetBrains 的新测试版扩展将 Claude Code 直接集成到你的 IDE 中。Claude 提出的修改会内联显示在你的文件中,在熟悉的编辑器界面内简化审阅和跟踪。只需在 IDE 终端中运行 Claude Code 即可安装。
在 IDE 之外,我们发布了可扩展的 Claude Code SDK,让你可以使用与 Claude Code 相同的核心智能体来构建自己的智能体和应用程序。我们还发布了一个展示 SDK 能力的示例:GitHub 上的 Claude Code,现已进入测试版。在 PR 中标记 Claude Code,即可回应审阅者反馈、修复 CI 错误或修改代码。要安装,请在 Claude Code 中运行 /install-github-app。
开始使用
这些模型是迈向虚拟协作者的一大步——保持完整上下文、在更长期的项目中持续专注,并推动变革性影响。它们经过了广泛的测试和评估,以将风险降至最低并最大限度地提高安全性,包括针对更高 AI 安全级别(如 ASL-3)实施相关措施。
我们很期待看到你会创造什么。今天就在 Claude、Claude Code 或你选择的平台上开始使用吧。
一如既往,你的反馈能帮助我们改进。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 应用,以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中集成安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com