跳到正文
Anthropic News·· 2025-02-24精选AI 评分88

Anthropic 发布 Claude 3.7 Sonnet 与 Claude Code

Claude 3.7 Sonnet and Claude Code

AI 导读

Anthropic 发布 Claude 3.7 Sonnet,称其为市场上首个混合推理模型,可在标准回答与可见的扩展思考模式间切换,API 用户还能限制思考的 token 预算,上限为 128K。

推荐理由

Anthropic 官方给出混合推理模式的定价与开放范围,读者可据此判断推理预算控制在实际编码工作流中的取舍。

正文 · AI 翻译

今天,我们宣布推出 Claude 3.7 Sonnet1,这是我们迄今为止最智能的模型,也是市场上首个混合推理模型。Claude 3.7 Sonnet 可以产生近乎即时的响应,也可以进行扩展的、逐步的思考,并且这些思考对用户可见。API 用户还可以对模型思考的时长进行细粒度控制。

Claude 3.7 Sonnet 在编码和前端 Web 开发方面表现出特别显著的改进。除了该模型,我们还推出了用于智能体编码的命令行工具 Claude Code。Claude Code 以有限的研究预览版形式提供,使开发者能够直接从终端将大量工程任务委托给 Claude。

Screen showing Claude Code onboarding

Claude 3.7 Sonnet 现已在所有 Claude 套餐中提供——包括 Free、Pro、Team 和 Enterprise——以及 Claude 开发者平台、Amazon Bedrock 和 Google Cloud 的 Vertex AI。扩展思考模式可在除免费 Claude 层级之外的所有平台上使用。

在标准模式和扩展思考模式下,Claude 3.7 Sonnet 的价格均与其前代产品相同:每百万输入 token 3 美元,每百万输出 token 15 美元——其中包括思考 token。

Claude 3.7 Sonnet:让前沿推理变得实用

我们开发 Claude 3.7 Sonnet 的理念与市场上其他推理模型不同。正如人类用同一个大脑进行快速反应和深度反思一样,我们认为推理应该是前沿模型的一项集成能力,而不是一个完全独立的模型。这种统一的方法也为用户创造了更无缝的体验。

Claude 3.7 Sonnet 以多种方式体现了这一理念。首先,Claude 3.7 Sonnet 既是普通 LLM,也是推理模型:你可以选择何时让模型正常回答,何时让它在回答前思考更久。在标准模式下,Claude 3.7 Sonnet 代表 Claude 3.5 Sonnet 的升级版本。在扩展思考模式下,它会在回答前进行自我反思,从而提升其在数学、物理、指令遵循、编码以及许多其他任务上的表现。我们总体发现,在两种模式下对模型进行提示的效果类似。

其次,通过 API 使用 Claude 3.7 Sonnet 时,用户还可以控制思考的预算:你可以告诉 Claude 思考不超过 N 个 token,N 可以是任意值,最高可达其 128K token 的输出上限。这使你能够在速度(和成本)与答案质量之间进行权衡。

第三,在开发我们的推理模型时,我们在数学和计算机科学竞赛题上的优化相对较少,而是将重点转向更能反映企业实际使用 LLM 方式的现实世界任务。

早期测试表明,Claude 在编码能力方面全面领先:Cursor 指出,Claude 再次成为现实世界编码任务中的最佳选择,在处理复杂代码库到高级工具使用等领域都有显著改进。Cognition 发现,它在规划代码变更和处理全栈更新方面远胜于任何其他模型。Vercel 强调了 Claude 在复杂代理工作流中的卓越精确度,而 Replit 已成功部署 Claude 从零构建复杂的 Web 应用和仪表板,这是其他模型无法做到的。在 Canva 的评估中,Claude 始终能生成生产就绪的代码,具有卓越的设计品味,并大幅减少了错误。

Bar chart showing Claude 3.7 Sonnet as state-of-the-art for SWE-bench Verified
Claude 3.7 Sonnet 在 SWE-bench Verified 上达到了最先进的性能,该基准评估 AI 模型解决现实世界软件问题的能力。有关脚手架(scaffolding)的更多信息,请参阅附录。
Bar chart showing Claude 3.7 Sonnet as state-of-the-art for TAU-bench
Claude 3.7 Sonnet 在 TAU-bench 上达到了最先进的性能,该框架测试 AI 代理在涉及用户和工具交互的复杂现实世界任务中的表现。有关脚手架(scaffolding)的更多信息,请参阅附录。
Benchmark table comparing frontier reasoning models
Claude 3.7 Sonnet 在指令遵循、通用推理、多模态能力和代理编码方面表现出色,扩展思考在数学和科学方面提供了显著提升。除了传统基准测试外,它甚至在我们 Pokémon 游戏测试中超越了所有之前的模型。

自 2024 年 6 月以来,Sonnet 一直是全球开发者的首选模型。今天,我们通过推出 Claude Code——我们的首个代理编码工具——在有限的研究预览中进一步赋能开发者。

Claude Code 是一个活跃的协作者,可以搜索和阅读代码、编辑文件、编写和运行测试、提交代码并推送到 GitHub,以及使用命令行工具——在每一步都让你保持知情。

Claude Code 是一个早期产品,但已成为我们团队不可或缺的工具,特别是在测试驱动开发、调试复杂问题和大型重构方面。在早期测试中,Claude Code 一次性完成了通常需要 45 分钟以上手动工作的任务,减少了开发时间和开销。

在接下来的几周内,我们计划根据使用情况不断改进它:增强工具调用的可靠性、增加对长时间运行命令的支持、改进应用内渲染,并扩展 Claude 对自身能力的理解。

Claude Code 的目标是更好地了解开发者如何使用 Claude 进行编码,从而为未来的模型改进提供信息。通过加入此预览,你将获得我们用来构建和改进 Claude 的同样强大的工具,你的反馈将直接塑造它的未来。

在代码库中与 Claude 协作

我们还改进了 Claude.ai 上的编码体验。我们的 GitHub 集成现已在所有 Claude 计划中可用——使开发者能够将他们的代码仓库直接连接到 Claude。

Claude 3.7 Sonnet 是我们迄今为止最好的编码模型。通过更深入地了解你的个人、工作和开源项目,它成为了修复错误、开发功能和构建文档的更强大伙伴,适用于你最重要的 GitHub 项目。

负责任地构建

我们对 Claude 3.7 Sonnet 进行了广泛的测试和评估,并与外部专家合作,确保其符合我们在安全性、安全防护和可靠性方面的标准。Claude 3.7 Sonnet 还能更细致地区分有害请求和良性请求,与上一代相比,不必要的拒绝减少了 45%。

本次发布的系统卡涵盖了多个类别的新安全结果,详细列出了我们的《负责任扩展政策》评估,其他 AI 实验室和研究人员可将其应用于自身工作。该卡片还探讨了计算机使用带来的新兴风险,尤其是提示注入攻击,并解释了我們如何评估这些漏洞,以及如何训练 Claude 抵御和缓解它们。此外,它还审视了推理模型可能带来的安全益处:理解模型如何做出决策的能力,以及模型推理是否真正值得信赖和可靠。阅读完整系统卡以了解更多。

展望未来

Claude 3.7 Sonnet 和 Claude Code 标志着迈向真正能够增强人类能力的 AI 系统的重要一步。凭借深度推理、自主工作和高效协作的能力,它们让我们更接近一个 AI 丰富并拓展人类所能成就之事的未来。

Milestone timeline showing Claude progressing from assistant to pioneer

我们很期待你探索这些新能力,并看看你会用它们创造出什么。一如既往,我们欢迎你的反馈,以帮助我们持续改进和演进我们的模型。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier 部署工程师,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用规模,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com