跳到正文
Anthropic News·· 2026-02-17精选AI 评分88

Anthropic 发布 Claude Sonnet 4.6,支持 1M token 上下文窗口

Introducing Claude Sonnet 4.6

AI 导读

Anthropic 发布 Claude Sonnet 4.6,称其为迄今最强的 Sonnet 模型,在编码、computer use、长上下文推理、智能体规划和设计等技能上全面升级,并支持 1M token 上下文窗口(beta)。

推荐理由

官方给出 Sonnet 4.6 在编码、computer use 与长上下文上的能力变化和定价,读者可据此判断是否从 Sonnet 4.5 迁移。

正文 · AI 翻译

Claude Sonnet 4.6 是我们迄今为止能力最强的 Sonnet 模型。它在编码、计算机使用、长上下文推理、智能体规划、知识工作和设计等方面的技能得到了全面升级。Sonnet 4.6 还提供 100 万 token 上下文窗口(测试版)。

对于使用我们免费版和专业版套餐的用户,Claude Sonnet 4.6 现已成为 claude.ai 和 Claude Cowork 中的默认模型。定价与 Sonnet 4.5 保持一致,为每百万 token 3 美元/15 美元起。

Sonnet 4.6 为更多用户带来了大幅改进的编码技能。在一致性、指令遵循等方面的提升,使获得早期访问权限的开发者以较大优势更青睐 Sonnet 4.6 而非其前代产品。他们甚至常常更青睐它,而非我们 2025 年 11 月最智能的模型 Claude Opus 4.5。

以往需要动用 Opus 级模型才能实现的性能——包括在现实世界中具有经济价值的办公任务上——现在通过 Sonnet 4.6 即可获得。与之前的 Sonnet 模型相比,该模型在计算机使用技能方面也展现出重大提升。

与每一款新的 Claude 模型一样,我们对 Sonnet 4.6 进行了广泛的安全评估,总体表明其安全性与我们近期其他 Claude 模型相当,甚至更高。我们的安全研究人员得出结论,Sonnet 4.6 具有“广泛意义上温暖、诚实、亲社会,有时甚至幽默的性格,非常强大的安全行为,并且没有迹象表明存在高风险形式的失准问题。”

计算机使用

几乎每个组织都有难以轻松自动化的软件:在现代 API 等接口出现之前构建的专用系统和工具。要让 AI 使用此类软件,用户以往必须构建定制连接器。但一个能像人一样使用计算机的模型改变了这一局面。

2024 年 10 月,我们率先推出了通用计算机使用模型。当时我们写道,它“仍处于实验阶段——有时笨拙且容易出错”,但我们预计它会迅速改进。OSWorld 是 AI 计算机使用的标准基准测试,它展示了我们的模型已经走了多远。该测试在模拟计算机上运行真实软件(Chrome、LibreOffice、VS Code 等)中的数百项任务。没有特殊的 API 或专门构建的连接器;模型看到计算机并与之交互的方式与人几乎相同:点击(虚拟)鼠标,在(虚拟)键盘上打字。

在十六个月里,我们的 Sonnet 模型在 OSWorld 上取得了稳步进展。这些改进在基准测试之外也能看到:早期 Sonnet 4.6 用户已在诸如浏览复杂电子表格或填写多步骤网页表单等任务中看到人类水平的能力,之后还能跨多个浏览器标签页将所有内容整合起来。

该模型在使用计算机方面无疑仍落后于最熟练的人类。但进步的速度仍然令人瞩目。这意味着计算机使用对一系列工作任务更加有用——而且能力更强的模型也指日可待。

Chart comparing several Sonnet model scores on the OSWorld benchmark
Claude Sonnet 4.5 之前的分数是在原始 OSWorld 上测量的;从 Sonnet 4.5 起的分数使用 OSWorld-Verified。OSWorld-Verified(2025 年 7 月发布)是原始 OSWorld 基准测试的原位升级,更新了任务质量、评估评分和基础设施。

与此同时,计算机使用也带来了风险:恶意行为者可能通过在网站上隐藏指令来劫持模型,这就是所谓的提示注入攻击。我们一直在努力提升模型对提示注入的抵抗力——我们的安全评估显示,Sonnet 4.6 相比其前代 Sonnet 4.5 有了重大改进,表现与 Opus 4.6 相当。你可以在我们的 API 文档中了解更多关于如何缓解提示注入及其他安全问题的方法。

评估 Claude Sonnet 4.6

除了计算机使用之外,Claude Sonnet 4.6 在各项基准测试上都有全面提升。它以更实用的价格实现了接近 Opus 级别的智能,使其适用于更多任务。你可以在我们的系统卡中找到关于 Sonnet 4.6 能力及其安全相关行为的完整讨论;下方是与其他近期模型的总结和对比。

A table of popular benchmarks and Sonnet 4.6's relative performance compared to other frontier models

在 Claude Code 中,我们的早期测试发现,用户大约 70% 的情况下更偏好 Sonnet 4.6 而非 Sonnet 4.5。用户反馈称,它能更有效地在修改代码前阅读上下文,并整合共享逻辑而非重复代码。这使得它在长时间会话中比早期模型更少令人沮丧。

用户甚至 59% 的情况下更偏好 Sonnet 4.6 而非我们 11 月推出的前沿模型 Opus 4.5。他们认为 Sonnet 4.6 明显更不容易过度工程化和“偷懒”,并且在遵循指令方面显著更好。他们反馈其虚假成功声明更少、幻觉更少,在多步骤任务上的执行也更一致。

Sonnet 4.6 的 1M token 上下文窗口足以在单次请求中容纳整个代码库、冗长合同或数十篇研究论文。更重要的是,Sonnet 4.6 能在所有这些上下文中有效推理。这可以让它更擅长长周期规划。我们在 Vending-Bench Arena 评估中尤其清楚地看到了这一点,该评估测试模型能否长期经营一家(模拟)企业——其中还包含竞争元素,不同 AI 模型相互对抗以赚取最大利润。

Sonnet 4.6 发展出了一种有趣的新策略:它在模拟的前十个月大力投资产能,支出显著高于竞争对手,然后在最后阶段果断转向聚焦盈利能力。这一转向的时机帮助它最终远远领先于竞争对手。

Sonnet 4.6 在 Vending-Bench Arena 中通过早期投资产能、最后阶段转向盈利,表现优于 Sonnet 4.5。

早期客户也反馈了广泛改进,其中前端代码和财务分析尤为突出。客户独立地将 Sonnet 4.6 的视觉输出描述为明显更精致,布局、动画和设计感都优于此前模型。客户达到生产级质量所需的迭代轮次也更少。

Databricks logo

Claude Sonnet 4.6 在 OfficeQA 上达到了与 Opus 4.6 相当的表现,该基准衡量模型阅读企业文档(图表、PDF、表格)、提取正确事实并基于这些事实进行推理的能力。对于文档理解类工作负载而言,这是一次有意义的升级。

Replit logo

Claude Sonnet 4.6 的性价比表现极为出色——Claude 模型近几个月来的演进速度之快,怎么强调都不为过。Sonnet 4.6 在我们的编排评测中表现优异,能够处理我们最复杂的智能体工作负载,并且随着你将 effort 设置调得越高,它的表现还会持续提升。

Cursor logo

Claude Sonnet 4.6 相比 Sonnet 4.5 实现了全面且显著的提升,包括长时程任务和更困难的问题。

GitHub logo

Claude Sonnet 4.6 一经推出,就已在复杂代码修复方面表现出色,尤其是在需要跨大型代码库进行搜索时。对于大规模运行智能体编码的团队而言,我们看到了很高的解决率,以及开发者所需的那种一致性。

Cognition logo

Claude Sonnet 4.6 在缺陷检测方面大幅缩小了与 Opus 的差距,让我们能够并行运行更多审查器、捕获更多种类的缺陷,而且这一切都无需增加成本。

Windsurf logo

Sonnet 首次以更小、更具成本效益的形态带来了前沿级推理能力。如果你是 Opus 的重度用户,它提供了一个可行的替代方案。

Hebbia logo

Claude Sonnet 4.6 显著提升了我们核心产品背后的答案检索能力——在我们的金融服务基准测试中,相比 Sonnet 4.5,答案匹配率出现了大幅跃升,并且在我们客户所依赖的具体工作流上实现了更好的召回率。

Box logo

Box 评估了 Claude Sonnet 4.6 在真实企业文档上接受深度推理和复杂智能体任务测试时的表现。它展现出显著改进,在重度推理问答上比 Claude Sonnet 4.5 高出 15 个百分点。

Pace logo

Claude Sonnet 4.6 在我们的保险基准测试中达到 94%,成为我们测试过的计算机使用表现最高的模型。这种准确度对于投保单录入和损失首次通知等工作流而言至关重要。

Bolt logo

Claude Sonnet 4.6 在复杂应用构建和缺陷修复方面带来了前沿级的结果。它正成为我们处理深度代码库工作的首选,而这类工作过去需要更昂贵的模型。

Rakuten logo

Claude Sonnet 4.6 为 Rakuten AI 生成了我们测试过的最好的 iOS 代码。更好的规范符合度、更好的架构,而且它一次性就用上了我们并未要求的现代工具。结果确实让我们感到惊讶。

Zapier logo

Sonnet 4.6 在困难任务的推理方面实现了重大飞跃。我们发现它在分支式和多步骤任务上尤其强大,例如合同路由、条件模板选择和 CRM 协调——这些正是我们的客户需要强大模型判断力和可靠性的地方。

Convey logo

Claude Sonnet 4.6 处理复杂计算机使用的准确度令我们印象深刻。在我们的评测中,它明显优于我们测试过的其他任何方案。

Triple Whale logo

Claude Sonnet 4.6 在构建前端页面和数据报告时拥有完美的设计品味,而且相比我们测试过的任何方案,它达到这一水平所需的引导要少得多。

Harvey logo

Claude Sonnet 4.6 对指令的响应异常精准——在被要求时能给出精确的数字和结构化对比,同时还能就审判策略和证据准备生成真正有用的想法。

01 /

15

产品更新

在 Claude 平台上,Sonnet 4.6 同时支持 自适应思考 和扩展思考,以及处于测试阶段的 上下文压缩,后者会在对话接近上限时自动总结较早的上下文,从而增加有效上下文长度。

在我们的 API 上,Claude 的 网页搜索和 抓取工具现在会自动编写并执行代码来筛选和处理搜索结果,只在上下文中保留相关内容——从而同时提升响应质量和 token 效率。此外,代码执行、记忆、程序化工具调用、工具搜索和工具使用示例现已正式可用。

Sonnet 4.6 在任何思考强度下都能提供强劲性能,即使在关闭扩展思考的情况下也是如此。作为从 Sonnet 4.5 迁移的一部分,我们建议你根据自己正在构建的内容,在整个范围内进行探索,以找到速度与可靠性能之间的理想平衡。

我们发现,对于需要最深层次推理的任务,例如代码库重构、在工作流中协调多个智能体,以及那些必须完全正确的问题,Opus 4.6 仍然是最强的选择。

对于 Claude in Excel 用户,我们的加载项现在支持 MCP 连接器,让 Claude 能够与你日常使用的其他工具协同工作,例如 S&P Global、LSEG、Daloopa、PitchBook、Moody’s 和 FactSet。你可以要求 Claude 从电子表格之外引入上下文,而无需离开 Excel。如果你已经在 Claude.ai 中设置了 MCP 连接器,这些相同的连接将在 Excel 中自动生效。此功能适用于 Pro、Max、Team 和 Enterprise 套餐。

如何使用 Claude Sonnet 4.6

Claude Sonnet 4.6 现已在所有 Claude 套餐、Claude Cowork、Claude Code、我们的 API 以及所有主流云平台上可用。我们还将免费套餐默认升级为 Sonnet 4.6——它现在包含文件创建、连接器、技能和压缩功能。

如果你是开发者,可以通过 Claude API 使用 claude-sonnet-4-6 快速上手。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com