Anthropic 发布 Claude Opus 4.6,编码与智能体能力升级并首次支持 1M token 上下文
Introducing Claude Opus 4.6
Anthropic 发布 Claude Opus 4.6,重点提升编码能力,能更谨慎地规划、更长时间维持智能体任务,并在更大代码库中更可靠地运行。
官方给出 Opus 4.6 在智能体编码与长上下文上的基准对比,可据此判断前沿模型的编码能力进展。
我们正在升级我们最智能的模型。
全新的 Claude Opus 4.6 在前代编码能力的基础上进一步提升。它规划更周密,能更持久地执行智能体任务,在更大的代码库中运行更可靠,并具备更强的代码审查和调试能力,能发现自己的错误。而且,作为我们 Opus 级模型的首次,Opus 4.6 在测试版中提供 100 万 token 的上下文窗口1。
Opus 4.6 还能将其增强的能力应用于一系列日常工作:运行财务分析、开展研究,以及使用和创建文档、电子表格和演示文稿。在 Cowork 中,Claude 可以自主处理多项任务,Opus 4.6 能代表你运用所有这些技能。
该模型在多项评估中表现达到业界领先水平。例如,它在智能体编码评估 Terminal-Bench 2.0 中获得最高分,并在 Humanity’s Last Exam 这一复杂的多学科推理测试中领先所有其他前沿模型。在 GDPval-AA——一项评估在金融、法律及其他领域具有经济价值的知识工作任务的测试2——中,Opus 4.6 比业界次优模型(OpenAI 的 GPT-5.2)高出约 144 Elo 分,3比其自身前代(Claude Opus 4.5)高出 190 分。Opus 4.6 在 BrowseComp 上的表现也优于任何其他模型,该测试衡量模型在网上查找难以找到的信息的能力。
正如我们在详尽的系统卡中所展示的,Opus 4.6 的整体安全表现也与业界任何其他前沿模型相当或更好,在各项安全评估中不当行为的发生率都很低。
在 Claude Code 中,你现在可以组建 agent teams 来协同处理任务。在 API 上,Claude 可以使用 compaction 来总结自己的上下文,从而执行更长时间的任务而不触及上限。我们还引入了 adaptive thinking,模型可以根据上下文线索判断该使用多少扩展思考,以及新的 effort 控制,让开发者对智能、速度和成本有更多掌控。
我们对 Claude in Excel 进行了大幅升级,并正在以研究预览形式发布 Claude in PowerPoint。这让 Claude 在日常工作中能力大大增强。
Claude Opus 4.6 即日起可在 claude.ai、我们的 API 以及所有主流云平台上使用。如果你是开发者,请通过 Claude API 使用 claude-opus-4-6。定价保持不变,为每百万 token 5 美元/25 美元;完整详情请参阅我们的定价页面。
下面我们将深入介绍该模型、我们的新产品更新、我们的评估以及我们广泛的安全测试。
第一印象
我们用 Claude 构建 Claude。我们的工程师每天都用 Claude Code 编写代码,每个新模型都会先在我们自己的工作中接受测试。对于 Opus 4.6,我们发现该模型无需被要求就能更专注于任务中最具挑战性的部分,更快地处理更直接的部分,以更好的判断力处理模糊问题,并在更长的会话中保持高效。
Opus 4.6 通常会思考得更深入,并在确定答案之前更仔细地重新审视其推理过程。这会在更难的问题上产生更好的结果,但在更简单的问题上可能会增加成本和延迟。如果你发现模型在某个给定任务上过度思考,我们建议将投入程度从默认设置(高)下调至中。你可以通过 /effort 参数轻松控制这一点。
以下是我们的早期访问合作伙伴对 Claude Opus 4.6 的一些评价,包括它在无需人工干预的情况下自主工作的倾向、它在以往模型失败之处取得的成功,以及它对团队工作方式的影响:
Claude Opus 4.6 是 Anthropic 迄今发布的最强模型。它能承接复杂的请求并真正贯彻执行,将其拆解为具体步骤、执行,即使任务雄心勃勃也能产出精雕细琢的成果。对 Notion 用户来说,它感觉不像一个工具,更像一位能力出众的协作者。
早期测试表明,Claude Opus 4.6 能够胜任开发者每天面对的复杂、多步骤编码工作——尤其是需要规划和工具调用的智能体工作流。这开始在前沿领域解锁长周期任务。
Claude Opus 4.6 在智能体规划方面是一次巨大飞跃。它能把复杂任务拆解为独立的子任务,并行运行工具和子智能体,并以真正的精确度识别阻碍因素。
Claude Opus 4.6 是我们迄今测试过的最好的模型。它的推理和规划能力在为我们的 AI Teammates 提供支持方面表现卓越。它也是一个出色的编码模型——它浏览大型代码库并确定应做哪些正确修改的能力处于最先进水平。
Claude Opus 4.6 以我们前所未见的水平对复杂问题进行推理。它会考虑其他模型遗漏的边缘情况,并始终得出更优雅、更周全的解决方案。我们对 Opus 4.6 在 Devin Review 中的表现印象尤为深刻,它提高了我们的缺陷捕获率。
在 Windsurf 中,Claude Opus 4.6 明显优于 Opus 4.5,尤其是在需要仔细探索的任务上,例如调试和理解陌生的代码库。我们注意到 Opus 4.6 思考得更久,这在需要更深入推理时会带来回报。
Claude Opus 4.6 在长上下文性能方面代表了一次意义重大的飞跃。在我们的测试中,我们看到它能够处理规模大得多的信息量,且一致性水平增强了我们设计和部署复杂研究工作流的方式。这一领域的进步为我们提供了更强大的构建模块,以交付专业人士可以信赖的真正专家级系统。
在 40 项网络安全调查中,Claude Opus 4.6 在与 Claude 4.5 系列模型的盲测排名中有 38 次(共 40 次)取得了最佳结果。每个模型都在相同的智能体框架上端到端运行,最多使用 9 个子智能体和 100 多次工具调用。
根据我们的内部基准测试和测试结果,Claude Opus 4.6 是长时运行任务的新前沿。它在审查代码方面也非常高效。
Claude Opus 4.6 取得了所有 Claude 模型中最高的 BigLaw Bench 得分,达到 90.2%。其中 40% 为满分,84% 高于 0.8,其法律推理能力极为出色。
Claude Opus 4.6 在一天之内自主关闭了 13 个问题,并将 12 个问题分配给合适的团队成员,管理着一个约 50 人、横跨 6 个代码库的组织。它同时处理产品决策和组织决策,综合跨多个领域的上下文,并且知道何时该上报给人类。
Claude Opus 4.6 是设计质量的一次提升。它与我们的设计系统配合得天衣无缝,而且更加自主,这正是 Lovable 价值观的核心。人们应该去创造有意义的东西,而不是事无巨细地管理 AI。
Claude Opus 4.6 在跨法律、金融和技术内容的多源分析等高推理任务中表现出色。Box 的评估显示性能提升了 10%,达到 68%,而基线为 58%,并在技术领域取得了近乎完美的分数。
Claude Opus 4.6 在 Figma Make 中生成复杂的交互式应用和原型,展现出令人印象深刻的创意范围。该模型能一次就将详细的设计和多层任务转化为代码,为团队探索和构建想法提供了强大的起点。
Claude Opus 4.6 是我们测试过的最好的 Anthropic 模型。它只需极少的提示就能理解意图,并且超出预期,探索并创造了我看到之前都不知道自己想要的细节。感觉像是在与模型合作,而不是在等它。
实际测试和评估都表明,Claude Opus 4.6 对设计系统和大型代码库有显著改进,这些用例能带来巨大的企业价值。它还一次性完成了一个功能齐全的物理引擎,单次通过就处理了一个大型多范围任务。
Claude Opus 4.6 是我几个月来见过的最大飞跃。我更放心地给它一系列跨技术栈的任务,让它自行运行。它足够聪明,能为各个部分使用子代理。
Claude Opus 4.6 像一位资深工程师一样处理了数百万行代码库的迁移。它提前规划,随着了解情况调整策略,并在一半的时间内完成。
我们只在开发者能真正感受到差异时才会在 v0 中发布模型。Claude Opus 4.6 轻松通过了这一标准。其前沿级推理能力,尤其是在边缘情况下的表现,帮助 v0 实现我们的首要目标:让任何人都能将想法从原型提升到生产。
Claude Opus 4.6 的性能跃升几乎令人难以置信。对 Opus [4.5] 来说具有挑战性的现实任务突然变得简单。这感觉像是 Shortcut 上电子表格代理的分水岭时刻。
01 /
20
评估 Claude Opus 4.6
在代理编码、计算机使用、工具使用、搜索和金融领域,Opus 4.6 都是行业领先的模型,而且往往大幅领先。下表展示了 Claude Opus 4.6 在各种基准测试中与我们之前的模型以及其他行业模型的对比。

Opus 4.6 在从大量文档中检索相关信息方面要好得多。这延伸到长上下文任务,它能在数十万个 token 中保持和跟踪信息,漂移更少,并能捕捉到连 Opus 4.5 都会遗漏的隐藏细节。
关于 AI 模型的一个常见抱怨是“上下文腐烂”,即当对话超过一定数量的 token 时性能会下降。Opus 4.6 的表现明显优于其前代:在 MRCR v2 的 8 针 1M 变体——一个测试模型从海量文本中检索“隐藏”信息能力的大海捞针基准——上,Opus 4.6 得分为 76%,而 Sonnet 4.5 仅得 18.5%。这是模型在保持峰值性能的同时实际能使用多少上下文的质变。
总而言之,Opus 4.6 更擅长在长上下文中查找信息,更擅长在吸收信息后进行推理,并且总体上具有显著更好的专家级推理能力。
最后,下面的图表展示了 Claude Opus 4.6 在多项基准测试中的表现,这些测试评估了它的软件工程技能、多语言编码能力、长期连贯性、网络安全能力以及生命科学知识。
安全方面的进步
这些智能提升并非以牺牲安全为代价。在我们的自动化行为审计中,Opus 4.6 表现出较低的不对齐行为发生率,例如欺骗、谄媚、鼓励用户妄想以及配合滥用行为。总体而言,它与前代模型 Claude Opus 4.5 一样对齐良好,后者是我们迄今为止对齐程度最高的前沿模型。Opus 4.6 在近期所有 Claude 模型中还表现出最低的过度拒绝率——即模型未能回答良性查询的情况。

对于 Claude Opus 4.6,我们运行了所有模型中最全面的安全评估,首次应用了许多不同的测试,并升级了我们此前使用的若干测试。我们加入了针对用户福祉的新评估、对模型拒绝潜在危险请求能力的更复杂测试,以及更新后的模型暗中执行有害行为能力的评估。我们还试验了来自 可解释性——研究 AI 模型内部运作机制的科学——的新方法,以开始理解模型为何会以某些方式行事,并最终捕捉标准测试可能遗漏的问题。
所有能力和安全评估的详细描述见 Claude Opus 4.6 系统卡。
我们还在 Opus 4.6 展现出特别优势、可能被用于危险用途以及有益用途的领域应用了新的防护措施。特别是,由于该模型展现出增强的网络安全能力,我们开发了六个新的网络安全 探针——检测有害响应的方法——以帮助我们追踪不同形式的潜在滥用。
我们还在加速该模型在网络安全防御方面的用途,利用它帮助发现并修补开源软件中的漏洞(正如我们在新的 网络安全博客文章中所述)。我们认为,网络安全防御者使用像 Claude 这样的 AI 模型来帮助创造公平的竞争环境至关重要。网络安全发展迅速,随着我们对潜在威胁的了解不断深入,我们将调整和更新我们的防护措施;在不久的将来,我们可能会实施实时干预以阻止滥用行为。
产品和 API 更新
我们对 Claude、Claude Code 和 Claude Platform 进行了大量更新,以让 Opus 4.6 发挥最佳性能。
Claude Platform
在 API 上,我们让开发者能更好地控制模型投入程度,并为长时间运行的智能体提供更多灵活性。为此,我们引入了以下功能:
- 自适应思考。此前,开发者只能在启用或禁用扩展思考之间二选一。现在,借助 自适应思考,Claude 可以自行决定何时进行更深入的推理会有帮助。在默认投入程度(高)下,模型会在有用时使用扩展思考,但开发者可以调整投入程度,使其更具或更少选择性。
- Effort。现在有四个 effort 级别可供选择:low、medium、high(默认)和 max。我们鼓励开发者尝试不同的选项,以找到最适合的方案。
- 上下文压缩(beta)。长时间运行的对话和智能体任务经常会触及上下文窗口上限。上下文压缩会在对话接近可配置的阈值时自动总结并替换较早的上下文,让 Claude 能够执行更长时间的任务而不触及限制。
- 100 万 token 上下文(beta)。Opus 4.6 是我们首个具备 100 万 token 上下文的 Opus 级模型。超过 20 万 token 的提示词适用溢价定价(每百万输入/输出 token 为 $10/$37.50),仅在 Claude Platform 上提供。
- 128k 输出 token。Opus 4.6 支持最高 128k token 的输出,让 Claude 无需将任务拆分为多个请求即可完成更大输出的任务。
- 仅限美国推理。对于需要在美国境内运行的工作负载,可使用 仅限美国推理,token 定价为 1.1 倍。
产品更新
在 Claude 和 Claude Code 中,我们新增了多项功能,让知识工作者和开发者能够借助更多日常使用的工具来处理更困难的任务。
我们在 Claude Code 中推出了 agent teams 研究预览版。你现在可以启动多个智能体,让它们作为团队并行工作并自主协调——最适合可拆分为独立、以读取为主的任务,例如代码库审查。你可以使用 Shift+Up/Down 或 tmux 直接接管任何子智能体。
Claude 现在也能更好地配合你已经在使用的办公工具。Excel 中的 Claude 以更佳的性能处理长时间运行和更困难的任务,能够先规划再行动、摄取非结构化数据并在无指导的情况下推断出正确的结构,还能一次性处理多步骤更改。再配合 PowerPoint 中的 Claude,你可以先在 Excel 中处理和构建数据,然后在 PowerPoint 中将其生动呈现。无论你是基于模板构建还是根据描述生成整套幻灯片,Claude 都会读取你的版式、字体和幻灯片母版以保持品牌一致。PowerPoint 中的 Claude 现已在 Max、Team 和 Enterprise 套餐中提供研究预览版。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 大规模扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,将安全的企业级 AI 系统整合到其全球运营中。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究团队和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅给出高层级指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com