Anthropic 发布 Claude Opus 4.7
Introducing Claude Opus 4.7
Anthropic 正式发布 Claude Opus 4.7,在高级软件工程和最难任务上较 Opus 4.6 有明显提升,并已通过 Claude 全线产品、API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 开放,定价维持每百万输入 token 5 美元、输出 25 美元。
官方给出 Opus 4.7 在编码与视觉分辨率上的具体提升,以及 token 用量与 effort 档位的变化,便于评估升级成本。
我们最新的模型 Claude Opus 4.7 现已正式发布。
Opus 4.7 在高级软件工程方面相较 Opus 4.6 有显著提升,在最具挑战性的任务上进步尤为明显。用户反馈称,他们能够放心地将最困难的编码工作——那些以往需要密切监督的任务——交给 Opus 4.7 处理。Opus 4.7 能够严谨而一致地处理复杂、长时间运行的任务,精确遵循指令,并在汇报结果之前设法验证自己的输出。
该模型在视觉方面也有大幅提升:它能够以更高的分辨率查看图像。在完成专业任务时,它更具品味和创造力,能够产出更高质量的界面、幻灯片和文档。而且——尽管其广泛能力不及我们最强大的模型 Claude Mythos Preview——它在多项基准测试中的表现均优于 Opus 4.6:

上周我们发布了 Project Glasswing,重点介绍了 AI 模型在网络安全方面的风险与益处。我们当时表示,将限制 Claude Mythos Preview 的发布范围,并先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 就是首个此类模型:其网络能力不如 Mythos Preview 先进(事实上,在其训练过程中,我们尝试了差异化降低这些能力的做法)。我们发布 Opus 4.7 时配备了防护措施,能够自动检测并阻止表明存在被禁止或高风险网络安全用途的请求。我们从这些防护措施的实际部署中学到的经验,将帮助我们朝着最终广泛发布 Mythos 级模型的目标迈进。
希望将 Opus 4.7 用于合法网络安全用途(如漏洞研究、渗透测试和红队演练)的安全专业人士,欢迎加入我们新推出的 Cyber Verification Program。
Opus 4.7 即日起可在所有 Claude 产品以及我们的 API、Amazon Bedrock、Google Cloud 的 Vertex AI 和 Microsoft Foundry 中使用。定价与 Opus 4.6 保持一致:每百万输入 token 5 美元,每百万输出 token 25 美元。开发者可通过 Claude API 使用 claude-opus-4-7。
测试 Claude Opus 4.7
Claude Opus 4.7 获得了早期访问测试者的强烈反馈:
在早期测试中,我们看到 Claude Opus 4.7 有潜力为我们的开发者带来重大飞跃。它能在规划阶段发现自身的逻辑缺陷并加速执行,远超以往的 Claude 模型。作为服务数百万消费者和企业的大规模金融科技平台,这种速度与精确性的结合可能带来颠覆性改变:加快开发速度,从而更快交付客户每天依赖的可信金融解决方案。
Anthropic 已经为编码模型树立了标准,而 Claude Opus 4.7 作为市场上最先进的模型,以有意义的方式进一步推动了这一标准。在我们的内部评估中,它不仅以原始能力脱颖而出,还在于它处理真实世界异步工作流——自动化、CI/CD 和长时间运行任务——的表现。它还会更深入地思考问题,并带来更有主见的观点,而不是简单地附和用户。
Claude Opus 4.7 是 Hex 评估过的最强模型。当数据缺失时,它会正确报告,而不是提供看似合理但不正确的回退方案;它还能抵御连 Opus 4.6 都会中招的不一致数据陷阱。它是一个更智能、更高效的 Opus 4.6:低投入的 Opus 4.7 大致相当于中等投入的 Opus 4.6。
在我们的 93 项任务编码基准测试中,Claude Opus 4.7 的解决率比 Opus 4.6 提升了 13%,其中包括 Opus 4.6 和 Sonnet 4.6 都无法解决的四个任务。结合更快的中位延迟和严格的指令遵循,它对复杂、长时间运行的编码工作流尤其有意义。它减少了这些多步骤任务中的摩擦,让开发者能够保持心流并专注于构建。
基于我们的内部研究代理基准测试,Claude Opus 4.7 拥有我们见过的多步骤工作中最强的效率基线。它在我们的六个模块中并列最高总分,达到 0.715,并在我们测试的所有模型中提供了最一致的长上下文性能。在 General Finance——我们最大的模块——上,它相比 Opus 4.6 有显著提升,得分为 0.813 对 0.767,同时还展现出该组中最佳的披露和数据纪律。在 Opus 4.6 表现不佳的演绎逻辑方面,Opus 4.7 表现扎实。
Claude Opus 4.7 拓展了模型在调查和完成任务方面能力的极限。Anthropic 显然针对长时间运行中的持续推理进行了优化,并以市场领先的性能证明了这一点。随着工程师从与代理 1:1 协作转向并行管理它们,这正是解锁新工作流所需的前沿能力。
我们看到 Claude Opus 4.7 的多模态理解有了重大改进,从读取化学结构到解读复杂技术图表。更高分辨率的支持正在帮助 Solve Intelligence 为生命科学专利工作流构建一流的工具,涵盖起草和审查到侵权检测和无效性图表。
Claude Opus 4.7 在 Devin 中将长时程自主性提升到了新水平。它能连贯地工作数小时,攻克难题而不是放弃,并解锁了一类我们以前无法可靠运行的深度调查工作。
对 Replit 来说,Claude Opus 4.7 是一个轻松的升级决定。对于我们的用户每天所做的工作,我们观察到它以更低的成本实现了相同的质量——在分析日志和追踪、查找错误以及提出修复方案等任务上更高效、更精确。就个人而言,我喜欢它在技术讨论中提出异议,帮助我做出更好的决策。它真的感觉像一个更好的同事。
Claude Opus 4.7 在 Harvey 的 BigLaw Bench 上展现出强大的实质性准确性,在高投入下得分 90.9%,在审查表上具有更好的推理校准,并且对模糊文档编辑任务的处理明显更智能。它能正确区分转让条款和控制权变更条款,这一任务历来对前沿模型构成挑战。在我们的评估中,实质性始终被评为优势:正确、全面且引用充分。
Claude Opus 4.7 是一个非常令人印象深刻的编码模型,尤其是其自主性和更具创造性的推理。在 CursorBench 上,Opus 4.7 是能力上的显著跃升,达到 70%,而 Opus 4.6 为 58%。
对于复杂的多步骤工作流,Claude Opus 4.7 是明显的升级:相比 Opus 4.6 提升 14%,同时使用更少的 token,工具错误只有三分之一。它是首个通过我们隐式需求测试的模型,并且能在过去会让 Opus 彻底卡住的工具故障中持续执行。这一可靠性跃升让 Notion Agent 感觉像一位真正的队友。
在我们的评估中,核心编排代理在工具调用和规划准确性上实现了两位数增长。当用户利用 Hebbia 来规划和执行检索、幻灯片创建或文档生成等用例时,Claude Opus 4.7 展现出在这些工作流中改进代理决策的潜力。
在 Rakuten-SWE-Bench 上,Claude Opus 4.7 解决的生产任务数量是 Opus 4.6 的 3 倍,在代码质量和测试质量上实现了两位数提升。这是一次有意义的提升,也是对我们团队每天交付的工程工作的明确升级。
对于 CodeRabbit 的代码审查工作负载,Claude Opus 4.7 是我们测试过的最敏锐的模型。召回率提升超过 10%,在我们最复杂的 PR 中发现了某些最难检测的 bug,同时尽管覆盖率提高,精确率仍保持稳定。在我们的测试框架上,它比 GPT-5.4 xhigh 稍快一些,我们正安排它在发布时用于最繁重的审查工作。
对于 Genspark 的 Super Agent,Claude Opus 4.7 精准把握了三个最关键的生产差异化因素:抗循环、一致性和优雅的错误恢复。抗循环最为关键。一个在 18 次查询中就有 1 次无限循环的模型会浪费算力并阻塞用户。更低的方差意味着生产环境中更少的意外。而 Opus 4.7 实现了我们测量过的最高单次工具调用质量比。
Claude Opus 4.7 对 Warp 来说是一次有意义的升级。Opus 4.6 是市面上最适合开发者的模型之一,而这款模型在此基础上可衡量地更加彻底。它通过了此前 Claude 模型失败的 Terminal Bench 任务,并解决了一个 Opus 4.6 无法攻克的棘手并发 bug。对我们来说,这就是信号。
Claude Opus 4.7 是世界上构建仪表盘和数据丰富界面的最佳模型。其设计品味确实令人惊讶——它做出的选择我真的会发布。它现在是我的默认日常主力。
Claude Opus 4.7 是我们在 Quantium 测试过的最强模型。通过我们专有的基准测试方案与领先的 AI 模型进行评估,最大的提升出现在最关键的地方:推理深度、结构化问题构建和复杂技术工作。更少的修正、更快的迭代,以及更强的输出来解决客户带给我们的最难问题。
Claude Opus 4.7 感觉在智能上是一次真正的升级。代码质量明显改善,它去掉了过去堆积的无意义包装函数和回退脚手架,并在过程中自行修复代码。这是自 Sonnet 3.7 转向 Claude 4 系列以来我们看到的最干净的跃升。
对于 XBOW 自主渗透测试核心的计算机使用工作,新的 Claude Opus 4.7 是一次阶跃式变化:在我们的视觉敏锐度基准上达到 98.5%,而 Opus 4.6 为 54.5%。我们最大的 Opus 痛点实际上消失了,这解锁了它在一整类此前无法使用的工作中的用途。
Claude Opus 4.7 是一次扎实的升级,对 Vercel 而言没有任何回退。它在一次性编码任务上表现出色,比 Opus 4.6 更正确、更完整,并且明显更诚实地对待自身的局限。它甚至会在开始工作前对系统代码进行验证,这是我们在早期 Claude 模型中从未见过的新行为。
Claude Opus 4.7 非常强大,在 Factory Droids 的任务成功率上比 Opus 4.6 提升了 10% 到 15%,工具错误更少,验证步骤的后续执行也更可靠。它会将工作贯彻到底,而不是半途而废,这正是企业工程团队所需要的。
Claude Opus 4.7 自主从零构建了一个完整的 Rust 文本转语音引擎——包括神经模型、SIMD 内核、浏览器演示——然后将其自身输出送入语音识别器,以验证其与 Python 参考实现一致。数月的高级工程工作,自主完成。从 Opus 4.6 的跃升显而易见,且代码库已公开。
Claude Opus 4.7 通过了三个此前 Claude 模型无法完成的 TBench 任务,并且正在修复我们之前最佳模型遗漏的问题,包括一个竞态条件。它在识别真实问题上展现出强大的精确度,并揭示出其他模型要么放弃、要么未能解决的重要发现。在 Qodo 的真实世界代码审查基准测试中,我们观察到了顶级的精确度。
在 Databricks 的 OfficeQA Pro 上,Claude Opus 4.7 展现出显著更强的文档推理能力,在处理源信息时比 Opus 4.6 的错误减少了 21%。在我们所有基于数据的智能体推理基准测试中,它是用于企业文档分析表现最佳的 Claude 模型。
对于 Ramp,Claude Opus 4.7 在智能体团队工作流中表现突出。我们看到了更强的角色忠实度、指令遵循、协调能力和复杂推理,尤其是在跨越工具、代码库和调试上下文的工程任务上。与 Opus 4.6 相比,它需要的逐步指导少得多,帮助我们扩展工程团队运行的内部智能体工作流。
对于 Bolt 的长时间应用构建工作,Claude Opus 4.7 可测量地优于 Opus 4.6,在最佳情况下提升高达 10%,且没有我们已习惯从高度智能体化模型中看到的回退。它提升了用户单次会话可交付成果的上限。
01 /
28
以下是我们对 Opus 4.7 早期测试的一些亮点和笔记:
- 指令遵循。Opus 4.7 在遵循指令方面显著更好。有趣的是,这意味着为早期模型编写的提示词有时现在会产生意想不到的结果:以往模型会宽松地解释指令或完全跳过部分内容,而 Opus 4.7 会字面地执行指令。用户应相应地重新调整他们的提示词和测试框架。
- 改进的多模态支持。Opus 4.7 对高分辨率图像有更好的视觉能力:它可以接受长边高达 2,576 像素(约 3.75 百万像素)的图像,是此前 Claude 模型的三倍多。这开启了大量依赖精细视觉细节的多模态用途:读取密集截图的计算机使用智能体、从复杂图表中提取数据,以及需要像素级精确参考的工作。1
- 真实世界工作。除了在 Finance Agent 评估中取得的最先进分数(见上表)外,我们的内部测试表明,Opus 4.7 是比 Opus 4.6 更有效的金融分析师,能产出严谨的分析和模型、更专业的演示文稿,以及跨任务更紧密的整合。Opus 4.7 在 GDPval-AA 上也处于最先进水平,这是一项针对金融、法律及其他领域具有经济价值的知识工作的第三方评估。
- 记忆。Opus 4.7 更擅长使用基于文件系统的记忆。它能在长时间、多会话的工作中记住重要笔记,并利用它们推进新任务,因此这些新任务需要的前期上下文更少。
下图展示了我们发布前测试中更多评估结果,涵盖一系列不同领域:
安全与对齐
总体而言,Opus 4.7 展现出与 Opus 4.6 相似的安全概况:我们的评估显示,欺骗、谄媚和配合滥用等令人担忧行为的比率较低。在某些指标上,例如诚实性和对恶意“提示注入”攻击的抵御能力,Opus 4.7 相比 Opus 4.6 有所改进;在其他方面(例如对受控物质给出过于详细的减害建议的倾向),Opus 4.7 则略弱。我们的对齐评估得出结论,该模型“大体上对齐良好且值得信赖,尽管其行为并非完全理想”。请注意,根据我们的评估,Mythos Preview 仍是我们训练过的最对齐的模型。我们的安全评估在 Claude Opus 4.7 系统卡中有完整讨论。

今日同步推出
除了 Claude Opus 4.7 本身,我们还推出以下更新:
- 更多努力控制:Opus 4.7 在
high和max之间引入了一个新的xhigh(“超高”)努力级别,让用户能更精细地控制难题上推理与延迟之间的权衡。在 Claude Code 中,我们将所有计划的默认努力级别提高到xhigh。在测试 Opus 4.7 用于编码和智能体用例时,我们建议从high或xhigh努力级别开始。 - 在 Claude 平台(API)上:除了支持更高分辨率的图像外,我们还以公开测试版形式推出任务预算,让开发者能够引导 Claude 的 token 消耗,从而在更长的运行中优先安排工作。
- 在 Claude Code 中:新的
/ultrareview斜杠命令会生成一个专门的审查会话,通读更改并标记出细心审查者会发现的错误和设计问题。我们为 Pro 和 Max Claude Code 用户提供三次免费 ultrareview 以供试用。此外,我们已将自动模式扩展到 Max 用户。自动模式是一种新的权限选项,Claude 会代你做出决定,这意味着你可以运行更长的任务且中断更少——并且比选择跳过所有权限的风险更低。
从 Opus 4.6 迁移到 Opus 4.7
Opus 4.7 是 Opus 4.6 的直接升级,但有两项变化值得提前规划,因为它们会影响 token 用量。首先,Opus 4.7 使用了更新的分词器,改进了模型处理文本的方式。代价是相同的输入可能映射到更多 token——根据内容类型不同,大约为 1.0–1.35 倍。其次,Opus 4.7 在更高 effort 级别下思考更多,尤其是在 agentic 场景的后续轮次中。这提升了它在难题上的可靠性,但也意味着它会生成更多输出 token。
用户可以通过多种方式控制 token 用量:使用 effort 参数、调整任务预算,或提示模型更加简洁。在我们自己的测试中,净效果是有利的——在内部编码评估中,所有 effort 级别的 token 用量都有所改善,如下所示——但我们建议在真实流量上测量差异。我们撰写了一份迁移指南,为从 Opus 4.6 升级到 Opus 4.7 提供进一步建议。

相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 应用,以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。
Claude 发现一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:在我们科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com