跳到正文
Anthropic News·· 2026-05-28精选AI 评分85

Anthropic 发布 Claude Opus 4.8,价格与 Opus 4.7 持平

Introducing Claude Opus 4.8

AI 导读

Anthropic 发布 Claude Opus 4.8,在编码、智能体技能、推理和实际知识工作等基准上较 Opus 4.7 有提升,常规使用定价不变,为每百万输入 token 5 美元、每百万输出 token 25 美元。

推荐理由

官方给出 Opus 4.8 在编码、智能体与诚实度上的对比数据和定价,可据此判断升级幅度与成本。

正文 · AI 翻译

我们正在将 Claude Opus 升级到新版本:Claude Opus 4.8。它基于 Opus 4.7 构建,在各项基准测试中均有提升,并且是更高效的协作者。它今天即可使用,价格保持不变。

Opus 4.8 发布的同时还带来了几项新功能。claude.ai 上的用户现在可以控制 Claude 在任务中投入的精力程度。Claude Code 新增了“动态工作流”功能,使其能够处理超大规模的问题。而 Opus 4.8 的快速模式——模型可以以 2.5 倍的速度工作——现在比之前模型的成本低三倍。

Opus 4.8 的能力

下表展示了 Opus 4.8 在编码、智能体技能、推理和实际知识工作任务测试中与其前代以及其他模型的对比。更多细节以及更广泛的能力评估请参见 Claude Opus 4.8 系统卡。

与 Opus 4.8 协作

早期测试者发现,Claude Opus 4.8 在执行智能体任务时更加可靠,判断力也更敏锐。以下是许多测试者关于与 Opus 4.8 协作体验的引述:

 logo

Claude Opus 4.8 的判断力明显更好。在 Claude Code 中,它会提出正确的问题,发现自己的错误,在方案不合理时提出异议,并在做出重大更改之前,围绕复杂的多服务探索逐步建立信心。它是一个非常适合用来构建的模型。

 logo

在我们的 Super-Agent 基准测试中,Claude Opus 4.8 是唯一一个端到端完成所有案例的模型,在同等成本下击败了此前的 Opus 模型和 GPT-5.5。对于翻译、深度研究、幻灯片构建和分析领域的智能体产品,它提供了强大的可靠性。

 logo

在 CursorBench 上,Claude Opus 4.8 在每个努力级别上都超越了此前的 Opus 模型。工具调用效率显著提高,在同等智能水平下使用更少的步骤,并且能够将端到端任务坚持完成。

 logo

Claude Opus 4.8 在我们的 Legal Agent Benchmark 上取得了有记录以来的最高分,并且是首个在全通过标准上总体突破 10% 的模型。对于实质性法律工作而言,这种准确率的提升直接转化为我们的客户可以放心移交多少真实律师工作。

 logo

Claude Opus 4.8 相比 Opus 4.7 感觉是一次重大的体验升级:更快、更容易协作,并且更擅长在长时间会话中保持上下文和风格方向。对于需要同时兼顾语气、品味和技术执行的工作,Opus 4.8 是我一直信赖的模型。

 logo

Claude Opus 4.8 是我们测试过的最强的计算机使用和浏览器智能体模型,在 Online-Mind2Web 上得分 84%,相比 Opus 4.7 和 GPT-5.5 都有显著提升。它以我们的客户智能体工作负载所需的端到端可靠性,保持反思能力并专注于任务。

 logo

Claude Opus 4.8 能够干净地使用工具,并以我们的自主工程工作负载所需的稳定性遵循指令,从而保持无人值守运行。它改进了 Opus 4.6,并修复了我们在 Opus 4.7 上看到的注释冗长和工具调用问题。Anthropic 的这次发布直接为在 Devin 上构建的工程师带来了更快的能力提升。

 logo

在我们长期运行的评估中,Claude Opus 4.8 的分析质量始终高于此前的 Opus 模型。它完成得更快,产出的内容更丰富、信息密度更高。总体而言,信噪比明显更优。最大的区别在于,Opus 4.8 倾向于主动指出分析输入和输出中的问题,而其他模型常常漏掉这些问题,留给用户自己去发现。

 logo

在 CoCounsel Legal 中,与之前的 Opus 模型相比,Claude Opus 4.8 在一致性和推理质量上带来了有意义的提升。对于我们的客户所依赖的高风险专业工作流程而言,这种可靠性至关重要。在我们为法律和税务专业人士构建受托级 AI 系统的过程中,这样的进步有助于提升真实工作流程中可信 AI 性能的标准。

 logo

Claude Opus 4.8 为企业 AI 树立了新标杆。在 Databricks 面向数据与知识工作的 AI 智能体 Genie 中,新的 Opus 模型在智能体推理方面实现了跨越式提升,比以往任何 Opus 都更快地处理更深入、多步骤的问题。其多模态优势还让 Genie 能够直接对 PDF、图表和其他非结构化内容进行推理,token 成本比 Opus 4.7 便宜 61%。

 logo

在 Hebbia 的编排器中处理金融文档工作流程时,Claude Opus 4.8 提供了与 Opus 4.7 同样出色的质量,同时引用精度明显更好,检索时的 token 效率也更高,这对于我们客户每天处理的那种密集申报文件来说效果极佳。

01 /

11

Opus 4.8 最显著的改进之一是其诚实性。我们训练所有模型都要诚实——例如,避免做出无法支撑的断言。但 AI 模型的一个普遍问题是,它们有时会草率下结论,自信地声称在工作中取得了进展,尽管证据并不充分。早期测试者反馈,Opus 4.8 更可能指出其工作中的不确定性,也更少做出没有依据的断言。这一点在我们的评估中得到了印证:评估显示,Opus 4.8 让其编写的代码中的缺陷未被指出就通过的可能性,约为其前代的四分之一。

一如既往,我们在发布前对模型进行了详细的对齐评估。在积极特质方面,我们的对齐团队得出结论:Opus 4.8“在我们衡量亲社会特质(如支持用户自主性和以用户最佳利益行事)的指标上达到了新高。”评估还显示,Opus 4.8 的不对齐行为发生率(如欺骗或配合滥用)大幅低于 Opus 4.7,与我们对齐程度最好的模型 Claude Mythos Preview 相近。完整的对齐评估以及一套部署前安全测试,均报告在 Claude Opus 4.8 System Card 中。

今日同步推出

除 Claude Opus 4.8 外,我们还进行了以下更新:

  • 动态工作流。这项新功能以研究预览形式提供,让 Claude 在 Claude Code 中承担更大的任务。Claude 可以规划工作,然后在单个会话中运行数百个并行子代理(借助 Opus 4.8,代理可以运行更长时间)。随后它会验证输出,再向用户汇报。例如,搭载 Opus 4.8 的 Claude Code 现在可以执行代码库规模的迁移,从启动到合并跨越数十万行代码,并以现有测试套件作为标准。你可以在这篇文章中了解更多关于动态工作流的信息——该功能在 Claude Code 的 Enterprise、Team 和 Max 套餐中提供。
  • claude.ai 和 Cowork 中的投入控制。模型选择器旁边新增了一个控制项,让用户选择 Claude 在回复中投入多少精力。在更高的投入设置下,Claude 会更频繁、更深入地思考,以给出更好的回复。在更低的投入设置下,Claude 会更快响应,并更缓慢地消耗用户的速率限制。用户现在有了这个选择——投入控制在所有套餐中均可使用。
  • Messages API 现在接受 messages 数组内的 system 条目。开发者可以在任务中途更新 Claude 的指令,而不会破坏提示缓存,也无需通过用户轮次来传递更新。这可以在给定的 harness 中用于在代理运行时更新权限、token 预算或环境上下文。

关于投入的说明

Opus 4.8 默认采用高投入,我们认为这是质量与用户体验的最佳整体平衡。在编码任务中,该投入水平消耗的 token 数量与 Opus 4.7 的默认值相近,但性能更好。用户可以选择“extra”(在 Claude Code 中为“xhigh”)或“max”,模型将消耗更多 token 以获得更好的结果;我们建议对困难任务和长时间运行的异步工作流使用“extra”。我们已提高 Claude Code 中的速率限制,以适应更高投入水平带来的更高 token 用量;用户可以根据自己的具体项目选择合适的方式。

下一步是什么?

用户会发现 Opus 4.8 相比前代是适度但切实的改进。还有更多工作要做:我们正在开发和发布以更低成本提供许多与 Opus 相同能力的模型。

不仅如此,我们还计划发布一类智能水平高于 Opus 的新模型。作为 Project Glasswing 的一部分,少数组织目前正在使用 Claude Mythos Preview 进行网络安全工作。这一能力级别的模型在普遍发布之前需要更强的网络防护措施。我们正在迅速推进这些防护措施的开发,并预计能在未来几周内将 Mythos 级模型带给所有客户。

可用性

Claude Opus 4.8 今日已在各处可用。常规使用定价与 Opus 4.7 保持不变:每百万输入 token 5 美元,每百万输出 token 25 美元。快速模式定价为每百万输入 token 10 美元,每百万输出 token 50 美元。开发者可以通过 Claude API 使用 claude-opus-4-8。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:Claude 在我们科学家仅提供高层方向的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com