Claude Opus 5.5 登顶 Artificial Analysis 智能指数,并降价 20%
Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index
Claude Opus 5.5 在 Artificial Analysis 智能指数上以最高努力档取得 58 分,登顶该榜单,同时 Anthropic 将 Opus 价格降至每 100 万输入/输出 token 4 美元/20 美元,缓存读取从 0.50 美元降至 0.20 美元。
第三方评测给出 Claude Opus 5.5 在智能指数与智能体知识工作上的具体分数和价格变化,可对照其与 GPT-6 Astra 的差距。
Claude Opus 5.5 在 Artificial Analysis Intelligence Index 上登顶,同时价格下调 20%,缓存命中折扣更大
Claude Opus 5.5 使 Anthropic 在 Terminal-Bench 4.0 和 AutomationBench-AA 等评估上与 GPT-6 Astra 持平,同时扩大了 Anthropic 在智能体知识工作方面的领先优势。
在最大努力设置下,它在 Artificial Analysis Intelligence Index 上得分 58,是我们测得的最高分,领先数分。Anthropic 已将 Opus 定价降至每 100 万输入/输出 token 4 美元/20 美元(Opus 5:5 美元/25 美元),缓存读取从 0.50 美元降至 0.20 美元。
关键要点:
➤ 持续强劲的表现,在十项 Intelligence Index 评估中的六项上得分领先:Humanity's Last Exam 61.4%(此前最佳 59.1%,Claude Fable 5.1)、SciCode 66.9%(63.1%,Fable 5.1)、GDPval-AA v2.1、AA-Briefcase v1.1、AA-Omniscience 和 AutomationBench-AA。在 Terminal-Bench 4.0 上得分 59.6%,与领先者 GPT-6 Astra(xhigh)持平,比 Opus 5 高 11 分。在 CritPt、AA-LCR 和 GDP.pdf 上仍然落后
➤ 在智能体知识工作方面领先:在 AA-Briefcase(我们的私有前沿知识工作评估)上,它达到 1822 的 Elo。这比 Fable 5.1 高 143,在分析质量和呈现两方面都领先,并且是 Anthropic 首次在呈现质量上超越 GPT-5.6 Sol。该评估测试模型能否使用我们的开源参考智能体框架 Stirrup 生成准确且呈现良好的专业输出
➤ 尽管输出 token 为 1.6 倍,每任务成本与 Opus 5 持平:Opus 5.5(max)每个 Intelligence Index 任务使用约 119k 输出 token,而 Opus 5(max)约 73k,Fable 5.1(max)约 78k,GPT-6 Astra(max)约 27k
➤ 五个努力级别中有四个位于智能与每任务成本前沿:Opus 5.5 max、xhigh、high 和 medium 均位于帕累托前沿,成本更低或表现优于其他得分 50+ 的模型(GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5)
其他模型细节:
➤ 上下文窗口:100 万 token 上下文,支持图像和文本输入,与 Opus 5 相同
➤ 定价:每 100 万输入/输出 token 4 美元/20 美元,较 Opus 5 的 5 美元/25 美元下降 20%。5 分钟 TTL 的缓存写入为每 100 万 token 5 美元,低于此前的 6.25 美元。缓存读取进一步降至每 100 万 token 0.20 美元,较 Opus 5 的 0.50 美元下降 60%。与未缓存输入定价相比,这是 95% 的折扣,高于此前 Opus 模型的 90%
➤ 努力设置:五种努力设置(low、medium、high、xhigh 和 max)。Intelligence Index 评估在全部五种设置下运行,并启用了 Anthropic 的默认回退

Claude Opus 5.5 的五个努力级别中有四个位于智能与每任务成本前沿:Opus 5.5 max、xhigh、high 和 medium 均位于帕累托前沿,成本更低或表现优于其他得分 50+ 的模型。

Claude Opus 5.5(max)在智能体知识工作方面表现顶尖。它在 AA-Briefcase v1.1 上以 1,822 Elo 领先(比 Fable 5.1 高 143),在 GDPval-AA v2.1 上以 1,846 Elo 领先(比 Claude Fable 5.1 高 111,比 Claude Opus 5 高 138)。在 AA-Briefcase 上,它在分析质量和呈现子分数上均领先,在基于评分标准的评分上仅次于 Fable 5.1。

有关 Claude Opus 5.5 的更多细节和基准测试,请参见 https://artificialanalysis.ai/models/claude-opus-5-5
来源:Artificial Analysis Articles · artificialanalysis.ai