Anthropic 发布 Claude Haiku 5.5,智能指数 43 分并引入分层定价
Anthropic has released Claude Haiku 5.5
Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,比上一代 Haiku 发布一年后提升 26 分。
同一新闻,精选展示《AWS 上线 Claude Haiku 5.5》
Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 版本发布一年后提升了 26 分
Haiku 5.5 是首个具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分层定价。
Haiku 5.5 比其前代更便宜——对于不超过 100k token 的提示,每 1M 输入/输出 token 的费用为 $0.10/$0.50(与 GPT-6 Luna 相同,是上一代 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的临时成本数据未包含阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 的覆盖。
关键要点:
➤ 领先的小型级模型性能:在最大努力下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型,并落后 Claude Sonnet 5.5(max,56)13 分
➤ 相比 GPT-6 Luna 的 token 使用量很高:Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 增加 2 分,但 token 用量约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 token:Haiku 5.5(high)以每任务约 55k token 得分 38,而 Luna(max)以约 50k 得分 38,且在较低努力设置下差距扩大
➤ 在智能体知识工作方面能力很强:在 AA-Briefcase(我们针对现实知识工作任务的私有评估)上,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当
➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)
➤ 事实知识较低,但幻觉相对较少:正如对较小级别模型的预期,Haiku 5.5 的事实知识低于其同系列模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这部分是因为它更愿意承认自己不知道——其幻觉率为 40%,低于上述两者的 55% 和 77%
➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分为 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒答问题导致模型过度拒答。Anthropic 正在解决此问题——我们将在修复后重新运行此评估,并预计该分数会上升
其他模型细节:
➤ 上下文窗口:100 万 token,高于 Claude 4.5 Haiku 的 200k
➤ 定价:不超过 100k token 时,每 1M 输入/输出 token 为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 后 $0.05),5 分钟缓存写入 $0.125(超过 100k 后 $0.625)
➤ 多模态:文本和图像输入,文本输出

Claude Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,多于 Opus 5.5(max),约为 GPT-6 Luna(max)的 3 倍。在不同努力设置下,Haiku 5.5 达到相近 Intelligence Index 分数时使用的输出 token 多于 GPT-6 Luna

Claude Haiku 5.5(max)在我们的私密前沿知识工作评估 AA-Briefcase 上达到 1578 Elo,处于 GPT-6 Astra(max)和 Claude Fable 5.1(high)的置信区间内

Claude Haiku 5.5 在不同 effort 设置下,Artificial Analysis Intelligence Index 中各项单独评估的完整细分

来源:Artificial Analysis Articles · artificialanalysis.ai