Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数上得分 43,比上一代 Haiku 发布一年后提升 26 分。
同一新闻,精选展示《AWS 上线 Claude Haiku 5.5》
Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 版本发布一年后提升了 26 分
Haiku 5.5 是首个具备 Anthropic 的 effort 设置和自适应思考的 Haiku 模型,Anthropic 还引入了分层定价。
Haiku 5.5 比其前代更便宜——对于不超过 100k token 的提示词,每 1M 输入/输出 token 收费 $0.10/$0.50(与 GPT-6 Luna 相同,是上一个 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的临时成本数据不包含这一阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 的覆盖。
关键要点:
➤ 领先的小型级模型性能:在最大 effort 下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型,并落后 Claude Sonnet 5.5(max,56)13 分
➤ 相比 GPT-6 Luna 使用大量 token:Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 会增加 2 分,但 token 用量约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 token:Haiku 5.5(high)得分为 38,每任务约 55k token,而 Luna(max)为 38,约 50k token,且在更低 effort 设置下差距扩大
➤ 在智能体知识工作方面能力很强:在 AA-Briefcase(我们针对现实知识工作任务的私有评估)上,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当
➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分为 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)
➤ 事实知识较低,但幻觉相对较少:正如较小级别模型所预期,Haiku 5.5 的事实知识低于其同系列模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这在一定程度上是因为它更愿意承认自己不知道——其幻觉率为 40%,低于 55% 和 77%
➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分为 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒答问题导致模型过度拒答。Anthropic 正在努力解决这一问题——我们将在修复后重新运行此评估,并预计该得分会上升
其他模型细节:
➤ 上下文窗口:100 万 token,高于 Claude 4.5 Haiku 的 200k
➤ 定价:每 1M 输入/输出 token 在不超过 100k token 时为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)
➤ 多模态:文本和图像输入,文本输出
来源:Artificial Analysis · x.com