Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna
[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,可据此判断小模型在智能体工作流中的成本位置。
距离 Anthropic 发布 Haiku 4.5 已经大约一年了,随着 Sonnet、Opus 和 Fable 一路迭代到 5.5,它似乎有点被遗忘了,尤其是在 OpenAI 随 Astra 和 Sol 6 一同推出 Luna 6 之后。
嗯,它来了,而且是一次令人欣喜的更新。更多内容见下方摘要。
2026 年 10 月 6 日至 10 月 7 日 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter,没有进一步检查 Discord。AINews 网站让你可以搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择开启/关闭邮件频率!
AI Twitter 回顾
头条:Anthropic 发布 Claude Haiku 5.5
发生了什么
Anthropic 发布了 Claude Haiku 5.5,这是其约一年来首次更新 Haiku 层级。其定价与 OpenAI 的 GPT-6 Luna 相当,Anthropic 同日还下调了 Sonnet 5.5 及其订阅计划的价格。
发布前信号。 @scaling01 在公告前发帖称“Haiku 5.5 日快乐”。@kimmonismus 表示该模型已出现在一次 Claude Code 更新中,并预测会采用“Luna 定价”。随后他在官方帖子发布前就公布了定价(@kimmonismus),并在正式上线时予以确认(@kimmonismus)。
正式发布。 @claudeai 和 @AnthropicAI 称其为“我们发布过的最便宜、最快、能力最强的小型模型”,平均运行成本比 Haiku 4.5 低约 75%。
可用性与预期用途。 它已在 Claude Platform 和 Claude Code 中上线(@ClaudeDevs)。Anthropic 将其定位为与 Opus 5.5 或 Sonnet 5.5 搭配使用的子代理,用于高并发、成本敏感的工作,如摘要、压缩和数据库查询。@mikeyk 将这种分工描述为“Opus 负责重度思考,Haiku 负责高并发工作”。
分层定价(@ClaudeDevs):
提示长度每 1M token 输入 / 输出每 1M 缓存读取低于 100K token$0.10 / $0.50$0.01超过 100K token$0.50 / $2.50$0.05
Sonnet 5.5 降价。 缓存读取从每 1M token $0.20 减半至 $0.10。Anthropic 表示,这使 Sonnet 5.5 在大多数长时间运行或代理式工作中便宜约 20%(@claudeai)。
为订阅者提供 API 额度。 每月 Claude Platform API 额度现在随 Max 5x($100)、Max 20x($200)和 Team(最高 $500,共享池)提供。它们适用于任何模型,包括 Haiku 5.5,也可在第三方工具中使用(@ClaudeDevs)。
同日 SDK 更新。 计算机使用和浏览器使用工具集现已内置于 Python 和 TypeScript 版 Claude SDK 中。SDK 运行操作循环,并将点击和按键发送给来自 browser_use、Browserbase、E2B 或 Daytona 的驱动程序,因此开发者不再需要自己编写该循环(@ClaudeDevs,快速入门)。
首日合作伙伴部署:
Cursor:@cursor_ai 声称在较短请求上“比 Haiku 4.5 少 10 倍”,并发布了 CursorBench 对比(@cursor_ai)。
VS Code 中的 GitHub Copilot:@code 报告称它“在许多编码任务上匹配 Claude Sonnet 5,同时使用更少的 token 和步骤”。
Devin:@cognition 报告在 FrontierCode 1.1 上达到 58.4%,领先于 Sonnet 5,而每任务成本约为其八分之一,并推荐将其作为 Opus 5.5 领导下的 Fusion 中的“sidekick”。
Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,分数待定(@arena)。
OpenDocRouter:同日添加(详情见下文)。
独立评估:Artificial Analysis
@ArtificialAnlys 发布了最详细的第三方数据(按评估细分、对比页面)。
智能指数:43(最大努力),较上一代 Haiku 提升 26 分。
略领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。
与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型。
在最大努力下落后 Claude Sonnet 5.5(56)13 分。
新控制项。这是首个带有 Anthropic 努力设置和自适应思考的 Haiku。
Token 使用量是主要注意事项。
在最大努力下,每个 Index 任务使用约 162k 输出 token,约为 GPT-6 Luna 最大努力(约 50k)的 3 倍。
从 xhigh 到 max 增加 2 分,但 token 用量约为 1.8 倍。
在同等分数下,它仍然更冗长:Haiku 5.5 在高努力下得分 38,使用约 55k token,而 Luna 在最大努力下得分 38,使用约 50k。在较低努力设置下差距更大。
成本数据为暂定。Artificial Analysis 尚未对超过 100K token 后的 5 倍价格阶梯建模。每任务成本数据将随后发布。
AA-Briefcase(私有智能体知识工作评估):1578 Elo。领先于 Kimi K3 和 GLM-5.3,与最大努力下的 Muse Spark 1.3 相当。
Terminal-Bench 4.0:33%,较 Haiku 4.5 的 0% 有所提升。
与 GLM-5.3 Flash 持平。
领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
知识与幻觉对比(AA-Omniscience):
模型准确率幻觉率Haiku 5.536%40%Gemini 3.8 Flash55%55%GPT-6 Luna44%77%
Haiku 准确率较低的部分原因是它更愿意表示自己不知道。
AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。一个发布前的安全漏洞导致模型过度拒绝。Anthropic 正在修复,Artificial Analysis 将重新运行评估,并预计分数会上升。
规格:
1M token 上下文,较 Haiku 4.5 的 200k 有所提升。
文本和图像输入,文本输出。
5 分钟缓存写入每 1M token 花费 $0.125(超过 100K 为 $0.625)。
其他基准测试声明(多为厂商或二手来源)
@ShayneRedford 总结了 Anthropic 报告的提升:
OSWorld(计算机使用):15% → 72%。
TerminalBench:0% → 39%。这与 Artificial Analysis 在 Terminal-Bench 4.0 上独立测得的 33% 不同。
知识工作和推理方面提升 10–50%。
在大多数这些方面击败 Luna。
1M 上下文,最大输出 token 约 12k。
@alexalbert__(Anthropic)强调 Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比跨度不到一年。
@TheRundownAI 报道称其在“各种基准测试中”击败 GPT-6 Luna。
文档解析(独立,基于 ParseBench):
@LoganMarkewich:总体接近 Luna,在表格上略好,在图表理解上较差。
@jerryjliu0:每 1,000 页约 $1.2。就价格而言,擅长表格和阅读顺序;在图表、语义格式和边界框方面较弱。
轶事:
@simonw 写了定价笔记,并跑了他的 pelican-on-a-bicycle 测试。他说它比贵 10 倍的 Haiku 4.5“好太多了”(对比)。
@AI_Screening 说 Haiku 5.5 在一个 Three.js 斑马模拟中“碾压”了 Luna(单次提示,并非系统性测试)。
观点与反响
看多
@kimmonismus:“比 GPT-6-Luna 好得多,接[近] Sonnet 5.5……便宜又聪明。”
@theo 喜欢这种分层定价:10 万 token 以下只收五分之一的价格,“让人非常清楚这个模型是干什么用的”。他还觉得,看到 Anthropic 的模型“在成本/智能图表上如此靠左”很引人注目(@theo),并在直播中报道了这次发布(@theo)。
@draecomino:“Haiku 在最大努力下表现得像前沿模型。”
@kipperrii 认为,小型、便宜的模型如今更重要,因为它们能完成“大量有用的事”。
@scaling01(“便宜得要命”)以及随后(@scaling01):“5.5 系列模型看起来不错。”
@NotTomBrown(“小而强大”)和 @edwinarbus,两人都来自 Anthropic 一方,发布了庆祝性的帖子。
竞争框架
这次发布被广泛解读为针对 OpenAI 的 GPT-6 Luna:“rip gpt 6 luna”(@dejavucoder),“是时候碾压 Luna 了”(@scaling01)。
@kimmonismus 将 Sonnet 缓存读取降价解读为 Anthropic 在向 OpenAI 施压。关于 API 额度,他补充道:“OpenAI:轮到你了”(@kimmonismus)。
@teortaxesTex 说 Anthropic 现在拥有“所有实验室中最深的产品阵容”(Haiku/Sonnet/Opus/Fable 加上 Mythos),对比 OpenAI 的 Luna/Sol/Astra。他仍然认为 Anthropic“对产品没那么上心”,他将其解读为这表明它在整个 2026 年有多么游刃有余。
ThursdAI 的 @altryne 对中间档提出质疑:“当 Opus 还很贵的时候,Sonnet 是合理的。”该节目计划报道 Haiku 5.5(@thursdai_pod)。
注意事项(主要来自数据,而非大声批评者)
宣传价格可能夸大了实际节省。
大量 token 使用(在最大努力下约为 Luna 的 3 倍)抵消了部分每 token 折扣。
超过 10 万 token 的提示要多付 5 倍,这对长上下文智能体循环很重要。
这两种效应可能解释了为什么 Cursor 的“短请求便宜 10 倍”与 Anthropic 的“平均便宜 75%”不同。
事实回忆弱于 Gemini 3.8 Flash 和 Luna。
过度拒绝 bug 目前压低了自动化得分。
尚未基准测试: Arena 分数待定,独立的每任务成本数据有待分层定价支持。
背景
自 2025 年 10 月以来,Haiku 4.5 一直是 Anthropic 的小型模型。此后,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 在低成本端展开竞争。
Haiku 5.5 的标价与 Luna 完全一致。它增加了努力控制和 100 万上下文。
它被明确地定位为多模型智能体框架中的廉价工作者:Claude Code 子智能体、Devin Fusion、Copilot 子智能体,以及压缩或摘要步骤。
Anthropic 将其与 Sonnet 缓存读取降价和订阅 API 额度配套推出,这是对智能体经济学的协同推进。这一推进正值关于 token 账单的更广泛辩论之际(见下方 @theo)。
其他新闻
OpenAI 的 722 份数学手稿:规模、效率与影响
来源:Latent Space · latent.space