跳到正文
Anthropic News·· 2025-10-15精选AI 评分74

Anthropic 发布 Claude Haiku 4.5 小模型

Introducing Claude Haiku 4.5

AI 导读

Anthropic 发布小模型 Claude Haiku 4.5,即日起向所有用户开放,编码性能接近五个月前的 Claude Sonnet 4,成本为其三分之一、速度超过两倍,在计算机操作等部分任务上甚至超过 Sonnet 4。

推荐理由

官方给出 Haiku 4.5 与 Sonnet 4 在编码性能、成本和速度上的对比,可据此判断小模型在实时与多智能体场景的定位。

正文 · AI 翻译

Claude Haiku 4.5,我们最新的小型模型,今天面向所有用户开放。

曾经处于前沿的能力,如今变得更便宜、更快速。五个月前,Claude Sonnet 4 还是最先进的模型。今天,Claude Haiku 4.5 为你带来相近水平的编码性能,但成本仅为三分之一,速度却提升了一倍以上。

Chart comparing frontier models on SWE-bench Verified which measures performance on real-world coding tasks

Claude Haiku 4.5 在某些任务上甚至超越了 Claude Sonnet 4,例如使用计算机。这些进步让 Claude for Chrome 等应用比以往更快、更实用。

对于依赖 AI 完成实时、低延迟任务的用户——如聊天助手、客服代理或结对编程——将会欣赏 Haiku 4.5 兼具高智能与惊人速度的特性。而 Claude Code 的用户会发现,Haiku 4.5 让编码体验——从多智能体项目到快速原型开发——明显更加流畅响应。

两周前发布的 Claude Sonnet 4.5 仍是我们的前沿模型,也是世界上最好的编码模型。Claude Haiku 4.5 为用户提供了一个新选择,适合那些想要接近前沿性能、同时大幅提升成本效益的场景。它还开启了将我们的模型组合使用的新方式。例如,Sonnet 4.5 可以将复杂问题拆解为多步骤计划,然后协调一组多个 Haiku 4.5 并行完成子任务。

Claude Haiku 4.5 今天已在各处上线。如果你是开发者,只需通过 Claude API 使用 claude-haiku-4-5。定价为每百万输入和输出 token 1 美元/5 美元。


基准测试

Comparison table of frontier models across popular benchmarks
Claude Haiku 4.5 是我们迄今为止最强大的模型之一。方法论见脚注。

 logo

Claude Haiku 4.5 达到了我们曾认为不可能实现的理想平衡点:接近前沿的编码质量,同时兼具极快的速度和成本效益。在 Augment 的智能体编码评估中,它达到了 Sonnet 4.5 性能的 90%,与规模大得多的模型不相上下。我们很兴奋能将它提供给用户。

 logo

Claude Haiku 4.5 是智能体编码的一次飞跃,尤其是在子智能体编排和计算机使用任务方面。其响应速度让 Warp 中的 AI 辅助开发感觉如同瞬时完成。

 logo

历来模型都在质量与速度、成本之间做取舍。Claude Haiku 4.5 正在模糊这一取舍的界限:它是一款快速的前沿模型,同时保持成本高效,也预示着这一类模型的发展方向。

 logo

Claude Haiku 4.5 在不牺牲速度的前提下带来智能,使我们能够构建同时利用深度推理和实时响应的 AI 应用。

 logo

Claude Haiku 4.5 的能力令人惊叹——仅仅六个月前,这样的性能水平在我们的内部基准测试中还会是最先进的。如今它以远低于 Sonnet 4.5 的成本,运行速度却快 4-5 倍,解锁了全新的用例。

 logo

对于在反馈循环中运行的 AI 智能体来说,速度就是新的前沿。Haiku 4.5 证明了你可以同时拥有智能和快速输出。它能可靠地处理复杂工作流,实时自我纠正,并在没有延迟开销的情况下保持节奏。对于大多数开发任务,它是理想的性能平衡点。

Gamma logo

Claude Haiku 4.5 在幻灯片文本生成的指令遵循方面超越了我们的现有模型,准确率达到 65%,而我们高级层模型仅为 44%——这对我们的单位经济效益而言是颠覆性的改变。

 logo

我们的早期测试表明,Claude Haiku 4.5 为 GitHub Copilot 带来了高效的代码生成能力,其质量可与 Sonnet 4 相媲美,但速度更快。我们已经看到,对于在 AI 驱动的开发工作流中看重速度和响应能力的 Copilot 用户来说,它是一个绝佳选择。

01 /

08

安全评估

我们对 Claude Haiku 4.5 进行了一系列详细的安全与对齐评估。该模型表现出较低的问题行为发生率,并且比其前代 Claude Haiku 3.5 的对齐程度大幅提升。在我们的自动化对齐评估中,Claude Haiku 4.5 的整体失准行为发生率也显著低于 Claude Sonnet 4.5 和 Claude Opus 4.1——按此指标衡量,Claude Haiku 4.5 是我们迄今为止最安全的模型。

我们的安全测试还表明,Claude Haiku 4.5 在化学、生物、放射和核(CBRN)武器生产方面仅构成有限风险。因此,我们按照 AI 安全等级 2(ASL-2)标准发布了它——相比之下,Sonnet 4.5 和 Opus 4.1 采用了更严格的 ASL-3。你可以在 Claude Haiku 4.5 系统卡中阅读该模型 ASL-2 分类背后的完整推理,以及我们所有其他安全测试的详细信息。

更多信息

Claude Haiku 4.5 现已在 Claude Code 和我们的应用中提供。它的高效性意味着你可以在使用限额内完成更多工作,同时保持高级模型的性能。

开发者可以在我们的 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上使用 Claude Haiku 4.5,它以我们最经济实惠的价格,可直接替代 Haiku 3.5 和 Sonnet 4。

如需完整的技术细节和评估结果,请参阅我们的系统卡、模型页面和文档。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com