Anthropic 发布 Claude 3 模型家族,含 Haiku、Sonnet 和 Opus
Introducing the next generation of Claude
Anthropic 发布 Claude 3 模型家族,按能力升序为 Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus,Opus 与 Sonnet 即日起在 claude.ai 和 Claude API 上线,API 已在 159 个国家开放,Haiku 稍后推出。
官方给出三档模型的基准、定价与上下文窗口,可据此判断不同工作负载该选哪一档。

今天,我们宣布推出 Claude 3 模型系列,该系列在广泛的认知任务中树立了新的行业基准。该系列包括三个最先进的模型,按能力升序排列:Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus。每个后续模型都提供越来越强大的性能,使用户能够为其特定应用选择智能、速度和 成本 的最佳平衡。
Opus 和 Sonnet 现已在 claude.ai 和 Claude API 中可用,该 API 现已在 159 个国家/地区 全面可用。Haiku 即将推出。
Claude 3 模型系列

智能的新标准
Opus,我们最智能的模型,在大多数常见的人工智能系统评估基准上均优于同类模型,包括本科水平专家知识(MMLU)、研究生水平专家推理(GPQA)、基础数学(GSM8K)等。它在复杂任务上展现出接近人类的理解和流畅度,引领通用智能的前沿。
所有 Claude 3 模型在分析和预测、细致的内容创作、代码生成以及使用西班牙语、日语和法语等非英语语言对话方面均展现出增强的能力。
以下是在多个能力基准 [1] 上 Claude 3 模型与同类模型的比较:

近乎即时的结果
Claude 3 模型可以支持实时客户聊天、自动补全和数据提取任务,这些任务需要即时和实时的响应。
Haiku 是其智能类别中市场上最快、最具成本效益的模型。它可以在不到三秒内阅读一篇包含图表和图形的 arXiv 上信息密集的研究论文(约 10k 个 token)。发布后,我们预计性能将进一步提升。
对于绝大多数工作负载,Sonnet 比 Claude 2 和 Claude 2.1 快 2 倍,且智能水平更高。它擅长需要快速响应的任务,如知识检索或销售自动化。Opus 提供与 Claude 2 和 2.1 相似的速度,但智能水平要高得多。
强大的视觉能力
Claude 3 模型具有与其他领先模型相当的复杂视觉能力。它们可以处理各种视觉格式,包括照片、图表、图形和技术示意图。我们特别兴奋能够为企业客户提供这种新模态,其中一些客户高达 50% 的知识库以 PDF、流程图或演示幻灯片等各种格式编码。

更少的拒绝
以前的 Claude 模型经常做出不必要的拒绝,表明缺乏上下文理解。我们在这方面取得了有意义的进展:与之前几代模型相比,Opus、Sonnet 和 Haiku 拒绝回答接近系统护栏的提示的可能性显著降低。如下图所示,Claude 3 模型对请求表现出更细致的理解,识别真正的危害,并且更少拒绝回答无害的提示。

提高准确性
各种规模的企业都依赖我们的模型为客户提供服务,因此我们的模型输出必须在大规模应用中保持高准确性。为了评估这一点,我们使用大量复杂的、针对当前模型已知弱点的真实性问题。我们将回答分为正确答案、错误答案(或幻觉)以及承认不确定性,即模型表示不知道答案,而不是提供错误信息。与 Claude 2.1 相比,Opus 在这些具有挑战性的开放式问题上准确率(或正确答案)提升了两倍,同时错误答案也减少了。
除了产生更可信的回答外,我们很快将在 Claude 3 模型中启用引用功能,以便它们能够指向参考材料中的精确句子来验证其答案。

长上下文与近乎完美的召回
Claude 3 系列模型在发布初期将提供 200K 上下文窗口。然而,所有三个模型都能够接受超过 100 万个 token 的输入,我们可能会向需要增强处理能力的特定客户提供这一功能。
为了有效处理长上下文提示,模型需要强大的召回能力。“大海捞针”(NIAH)评估衡量模型从大量数据中准确召回信息的能力。我们通过在每个提示中使用 30 个随机针/问题对之一,并在多样化的众包文档语料库上进行测试,增强了该基准的稳健性。Claude 3 Opus 不仅实现了近乎完美的召回,准确率超过 99%,而且在某些情况下,它甚至识别出了评估本身的局限性,发现“针”句子似乎是人为插入原始文本中的。

负责任的设计
我们开发 Claude 3 系列模型,旨在使其既强大又值得信赖。我们有几个专门团队负责跟踪和缓解广泛的风险,从错误信息和 CSAM 到生物滥用、选举干预和自主复制技能。我们继续开发诸如 Constitutional AI 等方法,以提高模型的安全性和透明度,并调整模型以缓解新模态可能引发的隐私问题。
解决日益复杂模型中的偏见是一项持续的努力,我们在这次新发布中取得了长足进步。如模型卡所示,根据 Bias Benchmark for Question Answering (BBQ),Claude 3 比我们之前的模型表现出更少的偏见。我们仍然致力于推进减少偏见和促进模型更加中立的技术,确保它们不偏向任何特定的党派立场。
虽然 Claude 3 模型系列在生物知识、网络相关知识和自主性等关键指标上比之前的模型有所进步,但根据我们的 Responsible Scaling Policy,它仍处于 AI 安全等级 2(ASL-2)。我们的 红队测试评估(按照我们的 白宫承诺和 2023 年美国行政命令进行)得出结论,这些模型目前带来的灾难性风险潜力微乎其微。我们将继续仔细监控未来的模型,以评估它们与 ASL-3 阈值的接近程度。更多安全细节可在 Claude 3 模型卡中获取。
更易于使用
Claude 3 模型更擅长遵循复杂的多步骤指令。它们尤其擅长遵循品牌语气和响应准则,并开发出用户可以信赖的面向客户的体验。此外,Claude 3 模型更擅长生成 JSON 等流行的结构化输出——这使得为自然语言分类和情感分析等用例指导 Claude 变得更加简单。
模型详情
Claude 3 Opus 是我们最智能的模型,在高度复杂的任务上具有市场上最佳的表现。它能够以非凡的流畅性和类人的理解力应对开放式提示和前所未见的场景。Opus 向我们展示了生成式 AI 可能达到的外围极限。
| 成本 [输入 $/百万 token | 输出 $/百万 token] | $15 | $75 |
| 上下文窗口 | 200K* |
| 潜在用途 |
|
| 差异化优势 | 比任何其他可用模型都更智能。 |
*特定用例可使用 100 万 token,请咨询。

Claude 3 Sonnet 在智能与速度之间实现了理想平衡——尤其适用于企业工作负载。与同类模型相比,它以更低的成本提供强劲性能,并专为大规模 AI 部署中的高耐久性而设计。
| 成本 [输入 $/百万 token | 输出 $/百万 token] | $3 | $15 |
| 上下文窗口 | 200K |
| 潜在用途 |
|
| 差异化优势 | 比具有类似智能水平的其他模型更实惠;更适合规模化。 |
Claude 3 Haiku 是我们最快、最紧凑的模型,可实现近乎即时的响应。它以无与伦比的速度回答简单查询和请求。用户将能够构建模仿人类交互的无缝 AI 体验。
| 成本 [输入 $/百万 token | 输出 $/百万 token] | $0.25 | $1.25 |
| 上下文窗口 | 200K |
| 潜在用途 |
|
| 差异化优势 | 在其智能类别中,比其他模型更智能、更快速、更实惠。 |
模型可用性
Opus 和 Sonnet 今天即可在我们的 API 中使用,该 API 现已全面可用,使开发者能够注册并立即开始使用这些模型。Haiku 即将推出。Sonnet 为 claude.ai 上的免费体验提供支持,Opus 则可供 Claude Pro 订阅者使用。
Sonnet 今天也可通过 Amazon Bedrock 使用,并在 Google Cloud 的 Vertex AI Model Garden 中处于私密预览阶段——Opus 和 Haiku 也将很快在这两个平台上线。
更智能、更快速、更安全
我们并不认为模型智能已接近其极限,我们计划在未来几个月内频繁发布 Claude 3 模型系列的更新。我们还很高兴推出一系列功能来增强我们模型的能力,特别是针对企业用例和大规模部署。这些新功能将包括工具使用(即函数调用)、交互式编码(即 REPL)以及更高级的智能体能力。
在我们推动 AI 能力边界的同时,我们同样致力于确保我们的安全护栏跟上这些性能的飞跃。我们的假设是,处于 AI 发展的前沿是引导其轨迹走向积极社会成果的最有效方式。
我们很期待看到您用 Claude 3 创造出什么,并希望您能给我们反馈,让 Claude 成为更有用的助手和创意伙伴。要开始使用 Claude 构建,请访问 anthropic.com/claude。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 正在向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier 部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱银行扩展 Claude 以升级运营并改善客户体验
英国全能银行巴克莱正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种具有类似 CRISPR 特性的新型酶系统。
来源:Anthropic News · anthropic.com