跳到正文
Anthropic News·· 2024-06-21精选AI 评分88

Anthropic 发布 Claude 3.5 Sonnet 并推出 Artifacts 功能

Claude 3.5 Sonnet

AI 导读

Anthropic 发布 Claude 3.5 Sonnet,这是 Claude 3.5 模型家族的首个版本,在 GPQA、MMLU、HumanEval 等评测上超过 Claude 3 Opus,速度约为 Opus 的两倍,定价为每百万输入 token 3 美元、每百万输出 token 15 美元,上下文窗口 200K token。

推荐理由

官方给出 Claude 3.5 Sonnet 的定价、上下文窗口与智能体编码评测数据,可据此判断其相对 Claude 3 Opus 的速度与成本取舍。

正文 · AI 翻译
Claude head illustration
  • 更新

    消费者条款与隐私政策

    2025年8月28日

今天,我们推出 Claude 3.5 Sonnet——这是即将面世的 Claude 3.5 模型家族中的首个发布版本。Claude 3.5 Sonnet 提升了智能的行业标准,在广泛的评估中超越了竞品模型和 Claude 3 Opus,同时具备我们中端模型 Claude 3 Sonnet 的速度和成本。

Claude 3.5 Sonnet 现已在 Claude.ai 和 Claude iOS 应用上免费提供,而 Claude Pro 和 Team 计划订阅者可以以显著更高的速率限制访问它。它还可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 使用。该模型每百万输入 token 收费 3 美元,每百万输出 token 收费 15 美元,具有 200K token 的上下文窗口。

Claude model family

以两倍速度实现前沿智能

Claude 3.5 Sonnet 在研究生级推理(GPQA)、本科级知识(MMLU)和编码能力(HumanEval)方面树立了新的行业基准。它在把握细微差别、幽默和复杂指令方面表现出显著改进,并且非常擅长以自然、有共鸣的语气撰写高质量内容。

Claude 3.5 Sonnet 的运行速度是 Claude 3 Opus 的两倍。这一性能提升,结合高性价比的定价,使 Claude 3.5 Sonnet 成为处理复杂任务的理想选择,例如情境敏感的客户支持和编排多步骤工作流。

在一项内部智能体编码评估中,Claude 3.5 Sonnet 解决了 64% 的问题,超过了解决了 38% 的 Claude 3 Opus。我们的评估测试模型在给定所需改进的自然语言描述的情况下,修复开源代码库中的错误或添加功能的能力。当被指示并提供相关工具时,Claude 3.5 Sonnet 可以凭借精密的推理和故障排除能力独立编写、编辑和执行代码。它轻松处理代码翻译,使其特别适用于更新遗留应用程序和迁移代码库。

Claude 3.5 Sonnet benchmarks

最先进的视觉能力

Claude 3.5 Sonnet 是我们迄今为止最强的视觉模型,在标准视觉基准上超越了 Claude 3 Opus。这些跨越式的改进在需要视觉推理的任务中最为明显,例如解读图表和图形。Claude 3.5 Sonnet 还能从不完美的图像中准确转录文本——这是零售、物流和金融服务领域的核心能力,在这些领域,AI 可能从图像、图形或插图中比仅从文本中获得更多洞察。

Claude 3.5 Sonnet vision evals

Artifacts——使用 Claude 的新方式

今天,我们还在 Claude.ai 上推出了 Artifacts,这是一项新功能,扩展了用户与 Claude 交互的方式。当用户要求 Claude 生成代码片段、文本文档或网站设计等内容时,这些 Artifacts 会出现在对话旁边的专用窗口中。这创建了一个动态工作空间,用户可以在其中实时查看、编辑和构建 Claude 的创作,将 AI 生成的内容无缝集成到他们的项目和工作流中。

这一预览功能标志着 Claude 从对话式 AI 向协作式工作环境的演变。这只是 Claude.ai 更广阔愿景的开始,该愿景很快将扩展到支持团队协作。在不久的将来,团队——并最终整个组织——将能够安全地将其知识、文档和正在进行的工作集中到一个共享空间中,而 Claude 则充当按需的队友。

对安全与隐私的承诺

我们的模型经过严格测试,并经过训练以减少滥用。尽管 Claude 3.5 Sonnet 在智能上实现了飞跃,但我们的红队评估得出结论,Claude 3.5 Sonnet 仍处于 ASL-2 级别。更多详情可参见模型卡附录。

作为我们对安全与透明度承诺的一部分,我们与外部专家合作,测试并完善了这款最新模型中的安全机制。我们最近将 Claude 3.5 Sonnet 提供给英国人工智能安全研究所(UK AISI)进行部署前安全评估。UK AISI 完成了对 3.5 Sonnet 的测试,并根据一份谅解备忘录与美国人工智能安全研究所(US AISI)分享了他们的结果,这得益于美英 AISI 之间今年早些时候宣布的合作伙伴关系。

我们整合了来自外部主题专家的政策反馈,以确保我们的评估稳健可靠,并考虑到新的滥用趋势。这种合作帮助我们的团队扩大了针对各类滥用情况评估 3.5 Sonnet 的能力。例如,我们利用来自 Thorn 的儿童安全专家的反馈,更新了我们的分类器并微调了我们的模型。

指导我们 AI 模型开发的核心宪法原则之一是隐私。除非用户明确许可,否则我们不会使用用户提交的数据训练我们的生成式模型。

即将推出

我们的目标是每隔几个月大幅改善智能、速度和成本之间的权衡曲线。为了完善 Claude 3.5 模型系列,我们将在今年晚些时候发布 Claude 3.5 Haiku 和 Claude 3.5 Opus。

除了研发我们的下一代模型系列外,我们还在开发新的模态和功能,以支持更多企业用例,包括与企业应用程序的集成。我们的团队还在探索诸如 Memory 之类的功能,这将使 Claude 能够按指定记住用户的偏好和交互历史,从而让他们的体验更加个性化和高效。

我们一直在努力改进 Claude,并乐于听取用户的意见。您可以直接在产品内提交关于 Claude 3.5 Sonnet 的反馈,以帮助我们制定开发路线图,并帮助我们的团队改善您的体验。一如既往,我们期待看到您使用 Claude 构建、创造和发现的一切。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口

Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier 部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。

阅读更多

巴克莱银行扩展 Claude 应用以升级运营并改善客户体验

英国全能银行巴克莱银行正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com