Anthropic 发布 Claude 3.5 Sonnet 并推出 Artifacts 功能
Claude 3.5 Sonnet
Anthropic 发布 Claude 3.5 Sonnet,这是 Claude 3.5 模型家族的首个版本,在 GPQA、MMLU、HumanEval 等评测上超过 Claude 3 Opus,速度约为 Opus 的两倍,定价为每百万输入 token 3 美元、每百万输出 token 15 美元,上下文窗口 200K token。
官方给出 Claude 3.5 Sonnet 的定价、上下文窗口与智能体编码评测数据,可据此判断其相对 Claude 3 Opus 的速度与成本取舍。

更新
消费者条款与隐私政策
2025年8月28日
今天,我们推出 Claude 3.5 Sonnet——这是即将面世的 Claude 3.5 模型家族中的首个发布版本。Claude 3.5 Sonnet 提升了智能的行业标准,在广泛的评估中超越了竞品模型和 Claude 3 Opus,同时具备我们中端模型 Claude 3 Sonnet 的速度和成本。
Claude 3.5 Sonnet 现已在 Claude.ai 和 Claude iOS 应用上免费提供,而 Claude Pro 和 Team 计划订阅者可以以显著更高的速率限制访问它。它还可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 使用。该模型每百万输入 token 收费 3 美元,每百万输出 token 收费 15 美元,具有 200K token 的上下文窗口。

以两倍速度实现前沿智能
Claude 3.5 Sonnet 在研究生级推理(GPQA)、本科级知识(MMLU)和编码能力(HumanEval)方面树立了新的行业基准。它在把握细微差别、幽默和复杂指令方面表现出显著改进,并且非常擅长以自然、有共鸣的语气撰写高质量内容。
Claude 3.5 Sonnet 的运行速度是 Claude 3 Opus 的两倍。这一性能提升,结合高性价比的定价,使 Claude 3.5 Sonnet 成为处理复杂任务的理想选择,例如情境敏感的客户支持和编排多步骤工作流。
在一项内部智能体编码评估中,Claude 3.5 Sonnet 解决了 64% 的问题,超过了解决了 38% 的 Claude 3 Opus。我们的评估测试模型在给定所需改进的自然语言描述的情况下,修复开源代码库中的错误或添加功能的能力。当被指示并提供相关工具时,Claude 3.5 Sonnet 可以凭借精密的推理和故障排除能力独立编写、编辑和执行代码。它轻松处理代码翻译,使其特别适用于更新遗留应用程序和迁移代码库。

最先进的视觉能力
Claude 3.5 Sonnet 是我们迄今为止最强的视觉模型,在标准视觉基准上超越了 Claude 3 Opus。这些跨越式的改进在需要视觉推理的任务中最为明显,例如解读图表和图形。Claude 3.5 Sonnet 还能从不完美的图像中准确转录文本——这是零售、物流和金融服务领域的核心能力,在这些领域,AI 可能从图像、图形或插图中比仅从文本中获得更多洞察。

Artifacts——使用 Claude 的新方式
今天,我们还在 Claude.ai 上推出了 Artifacts,这是一项新功能,扩展了用户与 Claude 交互的方式。当用户要求 Claude 生成代码片段、文本文档或网站设计等内容时,这些 Artifacts 会出现在对话旁边的专用窗口中。这创建了一个动态工作空间,用户可以在其中实时查看、编辑和构建 Claude 的创作,将 AI 生成的内容无缝集成到他们的项目和工作流中。
这一预览功能标志着 Claude 从对话式 AI 向协作式工作环境的演变。这只是 Claude.ai 更广阔愿景的开始,该愿景很快将扩展到支持团队协作。在不久的将来,团队——并最终整个组织——将能够安全地将其知识、文档和正在进行的工作集中到一个共享空间中,而 Claude 则充当按需的队友。
对安全与隐私的承诺
我们的模型经过严格测试,并经过训练以减少滥用。尽管 Claude 3.5 Sonnet 在智能上实现了飞跃,但我们的红队评估得出结论,Claude 3.5 Sonnet 仍处于 ASL-2 级别。更多详情可参见模型卡附录。
作为我们对安全与透明度承诺的一部分,我们与外部专家合作,测试并完善了这款最新模型中的安全机制。我们最近将 Claude 3.5 Sonnet 提供给英国人工智能安全研究所(UK AISI)进行部署前安全评估。UK AISI 完成了对 3.5 Sonnet 的测试,并根据一份谅解备忘录与美国人工智能安全研究所(US AISI)分享了他们的结果,这得益于美英 AISI 之间今年早些时候宣布的合作伙伴关系。
我们整合了来自外部主题专家的政策反馈,以确保我们的评估稳健可靠,并考虑到新的滥用趋势。这种合作帮助我们的团队扩大了针对各类滥用情况评估 3.5 Sonnet 的能力。例如,我们利用来自 Thorn 的儿童安全专家的反馈,更新了我们的分类器并微调了我们的模型。
指导我们 AI 模型开发的核心宪法原则之一是隐私。除非用户明确许可,否则我们不会使用用户提交的数据训练我们的生成式模型。
即将推出
我们的目标是每隔几个月大幅改善智能、速度和成本之间的权衡曲线。为了完善 Claude 3.5 模型系列,我们将在今年晚些时候发布 Claude 3.5 Haiku 和 Claude 3.5 Opus。
除了研发我们的下一代模型系列外,我们还在开发新的模态和功能,以支持更多企业用例,包括与企业应用程序的集成。我们的团队还在探索诸如 Memory 之类的功能,这将使 Claude 能够按指定记住用户的偏好和交互历史,从而让他们的体验更加个性化和高效。
我们一直在努力改进 Claude,并乐于听取用户的意见。您可以直接在产品内提交关于 Claude 3.5 Sonnet 的反馈,以帮助我们制定开发路线图,并帮助我们的团队改善您的体验。一如既往,我们期待看到您使用 Claude 构建、创造和发现的一切。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier 部署工程师,来自埃森哲、贝恩、CBA、德勤、麦肯锡、摩根士丹利和诺和诺德的首批学员已经开课。
巴克莱银行扩展 Claude 应用以升级运营并改善客户体验
英国全能银行巴克莱银行正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com