Anthropic 发布升级版 Claude 3.5 Sonnet、Claude 3.5 Haiku 及 computer use 公测
Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku
Anthropic 发布升级版 Claude 3.5 Sonnet 和新模型 Claude 3.5 Haiku,并公开 computer use 能力公测。
官方给出升级版 Claude 3.5 Sonnet 与 Haiku 的基准变化,并首次开放 computer use 公测,可据此判断智能体操作电脑的当前边界。
更新(2024年12月3日):我们已修订 Claude 3.5 Haiku 的定价。该模型现在的价格为输入 $0.80 MTok / 输出 $4 MTok。
今天,我们宣布推出升级版 Claude 3.5 Sonnet,以及一款新模型 Claude 3.5 Haiku。升级版 Claude 3.5 Sonnet 相较其前代实现了全面改进,在编码方面提升尤为显著——而这正是它此前已领先的领域。Claude 3.5 Haiku 在许多评估中达到了我们此前最大模型 Claude 3 Opus 的性能,速度则与上一代 Haiku 相近。
我们还推出了一项突破性的新能力公开测试版:计算机使用。该能力今日在 API 上可用,开发者可以指示 Claude 像人一样使用计算机——查看屏幕、移动光标、点击按钮和输入文本。Claude 3.5 Sonnet 是首个提供计算机使用公开测试版的前沿 AI 模型。现阶段,它仍处于实验性阶段——有时笨拙且容易出错。我们提前发布计算机使用功能,以获取开发者的反馈,并预计该能力将随时间迅速改进。
Asana、Canva、Cognition、DoorDash、Replit 和 The Browser Company 已经开始探索这些可能性,执行需要数十步、有时甚至数百步才能完成的任务。例如,Replit 正在利用 Claude 3.5 Sonnet 的计算机使用和 UI 导航能力,为其 Replit Agent 产品开发一项关键功能,用于在应用构建过程中对其进行评估。
升级版 Claude 3.5 Sonnet 现已面向所有用户开放。从今天起,开发者可以在 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上使用计算机使用测试版进行构建。新的 Claude 3.5 Haiku 将于本月晚些时候发布。

Claude 3.5 Sonnet:业界领先的软件工程能力
更新后的 Claude 3.5 Sonnet 在行业基准测试中展现出广泛改进,在智能体编码和工具使用任务上提升尤为强劲。在编码方面,它将 SWE-bench Verified 上的性能从 33.4% 提升至 49.0%,得分高于所有公开可用的模型——包括 OpenAI o1-preview 等推理模型以及专为智能体编码设计的专用系统。它还在 TAU-bench 这一智能体工具使用任务上提升了性能,零售领域从 62.6% 提升至 69.2%,在更具挑战性的航空领域从 36.0% 提升至 46.0%。新的 Claude 3.5 Sonnet 以与其前代相同的价格和速度提供这些进步。
早期客户反馈表明,升级版 Claude 3.5 Sonnet 代表了 AI 驱动编码的一次重大飞跃。GitLab 在 DevSecOps 任务中测试了该模型,发现它提供了更强的推理能力(各用例中最高提升 10%),且没有增加延迟,使其成为驱动多步骤软件开发流程的理想选择。Cognition 使用新的 Claude 3.5 Sonnet 进行自主 AI 评估,与上一版本相比,在编码、规划和问题解决方面都取得了显著改进。The Browser Company 在使用该模型自动化基于 Web 的工作流程时指出,Claude 3.5 Sonnet 的表现优于他们此前测试过的所有模型。
作为我们与外部专家持续合作的一部分,美国人工智能安全研究所(US AISI)和英国安全研究所(UK AISI)对新 Claude 3.5 Sonnet 模型进行了联合部署前测试。
我们还评估了升级版 Claude 3.5 Sonnet 的灾难性风险,发现根据我们的负责任扩展政策,ASL-2 标准对该模型仍然适用。
Claude 3.5 Haiku:最先进的技术与实惠和速度相结合
Claude 3.5 Haiku 是我们最快模型的下一代。在与 Claude 3 Haiku 相似的速度下,Claude 3.5 Haiku 在各项技能上都有所提升,并在许多智能基准测试中超越了上一代最大的模型 Claude 3 Opus。Claude 3.5 Haiku 在编码任务上尤其强大。例如,它在 SWE-bench Verified 上得分 40.6%,超过了使用公开可用最先进模型的许多智能体——包括最初的 Claude 3.5 Sonnet 和 GPT-4o。
凭借低延迟、改进的指令遵循和更准确的工具使用,Claude 3.5 Haiku 非常适合面向用户的产品、专门的子智能体任务,以及从海量数据(如购买历史、定价或库存记录)中生成个性化体验。
Claude 3.5 Haiku 将于本月晚些时候在我们的第一方 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上提供——最初为纯文本模型,随后将支持图像输入。
负责任地教 Claude 操作计算机
通过计算机使用,我们正在尝试一些根本性的新事物。我们不是制作特定工具来帮助 Claude 完成单个任务,而是教它通用的计算机技能——允许它使用为人类设计的各种标准工具和软件程序。开发者可以利用这一新兴能力来自动化重复流程、构建和测试软件,以及进行开放式任务,如研究。
为了实现这些通用技能,我们构建了一个 API,允许 Claude 感知计算机界面并与之交互。开发者可以集成此 API,使 Claude 能够将指令(例如,“使用我电脑和在线数据填写此表单”)转换为计算机命令(例如,检查电子表格;移动光标打开网络浏览器;导航到相关网页;用这些页面的数据填写表单;等等)。在OSWorld(评估 AI 模型像人类一样使用计算机的能力)上,Claude 3.5 Sonnet 在仅截图类别中得分 14.9%——明显优于次优 AI 系统的 7.8%。当获得更多步骤来完成任务时,Claude 得分 22.0%。
虽然我们预计这一能力在未来几个月会迅速提升,但 Claude 目前使用计算机的能力仍不完善。一些人们毫不费力就能完成的动作——滚动、拖拽、缩放——目前对 Claude 来说仍存在挑战,我们鼓励开发者从低风险任务开始探索。由于计算机使用可能为垃圾信息、虚假信息或欺诈等更常见的威胁提供新的载体,我们正采取主动措施来促进其安全部署。我们开发了新的分类器,可以识别计算机使用是否正在被使用,以及是否正在造成危害。你可以在我们关于开发计算机使用的文章中,进一步了解这项新技能背后的研究过程,以及对安全措施的更多讨论。
展望未来
从这项仍处于最早阶段技术的初步部署中学习,将帮助我们更好地理解能力日益强大的 AI 系统所蕴含的潜力与影响。
我们很高兴你能探索我们的新模型以及计算机使用的公开测试版——也欢迎你与我们分享反馈。我们相信这些进展将为你与 Claude 协作的方式开辟新的可能性,我们期待看到你会创造出什么。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口
Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 应用,以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层级指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com