Anthropic 为 Claude 3.5 Sonnet 开发电脑操作能力
Developing a computer use model
Anthropic 宣布最新版 Claude 3.5 Sonnet 具备电脑操作能力,在适当软件环境下可移动光标、点击屏幕位置并通过虚拟键盘输入,目前处于公开测试阶段。
Anthropic 官方披露 Claude 3.5 Sonnet 电脑操作能力的训练思路与安全评估,可了解该能力当前边界。
更新
消费者条款与隐私政策
2025年8月28日
Claude 现在可以使用计算机了。在适当的软件设置下运行最新版本的 Claude 3.5 Sonnet,它能够遵循用户的指令,在计算机屏幕上移动光标、点击相关位置,并通过虚拟键盘输入信息,模拟人们与自己计算机交互的方式。
我们认为这项技能——目前处于公开测试阶段——代表了 AI 进步的重大突破。下面,我们分享一些来自开发计算机使用模型研究中的见解——以及如何使其更安全。
为什么这项新能力很重要?现代工作的大量内容都是通过计算机完成的。让 AI 能够以与人类相同的方式直接与计算机软件交互,将开启当前一代 AI 助手根本无法实现的大量应用。
在过去几年中,强大 AI 的发展已经达到了许多重要的里程碑——例如,执行复杂逻辑推理的能力,以及看到并理解图像的能力。下一个前沿是计算机使用:AI 模型不必通过专门的工具进行交互,而是被赋予按照指令使用几乎任何软件的能力。
研究过程
我们之前在工具使用和多模态方面的工作为这些新的计算机使用技能奠定了基础。操作计算机涉及看到并解读图像的能力——在这里,就是计算机屏幕的图像。它还需要根据屏幕上的内容推理如何以及何时执行特定操作。结合这些能力,我们训练 Claude 解读屏幕上正在发生的事情,然后使用可用的软件工具来执行任务。
当开发者让 Claude 使用某个计算机软件并授予其必要的访问权限时,Claude 会查看用户可见内容的截图,然后计算它需要垂直或水平移动光标多少像素,才能点击正确的位置。训练 Claude 准确计算像素至关重要。没有这项技能,模型很难给出鼠标指令——类似于模型常常在看似简单的问题上挣扎,比如“单词‘banana’中有几个 A?”
我们惊讶于 Claude 从我们仅用几个简单软件(如计算器和文本编辑器)对它进行的计算机使用训练中泛化得如此之快(出于安全原因,我们在训练期间不允许模型访问互联网)。结合 Claude 的其他技能,这项训练赋予了它非凡的能力,能够将用户书写的提示转化为一系列逻辑步骤,然后在计算机上采取行动。我们观察到,模型在遇到障碍时甚至会自我纠正并重试任务。
尽管一旦我们取得初步突破,后续进展就来得很快,但达到那一步需要大量的试错。我们的一些研究人员指出,开发计算机使用接近于他们刚进入该领域时所设想的 AI 研究的“理想化”过程:不断迭代,反复回到绘图板,直到取得进展。
研究得到了回报。目前,Claude 在像人一样使用计算机的模型——即通过查看屏幕并据此采取行动——方面处于最先进水平。在一项为测试开发者尝试让模型使用计算机而创建的评估中,OSWorld,Claude 目前获得了 14.9%。这远未达到人类水平的技能(通常为 70-75%),但远高于同类中次优 AI 模型获得的 7.7%。
让计算机使用变得安全
AI 的每一次进步都带来新的安全挑战。计算机使用主要是降低 AI 系统应用其现有认知技能的门槛,而不是从根本上增加这些技能,因此我们对计算机使用的首要关注点集中在当前的危害而非未来的危害。我们通过评估计算机使用是否增加了我们负责任扩展政策中概述的前沿威胁风险来确认这一点。我们发现,更新后的 Claude 3.5 Sonnet,包括其新的计算机使用技能,仍处于 AI 安全级别 2——也就是说,它不需要比我们目前实施的更高标准的安全和安保措施。
当未来的模型因为呈现灾难性风险而需要 AI 安全级别 3 或 4 的保障时,计算机使用可能会加剧这些风险。我们认为,现在引入计算机使用可能更好,因为模型仍然只需要 AI 安全级别 2 的保障。这意味着我们可以在风险过高之前就开始应对任何安全问题,而不是首次将计算机使用能力添加到具有更严重风险的模型中。
本着这种精神,我们的信任与安全团队对我们的新计算机使用模型进行了广泛分析,以识别潜在漏洞。他们发现的一个担忧是“提示注入”——一种网络攻击,其中恶意指令被输入到 AI 模型中,导致它要么覆盖其先前的指令,要么执行偏离用户原始意图的意外操作。由于 Claude 可以解释来自连接到互联网的计算机的屏幕截图,它可能会接触到包含提示注入攻击的内容。
在我们的公开测试版中使用计算机使用版 Claude 的用户应采取相关预防措施,以尽量减少此类风险。作为开发者的资源,我们在参考实现中提供了进一步的指导。
与任何 AI 能力一样,用户也有可能故意滥用 Claude 的计算机技能。我们的团队已经开发了分类器和其他方法来标记和减轻此类滥用。鉴于即将到来的美国选举,我们高度警惕可能被视为破坏公众对选举过程信任的滥用企图。虽然计算机使用还不够先进或能够以相对于现有能力构成更高风险的规模运行,但我们已经制定了措施来监控 Claude 被要求参与选举相关活动的情况,以及引导 Claude 远离诸如在社交媒体上生成和发布内容、注册网络域名或与政府网站互动等活动的系统。我们将持续评估和迭代这些安全措施,以在公开测试版期间平衡 Claude 的能力与负责任的使用。
计算机使用的未来
计算机使用是一种完全不同的 AI 开发方式。到目前为止,LLM 开发者一直是让工具适应模型,构建定制环境,让 AI 使用专门设计的工具来完成各种任务。现在,我们可以让模型适应工具——Claude 可以融入我们每天使用的计算机环境。我们的目标是让 Claude 直接使用现有的计算机软件,就像人一样使用它们。
还有很多工作要做。尽管这已是当前最先进的技术水平,Claude 的计算机使用仍然缓慢且经常出错。人们日常在计算机上做的许多操作(拖拽、缩放等),Claude 目前还无法尝试。Claude 对屏幕的“翻页书”式视图——通过截取屏幕截图并将它们拼接起来,而不是观察更细粒度的视频流——意味着它可能会错过短暂的操作或通知。
即使在为今天的发布录制计算机使用演示时,我们也遇到了一些有趣的错误。其中一次,Claude 不小心点击停止了长时间运行的屏幕录制,导致所有素材丢失。另一次,Claude 突然从我们的编码演示中停下来,开始浏览黄石国家公园的照片。
我们预计计算机使用将迅速改进,变得更快、更可靠,并对用户想要完成的任务更有用。对于软件开发经验较少的人来说,实现起来也会容易得多。在每个阶段,我们的研究人员都将与安全团队密切合作,确保 Claude 的新能力伴随适当的安全措施。
我们邀请在公开测试版中尝试计算机使用的开发者使用此表单联系我们并提供反馈,以便我们的研究人员能够继续改进这一新能力的实用性和安全性。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 应用以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层方向的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com