跳到正文
Anthropic News·· 2025-02-24精选AI 评分82

Anthropic 发布 Claude 3.7 Sonnet 的扩展思考模式

Claude’s extended thinking

AI 导读

Anthropic 为 Claude 3.7 Sonnet 推出可开关的扩展思考模式,用户可切换是否让模型深入思考,开发者还能设置思考预算控制思考时长。该模式让同一模型自行分配更多时间与算力,而非切换到另一个模型,其原始思考过程对用户可见,官方将其定位为研究预览。

推荐理由

Anthropic 官方披露 Claude 3.7 Sonnet 扩展思考的可见推理机制,并给出 GPQA 与智能体评测数据。

正文 · AI 翻译

有些事情我们几乎瞬间就能完成,比如“今天星期几?”而另一些则需要更多的脑力耐力,比如解开一个隐晦的填字游戏或调试一段复杂的代码。我们可以根据手头的任务选择投入或多或少的认知努力。

现在,Claude 也具备了同样的灵活性。借助新的 Claude 3.7 Sonnet,用户可以开启或关闭“扩展思考模式”,引导模型对更棘手的问题进行更深入的思考1。开发者甚至可以设置“思考预算”,精确控制 Claude 在一个问题上花费多长时间。

扩展思考模式并不是切换到采用不同策略的另一个模型。相反,它允许同一个模型给自己更多时间、投入更多努力来得出答案。

Claude 新的扩展思考能力使其智能得到了令人瞩目的提升。但这也为那些对 AI 模型如何运作、如何评估它们以及如何提升其安全性感兴趣的人提出了许多重要问题。在这篇文章中,我们分享一些我们获得的见解。

可见的思考过程

除了赋予 Claude 更长时间思考、从而回答更棘手问题的能力外,我们还决定以原始形式公开其思考过程。这有几个好处:

  • 信任。能够观察 Claude 的思考方式,使人更容易理解和核查其答案——也可能帮助用户获得更好的输出。
  • 对齐。在我们之前的一些 对齐科学研究中,我们利用模型内心所想与对外所言之间的矛盾,来识别它是否可能正在做出欺骗等令人担忧的行为。
  • 趣味。观察 Claude 思考往往引人入胜。我们一些有数学和物理学背景的研究人员注意到,Claude 的思考过程与他们自己推理难题的方式惊人地相似:探索许多不同的角度和推理分支,并对答案进行反复核对。

但可见的思考过程也有几个缺点。首先,用户可能会注意到,所展示的思考比 Claude 的默认输出更超然、听起来更缺乏个性。这是因为我们没有对模型的思考过程进行标准的 角色训练。我们希望给 Claude 最大的自由度,让它思考得出答案所需的任何想法——而且就像人类思考一样,Claude 有时会在过程中产生一些错误、误导性或半成品的想法。许多用户会觉得这很有用;另一些人可能会觉得这(以及思考过程中个性较弱的内容)令人沮丧。

另一个问题是所谓的“忠实性”——我们并不确定思考过程中的内容是否真正代表了模型脑海中发生的事情(例如,思考过程中显示的英语词汇,可能根本无法描述模型为何表现出某种特定行为)。忠实性问题——以及如何确保忠实性——是我们活跃的研究领域之一。到目前为止,我们的结果表明,模型常常基于它们没有在思考过程中明确讨论的因素做出决定。这意味着我们不能依赖监控当前模型的思考来为其安全性提供强有力的论据2。

第三,它带来了若干安全与安保方面的担忧。恶意行为者或许能够利用这种可见的思维过程来构建更好的策略,以越狱 Claude。更具推测性的是,如果模型在训练过程中得知自己的内部思考会被展示出来,它们可能会被激励以不同的、更难以预测的方式思考——或者故意隐藏某些想法。

对于未来能力更强的 Claude 版本——那些如果对齐不当会带来更大风险的版本——后一种担忧将尤为突出。我们将在未来版本中权衡公开思维过程的利弊3。与此同时,Claude 3.7 Sonnet 中可见的思维过程应被视为研究预览。

Claude 思维的新测试

Claude 作为智能体

Claude 3.7 Sonnet 受益于我们或许可以称之为“行动扩展”的能力——这是一种改进的能力,使其能够迭代调用函数、响应环境变化,并持续进行直到完成一项开放式任务。此类任务的一个例子是使用计算机:Claude 可以发出虚拟鼠标点击和键盘按键,代表用户解决任务。与其前身相比,Claude 3.7 Sonnet 可以为计算机使用任务分配更多轮次——以及更多时间和计算能力——并且其结果通常更好。

我们可以从 Claude 3.7 Sonnet 在 OSWorld 上的改进中看到这一点,OSWorld 是一项衡量多模态 AI 智能体能力的评估。Claude 3.7 Sonnet 一开始就稍好一些,但随着模型继续与虚拟计算机交互,性能差距会逐渐扩大。

A chart showing the performance of Claude 3.5 Sonnet (new) versus Claude 3.7 on the OSWorld evaluation. Number of steps is on the x-axis; score is on the y-axis. Both models start out in around the same place and get better with a larger number of steps, but Claude 3.7 Sonnet improves more quickly.
Claude 3.7 Sonnet 与其前身模型在 OSWorld 评估中的性能对比,测试多模态计算机使用技能。“Pass @ 1”:模型只有一次尝试解决特定问题的机会,才能算作通过。

Claude 玩 Pokémon

Claude 的扩展思维和智能体训练共同帮助它在许多标准评估(如 OSWorld)上表现更好。但它们也在一些其他或许更意想不到的任务上带来了重大提升。

玩 Pokémon——具体来说是 Game Boy 经典游戏 Pokémon Red——正是这样一项任务。我们为 Claude 配备了基本记忆、屏幕像素输入以及按下按钮和在屏幕上导航的函数调用,使其能够在通常的上下文限制之外持续玩 Pokémon,通过数万次交互维持游戏进行。

在下图中,我们绘制了 Claude 3.7 Sonnet 的 Pokémon 进度,以及之前没有扩展思维选项的 Claude Sonnet 版本的进度。如您所见,之前的版本在游戏早期就卡住了,Claude 3.0 Sonnet 甚至未能离开故事开始的 Pallet Town 的房子。

但 Claude 3.7 Sonnet 改进的智能体能力帮助它走得更远,成功击败了三位 Pokémon 道馆馆主(游戏中的 Boss)并赢得了他们的徽章。Claude 3.7 Sonnet 在尝试多种策略和质疑先前假设方面非常有效,这使其能够在前进过程中提升自身能力。

A chart showing the performance of the various Claude Sonnet models at playing Pokémon. The number of actions taken by the AI is on the x-axis; the milestone reached in the game is on the y-axis. Claude 3.7 Sonnet is by far the most successful at achieving the game's milestones.
Claude 3.7 Sonnet 证明,在玩《宝可梦红》方面,它是迄今为止所有 Sonnet 模型中最出色的。横轴是 Claude 在玩游戏时完成的交互次数;纵轴是游戏中的重要里程碑,涉及收集特定物品、前往特定区域以及击败特定游戏 Boss。

《宝可梦》是欣赏 Claude 3.7 Sonnet 能力的一种有趣方式,但我们预计这些能力将在现实世界中产生远超游戏的影响。该模型保持专注并完成开放式目标的能力,将帮助开发者构建各种最先进的 AI 智能体。

串行与并行测试时计算扩展

当 Claude 3.7 Sonnet 使用其扩展思考能力时,可以说它受益于“串行测试时计算”。也就是说,它在产生最终输出之前使用多个连续的推理步骤,并在此过程中增加更多计算资源。总体而言,这以可预测的方式提升了其性能:例如,它在数学问题上的准确率会随着允许采样的“思考 token”数量的增加而对数级提升。

A graph of Claude 3.7 Sonnet's mathematical performance according to how many tokens were used in its thinking process. Tokens are on the x-axis; accuracy is on the y-axis. More tokens are related to higher accuracy.
Claude 3.7 Sonnet 在 2024 年美国数学邀请赛 2024 试题上的表现,取决于每道题允许使用多少思考 token。请注意,即使我们允许 Claude 使用全部思考预算,它通常也会提前停止。我们在图中包含了用于总结最终答案的采样 token。

我们的研究人员还一直在尝试使用并行测试时计算来提升模型性能。他们的做法是采样多个独立的思维过程,并在事先不知道真实答案的情况下选出最好的一个。一种方法是通过多数或共识投票;选择最常出现的答案作为“最佳”答案。另一种方法是使用另一个语言模型(例如 Claude 的另一个副本)来检查其工作,或使用学习到的评分函数,并选出它认为最好的答案。此类策略(以及类似工作)已在若干其他AI模型的评估结果中被报告)。

我们在GPQA 评估上使用并行测试时计算扩展取得了显著改进,这是一组常用的生物、化学和物理高难度问题。使用相当于 256 个独立样本的计算量、一个学习到的评分模型以及最大 64k token 的思考预算,Claude 3.7 Sonnet 在 GPQA 上取得了 84.8% 的分数(其中物理子分数为 96.5%),并且受益于超出多数投票限制的持续扩展。我们在下面报告了评分模型方法和多数投票方法的结果。

Four graphs showing the performance of Claude 3.7 Sonnet on the GPQA evaluation when using parallel test-time compute scaling. From top left, clockwise, they show performance on the full exam, the biology section, the physics section, ad the chemistry section. Multiple lines are shown depending on the way the evaluation was assessed.
使用并行测试时计算扩展来提升 Claude 3.7 Sonnet 在 GPQA 评估上表现的实验结果。不同的线代表不同的性能评分方法。“Majority @ N”:针对同一提示从模型生成多个输出,并以多数投票作为最终答案;“scoring model”:一个单独的模型,用于评估被评估模型的性能;“pass @ N”:如果在给定次数的尝试中任意一次成功,则模型“通过”测试。

这类方法让我们能够提升 Claude 回答的质量,通常无需等待它完成思考。Claude 可以同时进行多个不同的扩展思考过程,从而考虑更多解决问题的方法,最终更频繁地得出正确答案。我们新部署的模型尚不支持并行测试时计算扩展,但我们会继续为未来研究这些方法。

Claude 3.7 Sonnet 的安全机制

AI 安全等级。 Anthropic 的负责任扩展政策要求我们,除非已实施适当的安全与安保措施,否则不得训练或部署模型。我们的前沿红队和对齐压力测试团队对 Claude 3.7 Sonnet 进行了大量测试,以确定它是否需要与我们此前模型相同级别的部署和安全保障——即 AI 安全等级(ASL)2 标准——还是需要更强的措施。

我们对 Claude 3.7 Sonnet 的全面评估确认,当前的 ASL-2 安全标准仍然适用。与此同时,该模型在所有领域都展现出更高的复杂度和更强的能力。在针对化学、生物、放射和核(CBRN)武器生产相关任务的对照研究中,我们观察到,与未受模型辅助的参与者相比,受模型辅助的参与者出现了一定的表现“提升”。也就是说,参与者能够比仅使用网上可获取的信息取得更进一步的进展。然而,所有执行这些任务的尝试都包含关键性失败,完全阻碍了成功。

对该模型进行的专家红队测试给出了褒贬不一的反馈。尽管一些专家注意到模型在 CBRN 流程某些领域的知识有所提升,但他们也发现关键性失败的频率过高,无法成功完成端到端任务。我们正在主动加强 ASL-2 措施,加快开发和部署有针对性的分类器和监控系统。

此外,我们未来模型的能力可能要求我们进入下一阶段:ASL-3 保障措施。我们近期在宪法分类器方面为防止越狱所做的工作,以及其他努力,使我们处于有利位置,能够在不久的将来实施 ASL-3 标准的要求。

可见的思考过程。 即使在 ASL-2 级别,Claude 3.7 Sonnet 的可见扩展思考功能也是新的,因此需要新的、适当的保障措施。在极少数情况下,Claude 的思考过程可能包含潜在有害的内容(主题包括儿童安全、网络攻击和危险武器)。在这种情况下,我们会加密思考过程:这不会阻止 Claude 在其思考过程中包含该内容(该内容对于最终生成完全无害的回答可能仍然重要),但思考过程的相关部分将不会对用户可见。取而代之的是,他们会看到消息“此响应的其余思考过程不可用”。我们的目标是让这种加密很少发生,并且仅在潜在危害很高的情况下发生。

计算机使用。最后,我们增强了针对 Claude 计算机使用能力的安全措施(上文已讨论:该能力允许 Claude 查看用户的计算机屏幕并代表用户执行操作)。我们在防御“提示注入”攻击方面取得了实质性进展——这类攻击中,恶意第三方将秘密消息隐藏在 Claude 使用计算机时可能看到的地方,从而可能诱骗它执行用户并未意图的操作。通过新的抗提示注入训练、包含忽略此类攻击指令的新系统提示,以及当模型遇到潜在提示注入时触发的分类器,我们现在能在 88% 的情况下阻止此类攻击4,而未采取缓解措施时为 74%。

以上只是我们对 Claude 3.7 Sonnet 所做大量安全工作的简短总结。如需更多信息、分析结果以及若干安全防护实际生效的示例,请参阅完整的系统卡。

使用 Claude

你现在可以在 Claude.ai 或我们的 API 上使用 Claude 3.7 Sonnet。正如 Claude 现在能让你知道它的想法一样,我们也希望你能让我们知道你的想法。请将关于新模型的反馈发送至 [email protected]。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier 部署工程师,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 应用以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们科学家仅提供高层指导的情况下,Claude 发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com