跳到正文
Anthropic News·· 2024-05-23精选AI 评分62

Anthropic 发布 Golden Gate Claude 研究演示,展示可解释性研究如何调节模型特征

Golden Gate Claude

AI 导读

Anthropic 发布关于解读大语言模型内部机制的研究论文,并基于 Claude 3 Sonnet 推出为期 24 小时的交互演示 Golden Gate Claude。

推荐理由

Anthropic 用可交互演示展示可解释性研究如何定位并调节 Claude 内部特征,读者可借此理解该方法的实际效果。

正文 · AI 翻译

更新:Golden Gate Claude 曾作为研究演示在线开放 24 小时,现已不再可用。如果您想进一步了解我们在可解释性以及 Claude 内部特征激活方面的研究,请参阅这篇文章或我们的完整研究论文。

周二,我们发布了一篇重要的新研究论文,探讨如何解读大型语言模型,在文中我们开始描绘我们的人工智能模型 Claude 3 Sonnet 的内部运作机制。在 Claude 的“心智”中,我们发现了数百万个概念,当模型读到相关文本或看到相关图像时,这些概念就会被激活,我们称之为“特征”。

其中之一就是金门大桥这一概念。我们发现,在 Claude 的神经网络中,有一组特定的神经元组合,当它遇到这座旧金山最著名地标的提及(或图片)时就会被激活。

我们不仅能识别这些特征,还能调高或调低它们的激活强度,并识别出 Claude 行为中相应的变化。

正如我们在研究论文中所解释的,当我们调高“金门大桥”特征的强度时,Claude 的回复开始聚焦于金门大桥。它对大多数问题的回答都会开始提到金门大桥,即使这与问题并不直接相关。

如果你问这个“金门大桥 Claude”如何花掉 10 美元,它会建议用这笔钱开车驶过金门大桥并支付过桥费。如果你让它写一个爱情故事,它会给你讲一个关于一辆汽车在雾天迫不及待地想要驶过它心爱的大桥的故事。如果你问它想象自己长什么样,它很可能会告诉你,它想象自己看起来像金门大桥。

在短时间内,我们将这个模型开放给所有人互动体验。你可以在 claude.ai 上与“金门大桥 Claude”对话(只需点击右侧的金门大桥标志)。请记住,这仅是一个研究演示,这个特定模型可能会以一些出人意料——甚至令人不适——的方式表现。

我们的目标是让人们看到我们的可解释性工作能够产生的影响。我们能够在 Claude 内部找到并改变这些特征,这一事实让我们更加确信,我们正开始理解大型语言模型的真正运作方式。这并不是口头要求模型进行某种角色扮演,也不是添加一个新的“系统提示词”,在每次输入时附加额外文本,告诉 Claude 假装自己是一座桥。这也不是传统的“微调”,即用额外的训练数据创建一个新的黑箱来调整旧黑箱的行为。这是对模型内部激活的一些最基本方面进行的精确、外科手术式的改变。

正如我们在论文中所描述的,我们可以使用这些相同的技术来改变与安全相关特征的强度——比如那些与危险计算机代码、犯罪活动或欺骗相关的特征。通过进一步的研究,我们相信这项工作能够帮助让人工智能模型变得更安全。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩大 Claude 应用规模,以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,以在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:在我们的科学家仅提供高层级指导的情况下,Claude 发现了一种新型酶系统,其特性令人联想到 CRISPR。

阅读更多

来源:Anthropic News · anthropic.com