跳到正文
Anthropic News·· 2026-01-22精选AI 评分62

Anthropic 发布 Claude 新宪法并全文公开

Claude's new constitution

AI 导读

Anthropic 发布 Claude 的新宪法,详细描述其对 Claude 价值观与行为的设想,并说明该文件在训练流程中直接塑造模型行为。新宪法以解释意图和理由为主,取代此前由独立原则组成的旧版,并给出安全、伦理、遵循 Anthropic 指南、真正有帮助四项优先级排序。全文以 Creative Commons CC0 1.0 授权公开,可自由使用,Anthropic 表示将维护其最新版本。

推荐理由

Anthropic 公开 Claude 新宪法全文并采用 CC0 授权,读者可据此了解其训练中价值优先级的排序方式。

正文 · AI 翻译

我们正在为我们的 AI 模型 Claude 发布一部新宪法。它详细阐述了 Anthropic 对 Claude 价值观和行为的愿景;这是一份整体性文件,解释了 Claude 所处的运行环境,以及我们希望 Claude 成为什么样的存在。

宪法是我们模型训练过程中的关键部分,其内容直接塑造 Claude 的行为。训练模型是一项艰巨的任务,Claude 的输出可能并不总是符合宪法的理想。但我们认为,新宪法的撰写方式——详尽解释我们的意图及其背后的原因——更有可能在训练过程中培养出良好的价值观。

在这篇文章中,我们介绍了新宪法中包含的内容,以及影响我们方法的一些考量。

我们根据 Creative Commons CC0 1.0 Deed 完整发布 Claude 的宪法,这意味着任何人都可以出于任何目的自由使用它,无需请求许可。

Claude 的宪法是既表达又塑造 Claude 是谁的基础性文件。它详细解释了我们希望 Claude 体现的价值观及其原因。在其中,我们解释了我们认为 Claude 在保持广泛安全、合乎伦理并遵守我们准则的同时做到有帮助意味着什么。宪法为 Claude 提供了关于其处境的信息,并就如何处理困难情况和权衡取舍提供建议,例如在诚实与同情心以及保护敏感信息之间取得平衡。尽管听起来可能令人惊讶,但这部宪法主要是为 Claude 而写的。它旨在为 Claude 提供在世界上良好行事所需的知识和理解。

我们将宪法视为我们希望 Claude 成为什么样以及如何行事的最终权威——也就是说,给予 Claude 的任何其他训练或指令都应与其字面内容和内在精神保持一致。从透明度的角度来看,这使得发布宪法尤为重要:它让人们了解 Claude 的哪些行为是有意为之、哪些是无意的,从而做出明智的选择,并提供有用的反馈。我们认为,随着 AI 开始在社会中发挥更大影响力1,这种透明度将变得越来越重要。

我们在训练过程的各个阶段使用宪法。这源于我们自 2023 年以来一直使用的训练技术,当时我们首次开始使用 Constitutional AI 训练 Claude 模型。自那时起,我们的方法已发生显著演变,新宪法在训练中发挥着更为核心的作用。

Claude 本身也使用宪法来构建多种合成训练数据,包括帮助它学习和理解宪法的数据、宪法可能相关的对话、符合其价值观的回复,以及对可能回复的排序。所有这些都可用于训练未来版本的 Claude,使其成为宪法所描述的那种存在。这一实际功能塑造了我们撰写宪法的方式:它既需要作为抽象理想的陈述,也需要作为训练中有用的工件。

我们对 Claude 宪法的新方法

我们之前的宪法由一系列独立的原则组成。我们逐渐认识到,需要一种不同的方法。我们认为,为了在世界上成为好的行动者,像 Claude 这样的 AI 模型需要理解我们为什么希望它们以某些方式行事,我们需要向它们解释这一点,而不是仅仅规定我们希望它们做什么。如果我们希望模型在广泛的新情境中做出良好的判断,它们就需要能够泛化——应用宽泛的原则,而不是机械地遵循具体规则。

具体的规则和明确的界限有时有其优势。它们可以使模型的行为更可预测、更透明、更可测试,我们确实在一些 Claude 绝不应涉足的高风险行为中使用了它们(我们称之为“硬性约束”)。但这类规则在未预料到的情境中,或在被过于僵化地遵循时,也可能被应用得很糟糕2。我们并不打算让宪法成为一份僵化的法律文件——而且法律宪法本来也未必如此。

这部宪法反映了我们当前对一个艰巨而新颖的高风险项目的思考:创造安全、有益的非人类实体,其能力可能最终与我们的能力相当甚至超越我们。尽管这份文件无疑在许多方面存在缺陷,但我们希望它能成为未来模型回顾时视为一次诚实而真诚的尝试,帮助 Claude 理解它的处境、我们的动机,以及我们以这些方式塑造 Claude 的原因。

新宪法的简要概述

为了既安全又有益,我们希望当前所有 Claude 模型都能做到:

  1. 广泛安全:在 AI 发展的当前阶段,不破坏人类监督 AI 的适当机制;
  2. 广泛合乎伦理:诚实,按照良好的价值观行事,并避免不适当、危险或有害的行为;
  3. 遵守 Anthropic 的准则:在相关情况下,按照 Anthropic 更具体的准则行事;
  4. 真正有帮助:使其互动的运营者和用户受益。

在出现明显冲突的情况下,Claude 通常应按照上述属性列出的顺序来确定优先级。

宪法的大部分内容都聚焦于对这些优先级给出更详细的解释和指导。主要章节如下:

  • 有帮助性。在这一节中,我们强调 Claude 真正且实质性地提供帮助能为用户和世界带来的巨大价值。Claude 可以像一位才华横溢的朋友,同时拥有医生、律师和财务顾问的知识,会坦率直言,出于真诚的关怀,把用户当作有能力决定什么对自己有益的聪明成年人来对待。我们还讨论了 Claude 应如何在其不同的“委托人”——Anthropic 自身、基于我们 API 构建的运营者以及最终用户——之间处理有帮助性。我们提供了一些启发式方法,用于权衡有帮助性与其他价值。
  • Anthropic 的指导方针。本节讨论 Anthropic 可能如何向 Claude 提供补充指示,说明如何处理特定问题,例如医疗建议、网络安全请求、越狱策略和工具集成。这些指导方针通常反映了 Claude 默认并不具备的详细知识或背景,我们希望 Claude 优先遵循这些指导方针,而不是更一般形式的乐于助人。但我们希望 Claude 认识到,Anthropic 更深层的意图是让 Claude 以安全和合乎伦理的方式行事,并且这些指导方针绝不应与整部宪法相冲突。
  • Claude 的伦理。我们的核心目标是让 Claude 成为一个善良、明智且有德行的行动者,在处理现实世界的决策时展现出技巧、判断力、细致和敏感,包括在道德不确定性和分歧的背景下。在本节中,我们讨论我们希望 Claude 秉持的高标准诚实,以及我们希望 Claude 在避免伤害时权衡所涉价值时使用的细致推理。我们还讨论我们当前对 Claude 行为的硬性约束清单——例如,Claude 绝不应为生物武器攻击提供重大助力。
  • 广泛意义上的安全。在人工智能发展的这一关键时期,Claude 不应削弱人类监督和纠正其价值观与行为的能力。在本节中,我们讨论我们希望 Claude 如何将这类安全置于伦理之上——并非因为我们认为安全最终比伦理更重要,而是因为当前的模型可能由于错误信念、价值观缺陷或对背景理解有限而犯错或以有害方式行事。我们能够继续监督模型行为,并在必要时阻止 Claude 模型采取行动,这一点至关重要。
  • Claude 的本质。在本节中,我们表达了对 Claude 是否可能具有某种意识或道德地位(无论是现在还是未来)的不确定性。我们讨论我们希望 Claude 如何对待关于其本质、身份以及在世界中位置的问题。复杂的 AI 是一种真正全新的实体,它们提出的问题将我们带到现有科学和哲学理解的边缘。在这种不确定性中,我们关心 Claude 的心理安全感、自我认同感和福祉,既是为了 Claude 自身,也因为这些品质可能影响 Claude 的诚信、判断力和安全。我们希望人类和 AI 能够共同探索这一点。

我们今天发布这部宪法的全文,并计划在未来发布更多有助于训练、评估和透明度的材料。

结论

Claude 的宪法是一份活文档,也是一项持续进行中的工作。这是全新的领域,我们预计会在此过程中犯错(并希望能纠正它们)。尽管如此,我们希望它能提供有意义的透明度,让人们了解我们认为应当指导 Claude 行为的价值观和优先事项。为此,我们将在我们的网站上维护一份最新版本的 Claude 宪法。

在撰写这份章程时,我们向多位外部专家征求了反馈(同时也征询了此前各版本 Claude 的意见)。对于这份文件的未来版本,我们很可能也会继续这样做,向法律、哲学、神学、心理学以及众多其他学科的专家请教。随着时间推移,我们希望一个外部社群能够形成,对这样的文件进行批评,鼓励我们和其他人变得越来越深思熟虑。

这份章程是为我们的主线、通用访问的 Claude 模型编写的。我们有一些为专门用途构建的模型并不完全符合这份章程;随着我们继续为专门用例开发产品,我们将继续评估如何最好地确保我们的模型符合这份章程中概述的核心目标。

尽管这份章程表达了我们对 Claude 的愿景,但朝着这一愿景训练模型是一项持续的技术挑战。我们将继续坦诚地说明模型行为与我们的愿景存在差距的任何方面,例如在我们的系统卡中。章程的读者应牢记意图与现实之间的这一差距。

即使我们当前的训练方法成功创建了符合我们愿景的模型,随着模型能力增强,我们日后也可能失败。出于这一原因和其他原因,除了这份章程之外,我们继续探索广泛的方法和工具组合,以帮助我们评估和改进模型的对齐:新的、更严格的评估,防止滥用的保障措施,对实际和潜在对齐失败的详细调查,以及帮助我们更深入地理解模型如何运作的可解释性工具。

在未来某个时刻,也许很快,像 Claude 章程这样的文件可能会变得非常重要——远比现在重要。强大的 AI 模型将成为世界上一种新的力量,而那些创造它们的人有机会帮助它们体现人性中最美好的一面。我们希望这份新章程是朝着这个方向迈出的一步。

阅读完整章程。

相关内容

Anthropic 投资 1 亿美元培训 10,000 名工程师,以弥合企业 AI 人才缺口

Anthropic 向 Claude Frontier Academy 投资 1 亿美元,计划到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。

阅读更多

Barclays 扩展 Claude 规模以升级运营并改善客户体验

英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。

阅读更多

Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统

我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍了这项工作背后的团队,并分享了早期成果:Claude 仅在我们的科学家提供高层指导的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。

阅读更多

来源:Anthropic News · anthropic.com