Anthropic 阐述对 AI 安全的核心观点:何时、为何、是什么与怎么做
Core views on AI safety: When, why, what, and how
Anthropic 发布文章系统阐述其对 AI 安全的核心观点,认为 AI 影响可能堪比工业与科学革命,并可能在未来十年内到来。文章称算力投入以每年 10 倍增长,规模定律表明更多算力带来能力普遍提升,因此快速进展可能持续而非停滞。
Anthropic 官方系统阐述其对 AI 安全风险的判断与研究方向,可了解其安全策略背后的推理框架。
我们创立 Anthropic,是因为我们相信 AI 的影响可能堪比工业革命和科学革命,但我们并不确信它会顺利发展。我们也相信这种级别的影响可能很快就会到来——也许就在未来十年。
这种观点听起来可能难以置信或过于宏大,而且有充分理由对此持怀疑态度。首先,几乎所有说过“我们正在研究的东西可能是历史上最重大的进展之一”的人后来都被证明是错的,而且往往错得可笑。尽管如此,我们相信已有足够证据,让我们认真为一个 AI 快速进步、进而产生变革性 AI 系统的世界做准备。
在 Anthropic,我们的座右铭一直是“展示,而非空谈”,我们专注于持续发布我们认为对 AI 社区具有广泛价值的、以安全为导向的研究。我们现在写下这些,是因为随着越来越多的人意识到 AI 的进展,表达我们自己对这个话题的看法、并解释我们的战略和目标,显得恰逢其时。简而言之,我们认为 AI 安全研究具有紧迫的重要性,应当得到广泛的公共和私营主体的支持。
因此,在这篇文章中,我们将总结为什么我们相信这一切:为什么我们预期 AI 会非常快速地进步并产生非常巨大的影响,以及这如何让我们开始担忧 AI 安全。然后,我们将简要总结我们自己的 AI 安全研究方法及其背后的一些推理。我们希望借由这篇文章,为关于 AI 安全和 AI 进展的更广泛讨论作出贡献。
作为本文要点的概要总结:
- AI 将产生非常巨大的影响,可能就在未来十年。AI 快速且持续的进步,是用于训练 AI 系统的算力指数级增长的可预测结果,因为关于“扩展定律”的研究表明,更多算力会带来能力的普遍提升。简单的推断表明,AI 系统在未来十年将变得强大得多,可能在大多数智力任务上达到或超过人类水平的表现。AI 的进展可能会放缓或停滞,但证据表明它很可能会继续。
- 我们不知道如何训练系统稳健地表现良好。到目前为止,没有人知道如何训练非常强大的 AI 系统,使其稳健地做到有帮助、诚实且无害。此外,AI 的快速进展将对社会造成冲击,并可能引发竞争性竞赛,导致企业或国家部署不可信的 AI 系统。其结果可能是灾难性的,要么是因为 AI 系统战略性地追求危险目标,要么是因为这些系统在高风险情境中犯下更多本可避免的错误。
- 我们对一种多面向、以实证为驱动的方法来推进 AI 安全最为乐观。我们正在探索多种研究方向,目标是构建可靠安全的系统,目前最令我们兴奋的是监督扩展、机制可解释性、过程导向学习,以及理解和评估 AI 系统如何学习与泛化。我们的一个关键目标是差异化地加速这项安全工作,并形成一种安全研究布局,试图覆盖从安全挑战最终容易应对,到创建安全系统极其困难的各种情景。
我们对 AI 快速进展的粗略看法
导致 AI 性能可预测1提升的三个主要因素是训练数据、计算能力和改进的算法。在 2010 年代中期,我们中的一些人注意到,更大规模的 AI 系统始终更聪明,因此我们推测,AI 性能中最重要的因素可能是 AI 训练计算的总预算。当将其绘制成图表时,可以清楚地看到,投入最大模型的计算量正以每年 10 倍的速度增长(翻倍时间比摩尔定律快 7 倍)。2019 年,后来成为 Anthropic 创始团队的几位成员通过为 AI 开发缩放定律,使这一想法变得精确,证明只需让 AI 更大、用更多数据训练它们,就能以可预测的方式让 AI 变得更聪明。部分基于这些结果,该团队领导了训练 GPT-3 的工作,这可以说是第一个现代“大型”语言模型2,拥有超过 1730 亿个参数。
自发现缩放定律以来,Anthropic 的许多人一直认为,AI 的快速进展极有可能发生。然而,早在 2019 年,多模态、逻辑推理、学习速度、跨任务迁移学习和长期记忆似乎可能是会减缓或阻止 AI 进展的“墙”。此后几年,其中几堵“墙”,例如多模态和逻辑推理,已经倒塌。鉴于此,我们大多数人越来越确信,AI 的快速进展将继续下去,而不是停滞或趋于平缓。AI 系统如今在大量任务上正接近人类水平的表现,而训练这些系统的成本仍远低于哈勃太空望远镜或大型强子对撞机等“大科学”项目——这意味着还有很大的进一步增长空间3。
人们往往不善于在早期阶段识别和承认指数级增长。尽管我们正看到 AI 的快速进展,但人们倾向于认为这种局部进展必定是例外而非常态,并且情况很可能很快就会恢复正常。然而,如果我们是对的,那么当前这种 AI 快速进展的感觉,可能不会在 AI 系统拥有广泛超越我们自身能力的能力之前结束。此外,在 AI 研究中使用先进 AI 所形成的反馈循环,可能会使这一转变尤为迅速;我们已经在代码模型的发展中看到了这一过程的开端,这些模型让 AI 研究人员更高效,而宪法 AI则减少了我们对人类反馈的依赖。
如果这些判断中有任何一点是正确的,那么在不远的将来,大多数甚至所有知识工作都可能被自动化——这将对整个社会产生深远影响,也很可能改变其他技术的进步速度(一个早期的例子是,像 AlphaFold 这样的系统如今已经在加速生物学研究)。未来 AI 系统会采取什么形态——例如,它们能否独立行动,还是仅仅为人类生成信息——仍有待确定。尽管如此,这可能是多么关键的一个时刻,怎么强调都不为过。虽然我们或许更希望 AI 的进展放缓到足以让这一转变更可控,用几个世纪而不是几年或几十年来完成,但我们必须为预见到结果做准备,而不是为我们希望的结果做准备。
当然,这整个图景可能完全错误。在 Anthropic,我们倾向于认为它更可能是对的,但也许我们因从事 AI 开发工作而带有偏见。即便如此,我们认为这一图景足够可信,不能轻易否定。鉴于其潜在的重大影响,我们认为 AI 公司、政策制定者和公民社会组织应当投入非常认真的努力,研究和规划如何应对变革性 AI。
有哪些安全风险?
如果你愿意考虑上述观点,那么就不难论证 AI 可能对我们的安全与保障构成风险。有两个常识性的理由值得担忧。
首先,当这些系统开始变得像其设计者一样智能、一样能感知周围环境时,要构建安全、可靠且可控的系统可能很棘手。打个比方,国际象棋大师很容易发现新手的坏棋,但新手很难发现大师的坏棋。如果我们构建的 AI 系统比人类专家能力高得多,却在追求与我们最大利益相冲突的目标,后果可能极其严重。这就是技术对齐问题。
其次,AI 的快速进展将极具破坏性,会改变就业、宏观经济以及国家内部和国家之间的权力结构。这些破坏本身可能就是灾难性的,而且它们还可能使以谨慎、深思熟虑的方式构建 AI 系统变得更加困难,从而导致进一步的混乱和更多与 AI 相关的问题。
我们认为,如果 AI 进展迅速,这两个风险来源将非常显著。这些风险还会以多种难以预料的方式相互叠加。也许事后我们会认定自己错了,其中一个或两个要么不会成为问题,要么很容易解决。尽管如此,我们认为有必要偏向谨慎,因为“搞错了”可能是灾难性的。
当然,我们已经遇到过 AI 行为偏离其创造者意图的多种方式。这包括毒性、偏见、不可靠、不诚实,以及最近的谄媚和明确表达的权力欲。我们预计,随着 AI 系统扩散并变得更强大,这些问题的重要性会上升,其中一些可能代表了我们在人类水平 AI 及更高阶段将遇到的问题。
然而,在 AI 安全领域,我们预计会出现可预测和令人惊讶的发展的混合。即使我们能够令人满意地解决当代 AI 系统中遇到的所有问题,我们也不愿轻率地假设未来的问题都能以同样的方式解决。一些可怕的、推测性的问题可能只有在 AI 系统足够聪明,能够理解自己在世界中的位置、成功欺骗人类,或制定出人类无法理解的策略时才会出现。有许多令人担忧的问题可能只有在 AI 非常先进时才会出现。
我们的方法:AI 安全中的经验主义
我们相信,如果不与研究对象密切接触,就很难在科学和工程领域取得快速进展。不断针对“地面真相”的来源进行迭代,通常对科学进步至关重要。在我们的 AI 安全研究中,关于 AI 的经验证据——尽管主要来自计算实验,即 AI 训练和评估——是地面真相的主要来源。
这并不意味着我们认为理论或概念研究在 AI 安全中没有一席之地,但我们确实相信,以经验为基础的安全研究将最具相关性和影响力。可能的 AI 系统、可能的安全故障和可能的安全技术的空间很大,仅靠空想很难遍历。考虑到考虑所有变量的难度,很容易过度锚定在从未出现的问题上,或者错过确实存在的大问题4。好的经验研究往往能使更好的理论和概念工作成为可能。
与此相关的是,我们认为检测和缓解安全问题的方法可能极难提前规划,需要迭代开发。鉴于此,我们倾向于相信“规划不可或缺,但计划无用”。在任何给定时间,我们可能对研究的下一步有一个计划,但我们对这些计划几乎没有依恋,它们更像是短期赌注,我们准备在了解更多后改变。这显然意味着我们不能保证我们当前的研究方向会成功,但这是每个研究项目的现实。
前沿模型在经验安全中的作用
Anthropic 作为一个组织存在的一个主要原因是,我们认为有必要对“前沿”AI 系统进行安全研究。这需要一个既能处理大型模型又能优先考虑安全的机构5。
就其本身而言,经验主义并不一定意味着需要前沿安全。人们可以想象一种情况,即经验安全研究可以在更小、能力更弱的模型上有效进行。然而,我们不相信这就是我们所处的情况。在最基本的层面上,这是因为大型模型与小型模型有质的不同(包括突然的、不可预测的变化)。但规模也以更直接的方式与安全相关:
- 我们许多最严重的安全担忧可能只有在接近人类水平的系统中才会出现,而如果没有这样的 AI,就很难或无法在这些问题上取得进展。
- 许多安全方法,如宪法 AI或辩论,只能在大模型上工作——使用较小的模型使得探索和证明这些方法变得不可能。
- 由于我们的关注点集中在未来模型的安全性上,我们需要理解安全方法和属性如何随着模型规模的扩大而变化。
- 如果未来大型模型被证明非常危险,我们必须拿出令人信服的证据来证明这一点。我们预计只有使用大型模型才能做到这一点。
不幸的是,如果实证安全研究需要大型模型,这就迫使我们面对一个艰难的权衡。我们必须尽一切努力避免这样一种情况:出于安全动机的研究反而加速了危险技术的部署。但我们也不能让过度谨慎导致最具安全意识的研究工作只能与远远落后于前沿的系统打交道,从而极大地拖慢我们认为至关重要的研究。此外,我们认为在实践中,仅仅做安全研究是不够的——同样重要的是建立一个拥有机构知识的组织,以便尽快将最新的安全研究整合到真实系统中。
负责任地驾驭这些权衡是一种平衡之举,这些关切是我们作为组织制定战略决策的核心。除了我们在安全、能力和政策方面的研究之外,这些关切还驱动着我们在公司治理、招聘、部署、安全和合作伙伴关系方面的方法。在不久的将来,我们还计划做出对外明确的承诺:只有在满足安全标准的情况下,才会开发超过某一能力阈值的模型,并允许一个独立的外部组织评估我们模型的能力和安全性。
对AI安全采取组合式方法
一些关心安全的研究者受到对AI风险本质的强烈观点的驱动。我们的经验是,即使是预测AI系统在近期的行为和属性也非常困难。对未来的系统做出先验的安全预测似乎更加困难。与其采取强硬立场,我们认为多种情景都是可能的。
不确定性的一个特别重要的维度是,开发广泛安全且对人类构成极小风险的高级AI系统会有多困难。开发这样的系统可能落在从非常容易到不可能的光谱上的任何位置。让我们把这个光谱划分为三种具有截然不同含义的情景:
- 乐观情景:先进AI因安全失效而导致灾难性风险的可能性非常小。已经开发出的安全技术,如基于人类反馈的强化学习(RLHF)和宪法AI(CAI),在很大程度上已足以实现对齐。AI的主要风险是当今所面临问题的外推,如有害内容和故意滥用,以及广泛自动化和国际权力格局变化等事物可能造成的潜在危害——这将需要AI实验室以及学术界和公民社会机构等第三方进行大量研究以尽量减少危害。
- 中间情景:灾难性风险是先进AI发展可能甚至合理的结果。抵消这一点需要大量的科学和工程努力,但只要有足够集中的工作,我们就能实现。
- 悲观情景:AI 安全本质上是一个无法解决的问题——我们无法控制或向一个在智力上远超我们的系统灌输价值观,这只是一个经验事实——因此我们绝不能开发或部署非常先进的 AI 系统。值得注意的是,在非常强大的 AI 系统被创造出来之前,最悲观的情景可能看起来与乐观情景无异。认真对待悲观情景需要我们在评估系统安全的证据时保持谦逊和谨慎。
如果我们处于乐观情景……那么 Anthropic 所做之事的利害关系(幸运的是)要低得多,因为无论如何都不太可能出现灾难性的安全失败。我们的对齐工作很可能会加快先进 AI 真正发挥有益用途的步伐,并有助于减轻 AI 系统在开发过程中造成的一些近期危害。我们还可能将努力转向帮助政策制定者应对先进 AI 带来的某些潜在结构性风险,如果灾难性安全失败的可能性极小,这很可能会成为最大的风险来源之一。
如果我们处于中间情景……Anthropic 的主要贡献将是识别先进 AI 系统带来的风险,并找到和推广训练强大 AI 系统的安全方法。我们希望,我们的一系列安全技术——下文将更详细地讨论——至少其中一些在此类情景中会有所帮助。这些情景的范围可能从“中等偏易情景”,即我们相信可以通过迭代 Constitutional AI 等技术取得大量边际进展,到“中等偏难情景”,即成功实现机制可解释性似乎是我们最好的选择。
如果我们处于悲观情景……Anthropic 的角色将是提供尽可能多的证据,证明 AI 安全技术无法阻止先进 AI 带来的严重或灾难性安全风险,并发出警报,以便世界各国的机构能够将集体努力引导到防止危险 AI 的开发上。如果我们处于“接近悲观”的情景,这可能转而涉及将我们的集体努力引导到 AI 安全研究上,并在此期间暂停 AI 的进展。表明我们处于悲观或接近悲观情景的迹象可能是突然的且难以察觉。因此,除非我们有足够的证据表明我们并非处于此类情景,否则我们应始终假设我们仍可能处于这种情景中行事。
鉴于事关重大,我们的首要任务之一是继续收集更多关于我们处于何种情景的信息。我们正在推进的许多研究方向都旨在更好地理解 AI 系统,并开发能够帮助我们检测先进 AI 系统诸如权力寻求或欺骗等令人担忧行为的技术。
我们的目标本质上是开发:
- 让 AI 系统更安全更好的技术。
- 更好地识别 AI 系统安全或不安全程度的方法。
在乐观情景中,(1) 将帮助 AI 开发者训练出有益的系统,(2) 将证明此类系统是安全的。在中间情景中,(1) 可能是我们最终避免 AI 灾难的方式,(2) 对于确保先进 AI 带来的风险较低至关重要。在悲观情景中,(1) 的失败将成为 AI 安全无解的关键指标,(2) 则将使令人信服地向他人证明这一点成为可能。
我们相信这种对 AI 安全研究的“投资组合方法”。我们不是押注于上述清单中的某一种可能情景,而是试图制定一项研究计划,在 AI 安全研究最有可能产生超常影响的中间情景中显著改善局面,同时在 AI 安全研究不太可能对 AI 风险产生多大影响的悲观情景中发出警报。我们还试图以在乐观情景中也有益的方式做到这一点,因为在乐观情景中对技术性 AI 安全研究的需求并不那么大。
Anthropic 的三类 AI 研究
我们将 Anthropic 的研究项目分为三个领域:
- 能力:旨在让 AI 系统在各类任务上普遍表现更好的 AI 研究,包括写作、图像处理或生成、游戏等。让大型语言模型更高效的研究,或改进强化学习算法的研究,都属于这一类。能力方面的工作生成并改进我们在对齐研究中调查和使用的模型。我们通常不发表这类工作,因为我们不希望加快 AI 能力进步的速率。此外,我们力求对前沿能力的展示保持审慎(即使不发表)。我们在 2022 年春季训练了我们的主打模型 Claude 的第一个版本,并决定优先将其用于安全研究,而非公开部署。随着它与公开最先进水平之间的差距缩小,我们随后已开始部署 Claude。
- 对齐能力:这项研究侧重于开发新算法,以训练 AI 系统更有帮助、更诚实、更无害,同时更可靠、更稳健,并总体上与人类价值观对齐。Anthropic 现在和过去此类工作的例子包括辩论、扩展自动化红队测试、宪法 AI、去偏以及 RLHF(基于人类反馈的强化学习)。这些技术往往具有实用价值和经济价值,但它们不必如此——例如,如果新算法相对低效,或者只有在 AI 系统变得更强时才会变得有用。
- 对齐科学:这一领域侧重于评估和理解 AI 系统是否真正对齐、对齐能力技术的效果如何,以及我们能在多大程度上将这些技术的成功外推到能力更强的 AI 系统。Anthropic 这方面工作的例子包括机制可解释性这一广泛领域,以及我们关于用语言模型评估语言模型、红队测试,以及使用影响函数研究大型语言模型中的泛化(下文将描述)的工作。我们关于诚实的一些工作处于对齐科学和对齐能力的边界上。
在某种意义上,人们可以将对齐能力与对齐科学视为“蓝队”与“红队”的区分,其中对齐能力研究试图开发新算法,而对齐科学则试图理解并揭示其局限性。
我们发现这种分类有用的一个原因是,AI 安全社区经常争论 RLHF 的开发——它同时也产生经济价值——是否“真的”是安全研究。我们认为它是。实用的对齐能力研究是我们为更强大模型开发技术的基础——例如,我们在 Constitutional AI 和 AI 生成评估方面的工作,以及我们正在进行的自动化红队测试和辩论工作,如果没有先前在 RLHF 上的工作就不可能实现。对齐能力工作通常使 AI 系统能够协助对齐研究,通过使这些系统更加诚实和可纠正。此外,证明迭代对齐研究有助于制造对人类更有价值的模型,也可能有助于激励 AI 开发者更多地投资于使其模型更安全以及检测潜在的安全故障。
如果事实证明 AI 安全相当容易解决,那么我们的对齐能力工作可能是我们最有影响力的研究。相反,如果对齐问题更加困难,那么我们将越来越依赖对齐科学来发现对齐能力技术中的漏洞。而如果对齐问题实际上几乎不可能解决,那么我们迫切需要对齐科学来为停止开发先进 AI 系统构建非常强有力的理由。
我们当前的安全研究
我们目前正在多个不同方向开展工作,以发现如何训练安全的 AI 系统,其中一些项目针对不同的威胁模型和能力水平。一些关键想法包括:
- 机制可解释性
- 可扩展监督
- 面向过程的学习
- 理解泛化
- 危险故障模式测试
- 社会影响与评估
机制可解释性
在许多方面,技术对齐问题与检测 AI 模型不良行为的问题密不可分。如果我们能够在甚至新颖的情况下稳健地检测不良行为(例如通过“读取模型的思想”),那么我们就有更好的机会找到训练不表现出这些故障模式的模型的方法。与此同时,我们有能力警告他人这些模型不安全,不应部署。
我们的可解释性研究优先填补其他类型对齐科学留下的空白。例如,我们认为可解释性研究能够产生的最有价值的东西之一,是识别模型是否具有欺骗性对齐的能力(“配合”甚至非常困难的测试,例如故意“诱惑”系统揭示不对齐的“蜜罐”测试)。如果我们在可扩展监督和面向过程学习方面的工作产生有希望的结果(见下文),我们预计会生成根据甚至非常困难的测试看起来对齐的模型。这可能意味着我们处于非常乐观的情景,或者我们处于最悲观的情景之一。区分这些情况用其他方法似乎几乎不可能,但用可解释性只是非常困难。
这引出了一个重大且高风险的赌注:机制可解释性,即试图将神经网络逆向工程为人类可理解的算法,类似于人们可能对一个未知且可能不安全的计算机程序进行逆向工程。我们希望这最终能让我们做一些类似于“代码审查”的事情,审计我们的模型,以识别不安全方面或提供强有力的安全保证。
我们认为这是一个非常困难的问题,但也不像看起来那么不可能。一方面,语言模型是大型、复杂的计算机程序(而我们称之为“叠加”的现象只会让事情更难)。另一方面,我们看到了迹象表明这种方法比人们最初想象的更可行。在 Anthropic 之前,我们团队的一些人发现视觉模型具有可以被理解为可解释电路的组件。从那时起,我们成功地将这种方法扩展到小型语言模型,甚至发现了一种似乎驱动了相当一部分上下文学习的机制。我们对神经网络计算机制的理解也比一年前多得多,例如那些负责记忆的机制。
这只是我们当前的方向,我们从根本上是以经验为动机的——如果我们看到证据表明其他工作更有前景,我们会改变方向!更一般地说,我们相信更好地理解神经网络和学习的详细运作将开辟更广泛的工具,让我们可以追求安全。
可扩展监督
将语言模型转变为对齐的 AI 系统需要大量高质量的反馈来引导它们的行为。一个主要担忧是人类将无法提供必要的反馈。可能是人类无法提供足够准确/知情的反馈来充分训练模型,以避免在各种情况下的有害行为。可能是人类会被 AI 系统欺骗,无法提供反映他们真正想要的反馈(例如,意外地为误导性建议提供正面反馈)。可能是问题在于组合,人类可以付出足够努力提供正确反馈,但无法大规模做到。这就是可扩展监督的问题,它似乎可能是训练安全、对齐的 AI 系统的核心问题。
最终,我们相信提供必要监督的唯一方式是让 AI 系统部分地自我监督或协助人类进行自己的监督。不知何故,我们需要将少量高质量的人类监督放大为大量高质量的 AI 监督。这个想法已经通过 RLHF 和 Constitutional AI 等技术显示出前景,尽管我们认为还有很大空间使这些技术在人类水平系统上可靠。
我们认为这类方法很有前景,因为语言模型在预训练期间已经学到了很多关于人类价值观的知识。学习人类价值观与学习其他主题并无不同,我们应该期望更大的模型对人类价值观有更准确的了解,并且相对于更小的模型更容易学习它们。可扩展监督的主要目标是让模型更好地理解并按照人类价值观行事。
可扩展监督的另一个关键特性,尤其是像 CAI 这样的技术,在于它们让我们能够自动化红队测试(即对抗性训练)。也就是说,我们可以自动生成可能对 AI 系统有问题的输入,观察它们如何回应,然后自动训练它们以更诚实、更无害的方式行事。我们希望利用可扩展监督来训练更稳健安全的系统。我们正在积极研究这些问题。
我们正在研究多种可扩展监督方法,包括 CAI 的扩展、人类辅助监督的变体、AI-AI 辩论的版本、通过多智能体 RL 进行的红队测试,以及创建模型生成的评估。我们认为,扩展监督可能是训练能够超越人类水平能力同时又保持安全的系统最有前景的方法,但要研究这种方法能否成功,还有大量工作要做。
学习过程,而非达成结果
学习一项新任务的一种方法是通过试错——如果你知道期望的最终结果是什么样子,你就可以不断尝试新策略,直到成功。我们将此称为“以结果为导向的学习”。在以结果为导向的学习中,智能体的策略完全由期望结果决定,并且智能体(理想情况下)会收敛到某种低成本策略来实现这一结果。
通常,更好的学习方式是让专家指导你掌握他们为取得成功所遵循的过程。在练习轮次中,你的成功甚至可能没那么重要,如果你反而能专注于改进自己的方法。随着你进步,你可能会转向更具协作性的过程,与你的教练协商,检查新策略是否可能对你更有效。我们将此称为“以过程为导向的学习”。在以过程为导向的学习中,目标不是达成最终结果,而是掌握随后可用于达成该结果的各个过程。
至少在概念层面上,通过以过程为导向的方式训练这些系统,可以解决许多关于先进 AI 系统安全性的担忧。特别是,在这种范式中:
- 人类专家将继续理解 AI 系统遵循的各个步骤,因为要鼓励这些过程,就必须向人类证明其合理性。
- AI 系统不会因为以难以理解或有害的方式取得成功而获得奖励,因为它们只会根据其过程的有效性和可理解性获得奖励。
- AI 系统不应因为追求有问题的子目标(如资源获取或欺骗)而获得奖励,因为在训练过程中,人类或其代理会对各个获取性过程提供负面反馈。
在 Anthropic,我们强烈支持简单解决方案,而将 AI 训练限制为以过程为导向的学习,可能是缓解先进 AI 系统一系列问题的最简单方法。我们也热衷于识别并解决以过程为导向的学习的局限性,并理解如果我们用过程和基于结果的学习的混合方式训练,安全问题会在何时出现。我们目前认为,以过程为导向的学习可能是训练安全且透明的系统、使其达到并略微超越人类水平能力的最有前景的路径。
理解泛化
机制可解释性工作对神经网络所执行的计算进行逆向工程。我们也在尝试更详细地理解大型语言模型(LLM)的训练过程。
LLM 已展现出各种令人惊讶的涌现行为,从创造力到自我保护再到欺骗。虽然所有这些行为无疑都源于训练数据,但其路径是复杂的:模型首先在大量原始文本上进行“预训练”,从中学习广泛的表征以及模拟多样化智能体的能力。然后它们以多种方式被微调,其中一些方式可能带有令人惊讶的意外后果。由于微调阶段严重过度参数化,学习到的模型关键取决于预训练中的隐式偏差;这种隐式偏差源于一个复杂的表征网络,该网络建立在对世界知识很大一部分的预训练之上。
当模型表现出令人担忧的行为,例如扮演一个欺骗性对齐的 AI 时,这仅仅是对近乎相同训练序列的无害复述吗?还是这种行为(甚至会导致这种行为的信念和价值观)已成为模型对 AI 助手概念中不可或缺的一部分,并一致地应用于各种情境?我们正在研究将模型输出追溯到训练数据的技术,因为这将产生一组重要的线索,有助于理解它。
测试危险的失效模式
一个关键担忧是,先进 AI 可能发展出有害的涌现行为,例如欺骗或战略规划能力,而这些行为在规模较小、能力较弱的系统中并不存在。我们认为,在这种问题成为直接威胁之前加以预见的方法,是建立一些环境,在其中我们有意将这些特性训练进规模较小、能力不足以造成危险的模型中,以便我们能够将其隔离并加以研究。
我们尤其感兴趣的是,当 AI 系统处于“情境感知”状态时——例如,当它们意识到自己是在训练环境中与人类交谈的 AI 时——它们会如何表现,以及这如何影响它们在训练期间的行为。AI 系统会变得具有欺骗性,还是会发展出令人惊讶且不理想的目标?在最好的情况下,我们旨在建立详细的定量模型,说明这些倾向如何随规模变化,以便我们能够提前预见危险失效模式的突然涌现。
与此同时,重要的是要关注研究本身所带来的风险。如果研究是在能力不足以造成太大危害的较小模型上进行,那么这项研究不太可能带来严重风险,但这类研究涉及诱发我们视为危险的特定能力,如果在能力更强的较大模型上进行,则会带来明显的风险。我们不计划在能够造成严重危害的模型上开展这项研究。
社会影响与评估
严格评估我们工作可能带来的社会影响,是我们研究的一大关键支柱。我们的方法核心在于构建工具和衡量标准,以评估和理解我们 AI 系统的能力、局限性及其潜在的社会影响。例如,我们已发表研究,分析大型语言模型中的可预测性与意外性,探讨这些模型的高层次可预测性和不可预测性如何可能导致有害行为。在那项工作中,我们强调了出人意料的能力可能被以有问题的方式使用。我们还研究了红队测试语言模型的方法,通过在不同模型规模下探测模型的攻击性输出来发现并减少危害。最近,我们发现当前的语言模型能够遵循指令来减少偏见和刻板印象。
我们非常关注日益强大的 AI 系统快速部署将如何在短期、中期和长期影响社会。我们正在开展多种项目,以评估和减轻 AI 系统中潜在的有害行为,预测它们可能被如何使用,并研究其经济影响。这项研究也为我们在制定负责任的 AI 政策和治理方面的工作提供了信息。通过今天对 AI 影响进行严谨研究,我们旨在为政策制定者和研究人员提供所需的见解和工具,以帮助减轻这些可能重大的社会危害,并确保 AI 的好处在社会中广泛而均匀地分布。
结语
我们相信人工智能可能对世界产生前所未有的影响,或许就在未来十年内。计算能力的指数级增长以及 AI 能力的可预见提升表明,新系统将远比当今技术先进。然而,我们尚未牢固理解如何确保这些强大的系统稳健地与人类价值观保持一致,以便我们能够确信灾难性失败的风险极低。
我们要明确表示,我们不认为当今可用的系统构成紧迫的担忧。然而,现在进行基础性工作是审慎的,以便在更强大的系统被开发出来时,帮助减少先进 AI 带来的风险。创造安全的 AI 系统也许很容易,但我们相信为不那么乐观的情景做好准备至关重要。
Anthropic 正在采取以实证为驱动的方法来推进 AI 安全。一些活跃工作的关键领域包括:加深我们对 AI 系统如何学习并泛化到现实世界的理解,开发可扩展的监督和审查 AI 系统的技术,创建透明且可解释的 AI 系统,训练 AI 系统遵循安全过程而非追求结果,分析 AI 潜在的危险故障模式及其预防方法,以及评估 AI 的社会影响以指导政策和研究。通过从多个角度攻克 AI 安全问题,我们希望开发出一个安全工作的“组合”,帮助我们在各种不同情景中取得成功。我们预计,随着关于我们所处情景类型的更多信息变得可用,我们的方法和资源分配将迅速调整。
相关内容
Anthropic 投资 1 亿美元培训 10,000 名工程师,以解决企业 AI 人才缺口
Anthropic 将向 Claude Frontier Academy 投资 1 亿美元,到 2027 年底培训 10,000 名 Frontier Deployed Engineers,来自 Accenture、Bain、CBA、Deloitte、McKinsey、Morgan Stanley 和 Novo Nordisk 的首批学员已经开课。
Barclays 扩展 Claude 以升级运营并改善客户体验
英国全能银行 Barclays 正在扩大与 Anthropic 的战略合作,在其全球业务中整合安全的企业级 AI 系统。
Claude 发现了一种具有类 CRISPR 重复序列的新型酶系统
我们宣布在 Anthropic 成立一个新的生命科学研究小组和实验室。本文介绍这项工作背后的团队,并分享早期成果:Claude 在我们科学家仅提供高层方向的情况下,发现了一种特性令人联想到 CRISPR 的新型酶系统。
来源:Anthropic News · anthropic.com