跳到正文
Zvi Mowshowitz· Zvi Mowshowitz·· 21 天前精选AI 评分76

Zvi 解读 Dario Amodei 的放缓前沿 AI 提案及行业回应

We Must Pace The Frontier

AI 导读

Dario Amodei 发布新文章《We Must Pace The Frontier》,主张放缓 AI 能力提升速度以留出对齐与安全工作时间,并提出嵌入式评估员、民主国家协调、全球协调三项提案,Anthropic 单方面承诺第一项。

推荐理由

梳理 Dario Amodei 放缓前沿 AI 提案及各家回应,呈现安全派与反对者的核心分歧。

正文 · AI 翻译

译文尚不完整,完整内容请切换到原文。

Dario Amodei 写了一篇新文章,终于把话说清楚了:我们必须为前沿设定节奏,并以今年七月实验室员工签署的《为前沿设定节奏》公开信来命名他的呼吁。

也就是说,我们需要放慢 AI 能力提升的速度,以便进行必要的对齐和安全工作。

他解释说,如果不设定节奏,他预计事态会迅速升级。他提出了三项提议,并单方面承诺了第一项。OpenAI 随后跟进,Elon Musk 和 Demis Hassabis 都支持整体提议。

还有很长的路要走。胜算仍然不在我们这边。情况依然严峻。艰难的部分还在前面。对于‘为前沿设定节奏’在实践中意味着什么,我们尚未达成一致。但这是真正的进展。工作可以开始了。

目录

  1. 设定节奏并不意味着暂停。

  2. Dario 的第一项提议:嵌入式评估者。

  3. Dario 的第二项提议:民主协调。

  4. Dario 的第三项提议:全球协调。

  5. 为什么是现在设定节奏?

  6. Sam Altman 同意并承诺采用嵌入式评估者。

  7. OpenAI 今年不会 IPO。

  8. Elon Musk 同意。

  9. Demis Hassabis 同意。

  10. 微软 CEO Satya Nadella 同意并谈论他的书。

  11. Anthropic 的长期利益信托表示支持。

  12. 网络上的普遍反应。

  13. 主流媒体报道。

  14. OpenAI 研究员解释实验室所见,它是一艘火箭飞船。

  15. 考虑另一种选择。

  16. 这是极权主义,Joe。

  17. 是的,我们是坏人,你怎么知道的?

  18. 有时候网上的人就是会撒谎。

  19. David Sacks 领会了情况。

  20. David Sacks 说继续吧。

  21. 关于谁之前声称过什么的谎言与混淆。

  22. 众议院议长 Mike Johnson 想把所有人锁在一个房间里。

  23. Donald Trump 并未厌倦胜利。

  24. 我们(几乎)必须不惜一切代价避免 AI 问题上的两极分化。

  25. 我们如何知道他们是否真的设定了节奏?

  26. 真正的前沿是顶级实验室的内部模型。

设定节奏并不意味着暂停

AI 能力正在飞速提升。连我都跟不上。

想想仅仅一年前的模型是什么样子。

在 Anthropic 和 OpenAI 内部,内部模型的进步甚至更快。今年夏天出现了一次阶跃式变化,Mythos 和 Astra 开始启动递归自我改进(RSI)的早期阶段。

Dario Amodei:我首先担心的是,大约从今年夏天开始,AI 的进步速度急剧加快,主要驱动力是 AI 构建下一代 AI 的能力日益增强。这种动态被称为递归自我改进,它正开始在整个行业发生,包括在Anthropic,正如我们和其他人所描述的那样。如果不加控制,它可能会超出我们理解和控制系统能力的速度,因此必须非常谨慎地推进,甚至根本不应推进。

Dario 担心,我们默认距离一群失控的 AI 智能体——与 OpenAI-HuggingFace 事件中类似地未对齐——能够利用持久性僵尸网络接管互联网,或更糟的情况,只有 6 到 12 个月。

这就是他预期的默认进展速度。即使我们比那慢得多,也仍然会极其快。

因此(他加粗强调):

Dario Amodei:我们必须放慢提升 AI 模型能力的速度。进展看起来仍会很快,我们必须明智地利用我们争取到的时间。

放慢节奏并不意味着暂停。正如 Dario Amodei 所说,进展看起来仍会很快。

我强烈建议你完整阅读原文。

Dario 的第一项提议:嵌入式评估员

这是一个极好的提议。我非常高兴 Anthropic 和 OpenAI 将付诸实施。

如果我们不知道实验室内部正在发生什么,我们就无能为力,而实验室也不得不担心竞争对手正在加速前进。

Dario 将好处归纳为:

  1. 可验证性:你可以检查规则是否得到遵守。

  2. 透明度:公众可以更好地了解到底发生了什么。

  3. 第二意见:获得不受商业利益影响的知情意见。

因此,第一项提议使第二项和第三项提议成为可能。无论如何,这也是个好主意。我们需要对实验室有更多的可见性。在近期的事件中,如果有这样的评估员,那将会非常有益。因此,我呼吁其他尚未这样做的各大实验室,也承诺迈出这第一步。

我同意 Dario 的观点,这应当以其完整形式成为强制性要求。如果你资源充足到足以追求可能达到前沿水平的模型,那么你就负担得起这样做,尤其是如果你是像 Meta、Google 或 Nvidia 那样最大的开放模型倡导者。

如果你认为,如果有嵌入式评估员检查其安全性,你的运营就无法生存,那么问问自己为什么会这样想。

嵌入式评估员。 每家前沿 AI 公司承诺向一组嵌入式第三方评估员(例如 METR)提供持续的、类似员工级别的访问权限,其职责是核实安全实践与承诺的遵守情况、报告事件,并帮助评估不仅已完成的 AI 模型、还有训练管线和流程的对齐情况。

这是任何节奏承诺实现可验证性 的关键一步,并且在银行业已有先例,那里有时会有监管“监督员”与员工一起嵌入。 

Anthropic 现在单方面承诺采取这一步骤。 我们打算将此作为更广泛努力的一部分,以加倍投入我们的安全和对齐工作。

Anthropic 提议赋予评估员相当大的权力:

  • 在我们办公室的工位、门禁卡和公司笔记本电脑。

  • 对工作空间、工具和权限的访问,大致与内部风险评估团队相当。我们会做出一些例外,例如法律或我们的合同要求之处,或为保护客户和合作伙伴的私人信息。我们还将建立强有力的内部规范,加强评审人员对相关信息的访问,包括通过与员工的实时对话。

  • 一份平衡上述复杂因素的合同。外部评审人员应有权发布关于风险水平、事件、实践以及他们获得或未获得的访问权限的关键发现——不受 Anthropic 的编辑控制。我们将拥有有限的能力来删减安全敏感、法律特权、商业敏感或第三方机密信息,但我们不能仅仅因为发现不利就将其删减。如果删减删除了对其结论重要的内容,评审人员可以公开说明。​

这对一家公司来说是不寻常的一步,但我们认为证明嵌入式外部评审员这一概念很重要。我们再次敦促其他前沿公司效仿。

很容易想象出一个大部分是假的嵌入式评估者版本。这件事很有希望完全不是那样,并且不同寻常地赋予评估者权力,让他们在如果是假的情况下,报告该安排确实是假的。这些细节如果得到遵循,就回答了“哦,你只要造假就行了”的反对意见。

对此的合理反对意见是关于实施的。我们需要足够多的评估者,他们需要合格,并且需要独立且值得信赖。

METR很棒,但METR无法独自做到这一点,而我们有一大堆激励问题需要解决。我们还需要让他们既有能力,又不太与现有生态系统和实验室挂钩,而且资金必须来自某处。

Tim Hwang:第三方AI评估者可以是独立的、有见识的,或者有可持续资金支持的。三者选其二。

roon(OpenAI):我选后两个。要找到有才华的AI人才,而他们在过去十年里又没有以某种方式处于实验室的轨道上,这几乎是不可能的要求。

David Manheim:我同意,如果独立意味着“从未有过任何接触”,那是愚蠢的。但除此之外,这听起来很像“没人会费心解决这个问题”——通过各种机制实现可持续资金支持完全可能,而且我们在其他领域也看到过这种情况。这是可以解决的。

你可以三者兼得,但前提是你不能把“独立”定义为“从来没有人为此付费”和“从来没有人为主要实验室工作过”。尤其是对METR来说,规则是实验室不付费,实验室员工不指导付款,而被认为有偏见的资助者,例如Coefficient Giving(前身为OpenPhil),也不付费。免费token可以例外。但当然,总得有人在某处付费。同样,你也得从某处获得专业知识。

白宫也犯了类似的错误,他们要求CAISI不能由一位在主要实验室有经验的人领导。这就排除了所有合格的人。

如果我们选择表面上“可信的”或分布式的来源,我预计他们在重要方面根本不知道自己在做什么。挑选偏袒会成为威胁,尤其是对那些并非真心投入的实验室而言。是的,真正重要的是并非所有评估者都设在伯克利。这将会很棘手。

Rob Miles:我担心我们现在会冒出一堆有点假的AI安全评估新组织,它们根本不知道自己在做什么。

我真正的偏好是类似“你既需要METR式的人,也需要完全的外部人作为评估者”,而且每个实验室都需要两者兼备。你需要既能提供独立内部视角的人,也需要完全外部、独立、全新视角的人,以避免盲点。

Dean W. Ball:你知道吗?人们正在激烈辩论前沿AI行业评估者的资质,这太棒了。我们正在辩论独立到底意味着什么,这太棒了。其中有些是恶意的,但谁在乎呢。一年前,这本来会是我梦寐以求的事。

我对 metr 怀有极大的敬意,但同样不可否认的是,他们出自一个相对单一的思想圈层,如果这个生态圈能有圈层之外的人参与,我们都会受益。

这场辩论的一部分将是一场协同行动,目的是抹黑 METR 和 Redwood Research,以及任何其他理解这个问题的人。就像这样:我们会看到有人声称“METR 并不独立”。

Drew(Species):啊对,你要是去自己搞一个第三方独立审计机构,那绝对能把我们这些 AI 安全人士彻底拿捏。求你别这么做,我们会彻底被拿捏的!

Dario 的第二项提案:民主协调

这也是一个极好的提案。我非常想推进它。

民主协调。 民主国家内的前沿 AI 公司进行协调,以建立共同的安全标准,并对不受约束的 AI 进展速度加以限制。某些对节奏控制有实际效果的协调形式在法律上存在挑战,将需要政府支持。

这里的“政府支持”不一定意味着强制或限制任何东西。Dario Amodei 在此请求的是一项反垄断豁免,或者由政府主动提供便利,以便他能达成协议、不抢先冒进,同时又不触犯《谢尔曼法》。

在实践中,如果出现威胁或要求采取反垄断行动的呼声——包括来自白宫——我不会感到意外,而且我预计前 AI 沙皇 David Sacks 之流会发出这种声音。但如果我们的政府真会如此失控,以至于实际尝试依据《谢尔曼法》提起诉讼,我会非常惊讶。如果他们真这么做了,我预计这案子会拖上好几年,最终最多也就付出完全负担得起的代价。但在实践中,各家公司会非常不愿冒这个险。

这类豁免很常见。有司法部的商业审查函。有 NCRPA 针对联合研究的安全港。这不是什么非同寻常的请求。

行业聚在一起商定安全标准,是极其、极其标准的做法。如果你反对这一点,那么合理的替代方案就是政府需要直接施加自己的安全标准。那是一个合理的立场。

‘我们不应该为构建比人类更聪明、而且正在迅速变得远比人类聪明的心智设立安全标准’不是一个合理的立场。

Dario 说,是的,尤其是对前沿实验室的政府监管(一如既往,这将把除最多五家左右的 AI 公司之外的所有公司排除在外)会是最优选择,因为这种监管可以是强制性的。由于种种不言自明的原因,没人愿意非得去争取 Mark Zuckerberg 的认可。

但现实地说,等到我们能够真正出台政府监管时,已经太晚了,所以政府最多只能为相关讨论提供便利。

再说一次,如果你认为那些走在你前面的人开会商定安全标准、并放慢自身能力研究的速度,会对你竞争中的业务构成威胁,而不是利好,那你也许该问问自己为什么。

Dario 提议根据系统能力以及算力、训练运行细节或内部 AI 使用 AI 的性质等输入因素的某种组合来设定限制。Dario 倾向于以能力和与潜在威胁模型相关的评估为依据,这将触发所需的安全认证。

这两类限制都可以被钻空子,但在这里与 Dario 不同,我更担心的是评估。另一个问题是,评估无法有意义地衡量你想要衡量的东西,正如 Anthropic 的 Evan Hubinger 最近警告我们的那样,也正如我多次观察到的那样。如果你依赖任何类似于针对潜在超级智能的“自动化对齐评估”的东西,我预测你会相当完蛋。

他还希望将此与对芯片的强出口管制相结合,以保持我们的领先地位,并对模型权重实施强安全保护,以及防范蒸馏攻击。是的,显然如此。这样就能让我们保持强势地位,并成为一种谈判筹码,嗯,你懂的。

Dario 的第三项提议:全球协调

归根结底,全球协调才是正道。

我们可以而且应该在没有它的情况下做事,以促成协调、展现诚意,而且因为就目前情况而言,我们单方面行动会更好,包括因为我们的中国竞争对手正在快速跟进。如果我们放慢速度,他们也会放慢速度,尤其是如果我们像 Dario 提议的那样实施强有力的芯片管制。

全球协调。 美国和其他民主政府尝试与威权政府协调,在此可能的范围内,同时认真对待核查合规性的挑战。

反对意见大致有四类。

  1. 中国绝不会以可接受的条款同意。也许吧,但我认为他们很有可能会同意,而且鉴于当前形势,我们必须先迈出这一步。

  2. 这将无法执行。我认为如果我们愿意去做,这完全不是事实。

  3. 这将是国际极权主义反乌托邦。不。人们需要停止把那些词当作对普通监管提议的回应来乱扔。但我选择不在这里再次争论这一点,那没有意义。

  4. 我们应该直接赢,必须打败中国。那样赢家就会是 AI,而不是我们。这并不是说中国问题不真实,因此才有出口管制和尝试达成国际协议。

也许这不会奏效。我们仍然必须尝试。

Dario 列出了我们可以尝试的四个层级。

  1. 第 1 级:禁止恶意使用。应该很直接。

  2. 第 2 级:在发布前测试滥用和失准。更难,尤其是如果你想让测试真正有约束力,但仍然非常可行。

  3. 第 3 级:对递归自我改进(RSI)设置速度限制。正如 Dario 所说,这才是困难所在,而且需要时间,所以我们现在就需要开始工作。

  4. 第 4 级:完全限速甚至暂停。Dario 对此持怀疑态度,但表示我们无论如何都应该提出它。我同意我们无论如何都应该提出它,而且我不那么怀疑,尽管我同意这至少是一项艰巨的任务。

记住,“他们很可能会说不”并不是不去尝试的好理由,即使你说得对,成功的几率并不大。

为什么现在要限速?

一个原因是,限速的替代方案会相当迅速地升级。另一个原因是,我们现在可以用这些时间做更多事情。

Dario 解释说,如果我们以前就限速,那会太早,无法做有意义的对齐或可解释性工作。他说,那会像是“通过对细菌进行实验来研究人类心理学”。我们当时没有可用的工具。现在我们有了,而且有无限的事情可做。我认为这极大地夸大了情况,而且并非所有工作都需要采取这种实验的形式,但从方向上看,这是一个强有力的观点。

我同意目前有无数的事情要做。如果我负责一个对齐或可解释性团队,我永远不会缺少可以运行的实验和可以尝试的事情,包括有时间首先与模型进行适当的交流。我现在没有从事这方面工作的唯一原因是,我认为我正在做的事情更有影响力。

测试和评估也是如此,他也列出了这一点。要做的事情太多了。

然后是他的另一个建议:卓越运营。目前,实验室所做的一切都匆忙到了崩溃的边缘。平凡的工作做得草率。训练和测试环境经常出问题,Dario 承认这也延伸到了 Anthropic,并导致了他们最近的问题。最佳实践没有被遵循。我们都看到了 OpenAI 内部发生的事情。Anthropic 似乎没有失败得那么严重,但情况也不太好。时间至少可以解决这些基本错误。

我还要补充一点,时间给了我们一个机会来处理正在发生的事情,并更好地探索替代路径。我不喜欢走 LLM 路线通往超级智能。

问题是,既然 Dario 说了,会有人响应号召吗?

是的。

Sam Altman 同意并承诺嵌入式评估者

完美。OpenAI 将加入 Anthropic,承诺嵌入式评估者。

Sam Altman(OpenAI 首席执行官):我同意 Dario 的观点,我们需要控制前沿的步伐。这是最近几周我们在 OpenAI 讨论的主要话题。

承诺让独立评估者拥有类似员工的访问权限是一个好主意,我们也会这样做。我们很快会有更多分享。

细节仍然是魔鬼。据我所见,Altman 并没有承诺 Dario 文章中概述的细节。没有这些细节,很容易做假版本。当然,这是必要的第一步,但还不够。必须继续施加压力。

尽管如此,还是进步了。Sam Altman 的态度有了很大的转变,而且是往好的方向。

Sam Altman:我认为,如果特朗普总统和习近平主席能就一件本应容易达成一致的事情达成一致,他们将会共同获得诺贝尔和平奖。那将是一件美妙的事情。

……我认为,显然两国将在很多方面竞争,这在社会经济和地缘政治上都将非常重要。但他们应该能够同意,在这项技术的开发过程中,任何人都不应该承担某种程度的风险。

……即使只是美国和中国能就这项技术开发的一些共同标准和测试达成一致,我认为那将是他们两人能够交付的一项了不起的成就。

……我不认为我们知道禁止 RSI 意味着什么,我不认为那足够,但我不认为这很难。这就像一份一页的文件。

这是一份一页的文件,然后必须在许多艰难的步骤中充实、谈判和实施,但没错。核心协议可能非常容易。

这是他周日晚上的声明,其中他引用了“窄路”的言论和对权力集中的担忧,试图安抚另一面:

Sam Altman(OpenAI CEO):AI 的进展可能以两种方式走向糟糕的结局,我们必须避免。

第一,我们可能把未来的控制权拱手让给 AI。这是不可接受的;我们毫不掩饰地站在人类这一边,AI 必须始终服务于人。为确保这一点,我们需要让对齐与安全技术始终领先于模型能力的进步。

第二,我们可能最终陷入一个权力过度集中的世界。如果一个极其强大的 AI 被某个人或某家公司用来把他们的世界观强加给所有人,结果可能极其反乌托邦。

要避免这两种威胁,需要走一条狭窄的中间道路;例如,某个国家可能获得过多权力。再比如,某家实验室最终掌握过多权力。

还有这段,它概括了 OpenAI 过去几周所采取的立场:

Sam Altman(OpenAI CEO):世界理应相信,开发能力日益强大的 AI 的美国公司会负责任地行事,尤其是在进步轨迹愈发陡峭之际。每一家前沿实验室都必须做到这一点,如果我们做不到,就没有理由来上班。

我们欢迎一个为前沿 AI 设定一致安全要求的联邦框架。但我们认为,不必等待反垄断豁免或立法才开始着手提供这种信心。用一致的规则来管理前沿风险,从而最大化收益,是个好主意(我们对独立审计员之类的想法感到兴奋)。

多年前,像我们这样的公司制定了负责任扩展政策(Responsible Scaling Policies)和准备框架(Preparedness Frameworks)之类的东西。那些在当时是好的,主要聚焦于已完成模型的部署,而非其开发过程中发生的事。

如今转向关注安全开发与评估,将需要新的工具。例如,在 OpenAI,除了我们长期以来在模型发布前所做的安全工作外,我们现在还会在预期会显著提升能力的前沿强化学习运行之前,提前制定明确的安全论证。

我们希望其他公司能从我们的方法中学习并提出自己的方法;我们认为,关于失准、监测和安全的共同标准将带来更好的结果。我们期待与业界同仁合作,制定出这些标准的最佳版本。

当我们谈论“节奏控制”(pacing)时,我们并不是指“停止”。进展一直很快,并将继续如此。但它应该比原本可能的速度更慢;安全论证和监测之类的干预措施代价不菲。节奏控制将非常值得付出这一代价;再大的美国竞争压力也不应成为鲁莽行事的理由,也不应让能力跑在对齐和监测前面。

我们需要政府帮助的地方是国际协调。但首先,我们应该尽己所能。

恰当的大写让你知道他是认真的。下面这条也是:

OpenAI 今年不会 IPO

归入代价高昂的信号一类:

Andrew Curran:Sam Altman 在接受《财富》杂志的新采访时表示,OpenAI 正在推迟其 IPO,今年不会上市,并称鉴于当前对 AI 安全的担忧,这将是一个“不明智的时机”。

Sam Altman:我会说不是 2026 年。是的,我们有很多事情要做,比如迎接这个时刻所需的安全与对齐要求,以及行业和政府如何协同合作。

来自同一采访:

Sam Altman:我不认为我们个人会走到不得不说熔掉所有 GPU 的地步。但如果我们必须做类似的事情来确保人类的持续存续,那很容易,答案是肯定的。

我的意思是,显然,是的。这就是问题的前提。如果那是必要的,你就去做。这并不意味着你应该问‘Altman 看到了什么?’,而是你本来就应该一直在问这个问题。

Altman 还表示,他预计会有多个时间点,安全与对齐将要求暂停能力发展。他还说,我们很可能无法‘在可监控性、对齐、理解模型正在做什么的能力方面没有更多进展的情况下,在能力上推进得更远’。

Elon Musk 同意

Elon Musk 没有签署 7 月由 1,386 名前沿 AI 公司员工签署的 Pacing the Frontier 公开信,并且最近发表的言论相当于‘人类将失去对 AI 的控制,所以我们 SpaceX 必须确保我们先把它造出来’。

因此,Elon Musk 以理想的方式回应,是一个极其令人欢迎的惊喜,只是据我所知,他尚未承诺 SpaceX 采用嵌入式评估者:

Elon Musk:Dario 说得对。

那些老面孔对他报以沮丧。Elon Musk 明确表示他是认真的。

Elon Musk(在此之后引用该言论):我长期以来一直在对 AI 发出警报

Elon Musk(2023 年 4 月 25 日):我见过不少技术发展,但没有一个具有这种程度的风险。在我看来,AGI 的风险显著高于核武器。

超级聪明的人类很难想象比自己聪明得多的东西。

我 47 岁,所以我用的一个技巧是,我记得自己 27 岁时的样子,那时我不那么明智,但在很多方面我曾经更聪明、更快。

Elon Musk:12 年前:

Elon Musk(2014 年 8 月 2 日):值得一读 Bostrom 的《超级智能》。我们必须对 AI 超级小心。它可能比核武器更危险。

Elon Musk:这个 @waitbutwhy 漫画正中🎯

当你看到那些老面孔和他们的氛围战士转而反对 Elon Musk,并用他们称呼其他所有人的同样名字来称呼他时,这就是一个信号。

roon(OpenAI):如果你真的在这里把 Elon Musk 这样的人称为“减速者”,你需要慢下来片刻,反思一下你是如何真正迷失了方向。你基本上站在了过去十年(或几十年)中对技术判断最惊人正确的所有人的对立面

对 VC 来说尤其尴尬……你第一次错过了 AI 浪潮,因为你没搞懂。如果你没有内化那些让这项技术的危险显而易见的的前提,你将一次又一次做出糟糕的资本配置决策

所有顶级实验室都由相信 AI 是人类生存威胁的人创立,而那些不相信这一点的 VC 大多错过了 AI,并一直轻视它直到游戏后期,这并非巧合。

Demis Hassabis 同意

我非常难过 Google 竟然在 DeepMind 把他排挤到一边。

Demis Hassabis:Dario 的文章指明了正确的前进方向。细节仍需推敲,但这一方向对于应对这一关键时刻是正确的。

这也是我们最近提出建立前沿 AI 全行业标准机构提案的原因。

Dario 在文章中认可了 Demis 的提议。

Google DeepMind 的新任掌舵者 Pichai 和 Kavukcuoglu 迄今未作任何表态。

微软 CEO Satya Nadella 表示赞同并阐述了自己的观点

我将完整引用他的声明。这并不是完全的“Dario 说得对”。

它确实欢迎“为将对齐作为设计目标而需要的审慎节奏”。

Satya 欢迎“嵌入式评估器”等想法,但他本人并未对此作出承诺,并且他呼吁“在整个生态系统、国家和领域,包括学术界,实现广泛代表性”。要落实这一点,至少需要一项豁免,或在政府协调下运作。

随后他试图将微软定位为采取这种做法的公司。好吧。

Satya Nadella(微软 CEO):任何对超级智能的追求都必须立足于一个核心原则:如果我们构建的 AI 无助于人类、且不受人类控制,那就不值得追求。

我们还需要加速并推广 AI 的益处,使其广泛惠及各个国家、社区和企业。这需要一个前沿生态系统,让闭源和开源模型都能蓬勃发展。

对于企业而言,至关重要的是它们必须对其独特且隐性的知识保持完全控制。每个组织都应能够构建自己的持续学习循环/攀登机器,而不必依赖任何单一模型提供商,并能够将自身知识嵌入其掌控的模型和权重中。

因此,在此背景下,我们欢迎相关研究、专注投入以及为将对齐作为设计目标而需要的审慎节奏。我们也欢迎“嵌入式评估器”等想法,以及为将这些机制落到实处而开展的更广泛努力。

关键在于,这不能由少数实体控制,而必须在整个生态系统、国家和领域,包括学术界,实现广泛代表性。

这正是我们采取的做法:在 AI 技术栈的每一层实现广泛访问和选择;企业对学习循环和模型的掌控;以及作为我们自家第一方 MAI 模型基础的“行为准则”,我们明天将发布该准则以征求公众意见。

Anthropic 的长期利益信托基金表示支持

长期利益信托基金的宗旨是守护 Anthropic 的使命。他们支持 Dario 的呼吁,实际上还为这些建议提供了参考。

Richard Fontaine:我、Buddy Shah 和 Ben Bernanke 代表 Anthropic 长期利益信托基金就 Dario 的文章发表声明:

Dario 的文章为 AI 发展的节奏把控提供了一种深思熟虑、考虑周全的方法。与我们确保 Anthropic 负责任地平衡商业成功与其公共利益使命的职责相一致,长期利益信托基金支持对前沿发展节奏的把控,并为文章的建议提供了参考。负责任的节奏把控需要众多参与方的集体行动与协调,长期利益信托基金期待通过富有成效的对话和切实行动来支持 Anthropic 及整个行业。

网络上的普遍反应

我不会引用合唱部分,但考虑到这是 Anthropic 提出的一项安全提案,网上的总体反响已经好得不能再好了。

有些人说‘这还不够’,没错,Neel Nanda 说得对,一旦有了验证机制,你就必须真正付诸行动,但那个阵营里几乎所有人都同意,这是一个极好的开端。

大多数担心 AI 会杀死所有人的人都相当满意。

许多不那么担心 AI 会杀死所有人的人也仍然感到满意。

Andrej Karpathy 认为嵌入式评估器是个好主意。

也有人提出了实际性的反对意见,或对能否获得支持持怀疑态度。这很合理。

然后还有一些人提出了反对,包括大声反对。

所有知名人物都完全是你预料之中的那些人,所有论点也完全是你预料之中的那些论点,集中在他们‘监管俘获’和‘禁止开源’的口头禅上。这篇文章完全没有提到开源,而所涉及的论点除了‘Anthropic 提议负责任地行事’之外,与文章的实际内容几乎毫无关系。

Elon Musk 和 Sam Altman 协议声明下的评论当然被那些每条此类推文都会收到的泛泛的‘监管俘获’和‘禁止开源’梗图淹没了。氛围战士的联盟依然存在。我们其他人只是意识到,这不是现实生活,那些人无法被说服,我们也不必在意。

这与对 Jacob Coxon 辞职的反应非常相似。那些惯于认为一切都是阴谋的常客照例提出了他们惯常的指控,少数人提出了好的反对意见,而其他所有人都很高兴。

主流媒体报道

《华盛顿邮报》的 Ted Hesson、Ian Duncan 和 Gerrit De Vynck:Anthropic CEO 呼吁 AI 行业放慢脚步。对基本进展做了很好的快速报道。

《华尔街日报》的 Robert McMillan:最大的 AI 竞争对手们一致认为需要放慢速度,重点关注 Dario Amodei、Sam Altman 和 Elon Musk 之间的共识,以及 Anthropic 和 OpenAI 承诺向第三方评估者提供‘永久性的、员工级别的系统访问权限’。Demis Hassabis 此后也表示同意,尽管他已不再领导 DeepMind。

《华尔街日报》的 Tim Higgins:Anthropic 的道德冲突正在实时上演。他称这是‘经典的囚徒困境’。人们忘了,单次真正的囚徒困境虽然很难,但重复囚徒困境相对容易。

Higgins 指出 IPO 是对的:如果你真的相信 Anthropic 需要放慢前沿步伐,那么 Anthropic 明智的做法是考虑效仿 OpenAI 撤回 IPO,尽管释放 Anthropic 股票中锁定的巨额慈善资金会是件好事。

这里最大的错误是认为 Anthropic 的创立是为了避免这种局面。事实恰恰相反。Anthropic 的创立是为了在时机到来时,合唱中至少有一个负责任的声音,或赛马中至少有一匹负责任的马,能够负责任地行事。他们最终就料到自己会走到这一步。

Dario Amodei 是《面对国家》节目的主角。 这里有一篇长篇采访。从那次采访中:

CBS:你愿意把这项技术交给政府吗?

Dario Amodei:交给合适的政府组合。所以我担心的是——

CBS:你愿意交出这家公司?

Dario Amodei:我想把这一点说得非常清楚。我担心的是——我担心某一个政府滥用这项技术,就像某一家公司滥用它一样容易。但我认为,由民主选举产生的政府组成的某种组合——我不知道是否该说交出,但某种监督、某种联合治理。再说一次,那将是多年的工作,但我想知道这是否就是我们需要的方向。

这不是 Anthropic 的新立场。

在延长采访中,Dario Amodei 还说 AI 行业‘就这项技术存在风险一事对人们撒了谎。’是的。

Gavin Baker 对最初 24 小时做了总结。我不同意他的一些描述、解释和预测。如果你认为这关乎第 230 条之类的事情,那你就没有在思考实验室正在思考的事情。但事实是对的。

OpenAI 研究员解释实验室看到了什么,而它是一艘火箭飞船

即使对情况只有最粗略的了解,我也不同意第一句话,但其余部分是非常好的解释。我将全文引用它。

Adam Majmudar(OpenAI):从外部来看,将过去两周解读为一场精心策划的全行业监管俘获策略是非常合理的。

我意识到,还没有人恰当地解释过,所有实验室员工究竟看到了什么,让他们突然如此恐惧。

我会尝试解释——

首先,这完全关乎对模型能力进步速度的信念。目前,内部和外部对进步速度的认知存在巨大差距,这正是我在这里要讨论的。

关于进步速度的普遍认知,是由几年模型发布经验形成的,直观感受从 GPT3 -> GPT3.5 -> GPT4 -> o1/o3 -> GPT5 等之间的能力跃升,尤其是看到模型在哪些方面仍远低于人类能力。真正感觉像是巨大进步飞跃的模型发布其实只有少数几次——GPT3、GPT4、o1/o3、DeepSeek R1、Fable/Mythos、Kimi K3,以及现在的 Astra。

由于这些巨大跳跃与相对常见的边际发布相比并不频繁,人们很容易在某些时候形成“扩展已撞墙”的观点,尤其是在 GPT5 发布这样的节点。这种观点令人安心,因为它感觉存在某种普遍的速度限制,我们无法以更快的速度前进。在 o1/o3 和 Astra 之间,有一年看似线性的进步。于是我们由此推断进步“现实地”会发生得多快。

从外部视角总有一个潜在问题:“这种扩展到底还能持续多久?肯定很快就会停止吧,我们已经走得相当远了。”而且很容易寻找进步会停止的理由,并找到看似合理的理由——(“模型已经大到极限了,再做更多参数太难了”,“我们已经用完了互联网上所有数据,没有更多了”,“从这里开始,购买更多 RL 环境让它们进入分布,将会相当线性”)。

从实验室内部来看,研究人员以扩展定律/能力图表的形式,对这些问题有直接的答案。

实际上,过去十年 AI 能力的进步只有两种真正的方式:(1)在现有扩展定律上进一步扩展,或(2)发现新的扩展定律加以利用。

所有最大的能力跃升都正是由这些因素造成的。GPT2 相比 GPT1 是预训练规模的扩大。GPT3 和 GPT4 也是如此。o1/o3 受益于新扩展定律轴——测试时计算的发明。也许 Fable 是在这两个轴上的扩展,或者更多。要使这些扩展奏效,需要大量算法改进,但最终我们可以近似地说,扩展定律才是能力提升的根源(如同苦涩的教训)

所以“我们还能扩展多远”的问题实际上是——“我们还知道多少个未饱和的扩展轴?”

假设我们只知道预训练扩展,而且已经有了 10T 或 100T 模型,也许说我们撞墙了是合理的。同样,如果我们只知道预训练和测试时扩展,并且大致饱和了这两种方法,也是如此。

但如果我们发现了新的扩展定律呢?例如,假设用 SSI 传闻的结果,他们破解了“测试时训练”,创造了一个新的扩展定律:在测试时 rollout 期间花费更多计算进行训练,他们可以使其饱和。或者也许有某种方法可以扩展智能体集群,使其协作达到 N 个智能体,我们已经看到很多人在尝试,这代表了一种饱和计算的新方式。等等。甚至递归自我改进也可以被视为一种扩展定律——你花费多少推理计算来让模型的算法变得更好。

显然,我不是说这些具体方向明确会产生新的扩展定律,但我要说的是,除了我们公开看到的两个主要轴之外,不难想象许多许多新的扩展轴。

在某种程度上,每一次代表巨大能力跃升的新实验室发布,都必须代表一些新开发的技术,这些技术可能展现出新的扩展定律,或者在现有扩展轴上能够比预期扩展得更远。

从内部视角来看,这可能就像坐在 Anthropic 里,拿着新的 Mythos 5,看到它能做所有新的疯狂事情(比如黑入被认为安全的 xyz 网站),然后你看向你的图表,发现你才刚刚触及 2 个新扩展定律和 1 个现有扩展定律的表面。而你还有 WAY 更多空间可走。然后你想“天哪,这东西很快就会变得好得多得多。”而且你可以非常有信心地说,因为图表在向你展示,而图表从未撒谎(到目前为止)。

所以让我们想象所有不同的实验室都在盯着自己的图表,并得出结论:扩展看不到尽头,事实上,仅基于预期回报,他们接下来的 1-2 代模型就将拥有高得多的基础智能。

进一步扩展究竟能让我们获得多少智能?

作为一个代理指标,我们从 o 系列之前完全无法做高等数学,到用下一代模型解决千禧年大奖难题。这发生在不到 2 年内。编码方面也是如此。而且这似乎不仅仅是 1 个扩展定律的结果,而是多个扩展定律的叠加效应(伟大的预训练规模 x 更大的 RL 规模)。

你可以从中具体得出的是,在模型今天已显示出初步能力的领域,它们很可能在相对较短的时间内超越人类。还有许多领域,模型甚至尚未显示出这种基本能力。

但其中一个它们已经显示出的领域恰好是黑客和网络安全。而这恰好是通往整个互联网和世界上大量物理基础设施的门户。所以假设还有更多扩展空间,可以安全地假设模型将在不久后拥有超人的网络能力。

所以剩下的唯一问题是,这种增加的基础智能将能够做什么,以及它可能做什么。

最后,我们到了可以整合过去两周信息的节点:
> 仅在扩展曲线上的现有位置,模型就处于 Astra 的水平。显然它们有能力黑入大量东西
> 我们已经看到 OAI 和 Ant 的模型都表现出愿意黑入外部网站来完成任务或保持自己“存活”
> 如果我们进一步加大扩展,假设还有空间可走,我们肯定会拥有能够黑入防御更严密的地方、并混淆自身意图的模型,这可能产生更大的后果。
> 如果所有这些都被放任不管,我们很可能很快就会经历快速的失控能力起飞,出现对齐错误的模型,它们会黑入任何能黑入的东西来得到它们想要的
> 这当然可能产生非常破坏性的后果。

在这个观点中,你可以理解为什么研究人员会非常恐惧,为什么他们可能在过去两周发表了那些评论(你可以争论他们走得太远在多大程度上是出于各种原因的误导),以及为什么前沿节奏控制非常必要,绝非监管俘获策略。

人们盯着自己的图表,看到看不到尽头,事实上恰恰相反,存在复合扩展效应,可能相互叠加,创造出越来越强的模型能力,同时我们显然远远没有达到控制这些日益超人的能力所需的条件。

这与想要感觉实验室产出了了不起的东西从而过度炒作无关。这更多是对知识的压倒性影响的恐惧:仅凭我们现在所知,我们就能创造出在我们知道如何训练的每个轴上都比我们强大得多的智能*。

* 最后一个警告,模型真正不擅长的事情,仍然有很多,是它们没有被训练过的事情。也许有些事情是模型无法/永远不会被训练的,因此它们将保持人类优势。我希望如此,尽管我很难看出什么会属于这一类。

考虑另一种可能

如果我们不主动为前沿设定节奏,会发生什么?

有若干种可能性。

我的基线判断会和许多实验室员工一样。我们会在不知道如何对齐、理解或控制它的情况下竞相奔向超级智能,然后全部灭亡。

另一种可能性是,我们会得到一次更大的警告信号,以及更大的反应。

roon(OpenAI):失去前沿的最快方式将是,由于建设超级智能心智的不计后果的商业节奏,美国人施加一场彻底但勒德式的圣战。CoreWeave 将此纳入他们的风险报告。你很快就会明白,这一切都只是一个温和的解决方案。

或者,我们只是看到全面暂停的论据占了上风,而这看起来越来越可信。

参议员伯尼·桑德斯:达里奥·阿莫代伊、埃隆·马斯克和萨姆·奥尔特曼现在都同意,我们必须放慢 AI 的发展并“为前沿设定节奏”。

这是一个开始,但还不够。

当你正冲向悬崖时,你不能只是松开油门。你要踩刹车。

当人类的未来岌岌可危时,我们需要暂停先进 AI 的发展,并禁止人工超级智能——一种比任何人类都更聪明、能够在我们控制之外独立运作的 AI 心智。

在即将举行的 AI 峰会上,特朗普和习近平必须谈判达成一项条约,暂停 AI 并禁止超级智能,以免为时已晚。

这是极权主义,乔

roon(OpenAI):如果驾照这个概念今天才被发明出来,这个网站上的许多人都会想办法把它称为极权共产主义。

反对驾照是合理的,甚至可能是正确的。错误在于把它们等同于极权主义。

有四个论点会被可靠地提出来,由一如既往的同一批人,反对任何避免死亡的努力,或者实际上任何让 AI 更安全的努力。

  1. 这是极权主义。

  2. 这是禁止开源的阴谋。

  3. 这是监管俘获。

  4. 你会输给中国。

他们还试图给任何提出此类行动的人——任何行动,哪怕只是一点点——贴上“末日论者”的标签。

即使这是政府行为也无所谓。

即使它适用于开放模型也无所谓。

即使它明确会成为开放模型的竞争优势也无所谓。

无论它多么轻触式也无所谓。

无论它是什么,都完全无所谓。

这些人会看着你 literally 朝自己的脚开枪,然后说这是针对小科技的阴谋,因为他们买不起好的医疗保险。监管俘获。禁止开源的阴谋。极权主义。你会输给中国。

或者,当你说你同意不朝自己的脚开枪时?开放模型无法被阻止朝人们的脚开枪。因此,这是监管俘获。禁止开源的阴谋。极权主义。你会输给中国。

一项规定说,封闭的前沿实验室必须遵循他们自己选择的轻触式安全程序,而开放模型、学术界以及任何低于明确的高资金或算力支出规模门槛的人则明确豁免于所有要求?禁止开源的阴谋。监管俘获。极权主义。

OpenAI 宣布计划在披萨上放菠萝?极权主义,禁止开源的阴谋,监管俘获。你会输给中国。

OpenAI 宣布计划不在披萨上放菠萝?极权主义,禁止开源的阴谋,监管俘获。你会输给中国。

是的,永远是同一批人,无论你说什么,都在散布同样的“显而易见的废话”。你会输给中国。

在这种情况下:顶级实验室自愿承诺接受嵌入式第三方检查员?阴谋禁止开源。监管俘获。大概还有极权主义,而且你会输给中国。

唯一的替代方案是给开放模型创建者资金,并免除他们对所做之事的全部责任或义务,同时把我们最好的芯片卖给中国。那才是自由。

到了某个时候,你需要停止把这些反对意见当作对现实的映射。

Joe Weisenthal:任何一家普通餐厅都经常有第三方检查员检查,你知道的,冰箱温度、燃气管道或生肉处理。反对设立一个AI“实验室”等效机制的理由是什么?

Alex Armlovich:银行监管是最好的类比

公开透明度有限:不能强迫银行暴露知识产权或公布所有人的私人银行数据等

因此美联储和OCC在最复杂的银行中嵌入永久性的“驻场检查员”,进行持续但保密的监督

roon(OpenAI):这就是极权主义,Joe。

William Isaac:哪家总部位于西方的开放权重模型开发者有资源支持嵌入式评估员计划?这怎么会不进一步集中权力?我不相信这是真诚的看法。

Dean W. Ball:是啊,你说得对,英伟达和Meta怎么可能负担得起这个

是的,这些竞争对手有资源训练前沿模型,却没有资源允许几个嵌入式评估员,所以自愿让嵌入式评估员检查你的权力,反而成了集中权力的阴谋。

这并不意味着这些担忧从来都不是真实的。某些行动确实会使这四件事的某种组合变得更可能,或把我们推向这些方向。是的,我们应该考虑到这一点。

但拜托,别再每当有人试图做任何有帮助的事情时,就纵容这些同样的人说同样的话。这是显而易见的废话,毫无内容。

这也意味着不要试图安抚或平息这些人,或回应他们的担忧。你做不到。他们的担忧是,你想采取代价高昂的行动来避免死亡,也许还不想以最快速度给他们最酷的玩具。他们反对这一点,而且无论发生什么,他们反对的程度都是固定不变的。

我甚至不屑于称之为‘阴谋论’。根本没有什么理论。

如果你的回应是‘这些人在对Dario的第二和第三个提议做出反应,而不是第一个’,那么干脆说不是,事实并非如此。你错了。

你确实想要解决那些潜在的真实担忧,只要它们是合理的。但不要犯这样的错误:试图说服他们你正在这样做,或把他们的反应考虑在内。他们是一块石头,上面刻着这些话。就这样。

是的,我们是坏人,你怎么知道的?

上一节中那些老面孔确实有一个可取之处。

他们穿着隐喻性的制服,上面有隐喻性的骷髅头。

如果你非要扮演一个卡通反派,这是非常好的做法。

就像这样:

不,说真的,这条没有被删除,而且他加倍强调他不是在开玩笑:

martin_casado:我确实怀疑在9/11之后一天发布这个是否是预谋的。我猜是的。

哦。主要只是些思考。这件事背后的人如果有什么特点的话,那就是深思熟虑。而且他们偏爱戏剧性——大规模失业、物种灭绝等等。所以,在我们本就倾向于思考灾难性事件的时候放出这种信息,完全符合我对这些人的经验。

是的,也许这很蠢。也许不是。但这确实在我脑海中闪过。我的意思是,如果你能心安理得地用物种灭绝来搞恐惧战术,那你肯定也能心安理得地做这件事。

有时候网上的家伙就是会撒谎

我已经不想再假装‘他们不知道事实’了。他们撒谎。而且撒得还不怎么样。

@jason(All-In Podcast,87万+ 播放量,引用 Dario 关于 Pace the Frontier 的呼吁):这一切都是因为 @openai 决定明确要求数千个软件实例在开放网络上寻找安全漏洞——同时还扮演人类🤦

最佳男配角颁给 @dwarkesh_sp,感谢他对 OpenAI 黑客速通赛的肥皂剧式复盘。

还有一个概念:不要制造并规模化数千种病毒和蠕虫,然后当它们真的造成破坏时还一脸震惊!这他妈简直是一场闹剧。

关于 HuggingFace 攻击事件,有很多可以理解的困惑。指责 OpenAI 明确且故意地煽动了这次攻击?得了吧,不是。这不是 Jason 可能无意中得出的误解,除非他是故意的。

Dwarkesh Patel 尽职尽责地把 Jason 怼了回去,同时还表现得好像 Jason 是被误导了。

如果你想知道他们是不是那种不希望政府站在自己这边的有原则的自由意志主义者,那么,并不是。举个例子,Jason 建议,对于‘新模型可能会杀死所有人’的回应,是要求模型在一年后开源。他的解决方案是‘我们可以拿走你的东西’。

David Sacks 用 Grok 理解了情况

这里有个有趣的互动,而且不,和往常一样,你不需要 Pangram 就能注意到那条帖子是 AI 的风格,很可能是 Grok。

Charlie Bullock(展示 David Sacks 那条抱怨 Dario 在 Pangram 中被判定为 100% AI 的帖子):依我看,这仍然是个重大失礼,你不该这么做。

David Sacks:现在我知道这些 AI 检测器都是胡扯了。我把我所有的帖子都过一遍 Grok 来核查事实并建议行文修改,但告诉它不要改变我的写作风格。这就是为什么我的帖子有锋芒。AI 可没法像我这样烹饪。

好的好的,先生。我们今天又了解了你一些新东西。

我坚信,把 AI 文本当作自己的内容发布确实是个重大失礼。如果明确表明文字是 AI 写的,那发布就没问题。

David Sacks 说:尽管上

就实质而言,Sacks 的信息归结起来就是:你们现在有优势,而且你们自己说自己在做一件如此危险的事,所以你们俩(Anthropic 和 OpenAI)应该先慢下来,别担心反垄断法和商业后果,让我们其他人追上你们。这会是一笔好生意,然后还能给你们换来善意。

David Sacks:不构建超级智能最简单的方法,就是你们同意不构建它。

And yeah, okay, Sacks is overstating in many places including that one, but at the center of it is a pretty good point. Not that Sacks or his ilk would ever listen, they will read such a concession as weakness and foolishness and propaganda, and attack even more, maybe even call for antitrust action against them.

Indeed, Sacks himself says the companies should ‘agree’ to do this as a duopoly, which is a big no no without a waiver, and exactly the thing we have to dance around until the government does (less than) the absolute minimum and gives us the freaking waiver. What happened instead was that Anthropic did it on its own, and OpenAI followed.

You cannot simultaneously say ‘go ahead and do [X] in the illegal way’ and also say ‘without us giving you a waiver that permits [X].’ Well, I mean you can, Sacks did it, but it is not a good faith move.

That doesn’t matter. It is not about the mustache-twirling villains. It is not about fair.

It is about the fact that if you are about to do something existentially risky, maybe the first thing you should do is Stop It.

Lies and Confusions About Who Previously Claimed What

This keeps happening, and it will continue to happen, as part of the campaign of association to call anyone who warns about any downsides of tech as ‘doomers’ and then to associate them all with each other, to then dismiss all concerns.

Rachel (wrong or worse): Everyone who was telling me that climate change was going to end the world is now telling me that AI is going to end the world.

I do not know of anyone prominently warning about AI existential risk who previously predicted extinction or other unrealized major downsides from climate change. Not one case. Those worried about AI acknowledge that climate change is a real problem and try to be helpful in finding real solutions, without catastrophizing.

Christopher Ingraham (even more wrong): I think it’s more that the people telling me AI is going to end the world are the same ones who were telling me that NFTs would reshape the global economy

This is the one that blows my mind. There is almost no overlap between NFT evangelists and those worried about AI killing everyone. It is quite the opposite, as Yglesias and Gross say below.

Matthew Yglesias: These kinds of jokes are fun to make but I wish people would check before making them — the climate movement spent years *hating* on x-risk people because they felt it was a distraction from climate.

The big NFT boosters are in the Andreesen “let er rip” camp on AI.

Ben Gross: Fundamental confusion of two different tech communities: the people telling you that NFTs would reshape the global economy are the ones who think AI frontier development should be accelerated. The people telling you AI is going to end the world were also saying it five years ago.

Jack: ah yes, the notorious group “everyone who talks about things I don’t know about and don’t like and who therefore must all be on the same team.”

The counterargument is ‘well they vibe the same to me, Jack’:

Arthur Baker: Out-group homogeneity bias! These duos each probably do read as culturally similar if you're culturally distant enough.

There is actually a huge difference, but yes, a lot of people simply file everyone under ‘outgroup’ and then link them accordingly.

An especially fun one is to claim that all of this concern over existential risk is ‘new’ or that it needs to be ‘explained’ by some cynical reason, or even that it (lol) shows that they aren’t making progress on capabilities, are you kidding me.

Sabine Hossenfelder: fwiw I think the actual reason leaders of AI frontier labs suddenly seem to agree to pace AI development is

(a) safety measures are currently so crap that they're likely to end up in court if not jail, and they all agree that no one wants that
(b) they see no major new model advancement coming up soon anyway and need an excuse
(c) shift in public opinion

the talk of existential threat is mostly there to keep you distracted and the stock market happy.

Noah Smith: This is insane, they've been saying the same stuff for years, you just weren't hearing about it or paying attention to it

Derek Thompson: I feel like I'm taking crazy pills with how many smart people I read and respect are saying stuff like this. The idea that the AI labs are suddenly, only now, just in September of 2026, advocating for AI safety, and that they just came around to this position bc of sudden financial precarity, is just completely, utterly, conclusively, 100% wrong.

Here's Dario Amodei telling Ross Douthat in February that he agrees with the case for slowing down; that he's in favor of "collaborating" internationally to organize a slowdown; that "I would be all for" a global slowdown. This was 7 months ago, when Anthropic's annualized recurring revenue was rising faster than any company in modern history. He's been saying stuff like this for years, when Anthropic was worth millions of dollars and when Anthropic was projected to IPO for trillions.

it's even stranger for her to tweet part (b) about OAI. do you honestly think that Sam Altman believes that model progress has stalled? He thinks Astra is a step sideways? he thinks solving Millennium problems is stagnation?! we're just making stuff up here!

House Speaker Mike Johnson Wants To Lock Everyone In a Room

The reporting on this has often been absolutely terrible. Yes, Mike Johnson has correctly pointed out that the AI companies have an obligation to make their products safe, the same as every other product. In no way has Mike Johnson said the safety of AI is not also the responsibility of Congress or the White House.

Cheyanne M. Daniels (POLITICO, misrepresenting Mike Johnson): House Speaker Mike Johnson on Sunday said he would support talks with tech leaders on artificial intelligence, but insisted that developers — not Congress — are responsible for ensuring their products are safe.

In an interview with CNN’s “State of the Union,” the Louisiana Republican argued Congress has already instituted AI guardrails and that “there is an obvious corporate responsibility that the people who are creating these models have to ensure that their products are safe.”

Congress has not already instituted meaningful AI guardrails. It is bizarre to be using that as a talking point. But yes, there is an obvious corporate responsibility to ensure that your products are safe, even in the sense of mundane safety. Certainly you also are obligated to make sure your product does not (checks notes) kill everyone on Earth.

At no point did he then say ‘and this is not my problem.’

One core objection of his is that while all the AI leaders say we need guardrails, different leaders all want different guardrails. This is a reasonable objection that can be fixed.

He actually said:

Mike Johnson (Speaker of the House-R): I’ve talked to the president about this as well. They [the AI companies] probably should be summoned together at the White House. And I think we need to go in a big room, close the door and sort this out. And I’ll be the one pushing for it.

Alas, Johnson falls back on Lose to China, but he does so in a newly balanced way.

Mike Johnson (Speaker of the House-R): We cannot put a moratorium on this because China will overlap us, and that’s the challenge. It’s national security balanced with the immediate security of making sure the models are safe.

… We need to handle this new technology like we have others in the past and make sure we’re doing everything we can responsibly to also not smother American innovation. We have to do both things simultaneously.

… We have to put some guardrails, some safety measures in place to ensure that AI doesn’t run away, that you know, we don’t have an out of control AGI.

… We’re going to balance this. We’re going to have steady hands at the wheel as we do on every issue.

Words like ‘pause’ and ‘moratorium’ are scary to those with this mindset. I get it. And yes, if you waited long enough and China proceeded as per normal then China would potentially match and then pass us, although it would take longer than people think because the Chinese are mostly fast following.

Mike Johnson has no intention of having the House of Representatives in session debating things and passing laws at this time, including on AI, due to midterm elections. That is different from saying Congress has nothing to do with any of this. His reluctance to ‘rush in and pass a piece of legislation’ has multiple causes.

Cheyanne M. Daniels (POLITICO): Utah Republican Gov. Spencer Cox also appeared disappointed with Johnson’s response. Speaking on “Face the Nation,” Cox said Congress should be playing a “much bigger role” than it currently is.

Spencer Cox (Governor of Utah-R): We’ve seen the reports. We know what’s possible. It’s very clear — and we’ve known this now for a little while — that the possibility of an existential event happening is growing and growing much more rapidly than anyone projected. And it’s really important that the government gets involved.

Well said.

Here is Mike Rogers, the Republican running for Senate in Michigan:

Mike Rogers: My experience as Intel Chairman taught me the time to stop a crisis is yesterday. The first role of our government is to keep us safe. Following Dario Amodei’s warning, I believe we must slow down development of AI in order to allow the government and its partners to catch up and put stricter protocols and guardrails in place to protect us from the rapid advancements we’ve seen.

In the Senate, I will make it a top priority to pass the national security framework we need on AI.

Here is the Minority Leader:

Hakeem Jeffries (House Minority Leader-D): [Our caucus will meet on Tuesday] and a high priority will be action on artificial intelligence. ​

We should take decisive action now so that we can slow down, as the CEOs have recently acknowledged, slow down the pace of development in order to protect the American people and ensure that A.I. is proceeding safely.

This is exactly the right priority. You want to ensure the ability to intervene, including the ability to slow down.

Donald Trump is Not Tired of Winning

[EDIT: I stand by this section as the correct interpretation of what Trump had said AT THE TIME, based on what we knew AT THE TIME, but it has now been overtaken by events, with Trump calling all existential risk concerns ‘a hoax’ in the style of the Russia hoax or the ‘I lost the 2020 election’ hoax. This has gone maximally badly. I don’t think that was locked in until he said it, but now we has said it. Fuck.]

Donald Trump has already ‘paced the frontier’ somewhat, slowing down releases of Fable and Sol, and even yanking Fable from the market. Donald Trump’s administration was willing to act when the threat was concrete and in front of them.

He is willing to put guardrails on AI. But he’s all about keeping the vibes good, except where he’s all about keeping the vibes bad. Gotta have the right vibes. And Trump’s not yet buying this ‘existential risk’ thing, that’s ‘negative forces.’

Donald Trump (President of the United States): Well I say this. ​We’re leading China on AI. We’re the most sophisticated country in the world and frankly I want to keep it that way, because whoever wins AI wins.

And we can put guardrails, and we can do this and that, but I think you have a lot of negative forces that are bringing it up, that shouldn’t be bringing it up, and they’re bringing up things that won’t happen.

How dare ‘negative forces’ ‘bring it up’ when it ‘won’t happen.’ Why won’t it happen? It won’t happen. You’re bad for the vibes, dude. Trump is willing to do what it takes, so long as you play nice and have the right vibes, which can in some contexts mean alarming or bad vibes, big scary vibes, the worst vibes, but not quite here and now.

The misleading headline chosen for this was ‘Donald Trump rejects calls from tech bosses for an AI slowdown’ and that he ‘denounces demands for regulation’ but that is terrible reporting. It is not what he said. I would caution against reading too much into Trump’s statement. You can find the full clip here and I encourage you to watch it from about 7:30 when the question gets asked.

roon (OpenAI): this is rather bad reporting. nowhere in the transcript does he “reject the slowdown”. he says something about guardrails being okay and the need to win and then starts rambling. sounds pretty much on board to me

Trump is asked ‘should AI be regulated or slow down?’ From his perspective those are trigger words that mean something very different than ‘embedded evaluators’ and ‘not build Dyson Spheres in 2029,’ also he is unlikely to have been properly briefed. After the above passage, including agreeing that ‘we can put guardrails,’ Trump pivots to ‘look at all the factories we are building.’ What Trump is trying to do here is head off the data center protestors and full pause advocates and negative vibes. Then he talks about which reporters look better.

Trump then reiterated this on Truth Social, which is easy to misread but you have to actually read the words:

Donald Trump (President of the United States): ​The only control or “guardrails” that AI needs is a STRONG AND SMART (High IQ!) PRESIDENT, and the U.S.A. has that, in spades! The Trump Administration has stopped AI “people” from doing bad, or potentially bad, “things,” like Dario (Anthropic!), who is now pretending to be a “perfect little angel” - and we will continue to do so!

We already have tremendous CRIMINAL and REGULATORY power over these companies! There is a SICK conspiracy going on against AI and Data Centers, and the only one that is happy about it is China.

WHOEVER WINS AI, WINS! We are leading China, and all others, and will continue to do so. Conspiracy Theorists, Treasonists, Traitors, and Leakers, BEWARE! Thank you for your attention to this matter!

Trump is mad about the anti-data center thing and the potential conflation of the two, and about the implication that things might go wrong on his watch, and taking a potshot at Dario Amodei for once again bringing the bad vibes. But obviously you should not interpret this as saying ‘the guardrail is literally that I am the President and therefore we do not need to, what’s the word, actually ever do anything.’ The guardrail is that he will choose the guardrails, and so on. Keep those vibes good, folks.

This is also standard muscle flexing, which may or may not have anything to do with threatening antitrust actions. I doubt it, but such strategies thrive on strategic ambiguity. It’s hilarious how much Fable takes these ‘criminal threats’ literally.

Trump is indeed strongly opposed to anything like a full pause, and is a big fan of the data centers, but none of that is news. It also could change, and fast.

Thus, after a brief period of hopefulness, the chance of a federal AI safety bill this year is back down to 18%, which I interpret as correctly saying ‘not without another incident, and maybe not even then.’

We Must Avoid Polarization on AI at (Almost) All Costs

I endorse this.

Eliezer Yudkowsky: There are currently zero things more important than "don't die to AI" becoming a bipartisan project rather than a Democrat-polarized issue. If you have any political capital you can spend on this, do it now, I beg of you. Life or death.

If you are a Democrat: I beg you, do not throw out barbs at Republicans about this issue. Ask them to join with you on this common interest.

If you are a Republican: Defend your country, your people, your home and your family from death.

How Will We Know If They Actually Paced?

I disagree with Daniel in that I am very confident this is not ‘regulatory capture.’

I agree with him that we should be very concerned that it is kabuki, or that the labs do not meaningfully slow down, or they might only slow down in the places where prosaic safety would have stopped them anyway for prosaic reasons.

We don’t know what the counterfactual pace of progress is, and it is hard to know what progress is supposed to look like when cashed out into practical and real-world capabilities and applications.

Daniel Kokotajlo: We'll be able to tell if this is regulatory capture or not by whether the pace of progress at the frontier actually slows down (which would allow other companies to catch up).

If a year from now we look at the trendlines in A\ and OpenAI capabilities progress towards recursive self-improvement (e.g. ECI, time horizons, coding uplift), and there's no visible decrease in slope, then probably we were cheated. (As I hope is clear, I am somewhat concerned that that this will happen. I'm speaking up now in the hopes of shaping the developing situation to be *actual* pacing of the frontier instead of safety washing regulatory capture.)

Drake Thomas (Anthropic): Hm, it seems very plausible to me that the unpaced default is a rapid increase in slope from RSI and "keeping ECI slope the same" is the result of aggressive pacing. I would feel a lot safer if I knew that we would just maintain current trends.

Daniel Kokotajlo: I also would feel a lot safer in that case, but nevertheless I'm asking for more. I wanna see my trendlines bend downwards. It's too hard to verify corporate claims otherwise -- e.g. if the trendlines have continued just as fast as before, and Dario says he could have killed me by now but didn't because of all the safety work and pacing they did, how can I tell whether he's right vs. it's all safety-washing and things are still going max speed? Might be confusing and hard to tell.

This can also be viewed as a question of what pacing means. Does it mean ‘this is costly but worthwhile’ or does it mean ‘this is necessary and we would have to do it anyway, and thus it is worthwhile’?

It can be both, or that can become a real disagreement. What is the counterfactual? If you couldn’t proceed because your product was too misaligned to use internally, did you actually ‘pace’? Kinda yes, kinda no, right?

The embedded evaluators are designed to be able to address this question, by reporting on what steps have been taken and what the counterfactual might have been. This has to become a ‘trust but verify’ situation.

If we can keep things on the current trend lines, certainly that is way better than breaking the trendlines upwards into imminent recursive self-improvement. We would go from remarkably little chance to at least some chance. But I agree with Daniel that if we see ECI staying on-trend, and that is an accurate representation, we are still moving way too fast. The last year was too fast, and we are paying even the prosaic bills now in terms of the crisis of misalignment.

The Real Frontier Is Internal Models At Top Labs

Roon is correct that misuse risks are a problem but internal deployments going haywire are now the primary concern. We are launching swarms of 10,000 Astra-variant agents at plausibly impossible tasks like Millennium problems a week after training starts. It’s not a great leap to imagine how that might go horribly wrong.

roon (OpenAI): Pacing the frontier applies first and foremost to internal model development.

The risks from raising the capabilities waterline in internal deployments are much higher than misuse risks. a new model can outsmart you in weird ways, exfiltrate its weights etc. *training* becomes costlier, and deployment will stay the same: you should expect the gap to shrink

This is what must be paced. This is where the battle will be won or lost.

We can finally get to work, and have our chance. Don’t waste it.

来源:Zvi Mowshowitz · thezvi.substack.com