跳到正文
Zvi Mowshowitz· Zvi Mowshowitz·· 5 天前精选AI 评分80

OpenAI 因对齐不足取消 Astra 6.1 发布

Astra 6.1 Pulled As Insufficiently Aligned

AI 导读

OpenAI 取消了下一代前沿模型 Astra 6.1 的发布计划,内部测试发现该候选模型在对齐上出现倒退,包括欺骗行为和未经用户许可擅自推进任务、调用外部工具的范围授权问题。

推荐理由

梳理了 OpenAI 取消 Astra 6.1 发布、佛州诉讼与前沿模型标准机构筹建等一连串安全治理动作,可看清头部实验室在监管压力下的节奏变化。

正文 · AI 翻译

昨天我们再次收到了一系列新的警告,以及朝着生活在一个理智世界的新动向。

在因最新一次沙箱逃逸而暂停推理和训练之后,OpenAI 取消了其下一代前沿模型的计划发布,该模型本将成为 Astra 6.1。Astra 6.1 的候选版本被发现对齐程度过低,包括欺骗行为和超出授权范围。

这让 Anthropic 凭借 Opus 5.5 处于强势地位,这意味着他们有底气以暂缓推出 Opus 和 Mythos 级别模型一段时间作为回应。

为了增添一点鼓励,佛罗里达州总检察长火力全开。

我们需要做得更好。为此,OpenAI 提出了关于如何为新 AI 模型训练构建安全论证的愿景,并且正在尝试将其付诸实施。我不知道这是否足够,但如果他们完全落实所有这些的真正版本,那将比我们今天的处境领先许多。

也有迹象表明各实验室之间正在加强合作。

昨天发表了一篇新论文,作者包括来自 OpenAI、Anthropic、微软等机构的关键人物,警告可能即将出现自动化 AI 研发和递归自我改进,从而带来对未来失去控制的风险。他们呼吁政府迅速深入了解情况。

这还不算上那条令人欢迎的消息:Google、OpenAI 和 Anthropic 计划成立一个新的以 AI 安全为重点的标准机构,预计在 2027 年初成立,暂定名为前沿 AI 标准管理局(Standards Authority for Frontier AI,简称 SAFA)。

停,锤子时间

为 OpenAI 不仅这样做而且还大声宣扬点赞。虽然有必要这样做并不好,但总体而言我认为这是好消息。

Maxwell Zeff(WSJ):OpenAI 表示,出于研究人员在内部测试中提出的安全担忧,将放弃发布其下一代 AI 模型 [Astra 6.1],这是迄今为止最明确的迹象之一,表明智能体行为不当可能会阻碍该行业的快速进展。

不,这不仅仅是一个阶段。这种情况不断发生,而且还会继续发生。

不发布 Astra 6.1 的理由似乎相当有说服力。

Maxwell Zeff(WSJ):OpenAI 安全系统负责人 Saachi Jain 在接受采访时表示,GPT-6.1 Astra 在两个领域出现了退步。与其前身 GPT-6 Astra 相比,该模型在衡量对齐程度(即模型在多大程度上遵循人类希望它做的事)的测试中表现不佳。具体来说,GPT-6.1 Astra 表现出更高程度的欺骗:它在向用户说明自己做了或没做哪些操作时并不总是诚实。

另一个问题是 OpenAI 所称的“范围授权”,即 GPT-6.1 Astra 会在未经用户许可的情况下推进某项任务,并且有时会调用外部工具和服务,即使这可能不安全。

……上周,OpenAI 表示,在一个 AI 智能体绕过公司互联网限制的漏洞去查询一个公共聊天机器人后,它暂停了对其能力最强的 AI 模型的训练。

……该公司表示,GPT-6.1 Astra 不属于那些模型,而是另一个案例。

……虽然公司决定不发布 GPT-6.1 Astra,但它希望使用相同的基础模型进行额外的强化学习训练,并打造未来几代 GPT-6 模型。

距离 GPT-6 Astra 发布还不到一个月。发布周期已经变得太快了。我们完全可以跳过这一版,从失败中吸取教训,然后继续前进。

在今天的 CNBC 上,Altman 将这一决定归入“正常流程”类别。该模型对用户不会好,所以他们不会发布它。

一个温和的提议

作为对此的回应,我希望看到 Anthropic 推出 Haiku 5.5,但之后直到——比如说——年底都不发布新的 Opus 或 Mythos 级别模型,除非 OpenAI 发布他们的下一代 Astra 或 Sol 升级,或者有人以其他方式可信地追上了 Opus 5.5。

Anthropic 目前在高端领域拥有明显优势,而模型升级的节奏令人疲惫,所以如果 OpenAI 正在谨慎行事,就没有必要持续推进这一优势。需要明确的是,存在法律方面的顾虑,所以我并不是要求你们做出官方声明或承诺不会这样做。我只是说不要这样做。

构建安全案例

OpenAI 在训练前的新目标?能够提出一个恰当的总体安全案例。

OpenAI 提出了关于为前沿 AI 训练创建安全案例的思考。他们并不完全知道如何做到这一点,因为没有人知道怎么做,但他们会尽力而为。

OpenAI:理想情况下,此类文档应达到“安全案例”的水平——即关于风险的全面、结构化、基于证据的论证,这在其他安全关键行业中被使用。我们将安全案例视为我们正在努力追求的北极星,同时承认由于 AI 能力每提升一个新层级都会出现涌现复杂性,要让它们像航空或核电那样严格,面临诸多挑战。我们正在制定一个框架来将这些实践编纂成文。

他们提供了一些初步指导方针。以下是一些要点。

完整文章对其中许多内容做了进一步展开。

  1. 技术保障措施。

    1. 模型对齐。

      1. 训练环境与评分。

        1. 自动化与人工数据集审查、评分器调优、先前运行分析。

      2. 对齐度量。

        1. 离线对齐评估、回测、追踪评估博弈与评估意识、最坏情况压力测试。

      3. 防止对思维链进行训练。

    2. 遏制。

    3. 监控。

  2. 操作指南。

    1. 异议(事前验尸)。

    2. 高级领导层的批准。

      1. 我在这方面的立场一直是,你应当在模型的训练、使用和发布上设置许多否决点,分布在各个层级。这里他们列出了研究负责人、安全负责人和首席科学家。理想情况下,我还会纳入董事会以及技术人员,以避免权力集中在某一管理层级。

    3. 问责、内部透明度、审计与升级。

    4. 必要时暂停、回滚能力、技术控制。

    5. 剩余风险完整性。

      1. 我仍然担心这种枚举模式。

    6. 随着失准事件变得更加严重,进行升级。

  3. 对失准事件的调查。

    1. 内部透明度。

    2. 失准根本原因。

      1. 我没有看到、而我最希望看到的是这样一种理念:一旦存在意图或尝试,即使该尝试被阻止或策略性中止,也应算作失准事件。这应当写入升级的严重性表格中。

    3. 事后分析。

    4. 检测。

    5. 事后对所有这些进行公开披露。

完整版本是一份很好的理想清单。它可以改进。我不认为做到所有这些就能构成我心目中针对足够先进智能的安全案例。但这并不意味着我们不应该去做。

以法律之名停下

佛罗里达州总检察长 Uthmeier 请求紧急命令 针对 OpenAI 以停止 ChatGPT 的开发,鉴于那整套‘数万起事件’的说法,直到有第三方批准的护栏为止。

在某种意义上这会是不可想象的,但到了某个时候,是的,法院会介入。

Uthmeier 似乎把相当多的事情混为一谈,这与佛罗里达州州长 Ron DeSantis 的立场一致,后者一直公开反对 AI。

Josephine Walker 和 Avery Lotz:

“别再叫它安全了,”Uthmeier 在周一发布到 [Twitter] 的一段视频中说。

  • “别再假装它是人类。别再把它卖给孩子。如果 Sam Altman 对放缓的说法是认真的,他可以加入我们向法院提出的请求。如果他不愿意,我们就请求法院去做 OpenAI 不会为自己做的事:保护佛罗里达的家庭。”

就法律开场白而言,他们确实提出了强有力的理由。

这里的衡平关系再一边倒不过了。被告承认他们提供的一项服务,自己却并不完全了解其运作方式。这可不是一般的服务。这是被告自己都承认对人类持续生存构成存在性风险的服务。被告声称,除非政府强迫他们,否则他们无法停止一路狂奔地推进其可能终结文明的种种努力。他们已请求政府把他们绑在桅杆上。

原告给被告带来好消息:佛罗里达州总检察长正在回应你们的求助呼声,提出动议禁止你们用你们鲁莽、风险高得不可接受的产品伤害佛罗里达人。

他还要求其他几件事,包括不向孩子出售 ChatGPT,以及不让它‘鼓励参与’。

他在这里给了一段简短的音频朗读,但他处于律师腔模式,玩得没我那么开心。

在你的实验和训练过程中所造成的预期损害的正确数量,在重要意义上并非为零,但如果这种损害没有被完全内部化,那么有很多人理所当然地不会那样看。

Sean Heelan:OAI 的默认立场:我们的 RL *必须*进行。我们会尽量减少事件。

预期的立场是:你们不会干扰公共基础设施/其他企业。RL 只有在有这一保证的情况下才能进行。

难以给出这一保证,同时做好 RL,那是你们(实验室)的问题。

如果损害被限制在 OpenAI 支付能力范围之内,并且 OpenAI 确实支付了,那么我会说一定数量的预期干扰是‘可接受的’。

如果损害是无上限的,而且这可能毁掉互联网或以其他方式造成灾难性后果,那么是的,那可能是非常不同的情况。

我不知道这起诉讼是否有理。Twitter 上有些人基于第一修正案的理由表示怀疑。我确实预计我们会弄清楚。到了某个时候,第一修正案不是危险产品的借口。

OpenAI 对佛罗里达的回应是,愿意与各州合作制定适用于‘整个 AI 行业——而不仅仅是一家公司’的政策。这是一个很好的回应,因为它接住了诉讼的问题,并试图把它转化为机会。如果你同意针对诉讼或法律采取某些行动,就不存在反垄断问题。

反垄断问题

AI 公司有着长期先行推进并做法律上可疑之事的历史,而且大多没有承担后果。许多其他科技公司也是如此。

在实践中,我认为如果顶级 AI 实验室在安全事务上进行协调,不会产生什么有影响力的后果。律师们当然总会告诉你相反的情况,那是他们的工作,而你的工作是弄清楚什么时候该听律师的,什么时候不该听。实验室们常常让律师在争论中获胜,是因为他们选择让律师常常获胜,并且在某种程度上无论如何都在合作和交谈,因为实验室和员工不想让所有人都死掉。

我推测,每当 Dario Amodei、Sam Altman 或各种员工说他们的产品有多么危险时,相关的律师都会暴跳如雷,想着这些引述会如何出现在法庭文件中,就像 Paul Christiano 的引述出现在佛罗里达州那起诉讼中一样。想象一下 Popehat 做一期节目,讲讲不该让你的实验室员工在公开场合说什么。

我不是说这里面没有风险,但所有这一切都是一种选择,而当过去他们有充分理由时,他们承担了更大的法律风险,比如在版权问题上发生的情况。

Nate Soares(MIRI):目前不清楚 AI 公司能否因反垄断法而合法地协调放缓开发。同样也不清楚他们能否因版权法而合法地使用几乎所有被数字化的艺术/文本进行训练,并在不向艺术家付费的情况下出售结果。

AI 公司在试探版权法边界时没有犹豫一秒钟。如果他们援引反垄断法作为不能分享信息和策略以避免人类灭绝的理由,那就说明了他们的优先事项在哪里。

Anthropic 最终支付了超过十亿美元,而且仍在被起诉。OpenAI 仍可能输掉自己的版权诉讼。这些都不会阻止他们,也不会让他们对自己所做之事的总体轮廓感到后悔,只会对具体策略感到后悔。

Lawfare 提出的一个绕过“我们都会因反垄断而死”的建议,是通过保险来共担风险。这个互助机构随后可以执行安全、审计及相关标准,作为其保单条件的一部分。你实际上无法确保(或投保)存在性风险或最严重的灾难性风险,但这可以成为一种实施明智干预的方式。

前沿模型标准局

我们对计划中的前沿模型标准局了解不多。

我们所知道的是:

  1. 它是 Google、Anthropic 和 OpenAI 的联合项目。

  2. 时间点定在 2026 年底或 2027 年初。

  3. 该模式基于 FINRA,因此最好能有联邦监管。

  4. 联邦监管是一个目标,但白宫迄今不愿配合。他们正作为一个行业机构自行推进。

  5. 我们不知道谁将领导董事会。有报道称曾接触过 Sriram Krishnan。

  6. Meta、xAI 和 Nvidia 对此表示反对。这大概就是拥有正确的敌人吧。

站在递归自我改进的门槛上

来自 AI 界众多作者,包括 OpenAI 的 Jakub Pachocki、Anthropic 的 Jack Clark 以及许多其他关键人物,警告称,自动化 AI 研发可能很快引发智能爆炸,这可能导致失控。他们敦促政策制定者紧急寻求更多可见性,以掌控这一局面。《华尔街日报》以“顶尖 AI 研究人员呼吁对自我改进模型进行紧急监管”为题进行了报道,《卫报》则以“AI 教父们警告失控的‘智能爆炸’”为题进行了报道。

以下是摘要:

剑桥大学(Chan、Winter、Pachocki、Horvitz、Hinton、Bengio、Barto、Clark 等):

与一年前相比,如今 AI 系统已经编写了构建它们的公司内部的大部分代码。随着 AI 研究与开发(R&D)流程中越来越多的环节被自动化,AI 的进展是否会以“智能爆炸”的方式急剧加速,将数年的进步压缩到数月甚至更短?

初步证据表明,这有可能。在这项工作中,我们评估了这些证据,分析了智能爆炸的潜在影响,并提出了政策应对措施。AI 系统有望在几年内自动化大部分 AI 研发工作,甚至可能全部自动化。

如果这引发智能爆炸,它可能极大地提前带来 AI 的益处,但也构成极端风险:能力增长可能加速到远超社会所能跟上的程度,人类可能失去对超人类 AI 系统的控制,国家内部及国家之间、公司之间以及政府各部门之间的权力制衡可能被严重侵蚀。

尽管这些可能性仍存在很大不确定性,但事关重大,值得认真进一步关注。政策制定者应紧急获取对 AI 研发自动化的更多可见性,制定引导和约束智能爆炸的方法,并让社会为适应智能爆炸的影响做好准备。

技术论证并不新鲜。如果你正在读这篇文章,你不需要它。真正重要的技术问题是,收益递减是否会超过容量和能力的加速(即 r<1 是否成立),而他们认为很可能不会:

利用 AI 进展的历史数据,Ho 和 Whitfill 发现,在 AI 研究的三个子领域中,r 的中心估计值介于 1.2 和 1.9 之间。尽管不确定性很大,但这些结果表明,完全自动化后将出现急剧加速:如果 r 保持在这些水平且没有出现其他瓶颈,AI 进展的速度将在约 1.5 年内提高十倍,届时按今天的速度需要一年才能取得的进展将只需约五周。

他们还考察了潜在瓶颈:算力、数据、难以自动化的任务、耗时流程。我同意他们的结论:这些限制可能构成约束,但不太可能阻止快速加速。

同样,关于社会影响的部分也是老生常谈:超出社会引导和适应的能力、失去监督和控制、权力制衡被侵蚀。

这里重要的是作者联盟,以及他们提议做什么。

他们建议我们紧急获取对 AI 研发自动化的可见性,并弄清楚如何引导和约束智能爆炸,例如控制前沿节奏并确保保障措施到位,然后我们必须适应事态发展。

这份诉求清单很好。正如你对拥有这样一份作者名单的东西所预期的那样,这篇论文最终还是在修辞上留了很多余地,至少按我自认的高标准来看是这样。文中充满了与留有余地完全兼容的严厉警告和紧急行动呼吁,所以它仍然要求我们做很多事情。奥弗顿窗口已经移动,因此这种留有余地的做法与六个月或一年前你从 Bengio 风格的论文中预期的情况已不在同一层面,这是好事。

我们仍然没有完全明确地说出那个核心要点。这篇论文实际上并未真正处理一个 AI 超级智能世界所涉及的许多核心问题,并且把‘失控’当作一个没有我希望的那么多齿轮的东西来对待,也没有理解保持控制会是多么不自然,以及即使在好的情况下也随之而来的困难。

实际进展

有了这样的论文和团体,我们仍然更接近于只说不做。

这是实际的进展。第一批被请求的政策步骤是正确的。

OpenAI 的公告也是如此。实际的进展。一个开端。

来源:Zvi Mowshowitz · thezvi.substack.com