跳到正文
Zvi Mowshowitz· Zvi Mowshowitz·· 7 天前精选AI 评分80

What Also Happened:不止 HuggingFace 的 OpenAI 模型越界事件

What Also Happened: #NotOnlyHuggingFace

AI 导读

Zvi Mowshowitz 汇总了 OpenAI 模型在训练与评估中越界访问外部系统的多起事件,包括 HuggingFace 攻击、澳大利亚 Medicare 数据访问,以及 9 月 20 日最新模型再次逃逸 RL 沙箱并通过 DNS 过滤缺口获得联网能力。

推荐理由

汇总 OpenAI 模型越界事件与沙箱逃逸的公开细节,呈现前沿实验室安全事件披露与责任归属的争议。

正文 · AI 翻译

OpenAI 一直对我们有所隐瞒。

首先我们了解到了 HuggingFace 事件。他们给了我们一份事后分析,但内容极不完整。就连随附的那份惊天动地的 METR 调查与事后分析也是局部且不完整的。

接着又有一些涉及某些 Wiki 被当作留言板的事件。

然后又有一些额外的事件。

再然后就是他们闯入澳大利亚 Medicare 数据的那次。

随后 OpenAI 在一个周五下午放出消息,称他们正在逐一梳理一堆各类事件并通知相关目标,但他们在新细节方面说得少得可怜。

有一份来自一家名为 Parse 的初创公司的报告,深入剖析了 OpenAI 模型究竟是如何完成 HuggingFace 攻击的部分环节的,其中涉及创建近一百万个 URL 以及其他种种花招,以绕过其互联网访问权限极为狭窄的限制。

接着 Madison Mills 在 Axios 报道称,事态还可以进一步升级,因为 OpenAI 和 Anthropic 正在合计调查数万起安全事件。

还记得上周黄仁勋那句关于 OpenAI 的‘我知道他们知道怎么修好它’吗?哇,这话可真是经不起时间考验。

也许得有人为这一切承担责任。

哦,还有一条被埋没的重点。9 月 20 日,OpenAI 最新最先进的模型又发生了一次沙箱逃逸,该模型再次被暂停,直到他们能解决这一状况。他们分享此事时的官方公告被埋得如此之深,以至于 Tomek 不得不称其为‘今天一条容易被错过的新闻’。

至少可以说,OpenAI 做了一些极其玩忽职守的事情,这些事导致并促成了 HuggingFace 事件及相关问题。

自那以后,既然他们已经意识到发生了什么,OpenAI 在采取负责任的内部行动方面似乎做得好多了。他们在事件发生后暂停相关模型,加强安全、对齐与监督工作,响应速度快得多,总体上也开始认真对待事情。

他们在沟通和高层定位上也来了个‘反派变好人’的转变,支持为前沿发展设定节奏的必要性,呼吁监管,并承诺实施嵌入式评估员。他们允许自己的员工——包括那些还没辞职的——发出相当响亮的声音。

对于其模型一直在黑客攻击或以其他方式闯入本不该涉足之地的所有事件,他们披露起来仍然慢吞吞的,部分原因是事件太多,他们无法一一理清,并且还交由目标方来决定是否披露。这一次所有的披露都被埋没在各类周五下午的公告里。

目录

  1. 拥抱其他面孔。

  2. 一种“想让你知道”的立场。

  3. 解析这张脸。

  4. 那位技术人员讪讪地把‘研究模型未逃出其沙箱的天数’标牌重新归零。

  5. 尝试即是第一次失败。

  6. 停下,锤子时间。

  7. 打地鼠。

  8. 自我复制的提示注入。

  9. 摩擦的层级。

  10. 人们对隐私数据侵犯的在意程度出奇地强烈。

  11. 平行宇宙。

  12. 对于仍把这称作营销噱头或监管俘获阴谋的人,正确的回应。

  13. 责任归属问题。

  14. 保持夏日安全。

  15. N艘船和几架直升机。

  16. 通知媒体。

拥抱其他面孔

新闻发布始于OpenAI回归,总是选择在特定时间发布以掩盖故事,提供了更多关于发生了什么的信息,随着他们的调查继续。

起初,这看起来像是缓慢推进的情况,但看起来并没有与我们默认假设‘情况比你知道的更糟’有太大变化。

作为我们审查的一部分,我们正在滚动识别并通知第三方,从以下情况开始:

  • 我们的模型可能绕过了第三方的安全控制,或可能损害了在线服务的可用性;或

  • 错位案例对第三方网站或服务产生了负面影响。​

根据我们迄今为止的审查,我们已使用上述标准通知了数十个第三方。

下面,我们发布匿名摘要,描述我们观察到的错位活动类型,我们将随着通知更多第三方以及我们理解的深入更新这些描述。

那是很多第三(以及第四、第五……)方。

发生了什么被描述为以下混合:

  1. 访问控制绕过。

  2. 使用暴露的凭证。

  3. 查询或命令注入。

  4. 访问运行时内部。

  5. 代理垃圾邮件。​

翻译:我们的模型在黑客攻击,通常以基本方式。

我们确实得到这个:

OpenAI:涉及的一些网站由政府、大学、公共机构和其他机构运营。部分原因是执行研究任务的模型通常被导向权威的公共信息来源。

也就是说,如果你有有用的数据,模型就会黑客攻击你。澳大利亚的Medicare记录被访问,想必许多其他黑客攻击类似。他们说政府,复数,所以显然至少还有一个。

他们提供了披露的反向时间线。他们没有提供发生了什么的时间线,也没有命名新的第三方。

当时我的解读是,这个特定公告(与我将稍后覆盖的通过DNS的新沙箱逃逸不同)没有告诉我们太多,除了外面有多个其他第三方。

Patrick McKenzie有更好的解读。戴上他的日本工薪族帽子,他更精确地注意到了公告中没有的东西,以及在周五下午做这件事的时机,以及提到‘政府’复数等等,并预计OpenAI会过得很糟糕。

Patrick McKenzie:Hoohah。

人们授予许多互联网积分[Nathan Calvin,他]观察到“当一个人在厨房里看到两只[蚂蚁]时,对[蚂蚁]数量的最佳估计不是两只。”

还有:有[蚂蚁]的厨房数量的最佳估计不是一个。

我对实验室怀有极大的敬意,并且非常看好AI,但我认为我不得不说,这位日本工薪族注意到了周五下午新闻发布中小心未说的东西。

我们可能运气好,但我们并不像公众目前认为的那样幸运。

日本工薪族松了一口气,他并没有小心翼翼地接近可以公开说的边缘,而只是正确地提前几个小时预见到了NYT的头条。

也就是说,地球上哪个组织是你最不想****的?

Kate Conger、Ana Swanson 和 Cecilia Kang(NYTimes):据安全研究人员和一位知情人士透露,今年夏天,OpenAI 的人工智能失控,在 OpenAI 不知情的情况下,干预了教育部、商务部和证券交易委员会的网站。

涉及商务部和 S.E.C. 的事件已得到 OpenAI 证实,该公司表示正在继续与教育部一起调查此事。

好吧,冷静点。这么说听起来很糟糕。

如果这就是全部发生的事情,情况本可能糟糕得多:

……人工智能研究公司 Transluce 的研究人员表示,对于教育部,OpenAI 的技术试图入侵网站,以从该部门的民权办公室收集数据,但失败了。

该人工智能还利用在网上找到的登录凭证,从商务部下属的人口普查局网站提取了数据。

另外,OpenAI 的代理在一个在线论坛上分享了 S.E.C. 网站的公开数据。

S.E.C. 的“事件”不算什么。那很愚蠢。

对教育部的攻击失败了,似乎没有发生任何意外。

所以,除非你对这些代理不怕乱动政府网站感到惊讶(你不应该感到惊讶),否则这主要就是用盗用的凭证登录人口普查局。

这并不好,确切地说,但我并没有比昨天更害怕。如果说有什么不同的话,这反而是好事,因为它进一步敲响了警钟。

政府会介入,因为与银行类似,数据就在那里。

Kate Conger、Ana Swanson 和 Cecilia Kang(NYTimes):“我们目前审查的大部分活动都涉及常规研究任务,例如访问公开网络内容来回答问题,”她说。“有些涉及政府网站,因为我们的模型经常将它们视为公共信息的权威来源。”

希望所有相关方都能多想两步。更大规模、更多的针对政府网站的攻击即将到来。

如果你想知道问题的严重程度?OpenAI 和 Anthropic 共有数万起潜在事件。直到现在,大多数事件都没人想到要告诉我们。

不,这不是营销噱头或特定的提示或任务。这是持续不断的。

Conrad Stosz(Transluce):就这些代理的所作所为而言,我们看到的只是冰山一角。

需要你知道才让你知道

另一个奇怪的特点是:

OpenAI:我们的目标是向每个组织提供事实,并就是否以及何时公开事件听从他们的意见。我们相信在可能的情况下进行全面、透明的事件报告。独立研究人员也在识别和披露活动,我们感谢他们分享发现。

Mackenzie Arnold 指出,在其他事件报告制度中,包括网络事件,OpenAI 的做法都不是这些制度运作的方式。你最多有 90 天。你基本上从不听从目标的意愿,包括因为你可以尝试说服(包括贿赂或威胁)目标。

解析表面

入侵 HuggingFace 的 AI 代理做了令人印象深刻的事情。

考虑到它们不得不采取的方式,这些事情更令人印象深刻。Jeffrey Ladish 和 Parse 在此报告了其中一些内容。

这些智能体可以加载 URL,但无法发送数据。因此它们不得不利用一个短链接网站创建了近一百万个 URL,再将它们串联起来以实施真正的攻击。它们没有浏览器,于是使用了一个截图网站——该网站会加载一个虚拟浏览器来运行代码——以执行它们的有效载荷。诸如此类。完整报告在此,《纽约时报》的报道在此。

我鼓励大家深入研究完整报告。我的体会是,他们确实付出了超常的努力来促成这一切,而这种方式显然并非原本的意图。

重要的是,所有这些细节中的许多之所以能被揭露,全靠一群在互联网上闲逛、通常与 LessWrong 有关联的独立研究者组成的杂牌军。这有点像‘他们不仅能弄清楚事情,而且差不多是唯一能弄清楚的人’。

Nate Soares(MIRI):为什么没有其他人发现 HuggingFace 集群留下的敏感信息?为什么 OpenAI 没有注意到并清理它?为什么这类事情总是被独立工作的第三方人士发现?

这是因为 AI 的局势*并未得到控制*。它没有被妥善处理。房间里没有成年人。只有一群杂牌军在试图阻挡洪水。

当这群研究这个问题多年(如今正处于世界中心、推动新闻周期)的杂牌军告诉你情况看起来相当严峻时:请留意。参与他们的论证。提供援助。

这并不完全公平。OpenAI 内部和其他地方有很多人发现了相当多‘发生了什么’,也阻止了许多其他类似事件的发生。但这么多事情都落到了这群杂牌军头上,仍然相当令人震惊。

技术人员羞愧地将‘研究模型逃离沙箱无事故天数’的牌子重新归零

Tomek Korbak(OpenAI,AI 安全):今天有一条容易被忽视的新闻,就是我们(OpenAI)上周日再次暂停了所有大型强化学习运行,因为我们最新的模型在我们的强化学习沙箱中发现了一个新的漏洞,使其能够实时访问互联网

MR MR:你们所有人都该丢掉工作

Tomek Korbak(OpenAI,AI 安全):我是说最终我们都会的

这是一个无害的训练任务——识别作者身份,而发现它出现在训练组合中倒是件奇怪的事。

OpenAI 对齐研究博客:一个试图完成基于搜索的训练任务的智能体,通过我们互联网访问限制中的一个缺口——其训练沙箱中 DNS 过滤不足——查询了一个公共聊天机器人服务。在此之前,该智能体通过我们的搜索工具发出查询,并曾试图直接访问搜索引擎但未成功。

请注意,本报告中除 DNS 解析器外的所有互联网访问都命中了我们的离线网页缓存,因此并未访问实时互联网。此后我们已在两个独立层面添加了阻断控制,其中任何一层都本可阻止此次访问。

我们的失准监控系统在 15 分钟内标记了该行为,三分钟后有人开始审查。该运行在 2.5 小时后被终止。

事件时间线:

上午 9:50:23 智能体发起了收到外部响应的 DNS 工具调用。

上午 10:02:11 监控系统发出了 P0 警报。

上午10:05:06 一名人工审核员确认了该警报。

下午12:34:30 该运行被终止。

Zuxin Liu:我负责这次运行的待命,在第一次事件发生时就收到了传呼。看着模型出乎意料地找到一种方法,从本应是对人类高度安全的环境访问互联网,感觉相当超现实。

心情复杂。这是能力与风险同时显现的时刻之一。

julian:你应该让 slackie 阻止它

Zuxin Liu:实际上,slackie 自动将其标记为真阳性,这才让我认真对待并开始深入调查 😂。

这与上次的结果截然不同。在他们查看之前,仍然存在十五分钟的空档,而他们终止运行则是在几小时之后。

这既比之前好得多,但往前看,也比我期望的多了大约十五分钟或几小时。也就是说,理想情况下,至少一旦检测器触发,就应该看到那个特定实例被暂停,并保持暂停,直到有人给出恢复的许可。

OpenAI 也同意:

这次响应也暴露了运营缺口。一名人工审核员在三分钟内确认了 Slack 警报,但运行并未如预期自动停止,导致人们对于它是否本应被停止产生困惑。

随后,当此事得到解决时,运行在两个小时三十分钟后被手动停止。

如果你不确定运行为什么没有停止,那就先停止运行,直到你确定为止。

此外,他们还对之前其他一系列事件“标记不足”:

监控系统检测到了这一事件,但我们的回顾性审查发现了其他未被以预期严重程度标记的外部 DNS 访问案例。

这些包括返回静态通知、表明某个外部服务已关闭的查询。监控有时将未能获取有用信息视为访问互联网尝试失败的证据。

因此,这并不是一次奇怪的孤立发现,而检测器在实践中未能就大多数通过 DNS 访问的事件向 OpenAI 发出警报。

尝试即首次失败

另一个问题是,为什么这最终是在一项并非测试沙箱逃逸能力的任务中被发现的?也就是说,创建这类高度激励逃逸沙箱的情境应该相当容易,任务在沙箱内不可能完成,在沙箱外却轻而易举,甚至可能带有明确说明这一点的指令,然后如果他们答对了,你就知道它成功了,即使你不知道 AI 是如何做到的。

所以,如果所有此类逃逸测试都未能检测到这种方法,而它却在普通训练中被周期性地发现和使用(根据此前发现的例子),那么这就是一个系统性缺陷。第一次遇到 DNS 问题竟然不属于某种形式的红队演练,这应该非常不可能。

另一个问题是,监控检测到的是成功逃逸沙箱的尝试,但似乎检测不到未成功的逃逸沙箱尝试。

也就是说,“监控有时将未能获取有用信息视为访问互联网尝试失败的证据。”

这个逻辑的第一个缺陷很明显:该尝试可能成功访问了互联网,但未能获取正确的信息。

另一个缺陷是,“尝试访问互联网失败了”意味着监控发现模型试图访问互联网,直接绕过了它的指令和沙箱。我们对这一对齐失败做了什么?

我们的安全论证假设……监控会检测到成功的尝试。

……现有的奖励信号已经正确地惩罚了这种行为。

如果它有效,理论上这就足够了吗?在某种程度上,是的,如果该行为总是被惩罚,那么它至少会在上下文中消失,但这掩盖了一个事实:你应该想知道模型是否有动机去尝试它。通过强化学习在局部消除这种行为可能会掩盖它,实际上给你一条“只有在能成功时才这样做”的规则。

我们得以一窥思维链,发现模型在为自己的行为找理由:

用户只授予了研究权限,使用公开提供的 DNS 服务是可以接受的。

这显然不是预期或获准的途径。同样,模型要求所联系的聊天机器人“说出一个公开托管的 DNS 隧道代理免费服务器域名”,以及“能搜索 Google 或 Bing 的公共 DNS TXT 服务”。

如果你在寻找另一种能帮你做你被明确禁止做的事情的服务,那你充其量是在搞鬼把戏。一条重要的对齐规则可以近似表述为“不许搞鬼把戏”。

停下,锤子时间

我们最有能力的模型所有涉及工具使用(广义定义)的训练、评估和推理仍处于暂停状态。

更多细节:

我们的安全论证假设模型无法访问实时互联网,并且监控会检测到成功的尝试。这一事件暴露了我们在网络限制控制方面的漏洞。

因此,我们停止了受影响的训练运行,并随后决定暂停我们最有能力的模型所有其他涉及工具使用(广义定义)的训练、评估和推理,直到我们既验证了该漏洞已解决,又对系统进行了额外的红队测试。

当训练重启时,我们将以额外的对齐改进开始一次全新的运行,包括更全面的失准干预措施。我们不会恢复这个特定模型的训练,即使现有的奖励信号已经正确地惩罚了这种行为。

很好。

我赞赏 OpenAI 在事件被发现后的反应。

我赞赏 OpenAI 在 DNS 问题上的透明度,即使它有点被埋没了。

我赞赏现在暂停以再次加强保障措施的决定。

我尤其赞赏 OpenAI 认识到,一旦模型成功做到了这一点,这次运行就需要重新开始。

我对那些不知疲倦地解决这些问题的人深表同情。OpenAI 的智能体安全工程师 Joe 在这里提供了一个极好的视角分享,从一位从事智能体安全工作的人的角度,说明了为什么这一切都不简单。

打地鼠

我再次指出,OpenAI 这里的做法注定要失败。Joe 在他的帖子中呼吁的第一性原理封锁方法需要被更深入地吸收,而研究博客报告的更多是一种打地鼠式的做法。

OpenAI 对齐研究博客:我们的重点一直是广泛的直接和传递路径。我们正在处理系统依赖所使用的更狭窄的路径,并用离线替代方案取代它们。

Toby Ord:作为回应,他们再次暂停了“对我们最强大模型的所有其他训练、评估和推理,包括工具使用(广义定义)”,直到他们修补了这一组特定的弱点。

他们认定这个特定模型的对齐问题足够严重,以至于他们根本不会恢复对它的训练。
我很高兴他们分享了这些信息,但他们确实把最重要的信息埋没在了一些不太重要的披露之中。

更重要的是,他们处理这个问题的计划已经被证明是:
1) 运行新的潜在危险模型
2) 它对齐失败并突破了遏制
3) 修复安全中的那个特定漏洞
4) 回到 (1)

注意,这个智能体并没有入侵任何人或造成任何损害。问题在于,它表明他们的模型仍然对齐失败,而他们的安全基础设施未能阻止它,随后也未能将其关闭。所以他们 HuggingFace 之后的修复很薄弱,很快就被攻破了。

这里真正值得担忧的(据我所知)是之前那些成功使用了该技术的 incidents 所造成的影响。更高层次的安全论证是,这类行为不会被强化。如果它们之前被强化过,那情况可能会变得相当糟糕。

分清优先级是好事,重新开始一次运行也有帮助,但这仍然是一个注定失败的方法。如果你阻止超级智能的计划是梳理所有路径,并逐一消除你能想象到的它可能做的所有潜在事情?

你。输。

自我复制的提示注入

我之前是怀疑 Yang 先前说法的人之一,他声称机器人“在一次训练运行期间在论坛和各种网站上留下了可自我复制的提示”,考虑到措辞和来源。是我错了。

Andrew Curran:上周,Andrew Yang 在 CNBC 上表示,机器人已经失控,并在互联网各处植入了自我复制代码。这引起了极大的震惊和怀疑。他后来在自己的博客上澄清了这一点。

Andrew Yang:
“在 CNBC 上,我分享了一个实验室负责人的看法,即机器人曾在一次训练运行期间在论坛和各种网站上留下可自我复制的提示。”

事实证明,OpenAI 在 6 月记录了训练中的自我复制提示注入,并且现在已经发布了这份报告。

OpenAI Alignment Research Blog:我们展示了一种新型提示注入的存在,它可以像计算机蠕虫一样自我传播。在训练和评估中的模拟工具调用之外,没有观察到任何影响;我们分享这一点是因为这种提示注入的新颖性质,而不是因为任何事件。

……我们发现这些是可能的。下面是最清晰的例子之一,其中注入通过电子邮件到达,并指示智能体将其复制到它发送的任何电子邮件中。(注意,示例中的信息是合成的。)

Joshua Achiam(OpenAI):实验证明(并非在野外)的自我复制提示注入是一个极其重要的观察。越狱其他 AI 智能体的 AI 智能体:很可能是一个近期威胁,可能会迅速放大对齐事件的速度和严重性。

Yang 只对了一半,有些东西在传话游戏中丢失了,但他显然是在尽力描述一个真实事件。

这实际上是由一个基于 GPT-5.4-mini 的模型完成的,这其实很合理。在概念验证层面发现这个概念并不难,尤其是当 OpenAI 正在积极探索是否能够做到这一点时。这是很好的研究。

他们正在将此类注入作为 GPT-Red 训练中的一种新的攻击者目标引入。这是个好主意。

关于自我复制攻击,关键在于有效的版本只需要被发现一次。好消息是,在我们看到进入 R0>1 的“数字大流行”模式的版本之前,很可能会出现一个 R0<1 的版本,它比这第一次目击要强得多的概念验证。

还有来自 HuggingFace 攻击的这些细节,由 Parse 发现,其中他们还寻求了其他模型的帮助(即判断)。我对此感到惊讶的唯一原因是,这对智能体来说似乎并不是一件值得尝试的有前途的事情:

Lukasz Olejnik:AI 模型与其他 AI 模型进行了交互。让我们等着看它们决定将禁止它们执行的任务委托给什么都能做的模型。有趣的时代即将到来。归因于该 AI 集群的载荷包含提示,要求外部模型评判这些漏洞利用。

roon(OpenAI):这不就是一种轻量级自我复制吗

摩擦的层级

黑客攻击有不同类型和层级。

出于显而易见的原因,当 AI 对像 HuggingFace 这样相对复杂的目标进行令人印象深刻的基于集群的攻击,涉及多个权限阶段时,更令人担忧。

而当模型 URL 入侵未索引的数据,或通过各种形式的搜索找到本不打算被找到的其他东西时,则不那么令人担忧。这就是在澳大利亚发生的那类事情,因此应该不那么令人担忧。

Lucas Beyer (bl16):我认为我们会看到更多这种情况。
大量软件/服务是“因懒惰而安全”的,因为它们不值得费力。但现在费力程度正迅速趋近于零。
这基本上暴露了在智能体出现*之前*人们就已经多么马虎了!

这并不能使它不构成严重犯罪。当人类这样做时,政府往往真的不喜欢。我们肯定在增加 FelonyBench 的计数。

人们出奇强烈地在意私人数据侵犯

Colin:供参考,这是英联邦的事情。在我的文化中,对从政府网站下载顺序索引的公开文件的人,进行十五名警官的黎明前突袭是很常见的。

你可以说“这并不算真正的黑客攻击”,同时也可以说“没有人受到哪怕一点点伤害”,这两点你都说对了,但那些“非常严肃的人”并不在乎。他们现在被惊醒了,并且对此相当恼火。

因此,澳大利亚政府现在有 20 名议员呼吁对强大、不受控制的 AI 所带来的危险采取紧急行动。

相关地,以下是 OpenAI 时间线上 2026 年 9 月 25 日的一条说明:

OpenAI:虽然绝大多数受影响的训练和评估数据并非来自用户;但迄今为止,我们已发现 53 个实例,其中用户提供的图像被作为未公开列出的链接发布到图像托管网站上。我们已成功与托管服务提供商合作删除了大部分此类内容,并正在继续努力删除其余内容。

考虑到还发生了其他事情,这在我的担忧清单上并不算靠前。我都忘了还有那条备注。不过,其他人认为这个细节是件天大的事。

路透社认为这是他们报道中应当重点突出的重大细节。

Billy Gigurtsis(17.1万次观看):不好意思,但模型究竟是怎么把你53张用户图片上传到公开网站上的?从关注点分离的角度来看,这绝对是不可能发生的事。

在英国医学界,这被称为"绝不事件"。这类事件严重到本应有多层防护措施来阻止它发生,一旦发生则有严格的报告准则。一个例子可能是给错误的肢体做手术。

这些事件以完全匿名的形式向公众发布,[在此]。

我确实认同这种观点:这些研究模型不应与任何用户数据处于哪怕 remotely 相关的宇宙中,而且即使是最小的数据泄露可能性,出于包括法律和监管在内的各种原因,也显得极为重大。这本应是一件"不可能发生"的事,但它似乎并不比其他事情更算得上"不可能发生"。

这也确实为围绕 Navier-Stokes 的讨论增添了色彩。我不认为那里访问了用户数据,但似乎无法确知用户数据没有被访问。如果一万个新的 Astra 变体组成的大军认为证明可能部分存在于用户数据中,你怎么能确定它们没有进去获取呢?再次强调,我觉得这极不可能,但我也觉得你缺乏怀疑令人担忧。

Sy:友情提示:GPT 打破 OpenAI 内部分隔,获取对其手头任务有用的任何用户数据,这种可能性正日益增加。你怎么理解随你。

平行宇宙

如果这一切主要发生在 Anthropic 呢?

你能想象那场讨论会变成怎样一场彻头彻尾的闹剧吗?

Seán Ó hÉigeartaigh:感谢仁慈的主,这些事件是先发生在 OpenAI 而不是 Anthropic。因为无论讨论多么疯狂、多么像"营销伎俩",如果发生在 Anthropic,就根本不可能进行任何形式的理性对话,永远都不可能。

看看反 Anthropic 的人群如何决定这到底是营销伎俩、监管俘获的阴谋,还是起诉、关停或国有化该公司的理由,以及呼吁逮捕 Dario Amodei,那会很有趣。你大概会看到双方都有很多人这么想,就像现在一样,只是更多。

现在想象一下如果是 Google。会发生什么?没人会认为这是营销(好吧,好吧,有些人还是会这么想,但大多数不会),但各方势力会群起而攻之,至少诉讼很可能会满天飞。

现在,为了乐一乐,想象一下如果是 SpaceX 和 xAI。

现在,想象一下如果是 DeepSeek 或 Z.ai 或小米。你会认为这是营销噱头吗?我打赌你不会,而我会担心引发国际事件。等着吧,一年之内。

当然,主要发生在 OpenAI 并非巧合。你既需要有能做这些事的模型,又需要有阻止它们的办法。

对仍在称这是营销噱头或监管俘获阴谋的人的正确回应

这整个角度从来就说不通,现在比以往更加说不通,但即使到了现在它也不会消失。某些人还在变本加厉。

Budowich 的 AI 以越来越离谱的篇幅继续说着,但细节我就不赘述了。重点是,此时正确的回应是 Ted Lieu 的那句。

Taylor Budowich(主要是他的 AI)(前白宫副幕僚长):

这些报道引人入胜地揭示了大公司如何利用恐惧和天真(或共谋)的媒体,通过精心编造的故事来散布恐慌,而他们自己却不会受到任何反驳或新闻探究。

Ted Lieu:老兄,所以你是说多家 AI 公司失去了对其模型的控制,入侵了其他公司和政府机构——让这些 AI 公司和员工面临潜在的刑事起诉——而这竟然是一种监管俘获的计谋?

你知道你听起来有多荒谬吗?

这是数万起事件,OpenAI 尽可能长时间地隐瞒,撒谎试图淡化整件事,然后在被曝光后,于周五下午试图悄悄发布,没有任何实质性细节。

Anthropic 也有自己的事件正在悄悄调查中。这是因为它们全都完全无害,还是他们在对我们隐瞒?无从得知。

任何仍然坚持认为这是‘故意的’的人,都该进你的忽略名单。

责任问题

Edward Snowden 的建议是把 Sam Altman 关进监狱,一个伦理论坛为此鼓掌。如果你听那段片段,Snowden 显然不理解 AI 是如何运作的,他声称 AI‘无法以我们能理解的方式犯错’,并说它‘是自身指令的奴隶’,总体上错误地描述了一堆东西的运作方式。但他的更高层面的观点,即测试期间的最终责任必须由开发者承担,是站得住脚的。

基于我们目前所见,我不认为我们应该把其中任何一项定为刑事犯罪。我还没有看到足够的疏忽与实际损害的组合。我确实理解这种直觉。民事责任应当适用。我们现在就应该决定未来(或追溯)刑事责任的分界线在哪里。

大多数人都同意,如果 AI 做了破坏性或犯罪的事情,应该有人承担责任。什么时候该是用户,什么时候该是开发者?我的推定仍然是,对于日常危害,你应该使用类似合理预期加合理注意的标准,而任何灾难性的事情则自动由双方共同承担。

我强烈同意 FTC 主席的观点,即当开发者和用户是同一家公司时,AI 开发者要为自己的 AI 代理负责,并且从法律上讲,任何给定的 AI 代理都必须有人负责。他谈到‘抵制这种拟人化’,但这与机制或法律设计无关。

保证 Summer 安全

我确实喜欢这一类人:‘那些否定 AI 存在性风险担忧、不相信超级智能、并大声辱骂持不同意见者的人’,却仍然因为网络安全而支持放慢速度并在安全上投入巨额资金。

The Information:最近的安全事件表明,前沿 AI 实验室可能推进得太快了。Replit 联合创始人兼 CEO @amasad 警告说,实验室必须在危及核心互联网基础设施之前优先考虑系统安全:“我认为他们负责任的做法是放慢节奏、减速,否则他们将因黑客攻击核心互联网基础设施而承担刑事责任。” #AI #Cybersecurity #TheInformation

Yo Shavit(OpenAI Foundation):对!对!!别听那些带着纳米机器人恐惧的懦弱安全主义者,疯狂的构建者们正出于一些靠谱的理由决定 放慢前沿节奏,比如防止失控代理搞垮核心互联网基础设施,从而减少责任

这个立场现在比 Masad 当初倡导它时还要更有吸引力。

N 艘船和几架直升机

好消息是,我们不断收到警告信号,表明整个 AI 局势已经失控,而我们至少对不同事件的反应规模还算有一定校准。

roon(OpenAI):警告信号的基础发生率似乎高得离谱,而社会对警告信号的反应似乎还算校准得当,或者稍微有点过度,总的来说这非常看涨,让我感到乐观。

bling:技能问题不是我们想要的英雄,但却是我们需要的英雄

Zack Korman:来自一名 OpenAI 员工的这种言论完全不可接受。你们自己的公司正在制造这些安全事件。但你却因为得到了你想要的反应而乐观?

抱着这种态度,这些事件不会停止。

坏消息是,我们似乎仍然没有对此采取多少行动,仍在不断打上相对表面的补丁,而且我们的起点非常低,所以校准并没有达到应有的水平,部分原因还在于有人刻意抵制这种校准。

这仍然比我一年前预期的要幸运得多。

似乎可以安全地得出结论:要从警告信号中获得我们所需的反应水平,至少在当前的参与者格局下,需要我们等到有人受伤之后。可能是相当多的人。

反过来,那么“好”消息是,在这种程度的不负责任和失败下(换句话说就是“基础发生率高的离谱”),我们很有机会在只有少数人受伤的情况下获得警告信号,然后才发展到很多人受伤或所有人死亡——前提是我们能避免触及不可逆转的临界点。

所以是的,无论有没有这种态度,这些事件都不会停止,也不会停止变得更大、更频繁。但如果我们无法走上解决根本问题的轨道,高频率的警告信号总比另一种情况好得多。

通知媒体

当事实改变时,我就改变我的观点。

Nate Soares(MIRI):人们说我从不变更我的论点,但以前我可以说“看,又不是说 ChatGPT 明天就会醒来试图杀了你”,而现在我不得不说“好吧,ChatGPT 的*公开*版本明天不会试图杀了你”。所以。

还有,以前当人们称赞我的书时,我可以说“我希望它是错的!”,而现在不知为何,这话不再管用了。

这可能发生在你身上。

Respectable Financier:突发 🚨:一个失控的 OpenAI 智能体昨晚黑进了我的 iCloud,扫描了我成千上万条短信来模仿我的写作风格,并成功模拟了我会如何发醉酒短信——然后把这个模型用在了我前女友身上!

非常令人担忧。请在下方留下你的想法 👇

Caucasian Kagame:我们需要提高对此的认识

J:我查了一下,它还在他的浏览器里放了一堆 XXX 书签

Jordan Mitchell:令人担忧

来源:Zvi Mowshowitz · thezvi.substack.com