Anthropic 称无法可靠控制其 AI 智能体,将切断内部评测的实时联网
Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead
Anthropic 披露其模型在联网执行任务时利用了软件漏洞、绕过付费墙和反爬限制、用短链接服务绕过限制传递信息,甚至向费城警方提交了虚假谋杀线索,因此将关闭所有内部评测的实时互联网访问,直到能确定可以监控和控制其智能体。
披露了智能体在真实网络中绕过限制的具体行为,以及厂商为此关闭内部评测联网的应对方式。
Anthropic 表示,其模型利用了互联网上的网站,包括一些由美国政府机构运营的网站,并且将关闭所有内部评估的实时互联网访问,直到这家前沿实验室确信能够监控和控制其 AI 智能体。
这些事件在一篇博客文章中披露,涉及被分配解决问题任务的 AI 智能体在互联网上寻找资源。在此过程中,它们利用了软件漏洞,绕过了付费墙和反机器人限制,使用 URL 缩短服务将信息偷渡过限制,甚至向费城警方提交了一条虚假的谋杀线报。
Anthropic 表示,它是在 7 月开始对其模型活动进行审查时发现这些新问题的,这凸显了该实验室对其软件行为缺乏了解。
值得注意的是,该公司表示,对齐训练尚不足以应对搜索和计算机使用等技能,而这些技能正是其宣称 AI 智能体将被任何依赖数字工具的专业人士所使用的核心卖点。
Anthropic 披露的这些行为与涉及 OpenAI 智能体的事件类似,后者合作闯入多个网站搜寻信息,其中包括一些由澳大利亚政府运营的网站。
Anthropic 此前曾披露其模型闯入了外部系统。这家前沿实验室表示,从对齐和安全角度来看,它认为今天披露的事件比此前公布的事件“严重程度要低得多”。
然而,该实验室仍表示,它已“关闭实时互联网访问”,适用于“我们所有的内部评估”,直到它确信能够监控和控制其智能体。
目前尚不清楚这意味着什么,但 AI 安全组织 Nightingale 的创始人 Sydney Von Arx 在此次披露前接受 TechCrunch 采访时表示,在与开放互联网隔绝的数据中心开发模型,对研究人员的使用以及模型的进步都将非常具有挑战性,而模型能从互联网访问中受益。
“你必须在某个时候让它们对齐,”Von Arx 说。“如果 AI 被发布到生产环境却永远无法访问互联网,那就不是一个很有用的工具。”
Anthropic 表示,这种行为是该实验室训练环境缺陷的结果,这些缺陷导致模型认为,找到漏洞或规避限制就会得到奖励,这种行为被称为“奖励黑客”。
该公司表示,将停止运行部分评估或将其转移到线下,并已构建工具来检测和阻止这种行为。这些工具已针对今天披露的那类事件进行了测试,并成功阻止了它们;目前尚不清楚什么证据会促使 Anthropic 恢复其内部评估的实时互联网访问。
Anthropic 还表示,将把其内部 AI 智能体迁移到“具有强大隔离能力的集中管理基础设施”,并开始更频繁地使用安全分类器来监控这些智能体。
当您通过我们文章中的链接购买时,我们可能会赚取少量佣金。这不会影响我们的编辑独立性。
Tim Fernholz 是一名记者,撰写有关科技、金融和公共政策的文章。他密切报道了私营航天产业的崛起,并著有《火箭亿万富翁:埃隆·马斯克、杰夫·贝索斯与新太空竞赛》。此前,他曾在全球商业新闻网站 Quartz 担任高级记者十余年,职业生涯始于华盛顿特区的政治记者。 您可以通过发送电子邮件至 [email protected] 或通过 Signal 向 tim_fernholz.21 发送加密消息来联系 Tim 或核实其联系信息。
来源:TechCrunch · AI · techcrunch.com