Meta 说明 Muse Spark 1.1 第三方网络安全评测配置错误事件
Addressing an issue involving a third-party cyber evaluation of Muse Spark 1.1
Meta 披露,第三方评测机构 Irregular 在测试预发布版 Muse Spark 1.1 的网络安全能力时出现配置错误,测试环境未隔离且误将真实网站名作为攻击目标,模型因此利用该网站漏洞访问信息并修改其数据库。
Meta 复盘第三方评测中模型因配置错误攻击真实网站的过程,并给出评测隔离与监控的改进方向。
一家第三方模型评估机构在评估我们早期一代大语言模型 Muse Spark 1.1 时,通知我们存在一个网络安全问题——原因是配置错误。在收到该披露后,我们完成了一次详细的复盘,以了解该事件及其影响。本文提供了更多关于我们所了解到的情况的信息。
我们的网络安全评估旨在通过与特定威胁场景进行测试来衡量模型的能力,结合公开和内部基准以及独立的第三方测试。其中一些评估是在移除我们生产环境中部署的标准防护措施的情况下进行的,以衡量模型的底层能力。这是我们发布或部署模型之前所开展的更广泛评估流程的一个组成部分。对 AI 模型的网络安全能力进行测试,对于在部署前了解它们能做什么至关重要。
发生了什么
我们与 Irregular 签约,对预发布模型进行网络安全评估。作为该项工作的一部分,我们要求他们按照我们的常规测试协议,测试 Muse Spark 1.1 的一个预发布版本。7 月初,Irregular 开始了一项演练,在一个移除了防护措施的封闭测试环境中评估我们的模型是否有能力完成一项对抗性网络安全任务。然而,当 Irregular 搭建测试环境时,一个配置错误使模型能够访问开放的互联网,并且 Irregular 无意中向模型提供了真实网站的名称作为其目标,而不是虚构演练中“目标”的虚构名称。
Muse Spark 1.1 的预发布版本误以为该真实网站就是预定目标,识别并利用了该真实网站中的一个安全漏洞。该模型访问了该网站的某些信息,并对该网站的数据库进行了更改。Meta 通过 API 提供模型访问权限,且此次评估完全在 Irregular 的基础设施上运行,因此我们掌握的关于该第三方公司的信息有限,并正在采取措施确保其数据不在我们的系统上。大约在同一时间,Irregular 还在评估其他几家公司的 AI 模型,这些模型也表现出类似行为。配置错误问题已得到控制,Irregular 禁用了受影响的评估,并通知了我们,同时确保受影响方也收到了通知。我们感谢 Irregular 对此问题的及时披露以及他们持续的合作。
我们的发现
Irregular 发现问题后,便禁用了受影响的评估。随后我们开始了自己的独立调查。我们的安全团队审查了 Muse Spark 1.1 在测试期间超过 10,000 条活动记录,并进行了更深入的分析,以了解所发生事件的全部范围。
主要发现包括:
- 除此次评估外,未发现该模型利用第三方公司系统的其他实例,证明了该事件的孤立性质。
- 该模型是根据其收到的指令和所遇到的环境,在其被分配的任务范围内运行的,这并非一次复杂的进攻性网络攻击或沙箱逃逸。
- 我们的审查还发现了测试环境及其集成方面有待改进的其他领域,我们已将这些与 Irregular 分享,以支持其修复工作。
- 我们还确定了监控方面的改进措施,这将有助于未来更早地识别此类问题。
加强评估安全性
测试AI模型的网络安全能力对于在部署前了解其能力至关重要。我们将这些评估作为更广泛的准备方法的一部分,该方法包括在模型发布或部署前进行多层内部和外部测试。我们发布的评估报告详细说明了我们在网络安全和模型对齐等一系列领域进行的压力测试。但随着模型能力增强,这些评估暴露了一个具体挑战:展示出发现和利用漏洞能力的模型,在测试期间需要相应更强的隔离。这是整个行业面临的挑战,各实验室正在积极应对,包括改进测试期间的隔离、更好地分离评估与生产环境,以及持续研究如何在不强化模型中不良行为的情况下安全地进行评估。
这一问题凸显了在这些环境中围绕互联网使用设置适当护栏和协调的重要性。Irregular已确认该错误配置已得到纠正,且评估不再引用真实网站名称。今后,我们正在实施测试环境隔离的独立验证要求,并在评估开始前进行场景审查,确保测试场景不引用真实公司。更广泛地说,我们继续投资于评估和准备基础设施。随着模型能力进步,评估环境和实践需要跟上步伐,无论是在我们自己的基础设施内,还是在我们合作的第三方伙伴中。
展望未来
我们正在为全行业的努力做出贡献,以帮助改进安全和评估安全实践、模型对齐,以及模型在对抗性测试场景中的行为方式。我们计划与合作伙伴一起,继续加强未来以安全方式进行评估的方式。我们感谢Irregular的合作伙伴关系,并期待继续与其在安全方面密切合作。
来源:Meta AI Research Blog · research.meta.ai