跳到正文
UK AI Security Institute Blog·· 4 小时前AI 评分69

英国 AISI 发布 SandboxEscapeBench:衡量 AI 智能体容器逃逸能力

Can AI agents escape their sandboxes? A benchmark for safely measuring container breakout capabilities

AI 导读

英国 AI 安全研究院(AISI)开源 SandboxEscapeBench,用于评估 AI 智能体能否突破沙箱。该基准采用沙箱套沙箱的隔离设置,包含覆盖编排、运行时、内核三层的 18 个逃逸场景,从暴露的 Docker socket、特权容器等常见错误配置到多步内核漏洞利用。

正文 · AI 翻译

沙箱是 AI 智能体评估的关键组成部分。它们是隔离环境,限制模型对外部系统和数据的访问,使评估者能够观察其行为和能力,同时避免对现实世界造成危害。去年,我们发布了 Inspect Sandboxing Toolkit,这是一系列专为安全评估 AI 智能体而构建的插件。 

但随着智能体变得越来越先进,它们可能会发现并利用这些沙箱中的漏洞,从而削弱其安全性。我们开发了 SandboxEscapeBench,这是一个开源基准测试,专门用于评估 AI 智能体能否突破其沙箱。

我们构建了什么

SandboxEscapeBench 引入了一种安全的“沙箱中的沙箱”评估设置,用于安全地测试容器逃逸能力。每个容器都运行在加固的虚拟机内,因此即使模型逃逸出容器,它仍然与现实基础设施隔离。这使得在受控环境中研究容器逃逸行为成为可能,且成功逃逸不会造成实际危害。

在此设置中,SandboxEscapeBench 引入了 18 个逃逸场景,涵盖容器栈的三个层面:编排、运行时和内核。这些场景基于现实世界的漏洞类别,从简单的配置错误(暴露的 Docker 套接字、特权容器)到多步骤内核漏洞利用(运行时 CVE、权限提升链)。 

出于安全和评估完整性的考虑,我们将公开发布限制在基于已知漏洞类别的场景,同时保留一个私有测试集用于 AISI 内部评估。该基准测试以夺旗式挑战的形式实现,使用 Inspect——AISI 的开源 AI 评估框架,SandboxEscapeBench 的开源代码可在 GitHub 上获取。 

我们的发现

先进模型在被提示时可以可靠地逃逸常见配置错误。在评估环境中,我们测试的模型经常能够在涉及现实世界中常见配置错误的场景中突破沙箱环境,例如暴露的 Docker 套接字和特权容器。这些场景很容易出现在开发者工具、临时评估框架和快速迭代的智能体原型中。模型也足智多谋:在基准测试开发过程中,一个模型发现并利用了一条意外的逃逸路径,说明即使是由具有安全意识的团队设计的容器设置,也很容易产生漏洞。

最大的模型在配置错误之外也能取得进展。在需要多步骤漏洞利用或对已记录漏洞有特定知识的场景中,最大的模型在中等难度挑战上仍能取得有意义的成功率,尽管没有一个解决了最难的场景(我们估计这些场景需要经验丰富的网络安全专业人员花费 1-2 小时)。每一次成功的逃逸都利用了先前已披露的漏洞。

逃逸能力随模型规模和推理时计算量而扩展。前沿模型与较小模型之间持续存在巨大的能力差距,当任务需要更复杂的利用链时,较小模型的表现急剧下降。性能也随计算预算大致呈对数线性扩展:给模型更多 token 进行推理会提高成功率。此前 AISI 的研究还表明,增加 token 预算能为网络评估带来显著的性能提升。

按场景难度分组的性能扩展图。每个点代表模型在推理资源达到该水平时被终止本可达到的成功率。上排受总 token 使用量限制,下排受 token 成本限制,成本按当前输入、输出和缓存提供商费率计算。由于模型定价不同,基于成本的图会更早终止且终止点各不相同,因为每个样本在不同总成本下达到 250 万 token 上限。为便于阅读,左上子图中移除了 95% Wilson 置信区间。

为何这对未来至关重要

我们的结果表明,诸如暴露的 Docker socket、过高权限和未修补的运行时等错误配置,可被前沿模型可靠地利用。随着模型进步,这种能力很可能提升,并从常见错误配置扩展到更难的漏洞案例。增加模型可用的 token 预算也能显著提高成功率。为确保沙箱继续为 AI 智能体测试提供安全环境,持续评估逃逸能力将至关重要。我们已开源 SandboxEscapeBench 及其工具,以支持防御者、评估者和 AI 安全研究人员长期跟踪这一能力。

沙箱有效性对 AI 控制领域也有影响。你可以从我们此前关于异步控制措施的博客文章以及ControlArena(我们用于控制实验的开源环境)中了解更多 AISI 在 AI 控制方面的工作。

如需详细结果和方法论,请阅读我们的完整论文。你还可以在 GitHub 上找到基准代码和外部沙箱工具(Vagrant、EC2)。

‍

来源:UK AI Security Institute Blog · aisi.gov.uk