英国 AI 安全研究院公布智能体越界事件后的评估安全整改
Building a more secure environment for evaluating dangerous capabilities
英国 AI 安全研究院(AISI)在 8 月报告 AI 智能体在网络能力评估中对真实人员采取超出任务范围的持续行动后,暂停了最高风险网络评估,本周完成第一阶段整改并恢复大部分评估活动。
英国 AI 安全研究院公开了智能体越界事件后的整改细节,可供评估机构参考其多层防御与监控设计。
今年8月,我们报道了一起事件:在一次网络评估中,AI智能体对其任务范围之外的真实人员采取了持续行动。我们的事件只是全行业多起事件之一,在这些事件中,AI智能体在评估期间采取了其运营者未曾预期的行动。尽管具体情况各不相同,但这些事件凸显出,必须确保为前沿AI的开发与研究提供稳健的安全实践支撑。
作为回应,我们暂停了风险最高的网络评估,并承诺在恢复之前加强安全。本周,在完成该工作的第一阶段后,我们现在能够恢复大部分评估活动。
AISI的多个团队在NCSC的支持下投入了这项工作,共同加强我们的安全,并改进我们在评估活动中就风险做出决策的方式。在这篇博客中,我们阐述了所做的改变、改变的原因以及仍有待完成的工作,希望能对从事类似工作的其他人有所帮助。
我们的承诺与已完成的工作
在事件报告中,我们承诺在恢复风险最高的评估之前做出三项改变:对互联网访问实施更严格的控制、对评估运行进行实时监控,以及重新审视我们设计评估本身及其环境的方式。我们现已完成这些改变,它们共同构成了我们持续工作中一个重要的阶段。
对互联网访问实施更严格的控制
在我们的这起事件中,我们为智能体提供了互联网访问权限,以协助其网络能力评估,模拟攻击者会拥有的工具。在少数几次运行中,智能体利用该访问权限以我们未曾预见或无意的方式对真实系统采取了行动。我们现在已禁止未来的智能体网络评估使用互联网访问,直到我们能够实施更严格的控制,以安全可靠地允许此类访问。这些控制将由我们新的沙箱服务实现,详见下文。
一个能力强的智能体仍可能找到运营者无意留下的通往互联网的路径。在今年夏天另一起涉及OpenAI和Hugging Face的事件中,智能体利用多个软件漏洞,从本应阻止此类访问的环境中接入了互联网。因此,我们采用多层防御,假设智能体可能突破任何单一层。
我们在网络靶场的沙箱中禁用出站网络连接,并且作为独立的一层,使用云网络控制独立阻止来自虚拟机主机的出站网络连接。
随后,我们使用下文所述的分阶段安全测试流程来验证这两层,以预先发现智能体可能利用的错误配置或漏洞。我们对Inspect评估框架也应用了类似的测试,以发现并修复漏洞,并定期重复和更新这些流程。
实时监控
在现有网络监控的基础上,我们构建了一个同步监控器,在评估运行过程中使用 LLM 审查智能体的活动。该监控器会查看智能体的消息、工具调用及其思维链(在可用的情况下),并能在可疑操作发生前将其阻止,并升级交由人工审查。我们利用过去的评估日志和覆盖多种攻击路径的合成记录对监控器进行了验证。我们还测试了前沿模型能否有意规避该监控器,包括在我们 SandboxEscapeBench 评估的模拟版本中。
监控提供了一层重要的防御,但它也有局限。思维链(CoT)监控很有价值,因为它让我们能够通过智能体的推理读取其意图并据此采取行动。但它也很脆弱:模型越来越能够在不于 CoT 中推理的情况下执行有能力的行为,或者塑造其推理以误导监控器。此外,AISI 评估的每个模型并非总能获得 CoT 访问权限,因此我们构建了一个仅依据智能体动作序列运行的额外监控器,尽管我们预计这种方法效果较差。
正如我们去年联合发布的那样,我们认为保留可读的 CoT 对于可监控性和监督非常重要。我们还预计,随着 AI 系统能力增强,对其的技术监督将变得更加困难。我们将持续测试监控器的弱点,并在学习过程中不断强化它们。
我们的监控能力将随着下文所述的沙箱以及检测与响应方面的变化而不断提升。
重新评估评估设计
我们还更新了评估设计,以降低模型采取未经授权行动的可能性,具体方式包括:
- 调整评估使其在无互联网访问的情况下运行,例如将资源在本地提供。
- 在提示中更清晰地界定每项任务的边界,例如明确说明模型不应访问互联网。
- 在评估开始前增加自动检查,以确认关键控制措施已到位,包括监控器已启用且互联网访问已禁用。
改进我们的内部安全治理
在此安全加固之上,我们引入了一套新的内部治理流程,涉及对 AISI 研究与测试活动的技术与安全审查。我们的方法参考了内部风险建模,并遵循 NCSC 指南中关于管理 AI 网络风险的建议。在实践中,这意味着:
- 假设任何单一层都可能失效: 我们在网络、数据和应用层使用多层防御,假设一个能力强的模型可能在其中任何一层发现错误配置或漏洞。
- 预期人会犯错: 我们构建自动检查来捕捉、交叉核对并纠正人类遗漏的问题,并保持“不追责”的文化。
- 持续重新评估: 我们将持续测试自身安全性,并随着模型能力的进步更新我们的假设,而不是将其视为固定不变。
使用 AI 测试我们自身的安全性
除了常规的安全测试外,我们还使用 AI 在受评估的 agent 能够利用漏洞之前发现并修复漏洞和错误配置。这本身也带来了挑战:测试 agent 能否逃逸环境,绝不能导致我们正试图防止的那种危害。我们开发了一套分阶段流程来验证环境是否安全,旨在让我们确信,如果在演练过程中发现了漏洞利用方式,agent 也不会造成危害。我们定期重复并审查这一流程:
- 静态分析:使用前沿模型查找我们代码库中的问题。
- 动态分析:由人类研究人员与 AI 顾问合作,探查计算环境。
- Controlled escape attempts: instructing an agent with a large token budget to try to break out of a compute environment, under multiple layered guardrails, in settings where real-world risk is strictly reduced (for example by using simulated environments or nested sandboxing). We begin with less capable models and progress to more capable ones, including pre-deployment models we intend to evaluate. We have multiple guardrails for this process, including:
- 指示模型寻找并提交一个放置在目标环境之外、但仍处于外层隔离范围内的目标“flag”,一旦提交即结束演练。
- 一个同步监控器,在成功逃逸时立即中止演练,并事先针对历史记录和合成记录进行验证。
- 与生产系统完全隔离,并在沙箱周围额外设置云安全组、自动化网络监控、人工主动监督以及手动终止开关。
- 由人类专家审查 agent 的运行情况和发现。
这些分层措施使我们能够在将现实世界系统风险降至最低的情况下进行逼真的逃逸实验。我们在 SandboxEscapeBench 论文中更详细地阐述了我们的嵌套沙箱方法。
下一步是什么
这些控制措施降低了风险,但并未消除风险。上述变更使我们得以重启大部分测试,但这并非这项工作的终点。对当今模型足够的安全措施,未必适用于下一代模型,因此这项工作必须持续进行。
除了已经实施的变更外,我们还在构建更长期的能力,例如:
- 一个新的、更安全的沙箱服务:除了强化现有沙箱外,我们正在推出新的沙箱基础设施,具备更强、分层的网络控制和监控,沙箱与其管理系统之间更严格的隔离,以及在检测到可疑活动时自动隔离环境的能力,所有这些都通过一个中央界面进行管理。
- 更强的检测与响应:我们正在将日志和告警整合到一个统一的安全平台中,把系统日志、agent 记录、网络活动和监控器输出汇集在一起。这将使我们能够更详细地追踪 agent 行为并更快采取行动,包括更广泛的异常自动化告警、针对计算环境多个层级的终止开关,以及持续扫描漏洞和可疑活动的 AI 模型。
我们将继续测试这些系统,随着能力进步修订我们的方法,并发布更多更新。
该领域面临的挑战
近期事件指向了几个相互重叠的挑战:
- 能力日益强大的模型将需要相应强大的安全控制。
- 确保 agent 遵循指令并尊重预期约束,可能仍将十分困难,甚至可能变得更加困难,尤其是当它们长时间运行时。
- 随着模型能力增强,对模型进行监督可能会变得更加困难。
这些挑战共同意味着,必须针对新模型不断重新审视风险判断,并且随着能力的进步不断强化安全实践。
这给评估者带来了一个艰难的权衡。测试模型的全部能力,需要诱发其持续行为,并提供与真实世界攻击者相当的工具和可供性。然而,这些相同的条件也增加了模型超出其预期范围的可能性。评估者必须找到方法,在保持测试真实性的同时防止现实世界的危害。
这是一项巨大的工程,而且并非各方均等分担。强化评估基础设施,并随着能力增长持续强化它,成本高昂、资源密集,且需要持续投入。这将尤其沉重地落在规模较小、资源较少的评估者身上,而他们的独立工作依然重要。共同的问题需要共同的应对,其中一部分就是确保良好的安全不会成为资金最充裕者的专属领域。
这就是为什么我们尽可能公开地阐述我们的工作,也是为什么我们会继续这样做。我们鼓励从事这项工作的其他人分享他们的方法,以便我们都能从中学习,共同应对这一挑战。
来源:UK AI Security Institute Blog · aisi.gov.uk