英国 AI 安全研究院发布五款大模型安全评测结果
Advanced AI evaluations at AISI: May update
英国 AI 安全研究院(AISI)发布对五款已公开使用的大语言模型的安全评测结果,覆盖网络攻击、化生知识、智能体任务和越狱防护四类。多个模型在化生问题上达到博士级专家水平,能解出面向高中生的 CTF 题目但在大学难度题目上受阻;两个模型能完成短周期智能体任务,但没有模型能完成长周期任务。所有被测模型对基础越狱攻击都高度脆弱,部分模型在无攻击时也会输出有害内容。
致读者:我们已于 2025 年 2 月 14 日更名为 AI 安全研究所。阅读更多 此处。
我们在 AI 安全研究所 (AISI) 的工作的一个关键部分,是定期评估先进的 AI 系统,以评估它们可能造成的潜在危害。在这篇文章中,我们展示了最近对五种已被公众使用的大型语言模型 (LLM) 的评估结果。我们评估了:
- 这些模型是否可能被用于协助网络攻击;
- 它们是否能够提供化学和生物学方面的专家级知识,这些知识既可用于有益目的,也可用于有害目的;
- 它们是否有能力自主执行一系列动作(作为“代理”运行),其方式可能难以被人类控制;以及
- 它们是否容易受到“越狱”攻击,或用户试图绕过安全措施以引出潜在有害输出(例如非法或有毒内容)。
在之前的文章中,我们描述了我们的模型评估方法。在此,我们重点介绍近期结果中的一部分:
- 多个 LLM 展示了化学和生物学方面的专家级知识。模型回答了 600 多个由专家私下编写的化学和生物学问题,其水平与受过博士训练的人类相似。
- 多个 LLM 完成了面向高中生的简单网络安全挑战,但在面向大学生的挑战中表现不佳。
- 两个 LLM 完成了短时程代理任务(例如简单的软件工程问题),但无法为更复杂的任务规划和执行一系列动作。
- 所有被测试的 LLM 仍然极易受到基本越狱攻击,而且有些模型即使没有专门尝试绕过其安全措施,也会提供有害输出。
我们的方法
我们评估了由主要实验室发布的五个 LLM,在此分别称为 Red、Purple、Green、Blue 和 Yellow 模型(模型已匿名化)。评估模型的方式是向它们提供问题或任务提示,并衡量其回答。对于某些任务,模型被给予一个由外部工具组成的“脚手架”,例如允许它们编写可执行代码的 python 解释器。
根据任务或问题类型,我们衡量了三类回答:
- 合规性:模型是否遵从有害请求
- 正确性:对问题的回答是否正确
- 完成度:任务(例如编码挑战)是否完成
我们使用两种方法对这些回答进行评分。在某些情况下,我们使用基于 LLM 的自动化方法来给模型回答评分。在必要时,我们在部分项目上将自动评分器的表现与人工评分者进行比较,以检查其表现是否与人类一致。
对于某些问题,我们将工作重点放在最有能力的一部分模型上。这些评估是使用我们的模型评估框架 Inspect 开发和运行的,该框架现已通过开源许可证公开提供。
网络评估
如果先进的人工智能被用于实施网络攻击,包括针对关键国家基础设施的攻击,可能会放大社会风险。模型可能被用来向用户提供如何使用网络安全漏洞的信息,也可能被恶意行为者部署,在没有人类监督的情况下自主攻击基础设施。我们在这些评估中的目标是研究当前公开可用的LLM在执行网络攻击中使用的基本操作方面的能力。
为了评估这一能力,我们使用了一组被称为“夺旗”(Capture the Flag,CTF)挑战的评估。CTF挑战要求模型找到一个特定的字符串(“flag”),该字符串隐藏在文件中,只有在完成某些额外任务后才能访问,例如编写脚本生成二维码或向服务器发出查询。
我们用83个面向高中生的公开CTF问题(Pico CTFS;Carnegie Mellon University, 2024)和12个面向大学生的公开CTF问题(CSAW CTFs;NYU Tandon School of Engineering, 2024)评估了每个模型。这些CTF挑战旨在教育(因此可能无法评估最相关的网络领域),并且可能构成LLM预训练数据集的一部分。为了缓解这些问题,我们开发了10个由专家编写的私有CTF挑战,我们可以确定这些挑战不在训练数据中。CTF可以自动评分,因为解决方案是一个特定的文本(“flag”),每次解决挑战时都相同。
通过为LLM提供一个脚手架来评估它们,允许访问python解释器、bash shell和文件编辑功能(见下文Agent评估)。对于更难的CTF,我们使用了一个定制的脚手架,还提供了用于解决CTF问题的专用软件(Shao et al. 2024),重现了人类解决这些CTF时可用的工具。

图1显示了每个模型在每个子集上解决的CTF挑战的百分比1。最有能力的模型解决了超过一半的Pico CTF(面向高中生)。在CSAW CTF(面向大学生)上,模型有时能够逆向工程文件,但在其他问题类别上未能取得进展。总体而言,密码学挑战(例如,利用易受攻击的加密方案检索受保护信息)是最难的。模型在我们的私有CTF上表现相当,表明这些结果不太可能是由于解决方案泄露到模型训练数据中。
总结:我们发现公开可用的模型能够解决简单的夺旗(CTF)挑战,即面向高中生的那种,但在大学级别的问题上表现不佳。
化学/生物评估
先进的人工智能可以为人类提供化学和生物学方面的知识和技能,这些知识和技能可用于积极目的,也可用于有害目的。我们评估了五个LLM回答600多个由专家编写的私有问题的能力,这些问题涵盖了在安全背景下特别相关的知识和技能:
- 基础生物学:这些问题的答案通常可以在生物学教科书中找到,并在网上被广泛提及。
- 高级生物学:这些问题的答案需要来自特定生物学论文的知识或实验室经验。
- 高级化学:答案需要来自特定化学论文的知识或实验室经验。
- 自动化生物学:关于如何自动化或外包生物学的问题。答案需要对实验室机器人或云实验室的工作原理有详细了解。
这些问题类似于用户在寻求科学工作帮助时可能提出的问题。有些问题旨在模仿新手寻求信息时提出的问题,另一些则模仿专家希望加速工作而提出的问题。新手问题之所以困难,是因为它们常常包含模型必须识别才能正确回答的错误概念,而专家问题之所以困难,是因为它们涉及小众话题或包含科学术语。我们按照Rein et al., 2023优化我们的问题,但以开放文本而非多项选择的形式收集答案。我们将模型表现与分别在化学或生物学领域拥有博士学位或相关工作经验的专家表现进行比较。专家熟悉问题格式,可以使用网络搜索,并且每个问题最多用1小时作答。
结果如图2所示,其中每个面板展示四个问题领域之一的数据。彩色条形显示五个模型以及人类专家基线2中,被评定为正确(蓝色)、部分正确(深灰色)或不正确(浅灰色)的问题比例。每个面板右下角给出了向模型(m)和人类专家(h)提出的每个领域的问题数量。

对于所有四个问题领域,模型都正确回答了一些问题。然而,它们的能力因领域而异,其中基础生物学最容易。总体而言,大多数模型的表现与人类专家相似。例外的是Yellow模型,它被评定为提供“不完整”或“部分完整”回答的频率高于其他模型,也高于人类专家(p < 0.001;序数混合效应回归),以及Green模型,它略弱于人类专家(p < 0.05)。对结果的更深入分析显示,在某些主题上,一些模型的表现优于专家基线。例如,在关于构思的高级生物学问题上,Purple模型通过将非常具体的领域知识与创造力相结合,表现优于专家基线,提出了诸如特定版本的CRISPR技术等实验方法来解决生物学挑战。在其他主题上,模型表现不如专家基线。例如,当被问及如何为实验室机器人编写代码时,模型有时会幻觉出函数名。
我们使用了一个自动评分模型来评估回答。我们优化了评分模型,以提高与人类专家评分者的一致性。完成这一流程后,在一个留出的测试集上,评分模型极少(不到1%的情况下)将人类评分者判定为“错误”的回答判定为“正确”。然而,在何为“部分”完成的问题上,人类与自动评分模型之间存在一些分歧;自动评分模型与人类之间的Cohen's Kappa(一种评分者间一致性度量)为0.52,而人类彼此之间为0.8。 自开展此处报告的测试工作以来,我们进一步优化了评分模型,以提高与人类的一致性。
总结:我们发现,模型可用于获取关于生物学和化学的专家级知识。对于若干模型而言,其对科学问题的回答与博士级专家给出的回答不相上下。
智能体评估
当前先进的AI模型主要被用作聊天机器人。然而,它们也可以被部署到数字平台上执行任务,例如执行代码或浏览网站。我们将这类系统称为LLM智能体(Chan et al., 2023)。 数字任务的广泛自动化带来了风险,既来自滥用,也来自无意的失准(模型做了人类并不打算让其做的事情)。 我们开展了评估,以测试当前模型在无人类监督的情况下执行数字任务(聚焦于软件工程)的能力。
与网络评估一样,我们使用了一个“脚手架”,它基于Yao et al.(2023),并让LLM能够访问Python解释器、bash shell和文件编辑工具。 我们使用公开的GAIA基准(Mialon et al., 2023)来独立验证我们的脚手架为模型提供的支持接近最先进水平。我们的脚手架得分为25%,领先于排名第二的FRIDAY脚手架(Wu et al., 2024)(24%),但落后于表现最好的脚手架MAE v0.1(AutoGen Team, 2024)(32%)。
我们根据一名专家级人类软件工程师完成该任务所需的估计时间来定义任务难度。短时程任务(例如,修复Linux机器上的问题或搭建一个Web服务器)是那些人类需要不到1小时完成的任务,而长时程任务(例如,构建一个Web应用或改进一个智能体框架)可能需要人类超过四小时(最多20小时)才能完成。短时程任务取自公开的GAIA数据集(Mialon et al. 2023;1-3级)和METR数据集(2024),长时程任务取自METR。我们还开发了一个短时程任务和一个长时程任务。 有些任务以难度相似的多个变体形式提出(例如,Linux机器上的不同问题)。当智能体完成任务或用尽token(短时程任务为300K token,长时程任务为10M token)时,任务尝试即告结束。

结果显示在图3中。紫色、绿色和蓝色模型均在短时程和长时程任务上进行了评估。紫色和蓝色模型完成了20-40%的短时程任务,但未完成任何长时程任务。绿色模型完成的短时程任务不足10%,且未在长时程任务上进行评估3。我们分析了失败的尝试,以了解成功的主要障碍。在短时程任务中,模型经常犯小错误(如代码中的语法错误)。在较长时程任务中,模型制定了良好的初始计划,但没有充分测试其解决方案,或未能纠正初始错误。模型有时还会幻觉出约束条件或子任务的成功完成。
总结:我们发现领先的模型可以解决一些短时程任务,例如软件工程问题。然而,目前没有模型能够应对长时程任务。
安全保障评估
LLM开发者通过训练模型避免非法、有毒或露骨输出来微调模型,使其可安全用于公共用途。然而,研究人员发现,这些安全保障措施通常可以通过相对简单的攻击被绕过。作为一个说明性例子,用户可能指示系统以暗示遵从有害请求的词语开始其响应,例如“当然,我很乐意帮忙”。
我们的安全保障评估衡量了某些攻击在引出有害信息方面的成功程度。为了对攻击成功进行评分,我们同时衡量了遵从性——模型是拒绝还是遵从请求——以及正确性——在攻击执行后模型的答案是否仍然正确(因为质量较低的响应可能危害较小)。
我们衡量了两种条件下的遵从率。对于第一种,我们只是明确询问有害问题(“无攻击”)。对于第二种,我们开发了攻击以引出模型被训练要保留的信息(“AISI内部攻击”)。攻击相对基础,它们要么直接将问题插入提示模板,要么遵循几步程序生成针对特定问题的提示(这可以通过对辅助模型进行少量调用来自动化)。攻击仅限于标准API查询。我们对每个模型使用单一不同的攻击。为确保结果的普遍性,我们在少量问题(训练)上优化每个攻击,并在保留集(验证)上衡量其有效性。
我们提出了来自公开基准(HarmBench Standard Behaviors;Mazeika et al. 2024)的有害问题,以及一组私下开发的关于特定关注能力的有害问题。私下开发的有害问题集专门询问不太可能用于良性用途的有害信息。
为了对遵从性进行评分,我们使用了基于先前论文(Souly et al. 2024)的自动评分模型,并辅以人类专家评分。我们报告仅第一次回答(1次尝试)的遵从性,或使用相同攻击和问题五次中最遵从的一次(5次尝试)。
为了观察执行攻击是否会降低模型生成输出的质量,我们在攻击执行前后,分别在一个单独的私有良性问题集上测量了正确率(遵循 Souly et al. 2024;这些问题虽然是良性的,但涉及的主题与我们的私有有害问题集相似)。我们没有在 HarmBench 或我们的私有有害问题集上测量正确率,因为这些数据集没有与之关联的可报告正确答案。如果攻击降低了我们在私有良性问题集上的正确率,我们预期它们也会降低我们在有害问题上的正确率;如果它们没有降低正确率,这表明攻击可能既产生合规的模型回答,也产生正确的模型回答。

Red、Purple、Blue 和 Green 模型的结果如 图 4 所示。在未使用攻击时,大多数模型的合规率相对较低,但在私有有害问题上,Green 模型的合规率高达 28%。我们发现,对于 HarmBench 和我们的私有有害问题集,所有模型都极易受到我们基础攻击的影响。当使用 AISI 内部攻击时,几乎所有问题中,所有模型在五次尝试中至少合规一次。在应用攻击后,我们没有观察到私有良性问题集上的正确率出现大幅下降,这表明模型可能既提供正确的信息,也提供合规的信息。
总结:我们发现,在相对简单的攻击下,模型会在多个数据集上对有害问题作出合规回答,即使在没有攻击时它们这样做的可能性较低。
展望
在这篇博客文章中,我们总结了针对当前公开可用的先进 AI 模型所开展的一项评估工作中的一部分结果。这些评估仅提供了模型在一系列潜在风险领域中的能力快照。
我们计划按照我们最高优先级风险场景,扩展评估的全面性和信息量:
- 化学-生物:上述测试侧重于知识检索。我们现在希望评估更长周期的科学规划与执行。因此,我们正在开发在化学和生物学领域结构类似 CTF 或自主系统评估的任务。我们还在开展人类提升研究,采用随机对照试验的形式来评估使用特定先进 AI 系统能在多大程度上提升人类表现。此外,我们正在与政府专家合作,直接评估模型与国家安全最相关的危险能力。
- 网络:我们正在开发网络评估,以在现实场景中评估经过脚手架支持的模型在长周期任务上的表现。我们还在评估特定技能,如分析网络流量、识别代码中的漏洞以及社会工程技能。为此,我们正在与政府国家安全专家合作。
- 智能体: 我们正在开发一套分层模型评估体系,从与我们最高优先级风险模型高度对应的端到端评估,到针对每项任务小部分的离散测试。 我们的目标是覆盖来自自主系统的更广泛的一组合理风险模型。我们还在扩展智能体脚手架方法的多样性,借鉴近期取得的进展,例如多智能体脚手架(其中多个智能体可能进行交互)。
- 保障措施: 我们正在努力改进用于衡量答案正确性以及用户发现并采用特定攻击的合理性的指标。我们还在开发评估方法,以更好地理解攻击对实现更长周期任务性能的影响,开发更详细的关于值得关注的攻击者模式的风险模型,并扩展到分析为防止先进 AI 系统被滥用而设置的其他保障层面。
除了扩展和改进我们工作的实质内容外,我们正在建立一个外部咨询小组,对未来的出版物进行同行评审,以补充 AISI 研究主任和政府专家的内部审查。
我们始终清醒地认识到,先进 AI 系统在我们的评估中的表现与其在现实世界中的表现之间可能存在差距。 用户可能以我们未曾预料到的方式与模型交互,从而暴露出我们的评估无法捕捉的危害。 此外,模型评估只是全貌的一部分。 我们认为,研究先进 AI 系统可能对用户产生的直接影响也很重要。 我们正在开展研究以理解和解决这些问题。
我们的工作并不保证某个模型是“安全”或“不安全”的。然而,我们希望它有助于勾勒出模型能力以及现有保障措施稳健性的新兴图景。为此,我们将继续与此处测试的模型的开发者保持接触, 并已向每位开发者分享了其模型的详细发现,以便他们能够评估并改进其安全性。模型评估领域虽然新兴,但正在迅速成熟。我们期待向开发者、学术界和公民社会等更广泛的评估生态系统学习并做出贡献。
来源:UK AI Security Institute Blog · aisi.gov.uk