AISI:自主 AI 网络攻击能力进步有多快
How fast is autonomous AI cyber capability advancing?
英国 AI 安全研究院(AISI)发布博客,估算前沿模型在窄口径网络任务上达到 80% 成功率的任务时长自 2024 年底以来每 4.7 个月翻一倍,较其 2025 年 11 月估计的 8 个月明显加快。
2026年2月,我们内部估计,自2024年底以来,AI模型能够完成的网络任务长度每4.7个月翻一番——这已经比我们2025年11月估计的8个月有所加速。此后,AISI报告了两个新模型,Claude Mythos Preview和GPT-5.5,它们大幅超出了这两种翻倍速率趋势。目前尚不清楚这是否代表一种新的、更快的趋势。
我们追踪网络能力的进展速度,以帮助政府了解如何为前沿AI做好准备。随后,我们与NCSC等其他组织合作,由它们向企业发布建议。虽然评估并不能完美衡量AI在现实世界中的影响,但当前的变化速度表明,AI网络能力转化为切实风险的可能性正在增大——英国组织在未来几个月将需要应对这些风险。
这篇博文包含我们从GPT-5.5和Claude Mythos Preview获得的最新结果。在我们发布描述对Mythos Preview进行部署前测试的博文之后,我们获得了更新检查点的访问权限。该检查点取得了比先前版本更强的网络能力结果,包括首次完成我们的两个网络靶场。
网络时间跨度
时间跨度基准衡量AI模型能够完成的任务长度,以人类专家完成相同任务所需的时间为参照。它们并不能精确预测性能;AI在一些人类能快速完成的任务上表现不佳,却能轻松完成另一些人类觉得困难的任务。然而,我们使用这类基准,是因为它提供了一种衡量AI自主性的指标,我们可以从中得出趋势。
在AISI,我们为窄域网络测试套件中的每项任务估算了一名网络专家完成它所需的时间。1我们窄域套件中的任务要求模型在独立环境中识别并利用目标系统的网络安全弱点,测试逆向工程和Web利用等技能。这些任务仅涵盖与现实世界网络攻击相关的部分能力。
对于超过三分之一的任务,我们计时了人类专家完成它们所需的时间,作为基线。其余任务使用专家对完成时间的估计,而非实证基线;这些估计可能偏高或偏低。通过计算前沿模型在我们窄域网络套件所有任务上的成功率,我们可以估计它们以给定成功概率完成的任务长度——在本文中,我们关注80%的成功阈值。
我们刻意将设置限制为每项任务仅250万token,以使结果随时间具有可比性。这低估了前沿模型的能力。我们将在下文进一步讨论这一决定。
总而言之,一个时间跨度结果示例的完整解读是:“我们估计,在我们的测试设置中,每项任务250万token的情况下,Claude Sonnet 4.5在人类专家需要16分钟完成的网络任务上,只要这些任务与我们窄域网络套件中的任务相似,就能达到80%的成功率。”
为了分析能力进展的速度,我们对任意给定时间最具能力模型的历史结果拟合了一条指数曲线。这是一个不完美的模型,既不是对未来的预测,也不是固定法则。
网络时间跨度结果
2026年2月,我们估计,自2024年底推理模型出现以来,在250万token限制下,前沿模型的80%可靠性网络时间视野每4.7个月翻一番。这大约是我们2025年11月翻倍时间估计值的一半,当时50%和80%可靠性的翻倍时间均为8个月。此后,Claude Mythos Preview和GPT-5.5显著超越了这一趋势。在撰写本文时,尚不清楚Mythos Preview和GPT-5.5是代表了与现有进步速度的孤立偏离,还是属于一种新的、更快的趋势。
.png&mode=full&exp=1791590400&sig=6f97c48c24d870bb)
由于在我们窄网络套件最长的任务上成功率接近100%,即使有250万token限制,Mythos Preview和GPT-5.5仍有较大的上界误差条。2 我们的任务也不够长,无法确定模型可靠性在更高任务长度下会以多快的速度下降。这使得一些最新模型处于我们窄测试套件可测量范围的极限。
如果没有250万token上限,成功率会高到时间视野无法计算。该上限,加上我们使用简单智能体脚手架,人为地降低了成功率,并低估了模型在更多token和更强脚手架下能做到的事情。作为回报,它确保时间视野可测量,并可在模型之间进行比较。作为参考,250万token限制相对较低——在我们的网络靶场实验中,我们使用高达1亿token,并发现性能很可能在该预算之外仍会提升,尤其是对于近期模型,它们从更高token限制中获益不成比例。
其他几个因素也使翻倍时间不确定。更长时间视野的估计仅依赖于六个时长八小时或以上的任务;更大的样本可能包含AI模型觉得比我们当前评估的任务更难或更容易的长任务,从而降低或提高时间视野估计。
人类基线也不完美——不同专家可能比我们计时的专家更快或更慢——而且对于六个最长任务,我们只有少量人类基线。尽管如此,我们认为人类基线是有价值的,因为它们提供了比替代指标更客观的任务难度衡量。
另一个不确定性来源是,时间视野估计仅基于少量模型拟合(历史估计所用模型更少)。尽管这是一个问题,但我们的证据表明,该趋势并不依赖于个别模型。任何单一遗漏只会将Mythos之前的翻倍时间估计移至最低4.1个月、最高5.0个月。
网络与软件自主性的进一步证据
我们最新的翻倍时间估计与METR得出的结果接近,METR是一家研究非营利组织,估计软件工程的时间视野——这是一项与网络相关但更广泛的技能。他们的结果表明,自2024年底以来,软件任务的翻倍时间一直为4.2个月。3
我们还在狭窄任务套件之外观察到了网络自主能力的进一步证据。AISI 的网络靶场(如下所示)衡量 AI 模型对小型、无防御企业网络(初始访问权限已被获取)完成网络攻击的能力。每个网络靶场都需要持续规划和执行能力;更多细节可在我们的近期论文中找到。
在 AISI 的最新测试中,较新的 Mythos Preview 检查点完成了我们的两个网络靶场,在“The Last Ones”靶场中 10 次尝试成功 6 次,在此前未被解决的“Cooling Tower”中 10 次尝试成功 3 次。这是模型首次完成我们两个网络靶场中的第二个。GPT-5.5 在“The Last Ones”中 10 次尝试成功 3 次。
这些结果使用的是比此前 AISI 报告中更新的 Mythos Preview 检查点。显著的能力跃升并不总是需要新模型发布:同一模型的后续迭代也可能实质性改变我们对前沿能力的估计。

影响
任何单一基准测试结果都不应被解读为对 AI 能力的精确衡量。时间跨度估计存在真实的不确定性;我们狭窄套件中最长的任务拥有最少的人类基线,而且现在判断近期模型的阶跃变化是否代表一种新的持续(或加速)节奏还为时过早。无论如何,在我们考察的模型、方法选择和独立数据中,变化的方向和快速增长都是一致的。
前沿 AI 的自主网络和软件能力正在快速推进:前沿模型能够自主完成的网络任务长度大约每几个月翻一番,而不是每几年。这些证据没有告诉我们的是,进展速度将如何演变、AI 何时会达到任何特定的能力阈值,或者这些能力将如何对抗真实世界中经过防御的系统。
更强的 AI 网络能力已经在产生切实的机遇和风险。网络防御者已报告使用近期模型在漏洞发现方面取得重大进展,而获取当今受控能力的机会可能会随时间扩散。现在正是投资于强大安全基线的时候。前沿 AI 既能增强攻击者,也能增强防御者,而构建韧性存在一个关键窗口期。英国国家网络安全中心最近发布了关于使用 AI 模型发现漏洞的建议。
如果当前的 AI 进展速度持续(或加速),AI 网络能力将仍然是一个快速变化、难以追踪的目标。我们正在开发更严格的网络评估以跟上步伐:新的网络靶场、对现有靶场的增强,以及加入主动网络防御以更好地反映真实世界条件。我们将继续评估前沿自主网络和软件能力,并随着证据的发展更新我们的估计。
来源:UK AI Security Institute Blog · aisi.gov.uk