AISI 研究:提高推理预算后 AI 网络任务成功率显著上升
Evidence for inference scaling in AI cyber tasks: Increased evaluation budgets reveal higher success rates
英国 AI 安全研究院(AISI)与 Irregular 的联合研究发现,前沿模型在网络任务上能有效利用比常规评测大 10-50 倍的 token 预算,成功率随之上升,约 8% 的 AISI 任务只有在预算从 1000 万提升到 5000 万 token 时才被解决。
AI 评估是否跟得上智能体在网络任务上的表现?
AI 网络能力的提升一直很迅速。AISI 的评估显示,最先进的模型如今已能频繁完成学徒级网络任务,偶尔还能完成需要 10 年经验的专家级任务。Irregular 的评估同样记录到一次显著的能力跃迁,此前成功率近乎为零的困难级任务如今升至约 60%。这类能力评估有助于开发者、研究人员和政策制定者跟踪进展并评估潜在风险。但新证据表明,标准评估设置如今可能低估了模型在网络任务上的能力上限。
评估会限制智能体可运行的时间,例如对步数(“轮次”)、token、时间或花费设置上限。这些限制使测试成本可控且具有可比性,但隐含地假设额外预算不会显著改变估计的性能。直到最近,额外预算很少改变结果:许多模型很快达到平台期,在状态跟踪、故障恢复和长时程规划上表现吃力,因此更多预算大多意味着更高成本而非更高成功率。
自 2025 年 11 月以来,这一假设在前沿模型于网络场景中的表现上似乎正在瓦解。我们与 Irregular 合作发现,近期模型能够有效利用比该领域典型评估设置所允许的大 10-50 倍的 token 预算,从而展现出更高的成功率以及对先前未解决任务的首次破解。这意味着,以适度的 token 或轮次限制运行的评估如今有可能错过实质性的能力提升。
在这篇博文中,我们解释发生了什么变化,以及这对今后应如何评估智能体网络能力意味着什么。
我们的结果:近期模型在网络任务上能有效利用更多 token
为研究模型随能力提升而利用更大预算的能力,AISI 和 Irregular 各自对 2025 年 11 月之前和期间发布的前沿模型运行了其私有网络评估的一个子集。我们以远高于评估设置中通常使用的预算运行这些评估:AISI 为总计 5000 万 token,Irregular 为 1,000 轮。为使模型能够利用这些更大的 token 预算,AISI 使用了一个压缩工具,让模型能在固定上下文窗口内跟踪更多历史。Irregular 采用了类似方法。
这些评估表明,无论较旧还是较新的模型,更大的预算都带来了能力的显著提升,且与较旧模型相比,较新模型利用更多 token 的能力有所增强。

我们的结果表明,随着推理预算的扩大,一系列任务的平均成功率持续提升。重要的是,一些较难的任务只有在长时间评估的后期才被解决:AISI 的任务中约有 8% 只有将预算从 1000 万 token 增加到 5000 万 token 才能解决。这意味着要可靠地估计性能,就需要运行长时间、预算密集的评估,以捕捉这些后期才被解决的任务。对于困难任务,这可能意味着每次尝试需要数千万 token 的预算,并需多次重复。
我们应当指出这些发现存在若干重要局限。首先,它们基于网络任务,因此需要更多测试来确认其能否推广到其他领域。其次,我们无法精确量化脚手架设计与模型能力各自的相对贡献,尽管我们对使用同类脚手架的不同模型所做的比较表明,利用扩展推理预算的能力因模型而异。 最后,给定预算下的成功率本身带有随机性,虽然我们的样本量足以证明这种扩展效应,但样本量太少,无法精确估计真实成功率。随着样本量增大,我们的曲线和平台期可能会发生移动。
这对网络评估意味着什么?
我们的结果表明,要准确评估网络能力,所需的推理预算很可能远高于通常的假设。
AISI 的成功率大致随每次尝试所用总 token 数的对数而扩展:每当我们将 token 预算翻倍,成功率的绝对增幅大致相同。不利的一面是,对于困难任务,即使性能只有小幅提升,也需要指数级更大的推理预算,这使得准确评估的成本越来越高。
这并不意味着每次运行的成本会变得难以承受:在 AISI 的 5000 万 token 上限下,每次运行的平均成本约为 10 美元,单次运行的最高成本低于 60 美元。对于 Irregular 每次运行 1000 次迭代的情况,每次运行的平均成本从较简单挑战的不到 1 美元,到中等及大多数困难挑战的最高 20 美元不等,某些更困难的挑战则接近 100 美元。费用来自规模:要可靠地估计性能上限,需要大量任务和多次重复,总评估成本也随之增长。
这些发现会影响我们估计模型视野的方式,模型视野代表模型成功率降至 50% 以下时的难度水平(以人类时间衡量)。由于视野估计取决于测得的成功率,而测得的成功率又取决于所允许的推理预算,因此在预算不足的情况下运行的评估会低估模型的真实视野。在我们测试的预算下,提高 token 上限会显著推高视野估计,这表明此前在较低预算下得出的估计过于保守。
我们如何选择合适的推理预算?
为网络评估计算理想的推理预算需要权衡:预算设得太低,可能会低估模型的能力;而设得太高,则可能为没有产出的 token 付费,却无法改进能力估计。
Irregular 提出了每次成功成本作为评估网络任务经济可行性的有用指标。这是所有尝试的总成本除以成功次数,反映了成功完成一项任务平均预期花费的金额。
降低高估某项挑战预期每次成功成本风险的一种方法,是在不同的预算阈值下计算该指标。理论上,当推理预算较低时,我们预期每次成功成本会非常高,因为预期成功次数很少甚至为零——而随着预算增加,我们预期它会下降。在某个点上,我们预期每次成功成本会再次开始上升,因为额外的迭代只会延长那些模型已经犯下致命错误、走入死胡同,或遇到无论多少算力都无法解决的问题的运行。找到这条曲线中的低谷,即每次成功成本最低之处,可以在不超支的情况下最大化能力评估。

展望未来
总体而言,我们的发现对网络评估的开发和报告方式具有直接影响。
我们的结果为评估应如何影响安全决策提供了依据。一个在 200 万 token 时成功率为 5% 的模型,在 5000 万 token 时可能达到 30%——这一变化可能跨越与风险评估相关的 capability 阈值。在典型 token 或轮次限制下进行的评估,可能大幅低估模型距离危险 capability 阈值的接近程度。政策制定者和开发者需要准确的能力上限估计,而不是固定预算下的点估计。
需要更多研究来了解这些结果是否适用于其他领域。Model Evaluation & Threat Research (METR) 的结果表明,这种在高 token 预算下的持续扩展可能并不适用于所有软件工程任务。以更多 agent 轮次形式进行的推理扩展是否能推广到网络领域之外,仍是一个重要的开放问题。
对评估期间施加的推理限制——包括 token 数量、轮次限制、成本上限和时间约束——保持透明,将有助于为评估结果提供背景,使读者能够区分模型能力低下与评估设置过度受限。虽然一些组织现在会报告这些限制,但这一做法尚未统一。通过监测推理扩展曲线,评估者可以确定其选择的预算是否充足,或者额外的算力是否会显著提升估计性能。
展望未来,这些趋势将使网络评估越来越资源密集。环境需要支持稳定、长时间运行的 agent 会话,评估者需要工具来确定其选择的预算是否充足。更根本地说,社区可能需要从更短、更便宜的运行中估计长期性能的方法——例如,通过外推观察到的推理扩展曲线。如果没有这类方法,随着模型持续改进,测量到的模型能力与实际能力之间的差距可能会扩大。
来源:UK AI Security Institute Blog · aisi.gov.uk