英国 AISI 开源 optstop:按精度提前停止评测以节省算力
Optimal stopping: spending evaluation compute where it counts
英国 AI 安全研究院(AISI)发布开源 Python 包 optstop,集成在其 Inspect 评测框架中,通过可信区间精度和稳定化两条规则提前停止评测运行。
原文给出开源工具 optstop 的停止规则与实测节省区间,可据此判断评测算力如何按不确定性分配。
随着前沿 AI 模型的能力持续提升,我们用来测试和衡量这些能力的评估方法也必须跟上步伐。能够真正激发模型真实能力的评估正变得越来越耗时、运行成本越来越高,而快速的模型开发和发布周期又让运行这些评估的时间越来越少。
AISI 此前发现,固定预算的评估会系统性地低估前沿智能体能力,对于较新的模型尤其如此。受预算限制的基准分数可能导致模型之间的比较不公平,使决策者低估智能体的能力,并掩盖风险的真实规模。然而,要在评估中恰当地激发模型能力所需的算力预算规模,正日益成为许多评估者面临的实际问题——一些前沿评估现在需要数亿个 token。
在这种规模下,评估中每一个不必要或被浪费的步骤都意味着实实在在的机会成本。因此,评估者需要高效的方法,能够有选择地使用资源,同时不削弱评估结果的统计基础,也不损害评估激发模型真实能力的能力。
AISI 的使命不仅是评估前沿模型的能力,还要创新出更好、更优秀的工具、方法和框架,以确保评估始终切合目的——并在力所能及之处分享解决方案,以惠及更广泛的评估者群体。
为帮助应对评估效率这一挑战,我们开发的一项此类解决方案是optstop, 一个开源 Python 包,它与我们的 Inspect 评估框架集成。总体而言,optstop 旨在当模型性能的估计足够精确时停止运行,从而减少评估过程中不必要的算力使用。在测试中,我们发现在我们所设定的每一种条件下,optstop 都节省了评估中 57% 到 97% 的计划运行次数。
本博客将讨论 optstop 所解决的具体测量问题——并解释它的工作原理、评估者如何使用它,以及我们在初步测试中运行它时发现了什么。
为什么需要 optstop?
在一次评估运行中,模型会与一个或多个基准配对——基准是一组结构化的任务,用于估计模型的底层能力。基准中的各个任务集合会被重复运行,以平均掉模型在任务上逐次运行的随机性。
任务数量乘以重复次数,就得到试验(模型的单次运行)的总数,即评估的样本量。
评估产生的数据是嵌套的:模型响应嵌套在任务中,任务又嵌套在模型与性能相关评估设置(例如所选的 token 预算)的分组中。它们之间的不确定性往往并不均匀——有些模型-任务组合在几次运行后就变得精确,而另一些则需要多得多的运行次数。
由于样本量是由评估者在运行开始前选定的,它无法根据评估中不确定性所在的位置而变化。评估可能会在较难的案例得到解决之前就耗尽预算,却仍在采样那些已经精确的估计。
随着单次试验变得越来越昂贵,评估团队能够负担的运行次数随之下降,而一次浪费的试验的成本也随之上升。
针对该问题的一种自适应方法则将评估视为序贯测量:在不确定性仍然较高的地方继续采样,并在达到预先指定的精度水平时停止。

针对这一测量问题,一种既有的应对方法是缩小基准中单个任务的数量。自适应题目选择方法会为每个模型挑选最具信息量的任务,并跳过其余任务。然而,这些方法通常需要一个预先校准、已知难度的任务库,而对于新开发的或安全关键的基准,这样的任务库可能并不存在。
optstop 不需要这样的任务库,评估中的每个任务都保持可选:一旦评估的某一部分足够精确,采样就会停止,无论那是一个单项还是整个分组。
optstop 的工作原理
在评估过程中,optstop 会追踪模型当前性能估计值所处的统计范围(称为可信区间)。它在两个层面上进行追踪:任务内的重复,以及分组内的任务,每个层面都有自己的精度或稳定化目标。
在分组层面,分层贝叶斯模型会跨任务整合信息,同时允许各任务的个体表现存在差异。这解释了当某些任务比其他任务更早停止时所造成的不等样本量。
optstop 依据以下两条规则之一停止采样:
1. 精度。可信区间足够窄。
2. 稳定化。区间已不再变化,因此数据无法再告诉我们更多信息。
如果两条规则都不满足,分组就会直接运行到其完整的计划预算,因此真正“嘈杂”的估计不会被提前停止,而是采样到底。
当模型在评估中仅偶尔成功时,停止最为危险,因为一次罕见的成功可能正是整个测试的关键。optstop 中的一种保守机制可防范这一点:当估计成功率低于 1% 时,要求更多数据。
每一个停止决策也都是可检查的:optstop 会记录并报告所有停止决策及其理由。这份记录让你能够核查所报告的节省,而不是仅凭信任接受它。(每条规则和保障措施都在配套论文中单独验证。)
最优停止的实际应用
我们在基准中常见的三种评分类型上测试了 optstop ——二元(例如通过/失败)、序数(例如 0-10 的评分量表)和连续(例如 0-100%),并覆盖三种预期模型性能水平(低、中、高)。这些测试在公开基准上运行,包括 MATH、GPQA Diamond 和 WritingBench。
我们发现,在每一种条件下, optstop 的提前停止都节省了 57% 到 97% 的计划试验,且不影响分数估计(见图 2)。
当然,如果采用试验更少的精简设计,节省的试验数量可能会更低,但当每次试验都耗时且昂贵时,哪怕只削减几次,仍能带来可观的资源节省。

无风险地尝试
optstop 允许谨慎、渐进地采用,以抵消任何可感知的风险:
- 事后验证:评估者在已完成的评估上运行它,确认停止时的估计值与完整运行的估计值一致。
- 影子模式:评估照常运行,而
optstop报告本可节省的开销,同时保留评估者的完整数据集。
- 实时模式:评估者对影子模式的数据满意后,开启实时停止。
设置很轻量。如果使用 Inspect,optstop 只需在评估配置中添加几行代码。主要的实际要求是任务以随机顺序呈现,这样早期估计不会因队列中试验的顺序而产生偏差——Inspect 支持这一点。
超越固定样本
随着评估者面临越来越大的压力,需要跟上模型发布的速度,并确保前沿性能被评估有意义地捕捉,我们将optstop定位为一种工具,不仅能提升评估吞吐效率,还能将其直接而严谨地与我们对结论的信心联系起来。
optstop 被设计为轻量、低风险,并能灵活适应各种评估设置。通过将其作为我们现有开源框架的一部分发布,我们希望能帮助其他评估者自动将评估资源重新导向仍存在不确定性的地方。
我们一直在 AISI 探索 optstop 的用例,作为帮助解决评估瓶颈的一种潜在方法,并计划在未来开发和发布更多类似的工具。
你可以在此获取 optstop 包。
在此处阅读完整论文。
来源:UK AI Security Institute Blog · aisi.gov.uk