英国 AI 安全研究院发布 Inspect Evals 开源评测仓库
Announcing Inspect Evals
英国 AI 安全研究院(UK AISI)宣布推出 Inspect Evals,一个由社区贡献的 LLM 基准评测仓库,与 Arcadia Impact 和 Vector Institute 合作开发,提供数十个高质量开源安全评测。
致读者:我们已于 2025 年 2 月 14 日更名为 AI Security Institute。阅读更多 请见此处。
今天我们很高兴地宣布 Inspect Evals,一个由社区贡献的 LLM 基准评估仓库。 在过去几个月里,我们与 Arcadia Impact 和 Vector Institute 在这一新项目上密切合作,该项目提供了数十个用于安全研究的高质量开源评估。评估涵盖广泛领域,包括编程、数学、网络安全、防护措施、推理和通用知识。我们还收录了前沿模型提供商通常报告的大多数基准。
评估已成为追踪前沿模型能力的一种日益重要的方式。全球“评估社区”包括模型开发者、学者、AI 安全研究所以及众多其他研究组织。运行评估的组织常常面临各种实施挑战,包括缺乏共享的测量标准。通过这个项目,我们正在采取一些初步措施来应对这些挑战。

Inspect 平台
Inspect Evals 构建在 Inspect AI 之上,这是由英国 AISI 创建的开源评估框架。Inspect AI 最初于今年 5 月开源,此后得到了更广泛评估社区的广泛使用和贡献。已有 50 多位贡献者为该框架做出贡献,包括其他 AI 安全研究所、前沿实验室和主要安全研究组织。
Inspect Evals 的设计目标是易于运行和实验。它们可以作为 Python 包安装,并从命令行或通过 Python API 运行。该集合包含多个智能体基准,包括 GAIA、SWE-Bench、GDM CTF 和 Cybench。过去,智能体基准的设置和运行耗时且复杂,而借助 Inspect Evals,现在只需一条命令即可针对任何模型运行这些基准。
社区贡献
评估社区对全面评估前沿模型的能力和安全特性有着浓厚兴趣。传统上,基准实现被孤立在许多不同的组织中,导致重复工作、缺乏同行评审,以及运行的评估数量少于我们所有人期望的水平。Inspect Evals 旨在为更广泛的评估社区提供一个协作平台,共同开展高质量评估,让所有人都能从中受益。
我们正在寻求新的评估贡献,并且已经合并了来自十多位用户的评估。访问项目网站了解更多信息,并查看我们的贡献指南以开始参与!
来源:UK AI Security Institute Blog · aisi.gov.uk