跳到正文
Prime Intellect Blog·· 5 小时前AI 评分60

Prime Intellect 发布 Hosted Evaluations 托管评测服务

Releasing Hosted Evaluations: Making benchmarking effortless

AI 导读

Prime Intellect 发布 Hosted Evaluations,让用户可在其平台上用自有评测规模化测试模型。该服务支持在 Environments Hub 上已有的数百个社区环境中运行评测,可通过平台界面或 CLI 加 --hosted 参数启动,也可用 .toml 配置运行。评测结果可发布到对应环境的排行榜,评测查看器会展示采样参数、样本、trace 和工具调用,便于复现与对比。

正文 · AI 翻译

发布托管评估:让基准测试变得轻松简单

今天,我们发布托管评估(Hosted Evaluations),让每个人都能使用可扩展的基础设施,在自己的评估集上测试模型。

评估是 LLM 研究以及模型后续部署的基石。它们让我们能够弄清楚模型能做什么,更重要的是,不能做什么。没有评估,我们就只能依赖感觉、单条提示词测试和模型厂商精心挑选的示例。评估让我们深入了解不同模型在一系列领域和能力上的优势(和劣势)。

评估随时间不断演进

多年来,我们所关注的能力集合发生了很大变化。因此,基准测试也随之演进,引导着下一代模型的开发。

在 LLM 研究的早期阶段,我们主要关注基于知识的基准测试,例如 MMLU-Pro,用来评估模型是否从训练所用的互联网文本中掌握了事实。这些基准测试以多项选择题形式评分,因此很容易评估。

评估这些基准测试相对简单:你从任务集中取出问题,交给模型,然后用正则表达式(或任何其他评分函数)对模型的回答打分,得到最终分数。

A simple evaluation loop

像 SimpleQA(以及其经过任务清理的验证版本)这样的基准测试是这些知识型测试的自然延伸,因为模型需要将多个事实串联起来才能回答一个问题。这类基准测试使用第二个模型(称为评判模型)来评估,它读取第一个模型的自由形式输出,并被要求根据带有正确答案的评分标准进行打分。

不同模型在给定环境下的优势可以在相应的排行榜上看到:

SimpleQA leaderboard

推理模型的兴起导致对科学问题评估模型的需求增加。最早的基准测试之一 GPQA Diamond 要求模型在研究生水平上对生物学、物理学和化学进行推理。像 AIME 或 APEX-shortlist 这样的数学基准测试对这些模型来说是基本要求,而 HLE 和 FrontierScience 则更为广泛。所有这些基准测试都只有一个问题,然后要求模型对问题进行长时间推理以得出最终答案。

Reasoning benchmarks

随着 LLM 的演进,它们越来越多地被嵌入到产品中。然而,知识或推理评估并不适合特定需求,这就是社区创建窄域评估来测试单一能力的原因,例如用于指令遵循的 IFEval、用于工具调用的 tau3-bench,或用于长上下文能力的 GraphWalks。与此同时,像 Zapier 这样的公司在 Environments Hub 上构建了如 AutomationBench 这样的特定评估,以反映其业务需求和用例。

Agent 将能力推向了更高水平。像 SWE-bench Pro、FrontierSWE 或 Terminalbench 2 这样的基准测试要求模型在数小时内处理各种不同的问题,并试图模拟软件工程的真实情况。这些基准测试的工作方式是,将模型置于一个测试框架(如 Claude Code)中,并将两者的组合放入一个环境(如代码仓库)中,要求它解决特定任务。模型提交答案后,这些解决方案会被执行,以检查其是否正确。

评估正在成为基础设施挑战

从基于知识的单轮提示任务向多轮 Agent 编码任务的转变,也提高了对基础设施的要求:单轮提示评估只需要模型在单台机器上运行,而现代评估需要大量协同运作的组件:测试框架中的模型会在单个任务上运行数小时,在沙箱中编辑和运行代码。为了高效评估,数百个沙箱会并行启动。

Agentic evaluation infrastructure

这些基础设施需求往往被忽视,却成为研究中的巨大瓶颈。Prime Intellect 的技术栈恰好能填补这一空白:凭借我们在托管训练服务 Lab 方面的经验,我们找到了应对所有这些挑战的解决方案,并能将其用于评估。

为了让每个人都能轻松评估模型,我们支持托管评估,可用于在 Environments Hub 上已支持的数百个社区制作环境中运行评估。可以直接在平台上启动评估:

Launching a hosted evaluation on the platform

或者使用我们的 CLI,只需附加 --hosted 参数:

prime eval run primeintellect/gpqa --model openai/gpt-oss-120b --hosted

或者,你可以创建一个 .toml,并同样使用 --hosted 参数运行它:

[[eval]]
env_id = "primeintellect/gpqa"
model = "openai/gpt-oss-120b"

针对给定环境的任何运行评估都可以发布在该环境对应的排行榜上。这不仅让任何人都能轻松快速比较不同模型的性能;对可复现性也很重要:因为环境是开源的,每个模型都在相同的设置下进行评估。

Environments Hub 上托管的评估的另一个重要方面是评估查看器。它会显示任何评估运行所使用的采样参数和任何其他设置,让任何数字背后的结果对所有人都透明。

评估查看器还通过展示所有样本以及相应的轨迹、工具调用和结果,让深入查看实际数据变得轻而易举。

The evaluation viewer

未来方向

随着评估变得更加 Agent 化,我们正在让针对给定评估评估不同模型与测试框架组合变得更加容易。为此,我们正在开发 Verifiers v1,这是我们支持所有环境的开源库,旨在提供无缝体验。

虽然 Environments Hub 已经是最大的评估平台之一,但我们始终对新的、令人兴奋的评估感兴趣。联系我们,无论你是像 Ramp 或 Zapier 这样想要利用托管评估基础设施的企业;还是想要扩大你的评估受众的学术研究人员;或者有兴趣成为 RL resident 来构建新的评估!

来源:Prime Intellect Blog · primeintellect.ai