跳到正文
OpenRouter Blog·· 3 天前精选AI 评分60

OpenRouter 推出 Model Router Benchmarks 路由器评测页

Model Router Benchmarks

AI 导读

OpenRouter 上线 Model Router Benchmarks 页面,对多种模型路由器在质量、速度和成本上做基准测试,并给出单模型作为对照基线。页面提供 Router Index,默认按质量 60%、每任务耗时 20%、成本 20% 合成 0 到 10 分,用户可拖动滑块调整权重。

推荐理由

OpenRouter 把路由器的质量、速度、成本合成为可调权重的指数,读者可据此比较不同路由策略的取舍。

正文 · AI 翻译

今天我们推出了全新的 Model Router Benchmarks 页面,用于比较日益增多的各类路由选项的性能表现。每个路由都经过了一系列来自不同领域的基准测试,以在质量、速度和成本方面进行评分。

代表最佳成本效益和智能水平的单个模型与路由一同展示,作为对比的基线。请持续关注此页面,因为我们会不断添加新的路由,并随着路由的改进更新评分。

Benchmark matrix on the Model Router Benchmarks page showing Router Index scores for Auto cost tiers, Auto Beta, Fugu Max, Fugu Ultra v2, and Jev Router across six benchmarks

OpenRouter 通过我们的 Auto Router 和 Free Models Router 率先推出了两款模型路由。它们的诞生是为了让你拥有一个可靠的选项,能够紧跟最新模型,并符合你偏好的 成本水平。此后我们不断改进它们,包括 利用市场智慧 来为路由决策提供依据。

近几个月来,许多路由相继推出,它们利用模型生态中不同的优势来优化性能。

成本差异: 例如,将 DeepSeek v4 Flash 与 GPT-6 Astra 相比,GPT-6 Astra 每 token 的平均支付价格高出 48 倍以上,在 Codex 中运行平均 10 到 49 轮会话的成本则高出 21 倍。路由可以将任务的部分环节切换到成本更低的模型以节省开支。

任务多样性: 例如,在法律研究上表现最好的模型,未必是编码方面最出色的模型。路由可以在它们之间切换,以发挥每个模型的优势。

会话阶段: 智能体会话的不同部分可能需要不同水平的智能。路由可以在模型或推理力度之间切换,以适应会话中需要复杂规划或平凡执行的部分。

在实践中,这些技术各自都面临挑战,有时可能导致比直接使用单一模型更差的表现:

  • 在模型之间切换意味着请求会变得更昂贵,因为输入缓存需要重建。
  • 路由通常没有足够的信息,仅凭查看提示词来评估任务复杂度。
  • 用于判断会话阶段的启发式信号可能与模型的下一步不一致。
  • 在路由决策上运行的处理越多,引入的延迟就越大。

我们提供这些 Model Router Benchmarks,以展示哪些路由克服了这些固有挑战,从而让你能够决定何时(以及是否)是使用它们的合适时机。它们旨在帮助你找到符合你所需性能特征的路由与模型组合。

路由的类型

“路由”一词被交替用来表示许多不同的含义。让我们来梳理一下。

提供商路由: 模型通常由多个推理提供商提供服务,因此提供商路由会根据你在价格、速度、正常运行时间和数据政策方面的 偏好 挑选一个,如果失败则回退到另一个。这正是 OpenRouter 从第一天起就在做的事情。

模型路由: 你可以不直接选择单个模型,而是将请求发送给诸如 Auto Router 之类的路由,由它决定应由哪个模型来回答。它们的行为就像模型一样,但可能会使用一个或多个模型来响应你的请求。

我们进行基准测试的模型路由采用了几种不同的方法:

执行模型混合的路由器:Unbiased 的 Pareto 和 Sakana 的 Fugu 是使用模型混合的推理提供商,有时会升级到前沿模型。它们不披露所使用的模型或切换频率,并按标准化的每 token 费率计费。

选择模型的路由器:Auto Router 和 Jev Router 为每一轮选择一个模型。模型选择是透明的,无论选中哪个模型,都按该模型的标准费率计费。

在预定义模型集之间切换的路由器:NVIDIA 的 Switchyard 将一个更便宜的模型与一个更强的模型配对,并在 agent 执行任务的过程中在两者之间切换。已对若干配对进行了基准测试,以展示哪些模型搭配效果最佳,但你可以使用任意配对来运行它。

还有其他几种风格,例如 Pareto Code 或 -latest 模型 slug,它们都指向单个模型。Pareto Code 会针对你期望的智能水平挑选最具成本效益的模型,而 -latest slug 则指向某个系列中最新的模型。Fusion 是另一种风格,它将同一请求在多个模型组成的委员会上运行,并综合出最佳答案。这些风格未进行基准测试,因为它们服务于特殊用途,需要不同的比较方法。

Router Index 综合了质量、速度和成本

基准测试揭示了多个维度上的表现,因此很难判断哪个路由器表现最佳。Router Index 将质量、速度和成本综合为每个基准测试的 0 到 10 分。默认情况下,它将质量(基准测试得分)权重设为 60%,每任务时间设为 20%,成本设为 20%。你的优先级可能不同,因此你可以拖动页面上的滑块来调整指数权重。

Router Frontier chart plotting Router Index against cost per task on a log scale, with Pareto, Switchyard, and Auto points on the efficiency line and hollow single model baselines for reference

只需将模型替换为这些路由器中的任意一个即可试用

与任何基准测试一样,我们的 Model Router Benchmarks 仅代表一般任务,而非你自己的实际工作。列出的所有路由器均可在 OpenRouter 上使用。在任何应用、测试框架中,或通过我们的 API,将它们替换为你的模型即可。

来源:OpenRouter Blog · openrouter.ai