OpenRouter 推出 Model Router Benchmarks 路由器评测页
Model Router Benchmarks
OpenRouter 上线 Model Router Benchmarks 页面,对多种模型路由器在质量、速度和成本上做基准测试,并给出单模型作为对照基线。页面提供 Router Index,默认按质量 60%、每任务耗时 20%、成本 20% 合成 0 到 10 分,用户可拖动滑块调整权重。
OpenRouter 把路由器的质量、速度、成本合成为可调权重的指数,读者可据此比较不同路由策略的取舍。
今天我们推出了全新的 Model Router Benchmarks 页面,用于比较日益增多的各类路由选项的性能表现。每个路由都经过了一系列来自不同领域的基准测试,以在质量、速度和成本方面进行评分。
代表最佳成本效益和智能水平的单个模型与路由一同展示,作为对比的基线。请持续关注此页面,因为我们会不断添加新的路由,并随着路由的改进更新评分。

OpenRouter 通过我们的 Auto Router 和 Free Models Router 率先推出了两款模型路由。它们的诞生是为了让你拥有一个可靠的选项,能够紧跟最新模型,并符合你偏好的 成本水平。此后我们不断改进它们,包括 利用市场智慧 来为路由决策提供依据。
近几个月来,许多路由相继推出,它们利用模型生态中不同的优势来优化性能。
成本差异: 例如,将 DeepSeek v4 Flash 与 GPT-6 Astra 相比,GPT-6 Astra 每 token 的平均支付价格高出 48 倍以上,在 Codex 中运行平均 10 到 49 轮会话的成本则高出 21 倍。路由可以将任务的部分环节切换到成本更低的模型以节省开支。
任务多样性: 例如,在法律研究上表现最好的模型,未必是编码方面最出色的模型。路由可以在它们之间切换,以发挥每个模型的优势。
会话阶段: 智能体会话的不同部分可能需要不同水平的智能。路由可以在模型或推理力度之间切换,以适应会话中需要复杂规划或平凡执行的部分。
在实践中,这些技术各自都面临挑战,有时可能导致比直接使用单一模型更差的表现:
- 在模型之间切换意味着请求会变得更昂贵,因为输入缓存需要重建。
- 路由通常没有足够的信息,仅凭查看提示词来评估任务复杂度。
- 用于判断会话阶段的启发式信号可能与模型的下一步不一致。
- 在路由决策上运行的处理越多,引入的延迟就越大。
我们提供这些 Model Router Benchmarks,以展示哪些路由克服了这些固有挑战,从而让你能够决定何时(以及是否)是使用它们的合适时机。它们旨在帮助你找到符合你所需性能特征的路由与模型组合。
路由的类型
“路由”一词被交替用来表示许多不同的含义。让我们来梳理一下。
提供商路由: 模型通常由多个推理提供商提供服务,因此提供商路由会根据你在价格、速度、正常运行时间和数据政策方面的 偏好 挑选一个,如果失败则回退到另一个。这正是 OpenRouter 从第一天起就在做的事情。
模型路由: 你可以不直接选择单个模型,而是将请求发送给诸如 Auto Router 之类的路由,由它决定应由哪个模型来回答。它们的行为就像模型一样,但可能会使用一个或多个模型来响应你的请求。
我们进行基准测试的模型路由采用了几种不同的方法:
执行模型混合的路由器:Unbiased 的 Pareto 和 Sakana 的 Fugu 是使用模型混合的推理提供商,有时会升级到前沿模型。它们不披露所使用的模型或切换频率,并按标准化的每 token 费率计费。
选择模型的路由器:Auto Router 和 Jev Router 为每一轮选择一个模型。模型选择是透明的,无论选中哪个模型,都按该模型的标准费率计费。
在预定义模型集之间切换的路由器:NVIDIA 的 Switchyard 将一个更便宜的模型与一个更强的模型配对,并在 agent 执行任务的过程中在两者之间切换。已对若干配对进行了基准测试,以展示哪些模型搭配效果最佳,但你可以使用任意配对来运行它。
还有其他几种风格,例如 Pareto Code 或 -latest 模型 slug,它们都指向单个模型。Pareto Code 会针对你期望的智能水平挑选最具成本效益的模型,而 -latest slug 则指向某个系列中最新的模型。Fusion 是另一种风格,它将同一请求在多个模型组成的委员会上运行,并综合出最佳答案。这些风格未进行基准测试,因为它们服务于特殊用途,需要不同的比较方法。
Router Index 综合了质量、速度和成本
基准测试揭示了多个维度上的表现,因此很难判断哪个路由器表现最佳。Router Index 将质量、速度和成本综合为每个基准测试的 0 到 10 分。默认情况下,它将质量(基准测试得分)权重设为 60%,每任务时间设为 20%,成本设为 20%。你的优先级可能不同,因此你可以拖动页面上的滑块来调整指数权重。

只需将模型替换为这些路由器中的任意一个即可试用
与任何基准测试一样,我们的 Model Router Benchmarks 仅代表一般任务,而非你自己的实际工作。列出的所有路由器均可在 OpenRouter 上使用。在任何应用、测试框架中,或通过我们的 API,将它们替换为你的模型即可。
来源:OpenRouter Blog · openrouter.ai