跳到正文
OpenRouter Blog·· 2025-10-21精选AI 评分62

OpenRouter 推出 exacto 端点,按工具调用准确率筛选供应商

Provider Variance: Introducing Exacto

AI 导读

OpenRouter 发布 exacto 端点,通过路由到工具调用成功率更高的供应商子集来提升工具调用准确率,可用 model_slug:exacto 调用。首批覆盖 Kimi K2、DeepSeek v3.1 Terminus、GLM 4.6、GPT-OSS 120b 和 Qwen3 Coder。

推荐理由

OpenRouter 用自家数十亿次请求的工具调用数据说明同一模型在不同供应商间存在差异,并给出可切换的 exacto 路由入口。

正文 · AI 翻译

今天,我们推出了一组新的端点——exacto——它们专注于通过路由到一组可测量地具有更高工具使用成功率的提供商,来提供更高的工具调用准确性(文档)。

关于 LLM 提供商的准确性,一直有很多猜测;不同提供商运行相同模型时,表现是否相同。理论上,当然,相同的模型权重(具有相同的量化)应该产生相同的结果。但在实践中,将模型实现为生产级推理是复杂而微妙的,差异就会出现。

OpenRouter 每月看到来自世界各地的数十亿次请求,因此拥有独特的优势视角,可以观察这些差异,准确确定发生了什么,并为我们的用户提供高质量且无意外的体验。

提供商生态系统

在 OpenRouter,我们与提供商有着长期、稳定的合作关系。我们定期与他们交流,在 Slack 频道中交谈,拜访他们的办公室,并定期分享反馈。这些都是积极、亲身实践、真实世界的关系。

我们不相信我们的任何提供商曾经故意损害模型质量。他们会努力降低成本吗?绝对会。他们是否深入 VLLM 和 SGLang 以榨取性能?是的。我们偶尔也看到,在调整推理堆栈时会出现质量下降。但我们所有的提供商都非常重视质量。当我们报告问题时,我们会得到高水平的参与,来自聪明、专注的专业人士。我们的激励是一致的:我们是一个中立的平台,致力于为推理消费者提供最佳体验,我们的提供商也是如此。

话虽如此,大规模运行推理很难,有些模型比其他模型更难托管,错误也会发生。我们看到行业专家的报告,查看我们自己的数据,并听到我们自己的客户关于提供商输出质量定性差异的轶事:很明显,我们需要做更多工作来确保 OpenRouter 上的最佳体验。

基准测试

Artificial Analysis 在 gpt-oss-120b 发布后不久发布了一套很棒的基准测试,显示提供商在特定基准测试上存在显著差异:
性能差异显著。但重要的是,这个模型于 2025 年 8 月 5 日发布,而 Artificial Analysis 的这份数据来自 8 月 11 日。我们 firsthand 知道提供商需要一些时间来‘磨合’模型,并让它在他们的硬件和推理堆栈上真正高效运行。我们见过很多次;对于像 R1、Kimi K2 这样的模型——随着提供商完善他们的推理引擎,性能会提高。我们的直觉是这种差距会缩小,事实上截至 2025 年 9 月,我们有这个:

差距已经大幅收紧,OpenRouter 上可用的大多数提供商具有相似的基准性能。

我们与 Artificial Analysis 合作,对 Deepseek 3.1 进行了基准测试——这是一个已经发布数月的模型。我们再次看到了一个紧密的性能区间:

值得注意的是,即使是 Deepinfra,唯一将模型量化为 fp4 的提供商,也相当有竞争力。

展望未来,我们将致力于:

  1. 在新的开放权重模型可用后不久对提供商进行基准测试
  2. 与提供商(私下)分享结果
  3. 将任何超出可接受范围的提供商从轮换中移除
  4. 在性能问题解决后将其重新加入

工具调用数据

2025年8月,我们开始推出额外的质量遥测数据,重点关注工具调用和结构化输出。具体来说,对于所有 OpenRouter 上的每一个 tool_call 响应,我们检查三种可能的失败模式:

  1. LLM 返回的 tool_call 是有效的 JSON 吗?
  2. tool_call 中的工具名称是否存在于原始工具输入中?
  3. tool_call 的 schema 是否与所提供工具的 schema 匹配?

这使我们能够比较同一模型在不同提供商之间的工具调用准确性和工具调用倾向性。由于某些提供商的使用方式可能存在偏差,我们对大客户进行降采样,比较不同提供商上单个应用的准确性,并检查 schema 复杂性是否可比。总体而言,我们测量了数十亿次 LLM 工具调用的准确性。

例如,以下是排名前 5 的 DeepSeek Terminus 提供商的工具调用准确性(都相当不错!)。

此外,我们测量了在输入中提供了工具的情况下,模型和提供商请求工具的频繁程度。我们目前不发布完整数据集,因为我们希望先与提供商合作,更好地理解差异的来源,但以下是 Kimi K2 提供商样本中工具调用倾向性差异的示例。这与 Moonshot 发布的内容类似——但基于真实使用情况,而非基准测试。

虽然我们在此只分享了部分数据,但完整数据集清楚地表明,LLM 使用工具的倾向性以及这些工具调用的准确性在不同提供商之间的差异,远大于标准基准测试所显示的。

实时用户偏好

除了测量到的工具调用数据外,我们还可以访问另一个数据来源:提供商偏好。

OpenRouter 支持忽略提供商,我们可以将其解读为对该提供商未满足该客户需求的投票。

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
    "model": "meta-llama/llama-3.3-70b-instruct",
    "messages": [
      {"role": "user", "content": "What is the capital of France?"}
    ],
    "provider": {
      "ignore": ["omega"]
    }
  }'

总体而言,我们对每个模型有数千条提供商偏好,可以进一步限制为提供了工具的 LLM 生成。这是判断哪些提供商表现良好、哪些表现不佳的有力指标。

推出 Exacto

利用我们的工具调用数据、客户提供商偏好数据以及在 Groq OpenBench 上运行的工具调用基准测试,我们创建了新的、精选的端点,专门关注工具调用准确性。这些端点今天已经可用,我们称之为 exacto。

我们为以下模型推出 exacto 端点

你可以通过 model_slug:exacto. 使用这些新端点。例如:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
    "model": "moonshotai/kimi-k2:exacto",
    "messages": [
      {"role": "user", "content": "What is the capital of France?"}
    ]
  }'

你将被路由到满足以下所有条件的提供商之一:

  1. 在工具调用准确性方面是顶级提供商
  2. 在工具调用倾向性方面处于正常范围内
  3. 在进行工具调用时,不经常被 OpenRouter 用户忽略或列入黑名单

运行我们的内部工具调用评估套件,以及像 tau2-Bench 和 LiveMCPBench 这样的开源基准测试,我们观察到工具调用失败的发生频率明显降低,模型更可靠地利用提供给它的工具。基准测试(在此示例中,针对 Kimi K2 0905)显示,通过 exacto 工具调用成功率有显著提升:

我们预计这些端点将在许多智能体工作流中广受欢迎,并预期我们将与目前尚未纳入 Exacto 路由池的提供商合作,帮助他们改进并最终达到纳入标准。请注意,exacto 端点专门聚焦于工具调用,不应被视为对端点或提供商整体质量的更广泛评价。

最后,我们正在努力公开更多数据;预计在今年年底前会公开部分底层数据,以帮助用户做出更明智的决策。由于这些是新发现,我们希望在发布完整数据集之前,给某些提供商改进的机会(或对我们的方法论提出反馈)。

最后

虽然我们希望一些疑问已得到解答,但我们也怀疑这项分析会引发更多问题。我们期待听到反馈,并预计会有大量后续讨论。请通过 X 或 Discord 联系我们参与讨论。如果您对 exacto 下的某个提供商有具体反馈,请填写此表单

我们希望用户觉得 Exacto 端点有帮助,并且我们很高兴能在今年剩余时间里分享更多数据(包括基准数据和实证数据),并将其融入我们的产品中。

来源:OpenRouter Blog · openrouter.ai