跳到正文
OpenRouter Blog·· 2026-08-03精选AI 评分66

OpenRouter 发布 Ori Eval,用自家提示词评测并挑选最合适模型

Ori Eval: Find the Best Model for What You're Building

AI 导读

OpenRouter 发布 Ori Eval,让智能体在开发者自己的提示词、工具调用和代码库上评测模型,并给出带理由的推荐结果。它通过 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval 安装,会先访谈用户关注成本、延迟还是工具调用准确率,再挑选 5 个最新模型并行运行,生成 review.eval.ts 文件。

推荐理由

OpenRouter 官方发布的模型评测工具,展示了如何用自家提示词和工具调用断言选出适配模型,可迁移到团队选型流程。

正文 · AI 翻译

随着越来越多的应用加入 AI 功能,为你的项目选择使用哪个模型依然同样困难,甚至更难,因为你可以从 500 多个模型中进行选择。

在实践中,这个选择往往没有系统性的方法:来自社交媒体的推荐、基准排行榜,或者一种笼统的印象——某个模型目前最强。

这些资源确实有用,但都有同样的局限。基准测试衡量的是固定的任务集,而推荐反映的是别人的应用场景。两者都无法告诉你,模型在你的应用、你的测试框架、你的数据和你的提示词下表现如何。

与此同时,新模型每周都在发布,而手动重新评估它们的成本高得让许多团队推迟决策,或者继续使用一个已不再合适的模型。

在 OpenRouter,我们对模型略知一二。

我们学到的是:没有绝对最好的模型——只有最适合你正在构建的东西的模型。

Ori Eval 帮你找到那唯一合适的模型,并向你证明它。

要开始使用,告诉你的 agent:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

Ori Eval 会像一位友好且经验丰富的工程朋友一样,带你了解如何为你正在构建的东西选择最佳模型——无需任何评估经验。

简而言之

  • Ori Eval 在你自己的提示词上运行你的 agent,断言它调用了哪些工具,并用 LLM 评判员对开放式回答进行评分。
  • Ori 在一次运行中固定测试框架和模型。环境保持不变,因此如果评估结果发生了变化,你就知道这一变化只能归因于模型的变化。
  • Ori Eval 通过 OpenRouter 路由,因此模型对比覆盖所有模型和实验室。
  • 你不需要知道如何编写评估。Ori Eval 会找到你代码中每一处调用模型的地方,询问你在意什么,并编写评估文件。
  • 评估文件就是代码。在 CI 中运行它以阻止回归,并在新模型发布时重新运行它。
  • 要开始使用,告诉你的编码 agent:run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started。

提问,得到答案(附证明)

要使用 Ori Eval,你只需告诉你最喜欢的编码 agent:

运行 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval 并按照其输出中的说明操作

你的 agent 会把请求交给 Ori Eval。Ori Eval 会探索你的代码库,然后带着问题回来。在运行任何评估之前,它会与你一起帮助你弄清楚什么对你重要——是成本、性能、延迟、速度、工具调用准确性,还是其他什么。然后它会选择 5 个符合你要求的最新模型,并与你确认。

一旦收集齐所有这些必要的要求,Ori Eval 会编写一个 review.eval.ts 文件,针对候选模型并行运行你的 agent,并返回一个表格:

modelcatchp50$/PRresult
anthropic/claude-opus-594%38s$0.041pass
openai/gpt-5.6-sol92%44s$0.038pass
moonshotai/kimi-k390%31s$0.019pass
z-ai/glm-5.286%26s$0.008pass
google/gemini-3-pro84%52s$0.062fail (cost)

推荐会附带理由:比如说,在你的模型成本标准内最高的 bug 捕获率,以及如果 bug 审查量增长时的性价比之选。

如果你从未编写过评估,也不用担心

编写好的评估并不容易,这就是为什么我们为你处理烦人的部分。

Ori Eval 会扫描你的代码库中每一处运行模型的地方,并向你展示它发现的内容:用例界面、确切文件,以及你当前在那里使用的模型。然后它会询问你希望评估覆盖哪些地方,以及你最在意什么:准确性、速度、成本,还是其他什么?

一旦 Ori Eval 完成了对你的访谈,它就会根据你的回答编写评估文件,并运行它。

就这么简单。

每次运行,分数始终一致

因为 Ori Eval 是一个 agent,它可以在一次运行期间固定 harness、模型和 effort。它还经过预先调优:我们已经选好了最适合 eval 工作的 harness 和模型,所以你无需自己挑选。

一次 eval 检查三件事

一个 eval 文件是一个用 bun test 运行的 *.eval.ts 文件。它检查 agent 调用了哪些工具、避开了哪些工具,以及答案的质量:

const run = await agent.run("dinner in Lisbon?");
run.tool("search").toBeCalled();
run.tool("delete_file").toNotBeCalled();
run.toComplete();

对于开放式答案,由 LLM-as-a-judge 对输出进行评分。Ori Eval 帮助你设定评分标准和最低分数,因此即使是棘手的开放式问题也能被评估。

每个 bug 都变成你可以测试的东西

用大白话告诉 Ori Eval 一个 bug:比如说,一个客服 agent 连订单都不检查就直接退款——这可是个大问题。

Ori Eval 会写一个 eval,断言 lookup_order 被调用。这个 eval 会失败,从而证明该 bug 存在。然后你修复 agent,eval 就通过了。这个断言会留在你的测试套件中,所以你总能捕获它。

阻止回归,并在领域变化时重新运行

把 ori eval 添加到 GitHub Actions 工作流中。它的退出方式与 bun test 一样,所以 eval 失败也会导致构建失败,回归永远不会进入生产环境。

由于 Ori Eval 写出的只是代码,你也可以轻松地安排它们定期运行。我们的一位早期 beta 测试者现在每月运行一次模型对比。当有新模型发布,并且它在你的代码库中表现优于现有模型时,就会自动开一个 PR,你只需合并它,就能享受所有好处,甚至都不用去想这件事。

开始使用

告诉你的编码 agent:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

就这样。

该 skill 会安装 Ori(我们预先调优的编码 agent),要求你登录,对你进行访谈,并运行 eval。如果你使用 OpenRouter MCP server,请改为运行 /spawn-ori-eval,并跳过 URL。

手动安装 Ori:

curl -fsSL https://openrouter.ai/labs/ori/install.sh | bash

然后运行 ori login。运行 eval 还需要 Bun。

在 Ori Eval 页面或 Ori Eval 文档中了解更多。

来源:OpenRouter Blog · openrouter.ai