跳到正文
OpenRouter Blog·· 13 天前精选AI 评分60

Jev 在分类任务上能否达到前沿模型的准确率?

Is Jev as Accurate as Frontier Models at Classification?

AI 导读

OpenRouter 用 Banking77 的 3,080 条客服语句对比 TypeSafe 的 Jev 1.13 与 Claude Opus 5,Jev 准确率 81.0%,落后 Opus 的 84.4% 约 3.3 个百分点,但中位延迟 175 ms 对 2,266 ms,快约 13 倍,每千次请求成本 0.11 美元对 2.42 美元。

推荐理由

用同一数据集对比小模型与前沿模型的准确率、延迟和成本,并给出按置信度级联的阈值表,可迁移到自己的分类任务。

正文 · AI 翻译

Jev 是 TypeSafe 的 System One 决策模型。给它一个应用状态对象和一个带类型的问题,它会返回一个带类型的答案、一个置信度分数,以及每个可能选项的概率(即 Decisions API 的响应类型,而非聊天端点)。根据 TypeSafe 的宣传,你可以用像 Jev 这样的小型判断模型替换前沿聊天模型,在此类分类任务上显著降低成本和延迟。那么你会牺牲多少准确率?

我们将 3,080 条 Banking77 客户支持话语分别输入 Jev 1.13 和 Claude Opus 5——截至 2026 年 9 月 22 日,根据 OpenRouter 排行榜页面的 Task 支出部分,后者是 OpenRouter 用户在分类任务上花费最多的模型。每条话语被归入 77 种银行意图之一,两个模型都获得了相同的每种意图的一行描述。

下图将 Jev 和 Opus 并排展示,比较它们在准确率、中位延迟和每千次请求成本方面的表现。

Three bar charts comparing Jev 1.13 and Claude Opus 5 on the Banking77 test split. Accuracy is 81.0% for Jev and 84.4% for Opus. Median latency is 175 ms for Jev and 2,266 ms for Opus. Cost per 1,000 requests is $0.11 for Jev and $2.42 for Opus. Title reads that Jev trails Claude Opus 5 by 3.3 points at 13x the speed and 1/22 the cost.

Jev 在准确率上落后 Opus 3.3 个百分点,但其中位速度快 13 倍,成本仅为 Opus 的 1/22。

Jev 与 Claude Opus 5 一览

以下是更详细的结果。Macro-F1 对每种意图给予同等权重。

Jev 1.13Claude Opus 5
准确率81.0%(79.6 至 82.3)84.4%(83.1 至 85.6)
Macro-F180.5%83.6%
无效响应0 / 3,0800 / 3,080
延迟 p50175 毫秒2,266 毫秒
延迟 p95270 毫秒3,004 毫秒
延迟 p99353 毫秒3,835 毫秒
计费成本,完整运行$0.34$7.44
每 1,000 次请求成本$0.11$2.42
平均输入 token2,6053,750(3,725 缓存)
平均输出 token82617

括号中的数字是 95% 自助法置信区间,我们使用 3,080 个样本计算得出。两个模型均未返回格式错误的响应。每个错误都是标签错误,而非解析失败。

我们如何运行

Banking77 是来自 PolyAI 的话语级客户支持意图数据集,采用 CC BY 4.0 许可。话语很短,中位数为九个词,每条都标注了 77 种意图之一。当我们在 Banking77 上运行 Jev 和 Opus 时,我们使用了完整的测试集,包含 3,080 个样本,每种意图 40 个。有些意图非常接近,模型不能只靠几个关键词就停止阅读。想想 card_arrival 与 card_delivery_estimate。

我们仅根据标签名称,在完全不查看测试数据的情况下,为每种意图编写了一行标准,并将完全相同的标准列表提供给 Jev 和 Opus。为了给 Jev 评分,我们将每条话语作为 Decisions API 的 Choice 问题发送,以 77 条标准作为选项。对于 Opus,我们构建了一个提示,其中系统消息列出所有标准,然后用户消息仅包含话语。我们以温度零运行 Opus,关闭推理,并使用严格的 JSON schema 响应格式,枚举 77 个标签。我们为系统消息启用了 提示缓存,因为它在每次请求中完全相同。两个模型从同一台机器运行,我们一次发送 8 个并发请求,并将延迟测量为通过 OpenRouter 的客户端观察到的往返时间。

Jev 的准确率如何?

让我们谈谈数字。在 Banking77 上,Jev 为 81.0%,Opus 为 84.4%。配对自助法给出的 95% 置信区间为 2.3 至 4.4 个百分点,因此 Opus 领先约三个百分点不太可能是噪声。

好的一面是,这两者的一致性非常高。它们在 89.3% 的话语上一致。在它们分歧的地方,Opus 单独答对 175 条,Jev 答对 72 条。

不利的一面是,两者的表现仍远低于在全部 10,003 个 Banking77 训练样本上微调的编码器所报告的 90 分出头。这就是依赖单行标准而非进行全面微调的代价。

按类别来看,Opus 在 77 个意图中的 35 个上领先 Jev,Jev 在 15 个上领先,27 个打平。Opus 的最大领先在 receiving_money 上,达到 80.0%,而 Jev 为 52.5%。同时,Jev 在 compromised_card 上表现出色,达到 95.0%,而 Opus 为 70.0%。Opus 倾向于将盗刷的卡信息误判为未识别的支付。

Jev 有多快、多便宜?

非常快,Jev 的中位往返时间为 175 毫秒,p95 为 270 毫秒。另一方面,Opus 在未开启推理模式时,中位往返时间为 2,266 毫秒,p95 为 3,004 毫秒。这意味着最慢的 Jev 调用(约 1.6 秒)比最快的 Opus 调用(约 1.9 秒)还要快。

Jev 的总费用为 0.34 美元,即每千次请求 0.11 美元。Opus 为 7.44 美元,即每千次请求 2.42 美元。Opus 的这个数字是在缓存了 3,700 个 token 的系统提示的情况下得出的,因此所有请求都按缓存读取费率而非标价费率计费。如果不使用缓存,Opus 的标价费率约为每千次请求 19 美元。所以,如果你在使用前沿模型搭配标签分类体系,请缓存该系统提示。

基于 Jev 置信度的路由

Jev 会给出一个置信度分数,但它并非校准过的概率。在这里,它在中间范围高估了自己的准确率。尽管如此,它的排序能力很好。对于置信度 ≥0.99 的 58% 的语句,准确率为 96.3%。对于低于 0.5 的 3.5% 的语句,准确率为 29.6%。

这种排序正是你进行级联所需要的。接受高于给定阈值的 Jev 结果,将其余的发送给 Opus。以下是每个阈值下的准确率和每千次成本,范围从仅使用 Jev 到仅使用 Opus。

阈值由 Jev 处理准确率每 1,000 次成本
仅 Jev100%81.0%$0.11
0.9957.8%84.3%$1.13
0.9568.1%84.2%$0.88
0.9075.9%84.0%$0.69
0.8082.7%83.6%$0.53
0.7087.3%83.2%$0.42
仅 Opus0%84.4%$2.42

在阈值 0.90 时,76% 的流量绕过了 Opus。作为交换,你的准确率相对于仅使用 Opus 最多降低 0.4 个百分点,而成本降低了 3.5 倍。Opus 正确识别了 Jev 漏掉的 175 条语句。这些案例的置信度中位数为 0.67,其中 85% 低于 0.90。所以 Jev 通常知道自己只是在猜测。

注意事项

那么,让我们狭义地讨论一下我们实际进行的测试:一个数据集、一个领域、一种提示设计,以及某个下午的一个十五分钟窗口。

如果这里存在 Opus 的记忆优势,其分数可能因此略有虚高,因为 Banking77 发布于 2020 年。但仅凭这次运行无法判断。

另一点是,两个模型都在一个类别上失误了,因为标准仅根据标签名称编写,没有查看示例消息。在这种情况下,其中一个标签是 get_physical_card,它涵盖了关于 PIN 是否单独发送的查询。仅从名称几乎不可能猜到这一点。每个模型在该类别上的得分都是 0/40,将大多数消息路由到了 change_pin。仅排除该类别,Jev 达到了 82.1%,Opus 达到了 85.5%。但一个上线团队会使用留出的训练数据而非测试集来迭代标准,两个模型都会变得更好。

我们展示的级联表格使用的正是用于准确率测量的那 3,080 个样本,因此这是一个上限。请根据你自己的流量选择阈值。

最后,这些测试是在 Opus 处于“推理关闭”模式且开启结构化输出的情况下运行的。Opus 未在“推理开启”模式下测试,也未使用其他模式或少量样本示例进行测试。

这意味着什么

如果准确率上多出三个百分点值得每千次请求多花 2.42 美元,那就选 Opus。如果你面对的是高并发、低延迟,或者需要一个兜底方案,单用 Jev 的准确率与 Opus 相差不到 3.3 个百分点。更妙的是,基于 Jev 的置信度分数做级联,能把差距缩小到 0.4 个百分点以内,而成本不到 30%。

Decisions API 参考文档介绍了基本的请求结构。Jev cookbook 带你用 TypeScript 跑通一个可用的 Choice 问题。Jev-verified cascade cookbook 用代码展示了升级模式:由廉价模型起草,Jev 检查草稿,前沿模型只处理未通过检查的部分。Banking77 测试集是 PolyAI 仓库中一个 3,080 行的 CSV 文件。

要对自己的积压数据运行像这样的标注任务,Classify and Tag Text at Scale with Jev cookbook 涵盖了在速率限制内进行批处理、从标注样本中为每个标签选取阈值,以及计算每 1,000 条的成本。如果你刚接触 Jev,请先看 What Is Jev?,然后看 Jev vs LLM,了解何时用决策模型替代生成式调用。Jev 文档中心列出了 OpenRouter 上所有的 Jev 指南和 cookbook。

常见问题

在意图分类上,Jev 与 Claude Opus 5 相比准确率如何?

在 2026 年 9 月 22 日运行的 Banking77 测试集上(包含 77 个意图的 3,080 条话语),Claude Opus 5 达到 84.4% 的准确率和 83.6% 的 macro-F1,而 Jev 1.13 达到 81.0% 的准确率和 80.5% 的 macro-F1。配对差距在准确率上为 3.3 个百分点,95% bootstrap 区间为 2.3 到 4.4 个百分点。两个模型在 89.3% 的话语上结果一致。

在分类任务上,Jev 比前沿模型快多少?

在客户端观测的往返延迟中位数和 p95 上,Jev 的中位数为 175 毫秒、p95 为 270 毫秒,而禁用推理的 Claude Opus 5 中位数为 2,266 毫秒、p95 为 3,004 毫秒,中位数约高出 13 倍。这些数字是在同一客户端、8 个并发请求下测得的。它们包含网络时间以及提供商系统在实际推理前的任何排队时间。

在 OpenRouter 上用 Jev 对文本分类要花多少钱?

全部 3,080 次 Banking77 请求在 typesafe/jev-1.13 上总计计费 0.34 美元,即每千次请求 0.11 美元,约合每次请求 0.0001 美元。对 77 个标签的系统提示使用提示缓存后,同样的请求在 anthropic/claude-opus-5 上总计计费 7.44 美元,即每千次 2.42 美元。如果不使用缓存,Opus 按标价将计费约每千次 19 美元。

我可以用 Jev 的置信度分数来决定何时回退到更大的模型吗?

可以,在我们的数据中它确实能作为排序信号。我们测得 Jev 在置信度至少为 0.99 的那 58% 话语上准确率为 96.3%,而在置信度低于 0.5 的那 3.5% 话语上准确率为 29.6%。将所有置信度低于 0.9 的请求路由到 Claude Opus 5 后,准确率恢复到 84.0%,与单用 Opus 相差 0.4 个百分点以内,成本为每千次请求 0.69 美元。由于该分数并未按概率进行校准,请根据你自己的数据选择适用的阈值。

来源:OpenRouter Blog · openrouter.ai