LangChain 实测 Jev 能否成为更好的智能体评测器
Can Jev Be a Better Agent Evaluator?
LangChain 用 Deep Agents 构建天气智能体,把 5 条固定运行结果存入 LangSmith 数据集,对比 TypeSafe AI 的 System One 模型 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6 的评测表现。
LangChain 用同一批固定 trace 对比 Jev 与三个 LLM 裁判,给出准确率、方差和单次成本,可据此判断决策型模型做评测的取舍。
如今,智能体评估主要有两种形式:基于代码的评估和 LLM 作为评判者。两者都有各自的局限性:基于代码的评估器只能用于输入固定的狭窄问题集,而 LLM 评判者则可能速度慢、成本高且不可靠。随着 TypeSafe AI 的 Jev 的流行发布,我们想看看“System One”模型是否可能成为智能体评估器的第三种新形式,以及它可能对智能体工程产生的影响。
什么是 Jev?
Jev 是 TypeSafe AI 发布的新模型。Jev 实际上不是传统的 LLM;它不生成文本。它是 TypeSafe AI 团队所称的“System One”模型:
📖 System One 模型是一类 AI 模型,旨在做出快速、结构化的决策,供软件直接使用。System One 模型评估一个 状态 并返回类型化答案和概率。

根据 TypeSafe AI 的说法,这使得 Jev 比 LLM 更快、更便宜,在分类任务上比同类 LLM 的推理速度最高快 200 倍,成本低 400 倍。
如果您想了解更多关于使用 Jev 构建智能体的信息,我们将在 9 月 22 日星期二与 TypeSafe AI 团队举办一场直播:https://events.langchain.com/webinar/building-a-harness-with-jev/
为什么 Jev 可能是一个好的智能体评估器?
如今的智能体评估要么基于代码,要么是 LLM 作为评判者,各有其优点、局限性和权衡。
基于代码的评估与代码本身一样古老。它便宜、快速且可靠,其主要缺点在于能力范围较窄。由于传统函数需要固定的确定性输入,其评估智能体行为这一随机世界的能力有限。例如,虽然传统函数可以评估智能体是否在第一次运行中调用了工具,但它很难评估智能体随后是否使用工具结果成功回答了用户的问题。在开放式任务中,使用同一工具结果可能有多种有效方式,因此将每个可接受的答案编码为确定性逻辑很快就会遇到基于代码评估的狭窄范围限制。
于是出现了 LLM 作为评判者,它使用 LLM 对智能体轨迹的非结构化输入进行推理并评分。LLM 评判者可以接受问题、轨迹和证据作为非结构化输入,然后使用提示来评估响应是否解决了用户的请求。

然而,任何智能体工程师都会证明,LLM 评判者并非完美解决方案。它们本质上是非确定性系统,不是可信测试装置的坚实基础。它们运行起来也比传统的基于代码的评估更慢、更昂贵。
智能体评估是一项决策任务:给定智能体的状态和行为,分配一个提供反馈的分数。Jev 正是为此模式设计的。它根据结构化状态评估类型化问题,并返回带有概率的类型化答案。另一方面,自回归模型通过逐令牌生成来达成判断。在我们的实验中,这种决策优先的设计与更低的延迟、更低的成本和更低的方差相吻合。

Jev 支持三种类型的问题:
Choiceselects one option and returns probabilities and confidence- 示例:“哪种搜索结果最能描述这次运行?”
- 响应:
searched_appropriately、searched_unnecessarily或failed_to_search之一,外加概率和置信度
-
Scorerates an answer against an ordered rubric and returns probabilities and confidence示例:“这个答案有多大用处?”- 响应:从
1(无用)到5(非常有用)的评分量表分数,外加概率和置信度
Noulreturns the probability that a yes/no judgment is true- 示例:“最终答案是否基于检索到的证据?”
- 响应:一个从
0.0到1.0的float,其中1.0表示完全有依据
多个原子问题可以针对同一状态并行评估。

当智能体行为、检索数据或追踪上下文在多次运行之间发生变化时,比较评判者就很困难。Deep Agents 和 LangSmith 让我们能够将单次智能体运行捕获为数据集,并在每个模型上重放。
使用 Jev 进行评估
为了测试 Jev,我们需要一个可供评分的智能体。我们用 Deep Agents(我们的开源智能体框架)构建了一个目标智能体。然后我们将测试集定义为 LangSmith 数据集,这样每个评估器都针对相同的问题和预期行为运行。该测试集包含五个天气请求:
.png&mode=full&exp=1791417600&sig=8ee9923fc5fbe8bc)
对于数据集中的每个示例,我们捕获了天气智能体的响应,并将完整输出作为固定示例存储在 LangSmith 中。每个评判者用两个信号评估这五个捕获的运行:quality(一个连续分数)和 does_pass(一个二元决策)。
.png&mode=full&exp=1791417600&sig=a07828683e0adeb3)
为了将正确性与可重复性分开衡量,我们让人类评审员按照相同的评分量表为每个固定响应打标签。使用人类评审员的标签作为基准分数,使我们能够更深入地分析精确度和正确性对整体评估器有效性的影响。
准确度衡量与人类基准的一致程度。方差衡量评判者在相同智能体行为上是否始终得出一致判断。较低的方差并不自动意味着更高的准确度:评判者仍可能一直出错。但当评判者准确时,较低的方差会使这种准确度在生产中更可靠。
我们将 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 进行了比较,计算了 100 次重复中每个案例的方差以及与人类基准的一致程度。
评估结果
准确度
使用人类评审员的标签作为此比较的基准,我们计算了二元通过/失败决策的准确度。
对于二元 does_pass 分数,Jev 在全部 500 次重复决策中都与基准一致。Terra 在 99.8% 的决策中一致,Luna 为 96.4%,Claude 为 80.0%。

精确度
准确度告诉我们评判者是否与人类基准一致。精确度则询问当智能体行为不变时,它是否产生相同的质量分数。我们通过每个评判者分数的观测方差来衡量精确度。
Jev 的观测平均每案例方差最低:0.0000149。Luna 高出 433×,Terra 高出 913×,Claude 高出 92×。
这个实验无法告诉我们为什么 Jev 的分数变化更小。一种假设是,这些模型针对不同类型的输出进行了优化。TypeSafe 将 Jev 描述为一个决策模型,经过训练以返回校准的概率和类型化答案,而自回归 LLM 评判者先生成文本,然后由评估器将该输出映射为分数。这种差异可能使 Jev 更适合这个有界的评估任务,但该结果是观察性的,并不能证明其训练目标导致了更低的方差。
.png&mode=full&exp=1791417600&sig=ad297235841b9bf7)


成本和延迟

低成本意味着大规模运行智能体评估变得可行。当评估器调用成本高昂时,团队不得不在覆盖范围和预算之间做出取舍。在本实验中,每次调用仅需 0.00035 美元,Jev 让这一取舍变得不那么严峻。团队可以负担更多重复判断和更频繁的回归检查。这对于在线评估尤为重要,因为更低的单次调用成本让团队能够在更大比例的生产轨迹上运行更多评判器,从而产生更密集的反馈信号。

在线评估实现规模化
对于一个每天产生 10,000 条轨迹的生产智能体而言,观察到的单次调用成本会转化为显著的运营差异。
为了考量低成本调用是否有用,我们将信号价值定义为二元预言机一致度乘以二元可重复性。可重复性是指对同一轨迹进行两次独立调用返回相同判定结果的概率。这会奖励既准确又稳定的评判器,同时惩罚始终出错的评判器。

像 Jev 这样高信号、低成本的评判器可以为在线评估器解锁更好的价值。团队可以 在更多生产轨迹上生成反馈,更早发现质量变化,并在反馈开始朝错误方向变化时设置警报。
一种新型的智能体评估
如今,每一次智能体评估都伴随着取舍。评估更多智能体运行、评估更多维度,或测试更多变更,你的测试成本就会增加。这迫使团队减少评估量,低于他们期望的水平。
在我们的实验中,一次 Jev 判断花费 0.00035 美元。除了低成本之外,Jev 还提供了高准确度和低方差,这意味着评判结果可靠且信号强。以这样的价格获得高质量的评判器,意味着构建者可以针对多个聚焦标准评估每一次智能体运行,衡量每一次智能体变更,并在信心重要时重复判断。
这一点很重要,因为构建出色的智能体需要大量的测试和监控。你评估智能体的频率越高,进入开发循环的有用反馈就越多。
我们仍需观察本实验的结果是否能推广到其他智能体和生产工作流。此外,低成本也可能放大错误——一个始终出错的评估器可能大规模产生糟糕的反馈。工程师仍需将人工审核和评判器对齐纳入他们的工作流。
新的 System One 风格模型可能让高质量评估变得充裕。这可以加速整个智能体开发生命周期。智能体工程师可以将更多轨迹转化为反馈,更早发现回归,并在构建、测试、监控和部署智能体时更快推进。这一突破不仅仅是更便宜的评估,而是为构建可靠智能体打造更紧密的反馈循环。
可复现性
本项目的 GitHub 仓库可在此处获取。
我们通过 LangSmith Gateway 运行了 LLM 评判器:GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6。我们通过 langchain-typesafe==0.0.1a2 访问了 Jev。
为保证可复现性,本次运行使用了 Deep Agents 0.7.15、LangChain OpenAI 1.6.2、LangSmith 0.12.6 和 Tavily Python 0.8.3。我们没有为 LLM 评判器设置 temperature、top-p、seed 或 max tokens,因此应用了各提供商的默认值。实验元数据中未提供 Jev 服务版本。
想了解更多?
如果你想了解更多关于使用 Jev 构建智能体的信息,LangChain 将于 9 月 22 日(周二)举办一场与 TypeSafe AI 团队的直播。
来源:LangChain Blog · langchain.com