跳到正文
LangChain Blog·· 2026-08-24精选AI 评分62

LangChain 与 Fireworks 微调 Qwen 打造成本低 100 倍的 Trace Judge

Building a 100x Cheaper Trace Judge with Fireworks

AI 导读

LangChain 与 Fireworks 合作微调 Qwen-3.5-35B 作为 trace 评判模型,用于从用户交互中检测 Perceived Error,即用户认为助手出错或需要纠正的信号。

推荐理由

LangChain 与 Fireworks 用微调 Qwen 做 trace 评判的完整实验,含跨数据集迁移与成本对比数据,可迁移到自建评测器。

正文 · AI 翻译

如今,智能体产生了世界上大部分数据,并驱动着我们今天使用的许多应用。 随着越来越多的智能体投入生产,追踪记录将变得更加重要,因为它们是理解智能体系统如何与真实用户交互的最丰富的数据来源之一。

研究问题:我们如何能够经济高效地从每一条追踪记录中挖掘出重要信号,同时保持前沿性能?

为了回答这个问题,我们与 Fireworks 合作,微调了一个 Qwen 评判模型,以从用户交互中检测“感知错误”。

什么是感知错误:

感知错误是指用户认为助手犯了错误或产生了需要纠正的内容。感知错误并不是在评判客观正确性或用户满意度。例如,智能体可能给出了正确的答案,但用户对信息本身(而非智能体)感到不满。

我们通常推动团队构建针对特定应用的评估器,因为评判一条追踪记录的逻辑往往需要具备该应用的上下文。然而,我们认为“感知错误”是一个可以通用化的评估器示例。我们相信它所寻找的信号在各应用中是普遍适用的。

“感知错误”的通用性是一个关键问题。我们后续进行的一些实验正是专门为了测试这一指标的通用性。

我们从追踪信号中推断感知错误,例如用户纠正、拒绝智能体操作、重复请求以及助手承认错误。感知错误评估器随后会以下面所示的格式为追踪记录补充信息:

{"perceived_error": true, "reason": "The user corrects the meeting date the assistant used."}

我们如何创建数据集

应用于任务的智能体,其表现取决于用于训练它们的数据。我们从生产环境中使用的两个内部追踪数据集中获取数据:

chat-langchain

一个文档问答智能体,回答关于 LangChain 库和产品的问题。用户可能会提出概念性问题、调试问题,或寻求构建方面的帮助。这些交流通常具有技术性,并涉及大量细节

Fleet

一个无代码工具,用于创建能够完成实际工作(如撰写文档和进行研究)的智能体。用户可能将 Fleet 用于各种各样的任务。他们可能会调用许多不同的工具或技能。

我们从每个追踪数据集中选取了一部分追踪记录作为训练集和留出集。在从追踪记录池中筛选时,我们选择了多轮追踪记录,因为评判“感知错误”需要人类对 AI 结果的回应(例如,纠正助手或重复请求)。

使用多个数据集的动机之一是为了测试“感知错误”的通用性。一个在一个数据集上训练用于检测感知错误的模型,能否迁移到另一个数据集上?

数据集 总示例数 训练行数 留出行数
chat-langchain 885 707 178
Fleet 911 727 184

数据准备

在准备训练和预测数据时,我们选择只包含人类和 AI 消息,忽略所有工具调用。我们这样做是因为我们假设,对于我们所寻找的信号,人类和 AI 消息是主要的信息来源。这是我们打算在未来进行实验的一个调节杠杆。

我们还按原样包含了所有消息,没有对长内容进行裁剪。这是我们打算在未来进行实验的另一个调节杠杆。

标签

为了生成标签,我们结合了模型辅助标注和人工审核,为每条 trace 创建简短的 JSON 标签和理由。具体来说,我们首先让一组模型对一条 trace 进行评判。如果它们意见一致,我们就将其作为真实标签。如果它们意见不一致,我们就把它们所有的标签和理由传给另一组模型,让它们评判谁是对的。如果这组模型意见一致,我们就将其作为真实标签。如果它们仍然意见不一致,我们就人工进行标注。 在整个数据集上,chat-langchain 和 Fleet 分别有 24% 和 18% 的 trace 带有感知错误标签。

微调设置

在训练方面,我们在对其他模型进行了一些小规模测试实验后,选择 Qwen-3.5-35B 作为我们的基础模型。更小的模型错误率很高,不足以对我们的多轮 trace 进行推理。使用 Qwen-3.5-35B,我们得到了一个强大、廉价的开放模型,并且有通过微调达到前沿性能的空间。

我们仅使用 chat-langchain 数据集中的数据进行训练。只在一个数据集上训练的原因是为了让我们能够测试它是否能迁移到一个完全不同的领域。

我们还在观察到基础模型小规模实验中的常见失败模式后,对输入提示进行了轻度优化。在训练方面,我们使用了 在 Fireworks 上使用 LoRA 的托管 SFT 训练。

实验与结果

我们围绕三个问题组织实验:

  1. 微调能否将基线评判质量提升到前沿模型性能?
  2. 学习到的评判器能否跨数据集迁移?
  3. 服务一个微调后的模型是否具有成本效益?

微调开放模型可以超越或匹敌前沿模型

模型 chat-langchain 准确率 Fleet 准确率
基础 Qwen 90.5% 83.2%
Chat-langchain SFT 96.1% 90.8%
Fleet SFT 92.7% 91.3%
Claude Opus 91.6% 90.2%
GPT-5.5 98.9% 89.1%

我们发现,经过良好提示的基础 Qwen 在感知错误分类方面是一个强大的开箱即用模型,但落后于前沿模型的分类准确率。在两个数据集上,运行 LoRA SFT 任务都将基础模型提升到接近或超过前沿性能。

除了与前沿模型进行基准比较外,我们还与更小、更便宜的模型进行了比较。运行高吞吐、低成本推理工作负载的一种常见策略是使用最小的闭源前沿模型,例如 Haiku。但我们一致发现,强大的开放模型开箱即用就能超越 Haiku,同时运行成本要低得多。

微调后的评判器能很好地迁移到未见过的数据

我们的初步结果表明,Fleet 对所有模型来说都是一个更具挑战性的数据集。在 chat-langchain 上微调后,我们测试了该模型在没有任何 Fleet 特定训练的情况下迁移到 Fleet 数据的效果。在 chat-langchain 数据上训练的模型在 Fleet 数据上超越了所有前沿模型。

随后我们尝试专门在 Fleet 数据上训练一个模型。这相比我们在 chat-langchain 上 SFT 的模型带来了小幅提升。

这是一个重要结果,因为:

  1. 它表明我们的感知错误模型能够迁移到其他领域,并仍保持前沿水平的性能(在此情况下略高于前沿)。
  2. 对于希望在自己数据集上进一步提升感知错误(或其他微调评判器)性能的构建者来说,他们可以选择在应用特定的 trace 上进行微调,以获得进一步的性能提升。

微调后的模型运行成本要低得多

经过微调的模型可达到前沿准确率,并且在大规模运行时成本低得多——根据 trace 量和模型选择的不同,可便宜 10-100 倍。 随着 trace 量的增长,微调模型带来的成本节省会持续增加。 在性能方面,微调后的 Qwen 模型优于所有规模的 Haiku、Sonnet 和 Opus(以及 gpt-5.5)。

关于 trace 理解的未来研究

解决持续学习将涉及处理围绕 trace 理解的大规模数据挖掘问题。总的来说,我们很兴奋能够推进构建专门化、高性价比模型以更好地理解 trace 的方案。

开放模型已经跨过了智能门槛,如今在许多任务上都是开箱即用、高性价比的强分类器。借助 Fireworks 易于使用的训练与推理基础设施,我们能够将开放模型推向前沿性能,同时运行成本低几个数量级。

未来的研究方向包括帮助团队设计良好的训练目标和评分标准,为他们的 agent trace 构建自己的评估模型。我们对 agent trace 理解得越多,在做出改进 agent 的变更时就能做出越明智的决策。

试用我们的感知错误模型

我们将在未来几周内向部分精选客户推出微调后的感知错误模型,随后在一两个月内进行更广泛的发布。如果你有兴趣测试这个感知错误评判器并提供反馈,请在此报名。

‍

来源:LangChain Blog · langchain.com