Sierra 发布 𝜏-bench:评测真实场景下的 AI 智能体
𝜏-Bench: Benchmarking AI agents for the real-world
Sierra 研究团队发布 𝜏-bench 基准,用于评测 AI 智能体在动态用户与工具交互中的表现和可靠性,包含 𝜏-retail 和 𝜏-airline 两个领域。
Sierra 提出面向真实场景的智能体评测基准,并给出 12 个模型在规则遵循与可靠性上的实测表现。
TL;DR
- Sierra 的 AI 研究团队致力于推进对话式 AI 智能体的前沿。在我们的新研究论文中,我们提出了一个新的基准测试 𝜏-bench,用于评估 AI 智能体在动态用户和工具交互的真实世界环境中的性能和可靠性。
- 目前缺乏好的基准测试来衡量智能体在动态真实世界场景中与人类交互时的可靠性。𝜏-bench 测试智能体在与(LLM 模拟的)用户和工具交互以收集所需信息的同时完成复杂任务的能力。
- 结果表明,使用简单 LLM 构造(如函数调用或 ReAct)构建的智能体即使在相对简单的任务上也表现不佳,这凸显了对更复杂的智能体架构的需求。
背景
AI 智能体是由 LLM 驱动的自主软件系统,使它们能够推理、做出决策,并以创造力和灵活性追求目标,同时保持在为其设定的边界内。智能体在广泛的任务中有着令人难以置信的应用,从处理简单的信息交换和问答,到复杂的故障排除和问题解决。在 Sierra,我们在实现真实世界面向用户的对话式智能体方面的经验使一件事变得极其清晰:对智能体性能和可靠性的稳健测量对其成功部署至关重要。在公司部署 AI 智能体之前,他们需要衡量它在尽可能真实的场景中的工作效果。
研究社区在过去几年中为 AI 智能体构建了若干基准测试(WebArena、SWE-bench、Agentbench 等),但它们在一些关键领域都存在不足。虽然这些基准测试有助于揭示智能体的高层能力,但它们只评估单轮人机交互,其中所有必要信息一次性交换。这与现实场景形成鲜明对比,在现实场景中,智能体通过多次动态交换来收集信息。此外,这些基准测试通常将评估重点放在一阶统计量(如平均性能)上,而不提供可靠性或适应性的度量。
我们构建了 𝜏-bench 来填补这一空白。借鉴我们在生产环境中使用实时智能体的经验,我们将现实智能体基准测试的要求提炼为三个关键点。首先也是最重要的,大多数真实世界环境要求智能体在长时间跨度内与人类和程序化 API 无缝交互,以逐步收集信息并解决复杂问题。其次,智能体必须能够准确遵循特定于任务或领域的复杂策略或规则。这对于确保智能体不违反公司政策或产生不良行为至关重要。第三,智能体必须在规模上保持一致性和可靠性,跨越数百万次交互。这确保了可预测的智能体行为,并让部署它的公司安心。
𝜏-bench 将所有这些元素整合到一个单一的模块化框架中,用于评估和开发面向真实世界用例的智能体。
TAU (𝜏)-Bench:一个工具-智能体-用户基准测试
从高层次来看,𝜏-bench 衡量的是智能体在与(模拟的)人类用户和程序化 API 交互时,能否以一致的方式遵循特定领域的策略。该基准包含若干任务,用于测试使用模块化框架构建的智能体,该框架包括:(1) 逼真的数据库和工具 API,(2) 规定智能体所需行为的领域特定策略文档,以及 (3) 基于 LLM 的用户模拟器,由多样化场景的指令引导,以产生与智能体交互的逼真用户话语。
𝜏-bench 中的每个任务都测试智能体遵循规则、推理、在长而复杂的上下文中记忆信息,以及在逼真对话中进行有效沟通的能力。我们使用了一种有状态评估方案,将每个任务完成后的数据库状态与预期结果进行比较,从而使我们能够客观地衡量智能体的决策能力。这种方法也为对话回复的多样性留出了空间。此外,我们引入了一个新指标 pass^k,用于衡量智能体的可靠性,并确定它能否多次成功完成同一任务(k 表示不同试验的次数)。
以下是 𝜏-bench 的关键特性:
- 逼真的对话与工具使用:得益于语言生成建模的进步,𝜏-bench 具有复杂的数据库和逼真的用户模拟。值得注意的是,通过提示 LLM,我们可以用自然语言指定有趣且多样的用户场景,而不必编写复杂规则。
- 开放式且多样化的任务:𝜏-bench 的数据模式、API 和策略文档足够丰富,能够支持为智能体创建多样化、开放式且富有创造性的任务。
- 忠实的客观评估:𝜏-bench 侧重于根据目标数据库状态评估智能体(而不是评估对话本身),这可以快速且忠实地评估智能体能力,从而无需任何人工或基于 LLM 的评估。
- 模块化框架:𝜏-bench 采用模块化构建,便于轻松添加新领域、数据库条目、规则、API、任务和评估指标。
我们分三个阶段构建了 𝜏-bench:
- 阶段 1:受客户支持领域真实用例的启发,我们手动设计了数据库模式、API 和策略。
- 阶段 2:数据模式设置完成后,我们利用 LLM(GPT-4)生成代码片段,从而能够大规模生成数据条目。
- 阶段 3:我们为每个任务手动生成用于用户模拟的场景以及目标目标状态,并在将任务加入基准之前验证其正确性。
使用上述流程,我们构建了两个领域——𝜏-retail 和 𝜏-airline,处理相应领域中的常见用例。我们选择这些领域,是因为它们在数据合成与策略规范的难易程度,以及多样化、逼真应用的潜力之间提供了良好的平衡。你可以在论文中阅读更多关于基准构建方法的内容。
关键发现
大多数 AI agent 都相对简单,主要使用函数调用或 ReAct 框架构建,后者涉及 LLM 生成 API 调用来采取行动。作为 𝜏-bench 的首次使用,我们评估了由 12 个流行 LLM(包括专有和开源模型)驱动的这类 AI agent。我们发现,我们测试的所有 12 个 agent 都难以解决 𝜏-bench 中的任务,即使表现最好的 GPT-4o agent 在两个领域的平均成功率也低于 50%。
更有趣的是,所有被测试的 agent 在可靠性测试中都表现极差,当任务重新运行时,它们无法始终如一地解决完全相同的任务(请注意,由于用户是模拟的,我们只需重新运行任务,就可以在保持底层任务语义不变的情况下,在话语中生成各种词汇变体)。例如,由 GPT-4o 驱动的 agent 在 𝜏-retail 中的 pass^8 降至约 25%,与其对应的 pass^1 分数相比,下降了惊人的 60%。实际上,这意味着 agent 只有 25% 的概率能够解决 8 个不同客户的同一问题——这一数字远远落后于真实世界面向用户的 agent 的预期。
我们进一步手动分析失败案例,并将其分解为四个象限,这为改进 agent 能力提供了可操作的见解。关键挑战在于提高它们持续遵循规则、进行长时程规划以及专注于对话中正确信息片段的能力,尤其是在可能存在相互冲突的事实时。特别是,我们发现函数调用 agent 不太擅长遵循策略文档中提供的规则。
迈向现实世界中更可靠的 agent
Sierra agent 拥有比上述发现中描述的更广泛的能力。首先,Sierra 的 Agent SDK 使开发者能够以声明式方式指定 agent 行为,编排它们以准确执行复杂任务。Sierra agent 还受到监督 LM 模型的管理,这些模型确保 agent 性能一致且可预测,同时还能轻松适应独特的对话和无限的用户场景。在我们部署和评估 agent 时,我们的 Agent Development Life Cycle 允许快速迭代,以提高 agent 质量并确保符合特定领域的策略。我们计划使用 𝜏-bench 来帮助编译、定制和微调我们的模型组合,以实现卓越性能。此外,我们的研究团队正在研究新的规范框架和认知架构,以实现更可靠、更一致的 agent。
虽然 𝜏-bench 为动态智能体评估提供了一种新思路,但该基准在未来仍有若干改进方向。首先,我们可以通过更先进的 LLM 来提升用户模拟的保真度,这些 LLM 能够改进推理和规划,同时创建更复杂的场景。其次,我们可以构建新方法,通过使用自动化工具来降低标注难度。最后,我们可以开发更细粒度的评估指标,以测试智能体在对话中其他方面的行为(例如使用恰当的语气和风格)。我们希望 AI 研究社区能发现 𝜏-bench 在开发更强大、更可靠的 AI 智能体方面很有用,并在此基础上构建更先进的评估。
你可以在这里找到 𝜏-bench 的代码和数据。
来源:Sierra Blog · sierra.ai