Sierra 发布 τ-knowledge 基准,新增 τ-Banking 场景评测智能体知识检索能力
𝜏-knowledge: benchmarking agents on real-world knowledge
Sierra 发布 τ-knowledge 基准,在原有对话基准 τ-bench 上新增 τ-Banking 场景,围绕 698 篇文档、21 个产品类别的知识库评测智能体的检索、推理与多步工具调用能力。
Sierra 公开了 τ-Banking 基准与 11 个前沿模型的实测结果,可对照检索型智能体在真实知识库任务上的能力差距。
面向客户的智能体,其表现完全取决于它能否找到并应用正确的信息。在实践中,这意味着要在庞大、杂乱且不断演变的知识库中穿行,例如政策手册、产品目录、流程指南和内部工具说明。
尽管这在现实场景中非常普遍,但现有的基准测试并未很好地捕捉这种复杂性。它们测试的是智能体查找信息的能力,或采取行动的能力,但很少同时测试两者。
𝜏-knowledge 填补了这一空白——它评估智能体在搜索真实知识库、对检索到的内容进行推理并执行多步骤工具调用的能力,同时还要处理实时用户对话。
引入 𝜏-knowledge
𝜏-knowledge 扩展了 Sierra 的对话基准 𝜏-bench,新增了一个领域:𝜏-Banking,这是一个受金融科技启发的客户支持场景,围绕一个真实的知识库构建,包含 21 个产品类别的 698 份文档(约 195K tokens)。覆盖范围涵盖个人和企业支票账户、分层储蓄、奖励信用卡、先买后付计划等。文档不仅详细说明了面向客户的产品规格——APY 利率、费用、返现结构——还包含内部智能体协议:争议处理程序、卡片补发工作流、挽留优惠和身份验证。
任务要求智能体搜索这些文档、对检索到的内容进行推理并执行多步骤工具调用。每个任务平均需要来自 18.6 份文档的信息,平均执行 9.5 次工具调用,有些任务最多需要 33 次。下面的演示将其中一个任务浓缩为关键轮次。智能体必须处理两个请求——一笔交易争议和一次信用额度提升——这要求它:(1) 从知识库中检索两项政策;(2) 认识到这些政策相互影响且顺序很重要;(3) 发现并串联仅存在于知识库中的多个流程;(4) 拒绝用户后续提出的与政策相矛盾的诉求。跳过或错排其中任何一步,都会导致最终数据库状态错误。
𝜏-Knowledge 的前沿如何变化
当我们在 2026 年 3 月初首次发布 𝜏-knowledge 时,情况令人警醒:最好的前沿模型——开启高推理的 GPT-5.2——首次尝试(Pass^1)仅通过 25.5% 的任务,可靠通过(Pass^4)仅 9.3%。即使我们完全移除检索挑战,直接将相关文档交给智能体,上限也只有约 40% Pass^1。相比之下,前沿模型在现有的 𝜏-Bench 领域(如航空、零售和电信)上通常能突破 80% Pass^1。具备检索意识的知识工作确实是一个真实的缺口。
在此后的几个月里,我们在标准化检索设置下,以最大推理努力评估了 11 个前沿模型变体——让每个模型都能使用 BM25、稠密嵌入和自由形式的 shell,并让它自行选择搜索策略。前沿已显著推进。
开启 xhigh 推理的 GPT-5.5 目前以 37.4% Pass^1 领跑排行榜——较发布时的最佳成绩提升了 11.9 个百分点,Pass^4 从 9.3% 翻倍以上至 20.6%。但 𝜏-knowledge 仍远未饱和:即使领先模型在最大推理努力下,也仍有约 60% 的这些任务失败。
强智能体与其他智能体的区别
通过分析各模型数千条智能体轨迹,可以发现区分最强智能体的行为模式:
- 强大的模型将检索视为持续进行的过程,而非一次性步骤。 最弱的智能体将检索视为一次性的前置步骤:在任务开始时搜索,然后基于返回的结果进行操作。最强大的智能体则会在对话引入新上下文时持续搜索知识库——它们认识到客户在任务中途的转向(“实际上,这是医疗紧急情况”)可能会解锁智能体在第一轮时并不知道要查找的新内部流程。例如,当客户变得越来越沮丧时,GPT-5.5 会发起后续搜索以确定正确的升级协议;较弱的模型则会坚持最初的策略并停止搜索。
- 强大的模型搜索得更聪明,而非更费力。 在 GPT 系列中,5.5 发出的搜索查询比 5.2 更少(每个任务 19.4 → 9.1 次搜索),而 Pass^1 却上升了 12 个百分点。改进不在于数量——而在于针对性。GPT-5.5 发出精准的查询,如“transfer reason codes customer frustrated demands human medical emergency”,第一次尝试就能找到正确的内部文档;较旧的模型则大量发出相关但不精确的查询,直到碰巧命中。
- 强大的模型知道何时行动——以及何时不行动。 许多模型会陷入这样的陷阱:正确执行预期操作,然后在未经用户许可的情况下添加表面上看似有用的额外操作(例如,在预期的换卡订单之外同时提交欺诈争议)。强大的智能体能够识别预期操作集并停止。与 4.6 更急切的行为相比,Opus 4.7 更严格的校准在这一维度上有所帮助。
开放评估以推进前沿
随着智能体越来越多地部署到知识密集型工作流中,评估需要反映它们在实践中面临的相同条件。𝜏-Banking 远未解决,仍有约 63 个百分点的 Pass^1 提升空间。上述行为模式指出了模型接下来需要解决的具体校准问题。
我们邀请模型提供商和智能体开发者通过在 𝜏-Banking 上评估其模型,使用 𝜏-knowledge 来衡量智能体在知识接地任务上的实际水平。该基准是开放的,任务是可验证的,当前性能与可靠部署之间的差距是显而易见的。
来源:Sierra Blog · sierra.ai