跳到正文
Sierra Blog· Soham Ray, Keshav Dhandhania, Victor Barres·· 2026-05-02精选AI 评分66

Sierra 发布 τ-voice:在真实任务上评测实时语音智能体

𝜏-voice: benchmarking real-time voice agents on real-world tasks

AI 导读

Sierra 发布 τ-voice,首个把可验证任务完成度与实时对话动态放在同一通电话里评测的语音智能体基准。它沿用 τ-bench 的 278 个客服任务、工具与评测器,用户与智能体可同时说话、打断和反馈,并叠加环境噪声、口音与电话压缩等真实音频条件。

推荐理由

Sierra 把 τ-bench 的 278 个客服任务搬到全双工语音场景,让语音与文本成绩可直接对比。

正文 · AI 翻译

语音正迅速成为智能体系统的主要接口,然而如今的评估格局却将语音智能体一分为二。

音频基准测试衡量的是对话动态——模型是否会礼貌地打断、优雅地让出话轮、识别附和语、在噪声下听起来自然?但它们很少检查智能体是否真正解决了来电者的问题。另一方面,任务完成基准在文本领域已经相当成熟(其中包括 𝜏-bench):它们严格验证智能体是否调用了正确的工具、遵循了正确的策略、以正确的方式更改了数据库——但它们假设的是干净的文本通道,从未让智能体接触真实音频。

风险在于,交付的语音智能体可能一边进行着迷人的对话,一边悄悄地在底层任务上失败——或者反过来,智能体在文字上能完美完成任务,但一旦真实来电者开始抢话,就立刻崩溃。例如:

一位客户致电要求更改其账户。繁忙街道的背景噪声和陌生的口音让语音识别器出错,身份验证失败。

  1. 智能体会要求他们拼写自己的名字吗?
  2. 如果他们拼写了,智能体能正确转写吗?
  3. 如果能,它真的会修复失败的身份验证调用吗——还是会在跨越三轮对话的更正信息中迷失方向?

标准基准测试都无法捕捉这样的失败,因为每一步孤立来看都没问题。将两个维度一起衡量——在同一次通话中、在真实音频条件下,同时评估任务完成和对话动态——才能让我们看到这些集成性失败,量化智能体的文本能力在迁移到语音后还剩下多少,并为受影响最严重的人群暴露回归问题:口音不标准的说话者、来自嘈杂环境的来电者、连接质量差的用户。对真实音频条件的鲁棒性是一个无障碍问题。

这也是一件值得及时衡量的事情。音频原生模型——无需中间转写即可端到端接收和生成语音的系统——是智能体 AI 的下一个前沿。它们已由 OpenAI、Google 和 xAI 普遍提供,并且正在快速改进。一个对任务和对话都敏感的基准,让我们能够精确追踪这一前沿的推进速度。

推出 𝜏-voice

𝜏-voice 是首个将此前一直孤立评估的三件事结合起来的基准:

  • 与文本基准共享的可验证、有依据的任务: 278 个继承自 𝜏-bench 的客户服务任务,根据最终数据库状态进行确定性评分。任务、工具、策略文档和评估器与 𝜏-bench 排行榜上文本智能体使用的逐字节完全相同。这意味着本文中的语音数字可以直接与同一任务上的文本智能体进行比较——语音对文本,在完全相同的问题上,没有苹果对橘子的保留条件。
  • 实时、同时语音: 用户和智能体可以同时说话,有重叠、打断和附和语——即全双工模式,与文本智能体的半双工、严格轮次制设置形成对比。一个基于 tick 的编排器协调双向的 200 毫秒音频块,允许智能体在句子中间被打断,并让我们对轮次转换时机进行精确、可重复的控制。
  • 逼真、可控的音频:一个语音用户模拟器,能够合成具有多样化人设的来电者语音,混入环境噪声,应用电话压缩,丢弃帧,并逐轮决定是打断、让出话轮还是附和。

一个值得指出的实现细节:主流语音提供商 API(OpenAI Realtime、Gemini Live、xAI Grok)并不要求模拟通话实时进行。我们可以按任意节奏运行会话,而不会改变智能体听到的内容,这意味着用户模拟器不受实时延迟或 token 预算的约束——我们可以自由选择最适合模拟来电者的文本 LLM(在我们的实验中是 GPT-4.1)。采用这种方法,我们无需在强大的模拟器、对轮次转换的精确控制和可复现的运行之间做出取舍。

语音用户模拟器,端到端

在每个 tick,模拟器依次做四件事:以文本形式生成下一个来电者话语,通过语音人设将其合成,将合成语音与环境音频(背景噪声、口头习惯音、非指向性言语)混合,并应用信道退化(8 kHz 下的 G.711 µ-law 压缩、动态闷音、通过 Gilbert–Elliott 模型进行帧丢弃)。一个独立的、由 LLM 驱动的轮次转换策略每两秒评估一次,决定是打断、让出话轮还是附和。

语音模型进步飞快——真的很快

由于 𝜏-voice 从 𝜏-bench 继承了其任务、工具和评估器,语音数据可以直接绘制在与文本相同的坐标轴上。下图是 𝜏-voice 的进展时间线——与实时排行榜的 Progress over time 面板所呈现的视图相同——并叠加了两条文本参考线:当前文本推理上限(约 85% pass@1,Gemini 3 Pro / GPT-5.2 / Claude Opus 4.5),以及一个强大的非推理文本基线(54%,GPT-4.1)。

在大约八个月里,语音前沿已从 30%(OpenAI 的 gpt-realtime-1.0,2025 年 8 月)提升到 67%(xAI 的 grok-voice-think-fast-1.0,2026 年 4 月),越过了非推理文本线,并已接近推理上限的大部分路程。最大的单次跃升是最近的一次:由 xAI 的启用推理的音频原生模型驱动,在大约两个月内跃升了 +29 个百分点。这一模式在文本中似曾相识:为音频原生模型添加显式推理,可解锁工具使用可靠性的阶跃式提升。语音从论文撰写时保留约 45% 的文本能力,到今天约 79%,全程使用相同的领域和评估器,没有任何附加条件。

要探索完整排行榜——包括按领域细分、自定义提交、同一个 Progress-over-time 面板以及底层轨迹——请直接前往 𝜏-voice 排名(或 𝜏-bench 文本排名以进行直接比较)。到目前为止,我们已与所有主流音频原生提供商合作。上图还会继续变化。

实际出了什么问题

在深入失败案例本身之前,先看看在论文时代的模型上,当我们从 Clean(单一人设、无声学效果、严格轮次转换)切换到 Realistic(多样化人设、环境噪声、自由形式轮次转换)时,各提供商的 pass@1 如何变化会有所帮助——绝对下降幅度各不相同,但每个提供商都受到了影响。

知道每个提供商都会受到影响是一回事。知道哪些错误导致了这种影响则是另一回事。两位标注员在两个分析队列中标记了每一个失败的模拟——Voice-Fragile(文本模型通过但 voice-Clean 模型失败的任务)和 Noise-Fragile(voice-Clean 通过但 voice-Realistic 失败的任务)——同时标记了第一个关键错误的来源和类型。

最重要的四种失败模式

"真实感"的每个成分在多大程度上加剧了失败?

为了量化"真实感"的每个部分对上述失败模式的贡献程度,我们在零售领域进行了消融实验——在原本干净的条件基础上,一次添加一个因素:背景噪声、多样化口音和轮流对话动态。

聆听真实的 𝜏-voice 失败案例。同一任务,干净条件与真实条件,并排对比——附带可播放的、带标注的语音活动时间线。打开音频示例 →

如果你在构建语音代理或运营语音平台,实现一个适配器并联系我们——我们很乐意将你的系统加入排行榜。

𝜏-voice(目前)不衡量什么

我们对范围有明确的界定。有几件事 𝜏-voice 确实做了简化,以及后续计划:

  • 仅限英语,TTS 介导的口音:多样化口音由 ElevenLabs 角色生成,而非录制真人说话者。这足以揭示各提供商之间的巨大差距,但绝对数字应被视为指示性的而非确定性的。我们将 𝜏-voice 严格限定在英语和 TTS 驱动的角色范围内。更广泛的语言和录制说话者覆盖留给未来的基准测试。
  • 用户侧的转录注入:用户模拟器直接读取代理的转录文本,而非转录代理的音频。在我们的手动审查中,91 个抽样模拟中代理语音的可理解率为 100%——代理侧 ASR 目前不是问题——但随着语音模型变得更具表现力,这一假设可能需要重新审视。
  • 不评估代理语音质量:我们衡量代理说了什么(以及是否采取了正确的行动),而非它说得有多自然。添加语调、自然度和用户感知指标是直接的后续工作。
  • 级联基线:该框架支持级联 ASR→LLM→TTS 流水线以及音频原生模型,但我们尚未发布正面比较。这是将"语音模态"与"模型架构"效应隔离开来的最清晰方式。

开放、可复现,任你构建

𝜏-voice 是更广泛的 𝜏-bench 框架的一部分。任务、环境、语音用户模拟器、音频效果、轮流对话策略和评估全部开源。这里的每个结果都可以从固定种子复现(LLM 随机性除外),示例页面上的每个音频样本都来自真实的 𝜏-voice 运行,排行榜上的每个语音提交都附带其轨迹,因此你可以端到端重放对话。

官方语音角色是保留的,但一个单命令脚本可以通过相同的 ElevenLabs Voice Design API 生成等效角色,因此外部开发者可以在本地迭代,并期望改进能够延续到官方评估中。

如果你训练语音模型、评估语音智能体,或者只是想了解当今系统在哪些方面会出问题,我们非常欢迎你的贡献——新的音频原生提供商、级联式 ASR→LLM→TTS 基线,以及针对用户模拟器的 pull request 都欢迎。

无论我们是否仔细衡量,语音智能体都将投入生产。 我们更愿意仔细衡量它们。

完整详情请参阅我们的论文、代码和排行榜。该框架由 Sierra 的 Soham Ray、Keshav Dhandhania 和 Victor Barres 构建,普林斯顿大学的 Karthik Narasimhan 参与其中。

来源:Sierra Blog · sierra.ai