跳到正文
Sarvam AI·· 2026-02-02精选AI 评分62

Sarvam AI 发布 Sarvam Audio 语音识别模型

Sarvam Audio: Speech Recognition beyond Transcription

AI 导读

Sarvam AI 发布 Sarvam Audio,这是 Sarvam 3B 的音频扩展,覆盖 22 种印度语言和印度英语,支持五种转写格式控制、最长 60 分钟音频的说话人分离,以及基于对话上下文的语音识别。

推荐理由

Sarvam Audio 把语音识别从转写扩展到格式控制、说话人分离和上下文理解,并给出与 GPT-4o-Transcribe、Gemini-3-Flash 的对比结果。

正文 · AI 翻译
  1. 首页
  2. /
  3. 博客

研究


2026年2月2日 · 6分钟阅读

Sarvam Audio: Speech Recognition beyond Transcription

印度是一个语音优先的国家。键盘的刚性结构难以捕捉印度语言的流动性,而对大多数人来说,说话比打字更自然。从查询作物价格的农民,到接收导航指令的零工工作者,再到使用 WhatsApp 和智能电视的老年用户,语音是默认的交互方式。

这一现实既是机遇也是挑战。传统的自动语音识别(ASR)系统在干净、朗读式语音的基准测试中表现良好,但在真实的印度环境中往往失效。在实践中,仅凭准确率是不够的。印度的语音识别必须超越转录。

三大核心挑战尤为突出:

第一,文字系统控制 印度说话者会自由地在语音中混入英语。在某些应用中,英语单词必须以罗马字母保留,而在另一些应用中,则必须转写为本地文字。单一的固定输出格式行不通。

第二,多说话人分离 真实世界的音频往往涉及多个说话人同时讲话。准确的识别不仅需要转录,还需要可靠的说话人识别与归属。

第三,上下文感知 语音识别系统必须利用对话中先前轮次或长音频中累积的上下文来改进。没有这一点,短话语、歧义短语和噪声片段经常被误读。

Sarvam Audio 解决了这些挑战。

Sarvam Audio 是 Sarvam 3B 的音频扩展,后者是一个30亿参数的语言模型,从零开始在英语和22种印度语言上预训练。Sarvam Audio 超越了传统 ASR 系统,能够生成多种用户可控的转录格式,并将语音建模为上下文信号,以支持在长时长、对话场景、多说话人音频和面向操作的语音交互中的稳健识别。

精细控制的转录格式

真实世界的语音应用不仅需要控制转录什么,还需要控制如何呈现。印度语音本质上是多语言和语码混合的,不同的下游用例需要不同的转录格式。

Sarvam Audio 允许应用在推理时明确指定所需的转录风格。Sarvam Audio 支持五种转录模式:

音频语言模型语音特征

评估

为了量化转录格式控制的影响,Sarvam Audio 使用词错误率(WER)指标,在三种转录风格——未规范化、规范化和语码混合——下与 GPT-4o-Transcribe 和 Gemini-3-Flash 进行了对比评估。

在所有转录风格中,Sarvam Audio 始终优于基线模型,表明格式控制不必以牺牲准确率为代价。

最先进的说话人分离语音识别

真实世界的音频很少是单说话人的。会议、访谈和对话往往涉及多个说话人、重叠语音和快速轮换发言。在这些场景中,准确的语音识别既需要高质量的转录,也需要可靠的说话人归属。

Sarvam Audio 在带说话人分离的语音识别上达到最先进性能,可处理长达60 分钟的音频,在准确转写语音的同时识别出谁说了什么。

评估

  • 词级说话人分离错误率(WDER)(越低越好)衡量被归因到错误说话人的对齐词(包括匹配和替换)所占的百分比。
  • 说话人分离错误率(DER)(越低越好)衡量说话人混淆、误报和漏检语音的总和,并按总语音时长归一化。

评估设置

  • 基于真实会议录音构建的内部基准
  • 专家人工标注
  • 音频长度:1-60 分钟
  • 最多 8 位说话人
  • 大量重叠语音

上下文语音识别

上下文对于解码真实世界音频至关重要。LLM 主干使 Sarvam Audio 能够利用通过文本描述或对话历史提供的上下文,在棘手场景中显著提升转写质量。

  • 解决短话语中的语言歧义当用户对数量提示回答“नौ (Nau)”时,Sarvam Audio 利用对话上下文将其正确理解为印地语数字九,而不是英语单词no。
  • 从嘈杂音频中恢复语义在声学环境退化的情况下,如果用户说“Bhaiya, loc son bhejo”,Sarvam Audio 会利用配送领域上下文重建出预期短语“Bhaiya, location bhejo”。
  • 领域感知转写在股票市场讨论中,Sarvam Audio 将“M&M”正确转写为Mahindra & Mahindra,而不是字面短语“M and M”。

示例

评估

在反映印度语言真实世界对话语音的基准上,Sarvam Audio 优于 Gemini-3-Flash。

由于 WER 或 CER 仅能捕捉词级相似度,因此不单纯依赖它们,而是使用基于 LLM 的意图与实体保留分数,它能更好地反映真实对话和基于命令的使用场景。

评估指标:

  • 意图保留——话语的核心动作和意图是否被正确理解。
  • 实体保留——姓名、数字、地点和组织等关键实体是否被保留。

Sarvam Audio 在各语言上展现出一致的性能优势。评估框架已开源此处,并且合成上下文 ASR 基准(印度语言)已在 Hugging Face 上公开发布。

基准概述。该基准评估面向语音机器人交互的上下文感知 ASR,覆盖前 10 大印度语言。每个样本代表单轮对话,包含音频、真实转写、语言以及丰富的对话上下文(机器人人设、历史和提示)。该数据集跨银行、电商和医疗等领域合成生成,旨在测试上下文偏置、意图保留和端到端口语理解。

语音到命令

语音智能体如今已无处不在。大多数现有系统依赖两阶段架构:音频首先由 ASR 模型转写,然后由单独的 LLM 进行理解。虽然有效,但这种方法引入了额外的延迟,并且常常破坏上下文连续性,尤其是对于简短或嘈杂的话语。

Sarvam Audio 证明,高精度的函数调用和参数提取可以直接在音频模态上执行。

通过在语音上端到端运行:

  • 意图和上下文得以保留
  • 延迟显著降低
  • 系统复杂度得以简化

借助小规模、特定领域的微调数据集即可实现生产级理解,从而无需大模型开销即可快速可靠地部署语音智能体。

在上面的示例中,Sarvam Audio 以先前的对话上下文为条件,直接从语音输入中推断出合适的函数名称及其参数,从而实现精确的函数调用。

结论

Sarvam Audio 从底层重新思考了面向印度的语音识别。它提供覆盖 22 种印度语言和印度英语的最先进 ASR,同时应对语码混合、文字变体、长音频、说话人重叠和对话上下文等现实情况。

更重要的是,它超越了传统 ASR。凭借内置的上下文感知、说话人分离、格式控制和直接的语音到命令能力,Sarvam Audio 为面向真正印度用户构建的新一代语音优先应用和智能体奠定了基础。

Sarvam Audio 将很快在 Sarvam Dashboard 上提供。

语音就是界面。Sarvam Audio 让它为印度服务。

来源:Sarvam AI · sarvam.ai