Sarvam AI 发布语音识别模型 Saaras V4
Introducing Saaras V4
Sarvam AI 发布新一代语音识别模型 Saaras V4,采用音频编码器加自研 3B 混合状态空间 LLM 解码器,支持 transcribe、translate、verbatim、translit、codemix 五种转写格式。
原文给出 Saaras V4 的架构、五种转写模式与多语言基准结果,可据此判断多语种语音识别的落地方式。
面向多语言世界的 ASR 下一次飞跃
公告产品
2026年9月25日 · 6 分钟阅读

我们发布 Saaras V4,这是我们语音识别模型的最新一代。
本文介绍 Saaras V4 背后的工作,包括用于训练它的数据、我们的预训练方法、支持多种输出模式的架构与解码改动,以及我们结果背后的评估方法。我们还报告了在印度语言、英语以及具有挑战性的真实语音条件下的基准性能。
亮点
- Saaras V4 使用音频编码器和 LLM 解码器。LLM 解码器是一个 3B 混合状态空间模型,完全由我们内部从零训练
- Saaras V4 在所有 22 种印度语言上取得了 SOTA 性能,并再次确认我们对即使资源最匮乏的印度语言的承诺
- Saaras V4 在七个全球英语数据集上取得了最低 WER,其中六个是外国英语方言,一个是印度英语
- 你可以选择最适合你的格式:Saaras V4 支持五种转写格式:transcribe、translate、verbatim、translit 和 codemix
- Saaras V4 对嘈杂音频和语码混合具有鲁棒性。它也能无缝处理方言差异
- 其语言识别也是一流的:在排名前十的印度语言中错误率为 2.9%,在所有 22 种语言中为 5.22%
深入了解 Saaras V4
Saaras V4 将音频编码器与一个 3B 混合状态空间语言模型配对,该模型由我们内部从零训练。
我们将系统设计为能够处理我们在实践中见到的各种语音,包括语码混合、方言差异和嘈杂音频,同时支持表示同一语音的五种不同方式:逐字转写、规范化文本、语码混合文本、音译和翻译。
英语基准上的性能
我们在七个英语语音识别基准上评估了 Saaras V4,涵盖印度英语、国际口音、会议、媒体、金融和其他真实语音场景。在这些数据集上,Saaras V4 取得了最低的平均词错误率。
AMI
会议室、远场麦克风
GigaSpeech
播客、有声书、网络视频
LibriSpeech clean
朗读语音、录音室条件
LibriSpeech others
朗读语音、更困难的声学条件
SPGISpeech
财报电话会议、金融词汇
VoxPopuli
欧洲议会演讲
Svarah
印度口音英语
评估方法
- 六个国际数据集:采用 HuggingFace 的
Open ASR Leaderboard 已发布结果
- 一个印度口音英语数据集:由 AI4Bharat 发布的
Svarah
- 归一化和评分遵循 Open ASR Leaderboard 的
代码
Saaras V4 的 Indic 基准:
Vistaar
我们在 Vistaar 上对 Saaras V4 在十种印度语言中进行评估,并报告标准词错误率(WER)和 LLM-WER。
WER 仍然是语音识别的标准确定性度量,计算参考转录和预测转录之间的替换、删除和插入。然而,在印度语言环境中,其中一些差异可能是拼写或格式变化,不会实质性地改变口语内容。
为了考虑这一点,我们还报告了 LLM-WER,它增加了一个语义裁决步骤,以确定不匹配是改变了转录的含义,还是仅仅以不同方式表示相同的内容。
因此,这两个指标是互补的。WER 提供了一个可重复的基线,而 LLM-WER 则提供了对影响底层语音内容的错误的更忠实视图。
各种基准的详细分解:
五种模式,一个模型
不同的应用需要同一语音的不同表示。合规存档可能需要逐字转录,而 CRM 工作流可能需要规范化文本,分析系统可能需要英文翻译。这些转换通常通过单独的后处理步骤处理,这增加了复杂性并可能引入额外错误。
Saaras V4 在模型内部处理这些需求。从相同的音频输入中,它可以生成五种转录模式:逐字、规范化、代码混合、音译和翻译。
- 逐字: 以口语的母语文字进行精确转录
- 转录: 以口语的母语文字进行精确转录,并对数字和日期进行规范化
- 代码混合: 转录模式加上保留母语中的英语单词为英语,以提高可读性
- 音译: 进行转录,但使用英语文字。口语中称为“WhatsApp 语言”
- 翻译: 音频的英文翻译,数字已规范化
因为所有五种模式都来自一个模型,所以没有可能导致错误级联的额外预处理步骤。
超越转录
a. 一流的语言识别
Saaras V4 可以直接从音频中识别口语,并以相应的母语文字进行转录,无需事先指定语言。在已验证的 IndicVoices 话语上,所有 22 种印度语言的语言识别错误率为 5.22%,在十种最广泛使用的语言中降至 2.9%。
b. 关键词提示
关键词提示允许您将转录偏向于容易遗漏的单词或短语,例如产品名称、人名、首字母缩略词或特定领域的术语。
在 ai4bharat/IndicContextEval(Interspeech 2026)上验证为最佳:Saaras V4 在 L5(关键词提示)设置中达到最低 WER 16.03%,其中领域实体列表以母语文字随语言一起提供。有关数据集详细信息和竞争对手分数,请参阅
论文。
c. 为真实世界音频而构建
现场音频被压缩、削波,并且充满干扰。在这些条件下,在干净基准上训练的系统往往会崩溃。Saaras V4 旨在这些条件下保持可靠,包括嘈杂音频、代码混合和方言变化。
| 语言 | 条件 | 格式 | 转录 |
|---|---|---|---|
| 印地语 | 持续风噪 | 逐字 | ए एक बात सुनो ना मैडम दो दो दो दो दो दोनों मिलाकर |
| 印地语 | 失真与削波 | 转录 | सर आपको अपनी पॉलिसी के बारे में कुछ पूछना है? मैं आपसे ये पूछ रही थी कि। |
| 印地语 | 恒定背景音 | 语码混合 | होते हो। Nice to meet you brothers. Okay. Thank you. Bye. कुछ कुछ price तो ऐसा है कि जो |
| 孟加拉语 | 交通拥堵 | 音译 | Maane ami ekta TV kinechilam ami ekta TV installmente niyechilam apnader bank hoyto erokom taka kate okhan theke ki koreche |
| 卡纳达语 | 静电噪声 | 翻译 | 首先,在我们的艺术中,在我们的文化中,我们首先建造了一座寺庙。我们过去住在茅屋里。我们建造了很大很大的寺庙。如果你看到它,即使现在也令人惊叹。他们是如何建造它的,一千年,两千年,这种事情,令人惊叹。 |
| 英语 | 声道失真 | 转录 | 哦,多么值得一读的记录!多么值得凝视的画面!这事实多么可怕! |
d. 低延迟流式传输
对于实时语音应用,延迟与转录质量同样重要。Saaras V4 支持流式传输,首个 token 时间低于 150 毫秒,使下游系统能够以最小延迟开始响应,并实现更自然的轮流对话。
它还能原生处理长音频,多分钟录音可在一秒内处理完成。
将 Saaras V4 集成到你的平台
使用来自 Sarvam AI 仪表板 的简单 API 密钥,将 Saaras v4 集成到你的应用中
选择你的集成路径:
REST API:针对 30 秒以下音频的同步转录
Batch API:针对最长 2 小时文件的异步处理。可在批处理模式下启用说话人分离
WebSocket(实时):面向实时应用的带部分结果的流式转录
SDK 与框架:
适用于 Python 3.9+ 和 Node.js 18+ 的开箱即用 SDK。
框架集成可用于 Vercel AI SDK、
LiveKit Agents 和
Pipecat Agents
输出模式:
配置转录输出:transcribe(默认)、translate(译为英语)、translit(罗马化),或 verbatim 或 codemix
快速开始:
请参阅 开发者快速入门 以获取代码示例和身份验证详情
一个模型覆盖多种语言
借助 Saaras V4,你不再需要在英语性能与印度语言覆盖范围之间权衡。它在两者上都表现出色,同时支持低延迟流式传输和可靠的生产工作负载。这使得用一个 ASR 模型构建多语言语音应用成为可能。
来源:Sarvam AI · sarvam.ai