跳到正文
Sarvam AI·· 10 天前精选AI 评分62

Sarvam AI 发布语音识别模型 Saaras V4

Introducing Saaras V4

AI 导读

Sarvam AI 发布新一代语音识别模型 Saaras V4,采用音频编码器加自研 3B 混合状态空间 LLM 解码器,支持 transcribe、translate、verbatim、translit、codemix 五种转写格式。

推荐理由

原文给出 Saaras V4 的架构、五种转写模式与多语言基准结果,可据此判断多语种语音识别的落地方式。

正文 · AI 翻译
  1. 首页
  2. /
  3. 博客

面向多语言世界的 ASR 下一次飞跃

公告产品


2026年9月25日 · 6 分钟阅读

Introducing Saaras V4

我们发布 Saaras V4,这是我们语音识别模型的最新一代。

本文介绍 Saaras V4 背后的工作,包括用于训练它的数据、我们的预训练方法、支持多种输出模式的架构与解码改动,以及我们结果背后的评估方法。我们还报告了在印度语言、英语以及具有挑战性的真实语音条件下的基准性能。

亮点

  • Saaras V4 使用音频编码器和 LLM 解码器。LLM 解码器是一个 3B 混合状态空间模型,完全由我们内部从零训练
  • Saaras V4 在所有 22 种印度语言上取得了 SOTA 性能,并再次确认我们对即使资源最匮乏的印度语言的承诺
  • Saaras V4 在七个全球英语数据集上取得了最低 WER,其中六个是外国英语方言,一个是印度英语
  • 你可以选择最适合你的格式:Saaras V4 支持五种转写格式:transcribe、translate、verbatim、translit 和 codemix
  • Saaras V4 对嘈杂音频和语码混合具有鲁棒性。它也能无缝处理方言差异
  • 其语言识别也是一流的:在排名前十的印度语言中错误率为 2.9%,在所有 22 种语言中为 5.22%

深入了解 Saaras V4

Saaras V4 将音频编码器与一个 3B 混合状态空间语言模型配对,该模型由我们内部从零训练。

我们将系统设计为能够处理我们在实践中见到的各种语音,包括语码混合、方言差异和嘈杂音频,同时支持表示同一语音的五种不同方式:逐字转写、规范化文本、语码混合文本、音译和翻译。

图 1。我们的方法概览:输入音频波形进入音频编码器,生成捕捉语音和声学细节的音频嵌入。时间下采样适配器沿时间轴压缩这些嵌入,并将其投影到语言模型的嵌入空间,因此即使很长的录音也能保持在上下文预算内。随后,内部自研的 Sarvam-3B 自回归解码器将这些音频特征与作为文本特征的提示一起读取,并逐 token 输出转写结果,每个 token 都会作为下一个 token 的输入反馈回去。

英语基准上的性能

我们在七个英语语音识别基准上评估了 Saaras V4,涵盖印度英语、国际口音、会议、媒体、金融和其他真实语音场景。在这些数据集上,Saaras V4 取得了最低的平均词错误率。

AMI

会议室、远场麦克风

GigaSpeech

播客、有声书、网络视频

LibriSpeech clean

朗读语音、录音室条件

LibriSpeech others

朗读语音、更困难的声学条件

SPGISpeech

财报电话会议、金融词汇

VoxPopuli

欧洲议会演讲

Svarah

印度口音英语


评估方法

  • 六个国际数据集:采用 HuggingFace 的 Open ASR Leaderboard 已发布结果
  • 一个印度口音英语数据集:由 AI4Bharat 发布的 Svarah
  • 归一化和评分遵循 Open ASR Leaderboard 的 代码

Saaras V4 的 Indic 基准:

Vistaar

我们在 Vistaar 上对 Saaras V4 在十种印度语言中进行评估,并报告标准词错误率(WER)和 LLM-WER。

WER 仍然是语音识别的标准确定性度量,计算参考转录和预测转录之间的替换、删除和插入。然而,在印度语言环境中,其中一些差异可能是拼写或格式变化,不会实质性地改变口语内容。

为了考虑这一点,我们还报告了 LLM-WER,它增加了一个语义裁决步骤,以确定不匹配是改变了转录的含义,还是仅仅以不同方式表示相同的内容。

因此,这两个指标是互补的。WER 提供了一个可重复的基线,而 LLM-WER 则提供了对影响底层语音内容的错误的更忠实视图。

各种基准的详细分解:

五种模式,一个模型

不同的应用需要同一语音的不同表示。合规存档可能需要逐字转录,而 CRM 工作流可能需要规范化文本,分析系统可能需要英文翻译。这些转换通常通过单独的后处理步骤处理,这增加了复杂性并可能引入额外错误。

Saaras V4 在模型内部处理这些需求。从相同的音频输入中,它可以生成五种转录模式:逐字、规范化、代码混合、音译和翻译。

  • 逐字: 以口语的母语文字进行精确转录
  • 转录: 以口语的母语文字进行精确转录,并对数字和日期进行规范化
  • 代码混合: 转录模式加上保留母语中的英语单词为英语,以提高可读性
  • 音译: 进行转录,但使用英语文字。口语中称为“WhatsApp 语言”
  • 翻译: 音频的英文翻译,数字已规范化

因为所有五种模式都来自一个模型,所以没有可能导致错误级联的额外预处理步骤。

超越转录

a. 一流的语言识别

Saaras V4 可以直接从音频中识别口语,并以相应的母语文字进行转录,无需事先指定语言。在已验证的 IndicVoices 话语上,所有 22 种印度语言的语言识别错误率为 5.22%,在十种最广泛使用的语言中降至 2.9%。

b. 关键词提示

关键词提示允许您将转录偏向于容易遗漏的单词或短语,例如产品名称、人名、首字母缩略词或特定领域的术语。

在 ai4bharat/IndicContextEval(Interspeech 2026)上验证为最佳:Saaras V4 在 L5(关键词提示)设置中达到最低 WER 16.03%,其中领域实体列表以母语文字随语言一起提供。有关数据集详细信息和竞争对手分数,请参阅 论文。

c. 为真实世界音频而构建

现场音频被压缩、削波,并且充满干扰。在这些条件下,在干净基准上训练的系统往往会崩溃。Saaras V4 旨在这些条件下保持可靠,包括嘈杂音频、代码混合和方言变化。

语言条件格式转录
印地语持续风噪逐字

ए एक बात सुनो ना मैडम दो दो दो दो दो दोनों मिलाकर

印地语失真与削波转录

सर आपको अपनी पॉलिसी के बारे में कुछ पूछना है? मैं आपसे ये पूछ रही थी कि।

印地语恒定背景音语码混合

होते हो। Nice to meet you brothers. Okay. Thank you. Bye. कुछ कुछ price तो ऐसा है कि जो

孟加拉语交通拥堵音译

Maane ami ekta TV kinechilam ami ekta TV installmente niyechilam apnader bank hoyto erokom taka kate okhan theke ki koreche

卡纳达语静电噪声翻译

首先,在我们的艺术中,在我们的文化中,我们首先建造了一座寺庙。我们过去住在茅屋里。我们建造了很大很大的寺庙。如果你看到它,即使现在也令人惊叹。他们是如何建造它的,一千年,两千年,这种事情,令人惊叹。

英语声道失真转录

哦,多么值得一读的记录!多么值得凝视的画面!这事实多么可怕!

d. 低延迟流式传输

对于实时语音应用,延迟与转录质量同样重要。Saaras V4 支持流式传输,首个 token 时间低于 150 毫秒,使下游系统能够以最小延迟开始响应,并实现更自然的轮流对话。

它还能原生处理长音频,多分钟录音可在一秒内处理完成。

将 Saaras V4 集成到你的平台

使用来自 Sarvam AI 仪表板 的简单 API 密钥,将 Saaras v4 集成到你的应用中

选择你的集成路径:

  • REST API:针对 30 秒以下音频的同步转录
  • Batch API:针对最长 2 小时文件的异步处理。可在批处理模式下启用说话人分离
  • WebSocket(实时):面向实时应用的带部分结果的流式转录

SDK 与框架:

适用于 Python 3.9+ 和 Node.js 18+ 的开箱即用 SDK。

框架集成可用于 Vercel AI SDK、LiveKit Agents 和 Pipecat Agents

输出模式:

配置转录输出:transcribe(默认)、translate(译为英语)、translit(罗马化),或 verbatim 或 codemix

快速开始:

请参阅 开发者快速入门 以获取代码示例和身份验证详情

一个模型覆盖多种语言

借助 Saaras V4,你不再需要在英语性能与印度语言覆盖范围之间权衡。它在两者上都表现出色,同时支持低延迟流式传输和可靠的生产工作负载。这使得用一个 ASR 模型构建多语言语音应用成为可能。

来源:Sarvam AI · sarvam.ai