Sarvam 发布 Sarvam Edge 端侧模型系列
Announcing Sarvam Edge
Sarvam AI 发布 Sarvam Edge,将语音识别、语音合成和多语言翻译模型放到设备本地运行。语音识别为 74M 参数的统一多语言模型,支持 10 种印度语言,端侧占用约 294MB(FP16),首 token 延迟低于 300 毫秒,在 Snapdragon 8 Gen 3 上实时率约 0.12。
Sarvam 公布端侧语音识别、语音合成与翻译三款模型的具体参数量、内存占用和延迟数据,可据此判断印度语言端侧部署的可行边界。
为端侧智能提供动力
研究
2026年2月14日 · 阅读时长9分钟

智能应当无处不在。无需从遥远的服务器召唤,不受网络连接限制,也不按查询次数计费。它就在那里,即时且本地,以思维的速度运转。你手中的设备已具备运行复杂模型的计算能力。所缺少的,是真正为在端侧运行而设计的模型。
今天,我们宣布推出 Sarvam Edge,这是我们为将智能带到设备端、消除访问障碍而做出的专门努力。
问题已不再是印度能否训练出强大的模型。问题在于它们能否随时随地运行。AI 的下一阶段将不再由模型规模定义,而是由全国范围的部署、高性价比的推理、领域适配以及融入日常设备来定义。归根结底,这取决于可及性。
响应即时。无需往返数据中心,无需排在其他用户之后,也不会因网络状况而波动。模型就在那里,随时准备在你需要的那一刻运行。
你的数据永不离开你的设备。当你处理文档、翻译对话或提问时,这些信息都留在本地。没有服务器记录你的查询,没有数据库存储你的对话,也没有隐私政策需要解读。模型运行,产出结果,仅此而已。
它无处不在。在飞机上。在网络时断时续的乡村地区。在网络中断期间。当你带宽受限或云服务不可用时。它能工作,因为你的设备能工作。
经济模式不同。没有按查询计费,没有基于用量的定价,用户规模增长也无需担忧扩容。推理成本已经支付,它已嵌入设备之中。这改变了可能性的边界。AI 可以触达那些云成本原本高不可攀的场景。面向学生的教育工具、面向小企业的生产力软件、面向弱势群体的辅助技术,都成为可能。
Sarvam Edge 正与全球领先的设备制造商密切合作开发,将模型设计与硬件演进纳入同一场对话。当推理转移到设备端,某些根本性的东西随之改变。模型成为你设备的一部分,而非你访问的一项服务。它被设计为在人们已有的设备上运行。这意味着要重新思考一切。架构选择优先考虑效率而非原始参数量。训练技术要产出压缩良好且不损失能力的模型。
在这篇博客中,我们详细介绍了为 Sarvam Edge 提供支持的模型,包括为端侧推理打造的语音识别、语音合成和多语言翻译。
端侧语音模型
语音识别
该语音识别引擎提供专为印度市场打造的生产级端侧转写。通过完全在端侧处理,该系统为10种最常用的印度语言提供高精度语音转文本,无需依赖云端,确保绝对的数据隐私和运行可靠性。
该系统的核心是一个单一统一的多语言模型,在一个紧凑的架构内支持10种最流行的印度语言。该系统无需为每种语言维护单独的模型,而是采用一种高效架构,能够自动识别语言,无需用户手动选择,实现无缝的多语言交互。
这个紧凑模型采用高效架构,其转录准确率可与领先的服务器端云系统相媲美:
- 模型参数:74M
- 设备端占用空间:约294MB(FP16)
成本、延迟与内存
首令牌时间保持在300毫秒以内,带来适合实时应用的响应式流式体验。在高通Snapdragon 8 Gen 3移动芯片上测得,推理栈的实时因子约为0.12(RTFx 8.5),使语音处理速度快于实时。
由于推理完全在设备端运行,因此不依赖网络可用性,也没有每次查询的云成本。
准确率
该架构围绕真实世界的语音条件而设计。它在电话系统和录音设备典型的8KHz音频上保持高准确率。它能处理多说话人环境,包括语音重叠,并在嘈杂背景中保持稳健,而非假设受控的声学环境。
准确率不仅限于语音转录。该系统能高保真地保留印度专有名词、地区名称和实体。内置的逆文本归一化引擎将口语形式转换为正确的书面规范,对数字、日期、货币和温度单位进行适当格式化。标点和字母数字表达保持语法一致且可读,生成的输出可直接使用。
该模型已针对Vistaar数据集进行了严格基准测试,这是一个包含59个测试环境的综合套件,涵盖新闻、教育和旅游等多样领域。该评估展示了在支持的印度语言中具有竞争力的词错误率(WER)和字符错误率(CER)。
为建立性能基线,我们将我们的边缘ASR模型与云模型Saarika v2.6和Google Cloud STT进行比较,而对印度语言的原生设备端支持仍在持续发展。
语音合成
语音合成直接在设备端提供可靠的文本转语音,无需互联网连接。它使用单个紧凑模型支持10种印度语言和8个多语言说话人,同时保持低延迟、清晰逼真的语音以及跨语言一致的语音身份。这是一个单一统一模型,支持多个说话人和所有语言。它不仅便于紧凑、轻松部署,还通过允许说话人使用多种语言来提高输出质量。
模型规格如下
- 模型参数:24M
- 设备端占用空间:约60MB
该模型设计得足够紧凑,便于实际部署。该模型具备所有说话人在不同语言间保持相似音色身份的能力,这一点通过较高的说话人相似度得以体现,无论是语内还是跨语言生成均如此。这是通过为每个说话人生成多条音频,使用 Speechbrain ECAPA-TDNN 模型获取每条音频的嵌入向量,并计算这些向量之间的平均余弦相似度来衡量的。
成本、延迟与内存
该模型包含 2400 万个参数,代表学习到的权重总量。设备上最终可部署的文件大小约为 60MB。
该模型的首次音频输出时间(TTFA)为 260 毫秒,从文本输入到首次可听输出进行测量。该模型实现了 0.19 的实时因子(RTF),意味着音频生成速度约为实时的 5.2 倍。流式推理允许在完整句子生成完成之前就开始播放。
所有延迟和吞吐量基准均在三星 Galaxy S25 Ultra 上测量。
准确率
字符错误率(CER)衡量的是生成语音经自动语音识别系统重新评估后的转录错误。数值越低,表示输出越清晰、越易于理解。
该模型在 Bulbul V3 发布版的 sarvamai/tts-general-benchmark 数据集上实现了 0.0173 的总体平均 CER。在所有语言中,CER 始终保持在较低水平,表明合成语音在所有语言中都能被可靠理解。
该基准之所以重要,是因为它评估生成的语音是否不仅听起来自然,而且在语言上精确。低 CER 表明语音输出保留了预期的词语和结构,减少了语音界面和辅助系统中的下游错误。
ASR 评估使用 Sarvam Audio 进行。
自定义声音克隆
语音合成支持在同一统一多语言模型内接入自定义声音。借助约一小时精心整理的语音数据,新说话人可以适配到所有支持的语言,同时保持一致的音色身份。
适配后的声音仍可在设备上以相同的约 60MB 占用空间部署,保持与基础模型相同的内存和延迟特性。
边缘端翻译模型
边缘端翻译直接在设备上提供高性能多语言神经机器翻译。它支持 11 种语言,包括 10 种印度语言和英语,可实现 110 个语言对之间的双向翻译,无需通过中间语言进行枢轴翻译。
该系统运行自单一统一多语言模型,而非维护特定语言的检查点。这简化了部署,同时允许在所有支持的语言之间进行跨语言迁移学习。
成本、延迟与内存
该多语言模型大小约为 1.5 亿个参数,设备端内存占用约为 334MB。该设计在翻译质量与可部署性之间取得平衡,使完整的多语言翻译在现代移动硬件上切实可行。
在高通骁龙 8 Gen3 处理器上进行基准测试,首 Token 时间(TTFT)约为 200 毫秒,可在交互场景中实现近乎即时的响应。流式吞吐量达到约每秒 30 个 Token,即使对于较长的句子也能支持流畅的实时翻译。
分词效率在延迟中起着关键作用。通过在所有 11 种语言中最小化生育率(即每个词对应的 Token 数),系统减少了解码器的工作量,并降低了每句的总推理时间。
由于推理完全在设备上运行,翻译不依赖网络可用性,也不会产生每次查询的云成本。
准确度
该模型旨在处理真实世界的输入。它支持日期和货币的规范化,处理拼写错误和聊天风格语言等噪声输入,并处理复杂的字母数字格式。代码混合和口语化表达得到原生支持。
用户还可以控制输出中的数字样式,在国际印度-阿拉伯数字(如“100 रुपये”)和本地印度数字(如“१०० रुपये”)之间切换。这使得翻译能够适应受众和语境,而无需重新训练。
评估表明,在支持的语言中具有强大的翻译准确度。与一个 600M 参数的最先进开源多语言边缘模型相比,该模型以 4 倍更小的体积实现了相当或更优的质量。
这一点很重要,因为翻译质量必须在严格的内存和延迟约束下保持。在保持准确度的同时减小模型体积,可在不牺牲用户体验的情况下提高可部署性。
边缘实践
Macbook Pro 上的 Sarvam Vision OCR
演示首先上传一个奥里亚语图像文件,转录完全在 MacBook Pro 上本地运行。系统完全离线运行,互联网连接已关闭。它保持每秒超过 40 个 Token 的转录速度,同时峰值内存使用量低于 10GB,展示了在消费级硬件约束下高效的设备端语音识别。
Android 上的股票经纪应用
该演示展示了语音驱动的金融助手的全方位代理能力,全部在设备上本地运行。用户通过语音自然交互,以检索其投资组合概览、查看当前持股、查看余额、执行买卖特定股票等交易、进行市场研究、评估整体市场趋势,并接收实时股价报价。
所有语音交互,包括用于理解用户命令的语音识别和用于传递响应的文本转语音,都完全在设备上处理,无需云连接。这确保了快速响应时间、完全的隐私性,以及即使离线时也能可靠运行。
实时语音翻译
该演示展示了印度语言之间的实时语音翻译。您用首选语言说话,系统会用另一种语言翻译并回应,同时保留含义和自然表达。语音识别、翻译和富有表现力的文本转语音无缝协作。
而边缘正是起点
当智能内置于设备核心时,性能提升、延迟降低、隐私增强。AI 变得真正原生。内置于人们已经随身携带的设备中。
这一基础解锁了一类新产品。AI 眼镜。智能音频系统。辅助穿戴设备。在这些设备中,智能不是一款应用,而是硬件本身的一种属性。
Sarvam Edge 正朝着这一转变迈进。
来源:Sarvam AI · sarvam.ai