跳到正文
Sarvam AI·· 2026-08-07精选AI 评分66

Sarvam Epoch 发布 105B 模型更新、印度本地推理层与 Indus 智能体平台

Everything we announced at Sarvam Epoch

AI 导读

Sarvam 在首届 Sarvam Epoch 上公布全栈更新,包括 Sarvam 105B 面向对话与工作智能体的新变体、Sarvam Vision 2.0、Saaras V4、Bulbul V4 研究预览,以及托管在印度的推理层 Sarvam Inference。

推荐理由

Sarvam 一次性公布模型、推理层、智能体平台与硬件多条产品线,可据此观察印度本地化 AI 全栈的落地路径。

正文 · AI 翻译

Sarvam Epoch

上周,我们举办了首届 Sarvam Epoch。看到社区带着如此强烈的可能性意识齐聚 Epoch,令人振奋。

Builder Edition 汇聚了开发者和研究人员,进行技术会议和现场演示。Enterprise Edition 汇聚了来自银行、政府和行业的领导者,共同探讨在大型组织中部署 AI 需要什么。

在这两天里,我们在整个技术栈上都有发布:模型更新、托管在印度的推理层、自助式智能体平台,以及旨在将这些能力带入全国各机构的合作伙伴关系。本文涵盖了我们宣布的所有内容。

Sarvam 105B

我们在二月份发布了首个 Sarvam 105B 检查点。在 Epoch 上,我们发布了面向对话智能体和工作智能体的更新变体,这是我们在印度看到最多应用场景的两个用例。

对于对话智能体,标准的公开基准并不完整。它们无法捕捉模糊消息、ASR 噪声、代码混合语音、长篇政策文档,或必须在多轮之后才遵循的指令。

因此,我们在一个基于数亿分钟印度对话构建的生产基准上评估了该模型。

能力Sarvam 105BGPT 5.4 MiniGemini 3.5 Flash
语音通话能力82.174.778.9
指令遵循63.437.452.4
工具调用78.857.671.8
语言质量,胜率61.36.032.7

滚动

滚动

Sarvam 105B 在所有四项指标上均领先 GPT 5.4 Mini 和 Gemini 3.5 Flash,其中在指令遵循和语言质量方面差距最大,这两项能力决定了语音智能体能否在真实客户通话中存活下来。它以每百万混合 token 0.80 美元的价格实现这一点,而 GPT 5.4 Mini 为 4.50 美元,Gemini 3.5 Flash 为 9.00 美元。每一项指标都更好,价格却只是零头。

对于工作智能体,我们调整了一个推理变体,并在 HarnessBench 上进行了评估:涵盖软件工程、数据与金融、知识检索、办公工作流、工具使用、SRE 和长时间自主运行的 106 项沙盒任务。

与 753B 模型 GLM 5.2 相比,Sarvam 105B 的表现足够接近,最有用的产品决策是路由。在我们自己的智能体配置中,36% 的任务路由到 Sarvam 105B,64% 路由到 GLM 5.2,将服务成本降低了约 40%。

两个变体均可通过 Sarvam API 使用:一个针对低延迟对话优化,另一个针对智能体框架内的复杂任务优化。

Sarvam Vision 2.0

Sarvam Vision 1.0 于二月份推出,此后已数字化超过 3500 万页。

Vision 2.0 扩展了模型,支持从表格和表单中原生提取键值、印度手写识别、更强的复杂表格解析,以及改进的通用 OCR。

我们还发布了 Sarvam Vision Edge,通过为特定工作流定制的模型将这些能力带入客户环境。在为奥里萨邦政府进行的土地记录数字化工作流中,一个定制模型比在同一任务上测试的最佳通用模型准确率高出 50%。

Saaras V4

Saaras V4 扩展了 Sarvam 的语音识别技术栈,一个模型提供五种输出模式:逐字转录、规范化转录、代码混合输出、音译和翻译。

它还新增了单次多说话人 ASR,将说话人分离与转写合并在一起,而不是运行独立的串行系统。这对于通话录音、会议和访谈非常有用,因为在这些场景中,说话人归属与转写内容同样重要。

Saaras V4 支持 22 种印度语言。而且最好的英语 ASR 现在来自印度:在七套标准测试集上,从 LibriSpeech 和 GigaSpeech 到针对印度口音语音的 Svarah,它创下了所有测试系统中最低的平均词错误率。

Bulbul V4(研究预览版)

Bulbul V4 是我们迄今为止最具表现力的文本转语音模型。开发者可以塑造每一句话的说话方式,在生成音频时引导情感、强调、节奏以及笑声等提示。

这为语音智能体、创作者工具、配音、教育、无障碍和媒体带来了更多控制力。它在企业环境中尤其有价值,因为在那里名称、金额、产品术语和语气必须清晰准确地传达。

自定义模型训练

我们为希望基于自身数据、策略和工作流获得专用模型的组织推出自定义模型训练。我们在印度的基础设施上管理训练,并将训练好的权重交付给该组织,带来我们在高效管理 GPU 集群和运行优化模型训练流水线方面的经验。

我们与组织合作,训练更小、面向特定任务的模型,与对每个请求都使用更大的通用模型相比,这可以降低延迟和推理成本。

在整个合作过程中,组织的训练数据保持隔离,绝不会用于训练 Sarvam 自己的模型。训练完成后,生成的权重会交付给该组织并由其拥有,该组织对模型的部署和修改方式保留完全控制权。

Sarvam Inference

Sarvam Inference 是我们为 Sarvam 模型和前沿开放权重模型提供的服务层,从印度的数据中心运行。开发者可以访问最好的开放模型。企业默认获得数据驻留和符合印度法规的合规性。

该阵容包括 GLM 5.2 和 Gemma 4 31B,其性价比可与任何全球提供商竞争。GLM 5.2 的运行速度高达每秒 80 个 token,Gemma 4 31B 的首 token 时间 p50 为 0.63 秒。

这种性能来自底层的系统工程。我们的推理团队优化内核、分离预填充和解码、跨工作负载类型管理 KV 缓存,并训练推测模型。

所有这些都运行在印度首个 Blackwell GPU 集群上,并且该集群将在未来几个月内持续扩展。随着新的开放模型发布,我们将从第一天起就提供服务,并具备企业可以据此规划的可靠性和定价。

Indus 是一个平台,满足你所有的 AI 工作。一个工作空间,多个智能体。Voice Agents 用于对话,Work Agents 用于员工,Document Agents 用于文书工作,Content Studio 用于媒体,Coding Agents 用于工程。

Voice Agents

我们的语音智能体已通话超过 3.25 亿分钟,以人工坐席成本的一小部分交付业务成果。

业务团队可以用通俗语言描述智能体的目标,针对它模拟一千次通话,并在不到两小时内上线一个电话号码,整个技术栈可在合规要求下部署到企业自己的 VPC 内。

智能体还可以作为一支协同编排的团队朝着目标运行,一个负责解释,一个负责谈判,一个负责成交,并且它们会在每一次对话中不断改进。分析能力超越通话摘要,深入到业务洞察:哪个方案实现了转化,哪个人群出现了流失,下一笔千万级回款将来自哪里。这一切的成本和延迟都是为印度规模量身打造的。

语音智能体现已正式可用,无需等待名单,每分钟 ₹3.50,包含创作、模拟、电话号码、评估和分析功能。

Voice Agents analytics dashboard with call distributions, conversation insights, and language breakdown

工作智能体

工作智能体为企业提供一支 AI 同事团队,企业可以构建、管理它们,并将其与现有系统和数据集成。每一个都能与营销、数据或开发者团队并肩起草、研究、分析并运行流程。它在沙盒环境中执行代码,产出成品工件——一份报告、一个仪表盘、一个可运行的应用程序——并在企业级安全与合规下运行。工作智能体现已上线。

内容工作室

内容工作室将多语言内容创作与转换汇聚于一个平台。

内容工作室包含 AI 语音、声音克隆、转录、视频配音和实时翻译。这些能力可以单独使用,也可以组合成更大的内容工作流。

在配音方面,该系统旨在保留情感、保持说话人一致性,并生成听起来自然、可直接对口型的音频。

Sarvam Code

隆重推出 Sarvam Code,现已进入早期测试阶段。我们正在进入一个已有众多优秀产品的领域,并持有明确的观点:代码生成正在快速进步,但代码速度并未持续转化为产品成果。重复代码不断累积,代码审查正成为瓶颈,而前沿模型上的长时间任务可能变得昂贵。

Sarvam Code 旨在优化每个已完成任务的成本。它在 100B、700B 和 3T 规模的模型之间路由工作,在复杂任务上坚持到完成为止,使用为每个模型设计的工具,并管理上下文而无需反复处理同一代码库。

它包含前端开发、数据和机器学习以及网络安全方面的技能,同时还有针对 Finacle、SAP 和内部记录系统等系统的自定义技能。该框架构建于 Codex 之上,而更广泛的技术栈会从你基础设施内的工作流和轨迹中学习,以改进路由,并支持面向 ITOps、NetworkOps 和 CloudOps 的专用模型。它可以在印度、你的 VPC 或本地运行。

Sarvam Cyber

在 Epoch 上,我们预览了 Sarvam Cyber,这是一款 AI 安全智能体,帮助团队在复杂系统中发现、调查和修复漏洞。它跨环境追踪问题并关联相关发现,为安全团队提供从发现到解决的更清晰路径。

我们还在构建安全技能和工具,与网络安全领域的初创公司和领域专家合作。同一套用于规划和验证编码工作的框架,在调查方面也表现出色:它维护假设台账,发现漏洞,并将发现串联起来以证明可利用性,而不仅仅是标记可能性。

通过这种方式,我们已经在印度广泛使用的消费者平台中发现了漏洞。我们正在根据负责任披露原则与受影响的团队合作,以便尽快完成修补。

Anvaya in a Box

Anvaya 是一款面向国防、情报、政府和金融机构的调查智能体,在这些领域,准确性、部署控制和数据安全不容妥协。

它可以在本地部署、气隙环境中以及各种硬件上运行。将它指向文档、音频、视频、图像和结构化数据,它就能在所有这些数据之上构建一个统一的数据层,并带有本体、实体模式和追踪来源的知识图谱。

Kivi

Kivi 是一款语音应用,让你可以与计算机对话,并在任何应用中完成工作。在 WhatsApp 中写消息、在 Docs 中起草文档、处理电子表格、在 Sarvam Code 中构建应用,或在 Sarvam Work 中指挥 AI,全部通过自然说话完成。Kivi 理解 22 种以上的印度语言,包括语码转换,并将你所说的话转化为清晰、准确的文本或操作。它是你在计算机上所做一切的语音界面。

Kivi for Mac 现已推出。Windows、Android、API 和 MCP 访问即将到来。

智能眼镜

Kaze 是一款智能眼镜系统,将 Sarvam 的语音、视觉和语言模型带入可穿戴界面。它支持 22 种印度语言,包括语码转换,并使用云端和边缘模型在低网络环境中工作。

我们宣布的许多内容现在就可以试用,其余内容将在未来几周内陆续推出。请从 docs.sarvam.ai 开始,如果本文中有些内容尚未提供,很快就会提供。

Sarvam Epoch gift box on stage at the Bengaluru conference

来源:Sarvam AI · sarvam.ai