跳到正文
Sarvam AI·· 2026-03-06精选AI 评分71

Sarvam 开源 30B 与 105B 推理模型

Open-Sourcing Sarvam 30B and 105B

AI 导读

Sarvam AI 开源 Sarvam 30B 和 Sarvam 105B 两款从零训练的 MoE 推理模型,预训练分别使用 16T 和 12T token,训练全程在印度完成,算力由 IndiaAI Mission 提供。

推荐理由

Sarvam 开源两款从零训练的 MoE 推理模型,并给出与同级开源及前沿模型的基准对比,可据此判断其能力位置。

正文 · AI 翻译
  1. 首页
  2. /
  3. 博客

研究开源


2026年3月6日 · 18 分钟阅读

Open-Sourcing Sarvam 30B and 105B

我们发布 Sarvam 30B 和 Sarvam 105B 作为开源模型。两者均为推理模型,从零开始训练,使用我们在训练各阶段(预训练、监督微调与强化学习)内部整理的大规模高质量数据集。训练完全在印度进行,算力由 IndiaAI 使命提供。这些模型代表了真正的全栈努力。除数据集外,我们还优化了分词、模型架构、执行内核、调度和推理系统,使其能在从旗舰 GPU 到笔记本电脑等个人设备的广泛硬件上高效部署。两个模型均已投入生产。Sarvam 30B 为 Samvaad 提供支持,这是我们的对话代理平台。Sarvam 105B 为 Indus 提供支持,这是我们为复杂推理和代理工作流打造的 AI 助手。

Sarvam 模型在同级别中具有全球竞争力。Sarvam 105B 在广泛的基准测试中于推理、编程和代理任务上表现出色。Sarvam 30B 针对实时部署进行了优化,在真实世界对话用例中表现强劲。两个模型在印度语言基准测试中均达到最先进水平,超越规模大得多的模型。

此次发布标志着 Sarvam 的重要里程碑。构建这些模型需要在数据、训练、推理和产品部署方面发展端到端能力。有了这一基础,我们已准备好扩展到更大、能力更强的模型,包括专为编程、代理和多模态对话任务设计的模型。

Sarvam 105B 已在 Indus 上提供。两个模型均可通过我们的 API 在 API 仪表板 访问。权重可从 AI Kosh(30B、105B)和 Hugging Face(30B、105B)下载。如果您想使用 Transformers、vLLM 和 SGLang 在本地运行推理,请参阅 Hugging Face 模型页面获取示例实现。

架构

两个模型共享一个共同的架构原则:高容量推理与高效训练和部署。核心是混合专家(MoE)Transformer 主干,它使用稀疏专家路由来扩展参数数量,而不增加每个 token 所需的计算量,同时保持推理成本实用。该架构通过旋转位置嵌入、基于 RMSNorm 的稳定化以及针对推理期间高效 KV 缓存使用优化的注意力设计来支持长上下文输入。

虽然两个模型共享相同的设计理念,但它们在规模和注意力机制上有所不同。Sarvam 30B 使用分组查询注意力(GQA)来减少 KV 缓存内存,同时保持强劲性能。Sarvam 105B 通过更大的深度和多头潜在注意力(MLA)扩展了架构,MLA 是一种压缩注意力公式,进一步降低了长上下文推理的内存需求。

两个模型均使用具有 128 个专家的稀疏专家前馈层,但在专家容量和路由配置上有所不同。这允许较大的模型扩展到更高的总参数,同时保持活跃计算有界。

训练

训练流程的所有阶段均在内部开发和执行。这包括模型架构、数据整理与合成流水线、推理监督框架以及强化学习基础设施。从零开始构建一切,使我们能够直接控制训练每个阶段的数据质量、训练动态和能力发展,这是主权技术栈的核心要求。

预训练

我们的 30B 和 105B 模型均在大规模数据集上训练,30B 模型使用了 16T tokens,105B 模型使用了 12T tokens。预训练数据涵盖代码、通用网络数据、专业领域知识语料、数学以及多语言内容。经过多次消融实验,最终的训练数据混合比例经过平衡,以强调推理、事实基础和软件能力。我们在所有类别上都对合成数据生成流水线进行了大量投入。多语言语料库将训练预算的相当大一部分分配给了使用人数最多的 10 种印度语言。

预训练分三个阶段进行,涵盖长时程预训练、中期训练和长上下文扩展阶段。我们使用基于 sigmoid 的路由分数,而非传统的 softmax 门控,这改善了专家负载均衡并减少了训练过程中的路由坍缩。专家偏置项稳定了路由动态,并鼓励在训练步骤中更均匀地利用专家。我们观察到,105B 模型在训练早期就显著超越了 30B 模型的基准表现,这表明其具有高效的扩展行为。

监督微调

在监督微调期间,模型在大量高质量提示词语料库上训练,这些提示词根据难度、质量和领域多样性进行筛选。提示词来源于开放数据集,并使用定制模型进行标注,以识别领域并分析分布覆盖情况。为弥补代表性不足或低难度领域的缺口,我们基于预训练领域混合比例额外合成生成了提示词。实证分析表明,大多数公开数据集以低质量、同质化和简单的提示词为主,这限制了持续学习。为缓解这一问题,我们投入了大量精力构建跨领域的高质量提示词。所有对应的补全内容均在内部生成,并经过严格的质量过滤。该数据集还包含大量来自模拟环境和真实世界代码仓库的智能体轨迹,使模型能够学习工具交互、环境推理和多步决策。

在安全微调方面,我们开发了一个涵盖标准和印度特定风险场景的数据集。这项工作以统一的分类体系和受公开前沿模型章程启发的内部模型规范为指导。为发现并解决具有挑战性的失败模式,该数据集进一步通过自动化红队测试挖掘的对抗性和越狱式提示词进行了增强。这些提示词与符合政策的安全补全内容配对,用于监督训练。

强化学习

强化学习阶段使用了大规模且多样化的提示分布,涵盖数学、编程、STEM 推理、网络搜索和工具使用,并覆盖单轮和多轮环境。奖励来自可验证信号(如正确性检查和执行结果)与基于评分标准的评估(评估指令遵循、格式、响应结构和整体质量)的组合。为了维持有效的学习课程,提示会使用开源模型和早期检查点进行预过滤,以移除过于简单或始终无法解决的任务。在训练过程中,自适应采样机制根据每个提示当前通过率推导出的信息增益指标,动态分配 rollout。在固定生成预算下,rollout 分配被建模为背包式优化,将计算集中在接近模型能力前沿、学习信号最强的任务上。

RL 系统采用异步 GRPO 架构实现,将生成、奖励计算和策略更新解耦,从而在保持高 GPU 利用率的同时实现高效的大规模训练。轨迹陈旧度通过限制采样轨迹相对于策略更新的年龄来控制,在吞吐量与训练稳定性之间取得平衡。该系统省略了针对参考模型的 KL 散度正则化,避免了奖励最大化与策略锚定之间的优化冲突。策略优化则使用受 CISPO 启发的自定义组相对目标,相比标准裁剪代理方法提升了稳定性。奖励塑形进一步鼓励结构化推理、简洁响应和正确工具使用,从而形成稳定的 RL 流水线,适用于大规模 MoE 训练,学习过程一致且没有奖励崩溃的迹象。

基准测试

Sarvam 105B

Sarvam 105B 在知识、推理和智能体基准测试中,与其同类的大多数开源和闭源前沿模型持平或表现更优。在印度语言基准测试中,它显著优于我们评估的所有模型。

基准测试Sarvam-105BGLM-4.5-Air (106B)GPT-OSS-120BQwen3-Next-80B-A3B-Thinking
通用
Math50098.697.297.098.2
Live Code Bench v671.759.572.368.7
MMLU90.687.390.090.0
MMLU Pro81.781.480.882.7
Arena Hard v271.068.188.568.2
IF Eval84.883.585.488.9
推理
GPQA Diamond78.775.080.177.2
AIME 25(带工具)88.3 (96.7)83.390.087.8
HMMT(25 年 2 月)85.869.290.073.9
HMMT(25 年 11 月)85.875.090.080.0
Beyond AIME69.161.551.068.0
智能体
BrowseComp49.521.3
38.0
SWE Bench Verified(SWE-Agent Harness)45.057.650.634.46
Tau2(平均)68.353.265.855.0

Scroll

Scroll

Sarvam 105B - 所有基准测试

通用能力

Sarvam 105B 在数学、编程、知识和指令遵循等核心能力上展现出强劲且均衡的表现。它在 Math500 上达到 98.6,与对比中的顶尖模型持平;在 LiveCodeBench v6 上达到 71.7,在真实世界编程任务上优于大多数竞争对手。在知识基准测试中,它在 MMLU 上得分 90.6,在 MMLU Pro 上得分 81.7,与前沿级系统相比仍具竞争力。凭借 IF Eval 上的 84.8,该模型在人们对现代语言模型期望的主要工作负载上展现出全面均衡的能力画像。

推理性能

Sarvam 105B 在多步推理基准测试中表现强劲,反映出训练对复杂问题求解的重视。在 AIME 25 上,该模型达到 88.3 Pass@1,使用工具后提升至 96.7,表明推理与外部工具之间实现了有效集成。它在 GPQA Diamond 上得分 78.7,在 HMMT 上得分 85.8,在这两项上均优于多个同类模型。在需要更深推理链和更难数学分解的 Beyond AIME(69.1)上,该模型领先或与对比组持平。综合来看,这些结果反映出其在持续推理和困难问题求解任务上的一致优势。

智能体能力

Sarvam 105B 针对涉及工具使用、长时程推理和环境交互的智能体工作负载进行了优化。这体现在旨在近似真实世界工作流的基准测试的强劲结果上。在 BrowseComp 上,该模型达到 49.5,在网页搜索驱动任务上优于多个竞争对手。在 Tau2(平均)这一衡量长时程智能体推理和任务完成的基准上,它达到 68.3,是所比较模型中最高分。这些结果表明,该模型能够有效规划、检索信息,并在扩展的多步交互中保持连贯推理。

与更大模型的比较

一个有用的比较是在同一扩展规模内进行,因为随着每一代前沿模型的出现,训练计算量、数据集规模和基础设施规模都会急剧增加。其他实验室的最新模型使用显著更大的集群和预算进行训练。在一系列规模大得多的上一代模型中,Sarvam 105B 仍具竞争力。我们现已确立训练和数据管线的有效性,并将把训练扩展到显著更大的模型规模。

基准Sarvam-105BDeepseek R1 0528Gemini-2.5-Flasho4-miniClaude 4 Sonnet
AIME2588.387.572.092.770.5
HMMT Feb 202585.879.464.283.375.6
GPQA Diamond78.781.082.881.475.4
Live Code Bench v671.773.361.980.255.9
MMLU Pro81.785.082.081.983.7
Browse Comp49.53.220.028.314.7
SWE Bench Verified45.057.648.968.166.6
Tau2 Bench68.362.049.765.964.0
HLE11.28.512.114.39.6

Scroll

Scroll

Sarvam 105B 与更大模型的比较

Sarvam 30B

Sarvam 30B 被设计为面向实际部署的高效推理模型,将强大能力与低激活计算量相结合。它仅有 2.4B 激活参数,却在广泛基准测试中与规模大得多的稠密模型和 MoE 模型竞争。以下评估突出了其在通用能力、多步推理和智能体任务上的优势,表明该模型在保持运行高效的同时,能够提供强劲的真实世界性能。

基准Sarvam-30BGemma 27B ItMistral-3.2-24B-Instruct-2506OLMo 3.1 32B ThinkNemotron-3-Nano-30BQwen3-30B-Thinking-2507GLM 4.7 FlashGPT-OSS-20B
通用
Math50097.087.469.496.298.097.697.094.2
Humaneval92.188.492.995.197.695.796.395.7
MBPP92.781.878.358.791.994.391.895.3
Live Code Bench v670.028.026.073.068.366.064.061.0
MMLU85.181.280.586.484.088.486.985.3
MMLU Pro80.068.169.172.078.380.973.675.0
Arena Hard v249.050.143.142.067.772.158.162.9
推理
GPQA Diamond66.5
57.573.073.475.271.5
AIME 25(使用工具)80.0 (96.7)
78.1 (81.7)89.1 (99.2)85.091.691.7 (98.7)
HMMT Feb 202573.3
51.785.071.485.076.7
HMMT Nov 202574.2
58.375.073.381.768.3
Beyond AIME58.3
48.564.061.060.046.0
智能体
BrowseComp35.5
23.82.942.828.3
SWE-Bench Verified34.0
38.822.059.234.0
Tau2(平均)45.7
49.047.779.548.7

滚动

滚动

Sarvam 30B - 所有基准测试(为完整起见,对 Gemma 和 Mistral 进行了比较。由于它们不是推理或智能体模型,相应单元格留空)

通用能力

Sarvam 30B 在核心语言建模任务中表现强劲,尤其在数学、编程和知识基准测试中。它在 Math500 上达到 97.0,与其同类中多个更大的模型持平或超越。在编程基准测试中,它在 HumanEval 上得分 92.1,在 MBPP 上得分 92.7,在 LiveCodeBench v6 上得分 70.0,在实际编程任务上超越了许多规模相近的模型。在知识基准测试中,它在 MMLU 上得分 85.1,在 MMLU Pro 上得分 80.0,与其他领先的开源模型保持竞争力。

推理性能

Sarvam 30B 在多步推理基准测试中表现强劲,反映出其处理复杂逻辑和数学问题的能力。在 AIME 25 上,它达到 88.3 Pass@1,使用工具后提升至 96.7,表明推理与外部工具之间的有效集成。它在 GPQA Diamond 上得分 66.5,并在具有挑战性的数学基准测试中表现良好,包括 HMMT Feb 2025(73.3)和 HMMT Nov 2025(74.2)。在 Beyond AIME(58.3)上,该模型与更大的模型保持竞争力。综合来看,这些结果表明 Sarvam 30B 能够维持深度推理链和专家级问题求解,显著超出对具有相似活跃计算量的模型的典型预期。

智能体能力

Sarvam 30B 支持原生工具调用,并在旨在评估涉及规划、检索和多步任务执行的智能体工作流的基准测试中表现稳定。在 BrowseComp 上,它达到 35.5,在网页搜索驱动的任务上超越多个同类模型。在 Tau2(平均)上,它达到 45.7,表明在扩展交互中性能可靠。SWE-Bench Verified 对各模型而言仍具挑战性;Sarvam 30B 在其类别中展现出竞争力。综合来看,这些结果表明该模型非常适合需要高效工具使用和结构化任务执行的真实世界智能体部署,尤其是在推理效率至关重要的生产环境中。

印度语言性能

为评估印度语言能力,我们开发了一个新基准,采用成对比较框架和 LLM 作为评判者的协议。该基准的一个关键目标是反映当今印度语言的实际使用方式。这意味着以两种文字风格评估每种语言:代表正式书面用法的本地文字,以及代表消息传递和在线交流中常见的口语化用法的罗马化拉丁文字。

该基准分为四个领域:通用聊天、STEM、数学和编程。它源自 110 个英语源提示,其中 50 个涵盖通用聊天,STEM、数学和编程各 20 个。每个提示被翻译成 22 种表列印度语言,并以本地文字和罗马化文字两种形式提供。

直接在低资源语言中评估复杂推理提示的正确性可能噪声大且不一致。为解决这一问题,我们使用 Claude Opus 4 生成了高质量的英语参考答案,这些答案仅用于评估印度语言生成答案的有用性维度,涵盖相关性、完整性和正确性。

评估采用以 Gemini 3 作为评判模型的成对比较方法。评判模型从四个维度评估回复:流畅度、语言/文字正确性、有用性和冗长度。评估数据集及相应的提示词可在此处获取。

Sarvam 105B 在所有基准测试维度上平均胜率为 90%,在 STEM、数学和编程方面平均胜率为 84%。

Sarvam 30B 在所有基准测试维度上的比较中平均胜率为 89%,在 STEM、数学和编程方面胜率为 87%。

分词器效率

Sarvam 分词器针对所有 22 种印度表列语言的高效分词进行了优化,涵盖 12 种不同的文字系统,直接降低了以印度语言提供服务时的成本和延迟。在高效编码印度文本方面,它优于其他开源分词器,衡量标准为 fertility 分数,即表示一个词所需的平均 token 数。与其他分词器相比,它在 Odia、Santali 和 Manipuri(Meitei)等低资源语言上效率显著更高。下图展示了各种分词器在英语和所有 22 种表列语言上的平均 fertility。

推理优化

Sarvam 30B

Sarvam 30B 在构建时采用了推理优化技术栈,旨在最大化从旗舰数据中心 GPU 到开发者笔记本电脑等各部署层级的吞吐量。推理流水线并非依赖标准服务实现,而是使用架构感知的融合内核、优化的调度和分离式服务进行了重建。

对执行栈进行微秒级性能分析,识别出内存停顿、内核启动开销和低效调度是主要瓶颈。解决这些问题后,在所有硬件类别和序列长度上均实现了显著的吞吐量提升。优化策略聚焦于三个关键组成部分。

  • 使用融合注意力机制的内核级重写以及针对各硬件目标量身定制的矩阵乘法流水线
  • 先进的调度和批处理策略,可在真实的多用户负载下提高 GPU 利用率
  • 分离式服务流水线,消除预填充和解码阶段之间的瓶颈

这些优化在相同延迟目标下显著提高了每 GPU 每秒 token 数,从而支持更高的用户并发量并降低基础设施成本。

高端服务器性能(H100)

在 H100 级基础设施上,与 Qwen3 基线相比,Sarvam 30B 在所有序列长度和请求速率下均实现了显著更高的每 GPU 吞吐量,在等效的每用户每秒 token 数工作点上,持续提供 3 倍至 6 倍的每 GPU 吞吐量。

高性价比部署的性能(L40S)

Sarvam 30B 可在 L40S 等中端加速器上高效运行,无需依赖高端 GPU 即可实现生产部署。在更严格的计算和内存带宽约束下,优化的内核和调度策略在典型工作点上带来1.5 倍至 3 倍的吞吐量提升。在更长的输入和输出序列长度(28K / 4K)下,提升更为明显,而大多数真实世界的推理请求都落在这个范围内。

边缘性能(搭载 MXFP4 的 MacBook Pro)

Sarvam 30B 还针对 Apple Silicon 系统上的本地执行进行了优化,采用 MXFP4 混合精度推理。在 MacBook Pro M3 上,优化后的运行时在常见序列长度下实现了20% 到 40% 更高的 token 吞吐量。这些改进使本地实验的响应速度显著提升,并支持轻量级边缘部署,无需专用加速器。

Sarvam 105B

Sarvam 105B 针对以服务器为中心的硬件进行了优化,遵循与上述类似的过程,特别关注 MLA(多头潜在注意力)优化。这些优化包括自定义形状的 MLA 优化、词汇并行、高级调度策略和分离式服务。上述比较展示了在 H100 节点上各种输入和输出大小下的性能优势。

分词器与推理优化

结合高效的印度语分词器,在相同的 SLA 下,性能差异显著增加。对于 30B 模型,差异增加了多达 10 倍,达到了此前在印度语生成中此类模型无法实现的性能水平。

注意:性能数据为独立模型测量,未使用分离式推理。

演示

以下演示展示了 Sarvam 模型系列在实际应用中的实用能力,涵盖网页生成、多语言对话代理、复杂 STEM 问题解决和教育辅导。这些示例反映了模型在推理、工具使用、多语言理解和端到端任务执行方面的优势,并说明了如何将 Sarvam 模型集成到生产系统中,以构建交互式应用、智能助手和开发者工具。

网页创建

下面的小部件通过使用 Claude Code 框架进行端到端项目生成,展示了 Sarvam 105B 的代理能力,显示了模型从简单的提示规范构建完整网站的能力。

Pokédex

目标是生成一个完整、生产就绪的网页,包括运行应用程序所需的所有 HTML、CSS 和 JavaScript,无需框架或构建工具。模型使用 PokéAPI 动态加载 Pokémon 数据,实现了分页、搜索、过滤和详细模态视图,全部基于下面显示的提示。

Pokedex 网站的提示

构建一个示例 Pokédex Web 应用,作为单个 index.html 文件,内嵌 CSS 和 JS。

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ POKÉAPI 参考(基础 URL:https://pokeapi.co/api/v2) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

列表端点

单个 Pokémon 端点

精灵图 URL 快捷方式(无需 API 调用)

你可以直接构建精灵图 URL,无需获取: 缩略图: https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/{id}.png 官方艺术图: https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/other/official-artwork/{id}.png

所有 18 种类型和建议的徽章颜色

normal: #A8A878 fire: #F08030 water: #6890F0 electric: #F8D030 grass: #78C850 ice: #98D8D8 fighting: #C03028 poison: #A040A0 ground: #E0C068 flying: #A890F0 psychic: #F85888 bug: #A8B820 rock: #B8A038 ghost: #705898 dragon: #7038F8 dark: #705848 steel: #B8B8D0 fairy: #EE99AC

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 需求 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

  • 单个 index.html,不使用框架,不使用构建工具
  • 展示全部 1302 只宝可梦,每页 40 只分页显示,带有上一页/下一页控件 以及页码指示器(例如“第 3 页,共 33 页”)。应按页获取数据—— 只加载当前页所需的宝可梦,而不是一次性加载全部。
  • 响应式卡片网格,显示:精灵图(缩略图 URL)、名称、ID(#001 格式)、属性徽章
  • 点击卡片打开模态框,包含:官方立绘、全部 6 项种族值以带标签的 进度条展示(最大值 = 255)、身高(dm → m 换算)、体重(hg → kg 换算)、特性
  • 按名称或 ID 实时搜索——搜索应扫描全部宝可梦,而不仅是当前页
  • 使用可点击按钮按属性筛选
  • 当前页获取数据时显示骨架屏加载卡片
  • 经典宝可梦图鉴配色:红色(#CC0000)为主色,白色卡片,深色文字
  • 缓存已获取的宝可梦数据,避免重新访问某页时产生冗余网络请求

创建 index.html 并使其端到端完全可用。

产品落地页

任务是构建一个完整的 Sarvam 网站,捕捉一家为十亿人打造的印度 AI 公司的精神,同时在排版、动效、布局和交互设计上达到世界级视觉标准。完整提示词如下所示。

Sarvam 网站提示词

为我构建一个惊艳的、生产级网站,面向 Sarvam AI——一家印度 AI 公司,其使命是为十亿人构建 AI,深深扎根于印度的语言与文化多样性。“Sarvam”(सर्वम्)在梵语中意为“一切”。

美学方向:追求精致的印度现代主义——灵感来自莫卧儿 jali 格栅几何、藏红花与万寿菊的温暖,以及前沿 AI 工程的精确。想象:古印度遇上 GPU 集群。自信、温暖、建筑般优雅,且技术严谨。不要俗气——想象泰姬陵遇上数据中心。

配色方案:

  • 背景:#0A0A0F(近黑色,带蓝色底调)
  • 主强调色:#FF6B35(温暖的藏红花橙)
  • 次强调色:#00C9A7(青绿色,用于技术可信度)
  • 正文文字:#C8B8A2(温暖的陈年羊皮纸色——不是冷白)
  • 高亮白:#FAFAF7(略微偏暖)

排版:

  • 展示/主视觉:Playfair Display(古典、接近印度风格的衬线体)
  • 副标题:Syne(几何感、现代)
  • 正文:Literata(精致的长文阅读字体)
  • 代码:Fira Code

视觉效果与纹理:

  • 整个页面覆盖细微颗粒质感
  • 主视觉元素后方柔和的藏红花色径向光晕
  • 基于 SVG 的 jali 格栅图案作为装饰分隔线和背景水印
  • 使用 IntersectionObserver 配合垂直裁剪遮罩擦除实现滚动触发的文字显现
  • 粘性导航栏初始透明,滚动后获得 backdrop-filter: blur(20px) 深色模糊
  • CTA 按钮上的磁性悬停效果,带有脉动的藏红花色圆环动画

要构建的页面区块:

  1. 导航栏——Logo 以 SVG 并排展示天城文“सर्वम्”和罗马字“Sarvam AI”。链接:Products、Research、API、About、Blog。右侧 CTA:“Get API Access”,带有发光的藏红花色脉冲。

  2. Hero - 全视口高度。巨大的 Playfair Display 标题:"AI for a Billion People." Syne 字体的副标题:"Built for India's languages, cultures, and contexts - from the ground up." 下方是两个 CTA:"Explore the API"(填充藏红花色)和 "Read our Research"(幽灵/描边样式)。背景:动画粒子场,隐约呈现印度次大陆的形状,主要印度城市处有发光节点。5% 不透明度叠加淡淡的 jali 图案。

  3. 语言条 - 一个水平滚动的跑马灯(自动动画,不停顿),以各自的母语文字展示 Sarvam 支持的印度语言:हिन्दी · தமிழ் · తెలుగు · ಕನ್ನಡ · മലയാളം · বাংলা · ગુજરાતી · ਪੰਜਾਬੀ · ଓଡ଼ିଆ · মৈতৈলোন্ · 以及更多。每种文字使用各自的暖色调。这条语言条能瞬间传达覆盖范围。

  4. 产品部分 - 非对称网格中的三张卡片(一张宽,两张堆叠)。产品:Sarvam-1(旗舰 LLM)、Shuka(语音 AI)、Translate API(实时印度语言翻译)。每张卡片都有发光的强调边框、微妙的动画背景、一行描述和 "Learn more →" 链接。卡片在悬停时上浮并发光。

  5. 研究部分 - 深色编辑式布局。左侧:Playfair Display 斜体的大号引言 - "We don't adapt Western models to India. We build from Bharat." 右侧:三张近期研究论文卡片,包含标题、摘要片段和标签(例如 "NLP"、"Speech"、"Indic LLMs")。底部有 "View all research →" 链接。

  6. API / 开发者部分 - 深色面板,以 Fira Code 字体展示带语法高亮的实时代码片段。该片段展示对 Sarvam 翻译端点的简单 API 调用,并附有印地语的 JSON 响应。代码下方:三张统计卡片 - "11+ Languages"、"< 200ms latency"、"99.9% uptime"。一个 CTA:"Start building free →"

  7. 关于 / 使命部分 - 全宽电影感面板。背景:从上方俯瞰印度的缓慢视差图像(卫星风格,柔和且暗沉)。叠加的大号文字:"Sarvam was founded with one belief - that the next billion internet users deserve AI that truly understands them." 下方以小号 Syne 大写字母列出创始人姓名。

  8. 页脚 - 三列:链接(Products、Research、Careers、Blog)、社交(GitHub、Twitter/X、LinkedIn)和新闻通讯订阅。底栏:版权、隐私政策、条款。天城文 logo 以 3% 不透明度作为水印隐约出现在背景中。

技术要求:

  • 单个 HTML 文件,内嵌 CSS 和 JS
  • 使用 Google Fonts 进行排版
  • 全程平滑滚动行为
  • 所有动画以 CSS 优先,仅在必要时使用 JS
  • 完全响应式,最低适配 375px 移动端
  • 可访问性 - 正确的语义化 HTML、ARIA 标签、交互元素上足够的颜色对比度

让它感觉像是由一家世界级工作室专门聘请来捕捉印度 AI 灵魂的设计。每个细节都应显得刻意且 unmistakably Sarvam。

JEE Mains 2026

Sarvam 105B 在 2026 年 1 月 28 日举行的 JEE Main 2026 试卷 Shift 2 上进行了评估,以展示其 STEM 推理能力。试题和解答来源于:https://allen.in/jee-main/january-2026-question-paper-with-solutions

评估分两个阶段进行:

  1. 纯文本评估:对于纯文本问题,Sarvam 105B 直接在仅包含文本内容的问题上进行评估。
  2. 基于图表的评估:对于包含图表的问题,使用 Gemini-3-Pro 生成视觉内容的结构化文本描述,然后将这些描述作为输入提供给 Sarvam 105B 以生成答案。

下表总结了 Sarvam 105B 在物理、化学和数学科目中,在 Pass@1 和 Pass@2 评估设置下的表现。

在 Pass@1 下,模型在所有科目上都表现出很强的首次尝试准确率。在数学中,它达到了完美的 25/25。在化学中,得分为 23/25,在纯文本和图表衍生问题上均接近完美。物理同样表现出色,为 22/25,大多数错误发生在基于图表的推理中。

在 Pass@2 下,所有科目的表现均提升至满分。物理从 22/25 提升至 25/25,化学从 23/25 提升至 25/25,数学保持完美的 25/25。物理和化学中的基于图表的问题在 Pass@2 下均获得满分,表明模型在给定结构化文本表示时能够可靠地解决视觉推理任务。

科目纯文本图表总体
物理18/187/725/25
化学20/205/525/25
数学25/25
25/25

滚动

滚动

JEE Mains 2026 - Pass@2

导师模式

导师模式是一个内部项目,其中 Indus 技术栈使用针对师生对话优化的系统提示运行。下面的示例展示了 Sarvam 105B 通过交互式对话帮助学生解决 JEE 问题,而不是直接提供答案。模型通过提出探究性问题引导学生,逐步构建底层概念,最终得出答案。这也展示了模型的角色扮演能力。

注意:下面的问题取自上面已解决的同一份 JEE Mains 试卷。

Codeforces

Sarvam 30B 和 Sarvam 105B 的编码能力使用来自 Codeforces 的真实竞赛编程问题进行评估(Div3,链接)。评估涉及生成 Python 解决方案并手动提交到 Codeforces 平台以验证正确性。正确性以 pass@1 和 pass@4 衡量,如下表所示。

问题Sarvam 30BSarvam 105B
pass@1pass@4pass@1pass@4

ASieve of Erato67henes数论

BHeapify 1实现

CDice Roll Sequence动态规划

DAbsolute Cinema数学

EIdiot First Search树 / DFS

FParabola Independence图 / 动态规划

GIdiot First Search and Queries数据结构

HCodeforces Heuristic Contest 001几何

已解决4/85/86/86/8

答案使用以下系统提示生成,代码片段从 markdown 围栏中提取,思考标记从<think>标签内剥离。

Codeforces 系统提示

你是一名世界级的竞赛程序员,正在参加一场实时 Codeforces 竞赛。赢得这场比赛至关重要——每道题都很重要,失败不是选项。

在编写任何代码之前:

极其仔细地阅读题目描述。重新阅读约束条件、边界情况和示例。不要误读任何一个细节。

深入思考最优算法方案。结合给定约束考虑时间和空间复杂度。会超时的暴力解法毫无价值。

在编码前,先在脑中推演示例以验证你的方案。如果感觉哪里不对,就停下来重新思考——不要急于求成。

警惕各种陷阱:整数溢出、差一错误、未处理的边界情况(n=1、空输入、最大约束)。

在输出之前,最后一次检查你解法的正确性和效率。

在题目描述中提供的测试用例上运行,验证解法的正确性。

写出尽可能最优、正确的解法。使用高效的 I/O、最优的数据结构以及该问题已知的最佳算法。每一毫秒和每一字节内存都很重要。

只输出完整的解法代码——不要解释,不要 markdown 代码块,不要关于你思路的注释。

代码必须从 stdin 读取,向 stdout 写入。

语言:{lang_version}

用于本次评估的 Codeforces 比赛于 2026 年 2 月举行,而两个模型的知识截止时间均为 2025 年 6 月,因此模型不太可能见过这些问题。在此环境下的出色表现,为真正的泛化能力和实际解决问题的能力提供了证据。

Samvaad:对话式智能体

Sarvam 30B 已针对在 Samvaad 上生产部署对话式智能体进行了微调,Samvaad 是 Sarvam 的对话式 AI 平台。与规模相近的模型相比,它在对话质量和延迟方面都展现出明显的性能提升。

主要优势包括对印度语言的强大掌握能力,尤其是对这些语言中数值信息的准确处理,以及在多语言交互中可靠地执行工具调用。延迟方面的提升来自多个因素:相比同类模型更少的活跃参数、有针对性的推理优化,以及降低的分词器开销。

下面两个示例展示了 Sarvam 30B 用印地语和泰米尔语处理的电话对话。

Indus:面向印度的 AI 助手

Sarvam 105B 为 Indus 提供支持,Indus 是 Sarvam 的聊天应用,运行时使用针对对话优化的系统提示。该示例展示了模型理解印度语言查询、有效执行工具调用以及准确推理的能力。网络搜索以英语进行,以获取最新且全面的信息,而模型则解读查询并以泰卢固语给出正确的回答。

结论

Sarvam 30B 和 Sarvam 105B 代表着在印度构建高性能开放基础模型方面迈出的重要一步。通过将高效的混合专家架构与大规模、高质量的训练数据以及贯穿整个技术栈(从分词器设计到推理效率)的深度优化相结合,这两个模型在保持实际可部署性的同时,提供了强大的推理、编码和智能体能力。

Sarvam 模型家族的一个决定性优势在于其对印度 AI 生态系统的投入,这体现在对印度语言的强大性能、针对多样文字优化的分词,以及为印度特定语境量身定制的安全与评估上。结合 Apache 2.0 开源许可,这些模型可作为主权 AI 开发的基础设施。

本次发布也标志着内部能力的一个里程碑。通过这项工作,Sarvam 掌握了大规模构建高质量数据集、高效训练大型模型,并在具有竞争力的训练预算下取得优异成果的专业能力。有了这些基础,下一步是进一步扩展,训练规模更大、能力更强的模型。

致谢

这些模型使用印度政府电子和信息技术部 IndiaAI Mission 提供的算力进行训练。Nvidia 在该项目上密切合作,贡献了用于预训练、对齐和服务的库。我们也感谢使用过早期 Sarvam 模型并抽出时间分享反馈的开发者们。我们将这些模型开源,作为我们在印度构建基础 AI 基础设施的持续工作的一部分。

来源:Sarvam AI · sarvam.ai