Sarvam 105B开源模型发布
印度团队发布可竞争的开源大语言模型。模型发布消息对LLM应用开发者有参考价值,但性能对标和应用案例有限。
印度团队发布可竞争的开源大语言模型。模型发布消息对LLM应用开发者有参考价值,但性能对标和应用案例有限。
我们将以开源模型的形式发布 Sarvam 30B 和 Sarvam 105B。两者都是从零开始训练的推理模型,在训练的每个阶段——预训练、监督微调和强化学习——都使用了由内部团队精心构建的大规模高质量数据集。训练完全在印度进行,所用算力由 IndiaAI 计划提供。这些模型代表了真正的全栈工程成果。除数据集外,我们还优化了分词、模型架构、执行内核、调度和推理系统,使模型能够高效部署在各种硬件上,从旗舰级 GPU 到笔记本电脑等个人设备。两款模型均已投入生产。Sarvam 30B 为我们的对话式 AI 智能体平台 Samvaad 提供支持;Sarvam 105B 则为 Indus 提供支持,Indus 是我们面向复杂推理和 AI 智能体工作流打造的 AI 助手。
Sarvam 系列模型在各自级别中具备全球竞争力。Sarvam 105B 在广泛的基准测试中,在推理、编程和 AI 智能体任务上均表现出色。Sarvam 30B 针对实时部署进行了优化,在真实世界的对话用例中表现强劲。两款模型都在印度语言基准测试中取得了最先进的结果,超越了参数规模大得多的模型。
此次发布标志着 Sarvam 的一个重要里程碑。构建这些模型需要我们形成覆盖数据、训练、推理和产品部署的端到端能力。有了这一基础,我们已经准备好扩展到规模大得多、能力更强的模型,包括专门面向编程、AI 智能体和多模态对话任务的模型。
Sarvam 105B 已可在 Indus 上使用。两款模型均可通过 API dashboard 中的 API 访问。模型权重可从 AI Kosh(30B、105B)和 Hugging Face(30B、105B)下载。如果你希望使用 Transformers、vLLM 和 SGLang 在本地运行推理,请参阅 Hugging Face 模型页面中的示例实现。
两款模型遵循共同的架构原则:在实现高容量推理能力的同时,兼顾高效训练和部署。其核心是 Mixture-of-Experts(MoE)Transformer 主干网络,通过稀疏专家路由扩展参数规模,而不会增加每个 token 所需的计算量,同时将推理成本控制在实用范围内。该架构通过旋转位置嵌入、基于 RMSNorm 的稳定化机制,以及针对推理期间高效使用 KV-cache 而优化的注意力设计,支持长上下文输入。
虽然两款模型采用相同的设计理念,但它们在规模和注意力机制上有所不同。Sarvam 30B 使用 Grouped Query Attention(GQA),以减少 KV-cache 内存占用,同时保持强劲性能。Sarvam 105B 则通过更深的网络层数和 Multi-head Latent Attention(MLA)扩展了这一架构;MLA 是一种压缩式注意力机制,可进一步降低长上下文推理的内存需求。
两款模型都采用包含 128 个专家的稀疏专家前馈层,但专家容量和路由配置有所不同。这使较大的模型能够扩展到更高的总参数量,同时将实际参与计算的规模维持在限定范围内。
训练流水线的所有阶段均由内部团队开发和执行,包括模型架构、数据整理与合成流水线、推理监督框架,以及强化学习基础设施。从零开始构建整个体系,使我们能够直接控制训练各阶段的数据质量、训练动态和能力发展,而这是构建自主可控技术栈的核心要求。
我们的 30B 和 105B 模型均使用大规模数据集进行训练,其中 30B 模型使用了 16T tokens,105B 模型使用了 12T tokens。预训练数据涵盖代码、通用 Web 数据、专业知识语料库、数学和多语言内容。在进行多轮消融实验后,最终的训练数据配比经过平衡,重点强化推理、事实依据和软件能力。我们在所有类别的合成数据生成流水线上投入了大量资源。多语言语料库将训练预算中的很大一部分分配给使用人数最多的 10 种印度语言。
预训练分为三个阶段,包括长周期预训练、中期训练和长上下文扩展阶段。我们采用基于 sigmoid 的路由分数,而非传统的 softmax 门控,这改善了专家负载均衡,并减少了训练期间的路由坍缩。专家偏置项能够稳定路由动态,并促进各个训练步骤中的专家利用率更加均衡。我们观察到,105B 模型在训练早期便迅速取得了优于 30B 模型的基准测试成绩,这表明其具备高效的规模扩展特性。
在监督微调期间,模型会使用一个大规模高质量提示词语料库进行训练,这些提示词根据难度、质量和领域多样性进行了精心筛选。提示词来自开放数据集,并使用定制模型进行标注,以识别所属领域并分析数据分布的覆盖情况。为弥补代表性不足或难度偏低领域的缺口,我们根据预训练领域配比额外生成了合成提示词。实证分析表明,大多数公开数据集都以低质量、同质化且简单的提示词为主,这限制了模型的持续学习。为缓解这一问题,我们投入了大量精力,构建覆盖不同领域的高质量提示词。所有对应的回答均由内部生成,并经过严格的质量筛选。数据集还包含大量来自模拟环境和真实代码仓库的 AI 智能体轨迹,使模型能够学习工具交互、环境推理和多步骤决策。
在安全微调方面,我们开发了一个涵盖标准风险场景和印度特定风险场景的数据集。这项工作以统一的分类体系为指导,并采用了受到公开前沿模型宪章启发的内部模型规范。为了发现并解决具有挑战性的故障模式,我们进一步使用通过自动化红队测试挖掘出的对抗性提示词和 jailbreak 风格提示词扩充了数据集。这些提示词与符合策略要求的安全回答配对,用于监督训练。
强化学习阶段使用规模庞大且类型多样的提示词分布,覆盖数学、编程、STEM 推理、Web 搜索和工具使用,同时包含单轮和多轮环境。奖励由多种信号共同确定,包括正确性检查和执行结果等可验证信号,以及基于评分标准的评估;后者用于衡量指令遵循情况、格式、回答结构和整体质量。为了维持有效的学习课程,我们使用开源模型和早期检查点对提示词进行预筛选,移除那些要么能够被轻易解决、要么始终无法解决的任务。训练期间,自适应采样机制会根据每个提示词当前通过率所推导出的信息增益指标,动态分配 rollout。在固定的生成预算下,rollout 分配被建模为类似背包问题的优化,将算力集中在接近模型能力边界、学习信号最强的任务上。
RL 系统采用异步 GRPO 架构实现,将生成、奖励计算和策略更新解耦,从而在保持较高 GPU 利用率的同时,实现高效的大规模训练。通过限制采样轨迹相对于策略更新的陈旧程度来控制轨迹陈旧性,在吞吐量与训练稳定性之间取得平衡。该系统省略了相对于参考模型的 KL-divergence 正则化,避免奖励最大化与策略锚定之间的优化冲突。策略优化转而采用受 CISPO 启发的自定义组相对目标,与标准的裁剪代理方法相比,稳定性更高。奖励塑形还进一步鼓励结构化推理、简洁回答和正确的工具使用,从而形成一套适用于大规模 MoE 训练的稳定 RL 流水线,能够保持持续学习,且没有出现奖励坍缩的迹象。
Sarvam 105B 在知识、推理和 AI 智能体基准测试中,达到或超越了同级别大多数开源和闭源前沿模型。在印度语言基准测试中,它的表现显著优于我们评估的所有模型。
Sarvam 105B 在数学、编程、知识和指令遵循等核心能力上展现出强劲且均衡的表现。它在 Math500 上取得 98.6 分,与对比中的顶尖模型持平;在 LiveCodeBench v6 上取得 71.7 分,在真实世界编程任务中超越了大多数竞争对手。在知识基准测试中,它在 MMLU 上取得 90.6 分,在 MMLU Pro 上取得 81.7 分,保持了与前沿级系统相当的竞争力。模型在 IF Eval 上取得 84.8 分,表明它在现代语言模型所需承担的主要工作负载中具备全面均衡的能力。
Sarvam 105B 在多步推理基准测试中表现强劲,体现了训练过程对复杂问题求解的重视。在 AIME 25 上,该模型的 Pass@1 达到 88.3,使用工具后提升至 96.7,表明其推理能力与外部工具实现了有效整合。它在 GPQA Diamond 上获得 78.7 分,在 HMMT 上获得 85.8 分,两项成绩均超过多个同类模型。在要求更深层推理链和更复杂数学分解的 Beyond AIME 上,该模型取得 69.1 分,领先或追平对比模型。综合来看,这些结果反映出该模型在持续推理和高难度问题求解任务上的稳定优势。
Sarvam 105B 针对涉及工具使用、长程推理和环境交互的 AI 智能体工作负载进行了优化。这一点体现在其针对真实工作流设计的基准测试中的出色表现。在 BrowseComp 上,该模型取得 49.5 分,在由 Web 搜索驱动的任务中超过多个竞争对手。在衡量长程 AI 智能体推理和任务完成能力的 Tau2(平均分)基准测试中,它取得 68.3 分,是所有对比模型中的最高分。这些结果表明,该模型能够在长时间的多步交互中有效地制定计划、检索信息并保持连贯的推理过程。
在相同的规模区间内进行比较更具参考价值,因为每一代前沿模型的训练算力、数据集规模和基础设施规模都会大幅增长。其他实验室的最新模型使用了规模大得多的集群和预算进行训练。与一系列参数规模大得多的上一代模型相比,Sarvam 105B 仍然具有竞争力。我们现已验证了训练与数据流水线的有效性,接下来会将训练扩展到参数规模大得多的模型。
Sarvam 105B 与更大模型的比较
Sarvam 30B 被设计为一种适合实际部署的高效推理模型,兼具强大能力和较低的活跃计算量。它仅有 2.4B 活跃参数,却能在广泛的基准测试中与规模大得多的稠密模型和 MoE 模型竞争。以下评测重点展示了它在通用能力、多步推理和 AI 智能体任务方面的优势,表明该模型不仅能够提供强大的真实场景性能,同时还具备很高的运行效率。
Sarvam 30B——全部基准测试(为保证完整性,加入了 Gemma 和 Mistral 进行比较。由于它们并非推理模型或 AI 智能体模型,因此对应单元格留空)
Sarvam 30B 在核心语言建模任务中表现强劲,尤其是在数学、编程和知识类基准测试中。它在 Math500 上取得 97.0 分,追平或超过同类中的多个更大模型。在编程基准测试中,它在 HumanEval 上取得 92.1 分,在 MBPP 上取得 92.7 分,在 LiveCodeBench v6 上取得 70.0 分,在实用编程任务中超过许多规模相近的模型。在知识类基准测试中,它在 MMLU 上取得 85.1 分,在 MMLU Pro 上取得 80.0 分,与其他领先的开放模型相比仍具竞争力。
推理性能
Sarvam 30B 在多步推理基准测试中表现强劲,体现了它处理复杂逻辑和数学问题的能力。在 AIME 25 上,它的 Pass@1 达到 88.3,使用工具后提升至 96.7,表明其推理能力与外部工具实现了有效整合。它在 GPQA Diamond 上取得 66.5 分,并在多项高难度数学基准测试中表现出色,其中 HMMT Feb 2025 得分为 73.3,HMMT Nov 2025 得分为 74.2。在 Beyond AIME 上,该模型取得 58.3 分,与更大的模型相比仍具竞争力。综合来看,这些结果表明 Sarvam 30B 能够维持深层推理链,并完成专家级问题求解,其表现显著超出了对活跃计算量相近模型的通常预期。
Sarvam 30B 原生支持工具调用,并且在评估涉及规划、检索和多步任务执行的 AI 智能体工作流基准测试中表现稳定。在 BrowseComp 上,它取得 35.5 分,在由 Web 搜索驱动的任务中超过多个同类模型。在 Tau2(平均分)上,它取得 45.7 分,表明其在长时间交互中具有可靠的表现。SWE-Bench Verified 对所有模型而言仍然很有挑战性;Sarvam 30B 在同类模型中展现出了有竞争力的表现。综合来看,这些结果表明,该模型非常适合需要高效使用工具和结构化执行任务的真实 AI 智能体部署,尤其适用于推理效率至关重要的生产环境。
印度语言性能
为了评估印度语言能力,我们采用基于 LLM-as-judge 协议的成对比较框架开发了一项新基准测试。这项基准测试的一个关键目标,是反映印度当今实际使用语言的方式。这意味着要使用两种文字形式评估每种语言:一种是代表正式书面用法的原生文字,另一种是代表消息通信和在线交流中常见口语用法的罗马化拉丁文字。
该基准测试分为四个领域:通用对话、STEM、数学和编程。它源自 110 条英文提示词,其中 50 条涵盖通用对话,STEM、数学和编程各 20 条。每条提示词都会被翻译为印度宪法列入附表的 22 种语言,并同时提供原生文字和罗马化文字版本。
直接评估低资源语言中复杂推理提示词回答的正确性,可能会产生较大噪声和不一致。为解决这一问题,我们使用 Claude Opus 4 生成了高质量的英文参考答案。这些参考答案仅用于评估印度语言回答的实用性维度,包括相关性、完整性和正确性。
该评测采用成对比较方法,并使用 Gemini 3 作为评判模型。评判模型从四个维度评估回答:流畅度、语言及文字正确性、实用性和冗长度。评测数据集及对应提示词可在此处获取。
Sarvam 105B 在所有基准测试维度上的平均胜率为 90%,在 STEM、数学和编程领域的平均胜率为 84%。
Sarvam 30B 在所有基准测试维度的比较中平均胜率为 89%,在 STEM、数学和编程领域的胜率为 87%。
Sarvam tokenizer 针对印度宪法列入附表的全部 22 种语言进行了高效分词优化,覆盖 12 种不同文字体系,可直接降低印度语言服务的成本和延迟。根据 fertility score 衡量,它在高效编码印度语言文本方面优于其他开源 tokenizer。fertility score 指表示一个单词平均所需的 token 数量。与其他 tokenizer 相比,它对奥里亚语、桑塔利语和曼尼普尔语(Meitei)等低资源语言的处理效率显著更高。下图展示了各种 tokenizer 在英语及全部 22 种附表语言上的平均 fertility。
推理优化
Sarvam 30B 构建了一套推理优化技术栈,旨在最大限度提高各级部署环境的吞吐量,覆盖从旗舰级数据中心 GPU 到开发者笔记本电脑的各种设备。该推理流水线没有依赖标准服务实现,而是使用针对架构优化的融合内核、优化调度和解耦式服务进行了重构。
通过对执行栈进行微秒级性能分析,我们确定了三个主要瓶颈:内存停顿、内核启动开销和低效调度。解决这些问题后,各类硬件和不同序列长度下的吞吐量均得到大幅提升。优化策略主要聚焦于三个关键组成部分。
针对每种硬件目标,使用融合 attention 和 matmul 流水线进行内核级重写
采用高级调度和批处理策略,提高真实多用户负载下的 GPU 利用率
采用解耦式服务流水线,消除 prefill 与 decode 阶段之间的瓶颈
在延迟目标相同的情况下,这些优化显著提高了每块 GPU 每秒生成的 token 数量,从而支持更高的用户并发量并降低基础设施成本。
在 H100 级基础设施上,与 Qwen3 基线相比,Sarvam 30B 在所有序列长度和请求速率下均实现了显著更高的单 GPU 吞吐量;在每位用户每秒 token 数相同的运行点上,其单 GPU 吞吐量始终高出 3 倍至 6 倍。
Sarvam 30B 还可以在 L40S 等中端加速器上高效运行,使生产部署无需依赖高端 GPU。在计算能力和内存带宽限制更严格的情况下,经过优化的内核和调度策略可在典型运行点带来 1.5 倍至 3 倍的吞吐量提升。在更长的输入和输出序列长度(28K / 4K)下,这种提升更加明显,而大多数真实世界的推理请求都处于这一范围。
Sarvam 30B 还针对采用 Apple Silicon 的系统进行了本地运行优化,使用 MXFP4 混合精度推理。在 MacBook Pro M3 上,经过优化的运行时在常见序列长度下可将 token 吞吐量提升 20% 至 40%。这些改进显著提升了本地实验的响应速度,并且无需专用加速器即可支持轻量级边缘部署。
Sarvam 105B 针对以服务器为中心的硬件进行了优化,采用了与上述类似的流程,并特别侧重于 MLA(Multi-head Latent Attention,多头潜在注意力)优化。其中包括自定义形状的 MLA 优化、词表并行、高级调度策略以及解耦式服务。上述对比展示了该模型在 H100 节点上处理不同输入和输出长度时的性能优势。
结合高效的印度语言分词器后,在相同 SLA 下,性能差距会显著扩大。对于 30B 模型,这一差距最高可扩大至 10 倍,使其在印度语言生成任务中达到此前同类模型无法实现的性能水平。
注意:性能数据是未采用解耦式推理的独立模型测量结果。
以下演示展示了 Sarvam 模型家族在真实应用中的实用能力,涵盖网页生成、多语言对话式智能体、复杂 STEM 问题求解和教育辅导。这些示例体现了模型在推理、工具使用、多语言理解和端到端任务执行方面的优势,并说明了如何将 Sarvam 模型集成到生产系统中,用于构建交互式应用、智能助手和开发者工具。
下面的小组件通过使用 Claude Code harness 进行端到端项目生成,展示了 Sarvam 105B 的 AI 智能体能力,体现了该模型根据简单的提示词规格构建完整网站的能力。
目标是生成一个完整、可用于生产的网页,其中包含运行应用所需的全部 HTML、CSS 和 JavaScript,无需框架或构建工具。模型使用 PokéAPI 动态加载 Pokémon 数据,并仅根据下方所示的提示词实现了分页、搜索、筛选和详细信息模态框视图。
将 Pokédex 示例 Web 应用构建为单个 index.html 文件,并内嵌 CSS 和 JS。
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ POKÉAPI 参考(基础 URL:https://pokeapi.co/api/v2) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
GET /pokemon?limit=151&offset=0
Returns:
{
"count": 1302,
"results": [
{ "name": "bulbasaur", "url": "https://pokeapi.co/api/v2/pokemon/1/" },
{ "name": "ivysaur", "url": "https://pokeapi.co/api/v2/pokemon/2/" },
...
]
}
单个 Pokémon 端点
GET /pokemon/{id or name}
Example: GET /pokemon/1 or GET /pokemon/bulbasaur
Key fields in response:
{
"id": 1,
"name": "bulbasaur",
"height": 7, // in decimetres
"weight": 69, // in hectograms
"base_experience": 64,
"sprites": {
"front_default": "https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/1.png",
"other": {
"official-artwork": {
"front_default": "https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/other/official-artwork/1.png"
}
}
},
"types": [
{ "slot": 1, "type": { "name": "grass", "url": "..." } },
{ "slot": 2, "type": { "name": "poison", "url": "..." } }
],
"stats": [
{ "base_stat": 45, "stat": { "name": "hp" } },
{ "base_stat": 49, "stat": { "name": "attack" } },
{ "base_stat": 49, "stat": { "name": "defense" } },
{ "base_stat": 65, "stat": { "name": "special-attack" } },
{ "base_stat": 65, "stat": { "name": "special-defense" } },
{ "base_stat": 45, "stat": { "name": "speed" } }
],
"abilities": [
{ "ability": { "name": "overgrow" }, "is_hidden": false },
{ "ability": { "name": "chlorophyll" }, "is_hidden": true }
]
}
Sprite URL 快捷方式(无需调用 API)
无需获取数据即可直接构造 Sprite URL:缩略图:https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/{id}.png 官方插图:https://raw.githubusercontent.com/PokeAPI/sprites/master/sprites/pokemon/other/official-artwork/{id}.png
全部 18 种属性及建议的徽章颜色
normal: #A8A878 fire: #F08030 water: #6890F0 electric: #F8D030 grass: #78C850 ice: #98D8D8 fighting: #C03028 poison: #A040A0 ground: #E0C068 flying: #A890F0 psychic: #F85888 bug: #A8B820 rock: #B8A038 ghost: #705898 dragon: #7038F8 dark: #705848 steel: #B8B8D0 fairy: #EE99AC
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 要求 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
单个 index.html 文件,不使用框架,不使用构建工具
展示全部 1302 个 Pokémon,每页 40 个,提供上一页/下一页控件和页码指示器(例如 "Page 3 of 33")。应按页获取数据——仅加载当前页面所需的 Pokémon,不要预先加载全部数据。
响应式卡片网格,展示:Sprite(缩略图 URL)、名称、ID(#001 格式)、属性徽章
点击卡片后打开模态框,其中包含:官方插图、全部 6 项能力值及其带标签的进度条(能力值上限 = 255)、身高(将 dm 转换为 m)、体重(将 hg 转换为 kg)、特性
按名称或 ID 实时搜索——搜索范围应覆盖全部 Pokémon,而不仅仅是当前页面
使用可点击按钮按属性筛选
获取当前页面数据时显示骨架屏加载卡片
经典 Pokédex 配色方案:以红色(#CC0000)为主色、白色卡片、深色文字
缓存已获取的 Pokémon 数据,避免重新访问某个页面时发起重复的网络请求
创建 index.html,并确保其端到端功能完整。
该任务旨在为 Sarvam 构建一个完整的网站,在排版、动效、布局和交互设计方面达到世界级视觉标准的同时,体现一家致力于为十亿人构建 AI 的印度 AI 公司的精神。完整提示词如下所示。
为我构建一个惊艳且达到生产级质量的 Sarvam AI 网站。Sarvam AI 是一家印度 AI 公司,其使命是为十亿人构建 AI,并深深植根于印度多样化的语言和文化之中。“Sarvam”(सर्वम्)在梵语中意为“一切”。
美学方向:采用精致的印度现代主义风格——灵感来自莫卧儿