Sarvam AI推出支持全部22种印度语言加全球英语的语音转文本模型,首token延迟<150ms,每小时API费用约₹30,开发者可集成。
Sarvam AI 发布了 Saaras V4,这是其最新一代语音识别模型。它覆盖印度全部 22 种预定语言以及英语,且现已支持全球英语口音。Sarvam 报告称,Saaras V4 在全部 22 种语言上均达到了最先进的准确率。
是否可以部署? 可以——通过 Sarvam 的 API,指定 model="saaras:v4" 即可调用。权重未公开,且 Sarvam 目前的 SageMaker 自托管文档仅覆盖 Saaras v3。
Saaras V4 是一个编码器-解码器系统。音频编码器将声波转换为携带语音和声学细节的嵌入向量。随后,一个时间下采样适配器缩短该序列,并将其投影到语言模型的嵌入空间中。这使得长录音能够保持在解码器的上下文预算范围内。
解码器是 Sarvam-3B,这是一个 3B 参数的混合状态空间语言模型,从零开始在内部训练。它同时读取音频特征和文本提示,然后自回归地输出转录文本,将每个 token 作为下一步的输入反馈回去。
Sarvam 评估了 7 个英文数据集。其中六个来自 Hugging Face 的 Open ASR Leaderboard:AMI、GigaSpeech、LibriSpeech clean、LibriSpeech other、SPGISpeech 和 VoxPopuli。第七个是 AI4Bharat 的印度口音数据集 Svarah。评分遵循该 leaderboard 的标准化代码。Saaras V4 在 Sarvam 基准测试的所有模型中创下了最低的平均 WER。
在 Vistaar 上,Sarvam 使用 WER 和 LLM-WER 两种指标报告了 10 种印度语言的结果。LLM-WER 增加了一层语义检查,它将真正的语义错误与印度文字中常见的无害拼写或格式变体区分开来。
在 Kathbath Noisy 上,以 LLM-WER 衡量,Sarvam 表示 Saaras V4 的错误率不到 Deepgram Nova-3 和 GPT-4o Transcribe 的一半。该测试集包含压缩音频、截断音频和高背景噪声录音。
在经过验证的 IndicVoices 语料上,十大印度语言的语言识别错误率为 2.9%,全部 22 种语言为 5.22%。
需要注意的是,上述所有数字均为厂商自行报告,尚未有独立复现结果发表。
同一段音频可以返回 5 种表示形式,通过 mode 参数选择:
Sarvam 的论点很简单:在模型内部处理这些变换,可以消除可能累积误差的后处理步骤。
Keyterm prompting 是 V4 的新功能,仅适用于 saaras:v4。通过 keyterms 传入一个 JSON 列表,最多 50 个术语,每个术语最多 64 个字符。Keyterms 会影响识别倾向,但不保证必定输出。当品牌名(如 PhonePe)必须保持拉丁文字时,请使用 codemix 模式。
在 IndicContextEval(论文,Interspeech 2026)上,Saaras V4 在 L5 关键词提示设置下报告了 16.03% WER。Sarvam 表示这是该基准测试中的最低分数。
Streaming:WebSocket 方式,支持部分结果返回,首 token 时间低于 150 ms。
REST:同步转录,最长支持 30 秒片段。
Batch:异步任务,每个文件最长 2 小时,支持可选的说话人分离。
SDK:Python 3.9+ 和 Node.js 18+,另有 LiveKit Agents、Pipecat 和 Vercel AI SDK 集成。
价格:Sarvam 列出的语音转文字价格为实时、streaming 和 batch 统一 ₹30/小时,含说话人分离为 ₹45/小时。
Saaras v3 仍为默认模型。V4 使用相同的请求结构,因此切换只需改 1 行代码。
以下是 Sarvam 基准测试对比的 3 个系统。数据来源于各厂商公开文档和定价页,核查日期为 2026 年 9 月 26 日。
| 功能 | Sarvam Saaras V4 | Deepgram Nova-3 | ElevenLabs Scribe v2 | OpenAI GPT-4o Transcribe |
|---|---|---|---|---|
| 印度预定语言(总计 22 种) | 22 | 1 | 1 | 14 |
| 未按语言列出 | — | 是 | 是 | — |
| 总语言数 | 23(22 种印度语言 + 英语) | 45+ | 90+ | 多语言 |
| Keyterm 偏置 | 最多 50 个术语 | 是,付费插件 | 最多 1000 个(batch)、50 个(实时),付费插件 | 免费文本提示 |
| 内置输出模式 | 5 种(transcribe、verbatim、codemix、translit、translate) | Transcript 加 Smart Formatting | Verbatim 或 no_verbatim | Transcript |
| 实时 streaming | WebSocket,TTFT 低于 150 ms(厂商声明) | 是(WebSocket) | Scribe v2 Realtime,约 150 ms | 文件 streaming;通过 Realtime API 实现直播 |
| 说话人分离 | Batch API | 是 | 最多 32 个说话人 | 独立的 gpt-4o-transcribe-diarize 模型 |
| 列表价格 | ₹30/小时 | $0.0052/分钟(多语言,预录) | $0.22/小时(batch) | ~$0.006/分钟 |
| 自托管 | V4 尚未开放(v3 在 SageMaker 上) | 是 | — | 云 API |
Saaras V4 在 1 个模型中覆盖全部 22 种印度语言以及全球英语。
其背后是一个 3B 混合状态空间解码器,从零开始训练。
Keyterm prompting 最多支持 50 个术语,在 IndicContextEval L5 上取得了 16.03% WER。
5 种输出模式和低于 150 ms 的 streaming TTFT 均来自同一模型。
目前仅提供 API,定价 ₹30/小时;自托管文档仍停留在 v3。