Sarvam AI 发布 Saaras V4:面向全部 22 种印度语言和全球英语的语音转文字模型

Sarvam AI 发布了 Saaras V4,这是其语音识别模型的最新一代。它覆盖全部 22 种印度法定语言以及英语,现在还纳入了全球各地的英语口音。Sarvam 称其在全部 22 种语言上均达到最先进的准确率。

它可部署吗?可以,现在就能通过 Sarvam 的 API 使用,指定 model="saaras:v4" 即可。模型权重未公开,且 Sarvam 的 SageMaker 自托管文档目前仍只覆盖 Saaras v3。

Sarvam AI 发布 Saaras V4:面向全部 22 种印度语言和全球英语的语音转文字模型

Saaras V4 里有什么

Saaras V4 是一个编码器-解码器系统。音频编码器把波形转换为携带音素与声学细节的嵌入向量。随后,一个时间下采样适配器会缩短该序列,并将其投影到语言模型的嵌入空间。这样可以让长录音落在解码器的上下文预算之内。

解码器是 Sarvam-3B,一个 30 亿参数的混合状态空间语言模型,由 Sarvam 内部从零训练。它同时读取音频特征和一段文本提示,然后自回归地输出转写结果,把每个 token 再作为下一步的输入。

基准测试结果

英语:Sarvam 评测了 7 个英语数据集。其中 6 个来自 Hugging Face 的 Open ASR Leaderboard:AMI、GigaSpeech、LibriSpeech clean、LibriSpeech other、SPGISpeech 和 VoxPopuli。第 7 个是 AI4Bharat 的印度口音数据集 Svarah。评分沿用该榜单的归一化代码。在 Sarvam 所对比的模型中,Saaras V4 取得了最低的平均 WER。

印度语言:在 Vistaar 上,Sarvam 报告了 10 种印度语言的结果,同时使用 WER 和 LLM-WER。LLM-WER 增加了语义校验。它能区分真正的语义错误,与印度文字系统中常见的、无害的拼写或格式变体。

噪声音频:在 Kathbath Noisy 上,以 LLM-WER 衡量,Sarvam 称 Saaras V4 的错误率不到 Deepgram Nova-3 和 GPT-4o Transcribe 的一半。该数据集包含压缩、削波以及背景噪声严重的录音。

语种识别:在经人工校验的 IndicVoices 语音样本上,前 10 种印度语言的语种识别错误率为 2.9%,全部 22 种语言为 5.22%。

需要强调的是,以上所有数字均为厂商自行报告。目前尚无独立复现结果发布。

一个模型,5 种输出模式

同一段音频可以返回 5 种表示形式,通过 mode 参数选择:

  • transcribe(默认)​:原生文字,数字与日期已做归一化。
  • verbatim:逐字保留所说内容,包括语气词和口语数字。
  • codemix:原生文字,英文单词保留英文。
  • translit:整段内容用拉丁字母转写。
  • translate:英文翻译,数字已归一化。

Sarvam 的理由很简单:把这些处理放进模型内部,就能省掉那些可能叠加误差的后处理步骤。

关键词提示(Keyterm Prompting)

关键词提示是 V4 新增的能力,且仅在 saaras:v4 下可用。你在 keyterms 下传入一个 JSON 列表,最多 50 个词条,每条最长 64 个字符。关键词会对识别产生偏置,但不保证一定输出。当 PhonePe 这类品牌名必须保持拉丁字母时,请使用 codemix 模式。

在 IndicContextEval(论文,Interspeech 2026)上,Saaras V4 在 L5 关键词提示设置下报告了 16.03% 的 WER。Sarvam 称这是该基准上的最低分。

流式、长音频与定价

  • 流式:WebSocket,带部分结果,首 token 时延低于 150 毫秒。
  • REST:针对最长 30 秒的片段做同步转写。
  • 批处理:异步任务,单文件最长 2 小时,可选说话人分离。
  • SDK:支持 Python 3.9+ 和 Node.js 18+,另有 LiveKit Agents、Pipecat 和 Vercel AI SDK 集成。
  • 价格:Sarvam 列出语音转文字的价格为实时、流式与批处理 ₹30/小时,带说话人分离为 ₹45/小时。

Saaras v3 仍是默认模型。V4 使用相同的请求结构,因此切换只需改一行。

Saaras V4 与最接近的竞品

以下是 Sarvam 拿来对比的 3 个系统。数据来自各厂商的公开文档与定价页,核对日期为 2026 年 9 月 26 日。添加到对话

特性Sarvam Saaras V4Deepgram Nova-3ElevenLabs Scribe v2OpenAI GPT-4o Transcribe
印度法定语言(共 22 种)221114未按语言列出
语言总数23(22 种印度语言 + 英语)45+90+多语言
关键词偏置最多 50 个词条支持,付费附加项最多 1,000(批处理)、50(实时),付费附加项自由文本提示
内置输出模式5 种(transcribe、verbatim、codemix、translit、translate)转写 + Smart FormattingVerbatim 或 no_verbatim转写
实时流式WebSocket,TTFT 低于 150 毫秒(厂商声称)支持(WebSocket)Scribe v2 Realtime,约 150 毫秒文件流式;实时需经 Realtime API
说话人分离批处理 API支持最多 32 位说话人需使用单独的 gpt-4o-transcribe-diarize 模型
标价₹30/小时$0.0052/分钟(多语言,预录音频)$0.22/小时(批处理)约 $0.006/分钟
自托管V4 暂不支持(v3 可在 SageMaker 上)支持仅云 API仅云 API

要点

  • Saaras V4 在 1 个模型中覆盖全部 22 种印度语言加全球英语。
  • 音频编码器背后是一个从零训练的 3B 混合状态空间解码器。
  • 关键词提示最多接受 50 个词条,在 IndicContextEval L5 上取得 16.03% 的 WER。
  • 5 种输出模式与低于 150 毫秒的流式 TTFT 均出自同一个模型。
  • 目前仅 API 可用,价格 ₹30/小时;自托管文档仍只覆盖 v3。

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/72249.html

赞 (0)

相关推荐