星光澄海 | BLOG

Sarvam AI推Saaras V4:覆盖全22种印度语+英语的语音转写模型

Sarvam AI刚发的Saaras V4,是目前唯一覆盖印度全部22种官方语言的语音转写模型,还支持全球英语口音——这个覆盖度,比市面上其他竞品高了不止一倍。

覆盖全印度语,精度数据的前提要讲清

先泼个冷水:所有精度数字都是厂商自报的,目前还没看到第三方独立复现的结果。不过覆盖度是实的:Deepgram Nova3只支持11种印度语,ElevenLabs Scribe v2是14种,OpenAI更是没按印度语单独列支持数量,Saaras V4直接拉满22种,还加了全球英语口音,这个点足够戳印度市场的痛点。毕竟印度的多语言环境,之前的模型根本兜不住——哪怕是常用的商务场景,也可能碰到没人能识别的小众语言,现在终于有个全兼容的选项。

功能细节:5种输出和关键词提示,省麻烦

再看核心功能:模型是编码器-解码器架构,加了下采样适配器,能把长音频塞进解码器的上下文预算里,不会卡壳。解码器是自研的Sarvam-3B,30亿参数的混合状态空间模型,从头训的,不是套壳的通用模型。
还有个实用设计:5种输出模式直接在模型里生成,不用自己做后处理转写,比如要混合语的话,codemix模式直接把英语词留成英文,不用再加工;要转成拉丁拼写的话,translit模式一键搞定。新的关键词提示功能,最多传50个术语,每个最多64字符,能引导模型优先识别,比如做电商的,要固定保留PhonePe这种品牌名的拉丁拼写,就用这个模式,不会转成印度语拼法。在Interspeech 2026的IndicContextEval数据集上,这个功能的WER是16.03%,厂商说比同行低。

和竞品比,价格和场景的差异

最后看硬对比:部署上,V4目前只有API,自托管的文档还停留在V3版本,只能等后续更新;价格是亮点,实时、流式、批量转写都是30卢比每小时,加说话人 diarization是45卢比——换算成人民币也就几块钱,比Deepgram、ElevenLabs、GPT-4o都便宜。
场景适配也到位:流式的首token延迟低于150ms,适合实时客服、对话记录;批量最多支持2小时的文件,还支持说话人 diarization,对会议录音、播客转写友好;同时有Python、Node.js SDK,还集成了LiveKit、Vercel这些主流工具,上手快。
不过也要说短板:模型权重不公开,只能用API调用,要定制化的话暂时不方便。

现在的问题是,其他做多语言语音转写的公司,会不会赶紧跟进覆盖全22种印度语?毕竟这个覆盖度,直接卡住了印度市场的门槛,谁先跟上,谁就能拿到更大的盘子。


素材来源:MarkTechPost · AI情报、AI应用落地、AI基础设施
查看报道原文

发表第一条评论吧

支持 Markdown