Navana.ai 正式推出 Bodhi TTS,这是一款专为印度市场打造的文本转语音(TTS)模型,支持印地语、泰卢固语、泰米尔语等 10 种印度语言及英语,并提供超过 50 种优化声音。

极致性价比与本地化部署

Bodhi TTS 的定价为每 10,000 个字符 12 卢比。Navana.ai 表示,这一价格约为 ElevenLabs 的八分之一(后者约合每 10,000 字符 95 卢比),较 Sarvam AI 的 Bulbul v3(30 卢比/万字符)低 60%。

该模型在印度本土构建和训练,具备端到端完整语音技术栈。其显著优势在于低延迟与数据主权:音频生成启动时间不到 100 毫秒,且支持在企业自有数据中心内部署。这意味着银行、保险等客户的音频、转录文本及个人数据无需路由至第三方提供商,始终保留在安全的企业环境中。

Navana.ai 联合创始人 Jai Nanavati 指出,Bodhi TTS 的体积比近期同类模型小约五倍。这种轻量化设计使其能够在企业现有的中高端 GPU 上运行,既降低了成本,也确保了数据不出域。

深度适配印度语境

针对印度复杂的语言环境,Bodhi TTS 进行了专项优化。它能准确处理印度特有的文本格式,如将“₹1,00,000”读作“one lakh rupees”,并正确朗读 PAN 号码、电话号码、日期、等额本息还款额(EMI)及账户信息。

模型还支持通过词典控制发音。企业可上传产品、分支或客户名称,并通过内联标记指导模型发音。在实际通话中发现的发音错误,无需重新训练模型即可纠正。此外,所有 10 种语言均支持语音克隆,仅需几秒参考音频即可创建新声音,且参考音频已缓存,不会增加通话延迟。

“印度社会高度依赖语音交互,且多数非英语场景此前面临两难:要么使用发音错误的全球模型,要么承担高昂的试点成本。”Navana.ai 联合创始人兼 CEO Raoul Nanavati 表示,“Bodhi 从零构建以涵盖各种口音,让企业的语音助手真正具有印度特色。”

商业落地与新模型开放

目前,Navana.ai 的语音代理已在 Bajaj Finserv、Ujjivan Small Finance Bank 等 BFSI(银行、金融服务和保险)客户中广泛应用。公司数据显示,其处理的月度贷款发放总额超 1,000 亿卢比,累计语音 AI 交互时长超过 1 亿分钟。

除 Bodhi TTS 外,Navana.ai 还通过邀请制开放了其语音识别模型 Bodhi STT,支持 10 种印度语言和 40 多种方言,相关基准测试结果已在 Hugging Face 发布。

Bodhi TTS 现已通过 Navana.ai 平台提供服务,新用户可享 1,000 卢比免费额度。银行、保险公司及放贷机构可申请提前访问 Bodhi TTS 和 STT,首批获批团队将获得有效期 90 天的 100 小时使用额度。