
波士顿AI公司Modulate近日完成2500万美元融资,由Future Ventures领投,Hyperplane和Lakestar参投。至此,该公司累计融资额达6000万美元。
Modulate由Mike Pappas和Carter Huffman联合创立,两人相识于麻省理工学院(MIT)。公司早期凭借ToxMod系统在游戏领域崭露头角,自2023年起协助《使命召唤》进行语音聊天审核。2022年,Modulate曾获得由Lakestar领投的3000万美元A轮融资。
从游戏审核到全场景语音智能
随着语音成为AI主要交互界面,Modulate正将技术版图扩展至欺诈预防、客户服务及AI语音代理验证等领域。CEO Carter Huffman指出,语音交互带来了一系列仅靠文本转录无法解决的难题。
公司核心产品Velma能直接分析音频信号,实时识别情绪、语调、意图、重音及合成声音特征。与依赖单一大型模型不同,Velma采用“集成监听模型”(Ensemble Listening Model),针对特定任务组合100多个小型专用音频模型。
据Modulate数据,该架构效率比单一大模型高出多达1000倍,在识别真实问题上的准确率是通用大语言模型的两倍,误报率低七倍。在公开基准测试中,其转录模型今年7月登顶Hugging Face自动语音识别(ASR)排行榜;深度伪造检测器自3月以来稳居Hugging Face语音深伪竞技场榜首,等错误率仅为1.1%。批量转录成本低至每小时0.03美元。
防御深伪欺诈,月处理千万小时音频
面对日益成熟的语音克隆欺诈威胁,Modulate的技术已应用于医院等高风险场景,防御深度伪造来电。目前,该系统每月处理超1000万小时音频,累计分析时长突破6亿小时。此外,公司还提供语音掩蔽功能以保护员工,并能检测对话中的儿童诱骗行为。
Future Ventures联合创始人Steve Jurvetson认为,Modulate在“原生音频AI”领域具备显著技术领先优势,需求正从游戏快速延伸至AI代理、安全及客户体验市场。
本轮资金将用于研发及工程团队扩充,并通过推出新的SDK、API及合作伙伴集成吸引开发者,使企业能直接调用音频理解能力,无需自行训练模型。