多数语音 AI 公司都用能抓取到的任何音频训练模型。Rime却建了一座录音棚。7月15日,这家旧金山初创公司宣布完成由M13 Ventures领投的2400万美元 A 轮融资Twilio VenturesCorazon CapitalUnusual Ventures及其他现有投资者跟投。M13 合伙人Morgan Blumberg将出任董事会成员。

创始团队

Rime 由 CEO Lily Clifford2022年创立,她放弃了斯坦福语言学博士项目转而创业;团队还包括前 Amazon Alexa 工程师Brooke Larson以及斯坦福工程师Ares Geovanos。公司目前有35名员工,正在模型开发、工程和合作伙伴关系等岗位招聘。公司最近还聘请了Rafael Valle担任首席科学家;他此前曾在 Meta Superintelligence Labs 从事音频理解工作,也曾在 Nvidia 的应用深度学习音频研究团队任职。

数据押注

Rime 的差异化在于数据来源。该公司在旧金山自建录音棚,用于采集自己的对话数据,而不是依赖抓取来的网络音频——随着基于抓取数据的竞争对手面临版权审查,这一选择看起来越来越明智。公司还采用了基于音素的架构,旨在准确发音品牌名和行业术语,让客户无需为每个垂直领域重新训练模型。

当下的问题

Clifford 对行业痛点的判断,在这轮融资语境下显得格外直接。她告诉 TechCrunch:“语音技术目前还不足以自动化绝大多数企业电话。LLM 已经让构建可用的语音应用容易得多,但它们并没有改变交互的感觉。和语音 AI 代理通话,对终端用户来说并不是最有吸引力的体验。有点像新的 IVR,只不过声音更好听。”她的解决方案是架构层面的:从拼接式的 speech-to-text、LLM 到 text-to-speech 流程,转向speech-to-speech 模型,以降低延迟、改善轮次切换、处理背景噪音并减少编排开销。

进展与竞争格局

Rime 的客户包括Mayo Clinic、Dialpad、Upstart 和 Asurion,覆盖餐饮、医疗、航空和金融科技等领域;TechCrunch 报道称,该公司每月处理超过1亿通电话。其竞争对手包括模型开发商ElevenLabsDeepgram,基础设施公司 Vapi、Retell 和 LiveKit,以及客户支持公司 Decagon 和 Sierra。Blumberg 认为,模型层面的竞争仍未定局:“像 ElevenLabs 这样的公司已经转向编排层和应用层……我觉得技术上还有太多事情要做。”