Большинство компаний, работающих над voice AI, обучаются на любом аудио, которое удается собрать из сети. Rime построила студию звукозаписи. 15 июля стартап из Сан-Франциско объявил о $24 million Series A, который возглавила M13 Ventures; к раунду присоединились Twilio Ventures, Corazon Capital, Unusual Ventures и другие действующие инвесторы. Партнер M13 Morgan Blumberg получил место в совете директоров.

Основатели

Rime была основана в 2022 году CEO Lily Clifford, которая оставила докторантуру Stanford по лингвистике, чтобы запустить компанию; Brooke Larson, бывшим инженером Amazon Alexa; и инженером Stanford Ares Geovanos. В компании работают 35 сотрудников, и она набирает людей в направлениях разработки моделей, инженерии и партнерств. Недавно к команде присоединился Rafael Valle в качестве chief scientist; ранее он занимался пониманием аудио в Meta Superintelligence Labs и работал в команде Nvidia по applied deep learning audio research.

Ставка на данные

Ключевое отличие — происхождение данных. Rime построила в Сан-Франциско собственную студию звукозаписи, чтобы собирать разговорные данные, а не полагаться на выскребленное из сети аудио — решение, которое выглядит все более дальновидным по мере того, как конкуренты, опирающиеся на scraping, сталкиваются с проверками на соблюдение авторских прав. Вдобавок компания использует phoneme-based architecture, рассчитанную на правильное произношение названий брендов и отраслевых терминов, чтобы клиентам не приходилось переобучать модель под каждую вертикаль.

Что сегодня не работает

Диагноз Clifford для основателя, привлекающего деньги в этой категории, звучит необычно прямо. «Технология voice по-прежнему не готова автоматизировать подавляющее большинство корпоративных телефонных звонков», — сказала она TechCrunch. «LLM сильно упростили создание voice-приложений, которые работают, но не изменили того, как это ощущается. Разговор с voice AI-агентом — не самый убедительный опыт для конечного пользователя. Это что-то вроде нового IVR, но с более приятным голосом.» Ее решение — архитектурное: уход от состыкованного конвейера speech-to-text, LLM и text-to-speech в сторону моделей speech-to-speech, которые снижают задержку, улучшают очередность реплик, справляются с фоновым шумом и уменьшают накладные расходы на оркестрацию.

Спрос и рынок

Среди клиентов — Mayo Clinic, Dialpad, Upstart и Asurion в сегментах общественного питания, здравоохранения, авиаперевозок и fintech, а TechCrunch сообщает, что Rime обрабатывает более 100 million calls each month. Компания конкурирует с разработчиками моделей ElevenLabs и Deepgram, инфраструктурными игроками Vapi, Retell и LiveKit, а также с компаниями в сфере поддержки клиентов Decagon и Sierra. По мнению Blumberg, уровень модели по-прежнему остается полем борьбы: «Компании вроде ElevenLabs перешли в оркестрацию и прикладной слой... Думаю, здесь еще очень многое нужно сделать с технической точки зрения».