OpenAI перестраивает то, как ChatGPT говорит. 8 июля компания представила GPT-Live — пару голосовых моделей: GPT-Live-1 для платных пользователей Go, Plus и Pro и GPT-Live-1 mini для бесплатного тарифа, — которые слушают и говорят одновременно, а не по очереди. Он заменяет Advanced Voice Mode по умолчанию и в ближайшие несколько дней начнет глобально раскатываться на iOS, Android и ChatGPT.com.
Что такое full duplex
Ключевое изменение — архитектурное: GPT-Live непрерывно обрабатывает то, что слышит, пока генерирует речь, принимая решения «много раз в секунду» о том, говорить ли, продолжать слушать, сделать паузу, перебить собеседника или вызвать инструмент. Он выдает естественные подтверждения — «mhmm», «понял», «да» — умеет справляться с перебиваниями и может реагировать на просьбу говорить медленнее. OpenAI ремастировала для системы девять голосов ChatGPT и добавила три уровня рассуждения: Instant, Medium и High.
Хитрость делегирования
GPT-Live настроен на быстрый, естественный разговор, поэтому, когда запрос требует веб-поиска, более глубокого рассуждения или агентной работы, он передает задачу GPT-5.5 в фоновом режиме и продолжает беседу, пока идет вычисление, а затем встраивает результат обратно. Он также показывает визуальные карточки с такими данными, как погода, котировки и спорт. Чего на запуске нет: голос+видео, демонстрации экрана, desktop или Codex, а тарифы Business, Enterprise и Edu появятся позже.
Безопасность для новой модальности
OpenAI опубликовала отдельную GPT-Live System Card. Входящие и исходящие данные проверяются по мере развития разговора; если возникает что-то рискованное, система может направить ответ в безопасное русло или прервать его, воспроизвести голосовое сообщение о безопасности, предложить текстовые ресурсы поддержки или завершить вызов в случаях повышенного риска. Red-teaming охватывал имитацию личности, идентификацию говорящего, голос, похожий на детский, самоповреждение, эмоциональную зависимость и мошенничество. OpenAI говорит, что модели «не позиционируются как ИИ-компаньон».
Реакция
Голосовыми функциями ChatGPT уже пользуются более 150 миллионов человек, а собственные оценки OpenAI показывают, что GPT-Live «значительно предпочтительнее» Advanced Voice Mode в сопоставимых разговорах — примерно с уровнем предпочтения 75%. «Голос может стать интерфейсом будущего для самых разных видов работы», — сказал руководитель ChatGPT Voice Atty Eleti. Но не все в восторге: некоторые первые пользователи жаловались, что постоянные вставки «mhmm» слишком многословны и раздражают. Версия для API значится как «скоро», цена пока не объявлена.
