OpenAI 正在重塑 ChatGPT 的对话方式。7 月 8 日,该公司推出 GPT-Live,这是一对语音模型——面向付费 Go、Plus 和 Pro 用户的 GPT-Live-1,以及面向 Free 版本的 GPT-Live-1 mini——它们不再轮流说和听,而是同时进行。该功能将取代 Advanced Voice Mode,成为默认选项,并将在未来几天内面向 iOS、Android 和 ChatGPT.com 全球推送。
全双工,怎么理解
这一变化的核心在于架构:GPT-Live 会在生成语音的同时持续处理它听到的内容,并且每秒多次作出是否发言、继续倾听、暂停、打断或调用工具的判断。它能给出自然的回应——“mhmm”“got it”“yeah”——也能处理插话,并可被要求放慢语速。OpenAI 为这一系统重新制作了 ChatGPT 的 九种声音,并加入三档推理等级:Instant、Medium 和 High。
分派任务的技巧
GPT-Live 针对快速、自然的对话进行了优化,因此当请求需要网页搜索、更深入推理或 agentic 工作时,它会在后台把任务交给 GPT-5.5,在计算运行期间继续聊天,随后再把结果整合回来。它还会为天气、股票和体育等内容显示可视化卡片。发布初期不支持的功能包括:语音加视频、屏幕共享、桌面端或 Codex,Business、Enterprise 和 Edu 版本则要等到后续阶段。
为新形态准备的安全措施
OpenAI 发布了专门的 GPT-Live System Card。系统会在对话进行过程中检查输入和输出;当出现风险内容时,系统可以引导或中断回复,播放语音安全提示,提供基于文本的支持资源,或在更高风险情况下结束通话。红队测试覆盖了冒充、说话者识别、儿童化声音、自伤、情感依赖和诈骗等场景。OpenAI 表示,这些模型“并不是作为 AI 伴侣来定位的”。
市场反馈
已有超过 1.5 亿人使用 ChatGPT 的语音功能,而 OpenAI 自己的评估显示,在匹配对话中,GPT-Live 相比 Advanced Voice Mode “更受偏好”,偏好率约为 75%。ChatGPT Voice 负责人 Atty Eleti 表示:“语音可以成为各类工作的未来界面。”不过,并非所有人都买账:一些早期用户抱怨,持续不断的“mhmm”式填充回应显得冗长而刺耳。API 版本标注为“即将推出”,目前尚未公布定价。
