OpenAI 于周四晚间将 ChatGPT Voice 推出到其 macOS 和 Windows 桌面应用中,并以正式版而非预览版的形式全球上线。它运行在 GPT-Live 上,这是一款 OpenAI 于 7 月 8 日 在移动端发布的全双工语音模型,可同时监听和发言,而不是机械地轮流进行。
实际功能
Voice 的定位是监督者,而不是听写工具。它可以启动新任务、查看已在运行的工作状态、询问代理相关问题,并调整并行线程中执行的代理——而用户则可以同时做别的事情。屏幕上的操作通过 OpenAI 现有的 Computer Use 工具完成,并在 Work 或 Codex 已拥有的权限范围内运行。它还能访问本地文件以及包括 Slack、GitHub 和 Notion 在内的连接器。
一个应用,三个界面
ChatGPT Work 于 7 月 9 日上线,当时 OpenAI 将 Codex 整合进 ChatGPT 桌面应用。如今,Chat、Work 和 Codex 是同一程序的三个界面。Work 接收一个结果目标,将其拆解,在已连接的应用中运行数小时,最后返回完成的文档、电子表格、演示文稿或网页应用,而不是聊天回复。Fortune 报道称,它上线后用户数已达到约 1000 万。
适用范围与使用方式
该功能适用于 Plus、Pro、Business、Edu 和 Enterprise,不适用于 Free,也不支持网页端。用户还可以通过 ChatGPT iOS 应用的 Remote 配对功能来驱动它;Android 版本“即将推出”。用户可自定义的全局快捷键可将其唤起。在 macOS 上,启用可选的 Screen context 设置后,系统会开启 “Appshots”,让 ChatGPT 参考最前方窗口的内容。
竞争视角
整合后的桌面应用瞄准的是 Claude Desktop,而其后台任务行为也与 Anthropic 的 Claude Cowork 相似;Codex 则在与 Claude Code 竞争,后者已于 3 月加入按住说话语音功能。OpenAI 没有公布任何针对语音功能的新安全措施,也没有设置并行代理数量上限。
