OpenAI lanzó ChatGPT Voice en sus aplicaciones de escritorio para macOS y Windows el jueves por la noche, desplegándolo a nivel global como una versión completa y no como una vista previa. Funciona sobre GPT-Live, el modelo de voz de dúplex completo que OpenAI lanzó en móviles el 8 de julio, y que escucha y habla al mismo tiempo en lugar de alternar turnos rígidos.
La función real
Voice se plantea como un supervisor, no como una herramienta de dictado. Puede iniciar nuevas tareas, comprobar el estado del trabajo ya en curso, hacer preguntas sobre agentes y ajustar agentes que se ejecutan en hilos paralelos, todo ello mientras el usuario hace otra cosa. Las acciones en pantalla pasan por la herramienta Computer Use existente de OpenAI, operando dentro de los permisos que ya tengan Work o Codex. Accede a archivos locales y a conectores como Slack, GitHub y Notion.
Una app, tres superficies
ChatGPT Work se lanzó el 9 de julio, cuando OpenAI integró Codex en la aplicación de escritorio de ChatGPT. Chat, Work y Codex son ahora tres superficies de un mismo programa. Work toma un resultado, lo descompone, funciona durante horas en aplicaciones conectadas y devuelve documentos, hojas de cálculo, presentaciones o aplicaciones web terminadas, en lugar de respuestas de chat. Fortune informa de que alcanzó unos 10 millones de usuarios tras su lanzamiento.
Dónde y cómo
Disponible en Plus, Pro, Business, Edu y Enterprise; no en Free, y no en la web. También puede controlarse desde la app de ChatGPT para iOS mediante la función de emparejamiento Remote; Android llegará "pronto". Un atajo global programable por el usuario lo запуска. En macOS, un ajuste opcional de contexto de pantalla activa "Appshots", lo que permite a ChatGPT referenciar la ventana en primer plano.
La lectura competitiva
La aplicación de escritorio unificada apunta a Claude Desktop, y el comportamiento de tareas en segundo plano se asemeja a Claude Cowork de Anthropic; Codex compite con Claude Code, que añadió voz push-to-talk en marzo. OpenAI no publicó nuevas medidas de seguridad específicas para la voz ni un límite para los agentes en paralelo.
