OpenAI est en train de repenser la manière dont ChatGPT parle. Le 8 juillet, l’entreprise a présenté GPT-Live, une paire de modèles vocaux — GPT-Live-1 pour les utilisateurs payants Go, Plus et Pro, et GPT-Live-1 mini pour l’offre Free — qui écoutent et parlent en même temps au lieu de se relayer. Il remplace le mode vocal avancé comme option par défaut et est déployé à l’échelle mondiale sur iOS, Android et ChatGPT.com « au cours des prochains jours ».

Le full-duplex, expliqué

Le changement central est architectural : GPT-Live traite en continu ce qu’il entend tout en générant la parole, prenant des décisions « de nombreuses fois par seconde » quant à parler, continuer d’écouter, marquer une pause, interrompre ou appeler un outil. Il propose des acquiescements naturels — « mhmm », « compris », « oui » — gère les interruptions et peut être invité à parler plus lentement. OpenAI a remasterisé les neuf voix de ChatGPT pour ce système et ajouté trois niveaux de raisonnement : Instant, Medium et High.

L’astuce de la délégation

GPT-Live est optimisé pour une conversation rapide et naturelle ; ainsi, lorsqu’une demande exige une recherche web, un raisonnement plus poussé ou un travail agentique, il confie la tâche à GPT-5.5 en arrière-plan et continue de converser pendant que le calcul s’exécute, puis réintègre le résultat. Il affiche aussi des cartes visuelles pour des éléments comme la météo, les actions et le sport. Ce qu’il ne fait pas au lancement : la voix avec vidéo, le partage d’écran, le desktop ou Codex, et les offres Business, Enterprise et Edu devront attendre une phase ultérieure.

La sécurité pour une nouvelle modalité

OpenAI a publié une GPT-Live System Card dédiée. Les entrées et les sorties sont vérifiées au fil de la conversation ; lorsqu’un contenu risqué apparaît, le système peut orienter ou interrompre une réponse, diffuser un message de sécurité vocal, proposer des ressources d’assistance textuelles ou mettre fin à l’appel dans les cas à plus haut risque. Des tests de red teaming ont couvert l’usurpation d’identité, l’identification de l’interlocuteur, les voix à tonalité enfantine, l’automutilation, la dépendance émotionnelle et les escroqueries. OpenAI affirme que les modèles « ne sont pas conçus comme un compagnon IA ».

Accueil

Plus de 150 millions de personnes utilisent déjà les fonctionnalités vocales de ChatGPT, et les propres évaluations d’OpenAI montrent que GPT-Live est « nettement préféré » au mode vocal avancé lors de conversations appariées, avec un taux de préférence d’environ 75 %. « La voix peut être la future interface de toutes sortes de travail », a déclaré Atty Eleti, responsable de la voix de ChatGPT. Tout le monde n’est pas convaincu : certains premiers utilisateurs ont reproché aux marqueurs d’écoute « mhmm » d’être trop verbeux et agaçants. Une version API est annoncée comme « bientôt disponible », sans prix pour l’instant.