Anthropic a remanié jeudi le mode vocal de Claude pour qu’il s’appuie sur toute la gamme de modèles de l’entreprise — Opus, Sonnet et Haiku — au lieu de rétrograder discrètement chaque conversation parlée vers le plus petit modèle. La note de version s’intitule « Think through hard problems in voice mode », ce qui constitue un aveu assez direct de ce que le mode vocal ne pouvait pas faire auparavant.
Ce qui était réellement cassé
Le sélecteur de modèle de Claude était purement cosmétique en mode vocal. Quel que soit le choix de l’utilisateur, les conversations parlées passaient par Haiku 4.5 — choisi à l’origine pour réduire la latence. Le mode vocal utilise désormais par défaut le dernier modèle employé dans le chat textuel, sélectionne automatiquement la version la plus rapide disponible au sein de ce modèle et peut être basculé en cours de conversation.
Des outils à la voix
La moitié la plus importante concerne les connecteurs. Le mode vocal peut désormais accéder à Gmail, Google Calendar, Slack, Canva et Notion, ce qui permet de rédiger et d’enregistrer un e-mail à la voix. Anthropic est actuellement le seul grand assistant à permettre à un utilisateur de le faire en mode vocal — le mode vocal d’OpenAI ne peut toujours pas piloter d’outils.
Offres et langues
Les comptes gratuits obtiennent Haiku uniquement ainsi qu’un seul outil connecté. Les comptes payants obtiennent tous les modèles et tous les outils. Les langues — 11 options locales couvrant dix langues, dont l’hindi, l’indonésien, le japonais, le coréen et deux variantes de l’espagnol — sont disponibles sur tous les forfaits, y compris la version gratuite, même s’il n’y a pas de détection automatique. La fonctionnalité est en bêta sur mobile, ordinateur et web ; Anthropic indique qu’elle « fonctionne mieux depuis votre téléphone ».
Encore en mode tour par tour
Il s’agit d’une mise à jour sur le plan des capacités et des outils, pas d’une amélioration de la parole. La voix de Claude reste en tour par tour — écouter, faire une pause, répondre — tandis que GPT-Live d’OpenAI est en duplex intégral, parlant et écoutant en même temps. La gestion des interruptions ne s’est pas améliorée, et Anthropic n’a publié aucun chiffre de latence. Les concurrents restent plus naturels à l’oreille.
