xAI a lancé Grok 4.6 le 12 août, le présentant comme une amélioration de post-entraînement de Grok 4.5 plutôt que comme un nouveau modèle de base. Les deux reposent sur la même fondation "V9" de 1,5 billion de paramètres.
Ce qui a vraiment changé
Le travail repose sur du fine-tuning supervisé et de l’apprentissage par renforcement dans des environnements agentiques — une utilisation prolongée d’outils, et non une simple montée en échelle brute. xAI indique un score de 61 sur l’Artificial Analysis Intelligence Index, contre 56 pour Grok 4.5, à égalité avec GPT-5.6 Sol sur cet indice. Le contexte reste à 500K tokens, les entrées prennent en charge le texte et les images, et la date limite des connaissances est fixée au 1er février 2026. Un nouveau niveau d’effort de raisonnement xhigh est exposé aux utilisateurs de l’API.
Là où il ne prend pas l’avantage
En codage, le tableau est moins flatteur. Grok 4.6 affiche 69,9% sur CursorBench v3.2, 65,9% sur DeepSWE v1.1, 61,3% sur FrontierCode v1.1 et 26% sur Terminal-Bench v3.0. Le score DeepSWE reste nettement inférieur aux quelque 73% de GPT-5.6 — une égalité sur un indice composite ne constitue pas une avance en ingénierie logicielle.
Tarifs et disponibilité
En dessous d’une requête de 200K tokens, le modèle coûte 2 $ par million de tokens d’entrée, 0,50 $ pour le cache et 6 $ en sortie ; au-dessus, 4 $ / 1 $ / 12 $. La variante "fast" double ces tarifs. Elle est la version par défaut dans Grok Build, disponible pour toutes les offres Cursor, et a été déployée avec une utilisation incluse doublée pendant la première semaine. Il n’existe pas de poids ouverts.
Un chiffre à écarter
Une valeur "1753 ELO" a circulé dans la couverture médiatique pour Grok 4.6. Il s’agit du score GDPVal-AA v2 du modèle, et non d’un ELO Arena ; les deux ne sont pas comparables. Une mise à disposition annoncée à partir du 7 août n’est pas non plus étayée par les propres documents de xAI.
La logique à l’œuvre
Un gain de cinq points sur un indice, sans nouvelle passe de préentraînement, résume la forme actuelle de la compétition au front de pointe : la partie la plus coûteuse est terminée, et les gains viennent désormais de l’après-coup. Cela montre aussi que les numéros de version sont un mauvais indicateur de l’écart de calcul entre deux modèles.
