OpenAI a publié lundi avec AWS un billet conjoint sur le rapport prix-performance autour de GPT-5.6 exécuté dans Kiro, l’IDE de codage piloté par spécifications d’Amazon, en mettant en avant une réduction d’environ 82 % du coût des tâches achevées sur Terminal-Bench 2.1. La couverture spécialisée l’a interprété comme un lancement — « disponible dans Kiro à partir du 24 août 2026 ». Le propre journal des modifications de modèles de Kiro date l’arrivée de GPT-5.6 au 14 juillet 2026, et ne comporte aucune entrée pour les 24 ou 25 août.

Ce que le cadrage habituel ignore

Trois erreurs, empilées. D’abord, ce n’est pas un lancement. GPT-5.6 est dans Kiro depuis six semaines ; l’objet publié lundi est un contenu de co-marketing. Ensuite, le 82 % correspond à un écart de coût mesuré par le fournisseur sur un benchmark, pas à une facture client et pas à un résultat de précision. Aucun chiffre de précision n’est fourni pour la configuration Kiro, et rien ne distingue ce que le modèle a permis d’économiser de ce que l’infrastructure de test a économisé. Troisièmement — et c’est le point qui devrait faire hésiter les acheteurs — le levier tarifaire a été actionné trois semaines plus tôt. Le 31 juillet, Kiro a abaissé le multiplicateur de crédits de Luna de 0,6x à 0,1x et celui de Terra de 1,2x à 1,0x. Un lecteur tombant sur « 82 % moins cher » sans mention de ce changement pourrait facilement attribuer au modèle une décision de facturation.

Les dates, d’après les archives propres aux deux fournisseurs

L’entrée du 14 juillet de Kiro annonçait GPT-5.6 Sol, Terra et Luna avec une fenêtre de contexte de 272K et des multiplicateurs de 2,4x, 1,2x et 0,6x, dans le cadre d’un « support expérimental ... en cours de déploiement pour les clients Pro, Pro+, Pro Max et Power » dans deux régions — us-east-1 et eu-central-1. Les scores Terminal-Bench 2.1 publiés à l’époque : Sol 88,8 %, Terra 87,4 %, Luna 84,7 %. Le statut est toujours expérimental, toujours sur des offres payantes nommées, toujours dans deux régions. Rien de tout cela n’a changé lundi.

Pourquoi ce schéma va se répéter

Les éditeurs de modèles publient désormais des affirmations de coût par tâche achevée dans l’infrastructure de test d’un partenaire, où le modèle, l’architecture d’appui et le multiplicateur de crédits évoluent indépendamment, sans qu’aucun ne soit maintenu constant. Pour un acheteur qui compare des outils de codage sur la base de « 82 % moins cher », il est impossible d’attribuer l’économie à l’un de ces trois éléments. Le problème d’attribution n’est pas un effet secondaire de ce type d’annonce ; c’est ce qui rend l’annonce possible.

Ce qu’il faudrait pour vérifier le chiffre

Un chiffre de précision en parallèle du coût, une version figée de l’infrastructure de test, et une précision sur les multiplicateurs de crédits en vigueur pendant l’exécution. Aucun des trois n’est présent.