DeepSeek a fait passer V4-Flash de la préversion à une API en version officielle vendredi matin, heure de Pékin. L’élément intéressant n’est pas la sortie elle-même : c’est que le tableau de benchmarks de l’entreprise place son modèle bon marché au-dessus de son modèle plus cher, lequel n’a toujours pas été publié.
Les scores et les prix
D’après le changelog de DeepSeek : Terminal Bench 2.1 82.7, Cybergym 76.7, Toolathlon verified 70.3, DSBench-FullStack 68.7, DeepSWE 54.4, NL2Repo 54.2. Fenêtre de contexte 1M, sortie maximale 384K, mode de réflexion activable. Tarification par million de tokens : Flash $0.14 in / $0.28 out contre Pro à $0.435 / $0.87. Les plafonds de concurrence sont de 2,500 pour Flash et 500 pour Pro. Une majoration aux heures de pointe, doublant les tarifs pendant les heures ouvrées à Pékin, est annoncée comme à venir.
Trois points que la couverture présente mal
Premièrement, « version officielle » ne désigne pas un nouveau modèle. Le changelog de DeepSeek indique que V4-Flash-0731 « conserve la même architecture et la même taille de modèle » que la préversion et qu’il « a seulement été ré-entraîné en post-traitement ». L’architecture et le nombre de paramètres restent inchangés : il s’agit d’une remise à jour post-entraînement présentée comme un lancement. Deuxièmement, il s’agit d’un produit réservé à l’API. Aucun poids n’a été publié, et seule l’interface V4-Flash a été mise à niveau ; l’application, les modèles web et l’API V4-Pro n’ont pas été modifiés. Toute lecture de cette annonce comme une sortie en open weights est erronée. Troisièmement, le tableau de benchmarks est celui de DeepSeek, et le périmètre de comparaison est avantageux par construction : les scores sont mesurés face à son propre V4-Pro-Preview — une préversion, pas un produit distribué — ainsi qu’à GLM-5.2 de Zhipu. Aucun modèle de pointe occidental n’y figure.
Pourquoi l’inversion de l’échelle compte
Qu’une offre bon marché dépasse l’offre premium sur des tâches d’agent, à environ un tiers du prix, envoie un signal clair : les gains actuels sur le travail agentique proviennent du post-entraînement plutôt que de la seule montée en échelle. Cela place aussi V4-Pro dans une situation délicate : toujours en préversion, et désormais battu par son petit frère selon les propres chiffres de son éditeur.
Un chiffre à ne pas publier
Des médias chinois évoquent 284 milliards de paramètres au total et 13 milliards de paramètres actifs. Ce chiffre n’apparaît sur aucune page DeepSeek que nous avons pu vérifier et ne doit pas être repris comme un fait.
