Nature Medicine a publié deux documents le matin du 3 septembre, enregistrés à quelques secondes d’intervalle : un Matters Arising évalué par les pairs qui conteste l’article de juin 2026 affirmant que les LLM de pointe à usage général surpassent les outils d’IA clinique spécialisés, et la Reply des auteurs initiaux. La revue les a diffusés comme un duo délibéré.
Ce qu’avance la critique
Les benchmarks à l’origine des effets les plus marqués de l’étude sont entachés de biais de confusion que les auteurs eux-mêmes reconnaissent, et l’évaluation restante est limitée dans son champ, surestime sa précision et repose sur des paramètres d’inférence insuffisamment décrits ou contrôlés. La critique comprend une figure montrant du contenu récupérable du benchmark MedQA à partir d’un modèle de pointe — une mémorisation du jeu de test démontrée, et non simplement alléguée.
Ce que concèdent les auteurs
La Reply admet que une possible contamination de MedQA et l’affinité de l’évaluateur HealthBench peuvent limiter la généralisabilité — l’affinité de l’évaluateur désignant la tendance d’un juge LLM à préférer les sorties de sa propre famille de modèles — et précise que l’article traite ces deux benchmarks comme supplémentaires. Les auteurs maintiennent la conclusion principale au regard de leur étude et de leurs conditions de déploiement. Cette conclusion principale repose sur le benchmark de question clinique réelle : 100 requêtes de médecins désidentifiées, examinées à l’aveugle par 12 cliniciens américains.
Ce que le cadrage dominant occulte
Le résultat de juin a circulé sous la forme « ChatGPT bat les outils de référence des médecins » — un classement général des capacités. Il n’a jamais dit cela, et après le 3 septembre il est encore plus étroit : deux des trois piliers sont reconnus comme contaminés ou favorables au système, et le pilier restant se limite à 100 requêtes dans un seul établissement. La deuxième correction compte pour la manière dont l’information est relayée : un Matters Arising n’est ni une correction, ni une rétractation, ni une expression de préoccupation. L’article original demeure. Ce qui a changé, c’est la portée que ses propres auteurs revendiquent désormais pour lui, noir sur blanc.
Pourquoi cela tombe ici
C’est l’article cité dans les arguments d’achats hospitaliers contre le paiement d’abonnements spécialisés à l’IA clinique. Cet échange expose, dans la revue de référence, le poids que peut avoir un tel argument — et place la contamination des benchmarks et la fuite de préférence des LLM en tant que juges au cœur des décisions d’achat médicales, au lieu de les laisser au rang de simples questions de méthodologie en apprentissage automatique.
