Nature Medicine a publié le 4 septembre un agent d’IA clinique mère-enfant ; le dépôt Crossref est horodaté à 17:15:13 UTC. Il sera présenté comme un agent LLM qui prédit les issues maternelles et infantiles. Le résumé précise pourtant que les prédictions relèvent d’autre chose.
D’où viennent les chiffres
"MoChiAgent's core predictive engine, MoChiFormer, was developed and internally evaluated using 4,401,599 longitudinal clinical visits and externally validated using independent maternal and infant cohorts consisting of 263,452 and 23,192 visits." Et : "MoChiFormer accurately identified key gestational conditions, achieving AUROCs of 0.89 for placental abruption, 0.89 for premature rupture of membranes, and 0.91 for preterm labour." MoChiFormer est un transformeur supervisé appliqué à des séquences de laboratoire issues de dossiers médicaux électroniques. Il "reconstructs missing laboratory values, reduces batch effects" et prend en charge la modélisation des trajectoires — rien de tout cela ne relève de la modélisation du langage.
Ce sur quoi la couche LLM est évaluée
Pas sur la discrimination. Les données sources de l’article indiquent des "individual physician evaluation scores for each case and each system (MoChiAgent, ChatGPT, Gemini and OpenEvidence) across diagnostic accuracy, evidence traceability, completeness of the diagnostic and therapeutic plan, and clinical safety". Il s’agit d’un exercice de préférence des médecins, qui mesure légitimement tout autre chose. Le LLM orchestre des outils et récupère du texte de recommandations ; la prévision est déjà faite lorsqu’il intervient.
Ce que le cadrage retenu ne dit pas correctement
"LLM agent predicts preterm labour at 0.91 AUROC" serait faux. C’est un transformeur supervisé qui le fait ; un LLM rédige le compte rendu et cite les recommandations. C’est désormais la forme standard des articles sur les agents cliniques, et cela compte parce que les deux composants généralisent différemment — un transformeur entraîné sur les séquences biologiques d’un système de santé échoue de manière reconnaissable, tandis qu’un habillage LLM échoue avec fluidité. Attribuer au wrapper la capacité de discrimination du classifieur masque quelle moitié doit être révalidée dans un nouveau site.
Deux réserves que l’article lui-même porte
La validation externe est modeste au regard du développement — 263,452 et 23,192 visites contre 4,4 millions, soit environ 6 % et 0,5 % — et la cohorte infantile est comptée en visites, non en nourrissons. Les résultats de cluster (risques accrus d’ictère néonatal avec HR 2.81, IC à 95 % 2.60-3.03, et de maladie hématologique avec HR 2.83, IC à 95 % 2.62-3.05) sont des associations au sein de la cohorte. Et il s’agit d’un Accelerated Article Preview, pas de la version finale faisant foi, donc les chiffres peuvent encore évoluer.
