Nature Medicine publicó un agente clínico para madre e hijo el 4 de septiembre; el depósito de Crossref está fechado a las 17:15:13 UTC. Se presentará como un agente LLM que predice resultados maternos e infantiles. El resumen deja claro que las predicciones pertenecen a otra cosa.
De dónde salen las cifras
"El motor predictivo central de MoChiAgent, MoChiFormer, se desarrolló y evaluó internamente utilizando 4.401.599 visitas clínicas longitudinales y se validó externamente con cohortes maternas e infantiles independientes que consistían en 263.452 y 23.192 visitas." Y: "MoChiFormer identificó con precisión condiciones gestacionales clave, alcanzando AUROC de 0,89 para desprendimiento prematuro de placenta, 0,89 para rotura prematura de membranas y 0,91 para parto pretérmino." MoChiFormer es un transformer supervisado sobre secuencias de laboratorio de HCE. También "reconstruye valores de laboratorio ausentes, reduce los efectos de lote" y respalda el modelado de trayectorias; nada de eso es modelado de lenguaje.
En qué se mide la capa LLM
No en discriminación. Los datos de origen del artículo enumeran "puntuaciones individuales de evaluación de médicos para cada caso y cada sistema (MoChiAgent, ChatGPT, Gemini y OpenEvidence) en precisión diagnóstica, trazabilidad de la evidencia, exhaustividad del plan diagnóstico y terapéutico, y seguridad clínica". Se trata de un ejercicio de preferencia de médicos, que es una medición legítima de una cosa muy distinta. El LLM orquesta herramientas y recupera texto de guías; la previsión ya está hecha cuando interviene.
Qué falla en el encuadre recibido
"Un agente LLM predice el parto pretérmino con 0,91 de AUROC" sería falso. Lo hace un transformer supervisado; un LLM lo redacta y cita guías. Esta es ahora la forma estándar de los artículos sobre agentes clínicos, y eso importa porque ambos componentes generalizan de manera diferente: un transformer entrenado con las secuencias de laboratorio de un sistema sanitario falla de formas reconocibles, mientras que los fallos de un envoltorio LLM son fluidos. Atribuir al envoltorio la discriminación del clasificador oculta qué mitad debe volver a validarse en un nuevo centro.
Dos advertencias que el propio artículo incluye
La validación externa es pequeña en relación con el desarrollo — 263.452 y 23.192 visitas frente a 4,4 millones, aproximadamente 6% y 0,5% — y la cohorte infantil se cuenta en visitas, no en niños. Los hallazgos por conglomerados (riesgos elevados de ictericia neonatal con HR 2,81, IC 95% 2,60-3,03, y enfermedad hematológica con HR 2,83, IC 95% 2,62-3,05) son asociaciones dentro de la cohorte. Y se trata de una Accelerated Article Preview, no de la versión final de referencia, por lo que las cifras aún pueden cambiar.
