Nature Medicine publicó dos documentos la mañana del 3 de septiembre, registrados con segundos de diferencia: un Matters Arising revisado por pares que cuestiona el artículo de junio de 2026 que afirmaba que los LLMs de frontera de propósito general superan a las herramientas especializadas de IA clínica, y la Reply de los autores originales. La revista los difundió como un par deliberado.
Lo que sostiene la crítica
Que los benchmarks que producen los mayores efectos del estudio están afectados por factores que los propios autores reconocen, y que la evaluación restante tiene un alcance limitado, exagera su precisión y se apoya en configuraciones de inferencia que no están descritas ni controladas adecuadamente. La crítica incluye una figura que muestra contenido recuperable del benchmark MedQA a partir de un modelo de frontera: memorización del conjunto de prueba, demostrada y no solo afirmada.
Lo que admiten los autores
La Reply acepta que la posible contaminación de MedQA y la afinidad del evaluador de HealthBench pueden limitar la generalización —entendiendo por afinidad del evaluador la tendencia de un juez LLM a preferir la salida de su propia familia de modelos— y señala que el artículo trata esos dos benchmarks como suplementarios. Los autores mantienen la conclusión principal bajo las condiciones de su estudio y de despliegue. Esa conclusión principal se apoya en el benchmark de consulta clínica real: 100 consultas de médicos desidentificadas, revisadas a ciegas por 12 clínicos de EE. UU.
Qué falla en el marco de referencia habitual
El resultado de junio circuló como "ChatGPT supera a las herramientas de referencia de los médicos", una clasificación general de capacidades. Nunca fue eso y, tras el 3 de septiembre, lo es todavía menos: dos de los tres pilares se admiten como contaminados o autoafirmativos, y el pilar que sobrevive es de 100 consultas en una sola institución. La segunda corrección importa para cómo se informa de esto: un Matters Arising no es una corrección, ni una retractación, ni una expresión de preocupación. El artículo original se mantiene. Lo que cambió es el alcance que ahora reclaman sus propios autores, por escrito.
Por qué importa
Este es el artículo que se está citando en los argumentos de compra hospitalaria contra pagar suscripciones especializadas de IA clínica. El intercambio expone, en la revista de referencia, cuánto peso puede sostener ese argumento —y sitúa la contaminación de benchmarks y la fuga de preferencia del LLM como juez en el centro de las decisiones de compra médica, en lugar de dejarlas como meras cuestiones de metodología de aprendizaje automático.
