Nature Medicine publicou um agente de IA clínica para mãe e filho em 4 de setembro; o depósito no Crossref está carimbado às 17:15:13 UTC. Ele será reportado como um agente LLM que prevê desfechos maternos e infantis. O resumo deixa claro que as previsões pertencem a outra coisa.
De onde vêm os números
"O motor preditivo central do MoChiAgent, MoChiFormer, foi desenvolvido e avaliado internamente usando 4.401.599 visitas clínicas longitudinais e validado externamente usando coortes materna e infantil independentes, compostas por 263.452 e 23.192 visitas." E: "MoChiFormer identificou com precisão condições gestacionais-chave, alcançando AUROCs de 0,89 para descolamento prematuro da placenta, 0,89 para ruptura prematura de membranas e 0,91 para trabalho de parto prematuro." MoChiFormer é um transformer supervisionado sobre sequências laboratoriais de prontuário eletrônico (EHR). Ele também "reconstrói valores laboratoriais ausentes, reduz efeitos de lote" e dá suporte à modelagem de trajetórias — nada disso é modelagem de linguagem.
No que a camada LLM é medida
Não em discriminação. Os dados de origem do artigo listam "pontuações individuais de avaliação médica para cada caso e cada sistema (MoChiAgent, ChatGPT, Gemini e OpenEvidence) em acurácia diagnóstica, rastreabilidade das evidências, completude do plano diagnóstico e terapêutico e segurança clínica". Isso é um exercício de preferência de médicos, que é uma medida legítima de algo muito diferente. O LLM orquestra ferramentas e recupera texto de diretrizes; a previsão já está feita quando ele faz isso.
O que a formulação difundida erra
"Agente LLM prevê trabalho de parto prematuro com AUROC de 0,91" seria falso. Um transformer supervisionado faz isso; um LLM redige o resultado e cita diretrizes. Essa é agora a forma padrão dos artigos sobre agentes clínicos, e isso importa porque os dois componentes generalizam de maneiras diferentes — um transformer treinado nas sequências laboratoriais de um sistema de saúde falha de modos reconhecíveis, enquanto os fracassos de um wrapper LLM são fluentes. Atribuir ao wrapper a discriminação do classificador oculta qual metade precisa ser revalidada em um novo local.
Dois alertas que o próprio artigo traz
A validação externa é pequena em relação ao desenvolvimento — 263.452 e 23.192 visitas contra 4,4 milhões, cerca de 6% e 0,5% — e a coorte infantil é contada em visitas, não em crianças. As descobertas de cluster (riscos elevados de icterícia neonatal em HR 2,81, IC 95% 2,60-3,03, e doença hematológica em HR 2,83, IC 95% 2,62-3,05) são associações dentro da coorte. E esta é uma Accelerated Article Preview, não a versão final de registro, então os números ainda podem mudar.
