Nature Medicine은 9월 4일 모자 임상 AI 에이전트를 발표했으며, Crossref 등록 시각은 17:15:13 UTC로 찍혀 있습니다. 이 논문은 이를 산모와 영아의 결과를 예측하는 LLM 에이전트로 소개할 것입니다. 하지만 초록은 그 예측의 주체가 다른 무엇임을 분명히 보여줍니다.
수치의 출처
"MoChiAgent's core predictive engine, MoChiFormer, was developed and internally evaluated using 4,401,599 longitudinal clinical visits and externally validated using independent maternal and infant cohorts consisting of 263,452 and 23,192 visits." 그리고 "MoChiFormer accurately identified key gestational conditions, achieving AUROCs of 0.89 for placental abruption, 0.89 for premature rupture of membranes, and 0.91 for preterm labour." MoChiFormer는 EHR 검사 수열에 대한 지도학습 트랜스포머입니다. 또한 "결측 검사값을 복원하고, 배치 효과를 줄이며" 궤적 모델링을 지원합니다. 이들 중 어느 것도 언어 모델링이 아닙니다.
LLM 계층의 평가 대상
판별력이 아닙니다. 논문의 원자료는 "diagnostic accuracy, evidence traceability, completeness of the diagnostic and therapeutic plan, and clinical safety" 전반에 걸쳐 각 사례와 각 시스템(MoChiAgent, ChatGPT, Gemini and OpenEvidence)에 대한 "individual physician evaluation scores"를 제시합니다. 이는 의사의 선호를 측정하는 작업으로, 전혀 다른 것을 재는 정당한 지표입니다. LLM은 도구를 조정하고 지침 문구를 검색할 뿐이며, 예측은 그 전에 이미 만들어져 있습니다.
통용되는 프레이밍의 오류
"LLM agent predicts preterm labour at 0.91 AUROC"는 사실과 다릅니다. 실제로는 지도학습 트랜스포머가 그렇게 했고, LLM은 이를 정리하고 지침을 인용합니다. 이는 현재 임상 에이전트 논문의 표준적인 형태이며, 두 구성요소가 일반화하는 방식이 서로 다르기 때문에 중요합니다. 한 의료 시스템의 검사 수열로 학습한 트랜스포머는 알아볼 수 있는 방식으로 실패하지만, LLM 래퍼의 실패는 유창하게 보입니다. 분류기의 판별력을 래퍼에 돌리는 것은 새 현장에서 어느 절반을 다시 검증해야 하는지 가립니다.
논문 자체가 담고 있는 두 가지 단서
외부 검증 규모는 개발 규모에 비해 작습니다. 즉, 4.4 million건에 대해 263,452건과 23,192건으로, 대략 6%와 0.5%입니다. 또 영아 코호트는 영아 수가 아니라 방문 수로 집계됩니다. 군집 결과(신생아 황달 위험 증가 HR 2.81, 95% CI 2.60-3.03, 혈액질환 HR 2.83, 95% CI 2.62-3.05)는 코호트 내 연관성입니다. 그리고 이는 최종 확정본이 아닌 Accelerated Article Preview이므로 수치는 아직 바뀔 수 있습니다.
