Nature Medicine опубликовал 4 сентября клинического ИИ-агента для матери и ребёнка; депозит Crossref помечен временем 17:15:13 UTC. Его будут описывать как LLM-агента, предсказывающего исходы для матери и младенца. Но аннотация ясно показывает, что прогнозы принадлежат не ему.
Откуда берутся цифры
«MoChiAgent's core predictive engine, MoChiFormer, was developed and internally evaluated using 4,401,599 longitudinal clinical visits and externally validated using independent maternal and infant cohorts consisting of 263,452 and 23,192 visits.» И далее: «MoChiFormer accurately identified key gestational conditions, achieving AUROCs of 0.89 for placental abruption, 0.89 for premature rupture of membranes, and 0.91 for preterm labour.» MoChiFormer — это супервизируемый трансформер, работающий с последовательностями лабораторных данных из EHR. Он также «reconstructs missing laboratory values, reduces batch effects» и поддерживает моделирование траекторий — всё это не языковое моделирование.
На чём измеряют слой LLM
Не на дискриминации. В исходных данных статьи указаны «individual physician evaluation scores for each case and each system (MoChiAgent, ChatGPT, Gemini and OpenEvidence) across diagnostic accuracy, evidence traceability, completeness of the diagnostic and therapeutic plan, and clinical safety». Это упражнение на предпочтения врачей, то есть корректная оценка совсем иного свойства. LLM координирует инструменты и извлекает текст рекомендаций; прогноз уже сделан к тому моменту, как он это делает.
В чём ошибочна привычная подача
«LLM agent predicts preterm labour at 0.91 AUROC» — это было бы неверно. Это делает супервизируемый трансформер; LLM лишь оформляет результат и ссылается на рекомендации. Сейчас это стандартная форма статей о клинических агентах, и это важно, потому что два компонента обобщают по-разному: трансформер, обученный на данных одной системы здравоохранения, даёт предсказуемые сбои, а оболочка LLM ошибается гладко и убедительно. Если приписать дискриминационную способность классификатора оболочке, будет скрыто, какую именно часть нужно заново валидировать на новой площадке.
Две оговорки, которые содержит сама статья
Внешняя валидация невелика по сравнению с разработкой — 263,452 и 23,192 визита против 4,4 млн, то есть примерно 6% и 0,5% — а когорта младенцев считается по визитам, а не по детям. Наблюдения по кластерам (повышенный риск неонатальной желтухи при HR 2.81, 95% CI 2.60-3.03, и гематологического заболевания при HR 2.83, 95% CI 2.62-3.05) — это ассоциации внутри когорты. И это Accelerated Article Preview, а не финальная версия записи, так что цифры ещё могут измениться.
