Nature Medicine 于 9 月 4 日发表了一款母婴临床 AI agent;Crossref 存档时间戳为 17:15:13 UTC。它将被报道为一个可预测孕产妇和婴儿结局的 LLM agent。但摘要明确表明,这些预测其实来自别的东西。
数字从何而来
“MoChiAgent 的核心预测引擎 MoChiFormer,使用 4,401,599 次纵向临床就诊记录进行开发和内部评估,并使用由 263,452 和 23,192 次就诊组成的独立孕产妇和婴儿队列进行外部验证。” 以及:“MoChiFormer 准确识别了关键妊娠状况,对胎盘早剥、胎膜早破和早产分别实现了 0.89、0.89 和 0.91 的 AUROC。” MoChiFormer 是一个基于 EHR 实验室序列的监督式 Transformer。它还“重建缺失的实验室数值,减少批次效应”,并支持轨迹建模——这些都不是语言建模。
LLM 层的衡量方式
不是区分能力。论文的源数据列出了“每个病例和每个系统(MoChiAgent、ChatGPT、Gemini 和 OpenEvidence)的个人医生评估分数,覆盖诊断准确性、证据可追溯性、诊断与治疗方案的完整性以及临床安全性”。这是一项医生偏好测评,确实是在衡量另一种完全不同的东西。LLM 负责编排工具并检索指南文本;在它开始这样做时,预测早已完成。
现有表述错在何处
“LLM agent 以 0.91 AUROC 预测早产”是错误的。完成这一工作的,是一个监督式 Transformer;LLM 只是把结果写出来并引用指南。这已成为临床 agent 论文的标准形态,而这很重要,因为这两个组件的泛化方式不同——在某一医疗系统实验室序列上训练的 Transformer,会以可辨识的方式失效,而 LLM 外壳的失效则是流畅的。把分类器的区分能力归功于外壳,会掩盖在新机构中需要重新验证的是哪一半。
论文自身也给出的两个注意事项
外部验证样本相较开发规模较小——263,452 和 23,192 次就诊对比 440 万次,约为 6% 和 0.5%——而婴儿队列按就诊次数而不是婴儿人数统计。队列分析结果(新生儿黄疸风险升高,HR 2.81,95% CI 2.60-3.03;血液系统疾病风险升高,HR 2.83,95% CI 2.62-3.05)是该队列内的关联。并且这还是一篇 Accelerated Article Preview,不是最终定稿,因此这些数字仍可能变化。
