发表于8月19日、刊登于PLOS Digital Health的一项系统性分析,审查了截至2025年12月5日获FDA清除或批准的所有AI/ML医疗设备——共1,357个——并追问其中有多少曾就患者是否真的受益接受过测试。
数字
34个设备(2.5%)与一项已注册的前瞻性试验相关。12个(0.9%)公布了结果。12个(0.9%)有同行评议论文。还有3个(0.2%)按以患者为中心的结局进行了评估——即死亡率、发病率或再入院。在已注册试验中,62%属于观察性研究,而非随机试验。设备分布高度集中:1,059个放射学设备(78%),122个心血管设备(9%),68个神经学设备(5%)。
常见叙事错在哪里
相关报道把这项研究写成“AI医疗设备未经证实”或“未经测试”。这并不是论文衡量的内容。1,357个设备中几乎全部都通过了510(k)实质等同性清除程序,而法律并不要求该程序必须进行结局试验——它要求的是该设备与现有对照产品等同。“1,357个中只有3个”并不是说FDA违反了自己的规则;它只是说明规则要求什么。
这些设备也并非没有测试。它们接受过测试——包括诊断准确率、AUC、读者一致性,以及与参考标准对照的独立性能。缺失的是从更好的判读到更好的患者结局之间的下游关联。而且,由于78%的样本来自放射学领域,这条标题主要说的是影像分诊软件,而不是AI做出治疗决策。
研究中缺席了谁
纳入的大多数研究排除了孕妇、75岁以上成年人和非英语使用者,且都在资源充足的医疗系统中开展。作者来自多伦多、MIT Critical Data、Harvard Chan、约翰斯·霍普金斯大学、Mbarara University of Science and Technology和卑尔根,并声明不存在利益冲突。
解读获批新闻的一个准则
一个可供读者实际使用的判断标准是:当公司宣布获得FDA清除时,查看新闻稿是否包含一个结局数字。99.8%的情况下,没有人给出这样的数字——这意味着它的缺席是常态,而非丑闻;而一旦出现,才真正值得注意。
