一项前瞻性、单中心、交叉读片研究于8月21日发表在Academic Radiology上,将四款商用胸部 X 光 AI 产品与无辅助判读进行比较。5名拥有1至6年经验的读片者在五种条件下,对1,200名连续患者1,861张放射影像进行评估,观察肺部浸润、胸腔积液、纵隔肿块、气胸和肺结节,并在各轮次之间设置14天洗脱期,病例顺序随机化。参考标准为最终临床报告,并在可获得时辅以确认性 CT。

主要终点

“AI 辅助并未提高诊断准确率。”对于胸腔积液肺结节,在若干读片者-工具组合中,准确率下降了;文中指出的机制是假阳性增加——工具提示了某个异常,读片者表示认同,但实际上并不存在该发现。

常见叙事的误区

这与放射学 AI 结果通常的呈现方式正好相反。这里所有可用于营销的数字都属于次要终点,而且都改善了:5名住院医师中有3名判读更快,每例中位减少6至17秒(p≤0.031);5人中有4人表示诊断信心更高;部分组合中的高级医生会诊减少,且一次 CT 升级评估也下降了。与此同时,主要终点——诊断表现——没有变化,而对两项发现还出现了倒退。信心提高而准确率下降,是自动化偏差的教科书式特征,作者也明确点名了这一点。如果一篇报道以“AI 缩短判读时间并提升放射科医生信心”为标题,那么每个细节都准确,但整体结论却是错的。

为什么“商用”是关键措辞

这些并不是研究原型,而是已经获得上市许可、并投入临床工作流的产品,在真实世界环境中进行了一对一测试——这是一种明显强于支撑多数采购决策的回顾性、单工具研究的证据设计。

该研究不能证明什么

这是一项单中心研究,读片者相对年轻,参考标准是最终报告而非患者结局。作者最后表示,仍需要临床试验来回答患者结局是否更好,同时部署时必须谨慎进行本地化适配,以避免自动化偏差,并保留效率收益。值得注意的是,这些效率收益确实存在——只是并不是这些工具被宣称要带来的核心价值。