Nature Medicine 在 9 月 3 日上午发布了两份几乎相隔数秒登记的文件:一篇经同行评议的 Matters Arising,质疑 2026 年 6 月那篇声称通用前沿 LLM 优于专门临床 AI 工具的论文;以及原作者的 Reply。该期刊将二者作为一组同时发布。

质疑意见的核心论点

这项研究产生最大效果的那些基准,存在作者本人也承认的混杂因素;而其余评估的范围有限、夸大了精确性,并且依赖的推理设置没有得到充分说明或控制。该质疑还附带一张图,显示前沿模型可还原的 MedQA 基准内容——这是对测试集记忆的直接展示,而非仅仅推断。

作者承认了什么

Reply 同意,MedQA 可能存在污染,以及 HealthBench 评估者亲和性,可能限制结论的普适性——其中评估者亲和性是指 LLM 评判者倾向于偏好同一模型家族输出的现象——并表示论文将这两项基准视为补充性材料。作者仍维持其研究和部署条件下的主要结论。该主要结论建立在真实临床问题基准之上:100 条去标识化医生查询,由12 名美国临床医生盲审。

常见表述哪里出了错

6 月的结果被广泛传播为“ChatGPT 击败了医生的参考工具”——一种通用能力排名。事实从来不是如此;而在 9 月 3 日之后,它的范围更窄:三条支柱中的两条被承认为存在污染或自我偏好,剩下的一条只是某一机构的 100 个查询。第二点修正影响其报道方式:Matters Arising 不是更正、撤稿,也不是关注声明。原论文仍然有效。真正改变的是作者如今在正文中为其主张划定的范围。

为什么这件事重要

这篇论文正被用于医院采购争论中,作为反对支付专门临床 AI 订阅费用的论据。此次交锋在期刊正式记录中说明了,这类论据究竟能有多大分量——同时也把基准污染LLM 作为评判者时的偏好泄漏置于医疗采购决策的核心,而不再只是机器学习方法学问题。