AI 模型在阅读医学影像方面正变得越来越出色——但在判断自己何时出错方面,却也危险地糟糕。7 月 19 日公布的一项新基准 RadLE 2.0,全称“Radiology's Last Exam”,发现前沿模型往往会自信地误诊 X 光片,而不是选择交由人类判断;在医学场景中,这种失败模式比单纯的准确率更重要。
测试如何进行
RadLE 2.0 由印度 Ashoka University 的 CRASH Lab 开发,评估了 16 个前沿模型——包括 Claude Fable 5、Google 的 Gemini 3 Pro、Meta 的 Muse Spark 1.1 和 Grok 4.5——在 200 个 X 光病例上的表现。关键在于,它采用一种 置信度加权 评分体系,奖励诚实的不确定性,并惩罚自信但错误的答案,而不是简单统计答对了多少题。
与人类的差距
按这一评分标准,人类放射科医生得分为 988.7 分(满分 2,000 分),明显领先于最佳 AI 模型的 758 分。值得注意的是,仅看原始准确率时,Gemini 3 Pro 几乎与人类持平——这说明模型的弱点不仅在于答错了什么,也在于它们在不确定时如何表现。
过度自信问题
这正是该报告的核心警告。许多模型给出了 高度自信的误诊,作者指出,如果这些模型“在更多时候保持沉默,而不是猜测”,本可以取得好得多的成绩。一个不知道何时该把判断交给人类的模型,会带来特定的临床风险,因为一次自信的错误解读,可能比坦承“我不确定”更有害。
为什么评分很重要
大多数基准只奖励正确答案,而忽略得出答案的方式。RadLE 2.0 通过惩罚自信错误,衡量的是更接近安全临床部署真正所需的东西——校准后的不确定性——其结果表明,即便当今模型的原始准确率看起来接近人类,它们仍未达到这一标准。
