Nature Medicine утром 3 сентября опубликовал два документа, зарегистрированные с разницей в секунды: прошедшую рецензирование Matters Arising, оспаривающую статью июня 2026 года, в которой утверждалось, что универсальные frontier LLM превосходят специализированные клинические инструменты ИИ, и Reply от авторов оригинальной работы. Журнал выпустил их как намеренную пару.
В чём состоит критика
Критики утверждают, что бенчмарки, давшие исследованию наибольшие эффекты, искажены факторами, которые сами авторы признают, а оставшаяся оценка слишком узка по охвату, преувеличивает свою точность и опирается на настройки вывода, которые описаны или контролируются недостаточно. В критике также приводится фигура, показывающая восстановимое содержимое бенчмарка MedQA из frontier-модели — запоминание тестового набора, продемонстрированное, а не просто заявленное.
Что признают авторы
В Reply говорится, что возможная контаминация MedQA и affinity оценщика HealthBench могут ограничивать обобщаемость — под affinity оценщика понимается склонность LLM-судьи предпочитать ответы из собственной семейства моделей — и что в статье эти два бенчмарка рассматриваются как дополнительные. Авторы сохраняют основное вывод под условиями своего исследования и развёртывания. Этот основной вывод опирается на бенчмарк реального клинического запроса: 100 деидентифицированных запросов врачей, оценённых вслепую 12 клиницистами из США.
Что неверно в распространённой интерпретации
Июньский результат разошёлся как «ChatGPT обходит эталонные инструменты врачей» — то есть как общий рейтинг возможностей. На самом деле это никогда не было так, а после 3 сентября картина стала ещё уже: два из трёх опорных бенчмарков признаны контаминированными или дающими преимущество самой модели, а уцелевшая опора — 100 запросов в одной больнице. Второе уточнение важно для того, как это будет освещаться: Matters Arising — не исправление, не отзыв и не выражение обеспокоенности. Оригинальная статья остаётся в силе. Изменился лишь объём, который её собственные авторы теперь приписывают ей в печати.
Почему это важно именно здесь
Именно на эту статью ссылаются в аргументах о закупках в больницах, выступая против оплаты специализированных подписок на клинический ИИ. Этот обмен в журнале-источнике фиксирует, какой вес может иметь такой аргумент — и выводит контаминацию бенчмарков и утечку предпочтения в LLM-as-judge в центр решений о медицинских закупках, а не оставляет их в разряде методологических вопросов машинного обучения.
