Проспективное одноцентровое кроссовер-исследование с участием читателей, опубликованное 21 августа в Academic Radiology, проверило четыре коммерчески доступных ИИ-продукта для рентгенографии грудной клетки в сравнении с чтением без помощи ИИ. Пять специалистов с опытом от одного до шести лет оценивали 1 200 последовательных пациентов и 1 861 рентгенографию на предмет легочных инфильтратов, плевральных выпотов, масс средостения, пневмоторакса и легочных узелков в пяти условиях, с 14-дневным периодом вымывания между сессиями и рандомизированным порядком случаев. Эталоном служил итоговый клинический отчет с подтверждающей КТ, где она была доступна.
Первичный исход
«ИИ-поддержка не улучшила диагностическую точность». Для плевральных выпотов и легочных узелков точность снижалась в нескольких сочетаниях читатель–инструмент, а названный механизм — рост числа ложноположительных результатов: инструмент отмечает находку, врач соглашается, но находки нет.
Что обычно неверно подается в таких результатах
Это точная инверсия того, как обычно представляют результаты ИИ в радиологии. Каждый коммерчески привлекательный показатель здесь был вторичным, и каждый из них улучшился: три из пяти ординаторов читали быстрее, медианное сокращение составило от 6 до 17 секунд на случай (p≤0,031); четыре из пяти сообщили о более высокой уверенности; в отдельных сочетаниях снизилось число консультаций с более опытными коллегами и в одном случае уменьшилось направление на КТ. Между тем первичный исход, диагностическая эффективность, не сдвинулся — и по двум находкам даже ухудшился. Более высокая уверенность при более низкой точности — классический признак автоматизационного смещения, и авторы называют его прямо. Материал с заголовком «ИИ сокращает время чтения и повышает уверенность радиологов» был бы точен по каждому пункту и неверен в целом.
Почему фраза «commercially available» здесь критична
Это не исследовательские прототипы. Это продаваемые, одобренные продукты, уже используемые в клинических рабочих процессах, протестированные head-to-head в реальных условиях — а это существенно более сильный дизайн доказательств, чем ретроспективные исследования одного инструмента, на которых основана большая часть закупочных решений.
Что исследование не доказывает
Оно одноцентровое, читатели относительно молодые, а эталоном служит итоговый отчет, а не исходы пациентов. Авторы завершают работу тем, что клинические испытания по-прежнему нужны, чтобы понять, улучшают ли эти инструменты состояние пациентов, и что внедрение требует тщательной локальной адаптации, чтобы избежать автоматизационного смещения и при этом получить выигрыш в эффективности. Эти выигрыши, что важно, реальны — просто это не то, за что инструменты продаются.
