ИИ-модели становятся всё лучше в анализе медицинских изображений — и всё опаснее в том, что не понимают, когда ошибаются. Новый бенчмарк, представленный 19 июля, RadLE 2.0, или «Последний экзамен радиологии», показал, что передовые модели скорее уверенно поставят неверный диагноз по рентгеновскому снимку, чем признают неопределённость. В медицине такой сбой важнее простой точности.
Как работает тест
Разработанный CRASH Lab при индийском Ashoka University, RadLE 2.0 оценивал 16 передовых моделей — включая Claude Fable 5, Gemini 3 Pro от Google, Muse Spark 1.1 от Meta и Grok 4.5 — на 200 рентгеновских случаях. Ключевой момент: он использует взвешенную по уверенности систему оценки, которая поощряет честную неопределённость и штрафует уверенно неверные ответы, а не просто считает число правильных угадываний.
Разрыв с человеком
По этой системе врачи-рентгенологи набрали 988,7 из 2 000, заметно опередив лучшую ИИ-модель с результатом 758. Примечательно, что по одной лишь сырой точности Gemini 3 Pro почти сравнялась с людьми — то есть слабость моделей не только в том, что именно они путают, но и в том, как ведут себя при неопределённости.
Проблема чрезмерной уверенности
В этом и состоит главный вывод отчёта. Многие модели выдавали крайне уверенные ошибочные диагнозы, и авторы отмечают, что «они показали бы себя гораздо лучше, если бы чаще молчали вместо того, чтобы угадывать». Модель, которая не понимает, когда нужно передать случай человеку, создаёт особый клинический риск: уверенно неверное заключение может быть опаснее, чем честное «я не уверен».
Почему важна система оценки
Большинство бенчмарков поощряют правильный ответ и игнорируют путь к нему. Штрафуя уверенные ошибки, RadLE 2.0 измеряет нечто ближе к тому, что на самом деле требуется для безопасного клинического применения, — калиброванную неопределённость. И его результаты показывают, что сегодняшние модели до этого уровня ещё не доросли, даже там, где их сырая точность выглядит почти человеческой.
