По мере того как ИИ-модели заполняют стандартные тесты, лидеры отрасли все чаще утверждают, что сами эти тесты сломаны. 18 июля на WAIC ряд китайских руководителей в сфере ИИ выступили за отказ от статичных лидербордов в пользу измерения того, работают ли модели в реальном мире.
Проблема с бенчмарками
Претензия состоит в том, что такие бенчмарки, как MMLU, HumanEval и SWE-bench, стали перенасыщенными и, что еще хуже, загрязненными: их вопросы просачиваются в обучающие данные, поэтому высокие оценки измеряют не только способности, но и запоминание. Когда все передовые модели собираются в верхней части таблицы, лидерборд перестает их различать.
Новые ориентиры
Основатель Baidu Robin Li предложил альтернативу, основанную не на экзаменах, а на использовании: «ежедневно активные агенты» как показатель того, выполняет ли ИИ устойчивую реальную работу. Руководитель по продукту Li Jingqiu заявил, что лучший тест — это «сложная, требующая много времени задача», то есть многошаговая работа, которую один вопрос лидерборда не способен охватить.
«Просто используйте это»
Yang Minghui из StepFun сформулировал это наиболее прямо: «гонка бенчмарков — не вся суть... настоящий тест — это просто использовать его». Bai Chuanxu из MiniMax развил близкую мысль, подчеркнув нативную мультимодальность — способность одной модели работать с текстом, изображениями и другими форматами одновременно — как возможность, которую лидерборды, оптимизированные под текстовые рассуждения, обычно недооценивают.
Собственный интерес и суть проблемы
Здесь есть и удобный собственный интерес: переосмысление оценки через «реальное использование» выгодно компаниям, чьи продукты внедрены, но чьи оценки в бенчмарках отстают. И все же базовая критика широко разделяется в отрасли. По мере того как модели сближаются на перенасыщенных тестах, у индустрии действительно нет надежного способа сравнивать их — и вопрос «действительно ли это работает» оказывается более трудным и более честным, чем любая отдельная цифра.
