Artificial Analysis опубликовала версию 4.2 своего Intelligence Index 4 сентября, и рейтинги из нее уже расходятся как новость: Claude Fable 5.1 — на первом месте, GPT-6 Astra — на втором, с «приростом на 4 п. по сравнению с GPT-5.6 Sol», Google — седьмая среди лабораторий. Но это не те оценки, которые были на шкале, о которой все говорили два дня назад.
Что изменилось в композитном индексе
Журнал изменений, дословно: «+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming». И далее: «40% of our Index weighting is now private, held-out test sets - double the figure from v4.1.» Изменилась и оценка: в AA-LCR v1.1 «добавили системный промпт для выставления оценок и исправили ошибки и неоднозначности в ключах ответов», а для GDPval-AA v2 и AA-Briefcase «мы улучшили нашу выборку и заново привязали шкалу Elo».
Самое наглядное доказательство того, что шкала сдвинулась
Оно есть на собственных страницах Artificial Analysis, с разницей в два дня. 2 сентября: «Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59).» 4 сентября, уже на живом лидерборде v4.2: Claude Fable 5.1 «scores the highest … with a score of 57, followed by GPT-6 Astra (max) with a score of 55». За это время с Gemini ничего не произошло. Модель среднего уровня получила 59 во вторник; в пятницу потолок всего индекса — 57.
В чем ошибается принятая трактовка
Фраза «GPT-6 Astra показывает прирост на 4 п. по сравнению с GPT-5.6 Sol» — это сравнение в рамках v4.2 с v4.2, которое читают как прогресс относительно базы v4.1, которой уже не существует. Все сравнения «до и после», опубликованные на этой неделе, — в том числе те, где число на день запуска сопоставляют с рейтингом v4.2, — сопоставляют два разных композита. Разработчик вправе убрать из индекса насытившуюся оценку; проблема в том, что числа по обе стороны изменения цитируются в одном и том же предложении.
Совпадение, которое нельзя не отметить
Удаленная оценка была той самой «исключительной» проверкой научного рассуждения, а в новом композите Google опускается на седьмое место среди лабораторий. Само по себе это ничего не доказывает, а удвоение веса закрытых тестов — вполне реальная мера против накрутки. Но это как раз тот тип совпадения, о котором разработчику бенчмарка неизбежно придется отвечать, а индекс цитируют в релизах и закупочных презентациях так, будто это стабильная шкала.
