Artificial Analysis9월 4일 Intelligence Index 버전 4.2를 공개했으며, 그에 따른 순위는 이미 뉴스처럼 확산되고 있습니다. Claude Fable 5.1이 1위, GPT-6 Astra가 2위, "GPT-5.6 Sol보다 4점 높은" 것으로 나타났고, Google은 랩 기준 7위였습니다. 이는 이틀 전까지 누구나 인용하던 척도에서의 점수가 아닙니다.

종합 지표에서 무엇이 바뀌었나

변경 내역을 그대로 옮기면 다음과 같습니다. "+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming". 이어서: "40% of our Index weighting is now private, held-out test sets - double the figure from v4.1." 채점 방식도 달라졌습니다. AA-LCR v1.1은 "채점 시스템 프롬프트를 추가하고 답안의 오류와 모호성을 바로잡았으며", GDPval-AA v2와 AA-Briefcase에 대해서는 "샘플링을 개선하고 Elo scale을 다시 고정했다"고 밝혔습니다.

척도가 바뀌었음을 보여주는 가장 분명한 증거

그 증거는 이틀 간격으로 올라온 Artificial Analysis의 자체 페이지에 있습니다. 9월 2일: "Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59)." 9월 4일 라이브 v4.2 리더보드에서는 Claude Fable 5.1이 "가장 높은 점수인 57을 기록했고, GPT-6 Astra (max)가 55점으로 뒤를 이었다"고 적혔습니다. 그 사이 Gemini는 달라지지 않았습니다. 화요일에는 중간급 모델이 59점을 받았는데, 금요일에는 전체 지수의 최고치가 57점입니다.

널리 받아들여진 해석의 오류

"GPT-6 Astra shows a 4pt gain over GPT-5.6 Sol"이라는 표현은 v4.2끼리의 비교를, 더 이상 존재하지 않는 v4.1 기준에 대한 진전으로 읽은 것입니다. 이번 주에 공개된 전후 비교의 주장들, 특히 출시일 숫자와 v4.2 순위를 짝지은 것들은 모두 서로 다른 종합 지표를 비교하고 있습니다. 유지관리자가 포화된 평가를 폐지할 권한은 있습니다. 문제는 변화 전후의 숫자가 같은 문장 안에서 함께 인용되고 있다는 점입니다.

주목할 만한 우연

제외된 평가는 "exceptional scientific reasoning" 평가였고, 새 종합 지표에서 Google은 랩 기준 7위로 내려갔습니다. 이는 그 자체만으로는 어떤 증거도 아닙니다. 비공개 보류 테스트 세트의 가중치를 두 배로 늘린 것은 분명한 게임 방지 조치이기도 합니다. 그러나 지표 유지관리자라면 충분히 질문받을 만한 우연이며, 이 지수는 출시 게시물과 구매 제안서에서 마치 안정적인 척도인 것처럼 인용되고 있습니다.