أعلنت Artificial Analysis الإصدار 4.2 من Intelligence Index في 4 سبتمبر، والمراتب الصادرة عنه تتداول بالفعل بوصفها أخباراً: Claude Fable 5.1 في الصدارة، وGPT-6 Astra في المركز الثاني مع "زيادة 4 نقاط عن GPT-5.6 Sol"، وGoogle في المركز السابع بين المختبرات. وهذه ليست الدرجات على المعيار الذي كان الجميع يستشهد به قبل يومين.
ما الذي تغيّر في المؤشر المركب
جاء في سجل التغييرات، حرفياً: "+ AA-Briefcase، تقييمنا للعمل المعرفي الوكيلي مع مجموعة اختبار خاصة + Surge's GDP.pdf، استدلال المستندات طويلة السياق عبر 4,592 صفحة PDF − GPQA Diamond، وهو تقييم استدلال علمي استثنائي أصبح الآن مشبعاً … بالإضافة إلى وزن أكبر لمجموعات الاختبار المحجوبة لمنع التلاعب". وجاء فيه أيضاً: "40% من وزن مؤشرنا أصبح الآن خاصاً، ومحصوراً في مجموعات اختبار محجوبة - أي ضعف النسبة في v4.1." كما تغيّرت طريقة التقدير أيضاً: إذ أضافت AA-LCR v1.1 "موجهاً لنظام التقدير وصححت أخطاءً وأوجه غموض في مفاتيح الإجابة"، وفي GDPval-AA v2 وAA-Briefcase، "حسّنا آلية المعاينة وأعدنا إرساء مقياس Elo".
أوضح دليل على أن المعيار نفسه تحرّك
يأتي الدليل من صفحات Artificial Analysis نفسها، بفاصل يومين. في 2 سبتمبر: "تحصل Gemini 3.8 Flash على 59 في Artificial Analysis Intelligence Index … بما يتماشى مع جهود الاستدلال دون القصوى في GPT-5.6 Sol (xhigh، 59) وGrok 4.6 (medium، 59)." وفي 4 سبتمبر، لوحة الصدارة الحية في v4.2: Claude Fable 5.1 "تحقق أعلى نتيجة … بدرجة 57، تليها GPT-6 Astra (max) بدرجة 55". ولم يتغير شيء يخص Gemini بين التاريخين. نموذج من الفئة المتوسطة حقق 59 يوم الثلاثاء؛ وفي يوم الجمعة صار سقف المؤشر كله 57.
ما يخطئ فيه الإطار المتداول
"GPT-6 Astra تحقق زيادة 4 نقاط عن GPT-5.6 Sol" هي مقارنة داخل v4.2 تُقرأ على أنها تقدم مقابل خط أساس من v4.1 لم يعد قائماً. وكل ادعاء قبل وبعد نُشر هذا الأسبوع — بما في ذلك أي ادعاء يزاوج رقماً يوم الإطلاق مع ترتيب v4.2 — يقارن بين مكوّنين مختلفين. ومن حق الجهة المشرفة أن تُخرج تقييماً بلغ مرحلة التشبع من الخدمة؛ لكن المشكلة أن الأرقام على جانبي التغيير يجري اقتباسها في الجملة نفسها.
المفارقة الجديرة بالتسمية
التقييم الذي أُزيل كان تقييم "الاستدلال العلمي الاستثنائي"، وفي المؤشر الجديد تراجعت Google إلى المركز السابع بين المختبرات. وهذا ليس دليلاً على شيء بحد ذاته، كما أن مضاعفة وزن مجموعات الاختبار المحجوبة تمثل بالفعل إجراءً حقيقياً مضاداً للتلاعب. لكنه من نوع المصادفات التي ينبغي أن يتوقع المشرف على المعيار أن يُسأل عنها، بينما يُقتبس المؤشر في منشورات الإطلاق وعروض الشراء كما لو كان مقياساً ثابتاً.
