نشرت ARC Prize تقييمها الخاص لـ GPT-6 Astra بعد ساعات فقط من إطلاق النموذج في 3 سبتمبر، والرقم الرئيسي لا يصمد أمامه. فعند تشغيله على حزمة Standard المحايدة للمزوّد التابعة لـ ARC Prize، يحقق Astra نسبة 62.7% على ARC-AGI-3 Semi-Private. أما نسبة 99.9% التي تصدّرت مواد إطلاق OpenAI فقد جرى إنتاجها عبر مُشغّل مختلف.

حزمتا اختبار، ورقمان

تنشر ARC Prize كلا النتيجتين. تتيح حزمة Standard للنموذج الاحتفاظ بالملاحظات التي يختار الإبقاء عليها. أما حزمة Provider Adapter، فبحسب ARC Prize نفسها، فإنها "تحافظ على حالة الاستدلال غير الشفافة بين الطلبات وتستخدم الضغط لفترات المحادثات الأطول، ما يسمح للنموذج بإعادة استخدام العمل السابق." وفي جدول النتائج المنشور، تبلغ أعلى نتيجة على حزمة Standard نسبة 62.7% بتكلفة $26,098 عند أقصى جهد استدلالي. أما نسبة 99.9% فتظهر على جانب adapter عند جهد high، بتكلفة $18,817. وعند أقصى جهد، يعيد adapter نسبة 98.6% بتكلفة $17,332.

المقارنة التي لا تصح

وهنا تكمن النقطة المهمة لكل رسم بياني نُشر يوم الإطلاق. فقد وضعت OpenAI في جدولها نتيجة Astra على adapter في مواجهة Claude Opus 5 بنسبة 30.2% وGPT-5.6 Sol بنسبة 7.8% — وهي أرقام جرى قياسها على حزمة Standard. وعند تشغيل النماذج الثلاثة بالطريقة نفسها، تتقلص الفجوة البالغة نحو 69 نقطة أمام نموذج Anthropic إلى نحو 32 نقطة. وهي لا تزال أفضلية كبيرة؛ لكنها ليست تلك التي عُرضت.

أرخص وأعلى في الوقت نفسه، وهذه هي الإشارة

تكلفة تشغيل adapter كانت أقل من تكلفة التشغيل القياسي عند كل مستويات الاستدلال — $18,817 مقابل $40,705 عند الجهد العالي. وهذا يستبعد التفسير المعتاد القائل إن النتيجة الأفضل اشترت ببساطة قدرة حوسبة أكبر. ما يضيفه adapter هو إعادة استخدام الحالة عبر الطلبات، أي إن جزءًا مما يُقاس هنا هو البنية التحتية للاستدلال لدى OpenAI لا استدلال النموذج نفسه. وتقول ARC Prize ذلك صراحة، مشيرة إلى أن مختبريها لم يكن لديهم code interpreter أو scratchpad، لذا ينبغي أن تُفهم النتائج على أنها "الأداء المشترك للنموذج وأدواته."

ما الذي يخطئه الإطار المتداول

انتشرت عبارة "ARC-AGI-3 is saturated" على نطاق واسع في 3 سبتمبر. وهذا غير صحيح. فثلث المعيار لم يُحل بعد تحت المُشغّل المحايد للمزوّد. كما أن adapter ليس خدعة — فالحفاظ على حالة الاستدلال قدرة حقيقية يحصل عليها العملاء. لكنه ينتج نتيجة على مستوى النظام لا على مستوى النموذج، والتعامل معهما على أنهما قابلان للتبادل هو الخطأ. وتفصيل آخر يفكك سردية التوسع الأنيقة: على حزمة Standard، النتائج غير متدرجة بشكل أحادي. فعندما يكون جهد الاستدلال مضبوطًا على "none" يحقق 35.2%، أي ما يقارب ضعف 17.5% عند خيار "low".