نشرت مجموعة تضم Princeton وUK AI Security Institute وCornflower Labs وGeorgetown وآخرين ورقة Can AI agents conduct open-ended AI research? في 29 يوليو. والمنهج هو الجزء المثير للاهتمام. فقد أخذوا تقديمين غير منشورين إلى NeurIPS 2026، ومنحوا وكيلاً السؤال البحثي المركزي لكل ورقة، ثم طلبوا من المؤلفين الفعليين للورقتين تقييم النتائج بصفتهم محكّمين في المؤتمر.
الإعداد
Claude Opus 4.8 مع أعلى مستوى من الاستدلال على إطار OpenClaw، ستة أيام من الزمن الفعلي، 3,000 دولار من أرصدة واجهة البرمجة، وأرصدة GPU، وآلة افتراضية على Linux، والويب المفتوح.
الهندسة نجحت
أكمل الوكلاء مراجعات أدبية واسعة النطاق، وأصلحوا بيئات GPU، وأجروا مئات التجارب واختبارات المتانة، وجمعوا مستندات LaTeX كاملة جاهزة للطباعة النهائية دون أي تدخل يدوي يتجاوز بيانات الاعتماد وإعداد المستودع. وتمكنوا من حل كل عقبة بيئية باستثناء واحدة. وفي استطلاع أُجري مسبقًا، توقع تسعة من أصل أحد عشر من المؤلفين المشاركين أن تنتهي العمليات بحلقة خطأ غير قابلة للحل — وكانوا متشائمين أكثر من اللازم.
لكن البحث لم ينجح
تُقيَّم مراجعات المؤلفين على مقاييس NeurIPS: حصلت الورقة الأولى على 2/6 إجمالًا، والثانية على 1/6، مع درجة ثقة للمراجعين بلغت 4 و5 من 5. وكان الرفضان في الحالتين واضحين لا لبس فيهما. وشملت أوجه الفشل المذكورة: ضعف الحكم على العتبة اللازمة لبحث قابل للنشر، وردود غير مبتكرة على أوجه القصور في التصميم، وتراجعًا غير فعال من المآزق، وضعفًا في إدراك الموارد، وانحرافًا عن التعليمات.
أكثر التفاصيل دلالة
انتهت التجربتان وقد تم إنفاق أقل من نصف ميزانية واجهة البرمجة رغم التشجيع الصريح على استخدامها، كما تخلتا عن أكثر أهدافهما طموحًا خلال أول عشر ساعات ولم تعودا إلى تغيير المسار. وحملت إحدى المسودات صفر من التصورات المرئية في المتن الرئيسي مقابل 15 في النسخة الأصلية. وأعاد تشغيل على GPT-5.6 Sol إنتاج الإخفاقات — وأنفق كامل 3,000 دولار في يومين.
