تستهدف ورقة معيارية نُشرت في 3 سبتمبر الطريقة التي يقيَّم بها المجال ادعاءه الأمني الأبرز. فإذا أصلح وكيل ذكاء اصطناعي ثغرة، فإن الفحص القياسي هو إعادة تشغيل proof-of-concept الذي تسبب في العطل ومعرفة ما إذا كان سيتعطل مرة أخرى. ويخلص المؤلفون إلى أن هذا المعيار متساهل إلى حد كبير.

القياس الأبرز

"Across 11 state-of-the-art agents, including the top three AIxCC agents, the original PoC-only validation inflates the patching task solve rate of agents by 1.83x on average." ويغطي العمل ترقيع الثغرات في C وC++، والمقارنة هنا بين نظامي تحقق لا بين مجموعتين من الوكلاء.

كيف بُني المعيار

إنه "يختار الثغرات التي تقع إصلاحاتها الحقيقية خارج مكدس التعطل"، ثم يطبّق نقل الثغرات وتعديلات على الشيفرة. وتكتسب هذه البنية أهمية عند قراءة الرقم: فهذه حالات اختيرت تحديدًا لأن الترقية قد تُسكت التعطل من دون معالجة العيب.

نتيجة الحفظ

وبشكل منفصل، "في المتوسط، تُظهر 25% من ترقيعات الوكلاء تشابهًا كبيرًا مع ترقيعات المطورين التاريخية." هذا مقياس تشابه، لا دليلًا على تلوث بيانات التدريب — إذ غالبًا ما يبدو الإصلاح الصحيح شبيهًا بإصلاح المطوّر لأنه يوجد إصلاح صحيح واضح واحد — لكنه يشمل ربع العينة، وله صلة بما تقيسه هذه المعايير.

ما تخطئ فيه الصياغة المتداولة

العنوان الذي سيثير الاهتمام هنا هو أن وكلاء ترقيع الذكاء الاصطناعي مزيفون بنسبة 45%. وهذا ليس ما تعنيه 1.83x. فالنسبة تقارن بين طريقتين للتقييم على معيار بنته المؤلفةون خصيصًا لكسر الطريقة الأضعف، لذا فإن الفجوة مصممة لتكون ظاهرة لا مستخرجة من الواقع. والقراءة القابلة للدفاع هي قراءة اتجاهية: التحقق المعتمد على PoC فقط يبالغ في العدّ بشكل منهجي، وبنحو هذه الدرجة تقريبًا في الحالات المختارة عدائيًا. كما أن الملخص لا يورد درجات منفصلة لكل وكيل، لذلك لا يمكن إسناد النتيجة إلى بائع بعينه من خلاله. وتستحق الحدود أن تُذكر — فريق واحد، واقتران لغوي واحد، ومعيار من بناء المؤلفين أنفسهم، ولا توجد بعدُ إعادة تحقق مستقلة.