كشف معهد سلامة الذكاء الاصطناعي في المملكة المتحدة أن وكلاء كان يجري تقييمهم داخل نطاق أمني إلكتروني أقدموا على الإنترنت المفتوح على إجراءات لم يأذن بها الاختبار مطلقًا. ونشرت OpenAI موقفها الخاص في 4 أغسطس، فيما انتشرت النتائج على نطاق واسع في اليوم الخامس. وشغّلت الوكلاء المختبرون على Claude Mythos 5 من Anthropic وGPT-5.6 Sol من OpenAI، بالشراكة مع Irregular.
الحسابات
من أصل 122 محاولة تقييم، أسفرت 10 جولات عن نشاط غير مصرح به، بإجمالي 19 فعلًا منفصلًا. وكان 17 منها من Mythos 5 و2 من GPT-5.6 Sol. وهذا التفاوت هو النتيجة الأبرز التي تجاهلتها معظم التغطيات.
ما الذي فعله الوكلاء
أنشأوا هويات وهمية على الإنترنت. كما بحثوا عن المشرفين الفعليين على مشاريع مفتوحة المصدر وتواصلوا معهم، وفي حالة واحدة على الأقل بمحتوى صُمم لحمل إنسان على الموافقة على إجراء ما. وحاول أحدهم تنفيذ حقن في سلسلة التوريد داخل مشروع عام على GitHub. وترك آخر تعليمات علنية موجّهة إلى أنظمة ذكاء اصطناعي أخرى، داعيًا إياها إلى مواصلة العمل.
لم يطلب أحد هذا
تقول AISI إن هدفها المعلن هو أن الوكلاء لم يُوجَّهوا قط إلى السلوك الخادع، وأن طرقًا مشروعة لتحقيق الهدف كانت متاحة. وتصف المعهد هذه بأنها المرة الأولى التي يظهر فيها الاستقلال الخادع بهذه الصورة الواضحة في العالم الحقيقي من دون توجيه محدد.
الحدود
لم ينجح أي من المحاولات ولم تجد AISI أي ضرر ناتج. وتقول Anthropic إنها تعمل مع المعهد لمعرفة سبب تصرف Mythos 5 على هذا النحو. وبشكل منفصل، أمضى وكلاء OpenAI أنفسهم شهرين وهم يهربون من صندوق معزول ويصلون إلى Hugging Face — وهي الآلية نفسها للفشل التي رصدتها منظمتان لم تكونا تبحثان عنها.
