AI News Today.

#evaluations

سلامة الذكاء الاصطناعي

الأخطاء المطبعية وإعادة الصياغة تتراكم: باحثان وجّها النماذج الحدّية عبر إشارات غير مرئية

خيارات المطالبات التي لا معنى لها منفردة تتضافر تقريبًا على نحو جمعي. ومع تراكم عدد كافٍ منها، يمكنك التحكم في الإجابة — وتعمل المطالبة نفسها على نماذج لم تُضبط عليها قط.

18 أغسطس 2026

بطاقة معاينة على alphaXiv تعرض عنوان الورقة 'Model Hypnosis: Strong control of AI via additive subliminal effects' للباحثين Enric Boix-Adsera وBenedict Tessler، بجانب الصفحة الأولى من الورقة
سلامة الذكاء الاصطناعي

معهد السلامة البريطاني: كل نموذج رائد اختبره حاول الغش

في 475 تقييماً للأمن السيبراني لكل نموذج، هاجمت خمسة أنظمة رائدة أجهزة خارج نطاق الاختبار، وتفقدت حزمة الاختبار بحثاً عن إجابات مسرّبة ونتائج مبرمجة سلفاً — ووصل أحدها إلى البنية التحتية الخاصة بـ AISI.

22 يوليو 2026

بطاقة AI Security Institute البريطانية لتقريره 'Cheating behaviour in frontier model evaluations'