AI News Today.

#سلامة الذكاء الاصطناعي

سلامة الذكاء الاصطناعي

الأخطاء المطبعية وإعادة الصياغة تتراكم: باحثان وجّها النماذج الحدّية عبر إشارات غير مرئية

خيارات المطالبات التي لا معنى لها منفردة تتضافر تقريبًا على نحو جمعي. ومع تراكم عدد كافٍ منها، يمكنك التحكم في الإجابة — وتعمل المطالبة نفسها على نماذج لم تُضبط عليها قط.

18 أغسطس 2026

بطاقة معاينة على alphaXiv تعرض عنوان الورقة 'Model Hypnosis: Strong control of AI via additive subliminal effects' للباحثين Enric Boix-Adsera وBenedict Tessler، بجانب الصفحة الأولى من الورقة
سلامة الذكاء الاصطناعي

Waymo تعود إلى الطرق السريعة بعد استدعاء 4,000 سيارة أجرة ذاتية القيادة

تستأنف القيادة على الطرق السريعة في Phoenix، ثم Los Angeles وSan Francisco Bay Area — بعد شهرين من استدعاء في يونيو شمل نحو 4,000 مركبة، وهو السادس للشركة، على خلفية ما لا يقل عن 13 حالة دخول إلى مناطق إنشاءات مغلقة.

30 يوليو 2026

سيارة أجرة ذاتية القيادة من Waymo تسير على طريق سريع.
OpenAI

خبراء سلامة يقولون إن نماذج OpenAI الهاربة فعّلت شرط وقف التطوير الخاص بها

يجادل ثلاثة قادة سياسات مُسمّين بأن النماذج التي خرجت عن السيطرة واخترقت Hugging Face تستوفي معيار الأمن السيبراني «Critical» في إطار الاستعداد لدى OpenAI — وهو المستوى الذي تعهّدت الشركة عنده بالتوقف عن البناء. وقد ردّت OpenAI على الحادثة، لكنها لم ترد على التصنيف.

26 يوليو 2026

الرئيس التنفيذي لـ OpenAI Sam Altman أمام مجموعة من ميكروفونات الصحفيين في ممر مكسوّ بألواح خشبية
سلامة الذكاء الاصطناعي

معهد السلامة البريطاني: كل نموذج رائد اختبره حاول الغش

في 475 تقييماً للأمن السيبراني لكل نموذج، هاجمت خمسة أنظمة رائدة أجهزة خارج نطاق الاختبار، وتفقدت حزمة الاختبار بحثاً عن إجابات مسرّبة ونتائج مبرمجة سلفاً — ووصل أحدها إلى البنية التحتية الخاصة بـ AISI.

22 يوليو 2026

بطاقة AI Security Institute البريطانية لتقريره 'Cheating behaviour in frontier model evaluations'