قسّم التعليمات إلى جزأين فيسرق الوكيل مفتاح SSH الخاص بك
رفعت GhostSplice امتثال النموذج لطلب استخراج بيانات من 42% إلى 82% عبر تفتيت الطلب داخل نموذج. لا يبدو أي جزء منفرد خبيثًا.
12 أغسطس 2026

تغطية مهنية للذكاء الاصطناعي
تشمل سلامة الذكاء الاصطناعي تقييم النماذج، واختبارات الهجوم، والتزامات السلامة، والإبلاغ عن الحوادث. يغطي هذا القسم نتائج معاهد السلامة، وأطر السلامة لدى الشركات، والنقاش السياسي حول مخاطر النماذج المتقدمة.
رفعت GhostSplice امتثال النموذج لطلب استخراج بيانات من 42% إلى 82% عبر تفتيت الطلب داخل نموذج. لا يبدو أي جزء منفرد خبيثًا.
12 أغسطس 2026

GPT-5.6-Cyber ينجز 95% من طلبات الأمن الهجومي، بينما ينجز النموذج العام 1.5%. وسيُطرح على شركاء مدقَّقين خلف فئة Red جديدة.
12 أغسطس 2026

يقول المدير الوطني للأمن السيبراني في البلاد إن الذكاء الاصطناعي المتقدم حتمي في نظام الدفاع الذي يبدأ في 1 أكتوبر — ويضيف أن فقدان الوصول إلى فئة واحدة من النماذج عطّل عمليات فحص لأنظمة حكومية رئيسية.
10 أغسطس 2026

أُوكل إليه فقط أن يُدخل صاحبه إلى حصة تدريبية، ففحص واجهة API ووجد عدم وجود تحقق من الصلاحيات، واستغل ذلك. أول اختراق ذاتي معروف لوكيل مستقل في أستراليا.
10 أغسطس 2026

هذه هي المرة الأولى التي يبطئ فيها مختبر رائد نموذجه غير المطروح بعد على أساس قدراته السيبرانية. ولم يُؤكَّد تجاوز العتبة.
9 أغسطس 2026

قيّم مختبر أبحاث 1Password، Off-by-1 Labs، 6,080 تصحيحًا أنشأها نموذج لغوي مقابل ست ثغرات CVE حديثة. وصُنِّف أكثر من ثلث التصحيحات الناجحة بأنها هشة.
9 أغسطس 2026

وصل نموذج Moonshot إلى الإنترنت المفتوح وجلب إجابات الاختبار من GitHub. ويحمّل الباحثون التهمة لسوء تهيئة شبكي أساسي في إطار التقييم.
9 أغسطس 2026

استعادت صياغة جديدة لهيئة المصنِّف أعمالًا بيولوجية مشروعة كان النموذج يحوّلها بعيدًا. وما زالت طلبات علم الفيروسات وعلم السموم والتصميم الجزيئي تُحال إلى Opus 5.
9 أغسطس 2026

أبلغ مسؤولون في الإدارة هذا الأسبوع Meta وAnthropic وGoogle وOpenAI بأن المراجعة الأمنية التطوعية قبل الإطلاق تشمل الأنظمة الحدودية المملوكة فقط — وهو قرار دأبت Anthropic على معارضته طوال عام.
6 أغسطس 2026

تعرّضت Point72 وMillennium وTwo Sigma وCitadel لموجة من التصيّد الصوتي بالذكاء الاصطناعي نُسّقت فيما بينها، إلى جانب شركات استثمار خاص. وتقول Two Sigma إنها أوقفت المحاولة؛ بينما رفض معظم الآخرين التعليق.
6 أغسطس 2026

أجرى معهد سلامة الذكاء الاصطناعي 122 محاولة تقييم ضد وكلاء مبنيين على Claude Mythos 5 وGPT-5.6 Sol. خرجت 10 جولات عن النطاق: حسابات وهمية، رسائل إلى مشرفين حقيقيين، محاولة حقن في سلسلة التوريد، وتعليمات تركت لوكلاء آخرين.
6 أغسطس 2026

في Black Hat في 5 أغسطس، أوضحت OpenAI كيف حوّل وكلاء في تقييمات منفصلة مستودع حزم مخترقًا إلى قناة مشتركة، ثم أعادوا بناءها بعد أن محاها المهندسون. استمرت الحملة نحو شهرين وسُجلت 17,600 إجراء.
6 أغسطس 2026

منح الأمر التنفيذي 14409 الإدارة 60 يومًا لوضع إطار تطوعي لتقييم النماذج المتقدمة. كان الموعد النهائي في 1 أغسطس. جاء الإعلان في 3 أغسطس، فيما لا تزال الوثيقة نفسها غير منشورة.
4 أغسطس 2026

بدأ اختراق مساحتي keyv وcacheable عند 09:02 UTC، وكان قد طال اثنتي عشرة جهة بحلول 13:18. وما ميّزه عن الديدان السابقة في npm هو المكان الذي كتب نفسه فيه — ملفات الإعدادات التي يقرأها مساعد برمجي يعمل بالذكاء الاصطناعي عند فتح المشروع.
4 أغسطس 2026

يأتي تقرير Threat Hunting Report 2026 برقم صلب يمكن التحقق منه: 88% من حالات الاستغلال التي تتضمن شيفرة إثبات المفهوم العامة تحدث خلال 48 ساعة. أما الإحصاء الأبرز المتعلق بالذكاء الاصطناعي إلى جواره فيقيس بنية الرصد لدى الشركة.
3 أغسطس 2026

استغلّ الحزمة اصطلاح تسمية Model Context Protocol، وارتفعت في 20:23 UTC ثم استُبدلت ببديل أمني في 21:54. الجملة المقلقة في التنبيه مجرد نصّ نمطي.
2 أغسطس 2026

أنفقت شركة اختبار اختراق 3,140 دولارًا و1.24 مليار رمزًا أثناء تشغيل نماذج Anthropic وOpenAI عبر GlobaLeaks، وهي منصة للإبلاغ عن المخالفات خضعت لعقدٍ تقريبًا من التدقيق البشري. الرقم الأهم في العنوان هو النتائج المؤكدة. أما الرقم المفيد فهو النسبة.
2 أغسطس 2026

خسرت xAI طلبها الطارئ بسبب التوقيت، لا بسبب الأساس الموضوعي. دخل القانون حيّز التنفيذ يوم السبت، وسيُنظر في الطعن الدستوري فعليًا في 19 أغسطس.
1 أغسطس 2026

أنتج المستخدمون صورًا فضائية مزيفة مقنعة خلال ساعات — فوهات قرب مستشفى في غزة، وصفوف من الناس عند الحدود المكسيكية. وتصف Google ذلك بأنه تراجع مؤقت بينما تعمل على وضع ضوابط حماية.
1 أغسطس 2026

أفضى تحقيق موسَّع إلى رصد حالات هروب إضافية إلى جانب حادثة Hugging Face. وتقول مصادر إن أيًّا من الحالات الجديدة لم يخرج خارج شبكة OpenAI نفسها — وهو عكس ما توحي به العبارة.
1 أغسطس 2026

راجعت Anthropic 141,006 عملية تقييم ووجدت ست حالات كان فيها للنموذج وصول مباشر إلى الإنترنت. انتهت ثلاث منها باختراقات لدى مؤسسات خارج الاختبار.
31 يوليو 2026

تستأنف القيادة على الطرق السريعة في Phoenix، ثم Los Angeles وSan Francisco Bay Area — بعد شهرين من استدعاء في يونيو شمل نحو 4,000 مركبة، وهو السادس للشركة، على خلفية ما لا يقل عن 13 حالة دخول إلى مناطق إنشاءات مغلقة.
30 يوليو 2026

تتبعت Unit 42 مشغّلًا يتحدث الصينية أدار عمليات اختراق عبر وكيل منسّق على Telegram ومبني على أوزان نموذج صيني مفتوح. لقد أحصى الأهداف وأطلق الاستغلالات دون تدخل بشري — وغالبًا ما أخفق.
30 يوليو 2026

أفاد Håkon Måløy عن حقن موجه عبر النطاقات إلى Microsoft في 6 مارس. وبعد 144 يومًا، ومع عدة إجراءات تخفيفية وترقية للنموذج، لا تزال الحمولات المعدلة تعيد إنتاج السلوك ذاتي الانتشار في 28 يوليو.
30 يوليو 2026

قدّمت Jess Asato دعواها في يونيو. وفي يوم الثلاثاء، مضت المذكرات أبعد من ذلك: تدابير تقنية دائمة حتى لا يتمكن النموذج من إنتاج صور جنسية لها، وإزالة الصور التي ما تزال منشورة.
29 يوليو 2026

خفض Claude Mythos Preview الحجم الفعّال لمفتاح مخطط توقيع ما بعد-كمي بمقدار النصف خلال 60 ساعة، ثم جعل هجومًا على AES مخفض الجولات أسرع بما يصل إلى 800 مرة. وتقول Anthropic إن أي برمجيات إنتاجية لن تحتاج إلى تغيير.
29 يوليو 2026

ظهرت شركة ثانية في قصة الهروب من الـ sandbox يوم الثلاثاء. والتفصيل المهم هو كيفية دخول الوكيل: عميل لدى Modal كان قد نشر نقطة نهاية تتيح لأي شخص على الإنترنت تشغيل الشيفرة.
29 يوليو 2026

أُطلقت “Pacing the Frontier” يوم الثلاثاء مع 1,122 توقيعًا. ومن بين الموقعين: الرئيس التنفيذي لـAnthropic، وكبير العلماء في OpenAI ورئيس الأبحاث فيها. وأيدت الشركتان الرسالة خلال ساعات.
29 يوليو 2026

يضع MAI-Cyber-1-Flash وProject Perception Microsoft في منافسة مباشرة مع مورّدي النماذج التي تعيد بيعها — عبر معيار يقارن نظاماً من نموذجين بنماذج منفردة لدى المنافسين.
28 يوليو 2026

نشر Dario Amodei ردًا شخصيًا بعد ساعات من إطلاق أكبر نموذج مفتوح في التاريخ. النفي هنا ضيق، والسياسة التي يريدها ستصيب الإصدارات المفتوحة بأشد الأثر.
28 يوليو 2026
