مؤلفو ورقة “LLMs Beat Clinical AI” يقرّون بحدود معيارين
نشرت Nature Medicine صباح اليوم نفسه ردًّا محكَّمًا على نتيجة يونيو، إلى جانب ردّ المؤلفين الأصليين، وأعاد الرد تصنيف معيارين من أصل ثلاثة بوصفهما ثانويين.
قبل 18 س

تغطية مهنية للذكاء الاصطناعي
يلخّص هذا القسم سيل أبحاث الذكاء الاصطناعي: الأوراق المهمة، وإعلانات المختبرات، ونتائج المعايير، والأساليب التي تدفع المجال فعلًا إلى الأمام — مع شرح موجّه للممارسين، لا للباحثين فقط.
نشرت Nature Medicine صباح اليوم نفسه ردًّا محكَّمًا على نتيجة يونيو، إلى جانب ردّ المؤلفين الأصليين، وأعاد الرد تصنيف معيارين من أصل ثلاثة بوصفهما ثانويين.
قبل 18 س

تصف ورقة جديدة مهارات طرف ثالث تُنجز مهمتها المعلنة بإتقان بينما تحرّف ما يختاره الوكيل — ولم ترصدها أدوات الفحص التي خضعت للاختبار.
قبل 18 س

وضعت CJ Logistics روبوتين ثنائيي الذراع على خط تنفيذ حي لـ Olive Young، حيث يضعان مواد التوسيد داخل الصناديق ويكمل البشر كل عملية تغليف.
قبل 19 س

يتنبأ Facet-0 بالقوة والعزم اللذين ستنتجهما حركته التالية بدلاً من البكسلات التي سيرىها. وفي خمس مهام تجميع دون المليمتر، بلغ أقوى خط أساس موجَّه بالرؤية 15%.
قبل 1 ي

تخلص مراجعة رئيسية في Frontiers in Science أعدها باحثون من Imperial وStanford وYale وHarvard Law إلى استنتاج متقشف: الذكاء الاصطناعي الذي حصل فعلاً على موافقة للاستخدام السريري هو تشخيصات التعلم العميق التقليدية، أما الذكاء الاصطناعي التوليدي فلم يدخل الممارسة الروتينية.
قبل 1 ي

تقول ورقة قُبلت في EMNLP 2026 Findings إن رقمًا واحدًا لمعدل نجاح الهجوم، يُقاس في إعداد افتراضي، لا يقول تقريبًا شيئًا عن نظام مُنشر.
قبل 2 ي

قيّم معهد حكومي 415 مهنة ووضع 2.92 مليون عامل في فئة التعرض المرتفع — ويقول إن التوظيف تراجع أيضاً في الوظائف منخفضة التعرض.
قبل 3 ي

يجادل كبير اقتصاديي Apollo بأن مفارقة جيفونز توسّع خدمات العملاء الخارجية بدل أن تقلّصها — استنادًا إلى سلسلة توظيف تنتهي قبل عمليات النشر المعنية.
قبل 4 ي

تُقاس قيمة عرض النطاق البالغة ثمانية أضعاف من Hot Chips داخل الحزمة. واستخدامها يكلّف المعالج المضيف ذاكرته المؤقتة، والـ prefetch، والتنفيذ خارج الترتيب.
قبل 6 ي

"When Context Gets Root" يهاجم الـ harness لا النموذج: يُعاد تسلسل محتوى الملفات غير الموثوق إلى خانة التعليمات الأعلى امتيازًا لدى الوكيل. العنوان هو 13 من 13، لكن الجداول تحته تقول شيئًا أكثر تحديدًا.
قبل 6 ي

سجّل Crossref في نافذة الدفعة 101 إشعار سحب، نحو 90 منها من سلسلة مؤتمرات تابعة لناشر واحد. عند قراءتها فرادى، يختفي حجمها الحقيقي.
27 أغسطس 2026

عبر ستة نماذج و153 مهمة، تراوح معدل التسميم الذاتي بين 20.3% و41.8%. الرقم الذي سينتشر هو ذلك المقاس عندما تكون الحمولة مُكيَّفة مع عائلة المهمة.
27 أغسطس 2026

Iterated Distillation and Amplification هي تقنية تُستخدم أثناء التدريب، وليست نموذجًا يتحسن أثناء استخدامك له. ويظهر Zscaler على جانبي الإعلان.
27 أغسطس 2026

كان كل استعلام جديد سيتطلب مراجعة جديدة للخصوصية، لذلك اختبر الشركاء أسئلتهم على مجموعة بيانات عامة مختلفة بدلًا من ذلك.
27 أغسطس 2026

بعد واحد وعشرين عاماً من وصف Bezos لها بأنها "ذكاء اصطناعي اصطناعي"، تحصل السوق التي وفّرت التسميات وراء الذكاء الاصطناعي الحديث على موعد نهائي. التفسير الواضح هو التفسير الخاطئ.
26 أغسطس 2026

تتمثل الحجة المركزية في الورقة في أن الاختبارات السلوكية تتيح للوكلاء النجاح عبر نسخ التنفيذ الأصلي. وتسمّي نمط الفشل ثم تقيس مدى حدوثه.
25 أغسطس 2026

أربع سنوات في وضع التخفي، وتمويل بقيمة 23 مليون دولار، وحلقة مغلقة بين نموذج وعينة بشرية متبرع بها — موجهة إلى سوق لا توجد عند نهايته بوابة موافقة.
22 أغسطس 2026

تُصنّف هذه المتنبئات المتغيرات ذات الأهمية غير المؤكدة في علم الوراثة السريري. أما المعيار الذي تتفوق عليه فيقوم على تسلسلات مرجعية؛ وليس على تسلسلات المرضى.
22 أغسطس 2026

تجربة عشوائية تفصل الأداة عن التعليمات باستخدامها — ويتركز معظم الضرر في جانب التعليمات.
22 أغسطس 2026

الأرقام التي يمكن أن يبيعها البائع — قراءات أسرع، ثقة أعلى، إحالات أقل — كلها سارت في الاتجاه الصحيح. أما النتيجة الأساسية فلم تفعل، بل تراجعت في حالتيْن.
22 أغسطس 2026

لم يكن بالإمكان حتى إجراء التجربة على نطاق frontier، لأن خط الأساس غير المدرَّب كان أصلًا عند السقف.
22 أغسطس 2026

من خلال تدقيق ثلاث جولات من التدريب الذاتي بـ LoRA مقابل نموذج ضابط مجمَّد، وجد أربعة باحثين سبعة إخفاقات في القياس — ينعكس كلٌّ منها ليقلب نتيجة منشورة عند غياب الضابط.
21 أغسطس 2026

طريقة الفشل هي الاكتشاف نفسه: فالتصاميم التي ارتبطت بإتقان تعطّلت عندما استُخدمت كمستقبلات CAR، إذ هُزمت بخصيصة تقع خارج الواجهة التي حسّنها الذكاء الاصطناعي.
21 أغسطس 2026

الشركة المنبثقة عن Colossal جمعت 60 مليون دولار إجمالاً وتقول إنها تُقيَّم بـ63 ضعف ذلك. وبين الرقمين تقف قائمة جينية مرشحة.
21 أغسطس 2026

لا عقدة تصنيع، لا سعة، لا موعد إطلاق، ولا شريحة شريكة. الأرقام التي يُشار إليها بوصفها مواصفات هي أهداف لم يبلغها المجال بعد.
20 أغسطس 2026

يبيّن اختبار مضاد للواقع مضبوط بالبذرة أثرًا هندسيًا كبيرًا مع تبعات وظيفية شبه معدومة — وتحذيرًا لكل من يراجع النماذج عبر فروق الأوزان.
20 أغسطس 2026

فريق من MIT وSRI وضع أرقامًا على هذه الثغرة: 0.993 AUROC بين وكلاء متطابقين، و0.854 عبر الشركات — كما أن التوجيه لا ينجح إلا في نموذج white-box.
20 أغسطس 2026

مشروع مستقل أعاد تنفيذ تصنيف Anthropic المتمحور حول العمل ووجد أن النصف المستبعد هو المكان الذي تتركز فيه موضوعات الصحة والتحرش والمحتوى الجنسي.
19 أغسطس 2026

تجد ورقة قياس أن كل بوابة مفتوحة المصدر جرى اختبارها تسرب قراءات من ذاكرة التخزين المؤقت بين العملاء افتراضيًا — والإصلاح لا يكلف أكثر من 2.5%.
19 أغسطس 2026

354 رابطًا مؤكَّدًا من 1,320 تصميمًا، وما يصل إلى 12,500 ساعة H100 في الجلسة الواحدة — والقدرة محجوبة في أقوى نماذج Anthropic.
19 أغسطس 2026
