AI News Today.

#معايير قياس الذكاء الاصطناعي

Anthropic

«25% أرخص» في Fable 5.1 هو خفض في قراءة الذاكرة المؤقتة، لا في عدد الرموز

لم تتغير قائمة أسعار Anthropic: يبقى الإدخال عند 10 دولارات لكل مليون رمز والإخراج عند 50 دولارًا. ويأتي كامل التوفير من تراجع قراءات الذاكرة المؤقتة بنسبة 75% إلى 0.25 دولار، وهو ما يتحقق فقط في أعباء العمل التي تعيد استخدام بادئة.

قبل 1 ي

بطاقة إعلان Anthropic للإصدار، وتظهر Claude Fable 5.1 وMythos 5.1 بخط serif فوق سماء فاتحة مع سحب وهلال.
تنظيم الذكاء الاصطناعي في الولايات المتحدة

NIST تبني منصة اختبار لا يرى فيها مطوّرو النماذج بيانات الاختبار مطلقًا

يُقيّم AI Technology Evaluation النماذج على مجموعات بيانات معماة لم تكن علنية قط، وهو السبيل الوحيد لمعرفة ما إذا كانت نتيجة المعيار قد جرى حفظها. ولا يترتب عليه أي أثر تنظيمي على الإطلاق.

28 يوليو 2026

عمل فني رقمي تجريدي باللونين الفيروزي والأخضر لجسيمات متوهجة ودوائر إلكترونية، مستخدم كصورة ترويسية في موقع تحديات NIST الخاصة بـ AI
الذكاء الاصطناعي في الرعاية الصحية

يجد اختبار معياري جديد أن الذكاء الاصطناعي الذي يقرأ الأشعة السينية قد يكون واثقًا بشكل خطير عندما يخطئ

اختبر RadLE 2.0 16 نموذجًا متقدمًا على 200 حالة أشعة سينية باستخدام نظام تقييم يعاقب الأخطاء الواثقة؛ وسجل اختصاصيو الأشعة البشريون 988.7 من أصل 2,000 مقابل 758 لأفضل نموذج ذكاء اصطناعي.

19 يوليو 2026

صورة أشعة سينية للصدر معروضة على شاشة
نماذج الذكاء الاصطناعي

"ليست سباق المعايير هو النقطة الأهم": مسؤولون في WAIC يدفعون لإعادة التفكير في تقييم الذكاء الاصطناعي

مع تشبّع لوحات الصدارة القياسية وتلوّثها، جادل قادة الذكاء الاصطناعي في الصين بأن أداء المهام في العالم الواقعي — ومقاييس مثل "الوكلاء النشطين يوميًا" — ينبغي أن يحل محل المعايير الثابتة.

19 يوليو 2026

لوحة صدارة لمعايير نموذج ذكاء اصطناعي على شاشة