أطلقت AMD ROCm 10 في 27 أغسطس عند الساعة 15:09 بالتوقيت العالمي المنسق، وأتاحت ROCm.AI — Hyperloom وAMD Skills وROCm CLI — بشكل عام. والادعاء الرئيسي: «يوفّر نظام مهيأ بـ ROCm.AI تحسنًا متوسطه 3.3x في الاستدلال وتحسنًا 2.4x في التدريب مقارنةً بـ ROCm 7 على العتاد نفسه.»
ما تقوله الحاشية
تنص الحاشية MI350-81، في الصفحة نفسها، على الآتي: «اختبارات أجرتها AMD Performance Labs اعتبارًا من 7 يوليو 2026 … منصة AMD Instinct MI355x 8x GPU وبرنامج AMD ROCm 7.0 مقابل نظام مُهيأ على نحو مماثل يستخدم إصدار معاينة من AMD ROCm.ai (ROCm 7.2.2 مع تحسينات مثل Optimized Kernels وParallelism وScheduling) أثناء تشغيل نماذج GLM-5 وKimi-K2.5 وDeepSeekk-R1-0528. ويُعبَّر عن الارتفاع المعلن في الأداء بوصفه متوسط TPS مجمعًا عبر النماذج الثلاثة (3) التي خضعت للاختبار.» وتحمل حاشية التدريب، MI350-82، التاريخ نفسه في مواجهة Megatron-LM على DeepSeek-V2-Lite وDeepSeek-V3-16B وQwen3-30B-A3B.
ما الذي شُحن فعليًا
يوصف Hyperloom بأنه «نظام وكيل مستقل لتحسين أعباء عمل الاستدلال من البداية إلى النهاية»، مع دعم vLLM وSGLang واستهداف HIP وTriton وFlyDSL. وتُطرح AMD Skills في أسواق Claude Code وCursor وCodex، إضافة إلى فهرس مفتوح على GitHub. وهذه هي النقطة الجديدة فعلًا: تستخدم AMD الوكلاء لضبط النوى بدلًا من انتظار عمل المترجم.
أين يخطئ الإطار الشائع
سيقرأ كل عنوان: «ROCm 10 أسرع 3.3x». لكن الحواشي نفسها من AMD تناقض ذلك بثلاثة أوجه. لم يُقَس 3.3x على ROCm 10 — بل على ROCm 7.0 مقابل إصدار معاينة من ROCm 7.2.2، وتم هذا القياس قبل سبعة أسابيع من هذا الإصدار. كما أنه ليس 3.3x مقارنةً بـ Nvidia: فخط الأساس هو برمجيات AMD نفسها قبل عام على العتاد MI355X نفسه، ما يجعل الرقم يقيس مقدار الأداء الذي كانت AMD تتركه على الطاولة، لا موقعًا تنافسيًا. وهو أيضًا متوسط مجمع عبر ثلاثة نماذج بالضبط، وليس تسريعًا عامًا. وهناك تحفّظ آخر يستحق الإشارة: ROCm CLI، أحد الأعمدة الثلاثة في ROCm.AI «المتاح بشكل عام»، مُصنَّف بوصفه Technology Preview، ولا يدعم ROCm 10 رسميًا بعد — «بدءًا من برنامج ROCm 7.13، على أن يأتي الدعم الرسمي لـ ROCm 10 قريبًا».
