في جلسة AI 1 في Hot Chips يوم الثلاثاء، قدّم مهندسان من Nvidia Groq 3 LPU — ثم أوضحا أن Nvidia لا تصنعه. الأجزاء التي تدخل في رفوف جيل Vera Rubin تُشترى من Groq، التي تستوعبها Nvidia في ما وصفته المحاضرة بأنه acquihire أوسع نطاقًا.

الأرقام، ومقامها الحقيقي

يوفر رف يضم 256 LPU أداءً يبلغ 315 PFLOPS من FP8، ويحمل 128 GB من SRAM، ويحقق 40 PB/s من إجمالي عرض نطاق SRAM، مع تشغيل 11,000 رمز فك ترميز في الثانية على نموذج يضم 31 مليار معلمة. ولم يُكشف عن TDP الخاص بكل LPU أو عن عقدة التصنيع.

ما الذي يخطئ فيه الإطار الشائع

كل رقم بارز هنا على مستوى الرف وسيُقرأ على أنه على مستوى الشريحة. عبارة "128 GB of SRAM" توحي بأنها ذاكرة مخبأة ضخمة على الرقاقة؛ لكن عند تقسيمها على 256 تكون نحو نصف غيغابايت لكل LPU، من دون أي HBM على الإطلاق — وهو المقايضة المعروفة لدى Groq، لا مفاجأة، لكنه يعني أن النموذج يجب أن يُجزأ على مئات الشرائح ليلائم المنظومة. ولا يمكن لرف بسعة 128 GB أن يستوعب نموذجًا كبيرًا مع ذاكرة KV cache بالطريقة التي تستطيعها شريحة واحدة بسعة 216 GiB من HBM4. أما "40 PB/s" فهو الحساب نفسه المطبق على عرض النطاق: مجموع 256 مصفوفة SRAM منفصلة، من دون أن يقول شيئًا عن سرعة انتقال البيانات بين الشرائح، وهو القيد الحاسم في تصميم يعتمد على SRAM فقط. و315 PFLOPS هي ذروة FP8، فيما جرى عرض معدل الرموز على نموذج 31B — صغير بمعايير 2026، ومصمم ليتناسب مع ميزانية SRAM.

التشويه الثاني هو تشويشٌ مؤسسي

هذا ليس "LPU من Nvidia". تقول المحاضرة رسميًا إن Nvidia لا تنتجه حاليًا، وإن لديها منتجًا خاصًا بها قيد التطوير، وإنها تشتري هذه الشرائح من Groq. تقديم هذا الأمر على أنه إطلاق منتج من Nvidia يقلب ما قيل فعليًا على المسرح.

لماذا قد تفعل Nvidia ذلك أصلًا

الـ GPU الكثيفة ليست الشكل المناسب لفك الترميز منخفض الكمون: فالمهمة مقيدة بالذاكرة، وأحجام الدُفعات صغيرة، وكمون HBM هو العامل الغالب. والبنية المعتمدة على SRAM فقط تستهدف هذا بالضبط. وقوف Nvidia على منصة مؤتمر لتقديم إجابة منافسها — بينما تشتري الشرائح وتستقطب الفريق — هو إقرار أوضح بالفجوة من أي شريحة في خارطة طريق.