أعلنت Nvidia عن TensorRT-LLM v1.3.0rc25 في 31 أغسطس عند 03:24:43 UTC. والتغيير الأوسع أثرًا هو أن KV cache manager V2 أصبح الخيار الافتراضي لما يقرب من 21 عائلة من النماذج. ويصنَّف الإصدار على أنه نسخة ما قبل الإطلاق، وهي نقطة تخفيف هنا — لكن الملاحظات ما زالت تتناقض داخليًا مع نفسها.

ادعاء بلا رقم يسنده

المبرر المقدم لاعتماد V2 افتراضيًا هو تحسين قابلية التوسع والاستقرار. ولا توجد نقطة مرجعية، ولا معيار قياس، ولا رقم للإنتاجية، ولا مقارنة لبصمة الذاكرة، ولا عبء عمل محدد بالاسم. وبالنسبة إلى مكوّن يحدد كيفية تخصيص ذاكرة التخزين المؤقت للانتباه عبر أسطول من خوادم الخدمة، فإن القول إنه "أكثر استقرارًا" من دون قياس ليس ادعاءً هندسيًا يمكن للمشغّل أن يبني عليه.

الصفحة نفسها تناقض ذلك

تتضمن ملاحظات الإصدار قسم Known Issues، ويظهر فيه KV cache manager V2 مرارًا — بما في ذلك ملاحظة تفيد بأن مجدول V2 قد يتعطل بشكل متقطع أو ينفد منه الذاكرة على B200، الشريحة الرائدة الحالية لدى Nvidia. لذا فالمكوّن الذي رُوّج له بوصفه افتراضيًا لأسباب تتعلق بالاستقرار موثَّق، على الصفحة نفسها، على أنه قد يتسبب في أعطال على أحدث العتاد وأكثره احتمالًا لتشغيله. قد يكون كلا الأمرين صحيحًا — فقد يكون V2 أفضل إجمالًا ومع ذلك يظل لديه خلل مفتوح في المجدول — لكن الملاحظات لا توضح الصلة بينهما، والقارئ الذي يكتفي بالعناوين يطالع فقط الجانب الأول.

ما الخطأ في الإطار الشائع

تتعامل ملخصات ملاحظات الإصدار مع كلمة "افتراضي" بوصفها إشارة إلى النضج: إذا فعّله المورّد، فلا بد أنه جاهز. لكن هذا الاستنتاج لا يصح في القنوات ما قبل الإطلاق. جعل شيء ما افتراضيًا هو وسيلة المشروع لاكتساب تغطية اختبارية، وهذا هو المقصود من الإصدارات الموسومة بـ rc. والخطأ هنا هو قراءة اعتماد افتراضي في نسخة مرشحة للإطلاق على أنه توصية للإنتاج — والقراءة الصادقة لهذه النسخة هي أن Nvidia توسّع نطاق التعرض إلى V2 تحديدًا لأنه لا يزال يحوي مشكلات مفتوحة.

ما الذي ينبغي على المشغّل فعله

اقرأ Known Issues قبل العناوين، وثبّت KV cache manager السابق إذا كنت تقدّم الخدمة على B200 إلى أن تتضح ملاحظات المجدول. يوجد مخرج بديل؛ إلا أن الإصدار لا يبدأ بذكر أنك قد تحتاج إليه.