OpenAI أطلقت معاينة محدودة لـ Ultrafast في 13 أغسطس، وهو نمط خدمة مُسرَّع لـ GPT-5.6 Sol تقول الشركة إنه يعمل بسرعة تصل إلى 14x مقارنةً بالاستدلال القياسي، ويبلغ حتى 750 رمزًا مخرَجًا في الثانية.

الجزء الجديد

تأتي هذه الزيادة في السرعة من شراكة مع Cerebras. أما أسطول الخدمة لدى OpenAI فيعتمد بخلاف ذلك على Nvidia، وهذه هي المرة الأولى التي تُشغّل فيها الشركة علنًا نموذجًا متقدّمًا على مُسرّع تابع لمورّد آخر وعلى نطاق إنتاجي. وتبني Cerebras معالجات على مستوى الرقاقة الكاملة تحتفظ بأوزان النموذج في ذاكرة على الشريحة، ولهذا كانت أرقام الاستدلال لديها سريعة دائمًا — وكان السؤال المفتوح هو ما إذا كان مختبر متقدّم سيطرح نموذجًا عليها.

ما الذي يغيّره 750 رمزًا في الثانية

عند سرعات النماذج المتقدّمة القياسية، تُقاس الرحلة الطويلة للوكيل بالدقائق. وعلى هذه الوتيرة، يُنجز النموذج فقرة أسرع مما يقرؤها الإنسان، ما ينقل فئات كاملة من المنتجات من نمط غير متزامن إلى نمط تفاعلي. وذكرت OpenAI الاستجابة للحوادث، وخدمة العملاء، والتحليل المالي، والتجارة الإلكترونية — وكلها حالات تكون فيها مدة الانتظار، لا الجواب، هي القيد.

القيود كما وردت

هذه معاينة لـ مجموعة مختارة من العملاء، وقد قالت OpenAI إنها ستوسّع الوصول "مع نمو السعة" — وهو إقرار بأن سعة Cerebras، لا الطلب، هي ما يحدّ السقف. ولم تُعلن أي تسعيرة، كما أن رقمي 14x و750 هما حدّان أعلى لا معدل تشغيل مستمر.

لماذا يهم هذا أبعد من زمن الاستجابة

على مدى عامين، سعى كل مشتري كبير للاستدلال إلى تأمين مصدر ثانٍ. وتشغيل مختبر متقدّم لنموذجه الرئيسي على عتاد غير تابع لـ Nvidia هو أقوى دليل عملي حتى الآن على أن الشرائح البديلة تصلح لشيء يتجاوز القياسات المعيارية.