أطلقت Anthropic نموذج Claude Opus 5 يوم الجمعة مع طرحٍ يقوم عملياً على الحساب. فالنموذج يقترب إلى 0.5% من نظامها الحدّي، Claude Fable 5، في أحد أبرز معايير البرمجة — وذلك عند نصف تكلفة المهمة، وبالسعر نفسه الذي كان يفرضه سلفه تماماً. إذ تبقى تكلفة الإدخال عند $5 لكل مليون رمز والإخراج عند $25، من دون تغيير عن Opus 4.8؛ فيما تُسعَّر Fable 5 عند $10 و$50. ويصبح Opus 5 النموذج الافتراضي في Claude Max وأقوى خيار متاح في Claude Pro.
ما الذي تدّعيه ورقة المعايير
على Frontier-Bench v0.1، وهو تقييم Anthropic لهندسة البرمجيات، يتصدر Opus 5 جميع النماذج الأخرى ويُظهر أداءً يزيد على ضعف أداء Opus 4.8 عند تكلفة أقل للمهمة. وعلى CursorBench 3.2 عند أقصى جهد، يصل إلى داخل 0.5% من أعلى نتيجة لـ Fable 5 بنصف تكلفة المهمة، ويتفوق على كل نموذج آخر من حيث الأداء مقابل الدولار عند إعدادات الجهد العالي وxhigh وmax.



ويتكرر النمط خارج نطاق البرمجة:
- ARC-AGI 3، الذي يتطلب حل مسائل جديدة: نتيجة Opus 5 تبلغ ثلاثة أضعاف نتيجة النموذج التالي مباشرة.
- Zapier AutomationBench، الذي يقيس ما إذا كان النموذج يستطيع إنجاز مهمة أعمال من البداية إلى النهاية: معدل اجتياز أعلى بنحو 1.5× من أفضل نموذج تالٍ عند تكلفة المهمة نفسها — وحتى عند أدنى مستوى effort، ينجز Opus 5 مهام أكثر من أي نموذج آخر.
- OSWorld 2.0، وهو معيار لاستخدام الحاسوب: يتفوق على أفضل نتيجة لـ Fable 5 عند أكثر بقليل من ثلث التكلفة، ويتصدر كل نموذج عند أي نقطة سعرية معينة.



وتقول Anthropic أيضاً إنه يحقق أفضل النتائج وأكثرها كفاءة من حيث التكلفة في AA Coding Agent Index وGDPval-AA v2 وHLE وAutomationBench وDeepSearchQA. والمجال الوحيد الذي تعترف فيه صراحة بتراجعها هو الأمن السيبراني، حيث يظل Mythos 5 — النموذج المتاح بالدعوة فقط عبر Project Glasswing — متقدماً.



تفاصيل دقيقة تحت الرسم الرئيسي
تستحق الحاشية أسفل مخطط الجهد في Frontier-Bench القراءة. فهذه الأرقام تأتي من تشغيل داخلي على حزمة mini-SWE-agent مع خلفية GKE، مع احتساب النتيجة على أنها متوسط العائد عبر خمس محاولات لكل مهمة. وكلما رفض مصنف أمان طلباً خلال ذلك التشغيل — سواء على Opus 5 أو على Fable 5 — جرت الاستعاضة بـ Opus 4.8 كنموذج احتياطي، لذا فخطوط الرسم ليست بالمعنى الدقيق نتائج لنموذج واحد فقط.
بطاقة النتائج الكاملة — بما في ذلك ما يخسره
إن جدول المقارنة الخاص بـ Anthropic هو الأداة الأكثر فائدة في الإصدار، لأنه يوضح الموضع الذي يتوقف عنده Opus 5 عن الفوز. فهو يتصدر 9 من أصل 14 صفاً — لكن Fable 5 يحرز نسخة Humanity's Last Exam من دون أدوات، وتقسيم FrontierCode الخاص بالترميز، والمعيار القانوني؛ كما يتصدر OpenAI's GPT-5.6 Sol أحد تقييمات الترميز الوكيل بشكل واضح؛ فيما يحتفظ نموذج Anthropic المتاح بالدعوة فقط، Mythos 5، بالصدارة في الصحة. وكل الأرقام هنا من Anthropic نفسها، ولكل نموذج أفضل إعداد جهد لديه:

هناك أمران يبرزان من الجدول أكثر مما تبرزه الصياغة. ففي DeepSWE v1.1، وهو معيار للترميز، تتفوق نسبة 72.7% لـ GPT-5.6 Sol على كل نماذج Claude، بما فيها Opus 5. كما أن انتصارات Opus 5 العناوينية غير متوازنة بحسب الفئة: فهو يضاعف المجال بأكثر من الضعف في ARC-AGI-3 (30.2% مقابل 7.8%)، ويتقدم عليه بتسع نقاط في AutomationBench (26.0% مقابل 18.1%)، لكن في تقسيمات الترميز يقف الصف بأكمله ضمن نحو نقطة واحدة من بعضه البعض.
ثلاث مهام تقول Anthropic إن أي نموذج آخر لم يُنجزها
الجزء الأقوى في حجة Anthropic ليس الأرقام بل المثابرة. وهذه ثلاث أمثلة من تقييماتها واختباراتها المبكرة:
- عندما أُعطي رسماً لقطعة آلية وطُلب إعادة بنائها على هيئة نموذج 3D FreeCAD — من دون أي طريقة لعرض الرسم مباشرة — كتب Opus 5 مسار رؤية حاسوبية خاصاً به لاستخراج الهندسة من البكسلات الخام، ثم أعاد بناء القطعة كاملة. وقد فعل ذلك مراراً. وتقول Anthropic إن أي نموذج منافس بالإعداد نفسه لم يحل المسألة في خمس محاولات.
- وعندما أُعطي خطأً حقيقياً في حزمة إدارة مفتوحة المصدر شائعة، وجد السبب الجذري وأصلح حالة حدّية كانت الرقعة التي وضعها المجتمع نفسه قد أغفلتها. أما نموذج منافس فأصلح العرض السطحي فقط، ثم أبلغ أن الخطأ قد حُل.
- واستخدمه مهندس في شركة تداول لبناء تغذية بيانات سوق لبورصة جديدة في جلسة واحدة — وهو عمل لم تستطع النماذج السابقة إنجازه إطلاقاً، حتى مع تزويدها بخطط واسعة. ولأنه لم يجد موجزاً مباشراً للتحقق منه، بنى نموذج الاختبار الخاص به ليتأكد من أن برمجته تفسر بيانات البورصة على نحو صحيح.
ما الذي قاسه العملاء الأوائل فعلياً
نشرت Anthropic 22 شهادة من عملاء الوصول المبكر، ويحمل عدد غير معتاد منها أرقاماً صريحة:
- Ben Kus، الرئيس التنفيذي للتكنولوجيا في Box: يتفوق Opus 5 على Opus 4.8 بنسبة 8% إجمالاً، مع مكاسب 11% في تحليل البيانات و17% في العناية الواجبة.
- Fabian Hedin، الشريك المؤسس في Lovable: زيادة 22% فوق Opus 4.7 في أصعب مهام الترميز الوكيل لدى الشركة، و"أكثر ثباتاً، مع تباين أقل بكثير من تشغيل إلى آخر".
- Wade Foster، الرئيس التنفيذي في Zapier: تصدّر Opus 5 AutomationBench "من دون استهلاك رموز أكثر من نماذج Claude السابقة." وفي سير عمل لمنع فقدان العملاء أخفقت فيه النماذج السابقة تماماً، بلغ 100%.
- أفاد فريق قانوني للذكاء الاصطناعي بجودة مماثلة عند مستويات استدلال أقل، مع توليد 26% أقل من الرموز مقارنة بـ Opus 4.8 عند أقصى استدلال. وقاس مسؤول تقييمات مالية دقة أعلى بـ 9 نقاط مئوية مع عدد أقل بمقدار الثلث من الجولات واستدعاءات الأدوات و60% وقت أقل. وسجّل معيار تداول أفضل نتيجة على الإطلاق لـ Opus باستخدام نحو سُبع رموز الاستدلال وأقل من نصف زمن الاستجابة لـ Opus 4.8.
- قال Scott Wu، الرئيس التنفيذي في Cognition، إنه "يقترب من أداء مستوى Fable بنصف التكلفة" داخل Devin، مع قوة خاصة في تصحيح الأخطاء وتحليل السبب الجذري. ووصف Madhav Jha، الرئيس التنفيذي للتكنولوجيا في Vercel، النموذج بأنه "أكبر قفزة في عائلة Opus منذ 4.5."
وأحد التقارير يقدّم لمحة عمّا يتجه إليه الترميز الوكيل: فقد قال فريق معيار للواجهة الأمامية إن النموذج فتح صفحاته الخاصة في متصفح بعرض سطح المكتب والهاتف، والتقط منتجاً مخفياً أسفل الجزء الظاهر في الهاتف وزراً لإتمام الشراء خارج إطار الشاشة، ثم أصلح الاثنين قبل تسليم العمل مرة أخرى.
الكيمياء والبروتينات ونفق رياح
يتفوق Opus 5 على Opus 4.8 في كل تقييمات Anthropic الداخلية لعلوم الحياة، والتي تمتد إلى الأحياء البنيوية والكيمياء العضوية والمعلوماتية الحيوية. وتتمثل أكبر المكاسب في +10.2 نقطة مئوية في مهام الكيمياء العضوية مثل استنتاج البنى الجزيئية من بيانات التحليل الطيفي، و+7.7 نقاط في أعمال البروتينات مثل التنبؤ بكيفية تغيير التنوعات في تسلسل ما لوظيفته. كما تعرض Anthropic مخرجات بصرية أقوى، بما في ذلك محاكاة تفاعلية لنفق رياح بناها النموذج لتصوير تدفق الهواء فوق أجسام انسيابية — وأخرى غير انسيابية عمداً.
النموذج الأكثر مواءمة الذي راجعته Anthropic
في التدقيق السلوكي الآلي الذي تجريه الشركة، سجل Opus 5 2.3 في السلوك غير المتوافق إجمالاً، وهو الأدنى بين نماذجها الحديثة. وتقول Anthropic إنه يلتزم بـ دستور Claude أفضل من Opus 4.8 أو Sonnet 5 أو Fable 5، ويُظهر أدنى معدلات السلوك الخادع، وهو الأقل قابليةً لأن يُخدع إلى سوء استخدام، وهو حتى الآن أكثر نماذجها أماناً في تجنب الأفعال المتهورة ذات الآثار الجانبية الصعبة الرجوع.
قوي في اكتشاف الثغرات، ومكبَّل في استغلالها
تقول Anthropic إن Opus 5 لا يدفع حدود القدرات عالية المخاطر مزدوجة الاستخدام، وإنه في تقييمات أُجريت مع شركاء من القطاع الخاص والحكومة لا يزال خلف Mythos 5 في كل من أبحاث البيولوجيا والهجمات السيبرانية. وكما كان الحال مع Opus 4.8، تقول الشركة إنها تجنبت عمداً تدريب Opus 5 على مهام سيبرانية — ومع ذلك تحسن فيها، ببساطة كنتيجة جانبية لازدياد قدرته العامة. وهو يقترب الآن من Mythos 5 في العثور على الثغرات البرمجية.
أما الفجوة التي يحتفظ بها فتظهر في النصف الثاني من تلك السلسلة. ففي OSS-Fuzz، وهو تقييم داخلي لمدى قدرة النموذج على العثور على الثغرة ثم استغلالها من دون إرشاد بشري كبير، يضاهي Opus 5 Mythos 5 في تحديد الثغرة لكنه يتأخر بشكل كبير في تطوير الاستغلال — وهي الخطوة التي تحول الخطأ البرمجي إلى تهديد سيبراني مادي.
كيف تعمل الضمانات فعلياً
تسمح مرشحات الأمن السيبراني في Opus 5 بـالعثور على الثغرات في الشيفرة المصدرية لكنها تحظر فحص الثغرات القائم على الثنائيات — وهي طريقة تربطها Anthropic أكثر بالجهات الخبيثة — إلى جانب اختبار الاختراق وتوليد الاستغلالات. وبناءً على اختبارات الشركة نفسها، تتوقع أن تتدخل تلك المرشحات بنحو 85% أقل مما تفعله مرشحات Fable 5. وفي Claude.ai وClaude Code وClaude Cowork، تُعاد الطلبات المصنفة افتراضياً إلى Opus 4.8، ويمكن تفعيل الإرجاع نفسه عبر API. أما المؤسسات والباحثون الموجودون بالفعل داخل Cyber Verification Program الخاص بـ Anthropic فيحصلون على وصول فوري إلى نسخة بقيود أقل.
وفي البيولوجيا ينعكس الاتجاه. فبما أن Opus 5 يحمل تقريباً مجموعة الضمانات نفسها التي يحملها Opus 4.8 بدلاً من تلك الخاصة بـ Fable 5، فإنه أصبح الآن أكثر نماذج Anthropic المتاحة للعامة قدرةً على البحث العلمي — كما أن طلبات البيولوجيا التي تُحظر على Fable 5 ستُحال الآن إلى Opus 5 بدلاً من Opus 4.8. ومع ذلك، ما تزال الشركة تشير إلى حدود في البحث الذاتي الطويل الأمد، وهو المجال الذي تعتبره الأعلى خطورة، حيث تقول إن Mythos 5 يظل أقوى.
ما الذي يتعين على المطورين تغييره
هذا ليس مجرد تبديل مباشر لسلسلة النموذج. فهناك تغييران يكسِران التوافق:
- التفكير التكيفي مفعّل افتراضياً. كان Opus 4.8 يعمل من دون تفكير ما لم يُطلب ذلك؛ أما Opus 5 فيفكر ما لم يُقل له خلاف ذلك — وبما أن
max_tokensحدٌّ أقصى مشترك للتفكير والنص الظاهر معاً، فإن الميزانيات الحالية تحتاج إلى مراجعة. - لا يمكن إيقاف التفكير إلا عند مستوى
highأو أدنى. إن الجمع بينthinking: {"type": "disabled"}وxhighأوmaxيُرجع الآن خطأ 400.
إضافة إلى ذلك، ينخفض الحد الأدنى للمطالبة القابلة للتخزين المؤقت إلى 512 رمزاً بدلاً من 1,024، ما يعني أن المطالبات القصيرة التي لم يكن من الممكن تخزينها مؤقتاً سابقاً أصبحت ممكنة الآن، من دون أي تغيير في الشيفرة. وتصدر ميزتان في نسخة تجريبية: تغيير الأدوات أثناء المحادثة، الذي يتيح للمطورين إضافة أدوات أو سحبها بين الجولات من دون إبطال ذاكرة التخزين المؤقت للمطالبة (الترويسة mid-conversation-tool-changes-2026-07-01)، والإرجاعات التلقائية، التي تعيد توجيه الطلبات المصنفة أمنياً إلى نموذج آخر بدلاً من إرجاع رفض (fallbacks: "default"، الترويسة server-side-fallback-2026-07-01).
ولا تنتقل ميزتان أخريان: أداة web fetch غير متاحة في Opus 5، وميزة Priority Tier غير مدعومة. كما أن الإكمال المسبق في رسالة المساعد وقيم temperature أو top_p أو top_k غير الافتراضية لا تزال تُرجع أخطاء 400، كما كان الحال في Opus 4.8. وتحذر Anthropic أيضاً من أن الردود الافتراضية تعمل أطول مما كانت عليه في Opus 4.8، وأن خفض الجهد يقلص التفكير من دون أن يختصر المخرجات المرئية بصورة موثوقة — لذا اطلب الإيجاز بدلاً من ذلك. ونصيحتها بشأن الجهد هي إجراء جولة جديدة كاملة بدلاً من نقل إعدادات Opus 4.8 مباشرة، لأن low وmedium أقوى بشكل ملموس في هذا الجيل.
ورقة المواصفات
يحافظ Opus 5 على نافذة سياق قدرها 1M رمز و128k كحد أقصى للإخراج — حتى 300k عبر النسخة التجريبية للمخرجات الموسعة في Batch API — ويدعم جميع مستويات الجهد الخمسة: low وmedium وhigh (الافتراضي) وxhigh وmax. وتمتد بيانات تدريبه حتى مايو 2026، أي أحدث بأربعة أشهر من حد Fable 5 الزمني في يناير 2026. ويعمل Fast mode بسرعة تقارب 2.5× من السرعة الافتراضية مقابل ضعف السعر الأساسي، على Claude Platform وعبر أرصدة الاستخدام في Claude Code. ويستدعيه المطورون باسم claude-opus-5 على Claude API؛ كما يُعرض أيضاً على Amazon Bedrock وClaude Platform on AWS وGoogle Cloud وMicrosoft Foundry. وكما في نماذج Opus السابقة، لا يفرض الوصول العام أي متطلبات للاحتفاظ بالبيانات. وتشير وثائق Anthropic الآن أيضاً إلى مستخدمي Claude Opus 4.1 المتوقف — الذي سيُسحب في 5 أغسطس 2026 — إلى Opus 5 كوجهة للهجرة.
