
أصدرت شركة Anthropic مؤخرًا نموذجها الجديد Claude Opus 4.8، الذي يُعد الأكثر كفاءة ضمن النماذج المتاحة للعامة. يركز هذا الإصدار على تحسينات جوهرية في البرمجة، والاستدلال، والمهام الوكيلة، والصدق، مما يجعله أداة قوية للمطورين والمؤسسات.
تحسينات جوهرية في الصدق والأداء
يُظهر نموذج Opus 4.8 تحسنًا ملحوظًا في الصدق، حيث أصبح أقل احتمالًا بأربع مرات من سابقه للسماح بمرور أخطاء في الشيفرة دون الإشارة إليها.
هذه القدرة على اكتشاف الأخطاء الذاتية والاعتراض على الخطط غير المنطقية تعزز موثوقيته في المهام المستقلة.
فيما يتعلق بالمهام الوكيلة، يُعد Opus 4.8 النموذج الوحيد الذي أكمل جميع الحالات في اختبار Super-Agent الخاص بـ Anthropic، متفوقًا على نماذج Opus السابقة و GPT-5.5.
كما يتفوق في اختبار CursorBench، مستخدمًا خطوات أقل لاستدعاء الأدوات لتحقيق نفس مستوى الذكاء.
يُعد النموذج الأقوى الذي اختبرته Anthropic في استخدام وكلاء الحاسوب والمتصفح، مسجلًا 84% في Online-Mind2Web.
كما أصبح أقل ميلًا لتخطي عملية استدعاء أداة يتطلبها سير المهمة، وهي مشكلة كانت موجودة في الإصدارات السابقة.
تظل التتبعات الطويلة في المهام الوكيلة مركزة على الهدف، مع عدد أقل من الانحرافات حتى بعد ضغط السياق.
وعند تفعيل التفكير التكيفي، يقرر Opus 4.8 في كل خطوة ما إذا كانت الحاجة إلى الاستدلال قائمة، مما يقلل من الرموز المهدرة مقارنةً بـ Opus 4.7.
ميزات جديدة وقدرات تشغيلية
يقدم Claude Opus 4.8 ميزة التحكم في الجهد، حيث يمكن للمستخدمين اختيار مقدار الجهد الذي يبذله النموذج في الاستجابة عبر مستويات (منخفض، افتراضي، إضافي، أقصى).
يوصى بإعداد «إضافي» للمهام الثقيلة والتدفقات غير المتزامنة طويلة الأمد.
يتوفر الوضع السريع لـ Opus 4.8 كتجربة بحثية على واجهة Claude API، ويقدم ما يصل إلى 2.5 ضعف رموز الإخراج في الثانية الواحدة.
كما أنه أقل تكلفة بثلاث مرات مقارنة بالوضع السريع للنماذج السابقة لـ Opus.
تسمح واجهة Messages API الآن بإدخالات role: "system" ضمن مصفوفة الرسائل، مما يتيح تحديث تعليمات النموذج أثناء تنفيذ المهمة دون كسر ذاكرة التخزين المؤقت للموجه.
هذه الميزة مفيدة لتغيير الأذونات أو سياق البيئة لوكيل قيد التشغيل.
انخفض الحد الأدنى لطول الموجه القابل للتخزين المؤقت إلى 1,024 رمزًا، مما يسمح للموجهات الأقصر بإنشاء إدخالات تخزين مؤقت دون تعديل في الشيفرة.
توسعت ميزة "سير العمل الديناميكي" (dynamic workflows) في وصول مبكر للمطورين، لتشمل مشاريع Claude Code الضخمة.
يقوم الوكيل بتخطيط العمل، ويطلق مئات الوكلاء الفرعيين بالتوازي، ثم يتحقق من المخرجات قبل تقديم النتيجة النهائية.
التسعير والأداء في العالم الحقيقي
يظل تسعير Claude Opus 4.8 كما هو عليه في Opus 4.7، حيث يبلغ 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج.
أما الوضع السريع، فيُسعّر بـ 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج.
يتفوق Opus 4.8 في المجالات التي تتطلب استقلالية طويلة المدى، مثل وكلاء البرمجة، ووكلاء البحث، وسير العمل القانوني، وأعمال المعرفة في المؤسسات.
بعد استخدام النموذج في مهام وكلاء البرمجة، يلاحظ قدرته على تخطيط العمل وإطلاق وكلاء فرعيين.
في سيناريوهات تتطلب استقلالية طويلة المدى، أظهر Opus 4.8 تركيزًا عاليًا على الهدف.
وعند التعامل مع مشكلات معقدة، يتبنى النموذج تحليلًا عميقًا قبل تقديم الإجابة، مما يقلل من الرموز المهدرة.
معايير الأداء والتحفظات
وثّقت Anthropic مقياسًا داخليًا يشير إلى أن Opus 4.8 يُظهر معدلات سلوك غير محاذية (مثل الخداع أو التعاون في إساءة الاستخدام) أقل بكثير من Opus 4.7، وقريبة من نموذجها الأكثر توافقًا، Claude Mythos Preview.
ومع ذلك، فإن مقياس "أقل احتمالًا بأربع مرات" هو إعلان ذاتي من Anthropic، وقد تم إنتاجه بواسطة فريق Alignment الداخلي، ويعتمد على بروتوكول لم يتم نشره أو يمكن إعادة إنتاجه خارجيًا.
تشير أعمال مستقلة سابقة، مثل دراسة Aithos AI Research Foundation في فبراير 2026 حول Opus 4.6، إلى أن "السيناريوهات المنشورة تُظهر توافقًا شبه مثالي لنماذج Claude الحديثة، ولكن الاضطرابات تكشف عن ثغرات امتثال مستمرة".
هذا يثير تساؤلات حول مدى كفاية المقياس الرباعي المعلن ذاتيًا.
تعتمد معظم معايير الأداء الأخرى المعلنة، مثل Super-Agent Benchmark وLegal Agent Benchmark وCursorBench، على بروتوكولات ملكية غير منشورة.
فقط معيار Online-Mind2Web، الذي سجل فيه النموذج 84%، هو معيار أكاديمي عام، لكن ورقته المرجعية تدعو إلى التعامل بحذر مع الدرجات العالية لوكلاء الويب.
نظرة مستقبلية: نماذج فئة Mythos
أشارت Anthropic أيضًا إلى فئة جديدة من النماذج ذات "ذكاء أعلى من Opus"، تُعرف باسم Mythos.
تُستخدم حاليًا نسخة معاينة من Claude Mythos Preview من قبل عدد قليل من المؤسسات في أعمال الأمن السيبراني ضمن مشروع Glasswing.
تخطط الشركة لإتاحة نماذج فئة Mythos لجميع العملاء خلال الأسابيع القادمة، بمجرد اكتمال إجراءات الأمان والضمانات المعززة.
المواصفات التقنية الرئيسية
| الميزة | التفاصيل |
|---|---|
| معرف API | claude-opus-4-8 |
| نافذة السياق | 1 مليون رمز |
| الحد الأقصى للإخراج | 128 ألف رمز |
| سعر الإدخال (قياسي) | 5 دولارات لكل مليون رمز |
| سعر الإخراج (قياسي) | 25 دولارًا لكل مليون رمز |
| سعر الإدخال (الوضع السريع) | 10 دولارات لكل مليون رمز |
| سعر الإخراج (الوضع السريع) | 50 دولارًا لكل مليون رمز |
المميزات والعيوب
المميزات
- أقل احتمالًا بأربع مرات لتمرير أخطاء الشيفرة دون ملاحظة.
- يكتشف أخطاءه بنفسه ويعترض على الخطط غير المنطقية.
- أكمل جميع الحالات في اختبار Super-Agent الخاص بـ Anthropic.
- يتفوق على إصدارات Opus السابقة في CursorBench بخطوات أقل.
- أقوى نموذج في استخدام الحاسوب ووكلاء المتصفح (84% في Online-Mind2Web).
- أقل ميلًا لتخطي استدعاء الأدوات.
- تظل التتبعات الطويلة مركزة على الهدف.
- التفكير التكيفي يقلل الرموز المهدورة.
- وضع سريع يوفر 2.5x رموز إخراج أكثر في الثانية وبتكلفة أقل.
- يدعم إدخالات role: "system" في Messages API لتحديث التعليمات ديناميكيًا.
- انخفاض الحد الأدنى لطول الموجه القابل للتخزين المؤقت إلى 1,024 رمزًا.
- نفس تسعير Opus 4.7 مع أداء أفضل.
- أداء ممتاز في الاستقلالية طويلة المدى (وكلاء البرمجة، البحث، القانون، أعمال المعرفة).
- معدلات سلوك غير محاذية أقل بكثير من Opus 4.7.
العيوب
- مقياس "أقل احتمالًا بأربع مرات" هو إعلان ذاتي من Anthropic، والبروتوكول غير منشور وغير قابل لإعادة الإنتاج خارجيًا.
- أعمال مستقلة سابقة أشارت إلى "ثغرات امتثال مستمرة" في نماذج Claude الأقدم عند الاضطرابات.
- معظم معايير الأداء الأخرى تعتمد على بروتوكولات ملكية غير منشورة.
- الورقة المرجعية لمعيار Online-Mind2Web تدعو إلى التعامل بحذر مع الدرجات العالية على وكلاء الويب.
لمن يصلح؟
يُعد Claude Opus 4.8 خيارًا مثاليًا للمطورين الذين يبنون تطبيقات وكيلة معقدة تتطلب استقلالية عالية ودقة في التعامل مع الشيفرة والمهام المتعددة.
كما يناسب المؤسسات التي تحتاج إلى أتمتة سير العمل القانوني، وأعمال المعرفة، ووكلاء البحث والبرمجة على نطاق واسع.
أما بالنسبة للمستخدمين الذين يبحثون عن حلول بسيطة أو لا يحتاجون إلى هذه المستويات المتقدمة من الاستدلال والوكالة، فقد تكون النماذج الأقل تكلفة كافية لاحتياجاتهم.