Claude Opus 5 والتحكم في الجهد: حوسبة إضافية فقط عندما تستحق المهمة

مراجعة Claude Opus 5 العملية: السعر، ومستويات الجهد الخمسة، وتكلفة المهمة الناجحة، وخطوات الترحيل من Opus 4.8، وكيف تختار مسار الإنتاج الأنسب.

Thursday, September 3, 2026Omid Saffari
Claude Opus 5 والتحكم في الجهد: حوسبة إضافية فقط عندما تستحق المهمة

بسعر $5 لكل مليون token من المدخلات و$25 لكل مليون token من المخرجات، يكلّف Claude Opus 5 نصف تكلفة Fable 5، ولا تفصله سوى 0.5% عن أفضل نتيجة حققتها Fable في CursorBench عند ضبط الجهد على max. لذلك يصبح Opus 5 الخيار الافتراضي للعمل اليومي الجاد؛ فالميزة الأهم هنا ليست اسم النموذج، بل أداة التحكم الجديدة في الجهد عبر خمس درجات.

Claude Opus 5 هو نموذج Anthropic الممتاز للبرمجة المعقدة والوكلاء وأعمال المؤسسات. أُطلق في 24 يوليو 2026 بوعد بسيط: تقديم قدر كبير من إمكانات Fable 5 بسعر Opus السابق.

صفحة إطلاق Claude Opus 5 من Anthropic
Claude Opus 5

الترقية من Opus 4.8 سهلة من ناحية السعر، لكن اعتماد النموذج في بيئة الإنتاج ليس تلقائياً بالقدر نفسه. فالتفكير يعمل الآن افتراضياً، ومستوى الجهد يغيّر حجم العمل الذي يؤديه النموذج في النصوص والأدوات، كما أن حداً قديماً للمخرجات قد يوقف المهمة قبل اكتمال الاستدلال.

Claude Opus 5 هو النموذج الممتاز للعمل اليومي، لا السقف المطلق

استخدم Opus 5 للمهام الصعبة التي تتكرر كل يوم، وSonnet 5 عندما تكون الأولوية للحجم وزمن الاستجابة. أما Fable 5 فاحتفظ به لمهمة أخفقت بالفعل في تقييم باستخدام Opus، وكانت كلفة ذلك الإخفاق أعلى من علاوة tokens البالغة 2x.

هذا الترتيب هو أيضاً الطريقة التي تعرض بها Anthropic مجموعتها الآن. إذ يوصي دليل النماذج الحالي المطورين المترددين بالبدء مع Opus 5 في البرمجة المعقدة المعتمدة على الوكلاء وأعمال المؤسسات، ثم الانتقال إلى Fable 5 عند الحاجة إلى أعلى قدرة متاحة.

النموذجالاستخدام الأنسبالإدخال / الإخراج لكل مليون tokenالقيد الرئيسي
Fable 5أصعب مهام الوكلاء طويلة التشغيل$10 / $50السعر الأعلى
Opus 5البرمجة اليومية المعقدة وأعمال المؤسسات$5 / $25تكلفة الفئة الممتازة من دون بلوغ سقف Fable الكامل
Sonnet 5البرمجة والوكلاء بأحجام كبيرة$2 / $10 حتى 31 أغسطسسقف أدنى في أصعب المهام
Haiku 4.5المهام البسيطة الحساسة لزمن الاستجابة$1 / $5سياق 200k ومخرجات 64k

يملك Opus 5 نافذة سياق بسعة 1 مليون token، وحداً أقصى للمخرجات المتزامنة يبلغ 128,000 token. نافذة السياق هي المادة التي يستطيع النموذج إبقاءها في نطاق نظره خلال طلب واحد، وليست ضماناً بأن يمنح كل token القدر نفسه من الانتباه. ويشمل حد المخرجات كلاً من التفكير الخفي والإجابة الظاهرة، وهي نقطة تصبح مهمة عند الترحيل.

معرّف النموذج هو claude-opus-5. وهو متاح عبر Claude API وAmazon Bedrock وGoogle Cloud وMicrosoft Foundry. وفي تطبيق Claude، جعلته Anthropic النموذج الافتراضي في Max وأقوى نموذج متاح في Pro.

هذه ليست قائمة ترتيب دائمة، بل سياسة توجيه تستطيع الصمود أمام الإصدار التالي من النماذج، لأن كل انتقال فيها يستند إلى دليل من حمل العمل نفسه، لا إلى الولاء لفئة بعينها.

العبرة في نتائج الاختبارات هي تكلفة كل مهمة ناجحة

النتيجة المفيدة في اختبارات Opus 5 ليست أنه يتصدر كل شيء، بل أنه كثيراً ما يصل إلى النتيجة المقبولة نفسها بتشغيل أقل تكلفة.

تنشر Anthropic خمس نتائج ترسم ملامح القرار:

  • في Frontier-Bench v0.1، تتجاوز نتيجة Opus 5 ضعف أداء Opus 4.8، مع تكلفة أقل لكل مهمة.
  • في CursorBench 3.2، ينهي Opus 5 عند جهد max المهمة بفارق لا يزيد على 0.5% عن أفضل نتيجة لـ Fable 5، وبنصف التكلفة لكل مهمة.
  • في ARC-AGI 3، تبلغ نتيجته ثلاثة أمثال نتيجة ثاني أفضل نموذج في مقارنة Anthropic.
  • في Zapier AutomationBench، يبلغ معدل نجاحه نحو 1.5 ضعف ثاني أفضل نموذج عند التكلفة نفسها لكل مهمة. وحتى عند أدنى إعداد للجهد، ينجح في مهام أكثر من أي نموذج آخر في المقارنة.
  • في OSWorld 2.0، تتجاوز نتيجته أفضل نتيجة لـ Fable 5 في استخدام الحاسوب، بتكلفة تزيد قليلاً على الثلث فقط.

هذه نتائج إطلاق نشرها المورّد، وليست لوحة صدارة عامة لكل مستودع برمجي أو وثيقة سياسات أو سير عمل عبر المتصفح. إنها مؤشر على أن الجهد يمكن أن يحوّل tokens الإضافية إلى عمل مقبول، لكنها لا تخبرك بعدد المحاولات التي سيحتاج إليها وكيلك، ولا بمعدل رفض البشر للإجابات، ولا بما إذا كانت نتيجة أسرع وأضعف قليلاً أنسب لهدف مستوى الخدمة لديك.

تكلفة كل مهمة ناجحة تستوعب هذه العناصر المفقودة. اجمع تكلفة tokens في جميع المحاولات، ورسوم استدعاءات الأدوات، وزمن الاستجابة المؤثر في المنتج، والمراجعة البشرية. ثم اقسم المجموع على المخرجات التي تجتاز معيار القبول.

في وكيل برمجي، قد يعني النجاح اجتياز الاختبارات، وبقاء التغييرات ضمن النطاق، وقبول المراجع لها من دون جولة تصحيحية. وفي وكيل للعمليات، قد يعني تحديث السجل بصورة صحيحة، وطلب الموافقة المناسبة، وعدم تنفيذ أي إجراء غير مسموح. يجب أن يصف معيار التقييم النتيجة قبل مقارنة مستويات الجهد.

الذكاء الظاهري للنموذج ليس المقياس. المقياس هو نتيجة مقبولة بتكلفة معلومة.

تكلفة حمل العمل الثابت هي $9 أو $22.50 أو $45

عند ثبات شكل استهلاك tokens، يقع Opus 5 تماماً بين السعر التمهيدي لـ Sonnet 5 وسعر Fable 5.

لنفترض 100 مهمة. ترسل كل مهمة 20,000 token من المدخلات وتتلقى 5,000 token من المخرجات. بذلك تستهلك الدفعة 2 مليون token من المدخلات و500,000 token من المخرجات:

  • تبلغ تكلفة Sonnet 5 وفق سعره التمهيدي، $2 للإدخال و$10 للإخراج، $9.
  • تبلغ تكلفة Opus 5 عند $5 للإدخال و$25 للإخراج $22.50.
  • تبلغ تكلفة Fable 5 عند $10 للإدخال و$50 للإخراج $45.
مقارنة تكلفة 100 مهمة متطابقة على نماذج Claude
يكلف حمل العمل نفسه المؤلف من 100 مهمة مبلغ $9 على Sonnet 5، و$22.50 على Opus 5، و$45 على Fable 5.

يعتمد الحساب على أسعار Claude API الحالية لدى Anthropic. يستمر سعر Sonnet 5 البالغ $2/$10 حتى 31 أغسطس 2026، ثم يصبح سعره القياسي $3/$15. ولا يشمل الحساب التخزين المؤقت للـ prompt، أو خصومات الدفعات، أو البحث على الويب، أو تنفيذ الشيفرة، أو إعادة المحاولات، أو أي تغير في استهلاك tokens يسببه النموذج أو إعداد الجهد.

على هذا النطاق الصغير، يزيد Opus على Sonnet بمقدار $13.50، ويزيد Fable على Opus بمقدار $22.50. ولتبرير علاوة Sonnet عبر الدفعة، يكفي أن يمنع Opus تصحيحاً واحداً تتجاوز قيمته $13.50. أما Fable فيجب أن يمنع إخفاقاً أو مراجعة تتجاوز تكلفتها $22.50 حتى يبرر الانتقال إليه.

ومع 10,000 مهمة بالشكل نفسه، تصبح الإجماليات $900 و$2,250 و$4,500. يرتفع Opus الآن بمقدار $1,350 عن Sonnet، بينما يضيف Fable مبلغ $2,250 آخر. وهكذا يتحول قرار توجيه يبدو هامشياً في النموذج الأولي إلى بند واضح في ميزانية الإنتاج.

يوضح Fast mode الفرق أكثر. فهو يشغّل Opus 5 بسرعة تقارب 2.5 ضعف مقابل $10/$50، أي ضعف السعر العادي. وسيكلف مثال المهام الـ100 مبلغ $45، وهو إجمالي تكلفة tokens الأساسي نفسه على Fable 5. اشترِه عندما تكون لزمن الاستجابة قيمة كافية في المنتج تبرر هذه العلاوة، لا باعتباره مفتاح سرعة افتراضياً.

مستويات الجهد في Claude سياسة تشغيل وليست ميزانية tokens

ابدأ بـ high. فهو الإعداد الافتراضي في Claude API وClaude Code، وتوضح Anthropic أن تعيين high صراحةً يعطي السلوك نفسه الناتج عن حذف معامل الجهد.

يتحكم الجهد في مقدار العمل الذي يبذله Claude في الاستجابة كاملةً، بما يشمل النص الظاهر والتفكير واستدعاءات الأدوات ووسائط الدوال. قد يؤدي خفضه إلى تقليل استهلاك tokens ونشاط الأدوات، وقد يدعم رفعه استكشافاً أعمق. لكنه يظل إشارة سلوكية لا سقفاً صارماً؛ لذلك قد يفعّل طلب صعب عند low عملية التفكير رغم ذلك.

لكل مستوى من المستويات الخمسة وظيفة واضحة:

low للعمل الرخيص محدود النطاق. استخدمه للتصنيف والاستخراج والتحويلات البسيطة ومهام الوكلاء الفرعيين الضيقة التي يسهل التحقق من مخرجاتها. فوكيل الفرز الذي يحدد طابور التذكرة أنسب له من وكيل يتولى حلها.

medium هو الإعداد المتوازن للإنتاج. يناسب العمل الروتيني المعتمد على الأدوات عندما يكون المسار معروفاً وتتغير المدخلات، مثل تلخيص سجل عميل، أو صياغة رد قياسي، أو تطبيق إجراء تشغيلي محدد جيداً. وهو أول خطوة نزولاً من الإعداد الافتراضي عندما تصبح تكلفة tokens أو سرعة الاستجابة مهمة.

high هو الخيار الافتراضي للعمل اليومي الصعب. استخدمه لتعديلات الشيفرة والتحليل الدقيق والوكلاء متعددي الخطوات حين تكون الأخطاء مكلفة بما يبرر الاستدلال المتأني. وهذه هي نقطة القياس الأولى الصحيحة، لأن كل إعداد أعلى أو أدنى يمكن مقارنته بها.

xhigh للعمل طويل الأفق. تصف Anthropic هذا المستوى بأنه مخصص لمهام الوكلاء أو البرمجة التي قد تمتد لأكثر من 30 دقيقة وبميزانيات tokens تبلغ الملايين. استخدمه عندما يحتاج النموذج إلى الاستكشاف المتكرر، أو استدعاء أدوات كثيرة، أو الحفاظ على خطة طوال تنفيذ طويل.

max مسار استثنائي. فهو يزيل القيود على إنفاق tokens سعياً إلى أعلى قدرة. ولا تنتمي مهمة إلى هذا المستوى إلا بعد إخفاق xhigh، أو عندما تكون النتيجة عالية القيمة إلى حد يجعل كفاءة tokens أولوية ثانوية.

مسار قرار لاختيار مستوى الجهد في Claude Opus 5
وجّه العمل الروتيني إلى مستوى أدنى، وأبقِ العمل اليومي المعقد عند high، ولا تصعّد إلا بعد إخفاق أحد التقييمات.

هناك خطآن يسهل الوقوع فيهما.

أولاً، لا تستخدم الجهد للتحكم في طول الكتابة. توضح وثائق Anthropic أن تغيير الجهد لا يقلّص بصورة موثوقة الاستجابة الظاهرة من Opus 5. اطلب الطول المرغوب في الـ prompt.

ثانياً، لا تبدأ كل مهمة تبدو صعبة عند max. فهذا يمنعك من معرفة ما إذا كان high سيجتازها، ويجعل أي نقاش لاحق حول التكلفة افتراضياً. المقارنة المفيدة هي أدنى إعداد يحقق النتيجة باستمرار، لا أعلى نتيجة تستطيع شراءها.

من ينبغي له استخدام Opus 5 أو Sonnet 5 أو Fable 5؟

لا ينبغي لمعظم المشترين اختيار نموذج واحد لكل طلب. الأفضل أن يحددوا نموذجاً افتراضياً ومسار تصعيد ضيقاً.

مؤسس ممول يبني منتجاً يعتمد على الوكلاء

استخدم Sonnet 5 للتفاعلات كبيرة الحجم التي يسهل التحقق منها، وOpus 5 للخطوات التي تضع الخطة، أو توفّق بين سياقات متعارضة، أو تتعافى بعد إخفاق أداة.

الخطر الذي يواجه المؤسس هو وضع Opus في كل تفاعل لأنه يبدو الخيار الأكثر أماناً. فإذا كانت معظم الطلبات تسلك مساراً متوقعاً، تُدفع العلاوة مقابل عمل لم يحتج إليها قط. اجعل المسار الرخيص واسعاً، واحصر مسار Opus في الخطوات ذات العواقب المهمة.

ابدأ التنسيق المعقد باستخدام Opus عند high. ولا تصعّد فئة صعبة معروفة إلى xhigh إلا عندما يتحسن معدل القبول بما يغطي استهلاكها الإضافي من tokens. ولا ترسل مهمة إلى Fable إلا بعد إخفاق Opus في نسخة ممثلة منها، وحين يبرر أثرها التجاري سعر الوحدة البالغ 2x.

مدير تقنية في شركة متوسطة يوحّد طبقة النماذج

اجعل Opus 5 الخيار الممتاز الافتراضي، وأبقِ توجيه النماذج واضحاً في السياسة. عندها يستطيع مالك حمل العمل شرح سبب استخدام المهمة لـ Sonnet أو Opus أو Fable، وتحديد التقييم الذي قد يغيّر هذا المسار.

لا ترحّل كل طلبات Opus 4.8 بتغيير اسم النموذج ثم اعتبار المهمة مكتملة. فالتفكير الافتراضي يغيّر سلوك المخرجات واستهلاك tokens. كما تحتاج إعدادات max_tokens الحالية، وتصميم المحادثات المخزنة مؤقتاً، وتعليمات التحقق إلى مراجعة.

يقدم تحليل Claude Sonnet 5 مرجع الحد الأدنى المفيد: يفوز Sonnet عندما تظل مخرجاته المقبولة ثابتة عند السعر الحالي. أما Fable فهو الحد الأعلى. ويحتل Opus المساحة بينهما إلى أن يثبت أحد الحدين تفوقه في حمل عمل محدد بالاسم.

مختص عمليات خبير يؤتمت أعمال المؤسسات

استخدم Opus عندما تتجاوز المهمة حدود الأنظمة أو السياسات. فقراءة طلب، وفحص حساب، وتطبيق قاعدة، وتقرير ما إذا كانت موافقة بشرية مطلوبة أصعب من إعداد ملخص، لأن كل خطوة تغيّر عواقب الخطوة التالية.

استخدم medium لإجراء مستقر وأدوات محدودة النطاق. وانتقل إلى high عندما تكثر الاستثناءات أو السجلات الملتبسة أو نصوص السياسات المتعارضة. وأبقِ الموافقة البشرية شرطاً للإجراءات غير القابلة للتراجع حتى مع قوة نتائج الاختبارات. يقلل النموذج الأفضل المراجعة الروتينية، لكنه لا يلغي المساءلة.

لا يصبح Fable منطقياً إلا حين تكون المهمة شديدة الصعوبة وعالية القيمة معاً. وإذا كان شخص ما سيراجع كل نتيجة على أي حال، فقد يكون تحسين واجهة المراجعة أجدى من دفع علاوة إضافية للنموذج.

مطوّر تقني يعمل منفرداً

ابدأ بـ Sonnet 5 ما دام شكل المنتج يتغير. وانقل تصحيح الأخطاء الصعبة، ومراجعة البنية، والتنفيذ الممتد عبر ملفات متعددة إلى Opus 5. يظهر الفرق بوضوح حين تؤدي المحاولة الفاشلة إلى إعادة بناء سياق مكلفة، لا عندما تكون المهمة تعديلاً صغيراً.

يبقى الاختيار الأوسع بين المورّدين قراراً منفصلاً. يختلف GPT-5.6 وClaude Sonnet 5 في أنظمة التنفيذ إلى جانب جودة النموذج. يعزز Opus 5 المسار الممتاز لدى Anthropic، لكنه لا يجعل التنسيق أو صلاحيات الأدوات أو قابلية الرصد قابلة للاستبدال بعضها ببعض.

تتغير الإجابة عند النقطة نفسها للقراء الأربعة: رقِّ المسار عندما تتجاوز التكلفة المقاسة للإخفاق والمراجعة علاوة النموذج. وإذا لم يقس أحد هذه التكلفة، فالقرار التجاري الآمن هو إجراء تقييم قبل التصعيد.

الترحيل من Opus 4.8 يتضمن سلوكين غير متوافقين

يُبقي تغيير claude-opus-4-8 إلى claude-opus-5 سعر الوحدة نفسه، $5/$25، لكنه لا يحافظ على سلوك التشغيل ذاته.

أول اختلاف جوهري هو التفكير الافتراضي. كان Opus 4.8 قادراً على العمل من دون تفكير ما لم يفعّله الطلب. أما Opus 5 فيقرر افتراضياً متى يفكر وكم يبذل من التفكير. ولأن max_tokens يضع سقفاً للتفكير والإجابة الظاهرة معاً، فقد يقطع حد كان يستوعب استجابة Opus 4.8 بسهولة عمل وكيل Opus 5 قبل أن ينتهي.

الاختلاف الثاني هو العلاقة بين التفكير والجهد. إذا عطّل طلبٌ التفكير وضبط الجهد على xhigh أو max، تعيد واجهة API استجابة HTTP 400. أبقِ الجهد عند high أو أدنى عندما يجب تعطيل التفكير، أو احذف حقل تعطيل التفكير عند استخدام جهد أعلى.

تحذر Anthropic أيضاً من أن تعطيل التفكير قد يدفع Opus 5 أحياناً إلى كتابة استدعاء أداة كنص عادي، أو إظهار وسوم XML داخلية بدلاً من إصدار كتلة tool_use سليمة. أبقِ التفكير مفعلاً متى أمكن، واضبط الإنفاق من خلال الجهد.

هذا طلب Python صالح لمهمة برمجية ممتدة أو مهمة وكيل ممتدة:

Python
import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,
    output_config={"effort": "xhigh"},
    messages=[
        {
            "role": "user",
            "content": (
                "Review this repository migration plan. Identify unsafe "
                "assumptions, propose the smallest sound change, and verify "
                "the final plan against the stated acceptance criteria."
            ),
        }
    ],
)

for block in response.content:
    if block.type == "text":
        print(block.text)

حد 64,000 token هو نقطة البداية التي تقترحها Anthropic عند xhigh أو max، وليس شرطاً لكل طلب. اخفضه بعد رصد الاستهلاك الفعلي وسلوك الإكمال.

  1. غيّر معرّف النموذج في مسار تجريبي

    انقل حصة ممثلة من طلبات Opus 4.8 إلى claude-opus-5. وأبقِ المسار القديم متاحاً إلى أن يجتاز السلوك الجديد اختبارات النتائج نفسها.

  2. تخلّص من افتراضات التفكير الموروثة

    ابحث عن الشيفرة التي تعطّل التفكير، أو تضبط ميزانية له، أو تفترض أن كل المخرجات نص ظاهر. اختبر مسار الخطأ عند xhigh وmax صراحةً.

  3. ارفع max_tokens ثم اضبطه

    امنح عمليات الوكلاء الطويلة مساحة تكفي لإكمال التفكير واستخدام الأدوات. سجّل الإكمال والانقطاع وtokens المخرجات، ثم اخفض السقف حسب فئة المهمة.

  4. احذف تعليمات التحقق الزائدة

    يتحقق Opus 5 من عمله من دون طلب صريح أكثر مما كان يفعل Opus 4.8. وقد تولّد التعليمات التي تطلب مدققاً آخر أو جولة تحقق نهائية عملاً إضافياً بلا تحسن في القبول.

  5. قارن النتائج المقبولة

    قِس النجاح وtokens وزمن الاستجابة واستدعاءات الأدوات وإعادة المحاولات والمراجعة. قد يرفع نموذج بالسعر نفسه الفاتورة إذا استهلك سلوكه الافتراضي tokens أكثر.

توقع فروقاً نوعية أيضاً. تقول Anthropic إن Opus 5 يميل إلى كتابة مخرجات أطول، وسرد تقدمه بتواتر أكبر خلال جلسات الوكلاء، والتفويض إلى وكلاء فرعيين بسهولة أكبر، والتحقق من عمله من دون تعليمة منفصلة. قد تكون هذه السلوكيات مفيدة، لكن واجهة وكيل أو مسار سجلات أو طبقة تنسيق صُممت حول سلوك Opus 4.8 الأكثر هدوءاً قد تحتاج إلى تعديل.

ثلاثة تفاصيل في الإنتاج تحدد قيمة الفاتورة

يتفاعل الجهد والتخزين المؤقت والسرعة معاً. وقد يؤدي تحسين أي عنصر منها بمعزل عن الآخرين إلى الإضرار بالعنصرين الباقيين.

ثبّت الجهد داخل المحادثة المخزنة مؤقتاً

يؤدي تغيير output_config.effort بين الطلبات إلى تغيير الـ prompt الذي تنشئه Anthropic، ولذلك لا يحافظ الطلب اللاحق على البادئة المخزنة مؤقتاً. وقد يفقد نظام يرفع الجهد ويخفضه داخل محادثة طويلة وفر التخزين المؤقت الذي كان يتوقعه.

اختر مستوى الجهد في بداية الجلسة المعتمدة على التخزين المؤقت وثبّته. وإذا احتاج العمل اللاحق إلى جهد مختلف، فوجّهه إلى محادثة جديدة، أو احتسب فقدان التخزين المؤقت ضمن تكلفة التصعيد.

يخفض Opus 5 الحد الأدنى للـ prompt القابل للتخزين المؤقت من 1,024 token في Opus 4.8 إلى 512 token. وهذا يتيح التخزين المؤقت لتعليمات متكررة أقصر، ولكن فقط عندما تظل بادئة الـ prompt ومستوى الجهد ثابتين.

اشترِ Fast mode لخفض زمن الاستجابة، لا لرفع القدرة

تبلغ سرعة Fast mode نحو 2.5 ضعف السرعة العادية، وتكلفته $10/$50 لكل مليون token. وهو لا يحول Opus إلى Fable. وفي مثال المهام الـ100 الثابت، يرفع إجمالي Opus من $22.50 إلى $45 قبل احتساب التخزين المؤقت أو إعادة المحاولات.

يتوفر Fast mode بصفة معاينة بحثية في Claude API، ولا يتوفر حالياً على Amazon Bedrock أو Google Cloud أو Microsoft Foundry. لذلك لا يمكن لبنية متعددة السحابات افتراض أن إعداد السرعة سينتقل مع النموذج إلى كل منصة.

تعامل مع عناصر التحكم التجريبية الجديدة على أنها تجريبية

تسمح تغييرات الأدوات في منتصف المحادثة للتطبيق بإضافة أدوات أو حذفها بين الجولات مع الحفاظ على التخزين المؤقت للـ prompt. وتستخدم الميزة ترويسة beta المسماة mid-conversation-tool-changes-2026-07-01.

تستطيع آليات fallback التلقائية توجيه طلب Opus 5 أو Fable 5 الذي صنفه النظام إلى بديل توصي به Anthropic بدلاً من حجبه. وتستخدم قوائم fallback الافتراضية والصريحة ترويسة beta المسماة server-side-fallback-2026-07-01.

يعالج الخياران مشكلات تشغيلية، لكنهما يغيران أيضاً ما يمكن أن تفعله الجلسة المنطقية الواحدة، وأي نموذج قد يجيب. اختبر تغييرات الصلاحيات ومعالجة الإخفاق وجودة المخرجات قبل تفعيلهما في سير عمل غير قابل للتراجع.

نفّذ اختباراً شاملاً لمستويات الجهد الخمسة قبل الإطلاق

يكفي تقييم من 375 تشغيلاً لتحويل اختيار مستوى الجهد من رأي إلى بيانات توجيه: 25 مهمة ممثلة، وخمسة مستويات للجهد، وثلاثة تكرارات لكل تركيبة.

التكرار مهم لأن الوكيل قد ينجح مرة بالحظ ثم يفشل في مسار الأداة التالي. أما مجموعة المهام فأهم من حجمها، وينبغي أن تشمل العمل المعتاد، والحالات الطرفية المعروفة، والإخفاقات التي سبق أن احتاجت إلى تصحيح بشري.

  1. حدد معيار قبول واحداً لكل مهمة

    اكتب شرط النجاح قبل تشغيل النموذج. في الشيفرة، أدرج الاختبارات والنطاق والمراجعة. وفي سير عمل تشغيلي، أدرج الحالة النهائية للسجل والموافقات والإجراءات المحظورة.

  2. ثبّت النموذج والـ prompt

    استخدم claude-opus-5 مع الـ prompt والأدوات والسياق نفسها. غيّر مستوى الجهد وحده حتى تفسر المقارنة النتيجة.

  3. شغّل مستويات الجهد الخمسة ثلاث مرات

    نفّذ low وmedium وhigh وxhigh وmax على جميع المهام الـ25. ينتج الاختبار الكامل 375 تشغيلاً.

  4. سجّل التنفيذ كاملاً

    التقط tokens المدخلات والمخرجات، وزمن الاستجابة، واستدعاءات الأدوات، وإعادة المحاولات، وسلوك fallback، وقرار النجاح أو الإخفاق البشري. طول الإجابة الظاهرة وحده ليس مقياساً للتكلفة.

  5. احسب تكلفة كل مخرج مقبول

    اجمع تكلفة جميع المحاولات واقسمها على النتائج المقبولة. وأبقِ وقت المراجعة تكلفة تشغيلية مستقلة إذا تعذر تسعيره بدقة.

  6. اختر أدنى مسار ناجح

    اختر أدنى جهد يتجاوز عتبة العمل باستمرار. ضع قاعدة تصعيد لفئات المهام التي تفشل، ثم أعد الاختبار بعد أي تغيير جوهري في الـ prompt أو الأدوات أو النموذج.

لا تغيّر الجهد في منتصف الجلسة أثناء هذا الاختبار إذا كان الإنتاج يعتمد على التخزين المؤقت للـ prompt. اختبر كل مستوى في تصميم محادثة ثابت، وإلا أصبحت حالات فقدان التخزين المؤقت متغيراً خارج السيطرة.

قد تظهر نتيجة مفيدة أن medium ينجح في أعمال الحسابات الروتينية، وأن معالجة الاستثناءات تحتاج إلى high، وأن xhigh يحسن فئة ضيقة من تصحيح الأخطاء. لا تبرر هذه النتيجة استخدام xhigh في كل مكان، بل تبرر ثلاثة مسارات باقتصاديات مختلفة.

وتحسم العملية نفسها ما إذا كان Fable 5 يستحق سعره. أضف Fable فقط إلى مهام Opus التي تظل دون العتبة. وإذا لم يرفع Fable القبول بما يغطي علاوة $22.50 في مثال المهام الـ100، فأبقِ Opus.

حدود السلامة تختلف عن Fable 5

يفرض Opus 5 قيوداً أقل من Fable 5 على العمل الأمني المشروع، لكنه ليس نموذجاً سيبرانياً بلا قيود.

تقول Anthropic إن مصنفات الأمن السيبراني في Opus 5 يُفترض أن تتدخل بمعدل أقل بنحو 85% من نظيراتها في Fable 5. يستطيع النموذج العثور على الثغرات في الشيفرة المصدرية، بينما تحجب ضوابط الحماية فحص الثغرات القائم على الملفات الثنائية، واختبارات الاختراق، وتوليد الاستغلالات. كما يظل خلف Mythos 5 في الأمن السيبراني الهجومي وأبحاث الأحياء.

هذه الحدود مهمة لوكلاء تصحيح الأخطاء والأمن. فقد تنجح مراجعة الشيفرة المصدرية، ثم تُرفض خطوة لاحقة للتحقق من الاستغلال أو تُوجّه إلى مسار آخر. صمّم سير العمل بحيث يكون الرفض حالة معالجة، لا عطلاً مفاجئاً في المحلّل.

يمنح Cyber Verification Program المؤسسات والباحثين المؤهلين إمكانية الوصول إلى نسخة بقيود أمنية أقل. ولا ينبغي للمستخدمين عموماً بناء سير عمل إنتاجي على هذا المسار قبل تأكيد الوصول.

يمنح التدقيق السلوكي الداخلي لدى Anthropic نموذج Opus 5 نتيجة 2.3 للسلوك غير المتوافق إجمالاً، وهي الأدنى بين نماذجها الحديثة. تعامل مع ذلك كدليل يتعلق بمجموعة اختبارات Anthropic نفسها، لا كإذن بإلغاء الموافقات أو العزل أو مبدأ الحد الأدنى من صلاحيات الأدوات.

القرار

ينبغي أن يحل Claude Opus 5 محل Opus 4.8 في أحمال العمل الممتازة الجديدة، وفي معظم الأحمال الحالية بعد ترحيل مرحلي. فهو يكلف السعر نفسه، وترتفع قدراته بموثوقية أكبر عند زيادة الجهد، ويقترب من Fable 5 في عدد من التقييمات المهمة.

لكن لا ينبغي أن يحل محل Sonnet 5 في كل مسار كبير الحجم، ولا أن يجعل max الإعداد الافتراضي. تأتي الجدوى الاقتصادية من التوجيه: Sonnet أو جهد أدنى للعمل الرخيص المقبول، وOpus عند high للعمل اليومي الصعب، وxhigh للحالات طويلة الأفق التي أثبتها القياس، وFable فقط عندما يثبت أن إخفاق Opus مكلف.

تكمن قيمة أداة التحكم في الجهد في أنها تجعل هذه السياسة صريحة. استخدم الجهد كمتغير في التقييم، وثبّته عندما يكون التخزين المؤقت مهماً، واربط كل تصعيد بإخفاق محدد بالاسم.

ما مدى جودة Claude Opus 5؟

تنشر Anthropic نتائج هي الأفضل من نوعها في عدة تقييمات للبرمجة والعمل المعرفي. وأكثر النتائج فائدة لاتخاذ القرار هي CursorBench 3.2: ينهي Opus 5 عند جهد max المهمة بفارق لا يتجاوز 0.5% عن أفضل نتيجة لـ Fable 5، وبنصف التكلفة لكل مهمة. تحقّق من أدائه على نتائجك المقبولة قبل تغيير مسار الإنتاج.

هل Claude Opus 5 أفضل من Fable 5؟

ليس عند كل سقف للقدرة. يمثل Opus 5 الخيار اليومي الافتراضي الأفضل لأن سعر tokens البالغ $5/$25 يساوي نصف سعر Fable 5، ولأنه يقترب منه في عدة أحمال عمل. ويظل Fable أعلى فئات القدرات المتاحة عموماً لدى Anthropic لأصعب الأعمال.

هل Claude Opus 5 متاح، وهل يمكن استخدامه مجاناً؟

يتوفر Opus 5 عبر Claude API وAmazon Bedrock وGoogle Cloud وMicrosoft Foundry. وهو النموذج الافتراضي في Claude Max، وأقوى نموذج في Claude Pro؛ ولا يدرج جدول خطط Anthropic الوصول إلى Opus ضمن الفئة المجانية. تبلغ تكلفة Pro مبلغ $20 شهرياً أو $200 سنوياً، بينما يبدأ Max من $100 شهرياً.

لماذا Claude Opus مرتفع التكلفة؟

تبلغ تكلفة مخرجات Opus 5 مقدار $25 لكل مليون token، أي خمسة أمثال Haiku 4.5 و2.5 ضعف سعر Sonnet 5 المؤقت. لا تحقق العلاوة قيمتها إلا عندما تمنع قدرته على الاستدلال في المهام الأصعب عدداً كافياً من المحاولات الفاشلة أو أخطاء الأدوات أو المراجعات لتجاوز وفر المسار الأرخص.

هل تريد تحويل تغيير النموذج التالي إلى قرار جاهز للإنتاج؟ انضم إلى النشرة البريدية.

آخر تحديث

3 سبتمبر 2026

التصنيفAI

فضّل هذا الموقع في Google

إضافة omidsaffari.com كمصدر مفضّل في بحث Google

اجعل omidsaffari.com مصدرًا مفضّلًا، وسيرفعه Google لك في Top Stories وAI Overviews وAI Mode.

المزيد من AI

عرض كل مقالات AI
النشرة البريدية

رسالة واحدة، كل يوم أحد. أنظمة تعمل، لا آراء ساخنة.

سجلات بناء، وأنظمة قيد التشغيل، وملاحظات ميدانية من إدارة محفظة مشاريع ذكاء اصطناعي.

أسبوعية. بلا إزعاج. يمكنك إلغاء الاشتراك متى شئت.