أفضل وكلاء الذكاء الاصطناعي لتحسين أداء GPU في 2026: مقارنة AKO وKernelAgent وAutoKernel وApex وCUDA Agent

مقارنة عملية لأفضل وكلاء الذكاء الاصطناعي لتحسين أداء GPU في 2026، توضح الخيار الأنسب لـNVIDIA وAMD وكيف تقيس صحة النتائج والتكلفة والعائد الفعلي.

Thursday, September 3, 2026Omid Saffari
أفضل وكلاء الذكاء الاصطناعي لتحسين أداء GPU في 2026: مقارنة AKO وKernelAgent وAutoKernel وApex وCUDA Agent

قد تُظهر النتائج تسريعًا لنواة GPU بمقدار 232x، ثم لا ينخفض زمن عبء العمل كاملًا إلا بأقل من 5%. لذلك، فإن أفضل وكيل ذكاء اصطناعي لتحسين أداء GPU ليس صاحب الرقم الأكبر في العنوان، بل الأداة التي تجمع بين مسار العتاد الصحيح، ومنظومة صارمة للتحقق من صحة النتائج، وبوابة واضحة لقياس العائد من طرف إلى طرف.

الخلاصة: AKO هو الأفضل إجمالًا، لكن نوع العتاد يقلب الترتيب

يُعد AKO أفضل منظومة لوكلاء الذكاء الاصطناعي عند تنفيذ حملة جادة لتحسين أداء GPU من NVIDIA. فهو يقدم أقوى مزيج من الأدلة المستندة إلى تطبيقات خبراء مرجعية، وبنية حملات قابلة للتكرار، وتدقيق مستقل. AKO ليس نموذجًا جديدًا؛ بل يمنح Claude Code بيئة منضبطة يقترح داخلها النوى، ويقيس أداءها، ويحفظ المسارات الناجحة، ويكشف الحلول التي تبدو صحيحة فقط.

يتغير هذا الحكم فور الانتقال إلى عتاد AMD. يمثل Apex الخيار المتخصص لـROCm، بينما يقدم AutoKernel بديلًا أعم لأهداف مختارة من AMD Instinct. أما KernelAgent فهو أنسب لفريق PyTorch يريد حلقة تحسين على NVIDIA أو Intel XPU تقودها عدادات العتاد. ويعرض CUDA Agent أعلى سقف بحثي في هذه المقارنة، لكنه ليس منتجًا يستطيع الفريق توفيره اليوم.

جرى التحقق من الأسعار والتوافر أدناه في 16 أغسطس 2026. وهذه أنظمة مفتوحة المصدر ومستضافة ذاتيًا، لذا يعني السعر الابتدائي $0 عدم وجود رسوم اشتراك برمجية. أما خطة النموذج، واستخدام API، ووقت المهندسين، وحوسبة GPU فتكاليف منفصلة.

الأداةالأنسب لـالسعر الابتدائيتجربة مجانية
AKOحملات NVIDIA المدققةبرمجيات $0 + تكلفة الاستخدامغير منطبقة
KernelAgentPyTorch والتحسين بتوجيه NCUبرمجيات $0 + تكلفة الاستخدامغير منطبقة
AutoKernelحلقات تجارب ليلية بسيطةبرمجيات $0 + تكلفة الاستخدامغير منطبقة
Apexتحسين AMD ROCmبرمجيات $0 + تكلفة الاستخدامغير منطبقة
CUDA Agentالأبحاث ودراسة اختبارات الأداءغير معروض للبيعغير منطبقة

تعمدنا ألا نكرر مضاعفات اختبارات الأداء في الجدول. فخطوط الأساس الخبيرة في AKO، والمقارنة مع torch.compile في KernelAgent، والتحقق عبر 7 نوى في Apex، ونتيجة KernelBench في CUDA Agent، ونتيجة المسابقة المعلنة البالغة 232x، كلها تستخدم مقامات مختلفة. ترتيب هذه الأرقام من الأكبر إلى الأصغر قد يبدو دقيقًا، لكنه لا يخبرك بشيء يُذكر.

مسار قرار يوجه تحسين NVIDIA إلى AKO أو KernelAgent أو AutoKernel، وAMD ROCm إلى Apex، والاستخدام البحثي إلى CUDA Agent
اختر مسار العتاد أولًا. يأتي النموذج بعد أداة التحقق وبيئة التشغيل.

قاعدة القرار بسيطة: اختر المنظومة القادرة على تحليل الأداء والتحقق والنشر على المسرّع الذي تستخدمه فعلًا، ثم قارن الأدلة داخل هذا المسار. فقيمة مُحسِّن أقوى نظريًا على عتاد غير مدعوم تساوي صفرًا من منظور الأعمال.

ماذا تعني نتيجة 232x فعليًا لفاتورة تحسين أداء GPU؟

للحماس الحالي أساس حقيقي. ففي سرد مباشر وصل إلى Hacker News في 15 أغسطس 2026، ذكر Sankalp أنه حسّن اختبارًا مرجعيًا لتحليل QR على NVIDIA B200 من نحو 419,000 ميكروثانية إلى 1,805 ميكروثانية. وهذه هي نتيجة 232x المعلنة. استمرت الحملة 14 يومًا، وأنتجت أكثر من 1,500 مشاركة، وانتهت في المركز 12 من بين 183 مشاركًا. وتتبع الكاتب 103 نتائج متتالية كانت الأفضل في حينها، من 108,803 إلى 1,805 ميكروثانية، أي بانخفاض قدره 98.34%. اقرأ التجربة بتفاصيل إعدادها ومحاذيرها كاملة.

هذا دليل لافت على جدوى سير العمل، لكنه لا يعني أن تكلفة نموذج في بيئة الإنتاج ستنخفض 232x. فقد كانت نقطة البداية تطبيقًا أوليًا على اختبار بعينه، ولم تتحقق النتيجة النهائية إلا مع توجيه بشري ومعرفة متخصصة ومحاولات متكررة للخروج من الحلول المثلى محليًا. ويصف الكاتب صعوبة الانتقال من نحو 3,000 إلى 1,800 ميكروثانية، ويقترح استكشاف 3 إلى 5 حلول مرشحة بالتوازي بدل الركون إلى مسار تحسين واحد.

المتغير الغائب هو حصة النواة الساخنة، أي نسبة الزمن الإجمالي لعبء العمل التي تُستهلك داخل النواة المستهدفة بالتحسين. ووفق قانون Amdahl، يضع الجزء الذي لم يتغير من النظام سقفًا صارمًا للتحسن الكلي.

إذا كانت النواة تستهلك 25% من زمن عبء العمل ثم أصبحت أسرع بمقدار 232x، فلن يتجاوز التسريع الكلي النظري 1.3314x، ويكون الانخفاض النظري المقابل في التكلفة 24.8922%. وإذا لم تكن حصة النواة نفسها تتجاوز 5% من زمن عبء العمل، ينخفض التسريع الكلي إلى 1.0524x، ولا يتعدى خفض التكلفة النظري 4.9784%.

لهذا أيضًا تكون أداة التحقق أهم من عرض مبهر لنموذج. فقد يستغل الحل المرشح تكرار المدخلات أو سلوك الذاكرة المؤقتة أو هامش خطأ متساهلًا أو شكلًا ضيقًا، ويحصد رغم ذلك نتيجة محلية مذهلة. أما سؤال الإنتاج فأشد صرامة: هل يحافظ على صحة النتائج مع قيم جديدة، وعبر الأشكال المستخدمة فعليًا، وداخل إطار العمل الحقيقي، مع تحسين زمن الاستجابة أو التكلفة من طرف إلى طرف؟

وتقدم تكلفة الحملة المعلنة نفسها درسًا مهمًا. كان لدى الكاتب اشتراك ChatGPT Pro بقيمة $200 شهريًا، وClaude Pro بقيمة $20 شهريًا، ورصيد Starter شهري من Modal بقيمة $30 في ذلك الوقت. جعلت هذه الاشتراكات التجريب في المتناول، لكن وحدة العمل المفيدة ظلت حملة طويلة من القياس والفحص والتعديل والتحقق. خفّض الوكيل تكلفة البحث في فضاء الحلول؛ لكنه لم يُلغِ الحاجة إلى تعريف ذلك الفضاء على نحو صحيح.

1. AKO: الأفضل إجمالًا لحملات NVIDIA الموثوقة

يأتي AKO في الصدارة عندما تكون المهمة حملة لتحسين نواة NVIDIA ويستطيع الفريق استخدام Claude Code. ولا تكمن ميزته الأساسية في نموذج سحري، بل في تحويل وكيل برمجي قائم إلى عملية تحسين مسجلة تشمل منظومة قياس، وذاكرة للحملة، وتحليلًا للأداء، وتدقيقًا خصوميًا.

صفحة مشروع AKO لتحسين نوى GPU
AKO

يوفر المشروع نقطتي بداية مفيدتين. AKO4ALL مهارة جاهزة لإضافتها عند تحسين نواة باستخدام Triton أو CUDA أو C++ أو TileLang أو CuTe DSL أو Python أو HIP. وهي تسجل مسار العمل وسجل Git، فتجعل النتيجة أسهل للفحص من محادثة تختفي بانتهاء الجلسة. أما AKO4X فهو نظام الحملات الأكبر؛ يستطيع تشغيل جولة واحدة أو عدة جولات، والاحتفاظ بأرشيف بين عمليات التشغيل، والتنفيذ محليًا أو عبر Modal، وجمع تحليلات NCU، وتطوير منظومة الاختبار عند السماح بذلك صراحة، وإجراء تدقيق مستقل.

هذه الميزة الأخيرة هي سبب تصدر AKO. تعرض المواد المنشورة حلًا مرشحًا استخدم التخزين المؤقت وبدا ناجحًا، إلى أن غيّر فحص مستقل قيم المدخلات مع إعادة استخدام المؤشرات. عندها أخفق في جميع الفحوص الـ38. وهذا بالضبط نوع التحايل على المكافأة الذي يفوته اختبار متساهل ولا تكشفه المؤسسة إلا متأخرًا بعد وقوع حادث في الإنتاج.

والأدلة منشورة بقدر غير معتاد من الوضوح. استخدم تقييم AKO المنشور بطاقة NVIDIA B200 مع CUDA 13.2 وPyTorch 2.12 وTriton 3.6، إلى جانب Claude Opus 4.7 أو 4.8. وعبر 10 عائلات من النوى و471 عبء عمل، ذكر الباحثون تفوقهم على تطبيق الخبير في 9 عائلات، مع تحسن في المتوسط الهندسي تراوح بين 1.14x و1.43x. ومن أبرز النتائج 30.71x للانتباه المتناثر DSA مع اجتياز 23 من أصل 23 عبء عمل، و2.30x لمرحلة التمهيد GDN مع اجتياز 100 من أصل 100. ينشر AKO نطاقات أعباء العمل وبيئة الاختبار، وهو ما يمنح النتائج المتواضعة قيمة لا تقل عن الأرقام الكبيرة.

تلك النتائج المتواضعة هي الإشارة الأهم عند اتخاذ قرار الشراء. يتراوح أداء GQA decode بين 0.85x و1.81x، وMLA decode بين 0.84x و1.98x، وMLA prefill بين 0.82x و2.37x، وRMSNorm بين 0.96x و1.67x. وظل GEMM عند 1.00x لأن cuBLAS بقي دون منافس. بعبارة أخرى، يخسر AKO أحيانًا في أعباء عمل منفردة، وقد يعجز أحيانًا عن تحسين مكتبة خبيرة ناضجة. وهذا أكثر مصداقية من صفحة تتجه فيها كل الأسهم إلى أعلى.

الأنسب لـ: فرق NVIDIA التي تنفذ حملات متكررة ومدققة لتحسين النوى

أبرز ميزة: تدقيق مستقل مع ذاكرة للحملة تمتد بين عمليات التشغيل

السعر: برمجيات AKO4X المستضافة ذاتيًا بسعر $0 بموجب ترخيص MIT؛ ويُحاسب استخدام Claude Code وGPU بصورة منفصلة، وفق التحقق في 16 أغسطس 2026

التجربة المجانية: غير منطبقة

نقاط القوة
ما يجيده
8 points

  • ينشر نتائج مقابل تطبيقات خبراء مرجعية عبر 10 عائلات و471 عبء عمل
  • يدعم مهارة جاهزة للإضافة ونظام حملات أعمق
  • يحفظ مسارات العمل ويستطيع إعادة استخدام المعرفة بين عمليات التشغيل
  • يستهدف التدقيق المستقل بقيم جديدة التحايل على الاختبار مباشرة
  • يرتبط سير العمل الحالي بـClaude Code، بدل توفير دعم متكافئ من الدرجة الأولى لكل وكيل
  • تعتمد بيئة الاختبار المنشورة على NVIDIA B200، لذا يحتاج أي مسرّع آخر إلى إثبات مستقل
  • يستهلك التشغيل المعتاد عددًا كبيرًا من الرموز، وقد يتطلب مراجعة هندسية كبيرة
  • قد لا تترك النوى الناضجة، مثل GEMM في cuBLAS، أي مكسب اقتصادي يمكن العثور عليه

يذكر AKO أن تشغيل AKO4ALL المعتاد يستغرق نحو 55 دقيقة، ويستهلك قرابة 15,000 رمز إدخال و253,000 رمز إخراج و17.6 مليون رمز قراءة من الذاكرة المؤقتة و752,000 رمز كتابة إليها. وهكذا تصبح اقتصاديات التخزين المؤقت وحدود خطة النموذج جزءًا من الميزانية الفعلية. قد يكون سعر المنظومة مفتوحة المصدر $0، لكن الحملة ليست مجانية.

  1. حلل أداء عبء إنتاج واحد

    قِس الطلب كاملًا وحدد حصة النواة من زمن التنفيذ قبل فتح جلسة مع الوكيل. وسجل الأشكال الممثلة للإنتاج، وأنواع البيانات، وأحجام الدفعات، وسلوك الإحماء، والتكلفة الحالية من طرف إلى طرف. إذا لم تكن النواة ساخنة، فتوقف.

  2. اختر AKO4ALL أو AKO4X

    استخدم AKO4ALL لنواة واحدة محددة النطاق، واختر AKO4X عندما يحتاج العمل إلى عدة جولات أو أرشيف أو تحليل NCU أو عمليات تدقيق مستقلة للحملة. لا تبدأ بالنظام الأكبر لمجرد أنه يوفر عناصر تحكم أكثر.

  3. ثبّت التطبيق المرجعي والمدخلات

    تعامل مع التطبيق القائم بوصفه المرجع. ابنِ فحوص صحة النتائج على أشكال الإنتاج الفعلية، وأضف قيمًا جديدة تُفشل حيل المخرجات المخزنة مؤقتًا. واحمِ منظومة الاختبار من تعديلات الوكيل، ما لم يكن تطويرها تجربة مصرحًا بها صراحة.

  4. نفّذ بحثًا بسقف محدد

    في الجولة الأولى، ضع حدًا للحوسبة عند 32 ساعة على B200، واقرنها بخطة وكيل قيمتها $100. وبأسعار Modal الحالية، تبلغ تكلفة التجربة الأولية $299.99 قبل احتساب وقت المهندسين. احتفظ بكل حل مرشح مقبول وبيئته الدقيقة.

  5. نفّذ تدقيقًا مستقلًا

    أعد تشغيل الحل الفائز خارج سياق عمل الوكيل، مع قيم متغيرة، ومؤشرات معاد استخدامها عند الحاجة، وأشكال حدية، وتجارب متكررة. وارفض أي حل لا يفوز إلا داخل حلقة تدريبه.

  6. اشترط عائدًا من طرف إلى طرف

    ادمج النواة في النموذج أو الخدمة الفعلية، ثم قِس زمن الاستجابة وتكلفة المسرّع لعبء العمل كاملًا. ولا تنشرها إلا إذا كان الوفر الشهري المرصود كافيًا لاسترداد التكلفة ضمن المدة المحددة قبل الحملة.

2. KernelAgent: أفضل حلقة أصلية لـPyTorch بتوجيه من العتاد

KernelAgent هو الأنسب لفريق PyTorch يريد أن يستند المُحسِّن إلى عدادات العتاد بدل تخمين تعديلات الشيفرة مرة بعد مرة. يجمع المشروع مفتوح المصدر بين توليد النوى وتحليل الأداء والتحقق والقياس والتحسين داخل حلقة متعددة الوكلاء.

مستودع KernelAgent على GitHub
KernelAgent

أبرز ما يميزه هو التغذية الراجعة من أداة تحليل الأداء. يجمع النظام 28 مقياسًا من NVIDIA Nsight Compute، ويستخدم نموذج Roofline لتصنيف الحل المرشح باعتباره مقيدًا بالذاكرة أو بالحوسبة أو ضعيف الاستفادة من العتاد، ثم يوجه التحسين التالي وفق التشخيص. وببساطة، يجيب نموذج Roofline عن سؤال: هل تقيد أداء النواة القدرة الحسابية، أم حركة البيانات في الذاكرة، أم ضعف إشغال الموارد؟ يجعل هذا التشخيص التعديل التالي أكثر استهدافًا.

تتحقق الحلقة من المخرجات، وتقيس الأداء باستخدام أحداث CUDA، ويمكنها التوقف عند بلوغ الحد المضبوط للجولات، أو الوصول إلى التقارب، أو تحقيق ما لا يقل عن 95% من كفاءة حد الأداء النظري. يسرد المستودع دعمًا كاملًا لـNVIDIA CUDA ودعمًا لـIntel XPU، من دون دعم AMD ROCm. ويعمل على Linux وmacOS باستخدام Python من 3.8 إلى 3.12، ويتطلب Triton وPyTorch ومزود نماذج من OpenAI أو Anthropic أو مزودًا مخصصًا. يعرض مستودع KernelAgent مصفوفة الدعم الحالية.

يغطي الاختبار المنشور 100 مهمة من KernelBench Level 1. ويذكر الباحثون تحسنًا قدره 2.02x على مجموعة أقدم من النوى المولدة، و1.56x على torch.compile الافتراضي، والتفوق على torch.compile في 65 من أصل 100 مهمة، والوصول إلى 89% من سقف H100 وفق نموذج Roofline. كما يُنسب إلى نظام توليد أقدم تحقيق صحة نتائج بنسبة 100% عبر 250 مهمة من Level 1 وLevel 2 وLevel 3؛ لكن لا يصح نقل نسبة الصحة تلك بلا تمحيص إلى كل نتيجة محسنة صادرة عن KernelAgent.

توضح حالة عملية واحدة القيمة الحقيقية بصدق أكبر من المتوسط العام. انخفض تنفيذ ضرب مصفوفة في متجه من 9.52 ميلي ثانية إلى 1.95 ميلي ثانية، في حين وصل torch.compile إلى 2.09 ميلي ثانية. حسّن الوكيل التطبيق الأولي بدرجة كبيرة، لكن هامشه النهائي أمام المترجم المتاح بسهولة كان أصغر بكثير. ولهذا يجب أن يكون خط الأساس الاقتصادي أفضل نظام كنت ستنشره لولا الوكيل، لا أبطأ شيفرة يستطيع الوكيل استبدالها.

الأنسب لـ: فرق PyTorch على NVIDIA CUDA أو Intel XPU التي تريد تكرارًا تقوده بيانات تحليل الأداء

أبرز ميزة: توجيه Roofline بالاستناد إلى 28 مقياسًا من NCU

السعر: البرمجيات بسعر $0 بموجب Apache 2.0؛ وتُحاسب خدمات مزود النموذج واستخدام GPU بصورة منفصلة، وفق التحقق في 16 أغسطس 2026

التجربة المجانية: غير منطبقة

نقاط القوة
ما يجيده
8 points

  • يحول عدادات العتاد إلى اتجاه تحسين محدد
  • يدعم مزودي OpenAI وAnthropic والمزودين المخصصين
  • يستخدم التحقق والتوقيت بأحداث CUDA داخل الحلقة
  • يمنح فرق PyTorch مسارًا واضحًا من توليد النواة إلى تحسين موجّه بالعتاد
  • لا يدعم AMD ROCm
  • يركز اختبار التحسين الرئيسي المنشور على KernelBench Level 1، لا على مجموعة نماذج إنتاجية
  • تعتمد مضاعفات السرعة الإجمالية على خط الأساس المختار
  • يضيف تحليل الأداء عبر NCU متطلبات خاصة بالبيئة والأدوات

ينبغي أن يكون KernelAgent خيارك الثاني إذا كنت تقدر بنية أصلية وواضحة لـPyTorch ومرونة مزودي النماذج. ويصبح الخيار الأول عندما يقع الهدف بالفعل ضمن حزمة التقنيات المدعومة ويريد الفريق فهم سبب بطء النواة. لكنه أقل ملاءمة لحملة مستقلة واسعة تحتاج مباشرة إلى أرشيف يمتد بين عمليات التشغيل وأدوات تدقيق خصومية.

3. AutoKernel: أفضل حلقة بسيطة لتجارب تمتد طوال الليل

يمثل AutoKernel أفضل نقطة بداية عملية لفريق يريد من Claude أو Codex أو وكيل برمجي آخر تشغيل حلقة مباشرة لتحليل الأداء والتعديل والقياس طوال الليل. فهو يحلل النموذج، ويستخرج الاختناقات، ويعدل Triton أو CUDA C++، ويحتفظ بكل حل مرشح أو يتراجع عنه، ثم يتحقق من النموذج النهائي من طرف إلى طرف.

مستودع AutoKernel على GitHub
AutoKernel

يوثق المشروع اختبارًا ثابتًا من 5 مراحل للتحقق من صحة النتائج مع تقرير Roofline. وتكمن أهمية ثبات المنظومة في أن الوكيل البرمجي المفتوح الصلاحيات قد يحسن النتيجة بتغيير الاختبار بدل النواة. أما حلقة AutoKernel فتعرض كل حل مرشح للتجربة نفسها، ولا تحتفظ إلا بالتحسينات المقاسة.

ومن السهل وضع ميزانية لمعدل التشغيل المخطط. تقدر الوثائق مدة التجربة الواحدة بنحو 90 ثانية، أي قرابة 40 تجربة في الساعة ونحو 320 تجربة خلال الليل. وهذه أرقام تخطيطية، وليست إنتاجية مضمونة. ويصف المستودع أيضًا إجراء 50 إلى أكثر من 300 تجربة لكل مسألة في KernelBench، ضمن مجموعة تتجاوز 250 مسألة. يوثق AutoKernel الحلقة والمتطلبات الحالية.

يمثل اتساع دعم العتاد ميزة حقيقية. تشمل أهداف NVIDIA المختبرة H100 وA100 وRTX 4090. وأضاف الإصدار 1.3 دعم AMD ROCm لكل من MI300X وMI325X وMI350X وMI355X. وتتطلب الأداة Python 3.10 أو أحدث وuv، كما توثق 9 أنواع من النوى.

ومن المهم بالقدر نفسه فهم حدود الأدلة: يصف ملف README العام منظومة الاختبار وسير العمل وحجم الحملات، لكنه لا ينشر اختبارًا إجماليًا مستقلًا وحديثًا عبر جميع الأهداف المدعومة. لا يجعل ذلك AutoKernel أداة ضعيفة؛ بل يعني أن حجة اعتماده الصادقة تقوم على قابلية النشر وتصميم التجارب، لا على الفوز في لوحة صدارة.

الأنسب لـ: الفرق التي تريد حلقة ليلية سهلة الفهم ومتوافقة مع طيف واسع من الوكلاء

أبرز ميزة: تجارب بسيطة تقرر الاحتفاظ بالحل أو التراجع عنه، يليها تحقق نهائي من طرف إلى طرف

السعر: البرمجيات بسعر $0 بموجب ترخيص MIT؛ وتُحاسب تكاليف الوكيل البرمجي واستخدام GPU بصورة منفصلة، وفق التحقق في 16 أغسطس 2026

التجربة المجانية: غير منطبقة

نقاط القوة
ما يجيده
8 points

  • يعمل مع Claude أو Codex أو أي وكيل برمجي آخر
  • يدعم بطاقات NVIDIA المختبرة وأهدافًا حديثة مختارة من AMD Instinct
  • يستخدم فحصًا ثابتًا من 5 مراحل لصحة النتائج
  • يتحقق من النتيجة داخل النموذج كاملًا بدل التوقف عند نواة معزولة
  • لا توجد نتيجة إجمالية مستقلة وحديثة منشورة عبر العتاد المدعوم
  • يتغير معدل التجارب الموثق وفق زمن التجميع وتحليل الأداء وتعقيد النواة
  • يظل دعم العتاد الواسع بحاجة إلى تحقق محلي على حزمة البرمجيات المستخدمة فعليًا
  • توفر الحلقة العامة ذاكرة حملات وعمق تدقيق أقل من AKO4X

AutoKernel هو أول تجربة منطقية لفريق يثق أصلًا بوكيله البرمجي وينقصه الانضباط التجريبي. اختره بدل KernelAgent عندما تكون إنتاجية العمل الليلي وحرية اختيار الوكيل أهم من تصميم متعدد الوكلاء تقوده بيانات NCU. واختره بدل AKO إذا أراد الفريق حلقة أخف أو احتاج إلى أهداف ROCm المدرجة. لكن لا تختره لمجرد أن 320 تجربة تبدو أفضل تلقائيًا من 40؛ فجودة البحث تتوقف على منظومة الاختبار، وتنوع الحلول المرشحة، وخط الأساس.

4. Apex: أفضل مسار متخصص لـAMD ROCm

Apex هو أفضل خيار متخصص لتحسين أعباء AMD ROCm المدعومة. والمقصود هنا مُحسِّن AMD-AGI الوكيلي، لا NVIDIA Apex، إذ ترتبط افتراضات تشغيله صراحة بعتاد AMD Instinct.

مستودع AMD-AGI Apex على GitHub
Apex

الهدف الافتراضي هو MI355X، مع دعم معلن لكل من MI300X وMI300A وMI250X. تتطلب البيئة Ubuntu 22.04 أو أحدث، وPython 3.10 أو أحدث، وNode.js 18، وROCm 6.x أو أحدث لأغراض التقييم. ويثبت الإعداد الحالي حزمة PyTorch مبنية لـROCm 7.2. يستطيع Apex تنسيق Claude Code أو Codex أو Cursor، لكنه لا يتضمن وصولًا إلى النماذج. يسرد مستودع Apex الهدف الحالي وحدود الإعداد.

صُمم سير العمل بعقلية إنتاجية. يقيس Apex عبء العمل، ويحدد موضع الاختناق، ويطلب من الوكيل تحسينًا، ويقيّمه باستخدام Magpie، ثم يدمج الحلول المرشحة التي تتجاوز 1.05x، وينهي العمل باختبار من طرف إلى طرف. ويمكنه تطبيق تعديلات فورية على مسارات Python أو Triton في aiter وvLLM وSGLang، وكذلك aiter HIP. لكنه لا يستطيع تطبيقها على مكتبات C++ النظامية أو امتدادات _C.so أحادية البنية. وهذا الحد أهم من قائمة الوكلاء لديه: فإذا وقع الاختناق خلف سطح تكامل لا يستطيع Apex استبداله، فلن تصل الحملة إليه.

يشمل تحقق المورّد 7 نوى. ويورد نتائج قدرها 36.35x لـall_reduce و1.14x لـfused_moe و1.05x لـrms_norm و1.00x للنوى الـ4 المتبقية. تعامل مع نتيجة 36.35x بوصفها نتيجة مفيدة لنواة واحدة، لا عائدًا متوقعًا للمجموعة كلها. أما النوى الـ4 التي لم تتغير فتُظهر أن حد القبول يستطيع أن يقرر، على نحو صحيح، ترك الشيفرة كما هي.

الأنسب لـ: فرق AMD Instinct التي يقع اختناقها ضمن مسار تعديلات فورية يدعمه ROCm

أبرز ميزة: تحسين وكيلي وتقييم من طرف إلى طرف مصممان حول ROCm

السعر: البرمجيات بسعر $0 بموجب ترخيص MIT؛ وتُحاسب تكاليف الوصول إلى النموذج وحوسبة AMD GPU بصورة منفصلة، وفق التحقق في 16 أغسطس 2026

التجربة المجانية: غير منطبقة

نقاط القوة
ما يجيده
8 points

  • يمنح فرق AMD مسارًا متخصصًا بدل التعامل مع ROCm كإضافة ثانوية
  • يدعم Claude Code وCodex وCursor
  • يستخدم حد دمج مقاسًا قدره 1.05x
  • ينهي العمل باختبار أداء من طرف إلى طرف
  • مخصص لـAMD ROCm فقط
  • لا تصل التعديلات الفورية إلى مكتبات C++ النظامية أو امتدادات _C.so أحادية البنية
  • تضم مجموعة التحقق المنشورة 7 نوى
  • لا ينبغي تعميم نتيجة all-reduce الكبيرة على النوى الأخرى

يتصدر Apex التوصيات فور أن يكون هدف الإنتاج مسرّع AMD مدعومًا، وأن تقع الشيفرة الساخنة داخل السطح القابل للتعديل. ويأتي AutoKernel بالإصدار 1.3 بديلًا عندما تلائمك آليات حملاته الأوسع أو مساره المعلن من MI300X إلى MI355X. ولا ينبغي اختيار أي منهما اعتمادًا على كلمة "AMD" وحدها؛ تحقق من المسرّع الدقيق، وحزمة ROCm، ونقطة التكامل.

5. CUDA Agent: أعلى سقف بحثي، لكنه ليس خيارًا للشراء

CUDA Agent هو النظام البحثي الأكثر إثارة للاهتمام في هذه المقارنة، والأضعف من حيث الشراء. يدرب مشروع ByteDance Seed وTsinghua University نظامًا باستخدام التعلم المعزز لأعمال CUDA، وينشر مجموعة بيانات من 6,000 مثال، ومهارة لوكيل برمجي، ومجلد عمل للوكيل.

صفحة مشروع CUDA Agent البحثي
CUDA Agent

يصفه الباحثون بأنه أول نظام مدرب بالتعلم المعزز لتطوير CUDA. ويسجل تقييمهم على KernelBench معدل اجتياز إجماليًا قدره 98.8%، مع تفوق 96.8% من المسائل على torch.compile، وتسريع بمتوسط هندسي قدره 2.11x مقارنة بـtorch.compile. وفي Level 3، يذكرون معدل اجتياز 94%، وتفوق 90% من المسائل على torch.compile، وتسريعًا بمتوسط هندسي قدره 1.52x. تعرض صفحة مشروع CUDA Agent إعداد اختبار الأداء.

الإعداد ضخم: حتى 128,000 رمز سياق، و150 جولة تدريب، و200 جولة تقييم. وكان على الحل المرشح أن يتفوق على torch.compile بأكثر من 5%، وأن يجتاز فحص صحة النتائج على 5 مدخلات، وألا يغير البرامج النصية المحمية، وأن يعمل بلا استرجاع من الويب. وتجعل هذه الضوابط النتيجة المنشورة أكثر فائدة من عرض لوكيل برمجي بلا قيود.

لكن عائق الشراء ملموس. لا يسرد موقع المشروع ولا المستودع العام أوزان نموذج قابلة للتنزيل أو نقطة وصول مُدارة. وقد تساعد مجموعة البيانات والمهارة في بناء نظامك، لكنهما لا تمثلان المنتج المدرب الذي تصفه النتيجة الرئيسية. وإلى أن يتاح النموذج الفعلي أو الخدمة، سيبقى CUDA Agent مرجعًا بحثيًا، لا مزود تحسين قابلًا للنشر.

الأنسب لـ: الباحثين في تدريب الوكلاء ومسارات CUDA وتقييم KernelBench

أبرز ميزة: إعداد منشور للتعلم المعزز ونتيجة قوية على KernelBench وفق تقارير الباحثين

السعر: غير معروض للبيع؛ تتوفر مواد بحثية عامة، ولا توجد فئة تجارية مدرجة حتى 16 أغسطس 2026

التجربة المجانية: غير منطبقة

نقاط القوة
ما يجيده
8 points

  • ينشر إعدادًا واسعًا للتدريب والتقييم
  • يطرح مجموعة بيانات من 6,000 مثال ومواد للوكلاء
  • يستخدم برامج نصية محمية وحدًا مقاسًا للتحسن
  • يورد نتائج قوية حتى KernelBench Level 3
  • لا توجد أوزان مدرّبة قابلة للتنزيل ضمن المواد المدرجة
  • لا توجد نقطة وصول مُدارة مدرجة
  • لا يثبت أداء KernelBench إمكانية التكامل في الإنتاج أو استرداد التكلفة
  • لا يجيب نطاق CUDA عن قرار AMD ROCm

ضع CUDA Agent على قائمة المتابعة التقنية، واجعل انضباطه في التقييم معيارًا للحكم على الادعاءات الأخرى. لكن لا تُدخله في مقارنة شراء كما لو كان الفريق يستطيع شراء النموذج المعلن اليوم. فهذا الفارق هو ما يفصل بين الاستشهاد بسقف بحثي واختلاق منتج غير موجود.

أي أداة تناسب كل فريق؟

اختر AKO إذا كنت تعمل على NVIDIA، وتستطيع استخدام Claude Code، وتريد أقوى بنية معلنة للحملات والتدقيق. وتزداد جاذبيته عندما تكون لديك عائلة من النوى المهمة، وجولات تحسين متكررة، ووفورات محتملة تكفي لتبرير حفظ المسارات بين عمليات التشغيل.

اختر KernelAgent إذا كان فريقك يعمل أساسًا في PyTorch ويريد أن تستند الخطوة التالية للمُحسِّن إلى مقاييس NCU وتصنيف Roofline. إنه الخيار الأكثر طبيعية لأعمال NVIDIA أو Intel XPU المدعومة عندما يريد المهندسون فهم اختناق العتاد، لا مجرد قبول حل أسرع.

اختر AutoKernel إذا كنت تحتاج إلى خطوة تشغيلية أصغر: صِل وكيلك البرمجي الحالي، وحلل أداء النموذج، وشغّل سلسلة ثابتة من التجارب طوال الليل. وهو أيضًا المسار الأوسط المرن عندما يكون Codex ضروريًا أو عندما يجعل هدف مدرج من AMD Instinct كلًا من AKO وKernelAgent أقل ملاءمة.

اختر Apex إذا كان عبء العمل يعمل على عتاد AMD Instinct مدعوم، وكان الاختناق داخل مسار قابل للتعديل في aiter أو vLLM أو SGLang أو HIP. على AMD، يتفوق تطابق العتاد هذا على اتساع أدلة الحملات المنشورة لـAKO.

اختر CUDA Agent للأبحاث أو التخطيط لإعادة التجربة أو تصميم التقييم فقط، إلى أن تتاح أوزان مدرّبة أو نقطة وصول مُدارة.

الخلاصة الصريحة للترتيب هي: العتاد أولًا، ثم سطح التكامل، ثم أداة التحقق، ثم اختبار الأداء. يأتي اسم النموذج لاحقًا. وإذا اجتاز نظامان هذه المرشحات، ففضّل من يكشف المقام ونطاقات الإخفاق والنتيجة من طرف إلى طرف. تحسن أقل لكنه قابل للمقارنة أنفع من رقم مذهل مرتبط بخط أساس غير مناسب.

وللسؤال الأوسع عن اختيار طبقة التنسيق المحيطة بمنظومة متخصصة، تعرض مقارنة منصات وكلاء الذكاء الاصطناعي المفاضلات ذات الصلة. أبقِ هذا القرار منفصلًا عن حلقة النواة نفسها.

التكلفة الفعلية لتحسين أداء GPU: ابدأ بتجربة $299.99 واشترط العائد

سعر البرمجيات مفتوحة المصدر هو بند التكلفة الأقل أهمية. فالحملة الحقيقية تجمع بين وقت المسرّع، والوصول إلى الوكيل، وأعباء التجميع وتحليل الأداء، ومراجعة الخبراء.

كان سعر NVIDIA B200 المعلن لدى Modal هو $0.001736 في الثانية، أو $6.2496 في الساعة، عند التحقق في 16 أغسطس 2026. وتبلغ تكلفة فئة Starter $0 شهريًا إضافة إلى الحوسبة، وتشمل رصيد حوسبة شهريًا بقيمة $30 و3 مقاعد. أما Team فتكلف $250 شهريًا إضافة إلى الحوسبة، وتشمل رصيد حوسبة شهريًا بقيمة $100 ومقاعد غير محدودة. وتعرض Enterprise أسعار حوسبة مخصصة. تنشر Modal الأسعار الحالية.

وبذلك تكلف 32 ساعة على B200 مبلغ $199.99. أضف خطة وكيل بقيمة $100، فتصبح ميزانية الحملة الأولى $299.99 قبل وقت المهندسين. وقد اختير هذا السقف ليكون صغيرًا بما يكفي لإيقاف فكرة ضعيفة، وكبيرًا بما يكفي لتجاوز عرض تجريبي رمزي.

توفر خطط الوصول الحالية إلى الوكلاء عدة نقاط مرجعية للميزانية. تبلغ تكلفة ChatGPT Plus $20 شهريًا. ويقدم ChatGPT Pro خيارًا بقيمة $100 مع استخدام يعادل 5x من Plus، وخيارًا بقيمة $200 مع استخدام يعادل 20x؛ وكلاهما يشمل Codex. لدى Claude فئة Free بقيمة $0، وClaude Pro بسعر $17 شهريًا عند الفوترة السنوية ودفع $200 مقدمًا، أو $20 عند الفوترة الشهرية، إلى جانب Max بسعر $100 لاستخدام 5x أو $200 لاستخدام 20x. ويشمل Claude Pro أداة Claude Code. جرى التحقق من هذه البيانات في 16 أغسطس 2026 عبر معلومات Plus من OpenAI، ومعلومات Pro من OpenAI، وصفحة أسعار Anthropic، ودليل خطط Anthropic. وقد تختلف فوترة API، لذا افصل تكلفة رموز النموذج عن حوسبة GPU؛ ويشرح دليل أرخص API للذكاء الاصطناعي هذه الطبقة.

والآن قارن التجربة بفاتورة الإنتاج. تبلغ تكلفة تشغيل بطاقة B200 واحدة لمدة 720 ساعة بالسعر المعلن الحالي $4,499.71. وإذا استهلكت النواة المستهدفة 25% من عبء العمل وأصبحت أسرع بمقدار 2x، يوفر عبء العمل كاملًا 12.5%، أي $562.46 شهريًا. وعندها تسترد تجربة $299.99 تكلفتها خلال نحو 16 يومًا.

أما إذا كانت النواة لا تستهلك سوى 5%، فإن تحسينها بالمقدار نفسه، 2x، لا يوفر إلا 2.5%، أي $112.49 شهريًا. وهنا تمتد مدة استرداد التكلفة إلى نحو 80 يومًا. نتيجة التحسين واحدة؛ لكن نتيجة الأعمال مختلفة.

مقارنة مدة استرداد تكلفة تجربة تحسين GPU بقيمة 299.99 دولارًا عندما تستهلك النواة الساخنة 25 بالمئة أو 5 بالمئة من زمن التنفيذ
يسترد تحسين النواة بمقدار 2x تكلفة التجربة نفسها خلال نحو 16 يومًا أو 80 يومًا، وفق حصة النواة من زمن التنفيذ.

هذه الحسبة متحفظة من ناحية وناقصة من ناحية أخرى. فهي تستخدم سعر وقت المسرّع المعلن أساسًا للوفر، لكنها لا تشمل وقت المهندسين، وتقلب تكلفة رموز النموذج، وأعباء التجميع، وخصومات السعة المحجوزة، وتغيرات الاستفادة من العتاد. استبدل كل مدخل ببيانات فاتورتك الفعلية قبل اعتماد حملة أطول.

كيف اخترنا أدوات تحسين GPU المعتمدة على الذكاء الاصطناعي؟

هذه مقارنة للوثائق والأدلة الحالية، وليست ادعاءً بأن الأنظمة الـ5 ثُبتت واختُبرت على عتاد متطابق. ولهذا يقول العنوان مقارنة، لا اختبار. وكان على كل نظام مدرج أن يقدم وكيلًا أو منظومة عملية للعمل على نوى GPU، ووصفًا عامًا صادرًا عن الجهة المطورة نفسها، وتفاصيل تطبيق تكفي لتحديد المستخدم المناسب وحدود الاستخدام.

يعتمد الترتيب على 6 معايير:

  • قابلية النشر: هل يستطيع المطور الحصول على النظام المعني وتشغيله الآن؟
  • ملاءمة العتاد: هل يدعم المسرّع المستهدف وحزمة البرمجيات بوضوح؟
  • صرامة التحقق من الصحة: هل تقاوم المنظومة الإجابات المخزنة مؤقتًا والاختبارات المعدلة والأشكال الضيقة وهوامش الخطأ المتساهلة؟
  • مقام اختبار الأداء: هل يُذكر خط الأساس، وهل تظهر حالات الإخفاق أو عدم التحسن؟
  • التحقق من طرف إلى طرف: هل يعود سير العمل إلى النموذج أو الخدمة الفعلية بعد تحسين النواة المعزولة؟
  • وضوح التكلفة: هل يستطيع الفريق وضع ميزانية محدودة لـGPU والوكيل حول الحملة الأولى؟

لا يحسب الترتيب متوسطًا لمضاعفات يعلنها المورّدون. بل يكافئ جودة الأدلة، وملاءمة التشغيل، واحتمال تحويل اختبار محلي إلى وفر إنتاجي موثوق. ولهذا قد تكون نتائج AKO الواسعة بين 1.14x و1.43x أهم من رقم منعزل أكبر بكثير، كما أن نتيجة CUDA Agent البالغة 2.11x على KernelBench لا تتغلب على غياب نموذج قابل للنشر.

لا ينتمي أي شريك من المجموعة التجارية النشطة للموقع بصورة طبيعية إلى مجال تحسين نوى GPU. وإقحام أداة للهاتف أو CRM أو التدريب أو المحاسبة أو مواقع الويب هنا سيقلل موثوقية الصفحة. لذلك لا تستخدم هذه المقارنة أي موضع تسويق بالعمولة، ولا ترتب سوى الأنظمة ذات الصلة.

أدوات وحالات ينبغي تجنبها

تجنب KernelAgent مع AMD ROCm. تضم قائمة دعمه الحالية NVIDIA CUDA وIntel XPU، لا AMD ROCm. ولا يستطيع التصميم الموجّه بتحليل الأداء تعويض غياب دعم بيئة التشغيل.

تجنب AMD-AGI Apex لأعمال NVIDIA. نسخة Apex المقصودة هنا مبنية لـROCm وAMD Instinct. وهي ليست NVIDIA Apex، مشروع الدقة المختلطة والتدريب الموزع المنفصل. تحقق من هوية المشروع قبل تخصيص وقت المهندسين.

تجنب CUDA Agent باعتباره خدمة إنتاج مُدارة قابلة للشراء. مجموعة بياناته ومهارته ومواد العمل الخاصة به عامة، لكن الأوزان المدربة ونقطة الوصول غير مدرجتين. ادرسه، لكن لا تضع له ميزانية كخدمة قائمة.

تجنب AKO عندما لا يكون Claude Code تبعية معتمدة. تنبع قيمة منظومة AKO الحالية تحديدًا من قدرتها على ضبط وكيل قائم، لكن ملاءمة ذلك الوكيل تظل تبعية يجب تقييمها في الشراء والأمن.

تجنب AutoKernel عندما يشترط القرار اختبارًا إجماليًا مستقلًا قبل أي تجربة أولية. تشرح مواده العامة الحلقة والأهداف المدعومة جيدًا، لكنها لا تقدم نتيجة إجمالية مستقلة وحديثة عبر هذه الأهداف. نفّذ تجربة محدودة، أو اختر نظامًا بأدلة أقرب إلى متطلباتك.

وقبل كل شيء، تجنب تقديم جلسات Claude Code أو Codex المجردة بوصفها مُحسِّنًا متكاملًا. يستطيع كلاهما كتابة النوى ومراجعتها، ويستطيع AutoKernel أو Apex تنسيقهما، لكن المنتج الحقيقي هو ما يحيط بهما: أداة تحليل الأداء، والتطبيق المرجعي غير القابل للتغيير، وفحوص صحة النتائج، وتوقيت اختبار الأداء، ومنطق الاحتفاظ أو التراجع، وفحص النشر. من دون هذه المنظومة، يصبح الوكيل كاتبًا متحمسًا للنوى يصحح اختباره بنفسه.

الأسئلة الشائعة

هل يستطيع Codex تحسين نوى CUDA وTriton؟

نعم. يعمل AutoKernel صراحة مع Codex لتحسين Triton أو CUDA C++، كما يستطيع Apex تنسيق Codex في أعمال AMD ROCm المدعومة. لكن Codex وحده ليس نظام التحسين كاملًا؛ فهو يحتاج إلى أداة تحليل أداء، ومنظومة محمية للتحقق من الصحة، واختبار أداء، وحلقة تقرر الاحتفاظ بالحل أو التراجع عنه.

هل KernelAgent أفضل من AutoKernel؟

يكون KernelAgent أفضل عندما تكون الأولوية لحلقة أصلية لـPyTorch، ومقاييس NCU، وتحسين NVIDIA أو Intel XPU بتوجيه Roofline. ويكون AutoKernel أفضل لمن يريد حلقة ليلية أبسط، أو حرية أكبر في اختيار الوكيل، أو أهداف NVIDIA وAMD Instinct المدرجة لديه.

هل يحسن Apex بطاقات GPU من NVIDIA؟

لا. AMD-AGI Apex مُحسِّن لـROCm على عتاد AMD Instinct المدعوم. لا تخلطه مع NVIDIA Apex، فهو مشروع مختلف وليس المُحسِّن الوكيلي المصنف هنا.

ما أفضل وكيل ذكاء اصطناعي لتحسين أداء GPU من AMD؟

Apex هو أول خيار متخصص لعبء عمل مدعوم على AMD Instinct يقع داخل سطح التكامل القابل للتعديل. ويقدم AutoKernel بالإصدار 1.3 البديل الأوسع لكل من MI300X وMI325X وMI350X وMI355X.

كيف ينبغي مقارنة نتائج KernelBench؟

اربط كل نتيجة بالعتاد، ومستوى المهمة، وخط الأساس، وتعريف الاجتياز، ومدخلات فحص الصحة، وطريقة حساب المتوسط الهندسي. فالنتيجة المقاسة أمام torch.compile لا تكافئ نتيجة أمام تطبيق خبير أو خط أساس أولي في مسابقة.

هل يستحق وكيل نوى GPU الاستثمار لفريق صغير؟

قد يستحق، إذا أظهر تحليل الأداء أن نواة واحدة تستهلك حصة كافية من فاتورة مسرّع متكررة. ابدأ بتجربة $299.99 وطبّق بوابة العائد للنواة الساخنة؛ ثم توقف إذا لم يستطع الوفر المقاس من طرف إلى طرف استرداد تكلفة العمل ضمن المدة المستهدفة.

ماذا تفعل صباح الاثنين؟

لا تثبت الأنظمة الـ5 كلها. صباح الاثنين، حلل عبء عمل إنتاجيًا واحدًا ممثلًا للاستخدام، وسجل حصة أكثر النوى استهلاكًا للوقت من زمن التنفيذ الإجمالي. ثم اختر مسارًا واحدًا: AKO لحملة NVIDIA مدققة، أو KernelAgent لحلقة PyTorch تقودها عدادات العتاد، أو AutoKernel لبحث ليلي أخف، أو Apex لعتاد AMD ROCm المدعوم.

ضع سقف التجربة الأولى عند 32 ساعة على B200 مع خطة وكيل بقيمة $100، أو ما يعادل ذلك على عتادك. ثبّت التطبيق المرجعي واختبار الأداء، وأضف فحوص صحة بقيم جديدة. واشترط أن تصمد النواة الفائزة خارج حلقة الوكيل نفسه، وأن تحسن عبء العمل كاملًا لا اختبارها المصغر فقط.

قاعدة النشر في جملة واحدة: من دون عائد مقاس من طرف إلى طرف، لا توجد حملة ثانية.

آخر تحديث

3 سبتمبر 2026

التصنيفBuild

فضّل هذا الموقع في Google

إضافة omidsaffari.com كمصدر مفضّل في بحث Google

اجعل omidsaffari.com مصدرًا مفضّلًا، وسيرفعه Google لك في Top Stories وAI Overviews وAI Mode.

المزيد من Build

عرض كل مقالات Build
النشرة البريدية

رسالة واحدة، كل يوم أحد. أنظمة تعمل، لا آراء ساخنة.

سجلات بناء، وأنظمة قيد التشغيل، وملاحظات ميدانية من إدارة محفظة مشاريع ذكاء اصطناعي.

أسبوعية. بلا إزعاج. يمكنك إلغاء الاشتراك متى شئت.