أفضل نماذج الذكاء الاصطناعي المحلية في 2026: مقارنة شاملة
مقارنة لأفضل نماذج الذكاء الاصطناعي المحلية لعام 2026 حسب حجم الذاكرة وعبء العمل، مع أحجام 4-bit وخطوات التشغيل وأدوات التشغيل.

أفضل نموذج لغوي محلي لجهاز بذاكرة 32 GB هو Qwen3.6-35B-A3B: فحجم نسخته الحالية بدقة 4-bit على Ollama يبلغ 24 GB، مما يترك 8 GB قبل أن تستهلك بيئة التشغيل ونظام التشغيل وذاكرة السياق المؤقتة حصتها. لأجهزة 8 GB، اختر Qwen3.5-9B؛ ولأجهزة 16 GB، اختر Gemma 4 12B للمهام متعددة الوسائط أو gpt-oss-20b لمهام التفكير المنطقي.
الإجابة المختصرة: ما هي أفضل نماذج الذكاء الاصطناعي المحلية لكل جهاز؟
يجب أن يتسع النموذج المحلي في الذاكرة أولاً قبل أن تصبح لأي معايير أداء قيمة فعلية. يبدو هذا بديهياً، ومع ذلك فهو الخطأ الأبرز وراء معظم التوصيات غير الدقيقة: فالنموذج المتناثر (sparse model) قد يفعّل بضعة مليارات من المعلمات فقط لكل رمز (token)، لكنه لا يزال يتطلب تحميل كافة الأوزان في الذاكرة.
يبدأ هذا التصنيف بحجم الملف الفعلي القابل للتنزيل حالياً، ويضيف هامش العمل الضروري، وفقط عندئذ يحدد ما يجيده النموذج. هذه المقارنات مستندة إلى بطاقات النماذج الرسمية وصفحات أدوات التشغيل الحالية، وليست ادعاءات أداء مأخوذة من اختبارات غير موثقة.
الخيار الافتراضي الأفضل من بين أفضل نماذج الذكاء الاصطناعي المحلية هو Qwen3.6-35B-A3B على جهاز يحتوي على قرابة 32 GB من الذاكرة المتاحة للنظام أو الذاكرة الموحدة. فهو يجمع بين الأوزان المفتوحة، والإدخال متعدد الوسائط، والبرمجة بالوكلاء المستقلين ضمن حزمة Q4_K_M الحالية بحجم 24 GB. وإذا لم يتسع هذا الملف مع توفير مساحة كافية للعمل، فإن الانتقال إلى Qwen3.5-9B هو قرار أفضل بكثير من إجبار النموذج الأكبر على استخدام ذاكرة المبادلة (swap).
تحتوي فئة 16 GB على فائزين لأن نوع عبء العمل هو الذي يحسم الأمر. يُعد Gemma 4 12B الخيار الأكثر عملية إذا كان المساعد يحتاج لفحص الصور أو الفيديو أو الصوت. في حين يمثل gpt-oss-20b خيار التفكير المنطقي واستخدام الأدوات، إلا أن حزمته البالغة 14 GB تترك 2 GB فقط قبل أن تطلب بقية أجزاء الكمبيوتر حصتها من الذاكرة.
كم تحتاج نماذج الذكاء الاصطناعي المحلية من الذاكرة فعلياً؟
تختلط أربعة مفاهيم باستمرار في مناقشات النماذج المحلية: إجمالي المعلمات، والمعلمات النشطة، وحجم الملف المُكمم، وذاكرة العمل الفعلية. ولكل منها وظيفة مختلفة.
إجمالي المعلمات (Total parameters) يعبر عن كافة الأوزان المُتعلمة داخل النموذج. بينما تمثل المعلمات النشطة (Active parameters) الجزء المخصص الذي يستخدمه نموذج خليط الخبراء (MoE) لمعالجة رمز واحد. الرقم الثاني يشرح كفاءة المعالجة الحسابية، لكن الرقم الأول يظل هو الحاسم بالنسبة للتخزين والمساحة المشغولة في الذاكرة. توضح Google هذا التمييز صراحةً لنموذج Gemma 4 26B A4B: حيث لا ينشط سوى 4 مليار معلمة فقط، ومع ذلك يجب تحميل كافة الـ 26 مليار معلمة بالكامل في الذاكرة.
تقنية التكميم (Quantization) تخزن تلك الأوزان بدقة رقمية أقل. النسخة المعدة بدقة 4-bit تكون أصغر بكثير مقارنة بالدقة الكاملة، مع احتمال وجود مقايضة طفيفة في القدرات. يشبه ذلك ضغط خريطة مفصلة في طبعة جيب بدلاً من حذف ثلاثة أرباع الشوارع: البنية الأساسية تظل موجودة، ولكن مع فقدان بعض التفاصيل الدقيقة.
ذاكرة العمل (Working memory) هي حجم ملف النموذج مضافاً إليه كل ما يلزم لتشغيله. بيئة التشغيل تحتاج إلى ذاكرة. ونظام التشغيل يحتاج إلى ذاكرة. وذاكرة KV المؤقتة (KV cache)، وهي مساحة عمل سريعة لتخزين الأوامر وسياق الحوار المتولد، تتسع مع زيادة طول المحادثة. يحذر جدول Gemma الخاص بـ Google من أن تقديرات الأوزان الثابتة تستثني البرمجيات المساعدة ونافذة السياق.
لهذا السبب، فإن نموذجاً يُعلن عنه بدعم سياق يصل إلى 256K قد يتسع في الذاكرة، بينما لا تتسع الذاكرة لنافذة السياق الكاملة البالغة 256K. فالحد الأقصى للسياق هو أقصى مدى تدعمه معمارية النموذج، وليس ضماناً لما يمكن لجهازك المحمول استيعابه. كل من Qwen3.5-9B وQwen3-Coder-Next ينصحان المستخدمين بتقليل حجم السياق عند ظهور أخطاء نفاد الذاكرة.
ابدأ بتحديد فئة الذاكرة ثم اختر النموذج
استخدم هذه المستويات كحدود دنيا للتثبيت، وليست ضمانات لكافة أطوال السياق الممكنة:
- 4 GB ذاكرة VRAM مخصصة: يُعد ملف Phi-4-mini بدقة Q4_K_M وحجم 2.5 GB خياراً موثوقاً ضمن النماذج الصغيرة إذا توفرت في الجهاز ذاكرة RAM عادية كافية. وللاستخدام الحصري على المعالج CPU، فإن 8 GB من ذاكرة النظام هي الحد الأدنى الأكثر منطقية.
- 8 GB ذاكرة VRAM مخصصة: تتسع حزمة Qwen3.5-9B بحجم 6.6 GB إذا ظل السياق متواضعاً. ويُعد الجهاز الذي يحتوي على 12 GB أو أكثر من الذاكرة الإجمالية أو الموحدة خياراً أكثر أماناً.
- 16 GB ذاكرة متاحة: يحقق Gemma 4 12B التوافق الأكثر استقراراً. ويصل gpt-oss-20b إلى الحد الأدنى الرسمي المحدد من OpenAI عند 16 GB، لكنه خيار شديد الضيق.
- 32 GB ذاكرة متاحة: يُعد Qwen3.6-35B-A3B أقوى توصية شاملة هنا لأن حزمته البالغة 24 GB تترك 8 GB قبل استهلاك بيئة التشغيل والسياق.
- 64 GB أو أكثر: يصبح Qwen3-Coder-Next قابلاً للتشغيل عملياً، مع أن حزمته البالغة 52 GB تترك 12 GB فقط لبقية متطلبات النظام.

حساب الهامش المتبقي يوضح مدى التباين بين هذه التوافقات. يترك Qwen3.5-9B مساحة 1.4 GB في تخصيص 8 GB، أي بنسبة 17.5%. ويترك gpt-oss-20b مساحة 2 GB في 16 GB، أي 12.5%. بينما يترك Qwen3.6 مساحة 8 GB في 32 GB، أي 25%. ويترك Qwen3-Coder-Next مساحة 12 GB في 64 GB، أي 18.75%.
هذه النسب لا تمثل الذاكرة المتاحة بعد إطلاق النموذج، بل هي الحد الأقصى المتاح قبل أن يستهلك مشغل النموذج ونظام التشغيل وذاكرة KV المؤقتة حصصهم. وبالتالي، فإن التوافق مع gpt-oss يمثل حداً تقنياً أدنى، في حين يتمتع Qwen3.6 بأفضل هامش أمان صحي بين الخيارات الأربعة.

1. Qwen3.6-35B-A3B: أفضل نموذج محلي شامل لذاكرة 32 GB
يُعد Qwen3.6-35B-A3B أفضل نموذج لغوي محلي متكامل عند توفر 32 GB من الذاكرة الحقيقية. تصفه Qwen بأنه نموذج خليط خبراء يضم 35 مليار معلمة إجمالية مع 3 مليار معلمة نشطة، وأوزان مفتوحة، وتفكير متعدد الوسائط، وتركيز متخصص على البرمجة بالوكلاء المستقلين (agentic coding). تبلغ حزمة Ollama الحالية 24 GB بدقة Q4_K_M، وهو الرقم الفعلي الذي يحسم إمكانية تشغيله على جهازك.

يناسب هذا النموذج المؤسسين والمطورين المحترفين الباحثين عن مساعد خاص واحد لمعالجة استفسارات المستودعات البرمجية، وتخطيط التنفيذ، وفحص الصور، وأعمال البرمجة الطويلة. وهو خيار افتراضي أفضل من النماذج البرمجية البحتة عندما يحتاج المساعد المحلي نفسه إلى قراءة لقطات الشاشة أو المخططات أو المستندات. ورغم أن رقم 3 مليار معلمة نشطة يعزز كفاءة المعالجة، فإنه لا يقلص الحزمة إلى 3 GB: فحجم الملف المثبت بدقة 4-bit يظل 24 GB.
العائق العملي الحقيقي يكمن في طول السياق. يستهلك الملف ثلاثة أرباع تخصيص 32 GB حتى قبل بدء المحادثة. ومستودعات الأكواد الكبيرة والصور المتعددة والسجلات الطويلة كلها تزيد من استهلاك الذاكرة المؤقتة، ولذلك فإن العمل بسياق عملي أقصر أفضل من استخدام الحد الأقصى المُعلن الذي يجبر الجهاز على اللجوء لذاكرة المبادلة (swap).
الأنسب لـ: جهاز بذاكرة 32 GB يحتاج إلى نموذج محلي كفء للبرمجة والاستدلال والتعامل مع الصور.
الميزة البارزة: 35 مليار معلمة إجمالية، 3 مليار نشطة، إدخال متعدد الوسائط، وحزمة Q4_K_M بحجم 24 GB.
الأسعار: أوزان مفتوحة بموجب رخصة Apache License 2.0 مرفقة بحزمة Ollama الحالية؛ وتكلفة التشغيل تقتصر على عتادك المحلي.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- أفضل توازن بين القدرات المتقدمة والتوافق العملي مع ذاكرة 32 GB في هذه القائمة.
- الإدخال متعدد الوسائط يغنيك عن تشغيل نموذج رؤية منفصل.
- البرمجة المعتمدة على الوكلاء تمثل أولوية رسمية مباشرة وليست ميزة ثانوية.
- أمر التثبيت وحزمة Ollama الحالية موثقة وسهلة التحقق تماماً.
- ملف بحجم 24 GB يعتبر كبيراً جداً على أجهزة 24 GB في ظروف الاستخدام المعتادة.
- السياقات الكبيرة قد تستهلك هامش الـ 8 GB المتبقي بسرعة.
- النماذج الأصغر ستستجيب بسرعة أعلى على العتاد المتوسط.
تشغيل الخيار الأول باستخدام Ollama
تحقق من الذاكرة التي يمكنك تخصيصها
اعتمد 32 GB كحد أدنى فعلي لتشغيل هذا الملف بحجم 24 GB. في أنظمة الذاكرة الموحدة، اطرح ما يستهلكه نظام التشغيل والتطبيقات الأخرى أولاً.
تثبيت Ollama
قم بتنزيل أحدث نسخة لسطح المكتب أو سطر الأوامر من Ollama. باقة Free كافية للاستخدام غير المحدود على عتادك الخاص.
تشغيل النموذج عبر الوسم الدقيق
نفذ الأمر
ollama run qwen3.6:35b-a3b. يرتبط هذا الوسم مباشرة بملف Q4_K_M الحالي بحجم 24 GB والموثق في صفحة نماذج Ollama.ابدأ بسياق عمل قصير
ابدأ بمجلد المستودع أو المستندات الضرورية للمهمة المحددة، بدلاً من تحميل أرشيف كامل تلقائياً. وإذا بدأ الجهاز في المبادلة أو أبلغ المشغل عن خطأ نفاد ذاكرة، قلل السياق أولاً قبل التحول لنسخة تكميم أقل دقة.
2. Qwen3.5-9B: أفضل نموذج محلي لبطاقات GPU بحجم 8 GB
يُعد Qwen3.5-9B أفضل نموذج محلي مدمج هنا لبطاقات الرسوميات المنفصلة بذاكرة 8 GB VRAM. تصف بطاقة النموذج الرسمية النموذج بأنه نموذج لغوي سببي (causal language model) يضم 9 مليار معلمة مع مشفر رؤية، وتبلغ حزمة Ollama الحالية 6.6 GB مع دعم إدخال النصوص والصور. وهذا ما يجعله أصغر خيار موصى به في هذه القائمة يمكنه العمل كمساعد يومي موثوق ومتعدد الوسائط.

الاستخدام العملي الواضح له هو رفيق برمجي مكتبي قادر على قراءة لقطات شاشات الأخطاء، أو المخططات الأولية للواجهات، أو الرسوم التوضيحية. يمكن للمطور الفردي الذي يمتلك بطاقة 8 GB استخدامه لشرح الأكواد، وإجراء التعديلات السريعة، والإجابة عن الأسئلة البصرية دون الحاجة لتخصيص 24 GB كما يتطلب Qwen3.6. كما يُعد البديل المنطقي عندما يعمل النموذج الأكبر نظرياً ولكنه يقضي وقته في نقل البيانات عبر الذاكرة.
يتطلب سقف السياق المعلن البالغ 256K انضباطاً في الاستخدام. تحدد بطاقة Qwen الحد الأصلي بـ 262,144 رمزاً وتنصح بوضوح بتقليص السياق عند مواجهة أخطاء الذاكرة. ملف بحجم 6.6 GB يترك فقط 1.4 GB في ميزانية 8 GB VRAM قبل احتساب المشغل والذاكرة المؤقتة، ولذلك فإن الاستفادة من السياق الكامل تتطلب عتاداً أكبر بكثير.
الأنسب لـ: بطاقة GPU منفصلة بذاكرة 8 GB، والمحادثات المدمجة متعددة الوسائط، والمساعدة اليومية في البرمجة.
الميزة البارزة: حزمة بحجم 6.6 GB تدعم إدخال النصوص والصور معاً.
الأسعار: أوزان قابلة للتنزيل دون اشتراك للنموذج على الصفحة الرسمية؛ مع فصل تكلفة العتاد أو أي بيئة تشغيل مستضافة.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- يتوافق مع بطاقات 8 GB الشائعة مع الحفاظ على سياق معتدل.
- يقبل إدخال الصور إلى جانب النصوص.
- أسهل بكثير في التثبيت والتشغيل مقارنة بحزم 20 GB إلى 24 GB.
- ينتمي لعائلة حديثة بدلاً من الاعتماد على خيارات Qwen2.5 السابقة.
- لا يتبقى سوى 1.4 GB فقط من الذاكرة النظرية في بيئة 8 GB.
- أقصى سياق ممكن غير واقعي على الحد الأدنى من متطلبات العتاد.
- نموذج بـ 9 مليار معلمة يملك مساحة أقل للاستدلال الصعب مقارنة بالخيارات الأكبر.
3. Gemma 4 12B: أفضل نموذج محلي متعدد الوسائط لذاكرة 16 GB
يُعد Gemma 4 12B الخيار الأفضل لأجهزة 16 GB عندما تكون معالجة المدخلات متعددة الوسائط ركيزة أساسية لعملك. تعالج عائلة Google الحالية النصوص والصور والفيديو، بينما يقبل إصدار 12B الملفات الصوتية أيضاً. تتيح الأوزان المفتوحة الاستخدام التجاري المسؤول وفقاً لشروط Gemma، مما يجعله ملائماً كمساعد للمستندات والوسائط الخاصة إذا كانت تلك الشروط تتوافق مع متطلبات مشروعك.

يناسب النموذج مسؤولي المنتجات الذين يحتاجون لمقارنة لقطات الشاشة، وتلخيص المكالمات المسجلة، وفحص مقاطع الفيديو القصيرة، وتحليل النصوص المرفقة على الجهاز نفسه. يوفر هذا النموذج تنوعاً في المدخلات يتفوق على gpt-oss-20b المقتصر على النصوص. كما يتمتع بموقف ذاكرة أكثر راحة: فحزمة Ollama الحالية gemma4:12b تأتي بحجم 7.6 GB، مما يترك متسعاً مريحاً ضمن تخصيص 16 GB.
تقدير Google لدقة Q4_0 هو 6.7 GB، في حين يبلغ حجم ملف Ollama الحالي 7.6 GB. ولا يوجد تناقض بين الرقمين لاختلاف حزمة التكميم والبناء. والدرس المستفاد يكمن في تنبيه Google: ذاكرة النموذج الثابتة تستثني البرمجيات المساعدة ونافذة السياق، لذا لا يجب التعامل مع أي من الرقمين كمساحة التشغيل الكاملة.
ينتمي نموذج 12B إلى فئة Gemma المتوسطة بحد سياق 256K. ومثلما هو الحال مع Qwen، فإن هذا السقف البنيوي ليس خياراً افتراضياً عملياً على أجهزة 16 GB. ابدأ بالمستندات أو الوسائط المطلوبة للمهمة أولاً، وزد السياق فقط طالما ظل الجهاز مستجيباً بسلاسة.
الأنسب لـ: مساعد متعدد الوسائط على جهاز 16 GB للنصوص والصور والفيديو والصوت.
الميزة البارزة: دعم واسع للمدخلات بحزمة Ollama الحالية ذات حجم 7.6 GB.
الأسعار: أوزان مفتوحة بموجب شروط Gemma؛ ولا يُشترط أي اشتراك لتنزيل الأوزان.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- أفضل تغطية للمدخلات المتنوعة ضمن فئة 16 GB.
- يترك الملف بحجم 7.6 GB مساحة عمل أوسع مقارنة بـ gpt-oss-20b.
- تقدم Google إرشادات استثنائية من حيث الوضوح حول متطلبات الذاكرة.
- الاستخدام التجاري المسؤول مسموح به صراحة بموجب شروط Gemma.
- تتطلب شروط Gemma مراجعة ترخيص منفصلة للنشر التجاري.
- الوصول للسياق الكامل 256K ليس هدفاً عملياً على الحد الأدنى من الأجهزة.
- اختيار 12B ليس الأصغر ولا الأكبر في العائلة، لذا يسهل الخطأ باختياره بالاسم المجرد فقط.
4. gpt-oss-20b: أفضل نموذج محلي للاستدلال المنطقي عند حد 16 GB
يُعد gpt-oss-20b النموذج المحلي المخصص للاستدلال للأجهزة القادرة على تلبية الحد الأدنى الصارم لذاكرة 16 GB. توضح OpenAI أنه يحتوي على 21 مليار معلمة إجمالية، و3.6 مليار معلمة نشطة، وسياق يصل إلى 128K، وترخيص Apache 2.0، ودعم استخدام الأدوات، واستدعاء الدوال (function calling)، والمخرجات المهيكلة (Structured Outputs)، ومستويات جهد استدلالي تتنوع بين منخفض ومتوسط وعالٍ. تبلغ حزمة Ollama الحالية 14 GB وهي مخصصة للنصوص فقط.

يمثل هذا النموذج الخيار الأنسب للأتمتة المحلية التي تتطلب تحليلاً منطقياً لمهام مهيكلة وإنتاج بيانات وفق مخطط محدد مسبقاً (schema)، مثل تصنيف طلبات الدعم الفني تلقائياً قبل مراجعتها بشرياً. كما يناسب المطورين الذين يفضلون التحكم في مستويات التفكير على حساب معالجة الصور. دُرّب النموذج على مزيج نصوص إنجليزية في معظمه يركز على مجالات العلوم والتكنولوجيا والهندسة والرياضيات والبرمجة والمعرفة العامة، لذلك لا ينبغي اعتباره نموذج رؤية إطلاقاً.
تؤكد OpenAI أن نموذج 20B يمكنه العمل بذاكرة 16 GB. وحزمة Ollama بحجم 14 GB تفسر هذا الحد الأدنى، غير أن الـ 2 GB المتبقية تمثل 12.5% فقط من ذلك التخصيص قبل تشغيل المشغل والنظام وذاكرة السياق المؤقتة. ولذلك، يُنصح بجهاز 24 GB لتوفير بيئة عمل مريحة إذا كان النموذج سيعمل باستمرار بدلاً من الإجابة عن استفسارات قصيرة ومتقطعة.
الأنسب لـ: الاستدلال النصي، والأدوات، والمخرجات المهيكلة، وسير عمل الوكلاء.
الميزة البارزة: 3.6 مليار معلمة نشطة، ومستويات استدلال قابلة للتعديل، وحد أدنى رسمي عند 16 GB.
الأسعار: أوزان مفتوحة تحت ترخيص Apache 2.0؛ دون أي رسوم اشتراك للاستخدام المحلي.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- دعم رسمي قوي لأعباء العمل المعتمدة على الاستدلال والتعامل مع الأدوات.
- ترخيص Apache 2.0 مريح لمعظم المشاريع التجارية.
- تدعم المخرجات المهيكلة ومستويات التفكير القابلة للضبط بناء التطبيقات المتقدمة.
- حزمة 14 GB أصغر بكثير من حزمة Qwen3.6 البالغة 24 GB.
- يدعم النصوص فقط، وبالتالي لا يصلح كبديل للمساعد متعدد الوسائط.
- الحد الأدنى الرسمي 16 GB يترك هامش عمل ضيقاً للغاية.
- المحادثات الطويلة بحجم 128K تتطلب ذاكرة أكبر بكثير مما يوحي به حجم الملف الأساسي.
5. Phi-4-mini-instruct: أفضل نموذج محلي صغير للمعالجات وذاكرة 4 GB VRAM
يُعد Phi-4-mini-instruct أفضل نموذج محلي صغير في هذه المقارنة للأجهزة ذات الموارد المحدودة. تحدد بطاقة نموذج Microsoft مواصفاته بـ 3.8 مليار معلمة، ونافذة سياق بحد أقصى 128K، ومدخلات نصية فقط، ودعم 24 لغة، وترخيص MIT. يبلغ حجم ملف Q4_K_M في Ollama نحو 2.5 GB، مما يمنحه مكانة عملية مناسبة لبطاقة رسوميات منفصلة بذاكرة 4 GB VRAM أو جهاز يعتمد حصرياً على المعالج المركزي CPU مع 8 GB RAM على الأقل.

السيناريو الأنسب له هو أداة محلية متخصصة: إعادة صياغة ردود الدعم الفني، أو استخراج الحقول من مستند قصير، أو تصنيف الملاحظات، أو المساعدة في كتابة نصوص برمجية بسيطة بلغة Python دون الحاجة لإرسال البيانات إلى خوادم سحابية. تخصصه Microsoft صراحةً للبيئات ذات الموارد والذاكرة المقيدة وحساسية زمن الاستجابة، بالإضافة إلى مهام الرياضيات والاستدلال. وهذا سبب كافٍ لاختياره بدلاً من محاولة مقارنته غير العادلة بنماذج 24 GB في كل مهمة.
نقطة ضعفه الأساسية واضحة وصريحة. فتاريخ انتهاء التدريب الثابت هو June 2024، وتحذر Microsoft من أن النموذج الصغير لا يمكنه تخزين قدر كبير من المعرفة الواقعية، مما قد يسبب أخطاء في الحقائق. وتشير بطاقة النموذج إلى تقنيات التوليد المعزز بالاسترداد (RAG) أو البحث كحل وقائي. ببساطة: زوده بالمواد المرجعية للحقائق بدلاً من مطالبته بتذكرها من تدريبه القديم.
الأنسب لـ: الأدوات المتوافقة مع CPU، والأجهزة القديمة، والمهام النصية السريعة، وأجهزة 4 GB GPU.
الميزة البارزة: حزمة Q4_K_M بحجم 2.5 GB تحت ترخيص MIT.
الأسعار: أوزان قابلة للتنزيل بترخيص MIT؛ وتكلفة التشغيل تنحصر في استهلاك العتاد.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- أصغر حزمة معتمدة وعملية في التصنيف الرئيسي.
- ترخيص MIT واضح ومفتوح بالكامل.
- مصمم رسمياً للبيئات ذات القيود في الذاكرة وسرعة الاستجابة.
- يدعم استدعاء الدوال واستخدام الأدوات وفقاً لوثائق بطاقة النموذج.
- يدعم النصوص فقط.
- توقف بيانات المعرفة عند June 2024.
- تحذر Microsoft من أن محدودية السعة للحقائق قد تؤدي إلى معلومات خاطئة.
- قد تنحرف جودة المحادثات الطويلة رغم أن المعمارية تدعم سياق 128K.
6. Qwen3-Coder-Next: أفضل نموذج محلي للبرمجة لأجهزة 64 GB فما فوق
يُعد Qwen3-Coder-Next أفضل نموذج محلي متخصص في البرمجة للأجهزة التي تمتلك 64 GB أو أكثر من الذاكرة. صممته Qwen خصيصاً لوكلاء البرمجة ومراحل التطوير البرمجي المحلي، حيث يحتوي على 80 مليار معلمة إجمالية، و3 مليار معلمة نشطة، ويدعم الاستدلال بعيد المدى، واستخدام الأدوات المعقدة، والتعافي من أخطاء التنفيذ، وسياقاً أصلياً يصل إلى 262,144 رمزاً. يبلغ حجم حزمة Ollama بدقة Q4_K_M الحالية 52 GB.

هذا هو النموذج المناسب لمطور خبير يرغب في بناء وكيل محلي يتصفح مستودعات الأكواد الضخمة، ويستدعي أدوات النظام، ويعدل الملفات، ويتعافى ذاتياً عند فشل الأوامر. وهو ليس مخصصاً للمحادثات العامة أو التعامل مع الصور أو للأجهزة المحمولة بذاكرة 32 GB. توضح بطاقته الرسمية أنه يعمل فقط في وضع عدم التفكير (non-thinking mode)، مما يعني أنه لا يولد كتل التفكير التحليلية الظاهرة في المخرجات.
يسبب رقم 3 مليار معلمة نشطة الفخ ذاته المعتاد في النماذج المتناثرة. فحزمة Ollama تبلغ 52 GB لأن كافة الأوزان البالغة 80 مليار معلمة يجب تحميلها بالكامل. وتشغيل هذا الملف ضمن جهاز 64 GB يترك 12 GB فقط (أي 18.75%) قبل تشغيل المشغل والذاكرة المؤقتة، ولذلك تعد 64 GB حداً أدنى أساسياً، ويُفضل امتلاك مساحة أكبر لاستيعاب السياقات البرمجية الواسعة.
تنصح Qwen رسمياً بتقليص السياق إلى 32,768 عند ظهور خطأ نفاد الذاكرة. وهذا هو الإجراء الأولي السليم على أجهزة 64 GB، حيث إن السياق الأقصر الذي يحافظ على استجابة الوكيل أفضل بكثير من محاولة استغلال سقف الـ 262,144 رمزاً بالكامل والتسبب في تجميد النظام.
الأنسب لـ: وكلاء البرمجة المحليين، والتطوير في المستودعات البرمجية الكبيرة على أجهزة 64 GB فما فوق.
الميزة البارزة: 80 مليار معلمة إجمالية، 3 مليار نشطة، حزمة Q4_K_M بحجم 52 GB، وتخصص عميق في البرمجة بالوكلاء.
الأسعار: أوزان مفتوحة تحت ترخيص Apache License 2.0 مرفقة بحزمة Ollama الحالية؛ والعتاد يحسب بشكل منفصل.
التجربة المجانية: لا تنطبق على الأوزان القابلة للتنزيل.
- صُمم خصيصاً لوكلاء البرمجة وبيئات التطوير المحلية.
- دعم الأدوات والتعافي الذاتي من الأخطاء جزء أساسي من إمكانياته الرسمية.
- نافذة سياق أصلية واسعة للأجهزة القادرة على تلبية متطلبات الذاكرة المؤقتة.
- حزمة Ollama الحالية تملك أمر تشغيل مؤكداً ومباشراً.
- الحزمة بحجم 52 GB تستبعد الغالبية الساحقة من الأجهزة المحمولة الاستهلاكية.
- تخصصه الشديد في البرمجة يجعله خياراً ضعيفاً للاستخدامات العامة اليومية.
- يدعم وضع عدم التفكير فقط (Non-thinking mode).
- تشغيل السياق الكامل قد يسبب أخطاء نفاد الذاكرة بسهولة في الحد الأدنى للأجهزة.
مقارنة بيئات التشغيل: Ollama مقابل LM Studio مقابل llama.cpp
يحدد النموذج السقف النظري للقدرات، بينما تحدد بيئة التشغيل مدى سهولة الانتقال من تنزيل الملف إلى استخدامه كواجهة محلية فعالة. بيئة Ollama هي الأنسب للأتمتة، وLM Studio هو الخيار الأفضل للواجهات الرسومية، في حين يمنحك llama.cpp أقصى درجات التحكم في العتاد. ويمكنك استخدام الأدوات الثلاث على نفس الجهاز بحسب الحاجة.

Ollama: الأسهل والأسرع لسطر الأوامر وواجهات برمجة التطبيقات
يُعد Ollama الخيار الأسهل للتوصية به عندما ترغب في تحويل النموذج المحلي إلى أمر تنفيذي، أو سكربت برمجي، أو نقطة اتصال عبر API. تتضمن خطة Free الحالية تشغيل النماذج المحلية على عتادك الخاص، وواجهة سطر أوامر CLI، وواجهة برمجة تطبيقات API، وتطبيقات سطح المكتب. تشغيل النماذج على عتادك غير محدود دائماً، وهي الميزة السعرية الأهم للمشاريع المحلية بالكامل.

تضيف باقات Ollama المدفوعة قدرات سحابية بدلاً من فرض رسوم على الاستنتاج المحلي. تم التحقق من الأسعار والحدود الموضحة أدناه بتاريخ August 5, 2026.
تتم إعادة ضبط الحدود الفردية للجلسات السحابية كل 5 ساعات، والحدود الأسبوعية كل 7 أيام. ولا تنطبق عمليات إعادة الضبط هذه على النماذج التي تعمل محلياً على عتادك. بالنسبة لخيارنا الأول، يمكن إتمام الإعداد بالكامل بأمر واحد بعد التثبيت: ollama run qwen3.6:35b-a3b.
الأنسب لـ: المطورين الراغبين في سطر أوامر سهل، وواجهة API واضحة، وتطبيق مكتبي خفيف، ووسوم نماذج متوقعة.
الميزة البارزة: استخدام مجاني وغير محدود على العتاد المحلي مع خيارات سحابية إضافية.
الأسعار: باقة Free بسعر $0؛ وباقة Pro بسعر $20 شهرياً أو $200 سنوياً؛ وباقة Max بسعر $100 شهرياً مع إيقاف الاشتراكات الجديدة؛ وباقة Team بسعر $25 لكل مقعد شهرياً بحد أدنى 5 مقاعد؛ وEnterprise بتسعير مخصص.
التجربة المجانية: خطة Free مستمرة دائماً وليست فترة تجريبية محدودة بوقت.
LM Studio: أفضل تجربة استخدام عبر واجهة رسومية
يُعد LM Studio الخيار الأنسب عندما ترغب في تنزيل النماذج، وتحميلها، والدردشة معها بالكامل عبر واجهة رسومية سهلة. يأخذك الدليل الرسمي عبر علامة التبويب Discover، وقسم تحميل النماذج، وعلامة التبويب Chat. تشمل خطة Free تشغيل النماذج المحلية والتحويل الصوتي على جهاز المستخدم، وتؤكد صفحة الأسعار عدم خروج أي بيانات من جهازك أثناء الاستخدام المحلي.

يتيح LM Studio أيضاً خدمات الاستنتاج السحابي، مما يتطلب تمييزاً دقيقاً بين أسعاره السحابية واستخدامه المحلي. تم التحقق من الأسعار في August 5, 2026:
- Free بسعر $0: نماذج لغوية محلية، وBionic Agent، ومحركات تشغيل llama.cpp وMLX، وتحويل صوتي بدون إنترنت، وأداة بحث ويب بخصوصية كاملة عند تسجيل الدخول، وميزة LM Link لربط ما يصل إلى 5 أجهزة.
- الدفع حسب الاستخدام (Pay as you go): رصيد سحابي يُحسب لكل 1 مليون رمز. نموذج DeepSeek V4 Flash بتكلفة $0.13 للمدخلات، و$0.028 للمدخلات المخزنة، و$0.26 للمخرجات. ونموذج DeepSeek V4 Pro بتكلفة $1.74 للمدخلات، و$0.15 للمدخلات المخزنة، و$3.48 للمخرجات.
- الدفع حسب الاستخدام، تابع: نموذج GLM-5.2 بتكلفة $1.50 للمدخلات، و$0.30 للمدخلات المخزنة، و$4.50 للمخرجات. ونموذج Kimi K2.6 بتكلفة $0.95 للمدخلات، و$0.16 للمدخلات المخزنة، و$4.00 للمخرجات. ونموذج Kimi-K2.7-Code بنفس التكلفة $0.95 للمدخلات، و$0.16 للمدخلات المخزنة، و$4.00 للمخرجات. ونموذج Kimi K3 بتكلفة $3.00 للمدخلات، و$0.30 للمدخلات المخزنة، و$15.00 للمخرجات.
- Bionic Pass: تفاصيل الخطط والأسعار ستتوفر قريباً.
بالنسبة لمؤسس يقوم بتقييم النماذج على جهاز واحد، فإن الواجهة الرسومية المجانية كافية لاختيار LM Studio. أما للتطبيقات التي تحتاج لخدمات برمجية قابلة للتكرار تحت إدارة الإصدارات، فإن Ollama أو llama.cpp يمثلان مساراً عملياً أكثر ملاءمة.
الأنسب لـ: استكشاف النماذج بصرياً، وتحميلها، وإجراء المحادثات المحلية بسهولة.
الميزة البارزة: تجربة مكتبية مجانية بالكامل بسعر $0 مدعومة بمحركات تشغيل llama.cpp وMLX.
الأسعار: باقة Free بسعر $0؛ والاستنتاج السحابي بنظام الدفع حسب الاستخدام وفق الأسعار الموضحة أعلاه؛ وباقة Bionic Pass لم تتحدد أسعارها بعد.
التجربة المجانية: خطة Free مستمرة دائماً وليست تجربة مؤقتة.
llama.cpp: الخيار الأفضل للتحكم الدقيق بالعتاد والمعالجة الهجينة
يُعد llama.cpp الخيار الأنسب عند الرغبة في التحكم الكامل في إعدادات العتاد، ورايات البناء (build flags)، وتوزيع الطبقات بين المعالجات. يدعم هذا المشروع المفتوح المصدر والمحمي بترخيص MIT معالجات Apple Silicon عبر Metal، وبطاقات NVIDIA عبر CUDA، وبطاقات AMD عبر HIP، والمعالجة الهجينة بين المعالج والبطاقة الرسومية للنماذج التي يتجاوز حجمها ذاكرة VRAM المتاحة. ويوفر سطر أوامر وخادماً وواجهة ويب مدمجة.

الحالة العملية الأبرز له هي محطة عمل مخصصة يتم فيها تحميل جزء من النموذج على بطاقة الرسوميات وترحيل الباقي إلى ذاكرة النظام، أو عند الحاجة إلى بيئة معالجة متخصصة بعينها. يؤدي تشغيل الأمر llama serve إلى تشغيل الخادم الداخلي للمشروع. هذا المستوى من التحكم مفيد جداً، ولكنه يتطلب إعداداً أطول ومسؤولية كاملة لاختيار ملف GGUF المناسب ورايات التشغيل المثلى.
لا يحتوي llama.cpp على خطط تجارية، فهو مشروع مفتوح المصدر بالكامل بترخيص MIT. التكلفة تنحصر فقط في العتاد والوقت المستغرق في الضبط والإعداد.
الأنسب لـ: الأجهزة المخصصة، والاستنتاج الهجين بين CPU وGPU، والتحكم البرمجي منخفض المستوى.
الميزة البارزة: دعم واسع لمختلف المنصات وخادم محلي مدمج دون أي باقات مدفوعة.
الأسعار: مفتوح المصدر بترخيص MIT؛ دون وجود أي خطط تجارية مدفوعة من المشروع.
التجربة المجانية: لا تنطبق.
- يوفر Ollama أسرع مسار للحصول على سطر أوامر وواجهة API قابلة للتكرار.
- يقدم LM Studio أسهل واجهة رسومية للتعامل مع النماذج وتجربتها.
- يتيح llama.cpp أعمق مستويات التحكم التقني في العتاد والبيئات الخلفية.
- قد تصرف خطط Ollama السحابية الانتباه عن حقيقة أن الاستخدام المحلي مجاني وغير محدود.
- واجهة LM Studio الرسومية أقل ملاءمة لعمليات النشر المؤتمتة عبر السكربتات.
- يتطلب llama.cpp من المستخدم اتخاذ قرارات تقنية عديدة بشأن التنسيقات وإعدادات التشغيل.
كيف اخترنا أفضل نماذج الذكاء الاصطناعي المحلية؟
اعتمدت هذه المقارنة تاريخ August 5, 2026 كنقطة توقف نهائية. وتطلب اختيار أي نموذج وجود وثائق رسمية مباشرة وحديثة، وأوزان قابلة للتنزيل، وحالة استخدام عملية واضحة للمستخدمين أو المطورين، وملف تشغيل فعلي يمكن التحقق من حجمه عبر صفحة مشغل رسمية.
اعتمد الترتيب على ستة معايير:
- الحجم الفعلي لنسخة 4-bit: وجوب ملاءمة حزمة النموذج الحالية لفئة ذاكرة محددة مع إبقاء هامش متاح.
- فائدة عبء العمل: وجود سبب حقيقي لإدراج النموذج، مثل تعدد الوسائط، أو أدوات الاستدلال، أو قلة استهلاك الذاكرة، أو التخصص البرمجي.
- الانتماء لعائلة حديثة: استبعاد النماذج القديمة عند توفر جيل أحدث وموثق وقابل للتشغيل الفعلي.
- القيود والحدود الرسمية: استقاء بيانات السياق والوسائط والتراخيص ونقاط الضعف مباشرة من بطاقات النماذج الرسمية.
- التوافر في بيئات التشغيل: توفر حزمة جاهزة على Ollama أو دعم مباشر في بيئات التشغيل المعتمدة.
- الاستبعاد الصريح: عدم ترشيح نماذج الخوادم الضخمة للمستخدمين العاديين لمجرد أن عدد معلماتها النشطة يبدو قليلاً.
لم نعتمد أي درجة اختبار موحدة بين الشركات كمعيار ترتيب مطلق، نظراً لعدم وجود بيئة تقييم موحدة ومشتركة بينها جميعاً. ويعتمد الحكم النهائي على ملاءمة التثبيت وطبيعة العمل، وهي الجوانب التي يستطيع المستخدم التحقق منها واقعياً قبل تنزيل ملفات ضخمة.
ولهذا تضم القائمة ستة نماذج فقط بدلاً من حشوها بنماذج إضافية لا مبرر لها. فنماذج Qwen3.6 وGemma 4 تحل محل العديد من ترشيحات العائلات السابقة، كما أن تصنيف فئات الذاكرة يمنع تكرار نماذج متطابقة الحجم دون فائدة إضافية.
نماذج يُنصح بتجنبها على الأجهزة الاستهلاكية العادية
التجنب لا يعني رداءة النموذج، بل يعني أنه ليس حلاً مناسباً للعتاد الاستهلاكي المعتاد.
يُعد Mistral Small 4 نموذجاً حديثاً وقوياً يدعم إدخال النصوص والصور، ومستويات تفكير قابلة للضبط، ونافذة سياق 256K، وترخيص Apache 2.0. لكنه يحتوي على 119 مليار معلمة إجمالية مع 6 مليار معلمة نشطة لكل رمز. هذه الفئة من الأوزان الإجمالية تجعله خياراً لمحطات العمل أو الخوادم، وليس خياراً تلقائياً لجهاز حاسوب محمول عادي.
يحتوي Llama 4 Scout على 109 مليار معلمة إجمالية و17 مليار معلمة نشطة. وتوضح Meta أن إصدار Int4 منه يتطلب بطاقة NVIDIA H100 GPU واحدة على الأقل. ويحتوي Llama 4 Maverick على 400 مليار معلمة إجمالية و17 مليار نشطة، وتوضح Meta أنه يتطلب خادم H100 مخصصاً. هذه حقائق تقنية مفيدة، لكنها تصف عتاد خوادم لا عتاداً استهلاكياً.
يبدو اسم DeepSeek-V4-Flash وكأنه خيار أصغر، لكنه يضم في الواقع 284 مليار معلمة إجمالية و13 مليار نشطة. في حين يرتفع DeepSeek-V4-Pro إلى 1.6 تريليون معلمة إجمالية و49 مليار نشطة. يدعم كلاهما سياقاً يصل إلى 1 مليون رمز في خدمات DeepSeek الرسمية، وهو تفوق سحابي لا يعني أن أوزان النموذج مناسبة للأجهزة المكتبية العادية.
لا ينبغي أن تبدأ قائمتك لعام 2026 بنماذج مثل Llama 3.1 8B أو Mistral 7B أو Phi-3.5 Mini أو Gemma 2 9B أو Qwen2.5 7B لمجرد ورودها في مقالات سابقة. فقد تظل مفيدة لمشاريع قائمة بالفعل، لكن العائلات الحديثة مثل Qwen3.5 وQwen3.6 وGemma 4 وPhi-4 هي الأحق بالتقييم الأولي لأي مشروع جديد.
هذا التمييز مهم لتقدير كلفة الانتقال؛ فالتطبيق المستقر حالياً لا يحتاج لترقية عشوائية لمجرد مواكبة التسميات. بينما لا ينبغي للتطبيق الجديد البدء بخيارات قديمة قبل فحص توافق العائلات الحديثة مع نفس قيود الذاكرة والتراخيص المطلوبة.
الدليل النهائي لاختيار النموذج المناسب
عند توفر 4 GB ذاكرة VRAM مخصصة، استخدم Phi-4-mini-instruct للمهام النصية المحددة، مع تزويده بالبيانات المرجعية للحقائق. وعند توفر 8 GB ذاكرة VRAM مخصصة، استخدم Qwen3.5-9B مع سياق معتدل للحصول على أفضل توازن يجمع النصوص والصور والبرمجة.
عند توفر 16 GB، استخدم Gemma 4 12B إذا كانت معالجة الصور أو الصوت أو الفيديو ضرورية. واختر gpt-oss-20b عندما تكون الأولوية للاستدلال النصي واستخدام الأدوات وإنتاج المخرجات المهيكلة، مع تفضيل توفر 24 GB كذاكرة إجمالية للجهاز لتشغيل أدوات التطوير الأخرى بجانبه بسلاسة.
عند توفر 32 GB، اختر Qwen3.6-35B-A3B. إنه الخيار الشامل الأفضل في هذه المقارنة لأن حزمته الحالية بحجم 24 GB تترك هامشاً اسمياً كافياً للعمل، مع توفير قدرات متميزة في معالجة الوسائط المتعددة والبرمجة بالوكلاء المستقلين.
عند توفر 64 GB أو أكثر، اختر Qwen3-Coder-Next فقط إذا كان بناء وكلاء البرمجة هو عملك الأساسي. فحجم حزمته البالغ 52 GB وتخصصه البرمجي الصارم يعتبران زائدين عن الحاجة للمحادثات العامة، لكنهما مناسبان جداً للتطوير البرمجي المتقدم على مستوى المستودعات الكبيرة.
للاطلاع على نظرة أوسع حول النماذج المفتوحة الأوزان غير المقتصرة على الأجهزة الاستهلاكية، راجع مقارنة أفضل النماذج اللغوية مفتوحة المصدر. وإذا استقر رأيك على النموذج المناسب وترغب في بدائل لـ Ollama، قارن بين أبرز بدائل Ollama المتاحة حالياً.
أما اختيار مشغل النماذج فهو بسيط: استخدم Ollama للأوامر البرمجية المؤتمتة والـ API، واستخدم LM Studio للواجهات الرسومية، واستخدم llama.cpp للتحكم الدقيق بالعتاد. النموذج المحلي الأفضل هو ببساطة الذي يتسع في عتادك، ويخدم طبيعة مهامك، ويترك في الذاكرة ما يكفي لإتمام إجابة الأوامر.
الأسئلة الشائعة
ما هو أفضل نموذج لغوي محلي للبرمجة في 2026؟
يُعد Qwen3-Coder-Next الخيار المتخصص الأبرز للأجهزة التي تملك 64 GB أو أكثر، حيث تبلغ حزمته الحالية بدقة Q4_K_M نحو 52 GB وصُمم خصيصاً لوكلاء البرمجة. في حين يعتبر Qwen3.6-35B-A3B الخيار البرمجي الشامل الأفضل للأجهزة بذاكرة 32 GB.
ما هو أفضل نموذج ذكاء اصطناعي محلي لذاكرة 16 GB RAM؟
يمثل Gemma 4 12B الخيار الأكثر أماناً للمهام متعددة الوسائط بحجم حزمة 7.6 GB على Ollama. ويحقق gpt-oss-20b الحد الأدنى الرسمي البالغ 16 GB لمهام الاستدلال، إلا أن حزمته بحجم 14 GB تترك 2 GB فقط لبيئة التشغيل والسياق.
هل Ollama أفضل من LM Studio لتشغيل النماذج محلياً؟
يتفوق Ollama في التعامل مع سطر الأوامر البرمجية والسكربتات وواجهات برمجة التطبيقات API. بينما يتميز LM Studio بواجهته الرسومية المريحة لتصفح النماذج وتحميلها وإجراء المحادثات. وكلاهما يوفر مسار تشغيل محلي مجاني تماماً.
كم أحتاج من ذاكرة RAM أو VRAM لتشغيل نموذج محلي؟
ابدأ بحساب حجم ملف النموذج المُكمم، ثم أضف هامشاً لبيئة التشغيل ونظام التشغيل وذاكرة KV المؤقتة. تبدأ الخيارات العملية في هذه المقارنة من ملف بحجم 2.5 GB للأجهزة المحدودة وتصل إلى 52 GB للأجهزة التي تمتلك 64 GB أو أكثر.
هل نماذج الذكاء الاصطناعي المحلية مجانية بالكامل؟
النماذج الواردة في هذه القائمة ذات أوزان مفتوحة قابلة للتنزيل مجاناً، ولا توجد أي رسوم لكل رمز أو محادثة عند التشغيل المحلي. وتبقى التكلفة الفعلية منحصرة في عتاد الجهاز، ومساحة التخزين، واستهلاك الكهرباء، ووقت الضبط، وأي خدمات سحابية اختيارية.
احصل على قائمة التحقق لتدقيق سير عمل الذكاء الاصطناعي في الأعمال لاكتشاف المسار العملي الأنسب لاختيار وتطوير تطبيقات الذكاء الاصطناعي المحلية أو السحابية لمشروعك القادم.
4 سبتمبر 2026







