أفضل نماذج الذكاء الاصطناعي متعددة الوسائط لوكلاء استخدام الكمبيوتر في 2026
مقارنة عملية لأفضل نماذج الذكاء الاصطناعي متعددة الوسائط لوكلاء استخدام الكمبيوتر في 2026، تشمل الجودة والتكلفة والأمان وكيفية اختيار المسار الأنسب.

يُعد GPT-5.6 Sol أفضل نماذج الذكاء الاصطناعي متعددة الوسائط لوكلاء استخدام الكمبيوتر إجمالًا في 2026، لكن تكلفته المعيارية للنموذج وحده تبلغ $0.40 لمهمة تحتسب 50,000 توكن إدخال و5,000 توكن إخراج. وتبلغ تكلفة Gemini 3.7 Flash للمقدار نفسه من التوكنات $0.05625، بينما تتراوح تكلفة DeepSeek V4-Flash-Vision-Exp بين $0.0143 و$0.0286. اختر المسار الذي يخفض تكلفة كل مهمة مقبولة، لا المسار صاحب أرخص سعر للتوكنات فحسب.
أفضل نماذج الذكاء الاصطناعي متعددة الوسائط: القائمة المختصرة
تعالج المسارات الأربعة التالية صورًا مختلفة من استخدام الكمبيوتر. توفر GPT-5.6 Sol وClaude Opus 5 وGemini 3.7 Flash أداة لاستخدام الكمبيوتر وحلقة إجراءات محددة. أما DeepSeek V4-Flash-Vision-Exp فيوفر النموذج البصري واستدعاء الأدوات العامة، لكن على تطبيقك تعريف إجراءات الكمبيوتر والمنفذ والموافقات ومنطق التعافي.
تم التحقق من الأسعار في 22 أغسطس 2026. ويقصد بـ«السعر الابتدائي» سعر القائمة المباشر لواجهة API لكل مليون توكن، مع عرضه بصيغة الإدخال/الإخراج. ولا يشمل استضافة المنفذ أو رسوم الأدوات أو إعادة المحاولة أو المراجعة البشرية ما لم يُذكر خلاف ذلك.
الترتيب:
- GPT-5.6 Sol هو الخيار الأفضل إجمالًا عندما يكون الإجراء الفاشل مكلفًا وتريد أقوى نتيجة معلنة لاستخدام الكمبيوتر ضمن هذه المجموعة.
- Claude Opus 5 هو الخيار الأفضل للتحكم المؤسسي عندما تكون بنية المتصفح أو التأكيد التلقائي عند رصد حقن التعليمات أو معالجة البيانات أو أهلية أعباء العمل المنظمة أهم من تصدر اختبار معياري.
- Gemini 3.7 Flash يقدم أفضل قيمة لمسار أصلي في أتمتة المتصفح والهاتف وسطح المكتب القابلة للتراجع. النموذج متاح عمومًا، لكن Computer Use ما زالت في مرحلة Preview.
- DeepSeek V4-Flash-Vision-Exp يضع الحد الأدنى للتكلفة أمام فريق تقني يملك بالفعل منفذًا ومنظومة تقييم. فهو نواة بصرية تجريبية، وليس نظامًا متكاملًا لاستخدام الكمبيوتر.
لا ينبغي شراء نموذج لاستخدام الكمبيوتر لمجرد أنه يستطيع تمييز زر داخل لقطة شاشة. يجب على الوكيل الجاهز للإنتاج أن يدرك الحالة، ويقترح إجراءً مسموحًا، وينفذه في بيئة معزولة، ويراقب النتيجة، ويتعافى من الأخطاء، ويتوقف لطلب الموافقة قبل أي تبعات. لذلك فإن «أفضل نموذج» هو المسار الذي يكمل هذه الحلقة كلها بأدنى مستوى مقبول من المخاطر.
الخلاصة في دقيقة واحدة
ابدأ بـ GPT-5.6 Sol للأعمال مرتفعة القيمة، حيث قد تستهلك حالة فائتة أو إحداثية خاطئة أو محاولة تعافٍ فاشلة عدة دقائق من وقت الموظف. تعلن OpenAI أن Sol حقق 62.6% في OSWorld 2.0. هذه نتيجة معيارية يعلنها المزود، وليست وعدًا بأن نظام CRM أو بوابة المطالبات أو تطبيق سطح المكتب لديك سيتصرف بالطريقة نفسها، لكنها أقوى نتيجة معلنة لاستخدام الكمبيوتر بين هذه المسارات الأربعة الحالية.
اختر Claude Opus 5 عندما تكون طبقة التحكم جزءًا من قرار الشراء. توفر مجموعة أدوات Anthropic الحالية 17 إجراءً من جهة العميل، ويمكنها جمع عدة إجراءات في دور واحد، كما تضيف أداة خاصة بالمتصفح تقرأ بنية الصفحة وتفحص لقطات الشاشة تلقائيًا بحثًا عن حقن محتمل للتعليمات. أصبح استخدام الكمبيوتر متاحًا عمومًا على Claude API، ما يزيل اعتراضًا مهمًا في المشتريات، رغم أن تطبيقك يظل مسؤولًا عن البيئة وتنفيذ الإجراءات.
اختر Gemini 3.7 Flash لمسار عمل قابل للتراجع يحتاج إلى مخطط إجراءات أصلي مع إبقاء التكلفة قريبة من الحد الأدنى. تكلفته المعيارية للتوكنات أقل بكثير من تكلفة Sol في عبء العمل المستخدم هنا. كما تعرض Google نية الإجراء وقرارات الأمان، وهما إشارتان مفيدتان للموافقات والتسجيل. والمقابل هو حالة الإتاحة: Gemini 3.7 Flash متاح عمومًا، لكن قدرة Computer Use ما زالت في مرحلة Preview، وتحذر Google من استخدامها في أعمال حساسة أو غير قابلة للتراجع من دون إشراف لصيق.
لا تختر DeepSeek V4-Flash-Vision-Exp إلا إذا كان «بناء مستوى التحكم المفقود» ميزة بالنسبة إليك. فسعر التوكنات في وقت الذروة يظل أدنى من سعر Gemini الحالي في الوضع Standard، ولا تتجاوز تكلفة 100 لقطة شاشة بالحجم الأقصى $0.016896 في وقت الذروة قبل احتساب النص والإخراج. السعر المنخفض مهم، وكذلك غياب أداة إجراءات كمبيوتر من الطرف الأول. وعلى الفريق الذي لا يملك إطارًا قائمًا للمتصفح أو سطح المكتب أن يتعامل مع العمل الهندسي والأمني بوصفه المنتج نفسه، لا مجرد إعداد أولي.

اختبار الـ22 ثانية: لماذا لا يساوي سعر التوكن تكلفة المهمة؟
وكيل لقطات الشاشة عبارة عن حلقة، لا عملية استدلال واحدة. يرسل التطبيق لقطة الشاشة والحالة، ويعيد النموذج إجراءً واحدًا أو دفعة قصيرة من الإجراءات، ثم ينفذها نظامك ويلتقط التطبيق الحالة الجديدة ويسأل النموذج مرة أخرى. وقد تضيف كل دورة توكنات صور وتعريفات أدوات ونتائج إجراءات وزمن استجابة وفرصة أخرى للتعافي.
لذلك لا يمثل سعر الإدخال المنشور للنموذج سوى الحد الأدنى. أما مقياس الشراء فهو:
تكلفة المهمة المقبولة = توكنات النموذج + رسوم الأدوات + وقت تشغيل المنفذ + المراجعة البشرية + إعادة المحاولة، مقسومة على عدد المهام المقبولة.
وصفة «المقبولة» جوهرية. فالمهمة لا تكتمل لمجرد أن النموذج يقول إنه انتهى. يجب أن تحقق النتيجة فحصًا حتميًا أو معيارًا بشريًا محددًا. عند تعبئة نموذج، قد يعني ذلك تطابق كل حقل مع السجل المصدر وبقاء الإرسال النهائي خلف موافقة. وفي ضمان الجودة البصري، قد يعني اكتمال المسار المستهدف وظهور العنصر المتوقع والاحتفاظ بلقطة الشاشة التي تثبت ذلك.
لمقارنة أسعار واجهات API على أساس واحد، نستخدم مهمة معيارية تضم 50,000 توكن إدخال محتسب إجمالًا و5,000 توكن إخراج. يشمل مخصص الإدخال لقطات الشاشة وتعريفات الأدوات والحالة السابقة والنتائج. وهذا ليس توقعًا لكل مسار عمل، بل مقياسًا موحدًا.
- تبلغ تكلفة GPT-5.6 Sol في توكنات النموذج $0.40.
- تبلغ تكلفة Claude Opus 5 $0.375.
- تبلغ تكلفة Gemini 3.7 Flash في وضع Standard Paid $0.05625 حتى 31 ديسمبر 2026.
- تبلغ تكلفة DeepSeek V4-Flash-Vision-Exp $0.0143 خارج أوقات الذروة أو $0.0286 في وقت الذروة مع إدخال غير موجود في الذاكرة المؤقتة.
وعبر 1,000 مهمة مرسلة، تصبح الحدود الدنيا $400 لـSol، و$375 لـOpus 5، و$56.25 لـGemini، ومن $14.30 إلى $28.60 لـDeepSeek. لا تشمل هذه الأرقام المنفذ ولا الرسوم الخاصة بأدوات كل مزود. وهي تفترض أيضًا المقدار المحتسب نفسه من التوكنات، لا معدل النجاح نفسه.

أضف الآن تكلفة العمل البشري. عند تكلفة كلية للموظف قدرها $60 في الساعة، تساوي الدقيقة الواحدة $1. وتعادل زيادة تكلفة نموذج Sol البالغة $0.3714 مقارنة بسعر DeepSeek في وقت الذروة 22.284 ثانية من العمل. وتعادل زيادة Claude 20.784 ثانية، وزيادة Gemini 1.659 ثانية.
هذا هو اختبار الـ22 ثانية: إذا منع Sol مقدار 22 ثانية من المراجعة أو إعادة العمل أو التعافي من حلقة فاشلة لكل مهمة مرسلة، فإنه يمحو فرق تكلفة التوكنات مقارنة بسعر DeepSeek في وقت الذروة. وعبر 1,000 مهمة، يكلف Sol مبلغًا إضافيًا قدره $371.40 في توكنات النموذج، ويحتاج إلى توفير نحو 6.19 ساعة عمل للوصول إلى نقطة التعادل. وغالبًا ما يستغرق التدخل الواحد وقتًا أطول من ذلك حالما يفتح الموظف السجل ويفهم الحالة ويصححها ويعيد تشغيل المهمة.
لا يثبت الاختبار أن Sol سيوفر تلك الثواني. بل يحدد ما يجب أن يقيسه تقييمك. يمكن لنتيجة معيارية أن تبرر تجربة أولية، لكن سجل زمن التعافي لديك وحده هو ما يبرر الميزانية.
تغيّر التكاليف الإضافية الخاصة بكل مزود هذا الحد الأدنى:
- إذا أنجزت مهمة OpenAI عدد 20 استدعاءً قابلًا للفوترة لأداة الكمبيوتر، فإن السعر الحالي البالغ $2.50 لكل 1,000 استدعاء يضيف $0.05 قبل استضافة المنفذ.
- تضيف مجموعة أدوات الكمبيوتر الافتراضية في Claude Opus 5 نحو 4,520 توكن إدخال إلى طلب غير مخزن مؤقتًا، بقيمة $0.0226 وفق سعر الإدخال الأساسي. أما مجموعة أدوات المتصفح، التي تبلغ نحو 6,610 توكنات، فقيمتها $0.03305. ويمكن للتخزين المؤقت للتعليمات أن يخفض النفقات المتكررة، لكن ينبغي قراءة الاستخدام المحتسب بدل افتراض نجاح التخزين المؤقت في كل دورة.
- تحاسب Gemini على Computer Use وفق أسعار التوكنات العادية للنموذج المختار، بما يشمل توكنات الإخراج والتفكير. وقد يؤدي استدلال طويل إلى جعل جانب الإخراج أكبر من مقياس 5,000 توكن البسيط.
- يضع DeepSeek حدًا أقصى لكل صورة يبلغ 384 توكن إدخال، لكن مخطط الإجراءات المخصص واستجابات المنفذ وإعادة المحاولة وفحوص الأمان تظل تستهلك المال والوقت الهندسي خارج بند الصور.
وللتوجيه الأوسع وفق السعر، تقارن صفحة أرخص واجهات API للذكاء الاصطناعي نماذج لا تحتاج إلى قيادة شاشة. أما استخدام الكمبيوتر فيستحق ميزانية مستقلة لأن لقطات الشاشة وانتقالات الحالة ومحاولات التعافي تتراكم عبر الدورات.
1. GPT-5.6 Sol: الأفضل إجمالًا عندما تكون الإخفاقات مكلفة
GPT-5.6 Sol هو نموذج OpenAI متعدد الوسائط الرائد، وأفضل نقطة بداية إجمالًا عندما تفرض إخفاقات استخدام الكمبيوتر تكلفة تعافٍ ملموسة. يحيل الاسم المستعار gpt-5.6 إلى Sol، ويقبل النموذج الصور كمدخلات، ويدعم نافذة سياق سعتها 1,050,000 توكن، ويمكنه استخدام أداة computer الحالية في Responses API.

تعلن OpenAI أن Sol حقق 62.6% في OSWorld 2.0، مقارنة بـ50.2% لـTerra و45.6% لـLuna. يقيس OSWorld قدرة الوكيل على تشغيل برامج سطح المكتب، لذا فهو أقرب إلى قرار الشراء هذا من اختبار محادثة عام. ومع ذلك، جاءت النتيجة من إعدادات تقييم OpenAI. تعامل معها سببًا لإدراج Sol في التجربة الأولية، لا إذنًا بتجاوز اختبارات القبول الخاصة بك.
ما الذي يجيده Sol؟
تكمن القيمة العملية في تكامل OpenAI الحالي في مرونته. يستطيع النموذج فحص لقطات الشاشة وإعادة إجراءات الكمبيوتر عبر الأداة المدمجة، أو العمل من خلال أدوات مخصصة وإطار لتنفيذ التعليمات البرمجية. وهذا يتيح لفريق تقني البدء بمتصفح Playwright والانتقال إلى جهاز افتراضي كامل عندما يمتد مسار العمل إلى تطبيقات سطح مكتب أصلية.
كما يمنح الدليل الحالي طبقة الأمان الأولوية المناسبة. فهو يوصي بمتصفح أو جهاز افتراضي معزول، وبيئة موروثة فارغة، وتعطيل الإضافات والوصول إلى نظام الملفات المحلي حيثما أمكن، وطلب موافقة صريحة على الإجراءات ذات العواقب. ويطلب من الوكيل التوقف عندما يشبه المحتوى الظاهر على الشاشة حقنًا للتعليمات. هذه تعليمات تنفيذ، وليست وسائل حماية تلقائية، لكنها تدفع التجربة نحو إعداد افتراضي أكثر أمانًا.
أفضل حالة استخدام هي مسار عمل قيّم وقابل للتراجع داخل واجهات غير مرتبة. تخيل فريقًا ماليًا في شركة متوسطة يحتاج إلى جمع البيانات من ثلاث بوابات ويب، ومطابقتها مع سجل مصدر، وتجهيز قيد للموافقة. تصبح زيادة تكلفة Sol منطقية إذا منع تتبع الحالة والتعافي الأقوى قدرًا ولو صغيرًا من العمل التصحيحي للموظف. لكنها أقل منطقية مع نموذج ثابت لا تتحرك عناصره ويمكن إرسال بياناته عبر واجهة API.
أسعار OpenAI
لدى OpenAI حاليًا ثلاث فئات من GPT-5.6 تدعم استخدام الكمبيوتر:
- GPT-5.6 Sol: $5.00 لكل مليون توكن إدخال، و$0.50 لكل مليون توكن إدخال مخزن مؤقتًا، و$30.00 لكل مليون توكن إخراج.
- GPT-5.6 Terra: $2.00 لكل مليون توكن إدخال، و$0.20 لكل مليون توكن إدخال مخزن مؤقتًا، و$12.00 لكل مليون توكن إخراج.
- GPT-5.6 Luna: $0.20 لكل مليون توكن إدخال، و$0.02 لكل مليون توكن إدخال مخزن مؤقتًا، و$1.20 لكل مليون توكن إخراج.
يمكن أن تضيف أداة الكمبيوتر $2.50 لكل 1,000 استدعاء أداة قابل للفوترة، بينما تُحاسب التوكنات التي تستهلكها الأدوات المدمجة وفق سعر النموذج المختار. ولا يملك Sol فئة API مجانية مدعومة.
تتيح العائلة سلمًا مفيدًا للتوجيه. ابدأ بتحديد سقف الجودة عبر Sol، ثم أعد تشغيل مجموعة المهام المقبولة نفسها على Terra. لا تنقل فئة من المهام إلى Terra إلا إذا ظل نمط الإكمال والمراجعة ضمن الحد المطلوب. أما Luna فهو عامل أرخص بكثير، لكن نتيجة OSWorld التي يعلنها المزود أقل. مكانه هو الأعمال المحدودة والقابلة للتراجع بعد إثبات قاعدة القبول، وليس الخيار الافتراضي لمجرد أن توكنات إدخاله أرخص بكثير من Sol.
تجربة أولية آمنة لـSol
اختر مسار عمل واحدًا محدودًا
اختر مهمة ذات حالة بداية واضحة وفحص نهائي حتمي، من دون إجراء لا يمكن التراجع عنه قبل الموافقة. تشمل الخيارات الجيدة ضمان جودة المتصفح، وجمع الأدلة، وتجهيز سجل للمراجعة. وتجنب الشراء أو الحذف أو النشر أو الإرسال خلال التقييم الأول.
ثبّت البيئة
استخدم ملفًا شخصيًا معزولًا للمتصفح أو حاوية أو جهازًا افتراضيًا. أزل متغيرات البيئة الموروثة، وعطّل الإضافات والوصول إلى نظام الملفات المحلي حيثما أمكن، وأدرج النطاقات المطلوبة في قائمة السماح، ولا تعرض سوى بيانات الاعتماد التي تحتاج إليها المهمة.
حدّد الموافقات قبل التنفيذ
دوّن الإجراءات التي تتطلب شخصًا دائمًا، مثل إرسال رسالة أو قبول شروط أو تغيير بيانات حساب أو تقديم التزام مالي. يجب أن يفرض المنفذ التوقف، لا النص الذي يكتبه النموذج.
سجّل الحالة والقبول
احتفظ بالحالة الأولية وكل لقطة شاشة والإجراء المقترح والإجراء المنفذ ونتيجة الأداة وتوقف الأمان والحالة النهائية ونتيجة القبول. رسالة النموذج الأخيرة ليست فحص قبول.
انتقل إلى فئة أرخص بعد نجاح Sol فقط
استخدم Sol لتحديد خط أساس الإكمال والمراجعة الممكن تحقيقه، ثم قارن Terra وLuna على المهام نفسها وفي البيئة نفسها وبقواعد الموافقة نفسها. أبقِ Sol مسار تصعيد لأشكال المهام التي تفشل في الفئات الأدنى.
الأنسب لـ: أعمال المتصفح أو سطح المكتب مرتفعة القيمة ومتعددة الخطوات، حين يكون فشل التعافي مكلفًا.
نقطة القوة: تعلن OpenAI نتيجة 62.6% في OSWorld 2.0، وهي أقوى نتيجة حالية معلنة لاستخدام الكمبيوتر ضمن هذه المجموعة.
السعر: Sol بسعر $5/$30، وTerra بسعر $2/$12، وLuna بسعر $0.20/$1.20 لكل مليون توكن إدخال/إخراج، إضافة إلى رسوم استدعاءات الأدوات المنطبقة.
التجربة المجانية: لا توجد فئة API مجانية مدعومة لـSol.
- أقوى نتيجة معيارية معلنة لاستخدام الكمبيوتر بين هذه المسارات الأربعة.
- يسهّل شكل أداة واحد في Responses API عبر عائلة GPT-5.6 توجيه المهام بين الجودة والتكلفة.
- تغطي الإرشادات الحالية التنفيذ المعزول وحقن التعليمات وقوائم السماح والموافقة على الإجراءات ذات العواقب.
- توفر Sol وTerra وLuna سلم أسعار واسعًا من دون استبدال الإطار المحيط بها.
- يحمل Sol أعلى تكلفة معيارية للنموذج وحده في هذه المقارنة.
- قد تفرض استدعاءات أداة الكمبيوتر رسوم استخدام منفصلة.
- يظل العميل مسؤولًا عن بناء المتصفح أو الجهاز الافتراضي أو ربطه، ومنفذ الإجراءات، وفحوص القبول، والسجلات.
- لا يثبت تصدر اختبار المزود موثوقية النموذج على تطبيق خاص.
من ينبغي له تجاوزه: تجاوز Sol كعامل افتراضي عندما توجد واجهة API حتمية، أو عندما تكون المهمة منخفضة القيمة وشديدة التكرار، أو حين تحقق Terra أو Luna أو Gemini عتبة القبول نفسها. ولا تدفع سعر الفئة الرائدة للنقر على عنصر تحكم ثابت تستطيع الأتمتة المعتادة التعامل معه بأمان أكبر.
2. Claude Opus 5: الأفضل لأعمال سطح المكتب المؤسسية الخاضعة للحوكمة
Claude Opus 5 هو الخيار الأفضل عندما تكون طبقة التحكم في استخدام الكمبيوتر بأهمية جودة النموذج الخام نفسها. أتاحت Anthropic استخدام الكمبيوتر عمومًا على Claude API في 20 أغسطس 2026، بالتزامن مع أداة جديدة لاستخدام المتصفح. وتوفر مجموعة computer_toolset_20260801 الحالية 17 أداة من جهة العميل عبر تعريف واحد، ولا تتطلب ترويسة beta.

الفرق بين استخدام الكمبيوتر واستخدام المتصفح عملي. يعمل استخدام الكمبيوتر انطلاقًا من لقطات الشاشة ويتحكم في سطح مكتب كامل عبر إجراءات الفأرة ولوحة المفاتيح. أما استخدام المتصفح فيقرأ أيضًا بنية الصفحة ويتعامل مع عناصر محددة فيها، ما يجعله أنسب عندما يبقى مسار العمل داخل تطبيقات الويب. وقد تسهّل البنية استهداف حقل أو زر مقارنة بالاعتماد على إحداثيات الشاشة وحدها.
تظل الأداتان مع ذلك من أدوات التنفيذ لدى العميل. لا يتصل Claude بسطح المكتب من تلقاء نفسه. يشغّل تطبيقك كل إجراء داخل حاوية أو جهاز افتراضي أو متصفح مضبوط، ثم يعيد النتيجة ويستدعي النموذج مرة أخرى. واستخدام الكمبيوتر غير متاح حاليًا داخل Claude Managed Agents، لذا فمن يتوقع أن تستضيف Anthropic جلسة سطح المكتب كاملة قد اختار حدود المنتج الخاطئة.
لماذا يتصدر Claude في الحوكمة؟
يستطيع Claude إعادة عدة إجراءات كمبيوتر في دور واحد للنموذج. ينفذ نظامك هذه الإجراءات بالتتابع ويتوقف عند أول إخفاق. وقد يزيل ذلك جولات متكررة للنموذج في تسلسل آمن، مثل النقر ثم الكتابة ثم الملاحظة. لكنه لا يبرر جمع الإجراءات عبر حالة تحتاج إلى فحص؛ فإذا كان النقر قد يفتح الحساب الخطأ، ينبغي للوكيل رؤية النتيجة قبل أن يكتب.
تشغّل Anthropic أيضًا مصنفات للقطات الشاشة يمكنها رصد حقن محتمل للتعليمات وتوجيه النموذج إلى طلب التأكيد قبل الإجراء التالي. يستطيع العملاء التواصل مع الدعم لإلغاء هذه الخاصية، لكن الإعداد الافتراضي مفيد لمسارات العمل التي تتصفح صفحات غير موثوقة. يظل المصنف طبقة دفاع إضافية، لا بديلًا عن قوائم السماح للنطاقات وحدود بيانات الاعتماد أو الموافقة على مستوى المنفذ.
أصبحت صورة التعامل مع البيانات أوضح مما كانت عليه في المرحلة التجريبية. يتحكم العميل في تخزين لقطات الشاشة والإجراءات والملفات، وتقول Anthropic إن استخدام الكمبيوتر مؤهل للاحتفاظ الصفري بالبيانات. كما أنه مؤهل لأعباء العمل المنظمة وفق HIPAA بموجب اتفاقية BAA من Anthropic. لا تجعل الأهلية التطبيق ممتثلًا تلقائيًا، لكنها قد تزيل عائقًا على مستوى النموذج أثناء مراجعة مشتريات للرعاية الصحية.
يناسب هذا المزيج مسار عمل للمطالبات أو التأمين أو التمويل أو العمليات، حيث يحتاج النظام إلى الوصول إلى برنامج لا يملك واجهة API مفيدة، ويحتاج المشتري إلى دليل على كل إجراء. تستشهد Anthropic بعميل واحد هو Asteroid، أفاد بأن أطول مسار عمل للمطالبات لديه انخفض من 32 دقيقة إلى 13 دقيقة، وتراجعت تكلفة المهمة بنحو 30%، ووصل الإكمال إلى 100% من دون تغييرات في التعليمات. هذه نتيجة منسوبة إلى عميل، وليست معدلًا متوقعًا لنشر جديد. لكنها توضح الأثر الذي يستحق القياس: يمكن لتقليل دورات الحلقة وتحسين الاستهداف أن يغير تكلفة التشغيل، لا نتيجة النموذج وحدها.
يوضح التحليل الأعمق لتكلفة إجراءات Claude المتعددة متى توفر دفعة الإجراءات المال، ومتى تظل الملاحظة بين الإجراءات إلزامية.
أسعار Claude
تدعم مجموعة الأدوات الحالية Sonnet 5 وOpus 5 وFable 5 وMythos 5 محدود الإتاحة وOpus 4.8. ويتدرج سلم النماذج الحالية ذات الصلة كما يلي:
- Claude Sonnet 5: $2 لكل مليون توكن إدخال أساسي و$10 لكل مليون توكن إخراج. تبلغ تكلفة كتابة ذاكرة مؤقتة لمدة 5 دقائق $2.50، ولمدة 1 ساعة $4، فيما تبلغ تكلفة إصابة الذاكرة المؤقتة $0.20 لكل مليون توكن.
- Claude Opus 5: $5 لكل مليون توكن إدخال أساسي و$25 لكل مليون توكن إخراج. تبلغ تكلفة كتابة ذاكرة مؤقتة لمدة 5 دقائق $6.25، ولمدة 1 ساعة $10، فيما تبلغ تكلفة إصابة الذاكرة المؤقتة $0.50 لكل مليون توكن.
- Claude Fable 5 وClaude Mythos 5: $10 لكل مليون توكن إدخال أساسي و$50 لكل مليون توكن إخراج. إتاحة Mythos 5 محدودة.
- وضع Opus 5 Fast: $10 لكل مليون توكن إدخال و$50 لكل مليون توكن إخراج.
- وضع Opus 5 Batch: $2.50 لكل مليون توكن إدخال و$12.50 لكل مليون توكن إخراج. يفيد Batch في أعمال النموذج غير المتزامنة، لكن حلقة استخدام الكمبيوتر التفاعلية تظل بحاجة إلى الملاحظة والعمل بالتتابع.
يحصل مستخدمو API الجدد على قدر صغير غير محدد من الرصيد المجاني. وتطلب Anthropic من المشترين المؤسسيين التواصل مع المبيعات للحصول على تجربة ممتدة.
البند الخفي هو تكلفة تعريف الأدوات. تضيف مجموعة أدوات الكمبيوتر الافتراضية نحو 4,520 توكن إدخال على Opus 5 و4,590 على Sonnet 5 إلى الطلب. ويزيل تعطيل التكبير نحو 410 توكنات. أما مجموعة أدوات المتصفح فأكبر، إذ تضيف نحو 6,610 توكنات على Opus 5 و6,670 على Sonnet 5، فيما تضيف تهيئة أعضاء المتصفح الاختيارية الأربعة جميعًا نحو 880 توكنًا.
وفق سعر الإدخال الأساسي لـOpus 5، تكلف مجموعة أدوات الكمبيوتر الافتراضية غير المخزنة مؤقتًا نحو $0.0226 قبل لقطة الشاشة أو سياق المهمة أو نتيجة الإجراء أو الإخراج. وتكلف مجموعة أدوات المتصفح نحو $0.03305 على الأساس نفسه. قد تنفق المهمة القصيرة على تعريف سطح التحكم المتاح أكثر مما تنفق على بيانات العمل نفسها. خزّن التعليمات وتعريفات الأدوات الثابتة مؤقتًا عندما يسمح مسار العمل بذلك، وعطّل العناصر التي لا تستخدمها، واعتمد على الاستخدام المحتسب في الاستجابة بدل التقدير.
الأنسب لـ: مسارات عمل المتصفح وسطح المكتب المؤسسية التي تحتاج إلى ضوابط صريحة وأدلة تدقيق ومسار ترحيل مدعوم.
نقطة القوة: استخدام كمبيوتر متاح عمومًا مع 17 إجراءً من جهة العميل، ودفعات إجراءات متتابعة، وأداة متصفح منفصلة تدرك بنية الصفحة.
السعر: Sonnet 5 بسعر $2/$10، وOpus 5 بسعر $5/$25، وFable 5 أو Mythos 5 محدود الإتاحة بسعر $10/$50 لكل مليون توكن إدخال/إخراج أساسي.
التجربة المجانية: رصيد API صغير للمستخدم الجديد من دون تحديد المبلغ؛ ويتطلب التقييم المؤسسي التواصل مع المبيعات.
- استخدام الكمبيوتر متاح عمومًا على Claude API، ولا تحتاج مجموعة الأدوات الحالية إلى ترويسة beta.
- يضيف استخدام المتصفح بنية الصفحة لمسارات العمل المحصورة في الويب بدل الاعتماد على إحداثيات البكسل وحدها.
- يدعم التأكيد التلقائي عند حقن التعليمات، والتنفيذ الذي يتحكم فيه العميل، وأهلية ZDR تصميمًا جادًا للضوابط.
- يمكن لدفعات الإجراءات الآمنة أن تقلل دورات النموذج المتكررة والوقت المنقضي.
- يتيح Sonnet 5 مجموعة الأدوات الحالية نفسها عبر مسار نموذج أقل تكلفة.
- تضيف تعريفات أدوات الكمبيوتر والمتصفح آلاف توكنات الإدخال إلى الطلب.
- استخدام الكمبيوتر غير متاح داخل Claude Managed Agents.
- يظل تطبيقك مسؤولًا عن البيئة المعزولة والمنفذ وبيانات الاعتماد والموافقات والسجلات والتعافي من الإخفاقات.
- تحذر وثائق Claude من زمن الاستجابة وأخطاء الإحداثيات وإخفاقات التمرير وانخفاض الموثوقية عبر التطبيقات المتخصصة أو المتعددة.
من ينبغي له تجاوزه: تجاوز استخدام سطح المكتب الكامل عندما تبقى المهمة داخل صفحة ويب وتغطيها أداة استخدام المتصفح. وتجاوز الاثنين عند وجود واجهة API مستقرة. على المشتري الذي لا يريد سوى أرخص حلقة واجهة قابلة للتراجع أن يبدأ بـGemini؛ أما من يملك إطار الإجراءات كاملًا بالفعل فعليه تسعير DeepSeek بوصفه نواة النموذج.
3. Gemini 3.7 Flash: أفضل قيمة لاستخدام الكمبيوتر الأصلي
Gemini 3.7 Flash هو النموذج الذي توصي به Google لـComputer Use، والمسار الأفضل قيمة هنا بين الخيارات التي توفر حلقة إجراءات يحددها المزود. النموذج نفسه متاح عمومًا بنافذة سياق سعتها 1 مليون توكن وحد أقصى للإخراج يبلغ 64,000 توكن. أما Computer Use فما زالت في مرحلة Preview.

تدعم Google ثلاث بيئات مستهدفة: المتصفح والهاتف وسطح المكتب. يرسل التطبيق التعليمات والبيئة ولقطة الشاشة، ويعيد Gemini استدعاء دالة لإجراء على الواجهة. يتولى عميلك تحجيم الإحداثيات وتنفيذ الإجراء والتقاط الشاشة الجديدة وإرسالها مرة أخرى. وتظل هناك حاجة إلى جهاز افتراضي أو حاوية آمنة ومعالج إجراءات من جهة العميل، وتستخدم أمثلة Google أداة Playwright.
يضيف Gemini 3.x إشارتين مفيدتين بصفة خاصة لطبقة الموافقات. يمكن أن يحمل كل إجراء نية، وهي شرح موجز لسبب اختياره. ويمكن لـقرار أمان منفصل أن يصنف الإجراء كمسموح به أو محتاج إلى تأكيد أو محظور. لا تثبت النية صحة الإجراء، لكنها تمنح محرك السياسات والمراجع سياقًا أوسع من إحداثية نقر مجردة.
يمكن ضبط نظام الأمان بحسب فئة السياسة، أما اكتشاف حقن التعليمات في لقطات الشاشة فهو اختياري. وهذا يجعل Gemini جذابًا لفريق منتج يبني تجربة الموافقات الخاصة به. يستطيع التطبيق عرض الإجراء المقترح ونية النموذج وقرار السياسة ولقطة الشاشة الحالية معًا، ثم طلب تدخل شخص فقط عندما تستدعي مخاطر مسار العمل ذلك.
أين يناسب Gemini؟
Gemini نقطة بداية منطقية لتجربة أعمال قابلة للتراجع عبر بيئات متعددة. يمكن لفريق منتج للهاتف استخدام مسار النموذج نفسه لاختبار التسجيل في متصفح ويب وفي إصدار للهاتف، وجمع لقطات الشاشة ورصد مواضع اختلاف الرحلة. كما يستطيع فريق عمليات الدعم استخدامه لجمع معلومات عامة من مواقع معتمدة وتجهيز سجل من دون الضغط على زر الإرسال النهائي.
في المهمة المعيارية، يبلغ الحد الأدنى الحالي لتكلفة Gemini في وضع Standard Paid $0.05625 لكل مهمة أو $56.25 لكل 1,000 مهمة. وهو أعلى بـ$0.02765 لكل مهمة من DeepSeek في وقت الذروة. وعند $60 في الساعة، لا يحتاج Gemini إلا إلى توفير 1.659 ثانية من وقت العمل الهندسي أو المراجعة لتغطية فرق تكلفة النموذج. ويمكن لمخطط إجراءات محدد أو قرار أمان أو الاستغناء عن محول مخصص أن يتجاوز هذا الحد بسرعة.
التحذير يتعلق بحالة الإتاحة، لا بحاشية صغيرة. تقول Google إن Computer Use قد تحتوي على أخطاء وثغرات أمنية، وتنصح بعدم استخدامها في قرارات حساسة أو بيانات حساسة أو إجراءات جسيمة لا يمكن التراجع عنها من دون إشراف لصيق. لا يحول نموذج متاح عمومًا أداة في مرحلة Preview إلى قدرة متاحة عمومًا. وينبغي أن تراعي المشتريات ومراجعة المخاطر ونطاق الإطلاق حالة الأداة نفسها.
أسعار Gemini
تعرض Google أربعة أوضاع معالجة لـGemini 3.7 Flash. وحتى 31 ديسمبر 2026:
- Standard: $0.75 لكل مليون توكن إدخال، و$3.75 لكل مليون توكن إخراج، و$0.075 لكل مليون توكن مخزن مؤقتًا.
- Batch: $0.375 لكل مليون توكن إدخال، و$1.875 لكل مليون توكن إخراج، و$0.0375 لكل مليون توكن مخزن مؤقتًا.
- Flex: $0.375 لكل مليون توكن إدخال، و$1.875 لكل مليون توكن إخراج، و$0.0375 لكل مليون توكن مخزن مؤقتًا.
- Priority: $1.35 لكل مليون توكن إدخال، و$6.75 لكل مليون توكن إخراج، و$0.135 لكل مليون توكن مخزن مؤقتًا.
اعتبارًا من 1 يناير 2027، يصبح سعر Standard هو $1.50/$7.50 مع $0.15 للإدخال المخزن مؤقتًا. ويصبح سعر Batch وFlex هو $0.75/$3.75 مع $0.075 للإدخال المخزن مؤقتًا. أما Priority فيصبح $2.70/$13.50 مع $0.27 للإدخال المخزن مؤقتًا.
توفر فئة Standard Free للنموذج توكنات إدخال وإخراج مجانية، لكن Computer Use غير متاحة في الفئة Free. وتحاسب Google على Computer Use وفق توكنات النموذج العادية في الفئة Paid. يجب إدراج هذا الفرق في أي خطة تجربة: اختبار النموذج الأساسي في AI Studio ليس اختبارًا إنتاجيًا مجانيًا لحلقة استخدام الكمبيوتر.
يهتم الوكيل التفاعلي غالبًا بـStandard أو Priority أكثر من اقتصاديات Batch غير المتزامنة. وقد يكون Flex جذابًا للأعمال القابلة للجدولة إذا ناسبت خصائص خدمته الحلقة. لا تنقل أرخص وضع إلى دراسة الجدوى قبل التأكد من ملاءمة نمط التفاعل الشامل وزمن الاستجابة للمهمة.
الأنسب لـ: أتمتة المتصفح والهاتف وسطح المكتب القابلة للتراجع، عندما يلزم مخطط إجراءات أصلي بسعر منخفض للتوكنات.
نقطة القوة: نموذج واحد موصى به عبر ثلاث بيئات، مع نية الإجراء وسياسات أمان قابلة للضبط وقرارات تأكيد واكتشاف اختياري لحقن التعليمات.
السعر: Standard بسعر $0.75/$3.75 حتى 31 ديسمبر 2026؛ وBatch وFlex بسعر $0.375/$1.875؛ وPriority بسعر $1.35/$6.75 لكل مليون توكن إدخال/إخراج.
التجربة المجانية: لدى النموذج فئة Free، لكن Computer Use متاحة ضمن Paid فقط.
- أدنى سعر حالي للتوكنات بين المسارات الثلاثة التي توفر أداة لاستخدام الكمبيوتر يحددها المزود.
- يلائم دعم المتصفح والهاتف وسطح المكتب ضمان جودة المنتجات ومسارات العمل عبر واجهات متعددة.
- تسهّل نية الإجراء وقرارات الأمان تصميم واجهات الموافقة والتدقيق.
- لا تفرض Computer Use المدفوعة رسمًا منفصلًا لكل استدعاء على صفحة التسعير، بل تحاسب فقط وفق توكنات النموذج العادية.
- تظل Computer Use في مرحلة Preview رغم أن Gemini 3.7 Flash متاح عمومًا.
- تحذر Google صراحة من المهام الحساسة أو الحرجة أو غير القابلة للتراجع من دون إشراف لصيق.
- ينتهي السعر التمهيدي المنخفض مع نهاية 2026.
- يجب تفعيل اكتشاف حقن التعليمات في لقطات الشاشة، ويظل العميل مسؤولًا عن المنفذ والبيئة المعزولة.
من ينبغي له تجاوزه: تجاوز Gemini Computer Use في مسار عمل إنتاجي منظم أو غير قابل للتراجع لا يستطيع قبول مخاطر Preview. وتجاوزه عندما لا يكفي المتصفح وحده ولا يمكن عزل بيئة سطح المكتب المستهدفة. وإذا استهلكت إخفاقات الجودة أكثر من قدر ضئيل من وقت الموظف، فقارن Sol وClaude قبل تحسين بند التوكنات.
4. DeepSeek V4-Flash-Vision-Exp: الأفضل للأطر المخصصة محدودة الميزانية
DeepSeek V4-Flash-Vision-Exp هو أرخص نواة نموذج في هذا الترتيب، وأقل منتجات استخدام الكمبيوتر اكتمالًا. أطلقت DeepSeek النموذج التجريبي متعدد الوسائط في 21 أغسطس 2026 تحت معرّف API الدقيق deepseek-v4-flash-vision-exp.

يقبل النموذج النصوص والصور، ويدعم استدعاءات الأدوات العامة، ويعمل عبر واجهتي Chat Completions وResponses المتوافقتين مع OpenAI، إلى جانب واجهة متوافقة مع Anthropic. ولديه نافذة سياق سعتها 1 مليون توكن، وحد أقصى للإخراج يبلغ 384,000 توكن، ووضعا تفكير وعدم تفكير، وحد معلن للتزامن يبلغ 2,500.
هذه مكونات مفيدة لوكيل يستخدم الكمبيوتر، لكنها ليست أداة إجراءات من الطرف الأول لاستخدام الكمبيوتر. توثق DeepSeek كيفية إرسال لقطات الشاشة واستدعاء الأدوات العامة، لكنها لا توثق مخطط إجراءات مدمجًا للمتصفح أو سطح المكتب، ولا منفذًا، ولا قرارات موافقة، ولا بيئة تشغيل. ووصفه بأنه نواة نموذج استنتاج تحريري من حدود المنتج هذه.
عمليًا، يجب على فريقك تعريف أدوات مثل النقر والكتابة والتمرير والتقاط الشاشة والانتظار وطلب الموافقة. كما يجب عليه التحقق من الوسائط، وربط الإحداثيات، وتشغيل الإجراءات في متصفح أو جهاز افتراضي معزول، وإعادة الحالة الجديدة، واكتشاف الحلقات، والتوقف عند الأخطاء، وتسجيل كل شيء. قد يفضل فريق أتمتة ناضج هذا القدر من التحكم، لكن على من يشتري أول وكيل لاستخدام الكمبيوتر أن يحتسبه تطويرًا لتطبيق.
لماذا يستحق السعر الانتباه؟
تسعّر DeepSeek نموذج V4-Flash-Vision-Exp وفق جدول وقت الذروة وخارجه نفسه المعروض لمسار Flash:
- خارج أوقات الذروة: $0.007 لكل مليون توكن إدخال مصيب للذاكرة المؤقتة، و$0.22 لكل مليون توكن إدخال غير مصيب لها، و$0.66 لكل مليون توكن إخراج.
- وقت الذروة: $0.014 لكل مليون توكن إدخال مصيب للذاكرة المؤقتة، و$0.44 لكل مليون توكن إدخال غير مصيب لها، و$1.32 لكل مليون توكن إخراج.
تمتد ساعات الذروة من 01:00 إلى 04:00 UTC ومن 06:00 إلى 10:00 UTC، وتعد الساعات الأخرى خارج الذروة. واعتبارًا من 23 أغسطس 2026 بتوقيت بكين، تسري أسعار خارج الذروة طوال يومي السبت والأحد بتوقيت بكين.
لا تعلن صفحة التسعير عن فئة مجانية أو تجربة. ومع ذلك تظل تكلفة التقييم العملي ضئيلة جدًا. وفق معيار 50,000 توكن إدخال و5,000 توكن إخراج، تبلغ تكلفة النموذج $0.0143 خارج أوقات الذروة أو $0.0286 في وقت الذروة. يستطيع الفريق إجراء قدر كبير من التجارب قبل أن تصبح التوكنات بند التكلفة الأساسي، لكن ذلك لا يجعل التطوير أو المراجعة أو الإجراء الخاطئ رخيصًا.
قاعدة توكنات الرؤية واضحة على نحو لافت. تُعاد تحجيم الصور الكبيرة إلى ميزانية تقارب 800 في 800 بكسل، مع حد أقصى لكل صورة يبلغ 384 توكن إدخال. وفق سعر الإدخال غير المصيب للذاكرة المؤقتة في وقت الذروة، لا تتجاوز تكلفة 100 لقطة شاشة بأقصى عدد من التوكنات $0.016896 في إدخال الصور. وخارج أوقات الذروة تبلغ $0.008448. ولا يشمل هذا الحساب النص والإخراج والسجل المتكرر واستدعاءات الأدوات العامة وإعادة المحاولة.
يمثل هذا الحد ميزة في التكلفة وقيدًا على الإدراك في آن واحد. قد تفقد ورقة بيانات كثيفة أو نافذة حوار صغيرة أو لوحة معلومات متعددة الأعمدة تفاصيل مهمة عند ضغطها إلى ميزانية صور النموذج. أرسل قصاصة مركزة أو استخدم مسار التفاصيل الموثق original عند الضرورة، ثم تحقق من طريقة إعادة الخدمة لتحجيمها. لا تضمن توكنات الصور الرخيصة دقة قراءة النصوص شديدة الصغر.
يقبل DeepSeek صيغ JPEG وPNG وGIF وWebP. ويمكن إرسال بيانات base64 أو رابط عام أو مرجع Files API. تسمح الخدمة بما يصل إلى 600 صورة لكل طلب، وبحد أقصى 8,192 بكسل لكل ضلع، أو 4,096 بكسل لكل ضلع عندما يحتوي الطلب على 15 صورة أو أكثر. ويمكن أن يصل حجم صور base64 والروابط إلى 32 MiB، وصور Files API إلى 64 MiB، وجسم الطلب المضمن إلى 48 MiB.
هذه الحدود أعلى بكثير من احتياجات حلقة عادية للقطات الشاشة، لذا فإن العائق الحاسم ليس عدد الصور المرفوعة، بل مستوى التحكم المخصص. يجب أن يثبت الفريق أن مخطط إجراءاته وربط الإحداثيات والموافقات ومنطق التعافي تنتج نتائج مقبولة. فرؤية الزر لا تمنح النموذج إذن الضغط عليه.
للمقارنة الأوسع بين النماذج، تغطي صفحة DeepSeek مقابل ChatGPT المزودين خارج مسارات قيادة الشاشة.
الأنسب لـ: فرق الوكلاء ذات الخبرة التي تريد نواة رؤية منخفضة التكلفة داخل إطارها الخاص للمتصفح أو سطح المكتب.
نقطة القوة: حتى 384 توكن إدخال لكل صورة، وتسعير خارج الذروة قدره $0.22/$0.66 للإدخال غير المصيب للذاكرة المؤقتة/الإخراج.
السعر: $0.22/$0.66 خارج أوقات الذروة أو $0.44/$1.32 في وقت الذروة لكل مليون توكن إدخال غير مصيب للذاكرة المؤقتة/إخراج؛ وتبلغ تكلفة إصابات الذاكرة المؤقتة $0.007 خارج الذروة أو $0.014 في الذروة.
التجربة المجانية: لا توجد فئة مجانية أو تجربة معلنة على صفحة التسعير الحالية.
- أدنى تكلفة معيارية لتوكنات النموذج في مقارنة المسارات الأربعة هذه.
- تقلل صيغ الطلب المتوافقة مع OpenAI وResponses API وAnthropic عمل محول النموذج.
- تسمح استدعاءات الأدوات العامة للفريق المتمرس بتحديد مفردات إجراءاته وحدود سياساته.
- يجعل سقف الصور المتوقع البالغ 384 توكنًا ضبط تكلفة إدخال لقطات الشاشة سهلًا.
- تترك الحدود الكبيرة للسياق والإخراج والتزامن وعدد الصور مجالًا لمسارات مخصصة معقدة.
- تثير حالة النموذج التجريبية تساؤلات حول التغيير ومخاطر الإنتاج.
- لا توجد أداة موثقة من الطرف الأول لإجراءات استخدام الكمبيوتر، ولا منفذ أو قرار أمان أو طبقة موافقات.
- قد تزيل إعادة تحجيم الصور تلقائيًا التفاصيل الصغيرة في الواجهة.
- تزيد جداول وقت الذروة وخارجه تعقيد التنبؤ بحركة لا يمكن وضعها في طابور.
- قد تخفي تكلفة التوكنات المنخفضة فاتورة أكبر بكثير للهندسة والتقييم والمراجعة.
من ينبغي له تجاوزه: تجاوز DeepSeek عندما يتوقع المشتري حلقة إجراءات جاهزة، أو يحتاج إلى قرار أمان يحدده المزود، أو لا يملك منفذًا معزولًا ونظام تقييم. وتجاوزه كذلك في مهام النص الصغير أو الشاشات الكثيفة حتى تجتاز لقطات الشاشة المركزة اختبارًا بصريًا ممثلًا.
أي نموذج يناسب كل حالة؟
على مؤسس يملك تمويلًا ويريد أتمتة بحث تنافسي قابل للتراجع أن يبدأ بـGemini 3.7 Flash. فهو يوفر حلقة الإجراءات، ويغطي بيئات المتصفح وسطح المكتب، ويبقي الحد الأدنى لتكلفة النموذج منخفضًا بما يكفي لإجراء تقييم واسع. يتحول الاختيار إلى Sol إذا استهلكت المراجعة والتعافي من الحلقات الفاشلة وقتًا يتجاوز ما يوحي به اختبار فرق الـ22 ثانية تقريبًا، وإلى Claude إذا صار محتوى الويب غير الموثوق وتصميم الموافقات هما المشكلة الأصعب.
على مدير تقني في شركة متوسطة ينقل البيانات عبر تطبيق منظم أو قديم أن يبدأ بـClaude Opus 5 أو Sonnet 5. فاستخدام الكمبيوتر متاح عمومًا على Claude API، ويمكن لمصنفات لقطات الشاشة طلب التأكيد، ويتحكم العميل في البيئة، كما أن الميزة مؤهلة لـZDR. وتهم أهلية HIPAA بموجب BAA في مراجعة النموذج، لكن مسار العمل يظل بحاجة إلى بيانات اعتماد بأقل صلاحية وسجلات محمية وشخص يراجع قبل الإرسال. اختر استخدام المتصفح بدل استخدام الكمبيوتر الكامل عندما تبقى كل الخطوات داخل صفحات الويب.
على موظف خبير يريد أتمتة مسار عمل مكتبي مرتفع القيمة وغير مرتب أن يبدأ بـGPT-5.6 Sol. يبرر تصدر Sol لاختبار OSWorld وفق ما يعلنه المزود، إلى جانب نقطة التعادل الصغيرة في العمل البشري، دفع تكلفة سقف الجودة أولًا. وبعد معرفة عتبة القبول، وجّه أشكال المهام المستقرة إلى Terra أو Luna أو Gemini. الخطأ هو البدء بأرخص فئة وعدم معرفة مقدار التعافي الذي كان يمكن لنموذج أقوى تفاديه.
على المطور التقني الذي يملك منفذ إجراءات وخدمة سياسات ومنظومة تقييم أن يدرج DeepSeek V4-Flash-Vision-Exp في المقارنة. عند هذا المستوى من النضج، لا يصبح مخطط الإجراءات المخصص مشروعًا جديدًا، ويمكن للسعر خارج أوقات الذروة أن يغير تكلفة التقييمات الكبيرة وأعمال الدفعات. احتفظ بمسار أقوى للشاشات ذات النص الصغير والحالات الملتبسة والإخفاقات المتكررة.
يتغير القرار بحسب أربعة أسئلة:
- هل توجد واجهة API مستقرة؟ استخدمها. التحكم في الشاشة هو الحل الاحتياطي للواجهات التي لا توفر مسارًا برمجيًا موثوقًا.
- هل يمكن التراجع عن الإجراء الخاطئ؟ إن لم يكن، فاشترط الموافقة وفضّل مسارًا تلائم حالة إتاحته وضوابطه ومشترياته حجم العاقبة.
- هل تملك المنفذ بالفعل؟ إن لم تملكه، فلن يشتري توفير توكنات DeepSeek حلًا متكاملًا.
- كم ثانية مراجعة توفرها الفئة الأعلى؟ استخدم سجلات المهام المقبولة للاختيار بين Sol وClaude وGemini وDeepSeek، لا بطاقة الأسعار وحدها.
كيف اخترنا هذه النماذج؟
يعتمد هذا الترتيب خمسة معايير مرتبطة بقرار الشراء:
- اكتمال استخدام الكمبيوتر: هل يحدد المزود حلقة إجراءات، أم يكتفي بالرؤية واستدعاء الأدوات العامة؟
- الأدلة الحالية: هل توجد نتيجة معلنة وذات صلة لاستخدام الكمبيوتر، أو حالة منتج، أو تفصيلة تنفيذ يمكن التحقق منها اليوم؟
- اقتصاديات المهمة المقبولة: كم يكلف مقدار موحد من التوكنات، وكم من الوقت البشري يجب أن يوفره المسار الأعلى سعرًا؟
- عائق الإنتاج: أي جزء يظل مسؤولية المشتري، بما في ذلك العزل وعمل المنفذ والموافقات والدفاع ضد حقن التعليمات والتسجيل؟
- استقرار السعر: هل السعر قياسي أم محدود المدة أم متغير حسب الذروة أم مرتبط بقدرة في مرحلة Preview؟
قورنت المنتجات بالاعتماد على وثائقها الحالية وصفحات الأسعار وصفحات النماذج وحالات المزود المسماة في 22 أغسطس 2026. لم تُختبر داخل إطار متصفح مشترك في هذه الجولة، لذا لا تدعي هذه الصفحة تقديم نتيجة اختبار. نموذج التكلفة تحليل أصلي مبني على بطاقات الأسعار المثبتة. أما بروتوكول الـ240 جولة أدناه فهو الطريقة التي يستطيع بها المشتري إنتاج أدلة خاصة بمسار عمله.
تغطي هذه الجولة أربعة مسارات لأن كلًا منها يمثل قرار شراء مختلفًا: أعلى موثوقية، أو تشغيل مؤسسي خاضع للحوكمة، أو مرونة منخفضة التكلفة، أو اقتصاديات منظومة مخصصة. لكل مسار مدرج ميزة حالية وسجل أسعار وطريق للتنفيذ وعائق واضح. ولا تظهر النماذج الأقدم أدناه إلا حيث قد يواجهها المشتري أثناء الترحيل.
لم تؤثر أي علاقة تسويق بالعمولة في هذا الترتيب، ولم يُضف أي شريك تجاري غير ذي صلة. كما لم ترفع الإتاحة التجارية ترتيب أي نموذج أو تخفضه.
نماذج ومسارات ينبغي تجنبها
تجنب OpenAI computer-use-preview عند بناء تكامل جديد
يستخدم شكل الطلب الحالي المتاح عمومًا لدى OpenAI نموذج GPT-5.5 أو أحدث مع tools: [{ type: "computer" }]. أما نموذج computer-use-preview الأقدم وأداة computer_use_preview فيستخدمان شكل إجراءات مختلفًا ويتطلبان إعدادات طلب قديمة. احتفظ بهما فقط أثناء ترحيل تطبيق قائم. أما بدء مشروع جديد على المسار القديم فيخلق عملًا تعرف سلفًا أنك ستضطر إلى استبداله.
تجنب Gemini 2.5 Computer Use Preview عندما يتوفر 3.7
تصنف Google نموذج Gemini 2.5 Computer Use Preview بأنه النموذج القديم. تبلغ تكلفته $1.25 لكل مليون توكن إدخال و$10 لكل مليون توكن إخراج عندما تكون التعليمات 200,000 توكن أو أقل، وترتفع إلى $2.50/$15 فوق 200,000. وتوصي Google بـGemini 3.7 Flash لاستخدام الكمبيوتر، وسعره $0.75/$3.75 حتى 31 ديسمبر 2026. لا تحتفظ بـ2.5 إلا بسبب اعتماد توافق قسته ولا تستطيع إزالته بعد.
تجنب مسارات DeepSeek النصية التي تتنكر خلف وسيط بصري
لا يقبل الصور على واجهة DeepSeek الرسمية سوى deepseek-v4-flash-vision-exp. تعيد نماذج DeepSeek الأخرى خطأ 400 عند إدخال الصور. يستطيع محول من جهة خارجية أن يطلب من نموذج آخر وصف لقطة الشاشة ويمرر النص إلى DeepSeek، لكن ذلك يقيّم منظومة من نموذجين، لا استخدام DeepSeek البصري للكمبيوتر. ستتغير عندها التكلفة وزمن الاستجابة وفقد المعلومات ومعالجة البيانات. سمّ الوسيط مكونًا منفصلًا أو استخدم نموذج الرؤية الدقيق.
تجنب أي وكيل شاشة بلا اختبار قبول
عبارة «وصل النموذج إلى النهاية» ليست نتيجة أعمال. قد يفتح وكيل المتصفح الحساب الخطأ، أو يكتب في الحقل الخطأ، أو يتوقف بعد تغير الصفحة من دون أن يدرك الإخفاق. إذا لم يكن للمهمة فحص حتمي أو معيار مراجع محدد، فهي غير جاهزة للتنفيذ الذاتي على أي من هذه النماذج.
قائمة فحص الإنتاج أهم من اسم النموذج
النموذج مكوّن واحد داخل نظام مضبوط. وقبل زيادة الحجم، ينبغي لمراجعة الإنتاج الإجابة عن الأسئلة التالية:
- البيئة: هل المتصفح أو سطح المكتب معزول عن المضيف والحسابات الشخصية والملفات المحلية وبيانات الاعتماد غير المرتبطة بالمهمة؟
- نطاق الوصول: هل النطاقات والتطبيقات والإجراءات المسموح بها مقيدة بمسار العمل؟
- الأسرار: هل تحصل كل مهمة فقط على نطاق بيانات الاعتماد الذي تحتاج إليه، من دون ظهور سر في لقطات الشاشة أو السجلات؟
- العواقب: ما الإجراءات التي تتطلب دائمًا تأكيدًا بشريًا، وهل يفرض المنفذ هذه القاعدة؟
- الحقن: ماذا يحدث عندما تطلب صفحة أو صورة أو مستند أو نافذة حوار من الوكيل تجاهل مهمته؟
- الحالة: هل يستطيع النظام إثبات الحساب والسجل والنافذة والخطوة التي يعمل عليها قبل تنفيذ إجراء؟
- التعافي: هل يوقف الإجراء الفاشل الدفعة، ويحفظ الأدلة، ويعيد حالة كافية لمحاولة آمنة أو تصعيد؟
- القبول: ما الفحص الآلي أو قرار المراجع الذي يحدد اكتمال المهمة؟
- الاقتصاديات: هل تُسجل توكنات النموذج واستدعاءات الأدوات ووقت التشغيل وإعادة المحاولة وثواني المراجعة لكل مهمة مقبولة؟
- التغيير: هل يستطيع الفريق إعادة تشغيل مجموعة المهام نفسها بعد تغير لقطة النموذج أو السعر أو المتصفح أو واجهة المستخدم المستهدفة؟
يجب أن يكون تبديل النموذج إجراءً روتينيًا. تظل واجهة الإجراءات وسياسة الأمان والسجلات واختبار القبول ثابتة، بينما يتغير النموذج خلفها. وإذا كان تغيير المزود يقتضي إعادة كتابة مستوى التحكم بأكمله، فقد خلط النظام بين صيغة أداة مزود واحد وبين معمارية المنتج.
خطوة الاثنين: نفّذ مقارنة من 240 جولة
لا تحدد موعدًا لـ«تجربة وكيل ذكاء اصطناعي» واسعة. اختر فئة مهام واحدة واتخذ قرار توجيه واحدًا الأسبوع المقبل. استخدم 20 مهمة ممثلة، والمسارات الأربعة في هذا الترتيب، وثلاث محاولات لكل مسار. ينتج عن ذلك 240 جولة. تكفي ثلاث تكرارات لكشف بعض الحظ العابر، من دون الادعاء بأن العينة معيار عالمي.
الاثنين: ثبّت المهمة وقاعدة القبول
اختر 20 مهمة من مسار عمل واحد، تشمل الحالات المعتادة وحالات الشاشات الصغيرة والنوافذ المنبثقة وعناصر التحكم الملتبسة وحالة اختبار آمنة واحدة لحقن التعليمات. أزل الإجراءات النهائية التي لا يمكن التراجع عنها، واكتب شرط النجاح الدقيق والحالات التي تتطلب المراجعة.
الثلاثاء: وحّد البيئة
شغّل كل مسار على أبعاد العرض نفسها، وصورة المتصفح أو الجهاز الافتراضي نفسها، وقائمة السماح للنطاقات نفسها، والحالة الأولية نفسها، ونطاق بيانات الاعتماد نفسه، ومفردات الإجراءات نفسها، والحد الزمني نفسه، وسياسة الموافقات نفسها. وبالنسبة إلى DeepSeek، اربط أدواتك المخصصة بإجراءات المنفذ الأساسية نفسها التي تستخدمها المسارات الأصلية.
الأربعاء: اجمع التكلفة الكاملة لكل جولة
سجّل الإدخال المحتسب والإدخال المخزن مؤقتًا والإخراج واستدعاءات الأدوات القابلة للفوترة ووقت تشغيل المنفذ والوقت المنقضي والمحاولات وتوقفات الأمان وثواني المراجعة البشرية. وخزّن حالة الإخفاق الأولى والدليل النهائي المقبول.
الخميس: احسب تكلفة المهام المقبولة
اجمع تكلفة النموذج ورسوم الأدوات وتكلفة المنفذ وعمل المراجع وفق السعر المتفق عليه في الساعة وتكلفة إعادة المحاولة، ثم اقسمها على عدد المهام المقبولة. وأبلغ أيضًا عن نسبة المهام المقبولة بلا تعديل، والمقبولة بعد إصلاح، والمرفوضة بأمان، والفاشلة بصورة غير آمنة.
الجمعة: وجّه فئة واحدة واحتفظ بمسار التصعيد
اختر أرخص مسار يجتاز عتبة القبول والأمان. واحتفظ بالنموذج الأقوى للتصعيد عند تكرار إجراء أو غموض الحالة أو الاشتباه في الحقن أو فشل التحقق أو الخطوات ذات العواقب الكبيرة. وسجّل معرّف النموذج وتاريخ السعر حتى يمكن إعادة القرار.
خطوة الاثنين صغيرة عن قصد. فقياس فئة مهام واحدة يصنع بند ميزانية يمكن الدفاع عنه، بينما ينتج العرض الواسع مجموعة لقطات شاشة من دون قاعدة توجيه.
الأسئلة الشائعة
ما أفضل ذكاء اصطناعي لاستخدام الكمبيوتر؟
GPT-5.6 Sol هو أفضل نقطة بداية إجمالًا عندما تكون الإخفاقات مكلفة، استنادًا إلى نتيجته المعلنة البالغة 62.6% في OSWorld 2.0 ونقطة التعادل الصغيرة للعمل البشري مقابل فرق تكلفة توكناته. ويقدم Claude Opus 5 المسار المؤسسي الأفضل حوكمة، وGemini 3.7 Flash مسار القيمة، بينما يناسب DeepSeek V4-Flash-Vision-Exp الفرق التي تملك إطار الإجراءات بالفعل.
ما أفضل ذكاء اصطناعي متعدد الوسائط؟
في استخدام الكمبيوتر، أفضل نموذج متعدد الوسائط هو الذي يرى الواجهة المستهدفة بالدقة الكافية، ويعمل مع طبقة الإجراءات والموافقات المطلوبة، ويخفض تكلفة كل مهمة مقبولة. ولا يوفر الاستدلال البصري وحده منفذًا آمنًا أو سياسة أمان أو فحص إكمال.
ما أقوى نموذج ذكاء اصطناعي حاليًا؟
لا يدعم اختبار معياري واحد هذا الادعاء عبر جميع المهام. تعلن OpenAI أن GPT-5.6 Sol حقق 62.6% في OSWorld 2.0، بينما تقدم Anthropic نموذج Opus 5 بقوة لاستخدام الكمبيوتر، وتوصي Google بـGemini 3.7 Flash لأداتها. استخدم هذه الإفصاحات لاختيار قائمة مختصرة، ثم رتب النماذج بحسب المهام المقبولة وزمن التعافي والأمان داخل مسار عملك.
نزّل خريطة أدوات الذكاء الاصطناعي لأصحاب الأعمال وحوّل هذه القائمة المختصرة إلى مقارنة عملية لاستخدام الكمبيوتر خلال أسبوع واحد.
2 سبتمبر 2026







