أسعار Together AI API في 2026: متى تستحق وحدات PTU تكلفتها؟
دليل عملي لأسعار Together AI API في 2026، من Serverless ووحدات PTU إلى الاستدلال المخصص، مع أمثلة تكلفة واضحة واختبار فعلي لنقطة التعادل الحقيقية.

أرخص نقطة دخول إلى Together AI API هي Serverless، أما الخيار الجديد بسعر $0.05 لكل PTU في الدقيقة فليس خصمًا على أسعار الرموز المعلنة لدى المنصة. حجز PTU واحدة باستمرار يكلف $2,160 خلال شهر من 30 يومًا؛ لذا اشترها لضمان السعة والحصول على SLA للتوافر بنسبة 99%، لا لتخفيض تكلفة الرموز عند خمول السعة.
أسعار Together AI API باختصار
الأفضل التعامل مع Together AI على مراحل: ابدأ باستخدام Serverless المدفوع مسبقًا، ثم انقل الزيارات المنتظمة والحساسة للاعتمادية إلى Provisioned Throughput، ولا تحجز عتادًا مخصصًا إلا إذا كان عبء العمل يحتاج تحكمًا أحادي المستأجر أو نماذج مخصصة. الخطأ المكلف هو النظر إلى هذه المراحل كأنها خصومات حجم؛ فكل مرحلة تقيس موردًا مختلفًا وتنقل نوعًا مختلفًا من مخاطر التشغيل إلى العميل.

لا تقدم Together AI سلمًا بسيطًا من خطط Free وPro وBusiness. ما تبيعه هو رموز ومخرجات وسائط عبر Serverless، وسعة رموز محجوزة، ووحدات GPU مخصصة ومدارة، وعناقيد GPU خام، وحوسبة Sandbox، وتخزين، وضبط دقيق. وقد يستخدم المنتج الواحد أكثر من عداد؛ فالوكيل مثلًا قد يدفع مقابل رموز النموذج، ومعالج Sandbox وذاكرته، ونقطة نهاية لنموذج مضبوط دقيقًا تستمر فوترتها بين الطلبات.
جميع الأسعار والحدود الواردة هنا جرى التحقق منها بالرجوع إلى صفحة الأسعار المباشرة لدى Together AI ووثائق الفوترة والمنتجات في 22 أغسطس 2026. لهذا التاريخ أهميته؛ فالصفحة الحالية تختلف بوضوح عن تغطيات الأسعار في يونيو، إذ تعرض MiniMax M3 وKimi K3 وGLM-5.2، وأسعارًا مباشرة أقل للعتاد المخصص، وطبقة Provisioned Throughput الجديدة.
قاعدة القرار الأولى واضحة: استخدم Serverless عندما يكون الطلب مجهولًا أو متقطعًا. فكّر في PTU عندما يحمل نموذج محدد حملًا أساسيًا ثابتًا وتكون للسعة المحجوزة قيمة تجارية. اختر Dedicated Inference عند الحاجة إلى نموذج مخصص أو عتاد أحادي المستأجر أو تحكم في الإعدادات. ولا تتجه إلى GPU cluster إلا إذا أرادت الشركة تشغيل الحوسبة الأساسية بنفسها بدل شراء نتيجة استدلال مُدارة.

هذا الفارق يجعل Together AI جذابة لمؤسس ممول يريد مسار API واحدًا يبدأ بالتجربة وينتهي ببنية محجوزة. لكنها أقل جاذبية لمطور مستقل يبحث عن أدنى سعر فوري للرموز، أو لفريق لا يستطيع توقع الطلب حتى لشهر واحد. المرونة هي ما يقدمه Serverless، أما الالتزام فهو عملية شراء مستقلة.
Serverless هو نقطة البداية، واختيار النموذج هو العامل الأكبر في الفاتورة
يُعد Serverless البداية الصحيحة لأنه لا يفرض تكلفة تجهيز ولا حدًا أدنى للاستخدام بعد شراء الوصول إلى المنصة بقيمة $5. ترسل الطلبات إلى بنية مشتركة وتدفع مقابل العمل المنجز. وما يصنع الفارق في الفاتورة فعلًا هو النموذج، واتجاه الرموز، وسعر الذاكرة المؤقتة، وطول المخرجات؛ لا مجرد ظهور اسم Together AI عليها.
يمتد كتالوج المحادثة الحالي عبر نطاق سعري واسع. يكلف LFM2.5-8B-A1B مبلغ $0.03 لكل مليون رمز إدخال و$0.12 لكل مليون رمز إخراج. ويكلف DeepSeek V4 Flash 0731 مبلغ $0.14 للإدخال، و$0.03 للإدخال المخزن مؤقتًا، و$0.28 للإخراج. أما gpt-oss-120B فسعره $0.15 للإدخال و$0.60 للإخراج. وفي الطرف الأعلى من قائمة النصوص المعروضة، يكلف Kimi K3 مبلغ $3 للإدخال، و$0.30 للإدخال المخزن مؤقتًا، و$15 للإخراج لكل مليون رمز.
هذا السعر الخاص بنموذج DeepSeek المستضاف لدى Together هو عداد يخص مزود الخدمة. ويشرح تحليل أسعار DeepSeek المنفصل اقتصاديات النموذج مباشرة؛ أما فاتورة Together فيجب تقديرها من صفحتها المباشرة.
هذا فارق قدره 125x بين سعر إخراج LFM البالغ $0.12 وسعر Kimi K3 البالغ $15. وتحسين اختيار المزود مع تجاهل توجيه النماذج يشبه التفاوض على خصم بسيط للشحن ثم إرسال كل طرد جوًا. أول خطوة للسيطرة على التكلفة هي إسناد كل مهمة إلى أرخص نموذج يحقق مستوى الجودة المطلوب.
يوضح عبء عمل نموذجي لوكيل الصورة بالأرقام. لنفترض أن 1,000 استدعاء يستهلك كل منها 8,000 رمز إدخال وينتج 1,000 رمز إخراج. المحصلة 8 ملايين رمز إدخال و1 مليون رمز إخراج:
- تبلغ تكلفة DeepSeek V4 Flash 0731 الإجمالية $1.40، أو $0.0014 لكل استدعاء.
- تبلغ تكلفة gpt-oss-120B الإجمالية $1.80، أو $0.0018 لكل استدعاء.
- تبلغ تكلفة MiniMax M3 الإجمالية $3.60، أو $0.0036 لكل استدعاء.
- تبلغ تكلفة GLM-5.2 الإجمالية $15.60، أو $0.0156 لكل استدعاء.
- تبلغ تكلفة Kimi K3 الإجمالية $39، أو $0.039 لكل استدعاء.
الفرق الأكبر لا يأتي من هامش المزود، بل من النموذج المختار وحجم المخرجات المكلفة التي ينتجها. فمصنف دعم العملاء الذي يعيد تصنيفًا واحدًا لا يحتاج ميزانية إخراج مماثلة لوكيل بحث يكتب إجابة مطولة. ضع سقفًا صارمًا للمخرجات في المهمة المحددة قبل البحث عن نقطة نهاية أرخص.
ولهذا لا تصبح مقارنة أرخص واجهات AI API مفيدة إلا بعد توحيد المهمة. فمقارنة مزودين باستخدام أطوال مختلفة للموجهات أو الردود، أو افتراضات مختلفة للذاكرة المؤقتة أو النماذج، تنتج رقمًا أنيقًا لا يصلح لاتخاذ قرار مالي.
الإدخال المخزن مؤقتًا يخفض تكلفة المقدمة المتكررة
الإدخال المخزن مؤقتًا هو أقوى خصم ذاتي الخدمة عندما تتكرر الموجهات. تتعرف Together عندئذ على مقدمة لم تتغير، مثل تعليمات نظام طويلة أو سياق مرجعي ثابت، وتحاسب رموزها بسعر أقل في النماذج المدعومة.
في عبء العمل نفسه المكون من 1,000 استدعاء، افترض أن 80% من رموز الإدخال البالغ عددها 8 ملايين مؤهلة لسعر الذاكرة المؤقتة. تنخفض تكلفة MiniMax M3 من $3.60 إلى $2.064، وتنخفض GLM-5.2 من $15.60 إلى $8.304، وKimi K3 من $39 إلى $21.72. وتساوي هذه التخفيضات 42.7% و46.8% و44.3% على الترتيب.
الأثر التشغيلي هنا أكبر من نسبة الخصم نفسها. على المشغل الخبير فصل المقدمة الثابتة عن السياق الخاص بكل طلب، وتسجيل الرموز المخزنة وغير المخزنة كلًا على حدة، ومراقبة تعديلات الموجه التي تبطل الذاكرة المؤقتة. فقد ترفع إعادة صياغة موجه الإنفاق من دون أي تغير في الزيارات، فتبدو المشكلة في الأسعار إلى أن تكشفها بيانات الذاكرة المؤقتة.
Batch أرخص فقط عندما يتأهل النموذج وسير العمل
تمنح Batch API من Together AI خصمًا يصل إلى 50% لنماذج Serverless مختارة مقابل قبول المعالجة غير المتزامنة. وهذا هو العداد المناسب للتصنيف غير الفوري، والبيانات الاصطناعية، والتقييمات، والملخصات بالجملة. لكنه خيار غير مناسب لمحادثة مباشرة أو مساعد دفع أو خدمة عملاء تنتظر الرد التالي.
يسمح عقد Batch الحالي بما يصل إلى 50,000 طلب داخل ملف إدخال حجمه 100 MB، وبما يصل إلى 30 مليار رمز في قائمة الانتظار لكل نموذج. نافذة الإكمال ثابتة عند 24 ساعة وهي هدف قائم على أفضل جهد. توصي Together بدفعات من 1,000 إلى 10,000 طلب. تُفوتر الردود الناجحة ولا تُفوتر الطلبات الفاشلة، كما أن إلغاء الدفعة لا يلغي تكلفة الردود التي اكتمل تنفيذها.
لا ينطبق عنوان الخصم البالغ 50% على كل شيء. فالخصم مخصص لنماذج Serverless مختارة، وبعض النماذج لا تعمل عبر Batch أصلًا. تستطيع نقاط النهاية المخصصة استقبال مهام Batch، لكن الخصم لا يسري عليها. راجع قائمة نماذج Batch المباشرة قبل بناء التوقع المالي.
في مثال حالي مؤهل للخصم، تكلف 8 ملايين رمز إدخال مع 1 مليون رمز إخراج على Llama 3.3 70B مبلغ $9.36 وفق سعر $1.04 لكل من الإدخال والإخراج. أما دفعة مؤهلة لخصم 50% فتكلف $4.68. الوفر حقيقي لأن المهمة تقبل تأخر الإكمال، لا لأن كل طلب Serverless صار أرخص.
الصور والفيديو والصوت والتخزين لها وحدات قياس مختلفة
لا يقتصر Serverless على النصوص. يمتد كتالوج الصور المباشر من $0.0017 إلى $0.134 لكل صورة أو ميغابكسل عبر النماذج المعروضة، فيما تمتد قائمة الفيديو من $0.115 إلى $3.20 لكل فيديو مولد. ويتراوح تحويل الكلام إلى نص من $0.0015 إلى $0.0045 لكل دقيقة صوتية، بينما يتراوح تحويل النص إلى كلام من $4 إلى $65 لكل مليون حرف. وتكلف تضمينات Multilingual e5 large instruct مبلغ $0.02 لكل مليون رمز، ويكلف الإشراف عبر Llama Guard 4 12B مبلغ $0.20 لكل مليون رمز.
هذه النطاقات ليست قابلة للمقارنة المباشرة. توضح Together أن أسعار الصور والفيديو المعروضة تستخدم أدنى دقة أو مدة مدرجة، وأن تجاوز خطوات التوليد الافتراضية قد يضيف تكلفة. يحتاج مدير منتج يضع ميزانية لـ100,000 فيديو قصير إلى معرفة النموذج والمدة والدقة وإعداد الصوت ومعدل إعادة المحاولة بدقة. ضرب أرخص سعر للصورة المصغرة في حجم الإنتاج سيقلل تقدير البند عن واقعه.
يظل Serverless نقطة البداية المناسبة لمعظم الأحمال الجديدة. الحد الذي يصطدم به ليس سعر الرموز، بل السعة المشتركة، وحدود المعدل الديناميكية، وغياب التزام معلن بالتوافر يعادل منتج Provisioned. عندما يتحول ذلك إلى مخاطرة تمس العميل، يصبح القرار التالي قرار سعة لا ترقية عامة.
Provisioned Throughput يحول السعة إلى التزام شهري
لا يستحق Provisioned Throughput الشراء إلا حين تحل سعة الرموز المحجوزة مشكلة تجارية. أطلقته Together AI في 8 يوليو 2026 بوصفه طبقة وسطى بين Serverless القائم على أفضل جهد وDedicated Inference القابل للتهيئة بالكامل. ويأتي مع SLA للتوافر بنسبة 99%، وحد أدنى لشهر واحد، وسعر معلن قدره $0.05 لكل Provisioned Throughput Unit، أو PTU، في الدقيقة.
PTU ليست حزمة رموز، بل معدل محجوز من الرموز في الدقيقة لنموذج مدعوم واحد ومخصص للعميل. يستهلك الإدخال والإدخال المخزن مؤقتًا والإخراج هذه السعة بمعدلات مختلفة. وتعرض الصفحة المباشرة حاليًا ثلاثة جداول عامة:
توفر PTU واحدة من MiniMax M3 عدد 166,667 رمز إدخال، أو 833,333 رمز إدخال مخزن مؤقتًا، أو 41,667 رمز إخراج في الدقيقة. وتوفر Kimi K3 عدد 16,667 للإدخال، أو 166,667 للإدخال المخزن، أو 3,333 للإخراج. أما GLM-5.2 فتوفر 35,714 للإدخال، أو 192,308 للإدخال المخزن، أو 11,364 للإخراج. ويستهلك الطلب المختلط مزيجًا من هذه السعات.
بسعر $0.05 للدقيقة، تكلف PTU واحدة $3 في الساعة، و$72 في اليوم، و$2,160 على مدى شهر من 30 يومًا. تستخدم ملاحظة حاسبة Together نحو 43,800 دقيقة للتجهيز المستمر خلال متوسط الشهر، ما ينتج نحو $2,190. ينبغي للمالية الاعتماد على العقد الفعلي والشهر التقويمي بدل افتراض أن كل شهر يساوي دائمًا $2,160.
اختبار إشغال PTU
الحساب الكاشف هو تقدير تكلفة السعة نفسها لو اشتُريت عبر عداد Serverless لدى Together. إذا خُصصت PTU من MiniMax M3 للإدخال مدة 30 يومًا، يمكنها تقديم نحو 7.2 مليارات رمز إدخال. بسعر Serverless البالغ $0.30 لكل مليون، تساوي هذه السعة نحو $2,160. وإذا خُصصت للإخراج، يمكنها تقديم نحو 1.8 مليار رمز إخراج. وبسعر $1.20 لكل مليون، تساوي أيضًا نحو $2,160. ويصل مسار الإدخال المخزن مؤقتًا إلى النتيجة نفسها ضمن هامش التقريب.
تتم معايرة Kimi K3 وGLM-5.2 بالطريقة نفسها. تبلغ سعة PTU العامة نقطة التعادل مع تسعير Serverless العام عند إشغالها بالكامل تقريبًا طوال شهر من 30 يومًا. قد تعرض الحاسبة المنشورة وفرًا كبيرًا مقارنة بنموذج تجاري مختار، لكنها تنص صراحة على أنها تقارن إنفاق PTU بالسعر المعلن لذلك النموذج الخارجي؛ ولا تثبت وجود خصم شامل على أسعار Serverless لدى Together نفسها.
هذا هو اختبار إشغال PTU: لا تتساوى قيمة السعة مع قيمة Serverless إلا عند استخدام الوحدة المحجوزة بالكامل. عند استخدام 50%، تتضاعف أسعار MiniMax M3 الفعلية إلى $0.60 لكل مليون رمز إدخال، و$0.12 لكل مليون رمز إدخال مخزن مؤقتًا، أو $2.40 لكل مليون رمز إخراج. وعند 25%، تصبح أربعة أضعاف: $1.20 و$0.24 و$4.80. وعند 70%، يبلغ السعر الفعلي نحو 1.43x من Serverless، أي قرابة $0.43 للإدخال و$1.71 للإخراج.

هذا لا يجعل PTU منتجًا سيئًا، بل يوضح ما يشتريه العميل. قد يقبل مدير تقنية في شركة متوسطة 20% من السعة الخاملة إذا خفّض المسار المحجوز مخاطر تقييد الطلبات وكانت لـSLA بنسبة 99% قيمة تعاقدية. أما مؤسس يعتمد على الطلب في أيام العمل فقط، فلا ينبغي أن يدفع تكلفة الليالي وعطلات نهاية الأسبوع إلا إذا كان ضمان السعة يحمي إيرادات تكفي لتغطية العلاوة.
تذكر الصفحة العامة أن مستويات الالتزام الأعلى قد تحصل على خصومات، لكنها لا تنشر جدولها. ينقل الخصم التفاوضي نقطة التعادل إلى ما دون إشغال 100%. وإلى أن يضع فريق المبيعات السعر في نموذج طلب، ابنِ النموذج المالي على السعر العام واعتبر أي خصم مكسبًا إضافيًا.
لا تزال SLA بنسبة 99% تحتاج تفسيرًا تجاريًا
يسمح هدف توافر شهري قدره 99% بنحو 7 ساعات و18 دقيقة من التوقف خلال شهر من 30.4 يومًا. وهو أقوى من وصول قائم على أفضل جهد، لكن فئة Performance للمؤسسات لدى Groq تنشر نسبة 99.9%، لذلك لا تمثل 99% أقوى التزام في هذه القائمة المختصرة. يجب مقارنة التعويض المكتوب واستثناءات الصيانة والتصميم الإقليمي ومسار التحويل الاحتياطي، لا الاكتفاء بوجود رقمين وعلامة النسبة.
يكون Provisioned Throughput أكثر قابلية للدفاع عنه حين يملك التطبيق حملًا أساسيًا ثابتًا، واختيارًا متوقعًا للنموذج، ووعدًا للعميل قد يخرقه تقييد البنية المشتركة. ويكون أضعف حين تتذبذب الزيارات بمقدار 10x، أو يتغير النموذج أسبوعيًا، أو يمكن نقل العمل غير الفوري إلى Batch. في هذه الحالات يحول الحجز عدم اليقين إلى وقت خمول مدفوع.
هذا الاختيار يغير نقاش ميزانية يوم الاثنين
قبل 8 يوليو، كان الفريق الذي يختار Together يواجه قفزة واسعة من Serverless المشترك المحاسب بالرموز إلى بنية GPU مخصصة. تضيف PTU بندًا وسطًا إلى الميزانية: معدل معالجة محجوز للنموذج من دون تحمل مسؤولية تحديد حجم GPU أو بناء منظومة تقديم مخصصة. وهكذا تستطيع المالية اعتماد سقف شهري ثابت للسعة، بينما تواصل الهندسة استخدام واجهة الاستدلال نفسها.
تظهر نتيجة تشغيلية جديدة: لم يعد إنفاق الرموز وحده كافيًا. يحتاج المسؤول إلى معدل الطلبات في الثانية عند الذروة، ومزيج رموز الإدخال والإخراج، ونسبة إصابة الذاكرة المؤقتة، وإشغال السعة، والطلبات المقيدة، والنتائج المقبولة. إذا لم تعرض لوحة المتابعة هذه المقاييس الستة، فلن تعرف الشركة إن كانت PTU حماية أم هدرًا.
PTU واحدة من MiniMax M3 تشتري نحو 600,000 استدعاء وكيل محسوب
يمكن لـPTU واحدة دعم نحو 600,000 استدعاء على MiniMax M3 خلال شهر من 30 يومًا عندما يستخدم كل استدعاء 8,000 رمز إدخال غير مخزن مؤقتًا وينتج 1,000 رمز إخراج. وهذا هو عبء العمل نفسه الذي حُسب سابقًا بسعر $0.0036 لكل استدعاء عبر Serverless، ولذلك تكلف 600,000 استدعاء عبر Serverless مبلغ $2,160. يلتقي عداد السعة وعداد الرموز عند الإشغال الكامل بحكم التصميم.
يستخدم حساب السعة جانبي الطلب معًا. تستهلك ثمانية آلاف رمز إدخال نحو 0.048 دقيقة من PTU وفق جدول MiniMax M3 البالغ 166,667 رمز إدخال في الدقيقة. ويستهلك ألف رمز إخراج 0.024 دقيقة إضافية من PTU وفق معدل 41,667 رمز إخراج في الدقيقة. وهكذا يستهلك الطلب الكامل نحو 0.072 دقيقة من PTU. بقسمة 43,200 دقيقة PTU في الشهر على أثر الطلب، تكون النتيجة نحو 600,000 استدعاء.
ومن هنا تتشكل ميزانية تشغيل جاهزة للقرار:
عند إشغال 80%، تدعم PTU نحو 480,000 استدعاء. وتبلغ فاتورة Serverless المكافئة $1,728، ما يترك علاوة حجز شهرية قدرها $432. بذلك تكون PTU أعلى بنسبة 25% من تكلفة عمل Serverless المستهلك. ويمكن لمنتج يواجه العملاء قبول هذه العلاوة إذا كانت السعة المحجوزة وSLA بنسبة 99% تحميان إيرادات أو وقت دعم أو سمعة تتجاوز قيمتها $432.
عند إشغال 70%، تدعم نحو 420,000 استدعاء. يكلف Serverless مبلغ $1,512، فتبلغ علاوة السعة $648. وعند 50% تدعم 300,000 استدعاء، فيما يكلف Serverless مبلغ $1,080، أي إن نصف فاتورة PTU يصبح مقابل سعة خاملة مدفوعة.
تغير الذاكرة المؤقتة عدد الاستدعاءات التي تستوعبها الوحدة. إذا كان 80% من الإدخال مخزنًا مؤقتًا، يستهلك كل طلب نحو 0.04128 دقيقة PTU بدلًا من 0.072. ويمكن لوحدة واحدة عند الإشغال الكامل حمل نحو 1.0465 مليون من الاستدعاءات نفسها. وينخفض سعر Serverless بالتزامن من $0.0036 إلى $0.002064 لكل استدعاء، لذلك تظل تكلفة الحمل الكامل متقاربة عند $2,160.
المكسب التجاري من الذاكرة المؤقتة هو زيادة معدل المعالجة وخفض تكلفة الوحدة معًا. تسمح مقدمة نظام طويلة وثابتة للسعة المحجوزة نفسها بخدمة عدد أكبر من العملاء. أما تعديل الموجه بما يدمر إعادة استخدام الذاكرة، فيخفض هامش PTU ويرفع إنفاق Serverless في آن واحد.
لنوسع القرار إلى بند كامل في الميزانية. تكلف عشر وحدات PTU مبلغ $21,600 لشهر من 30 يومًا، وتحمل نحو 6 ملايين من الاستدعاءات المحسوبة غير المخزنة عند الإشغال الكامل. وعند 70% تحمل 4.2 ملايين استدعاء. تبلغ فاتورة Serverless المكافئة $15,120، ما يترك علاوة شهرية قدرها $6,480 مقابل السعة المحجوزة وSLA.
على مدير التقنية تبرير مبلغ $6,480 تحديدًا. إذا كان تقييد البنية المشتركة يهدد بأكثر من $6,480 من الهامش الإجمالي أو أعباء الدعم أو الغرامات التعاقدية، فقد يستحق الحجز مكانه. وإن لم يكن كذلك، يُبقي Serverless مبلغ $6,480 نفسه متاحًا لتطوير المنتج. أما حجة عامة مثل «ننفق $15,000 على الرموز» فلا توصل إلى هذا القرار.
لا يملك Dedicated Inference نقطة تعادل عامة بالوضوح نفسه، لأن معدل الإخراج يعتمد على النموذج والتكميم وشكل الدفعة وعدد وحدات العتاد والإعدادات. وأي مقال يقسم السعر الشهري لوحدة GPU على سعر رموز عام واحد ثم يعلن نقطة انتقال صالحة للجميع يخفي المتغير الذي يحسم النتيجة. اختبر النموذج المرشح على نقطة النهاية المقصودة، ثم قارن تكلفة كل نتيجة مقبولة عند معدل الاستخدام الفعلي.
Dedicated Inference وGPU clusters يحلان مشكلتين مختلفتين
يكون Dedicated Inference الخطوة الصحيحة عندما تكون السيطرة أهم من مرونة الخدمة الذاتية. تخصص Together عتادًا أحادي المستأجر، وتدعم النماذج المخصصة، وتوفر التوسع التلقائي والتعامل مع طفرات الزيارات. السعر المباشر هو $5.49 لكل GPU في الساعة لجهاز NVIDIA HGX H100، و$8.99 لجهاز HGX B200. أما أسعار H200 وB300 وGB200 NVL72 وGB300 NVL72 فتتطلب التواصل مع المبيعات.
عند التشغيل المستمر 30 يومًا، تكلف وحدة H100 واحدة $3,952.80، ووحدة B200 واحدة $6,472.80. وهذه أرقام لكل GPU قبل احتساب أي حاجة إلى عدة وحدات. تستمر فوترة نقطة النهاية ما دامت تعمل بصرف النظر عن حجم الطلبات، لذلك يظل النشر الخامل بندًا فعليًا في الميزانية.
لا تستخدم وثائق نقاط النهاية المخصصة القديمة لتوقع فاتورة العتاد. تعرض الوثائق حاليًا أرقامًا لـH100 وH200 وB200 تتعارض مع صفحة الأسعار المباشرة. الصفحة الحالية هي المصدر الأحدث وهي المعتمدة في هذا التحليل. ولهذا تحديدًا ينبغي إرفاق التاريخ بأي سعر للبنية التحتية.
يبرر Dedicated Inference تكلفته عندما يتعذر تشغيل نموذج مضبوط دقيقًا أو مرفوع على Serverless المشترك، أو عندما يحتاج زمن p99 إلى عتاد مستقر، أو تتطلب خدمة النموذج إعدادات مخصصة، أو يجعل الاستخدام المرتفع المنتظم GPU المحجوز أكثر جدوى اقتصاديًا. ويخسر جدواه عندما تقضي نقطة النهاية معظم اليوم في الانتظار.
GPU clusters خام أكثر، وقد تبدو أرخص للسبب الخطأ
تنقل GPU clusters جزءًا أكبر من المنظومة إلى المشتري. الأسعار الحالية عند الطلب هي $3.99 لكل GPU في الساعة لـH100، و$5.99 لـH200، و$8.19 لـB200. ويبلغ مكافئ H100 لشهر من 30 يومًا مبلغ $2,872.80، لكنه ليس بديلًا أرخص من Dedicated H100 البالغ $3,952.80؛ فمشتري العنقود يتحمل قدرًا أكبر من النشر والتقديم والتنسيق والمراقبة وإدارة الاستخدام.
تنخفض أسعار العنقود المحجوز مع مدة الالتزام. ينخفض H100 إلى $3.69 لمدة 7-30 يومًا، و$3.45 لمدة 31-90 يومًا، و$3.19 لمدة 91-180 يومًا. وينخفض H200 من $4.99 إلى $4.15 ثم $3.99 عبر الفئات نفسها. أما B200 فينخفض من $7.99 إلى $7.79 ثم $6.79. وتتطلب المدد البالغة 181 يومًا أو أكثر عرض سعر.
للخصم قيود صارمة. تنص وثائق فوترة GPU لدى Together على تحصيل قيمة الحجز كاملة مقدمًا أو خصمها فور تجهيز الموارد. الحجوزات غير قابلة للاسترداد، ولا يمكن استرداد جزء منها أو إيقافها مؤقتًا. وإذا توسع العنقود فوق السعة المحجوزة، تُفوتر السعة الإضافية بسعر الاستخدام عند الطلب.
في حجز H100 لمدة 91-180 يومًا، تبلغ تكلفة الشهر الموحد على 720 ساعة مبلغ $2,296.80 لكل GPU، أي أقل بـ$576 من مكافئ الاستخدام عند الطلب. لا قيمة لهذا الوفر إلا إذا ظلت GPU مشغولة بعمل مفيد. فحجز أربع وحدات GPU مع ترك نصفها خاملًا لا يصبح اقتصاديًا لمجرد انخفاض السعر بالساعة.
للتخزين دورة حياة مستقلة أيضًا. يكلف التخزين المشترك $0.16 لكل GiB شهريًا، وبذلك يكلف 1 TiB نحو $163.84 شهريًا. يستمر القرص وتستمر فوترته بعد إنهاء العنقود حتى يحذفه أحد. وهذه ميزة تشغيلية عند إعادة إنشاء الحوسبة حول بيانات دائمة، لكنها تحول الأقراص المهجورة أيضًا إلى إنفاق صامت.
قد يكون تدريب Fine-tuning رخيصًا بينما تظل استضافته مكلفة
للضبط الدقيق تكلفتان منفصلتان: مهمة التدريب، ثم نشر النموذج بعد ذلك. قد يبدو بند التدريب ضئيلًا، لكن استضافة النتيجة يمكن أن تصبح أكبر تكلفة شهرية.
تحسب Together التدريب القياسي بضرب رموز مجموعة البيانات في عدد الحقب، ثم إضافة رموز التقييم الاختيارية مضروبة في عدد مرات التقييم. بالنسبة إلى النماذج التي تصل إلى 16B من المعاملات، يكلف Supervised Fine-tuning مبلغ $0.48 لكل مليون رمز معالج باستخدام LoRA و$0.54 باستخدام Full fine-tuning. أما Direct Preference Optimization، أو DPO، فيكلف $1.20 مع LoRA و$1.35 مع Full tuning.
بالنسبة إلى نماذج 17B-69B، تبلغ الأسعار الأربعة $1.50 و$1.65 و$3.75 و$4.12. وبالنسبة إلى نماذج 70B-100B، تصبح $2.90 و$3.20 و$7.25 و$8. والحد الأدنى القياسي لتكلفة المهمة هو $4.
تخضع النماذج الأكبر والنماذج المسماة لتسعير متخصص. يبلغ سعر LoRA لنموذج DeepSeek V4 Flash مقدار $6 لكل مليون رمز معالج في Supervised Fine-tuning و$15 في DPO، مع حد أدنى قدره $12. ويبلغ سعر gpt-oss-120B مقدار $5 و$12.50 بحد أدنى $6. أما Kimi K2.6 أو K2.7-Code فسعره $15 و$37.50 بحد أدنى $60، وGLM-5.2 بسعر $40 و$100 بحد أدنى $60.
يغير هذا التفاوت الخاص بالنماذج تكلفة تجربة تبدو بسيطة. فمجموعة بيانات من 20 مليون رمز تُشغّل لثلاث حقب تعالج 60 مليون رمز. في مهمة LoRA قياسية لنموذج حتى 16B، يكلف التدريب الموجّه $28.80. أما على LoRA المتخصص لـGLM-5.2، فتكلف كمية الرموز المعالجة نفسها $2,400. لم يتغير حجم البيانات؛ الذي تغير هو سعر النموذج الأساسي.
ومع ذلك، لا تمثل مهمة التدريب تكلفة دورة الحياة كاملة. يحتاج النموذج المضبوط دقيقًا إلى سعة نشر ورصيد مدفوع مسبقًا كافٍ. تكلف وحدة Dedicated H100 واحدة تعمل 30 يومًا بالسعر الحالي $3,952.80. قد ينفق الفريق $28.80 لإنشاء موائم صغير، ثم ينفق شهريًا أكثر من 137x هذا المبلغ لإبقاء H100 واحدة نشطة.
هنا تتعثر ميزانيات النماذج الأولية غالبًا. يبلغ عالم البيانات عن تكلفة التدريب، ثم ترى المالية لاحقًا فاتورة التقديم. اعتمد التجربة ومعها خطة للنشر تحدد ساعات التشغيل المتوقعة، وعدد وحدات GPU، والحد الأدنى للتوسع التلقائي، وحجم الطلبات، والمسؤول عن الإيقاف.
أما التدريب الملغى فاسترداده أضيق مما يتوقعه كثير من المشترين. تحاسب Together على الخطوات المكتملة ولا تعيد إلا قيمة العمل الذي لم يكتمل. وتبقى رسوم المنصة القياسية غير قابلة للاسترداد افتراضيًا بموجب الشروط. تعامل مع مهمة التدريب كحوسبة مستهلكة، لا كاشتراك برمجي قابل للرجوع.
Sandbox وCode Interpreter عدادان مستقلان للوكلاء
يكلف Code Sandbox مبلغ $0.0446 لكل vCPU في الساعة، إضافة إلى $0.0149 لكل GiB من RAM في الساعة. وتكلف بيئة Sandbox تعمل بـ2 vCPU و8 GiB لمدة 160 ساعة نحو $33.34. ويستخدم Code Interpreter عدادًا مختلفًا بسعر $0.03 لكل جلسة مدتها 60 دقيقة.
في منتج قائم على الوكلاء، تقع هذه الرسوم بجوار تكلفة استدلال النموذج. فإذا فتحت 10,000 عملية وكيل شهرية جلسة Interpreter مدتها ساعة، يبلغ بند Interpreter وحده $300 قبل رموز النموذج. وإذا أمكن إعادة استخدام الجلسات بأمان، تغير بنية المنتج تكلفة كل مهمة مكتملة. أما إذا بقيت الجلسات مفتوحة بعد انتهاء العمل، تصبح الحوسبة الخاملة نظيرًا أصغر حجمًا لخمول GPU.
لذلك الوحدة الصحيحة هي تكلفة النتيجة المقبولة، لا تكلفة مليون رمز. يكلف استدعاء MiniMax M3 المحسوب $0.0036؛ أضف إليه جلسة Code Interpreter واحدة بسعر $0.03، فتبلغ تكلفة المسار $0.0336 على الأقل قبل إعادة المحاولة أو استدعاءات الأدوات الأخرى. قِس المسار كاملًا.
Together AI ليست مجانية، حتى عندما يعرض النموذج سعر رموز $0
لا تقدم Together AI حاليًا تجربة مجانية، وتشترط شراء رصيد مدفوع مسبقًا بقيمة لا تقل عن $5 قبل الوصول إلى المنصة. لذلك فالجواب عن وجود خطة مجانية واضح: لا يوجد حساب مجاني بلا دفع لاستخدام API.
يعرض الكتالوج المباشر بالفعل Ternary Bonsai 27B بسعر $0 لكل مليون رمز إدخال و$0 لكل مليون رمز إخراج. وقد يجعل ذلك تكلفة الاستدلال المستمرة $0 ما دام العرض متاحًا، لكن الحساب لا يزال يحتاج شراء الوصول بقيمة $5. ولا يوصف مبلغ $5 بأنه اشتراك شهري. كما أن الأرصدة المدفوعة مسبقًا المشتراة لا تنتهي صلاحيتها حاليًا.
من الذي لن يحتاج إلى دفع المزيد بعد أول $5؟ مستخدم هاوٍ أو مقيّم يكتفي بالنموذج الحالي ذي السعر الصفري، ويلتزم بحدود المعدل، ولا يشغّل أي خدمة مدفوعة؛ عندها قد يبقى الرصيد المشتَرى من دون مساس. هذه حالة ضيقة وليست فئة إنتاج مجانية. يمكن أن يتغير توافر النموذج وسعته وسعره، ولا ينبغي لمنتج أن يعد عملاءه بأن نقطة نهاية ترويجية أو صفرية السعر ستظل خلفيته الدائمة.
انتهت عروض أرصدة التسجيل المجانية السابقة. تنص سياسة الدعم الحالية لدى Together على أن المستخدم يجب أن يشتري $5 على الأقل ويربط وسيلة دفع. ولا يوجد رصيد سالب في الوصول العادي المدفوع مسبقًا؛ عندما يصل الرصيد المشتَرى إلى الصفر، يتوقف الوصول إلى API حتى إضافة رصيد جديد. أما عملاء العقود فتسري عليهم شروط طلباتهم.
الأرصدة لا تنتهي، لكنها ليست حساب توفير قابلًا للاسترداد
لا تنتهي صلاحية الأرصدة المشتراة حاليًا. وهذا أفضل من سياسة انتهاء سنوية، لكنه لا يجعل الإفراط في شحن الحساب بلا ضرر. تنص شروط Together على أن الرسوم المدفوعة غير قابلة للاسترداد افتراضيًا، وأن التزامات الدفع غير قابلة للإلغاء، وأن أجزاء الشهر لا تُحسب نسبيًا ما لم ينص نموذج الطلب على خلاف ذلك.
يستحق الشحن التلقائي ضبطًا حذرًا. تذكر وثائق الفوترة مبلغ شحن افتراضيًا قدره $25، وتحذر من أن وضع حد تشغيل أعلى من الرصيد الحالي قد يطلق عمليات شراء فورية متكررة حتى سد الفجوة. اربط الحد بمعدل الحرق المتوقع، وأنشئ تنبيهًا لكل عملية شراء، واحتفظ بميزانية على مستوى المشروع خارج رصيد الحساب.
Build Tiers ترفع الحدود وفق الإنفاق التراكمي
فئات Build Tiers الخمس لدى Together هي شرائح لحدود المعدل مبنية على الإنفاق التراكمي، وليست خطط ميزات شهرية. تبدأ Tier 1 عند $5 وتعرض 600 طلب LLM في الدقيقة. وتبدأ Tier 2 عند $50 وتعرض 1,800، وTier 3 عند $100 وتعرض 3,000، وTier 4 عند $250 وتعرض 4,500، وTier 5 عند $1,000 وتعرض 6,000.
ترتفع حدود Embedding من 3,000 RPM في Tier 1 إلى 10,000 في Tier 4 وTier 5. ويرتفع حد Rerank من 500,000 إلى 5,000,000 عبر الفئات الخمس. وهذه ليست وعودًا عامة لكل نموذج؛ إذ تستطيع Together فرض قيود خاصة بالنماذج، كما تصف وثائق Serverless الحالية حدودًا ديناميكية تستجيب للسعة المباشرة والزيارات الناجحة مؤخرًا.
لهذا المزيج أثر مهم عند الإطلاق. حتى حساب Tier 5 قد يتلقى استجابة 429 إذا كانت سعة نموذج رائج أضيق، أو إذا قفزت الزيارات كثيرًا فوق نمطها الحديث. يحل Serverless مشكلة التجهيز، لا كل طفرة. وتبقى Batch أو PTU أو Dedicated Inference مسارات الخروج، ولكل منها مفاضلة مختلفة بين التكلفة وزمن الاستجابة.
التكاليف الخفية في معظمها عدادات خاملة وحدود في السياسات
تتسم أسعار الرموز الظاهرة لدى Together AI بالوضوح عمومًا. أما المفاجآت المكلفة فتقع بين المنتجات، وفي الالتزامات والموارد الخاملة والافتراضات التي تبدو عامة وهي ليست كذلك.
حساب تقويم PTU: ينتج سعر $0.05 للدقيقة مبلغ $2,160 خلال شهر من 30 يومًا. وتستخدم ملاحظة الحاسبة المباشرة نحو 43,800 دقيقة، فتنتج نحو $2,190. يصبح فرق $30 لكل PTU مبلغ $3,000 عبر 100 وحدة PTU. استخدم قاعدة الفوترة الواردة في العقد.
ضعف استخدام PTU: تتم معايرة PTU العامة لتساوي قيمة Together Serverless عند الإشغال الكامل طوال 30 يومًا. وعند إشغال 50% تتضاعف تكلفة الرموز الفعلية. قد يبرر المنتج هذه العلاوة بقيمة السعة وSLA، لكن يجب إظهارها بوضوح.
خمول Dedicated: يفوتر Dedicated Inference العتاد المخصص طوال تشغيله، حتى مع صفر طلب. يجب إدراج استضافة النموذج المضبوط دقيقًا في التوقع الشهري، لا في تذكرة التجربة وحدها.
الحجوزات غير القابلة للاسترداد: تُحصّل حجوزات GPU cluster للمدة كاملة، ولا يمكن إيقافها مؤقتًا أو استرداد جزء منها. أي خطأ في التوقع يتحول إلى إنفاق ملتزم به.
تجاوز الطفرة عند الطلب: يُفوتر التوسع فوق سعة GPU المحجوزة بالسعر الأعلى عند الطلب. وقد يظل الحمل الأساسي الثابت ينتج مفاجأة إذا كان افتراض الطفرة منخفضًا أكثر من اللازم.
التخزين الدائم: يبقى التخزين بعد إنهاء العنقود ويستمر في الفوترة حتى حذفه. يحتاج كل تفكيك للعنقود قرارًا صريحًا: احتفاظ أم حذف.
أهلية Batch: الخصم خاص بالنموذج، ونافذة 24 ساعة قائمة على أفضل جهد، وتظل الردود المكتملة قابلة للفوترة بعد الإلغاء. لا تطبق 50% على ميزانية العمل غير الفوري كلها من دون مراجعة القائمة المباشرة.
إعدادات الوسائط الافتراضية: قد تشير أسعار الصور والفيديو إلى أقل دقة أو مدة أو عدد افتراضي للخطوات. ترفع إعدادات جودة الإنتاج وإعادات المحاولة تكلفة الأصل الصالح للاستخدام.
سلوك الشحن التلقائي: قد يطلق حد مبالغ فيه عمليات شراء فورية، فيما تظل الرسوم العادية غير قابلة للاسترداد. تعامل مع الشحن التلقائي كأداة لاستمرارية الإنتاج مزودة بتنبيهات، لا كإعداد يُترك بلا متابعة.
انحراف المخرجات: أي تحديث للموجه أو النموذج ينتج ردودًا أطول يرفع الإنفاق حتى لو ظل حجم الطلبات ثابتًا. تتبع الإدخال والإدخال المخزن والمخرجات والنتائج المقبولة كلًا على حدة.
انحراف حدود المعدل: قد تكون حدود Serverless ديناميكية وخاصة بالنموذج. شراء Tier 5 عبر الإنفاق التراكمي لا يحجز البنية الأساسية.
لا يوجد خصم سنوي قياسي للخدمة الذاتية يمكن إدخاله في النموذج المالي. يعمل Serverless بالاستخدام المدفوع مسبقًا، وتفرض PTU حدًا أدنى لشهر واحد، وتنشر حجوزات GPU فئات 7-30 و31-90 و91-180 يومًا، بينما تذهب الالتزامات الأطول إلى المبيعات. مخاطر القفل السنوي توجد في نموذج طلب مخصص أو سلسلة حجوزات للبنية التحتية، لا في خطة تطبيق سنوية معلنة.
بدائل Together AI: وحّد النموذج قبل الاختيار
ليست Together AI الأرخص وحدها في كل نموذج مشترك. بالنسبة إلى gpt-oss-120B، يطابق سعر Serverless العام لديها سعر Fireworks AI وGroq تمامًا: $0.15 لكل مليون رمز إدخال و$0.60 لكل مليون رمز إخراج. وتكلف مهمة تستخدم 1 مليون رمز إدخال و250,000 رمز إخراج مبلغ $0.30 لدى كل مزود، قبل أي ميزة للإدخال المخزن أو اتفاق خاص بالحساب.
هذا التعادل مفيد؛ فهو يزيل سعر الرموز من عوامل الحسم، ويجبر المشتري على مقارنة سعر الذاكرة المؤقتة، وحدود المعدل، وزمن الاستجابة، والتحكم في المزود، وسلوك التحويل الاحتياطي، ومسارات النشر، وحزمة SLA.
Fireworks AI يطابق السعر الأساسي ويضيف ذاكرة مؤقتة أرخص
يعرض Fireworks AI نموذج gpt-oss-120B Standard عبر Serverless بسعر $0.15 للإدخال، و$0.015 للإدخال المخزن مؤقتًا، و$0.60 للإخراج لكل مليون رمز. تكلف المهمة الموحدة غير المخزنة مبلغ $0.30 نفسه كما في Together. كما يعلن Fireworks عن رصيد بداية بقيمة $1.

يفوز Fireworks في هذه المقارنة الضيقة عندما يحتوي عبء العمل على مقدمة كبيرة قابلة لإعادة الاستخدام، لأن سعر الإدخال المخزن الحالي لـgpt-oss واضح ومنخفض. كما يقدم فئات Standard وPriority وFast في Serverless، ما يضيف خيارًا آخر بين زمن الاستجابة والسعر. لكن هذه الفئات الإضافية تعقّد مقارنة يفترض أنها بسيطة، كما أن سعر GPU المخصص لديه يخص منتجًا مختلفًا عن PTU لدى Together.
اختر Fireworks عندما تكون الحاجة الرئيسية هي Serverless لنماذج مفتوحة تعتمد كثيرًا على الذاكرة المؤقتة، وتناسب ضوابط فئات الخدمة التطبيق. واختر Together عندما تكون القيمة الاستراتيجية الأكبر هي الانتقال من API نفسها إلى PTU، أو استدلال نموذج مخصص، أو ضبط دقيق، أو Sandbox، أو عناقيد خام.
Groq يبيع السرعة بسعر الرموز نفسه
يعرض Groq نموذج gpt-oss-120B بالسعر نفسه: $0.15 للإدخال و$0.60 للإخراج، فتبلغ تكلفة المهمة الموحدة أيضًا $0.30. وتعرض صفحة النموذج الحالية نحو 500 رمز في الثانية، وحدًا قدره 250,000 رمز في الدقيقة ضمن خطة Developer، و1,000 طلب في الدقيقة لهذا النموذج.

يكون Groq الخيار الأوضح في القائمة المختصرة عندما يكون انخفاض زمن التوليد هو وعد المنتج. تضيف فئة Performance للمؤسسات معدل معالجة مجهزًا مسبقًا مع SLA للتوافر بنسبة 99.9%، لكن السعر العام غير منشور. لذلك يسهل مقارنة تكلفة الرموز ذاتية الخدمة، بينما يستحيل توحيد تكلفة السعة المحجوزة من دون عرض سعر.
اختر Groq لمسار تفاعلي تكون فيه مجموعة النماذج المدعومة والسرعة أهم من منظومة Together الأوسع للتدريب والبنية التحتية. وتجاوزه إذا كان عبء العمل يحتاج Fine-tuning أو GPU cluster أو Sandbox أو مسار PTU عام ضمن حساب واحد.
OpenRouter قد يكون أرخص، لكن مقابل مفاضلة استخدام وسيط
يعرض OpenRouter حاليًا gpt-oss-120B بسعر $0.03 للإدخال، و$0.03 للإدخال المخزن مؤقتًا، و$0.17 للإخراج لكل مليون رمز. وتكلف المهمة الموحدة ذات 1 مليون رمز إدخال و250,000 رمز إخراج مبلغ $0.0725 قبل رسوم شراء الرصيد. وإذا وُزعت رسومه البالغة 5.5% على أرصدة مستهلكة بالكامل، ترتفع التكلفة إلى نحو $0.0765، مع أن الحد الأدنى للرسوم البالغ $0.80 يهيمن على عمليات الشحن الصغيرة.

يفوز OpenRouter في مثال السعر الفوري عبر التوجيه بين مزودين أساسيين. كما يوفر تحويلًا احتياطيًا تلقائيًا وكتالوج نماذج أوسع كثيرًا. لكنه ليس المنتج نفسه الذي يتيح حجز سعة لدى Together أو اختيار مزود بنية واحد؛ إذ يصبح اختيار المسار وسياسة البيانات وزمن الاستجابة وتوافر المزود الأساسي وتبدلات المزود جزءًا من التصميم.
فئته المجانية أسهل وصولًا من Together: تعرض صفحة الأسعار الحالية أكثر من 25 نموذجًا مجانيًا و50 طلبًا في اليوم. وتشمل المفاضلات حدودًا مجانية منخفضة، ورسوم منصة بنظام الدفع حسب الاستخدام قدرها 5.5%، وحق المنصة في إنهاء صلاحية الأرصدة غير المستخدمة بعد سنة. في المقابل، تقول Together حاليًا إن الأرصدة المشتراة لا تنتهي.
اختر OpenRouter عندما يكون الوصول إلى مجموعة واسعة من النماذج، والتحويل الاحتياطي، والسعر الفوري الحالي هي الأولويات. واختر Together عندما يكون التحكم المباشر في المزود، أو مسار متوقع إلى سعة محجوزة، أو تدريب النماذج، أو البنية المخصصة أهم من أرخص طلب موجّه.
النتيجة الموحدة صريحة: تتعادل Together وFireworks وGroq في سعر الرموز غير المخزنة لـgpt-oss-120B. ويكون OpenRouter أرخص في هذه اللقطة، لكنه يغير علاقة المشتري بالمورد. ينقلب القرار وفق المتطلب التشغيلي، لا وفق ادعاء عام بأن منصة واحدة أرخص دائمًا.
من يناسبه Together AI، ومن الأفضل أن يتجاوزه؟
Together AI منصة مناسبة للشركة التي تتوقع أن يتطور عبء عمل النماذج المفتوحة لديها من استدعاءات مجهولة النمط إلى خطة سعة مدروسة. لكنها ليست الاختيار التلقائي لكل مطور يبحث عن API منخفضة التكلفة.
على المطور التقني المستقل أن يبدأ بـServerless ويحصر أول شراء في $5. وجّه مهمة محددة إلى DeepSeek V4 Flash أو gpt-oss-120B أو أي نموذج آخر يحقق مستوى الجودة المطلوب. لا تنتقل إلى PTU أو العتاد المخصص حتى تثبت سجلات الإنتاج وجود طلب منتظم. وإذا كان الهدف الوحيد تجربة نماذج كثيرة أو الوصول المجاني، فقد يكون OpenRouter الحساب الأول الأبسط.
يناسب Together المؤسس الممول عندما يقلل سلم النشر أعمال الترحيل مستقبلًا. يستطيع Serverless إثبات صلاحية المنتج، ثم تحجز PTU نموذجًا مفتوحًا ثابتًا خلف API نفسها، وبعدها يستضيف Dedicated Inference نموذجًا مضبوطًا دقيقًا أو مخصصًا. وتفوق قيمة هذا الاستمرار فارقًا صغيرًا في سعر الرموز عندما تشير خارطة المنتج أصلًا إلى سعة محجوزة.
على مدير التقنية في شركة متوسطة شراء PTU من أجل التزام الخدمة، لا بسبب كِبر الفاتورة. توقّع الإشغال، وقارن SLA البالغة 99% بالوعد المقدم للعميل، وقدّر قيمة حجز السعة مقابل المعاملات المفقودة أو تصعيد الدعم. وإذا كان التطبيق يحتاج توافرًا بنسبة 99.9%، فلا يكفي بند 99% وحده؛ صمم مسارًا احتياطيًا أو تفاوض على العقد.
على المشغل الخبير نقل الأحمال غير الفورية إلى Batch قبل حجز السعة. يمكن لأعمال التصنيف والإثراء والتقييمات والبيانات الاصطناعية أن تحصل على خصم يصل إلى 50% في النماذج المؤهلة. هذا خصم مباشر مقابل قبول زمن انتظار، أما PTU فهي شراء سعة ويجب أن تأتي لاحقًا.
على فريق البحث أو النماذج ألا يستخدم Dedicated Inference أو GPU clusters إلا مع مسؤول واضح عن الاستخدام. قد تبرر منظومة التدريب والتقديم المخصص والتحكم منخفض المستوى التكلفة. لكن الفريق الذي لا يستطيع مراقبة ساعات GPU والنسخ الخاملة واستخدام الطفرات والأقراص الدائمة يشتري بنية لا يستطيع إدارتها.
تجاوز Together AI إذا تحقق أحد أربعة شروط. إذا كان أرخص رمز موجّه هو الأولوية الوحيدة، أو كانت الزيارات متقلبة أكثر من أن تناسب حجز شهر، أو كان النموذج المطلوب متاحًا في مكان آخر، أو كانت الشركة تحتاج SLA عامة أقوى من دون تفاوض مع المبيعات. قد يكون Fireworks أو Groq أو OpenRouter أو مزود النموذج المباشر أنسب.
- يجمع حساب واحد Serverless وسعة الرموز المحجوزة وDedicated Inference وFine-tuning وGPU clusters وحوسبة Sandbox والتخزين.
- أسعار Serverless الحالية منافسة لعدة نماذج مفتوحة، مع خصومات كبيرة للإدخال المخزن مؤقتًا في نقاط النهاية المدعومة.
- الأرصدة المدفوعة مسبقًا المشتراة لا تنتهي صلاحيتها حاليًا.
- يضيف Provisioned Throughput مسارًا عامًا بسعر $0.05 لكل PTU في الدقيقة بين الاستدلال المشترك والمخصص.
- لا توجد تجربة مجانية بلا دفع؛ إذ يتطلب الوصول إلى المنصة شراء بقيمة $5.
- لا يتعادل سعر PTU العام مع Together Serverless إلا عند الإشغال الكامل، قبل الخصومات التفاوضية.
- قد تكون SLA بنسبة 99% لوحدات PTU أضعف من احتياجات مسارات العملاء الحساسة في غياب بديل احتياطي.
- يمكن أن تستمر فوترة Dedicated وحجوزات GPU والتخزين والنماذج المضبوطة دقيقًا حتى عندما يكون حجم الطلبات صفرًا.
- قد تتعارض الأسعار المباشرة مع وثائق منتجات أقدم، لذلك تحتاج المشتريات إلى مصدر مؤرخ.
خطوة الاثنين: قِس عبء عمل واحدًا قبل أي حجز
اختر يوم الاثنين سير عمل إنتاجيًا محددًا، وابنِ له سجل تكلفة على مدى سبعة أيام. ليس الهدف اختبار كل نموذج، بل معرفة ما إذا كان الحمل ينتمي إلى Serverless أو Batch أو PTU أو السعة المخصصة.
حدد نتيجة مقبولة واحدة
اختر مهمة يمكن تقييم نتيجتها: تصنيف صحيح، أو تعديل كود ناجح، أو مسودة دعم معتمدة، أو استخراج مكتمل. المقياس التجاري هو تكلفة كل نتيجة مقبولة.
سجل شكل الاستخدام كاملًا
التقط عدد الطلبات، والإدخال غير المخزن، والإدخال المخزن، والإخراج، وإعادات المحاولة، وذروة الطلبات في الثانية، واستجابات 429، وزمن الاستجابة، ووقت Sandbox، والنتائج المقبولة لمدة سبعة أيام. افصل ذروات أيام العمل عن الليل وعطلات نهاية الأسبوع.
احسب خط أساس Serverless
طبّق أسعار النموذج المباشرة على مزيج الرموز المقاس. انقل العمل غير الفوري المؤهل إلى Batch وأعد الحساب. ضع سقفًا للمخرجات غير الضرورية وحافظ على مقدمات الموجه الثابتة، حتى يتضمن خط الأساس وفر الذاكرة المؤقتة الممكن تحقيقه.
نفذ اختبار إشغال PTU
استخدم حاسبة PTU المباشرة مع معدل الطلب عند الذروة، ونسبة إصابة الذاكرة المؤقتة، ومزيج الرموز. قارن عدد وحدات PTU المطلوبة بمتوسط الاستخدام. عند إشغال 80%، يحمل السعر العام علاوة فعلية للرموز قدرها 25%؛ فاحسم ما إذا كانت السعة المحجوزة وSLA بنسبة 99% تستحقانها.
لا تصعّد إلا لمتطلب محدد بالاسم
انتقل إلى Dedicated Inference من أجل النماذج المخصصة أو التحكم أحادي المستأجر أو أداء مستقر للعتاد. وانتقل إلى GPU clusters فقط عندما يملك الفريق منظومة التقديم أو التدريب. ضع اسم مسؤول الإيقاف وتنظيف التخزين بجوار مسؤول الميزانية.
ينبغي أن تكون خلاصة القرار جملة واحدة تفهمها المالية والهندسة معًا: «سيبقى عبء العمل هذا على Serverless»، أو «سينتقل هذا المسار غير الفوري إلى Batch»، أو «سيحجز مسار العميل هذا N من وحدات PTU لأن ضمان السعة يستحق علاوة الخمول المقاسة». هذه خطوة ليوم الاثنين، وليست عملية ترحيل بنية مبنية على عنوان عن الأسعار.
الأسئلة الشائعة حول أسعار Together AI API
كم تكلف 1,000 رمز على Together AI؟
اقسم سعر النموذج لكل مليون على 1,000، واحسب الإدخال والإخراج كلًا على حدة. يكلف MiniMax M3 مبلغ $0.0003 لكل 1,000 رمز إدخال غير مخزن، و$0.0012 لكل 1,000 رمز إخراج. ويكلف Kimi K3 مبلغ $0.003 للإدخال و$0.015 للإخراج لكل 1,000 رمز.
كم تكلف Together AI شهريًا؟
لا يفرض Serverless اشتراكًا شهريًا ثابتًا؛ فبعد شراء الوصول بقيمة $5، تتبع التكلفة الشهرية الاستخدام. تكلف PTU واحدة $2,160 في شهر من 30 يومًا، أو نحو $2,190 وفق افتراض متوسط الشهر البالغ 43,800 دقيقة في صفحة الأسعار. وتكلف وحدة Dedicated H100 تعمل باستمرار $3,952.80 خلال 720 ساعة بالسعر الحالي البالغ $5.49 للساعة.
هل Together AI مجانية؟
لا. لا تقدم Together AI حاليًا تجربة مجانية، وتشترط شراء رصيد مدفوع مسبقًا بحد أدنى $5 للوصول إلى المنصة. يعرض الكتالوج المباشر Ternary Bonsai 27B بسعر $0 لرموز الإدخال والإخراج، لكن الحساب يظل بحاجة إلى شراء $5.
هل تمنح Together AI أرصدة مجانية؟
ليس كعرض تسجيل دائم. انتهت عروض التسجيل السابقة، ويتطلب الوصول الحالي شراء $5. كما تدير Together برنامج أرصدة بحثية بدعوات فقط لمشروعات طلابية خارج المقررات الرسمية، لكنه غير متاح على نطاق واسع.
ما حدود الفئة المجانية لدى Together AI؟
لا توجد فئة مجانية بالمعنى المعتاد. يضع رصيد مشتَرى بقيمة $5 الحساب في Build Tier 1، التي تعرض حاليًا 600 طلب LLM في الدقيقة، و3,000 طلب Embedding في الدقيقة، وحد Rerank يبلغ 500,000. وقد تكون الحدود الخاصة بالنماذج والديناميكية أقل.
ما أفضل بدائل Together AI؟
يُعد Fireworks AI أقرب بديل واسع لاستدلال النماذج المفتوحة وضبطها الدقيق، ويبرز Groq للنماذج المدعومة منخفضة زمن الاستجابة، بينما يتفوق OpenRouter في اتساع توجيه النماذج والتحويل الاحتياطي. بالنسبة إلى gpt-oss-120B، تشترك Together وFireworks وGroq حاليًا في سعر $0.15 للإدخال و$0.60 للإخراج لكل مليون رمز؛ وسعر OpenRouter الموجّه أقل في هذه اللقطة، لكنه يضيف رسوم شراء رصيد وطبقة وسيطة.
هل تقدم Together AI خصمًا للطلاب؟
لا تنشر Together AI فئة أسعار دائمة للطلاب. يقدم برنامج الأرصدة البحثية المتاح بدعوات فقط منحًا صغيرة للطلاب الذين يجرون مشروعات خارج المقررات الرسمية، ويطلب من المستفيدين الإشارة إلى Together AI في العمل.
ما سياسة استرداد الأموال لدى Together AI؟
تنص شروط Together على أن الرسوم غير قابلة للاسترداد افتراضيًا، وأن التزامات الدفع غير قابلة للإلغاء أو الحساب النسبي ما لم يحدد نموذج الطلب خلاف ذلك. حجوزات GPU غير قابلة للاسترداد. وعند إلغاء مهمة Fine-tuning، تُحسب الخطوات المكتملة ولا تُسترد إلا قيمة الجزء غير المكتمل.
هل تنتهي صلاحية أرصدة Together AI؟
لا تنتهي صلاحية الأرصدة المدفوعة مسبقًا المشتراة حاليًا. وهذا منفصل عن إمكانية الاسترداد؛ فقد تظل الأرصدة صالحة للاستخدام من دون أن تكون قابلة للاسترداد، كما لا تستطيع الأرصدة المشتراة بعد صدور فاتورة تسوية رصيد أقدم متأخر السداد.
هل تغيرت أسعار Together AI في 2026؟
نعم. أطلقت Together AI منتج Provisioned Throughput في 8 يوليو 2026، وأضافت سعة رموز محجوزة بسعر $0.05 لكل PTU في الدقيقة، وحدًا أدنى لشهر واحد، وSLA للتوافر بنسبة 99%. كما تغير كتالوج Serverless الحالي وأسعار العتاد المخصص منذ يونيو، ولهذا تحمل هذه الصفحة تاريخ تحقق هو 22 أغسطس.
هل Provisioned Throughput أرخص من Together Serverless؟
ليس تلقائيًا. بالأسعار العامة، تعادل PTU المشغولة بالكامل تقريبًا قيمة سعتها عبر Together Serverless طوال 30 يومًا. يرفع ضعف الاستخدام السعر الفعلي للرموز. تشتري PTU سعة محجوزة وSLA؛ وقد يحسن خصم تفاوضي مقابل الالتزام السعر، لكن Together لا تنشر جدول الخصومات.
احصل على خريطة أدوات AI لأصحاب الأعمال
تحول خريطة أدوات AI لأصحاب الأعمال أسعار النماذج إلى منظومة اعتماد عملية، وتوضح مستوى الجودة المطلوب ودور التوجيه ومحفز التكلفة لكل أداة. اشترك لتحصل على الإصدار التالي مجانًا.
2 سبتمبر 2026







