تحليل الفيديو بالذكاء الاصطناعي في Gemini: متى يكون خفض الرموز 88% حقيقيًا؟

يشرح هذا الدليل كيف يتنقل Gemini داخل الفيديو الطويل بحثًا عن النص والصور والصوت المطلوب، ومتى يحقق النمط الوكيلي خفضًا يصل إلى 88% في عدد الرموز.

Wednesday, September 2, 2026Omid Saffari
Tools
تحليل الفيديو بالذكاء الاصطناعي في Gemini: متى يكون خفض الرموز 88% حقيقيًا؟

في 1 سبتمبر 2026، قدمت Google أسلوبًا مختلفًا لتحليل الفيديو بالذكاء الاصطناعي عبر Gemini API: فبدلًا من تحميل الخط الزمني كاملًا بمعدل ثابت، يستطيع النموذج الآن فحص النص المفرغ أو الإطارات أو الصوت الذي يحتاج إليه فقط للإجابة عن السؤال. وتفيد Google بأن عدد الرموز في مقاطع الفيديو الطويلة قد ينخفض بما يصل إلى 88%، لكن هذه النسبة تمثل الحد الأقصى، وليست خصمًا شاملًا ينطبق على كل فاتورة.

كيف يعمل تحليل الفيديو بالذكاء الاصطناعي في نمط Gemini الوكيلي؟

كان الخيار الافتراضي السابق هو المعالجة الثابتة. يستخرج Gemini إطارًا واحدًا كل ثانية، ويعالج الصوت، ويضع هذه المواد في نافذة السياق، ثم يجيب في تمريرة واحدة. ويسهل توقع سلوكه لأن النموذج يرى الخط الزمني وفق معدل أخذ عينات ثابت، سواء احتاج السؤال إلى المحتوى كله أم لا.

أما الخيار الجديد فهو المعالجة الوكيلية. يحدد النموذج أولًا نوع الأدلة التي يحتاج إليها؛ فيمكنه طلب جزء من النص المفرغ، وتحميل إطارات من لحظة ذات صلة، وفحص الصوت، ثم تكرار هذه الدورة قبل صياغة الإجابة. ببساطة، أصبح Gemini يبحث داخل الفيديو قبل أن يجيب عن محتواه.

يمكن تشبيه الفرق بباحث يعمل في أرشيف للفيديو. في النمط الثابت، تمر جميع البكرات أمام مكتبه. أما في النمط الوكيلي، فيقرأ الفهرس، ويسحب البكرة الأرجح، ويتحقق من المشهد المحدد، ولا يعود لجلب مادة إضافية إلا إذا لم تكفِ المحاولة الأولى.

أُتيحت هذه الميزة في النماذج gemini-3.7-flash وgemini-3.6-flash وgemini-3.5-flash-lite. وهي تعمل عبر كل من Interactions API وGenerateContent API. وتعد Interactions API المسار الموصى به، ولذلك سأستخدمها أدناه لأن استجابتها تعرض خطوات المعالجة التي ينفذها النموذج.

وجه المقارنةالنمط الثابتالنمط الوكيلي
طريقة القراءةإطار واحد في الثانية مع الصوت، ضمن تمريرة واحدةتحميل النص المفرغ أو الإطارات أو الصوت عند الطلب
الأنسب لهالمقاطع القصيرة، وزمن بدء منخفض، ودقة تشمل الخط الزمني كاملًاالفيديوهات الطويلة والأسئلة التي تستهدف لحظات محددة
نمط استهلاك الرموزنحو 100 رمز لكل ثانية عند دقة وسائط منخفضةاستهلاك متغير، مع خفض يصل إلى 88% في الفيديوهات الطويلة
عناصر التحكم الإضافيةتحديد مقاطع زمنية ومعدلات إطارات مخصصةتنقل ديناميكي يتحكم فيه النموذج
الوضع الافتراضينعملا، اضبط processing: "agentic"
أرشيف فيديو من الصلصال يوضح النمط الثابت وهو يحمل كل إطار، والنمط الوكيلي وهو ينتقي النص المفرغ والإطارات والصوت
النمط الثابت يحمل الخط الزمني. أما النمط الوكيلي فيعود لجلب الأدلة التي يتطلبها السؤال.

تقف خلف هذه الدورة خطوتان جديدتان ضمن الاستجابة. تعني processing_call أن النموذج طلب مقطعًا آخر من الفيديو أو من النص المفرغ، بينما تتضمن processing_result المطابقة المادة التي عادت إليه. وعندما تظهر هاتان الخطوتان في interaction.steps، فهذا يؤكد تشغيل التنقل الوكيلي. ويمكن للتطبيق عرضهما باعتبارهما مؤشرًا للتقدم، لكنه غير ملزم بالاستجابة لهما كما يفعل مع استدعاء دالة مخصصة.

وهناك حد فاصل مهم: هذه الميزة مخصصة لفهم الفيديو، لا لتوليده. تستقبل النماذج الثلاثة الفيديو وتعيد نصًا. أما إنشاء الفيديو أو تعديله فله مسار منفصل هو سير عمل Gemini Omni Flash.

لماذا تهم نسبة 88% عند تحليل الفيديو؟

ترتفع تكلفة الفيديو في النمط الثابت بطريقة آلية تمامًا. فعند دقة وسائط منخفضة، يقدر الدليل الاستهلاك بنحو 100 رمز لكل ثانية من الفيديو. وهكذا يصل فيديو مدته ساعة واحدة إلى قرابة 360,000 رمز إدخال قبل توليد الإجابة. ووفق السعر القياسي الحالي لـGemini 3.7 Flash أو Gemini 3.6 Flash، والبالغ $0.75 لكل 1 مليون رمز إدخال حتى 31 ديسمبر 2026، تبلغ تكلفة هذا الإدخال نحو $0.27.

وعند تطبيق الخفض الكامل البالغ 88% على ميزانية الإدخال هذه، ينخفض العدد إلى 43,200 رمز، أي نحو $0.0324 بالسعر نفسه. هذه هي الحالة الجذابة: لم يعد السؤال المحدد عن تسجيل طويل يتطلب وضع كل إطار مأخوذ في نافذة السياق.

لكن ذلك لا يمثل الفاتورة كاملة. فالاستكشاف الوكيلي يولد رموز تفكير تُحتسب بسعر الإخراج، إلى جانب رموز استخدام الأدوات الخاصة بالنص المفرغ والصوت والإطارات التي يحملها النموذج. وقد يفحص النموذج مواد أكثر أيضًا عندما يكون السؤال واسعًا أو يكون الفيديو كثيف التفاصيل البصرية. وتشير Google إلى تحسن في الجودة بنحو 7% للمحتوى الطويل، إلا أن الدليل العام لا يعرض الاختبار المرجعي الذي تستند إليه هذه النسبة.

يغير اختيار النموذج سعر الوحدة أيضًا. تبلغ تكلفة Gemini 3.5 Flash-Lite على الخطة القياسية $0.30 لكل 1 مليون رمز إدخال و$2.50 لكل 1 مليون رمز إخراج. أما Gemini 3.7 Flash وGemini 3.6 Flash فتبلغ تكلفة الإدخال فيهما $0.75 وتكلفة الإخراج $3.75 حتى نهاية 2026، ثم من المقرر أن يتضاعف السعران في 1 يناير 2027.

لذلك تقدم المعالجة الوكيلية للفيديو فائدتين في الوقت نفسه: فهي تساعد على استيعاب مصدر أطول ضمن ميزانية السياق، وتقلل حجم المواد المدفوعة التي يتعين على النموذج فحصها. وتبلغ الفائدة ذروتها عندما يكون المصدر طويلًا والسؤال محددًا.

من لن يتأثر؟ من غير المرجح أن يحصل فريق يعالج مقاطع منتجات مدتها 30 ثانية على الفائدة نفسها. وقد يكون من الأفضل لسير عمل يعرف مسبقًا المقطع المحدد الذي يحتاج إليه ومدته 5 دقائق أن يقتصه ويستخدم النمط الثابت. كذلك لا يظهر أي مفتاح جديد لمستخدم تطبيق Gemini؛ فقد أطلقت Google معاملًا للمعالجة في واجهة API، لا عنصر تحكم للمستهلك.

من يستطيع الاستفادة منه الآن؟

مسؤول تعلم وتطوير لديه تسجيلات تدريبية مدتها ساعة

يستطيع مسؤول التعلم والتطوير في شركة كبيرة رفع ورشة عمل مسجلة وطلب الإجراءات الأساسية، والأمثلة المرتبطة بكل إجراء، واختبار قصير. ويمكن للنمط الوكيلي أن يبدأ بالنص المفرغ، ثم يجلب الإطارات عندما تكون شريحة عرض أو تجربة عملية مهمة، ويتجاوز الأقسام غير المرتبطة بالسؤال.

ولا تقتصر الفائدة على ملخص أقل تكلفة. إذ يمكن طرح أسئلة محددة على المصدر نفسه، مثل: «ماذا قال مقدم العرض عن التصعيد؟»، من دون ملء نافذة السياق بكل إطار أولًا.

مسؤول أبحاث SaaS يراجع مقابلات العملاء

يمكن لمسؤول أبحاث المنتجات أن يطلب من مقابلة مدتها ساعة استخراج كل لحظة يذكر فيها عميل صعوبة في الإعداد الأولي، أو التباسًا في التسعير، أو سير عمل مفقودًا. ويمكن أن تتضمن الإجابة طوابع زمنية ليعود الباحث إلى التسجيل الأصلي قبل تحويل مخرجات النموذج إلى قرار يخص المنتج.

الفائدة هنا هي تسريع المراجعة مع الإبقاء على مسار للتدقيق. يستطيع Gemini حصر اللقطات ذات الصلة، لكن الباحث يظل مسؤولًا عن مراجعة المقطع الذي يدعم الادعاء.

فريق عمليات إعلامية يبحث داخل أرشيف

يستطيع فريق إعلامي توجيه Gemini إلى ندوة عبر الإنترنت أو لقاء عام أو مقابلة طويلة، ثم طلب اللحظة التي يظهر فيها موضوع معين. وهذا هو النوع من المهام الذي صُمم له النمط الوكيلي: خط زمني كبير ومهمة استرجاع محددة.

الفائدة هي تسريع تسليم المادة؛ إذ يحصل المحرر على اللحظات المرجحة وطوابعها الزمنية بدلًا من ملخص فضفاض للبرنامج كاملًا.

مهندس ضمان جودة في التصنيع يفرز تسجيلات الفحص

يمكن لمهندس ضمان الجودة استخدام النمط الوكيلي للبحث في تسجيل كاميرا طويل عن حدث محدد، مثل فتح حاجز حماية أو تغير ضوء تحذيري. وبعد أن يعثر Gemini على فترة زمنية مريبة، يستطيع المهندس معالجة ذلك الجزء القصير بالنمط الثابت.

ولهذه الخطوة الثانية أهميتها. فالنمط الثابت يظل الأداة المناسبة عندما يكون كل إطار مأخوذ مهمًا، وتحذر Google من أن المعالجة بمعدل إطار واحد في الثانية قد تفوت حركة سريعة. يستخدم سير العمل هذا النمط الوكيلي لتحديد النطاق المحتمل، ثم يعتمد النمط الثابت أو نظام رؤية متخصصًا للتحقق من الحدث.

منتج تعليمي يحافظ على سياق الحوار حول محاضرة

يستطيع مطور منتج تعليمي إنشاء تفاعل واحد حول محاضرة، ثم السماح للطالب بطرح أسئلة متابعة باستخدام previous_interaction_id. يحتفظ الخادم بسياق الفيديو، فلا يحتاج المنتج إلى إعادة بناء المحادثة كاملة في كل مرة.

وتتحول الفائدة هنا إلى جلسة دراسة فعلية بدلًا من ملخص لمرة واحدة. لكن إدارة الحالة شرط أساسي: إذا كان المنتج يعمل بلا حالة، فعليه إعادة إرسال كل خطوة معالجة أعادها الخادم، وإلا فقدت الإجابة التالية سياق الفيديو.

كيفية استخدام تحليل الفيديو بالذكاء الاصطناعي عبر Interactions API

يعتمد أقصر مسار ملائم للإنتاج على حزمة Google Gen AI الرسمية للغة Python وعلى Files API. استخدم Files API مع فيديو طويل نسبيًا، أو مع أي فيديو تنوي الاستفسار عنه أكثر من مرة، أو عندما يتجاوز إجمالي الطلب 20 MB.

  1. إعداد مفتاح API وتثبيت SDK

    أنشئ مفتاح Gemini API في Google AI Studio، وضعه في GEMINI_API_KEY، ثم ثبّت الإصدار الحالي من SDK:

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. رفع الفيديو وطلب المعالجة الوكيلية

    استبدل المسار بمسار فيديو محلي. يعرض هذا المثال طريقة Python الواردة في دليل Google للفيديو الوكيلي:

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. التحقق من النمط قبل اعتماد نتيجة الاختبار

    افحص interaction.steps. ينبغي أن تظهر إدخالات processing_call وprocessing_result قبل model_output النهائية. وإذا لم تظهر، فلا يوجد ما يثبت أن الطلب استخدم التنقل الديناميكي.

  4. قياس المقارنة الصحيحة

    شغّل مقاطع الفيديو والأسئلة التمثيلية نفسها في النمطين الثابت والوكيلي. وقارن إجمالي رموز الإدخال، ورموز التفكير، ورموز استخدام الأدوات، والزمن حتى أول رمز، وجودة الإجابة، والتكلفة النهائية. إن نسبة 88% حد أقصى يعلنه المزود؛ وما يحدد بقاء هذا المكسب في بيئة الإنتاج هو مزيج المطالبات الفعلي لديك.

الخطأ الأسهل وقوعًا هو وضع processing على مستوى الطلب بدلًا من كائن الفيديو؛ فمكانه داخل مُدخل الفيديو نفسه. وعندما يحتوي طلب واحد على عدة فيديوهات، يمكن لكل فيديو اختيار نمطه الخاص، بحيث تعمل المحاضرة الطويلة بالنمط الوكيلي بينما يبقى مقطع التجربة القصير في النمط الثابت.

كما أن ترتيب المطالبة مهم. عند إرسال فيديو واحد مع نص، توصي Google بوضع الفيديو أولًا ثم المطالبة النصية بعده، كما في المثال.

ما ينبغي معرفته بلا مبالغة

يستبدل النمط الوكيلي المسح الثابت بحلقة بحث. وفي المقاطع التي تقل مدتها عن 5 دقائق، قد تطيل هذه الحلقة قليلًا زمن الوصول إلى أول رمز، لأن النموذج يفكر ويطلب المواد وينتظر نتائج الأدوات الداخلية قبل بدء الإجابة النهائية. فإذا كان المقطع قصيرًا وكان التطبيق حساسًا لزمن الاستجابة، يظل النمط الثابت الخيار الافتراضي الأبسط.

تمثل عناصر التحكم في الاقتصاص المخصص ومعدل الإطارات حدًا صارمًا آخر. فلا تعمل start_offset وend_offset ومعدل fps المخصص إلا مع المعالجة الثابتة. وإذا كنت تعرف الفترة الزمنية الدقيقة مسبقًا، فقد يكون اقتصاص طلب ثابت أبسط وأكثر قابلية للتوقع من مطالبة النموذج بالعثور عليها مجددًا.

تتطلب حدود الإدخال الانتباه لأن دليل Google الحالي يناقض نفسه. فجدول المقارنة فيه يصف البيانات المضمنة بأنها أقل من 100 MB، بينما ينص قسم البيانات المضمنة التفصيلي على ضرورة بقاء إجمالي الطلب دون 20 MB، ويوجه صراحة إلى استخدام Files API عند تجاوز 20 MB. التزم بالحد المحافظ البالغ 20 MB إلى أن توفق Google بين النصين.

تقبل File API نفسها ملفات يصل حجمها إلى 20 GB في الحسابات المدفوعة و2 GB في الحسابات المجانية. ويمكن للنماذج ذات نافذة السياق البالغة 1,048,576 رمزًا معالجة ما يصل إلى 3 ساعات من الفيديو منخفض الدقة أو ساعة واحدة بدقة عالية. وتعمل روابط YouTube العامة، بخلاف الفيديوهات الخاصة وغير المدرجة. كما تقيد الخطة المجانية إدخال YouTube بحد 8 ساعات يوميًا.

وتخفي المحادثات متعددة الجولات فخًا عند الانتقال إلى الإنتاج. فالطلبات ذات الحالة التي تستخدم previous_interaction_id تبقي سياق الفيديو على الخادم. أما الطلبات بلا حالة، فيجب أن تعيد إرسال كل خطوة من نوع processing_call وprocessing_result. ولا يؤدي حذف هذه الخطوات حاليًا إلى ظهور خطأ، لكن Google تقول إن سياق الفيديو يختفي وإن جودة المتابعة تنخفض بشدة. كذلك تضيف إعادة إرسال الخطوات رموز إدخال جديدة.

وأخيرًا، لا يعني الاسترجاع التحقق. تنص إرشادات السلامة لدى Google نفسها على أن مخرجات النموذج قد تكون غير دقيقة، وتعد المعالجة اللاحقة والتقييم البشري أمرين أساسيين. وفي القرارات الطبية أو القانونية أو المتعلقة بالسلامة أو الامتثال أو الدقة على مستوى الإطار، استخدم Gemini لتحديد موضع الدليل، وأبقِ إنسانًا أو نظامًا حتميًا ضمن مسار الموافقة.

ما الخطوة المناسبة الآن؟

استخدم النمط الوكيلي هذا الأسبوع إذا كان منتجك يرسل تسجيلات طويلة إلى Gemini ويطرح أسئلة محددة عن لحظات أو موضوعات أو حجج بعينها. ابدأ بـGemini 3.7 Flash عندما تكون جودة الإجابة هي الأولوية، واختبر Gemini 3.5 Flash-Lite عندما يتقدم حجم الاستخدام والتكلفة على غيرهما.

تمسك بالنمط الثابت إذا كانت المقاطع قصيرة، أو كان زمن البدء مهمًا، أو كنت تحتاج إلى الاقتصاص أو معدل إطارات مخصص، أو كانت المهمة تتطلب مسحًا متسقًا للخط الزمني كاملًا. لا يلغي الخيار الجديد سابقه، بل يضيف استراتيجية ثانية لقراءة الفيديو.

انتظر إذا لم يكن منتجك قادرًا بعد على تسجيل حقول الاستخدام المنفصلة أو مقارنة الإجابات بالطوابع الزمنية للمصدر. فمن دون هذه الأدلة، لن تعرف إن كان التنقل الوكيلي قد وفر المال فعلًا أم اكتفى بنقل الرموز بين الفئات.

لن تتأثر إذا كان احتياجك هو توليد الفيديو، أو ميزة للمستهلك داخل Gemini، أو تحليلًا حتميًا إطارًا بإطار. فهذه منتجات مختلفة ومشكلات تقنية مختلفة.

إذا أردت تحويل التغيير التالي في المنصة إلى قرار قابل للتنفيذ، فانضم إلى النشرة البريدية.

آخر تحديث

2 سبتمبر 2026

التصنيفExplained

فضّل هذا الموقع في Google

إضافة omidsaffari.com كمصدر مفضّل في بحث Google

اجعل omidsaffari.com مصدرًا مفضّلًا، وسيرفعه Google لك في Top Stories وAI Overviews وAI Mode.

المزيد من Explained

عرض كل مقالات Explained
النشرة البريدية

رسالة واحدة، كل يوم أحد. أنظمة تعمل، لا آراء ساخنة.

سجلات بناء، وأنظمة قيد التشغيل، وملاحظات ميدانية من إدارة محفظة مشاريع ذكاء اصطناعي.

أسبوعية. بلا إزعاج. يمكنك إلغاء الاشتراك متى شئت.