Gemini Omni Flash: مولد فيديو بالذكاء الاصطناعي قابل للتحرير بالمحادثة

تعرّف إلى Gemini Omni Flash، مولد فيديو بالذكاء الاصطناعي الذي ينشئ المقاطع من النص والصور ويتيح تعديلها بالمحادثة مع الحفاظ على سياق المشهد.

Thursday, September 3, 2026Omid Saffari
Gemini Omni Flash: مولد فيديو بالذكاء الاصطناعي قابل للتحرير بالمحادثة

لم يعد استخدام مولد فيديو بالذكاء الاصطناعي أشبه بآلة حظ تمنحك نتيجة عشوائية من المحاولة الأولى. أصبح أقرب إلى جلسة تحرير فعلية: أنشئ مقطعًا، وأرفق صورة مرجعية، واطلب تعديلًا واحدًا، ثم احتفظ بالعناصر التي نجحت.

هذه هي القيمة الحقيقية في Gemini Omni Flash، نموذج الفيديو التجريبي من Google ضمن Gemini API. فهو يحوّل النص إلى فيديو، والصورة إلى فيديو، وينشئ مقاطع انطلاقًا من مراجع، ثم يتيح تعديل النتائج بأوامر لاحقة عبر Interactions API. والطلب في السوق واضح بالفعل: تُظهر بيانات DFS نحو 246,000 عملية بحث شهرية على Google عن ai video generator، و40,500 عن image to video ai، و27,100 عن ai video editor.

ما هو Gemini Omni Flash، مولد فيديو بالذكاء الاصطناعي من Google؟

Gemini Omni Flash هو نموذج Google التجريبي لإنشاء الفيديو بسرعة وتحريره عبر المحادثة. معرّف النموذج هو gemini-omni-flash-preview، وتقدّمه Google استنادًا إلى ثلاث ركائز: تعدد الوسائط المدمج، والتحرير بالحوار، والمعرفة بالعالم.

أسهل طريقة لفهمه هي تخيّل موقع تصوير يمتلك ذاكرة. مولد الفيديو التقليدي يشبه الاستعانة بطاقم، وتسليمه موجزًا، ثم انتظار نجاح اللقطة الأولى. أما Gemini Omni Flash فيُبقي الطاقم حاضرًا؛ يمكنك أن تطلب «اجعل الإضاءة أكثر درامية» أو «أخفِ الهاتف»، ثم تحصل على لقطة جديدة من دون شرح المشهد كله مرة أخرى.

تأتي هذه الذاكرة من Interactions API. تمثّل كل Interaction دورة كاملة ضمن المهمة. وعند تمرير previous_interaction_id، يستطيع الخادم استرجاع سجل المحادثة السابق، بما فيه حالة الفيديو المُنشأ، كي يبني الطلب التالي عليه. وفي سير عمل الفيديو لدى Omni، ينتج كل تعديل لاحق فيديو جديدًا.

مجسّم طيني يوضح تحوّل مدخلات النص والصورة والفيديو والصوت إلى مشهد فيديو محرر
التحول الأهم هو الاحتفاظ بالحالة: يستطيع الفيديو التالي تذكّر الفيديو السابق.

يقبل النموذج الأوامر النصية والصور المرجعية ومسارات العمل التي تتضمن فيديو مرفوعًا. وتصفه Google أيضًا بأنه متعدد الوسائط بصورة مدمجة عبر النص والصورة والصوت والفيديو، لكن النسخة التجريبية تفرض قيدًا عمليًا واضحًا: لا يدعم إصدار API الحالي المراجع الصوتية المرفوعة، كما لا يدعم تحرير الصوت البشري.

بالنسبة إلى أبعاد المخرجات، يدعم aspect_ratio النسبتين 16:9 و9:16، وتكون الوضعية الأفقية هي الافتراضية. أما نوع المهمة في generation_config.video_config.task، فيمكن أن يكون text_to_video أو image_to_video أو reference_to_video أو edit. وإذا لم تحدد المهمة، يحاول النموذج استنتاج المقصود من الأمر النصي.

التسعير هنا ليس موجّهًا للهواة. تتوفر نسخة Gemini Omni Flash Preview ضمن الفئة المدفوعة فقط في Gemini API. تسعّر Google إدخال النص والصورة والفيديو والصوت عند $1.50 لكل 1M tokens. أما المخرجات، فسعرها $9.00 لكل 1M tokens للنص و$17.50 لكل 1M tokens للفيديو. ووفق Google، يُحتسب فيديو 720p بمعدل 5,792 output tokens في الثانية، أي نحو $0.10 للثانية وفق تسعير Standard.

كيف يعمل ببساطة؟

سير العمل مباشر: صف المشهد، وأرفق مادة بصرية إن احتجت إليها، وحدد أبعاد الفيديو، ثم اجعل كل تعديل محدودًا وواضحًا.

لإنشاء فيديو جديد، ترسل أمرًا نصيًا. وتوصي Google بأن يتضمن وصف المشهد وحركة الكاميرا والإضاءة والمزاج. وإذا أردت مشهدًا متصلًا بلا انقطاع، فاذكر ذلك صراحة؛ من الصيغ التي توصي بها Google: "single unbroken shot" و"single continuous shot" و"no scene cuts".

عند تحويل الصور إلى فيديو بالذكاء الاصطناعي، أرفق صورة وصف الحركة المطلوبة. يمكن مثلًا تحويل صورة منتج إلى لقطة رئيسية تدور ببطء، أو تحويل رسم أولي إلى مشهد واقعي. وتحذّر Google تحديدًا من الأوامر المبهمة مثل "make it move"؛ فالأمر الأقوى يصف حركة العنصر، وحركة الكاميرا، والمؤثرات المحيطة.

في العمل المعتمد على المراجع، يمكنك تمرير عدة صور. يستخدم مثال Google صورتين كمدخلات، إحداهما لصورة قطة والأخرى لصورة كرة من الخيط، ثم يطلب مقطعًا للقطة وهي تلعب بالخيط. ويدعم دليل كتابة الأوامر أيضًا وسوم الأدوار: يمكن استخدام <FIRST_FRAME> لتحديد إطار البداية، و<IMAGE_REF_N> لتحديد صورة مرجعية. يبدأ ترقيم مراجع الصور من 0.

في التعديلات، يكون الأمر القصير هو الأفضل غالبًا: "Change the lighting to be more dramatic. Keep everything else the same." الجملة الأخيرة مهمة، لأن نماذج الفيديو قد تفسر طلب التعديل على أنه إذن بإعادة تكوين جزء كبير من المقطع.

بالنسبة إلى ملفات المخرجات الكبيرة، توصي Google باستخدام response_format.delivery="uri" عندما يتجاوز الفيديو المُنشأ 4 MB. يعيد ذلك URI مستضافًا لدى Google، ثم يستطلع تطبيقك حالته حتى يصبح الملف ACTIVE قبل تنزيله. وبالنسبة إلى الوسائط المرفوعة، تدعم Files API ما يصل إلى 20 GB لكل مشروع و2 GB لكل ملف، وتحتفظ بالملفات لمدة 48 ساعة. وتوصي Google باستخدام Files API عندما يتجاوز الحجم الإجمالي للطلب 100 MB.

حالات الاستخدام مرتبة بحسب الأسرع استفادة

1. فرق الإعلانات المدفوعة التي تنتج نسخًا متعددة من الفيديو

يمكن لمسوق الأداء أن يبدأ بصورة منتج ناجحة وموجز قصير ومقاس خاص بمنصة مثل 9:16. ينشئ Gemini Omni Flash فيديو مع الصوت، ثم يستطيع المسوق طلب تعديلات صغيرة: كادر أقرب، أو إضاءة مختلفة، أو حذف الحوار، أو حركة افتتاحية أسرع، أو ظهور كلمة واحدة في كل مرة.

المكسب الحقيقي هو سرعة التكرار. فالجزء المكلف في إعلانات الشبكات الاجتماعية المدفوعة ليس إنتاج مقطع مصقول واحد، بل صنع عشرات المحاولات القريبة من النجاح للوصول إلى النسخة التي تستحق الإنفاق عليها. ويتناسب التحرير بالمحادثة مع هذه الدورة، لأنه يحافظ على المشهد الأساسي مع تغيير متغير واحد في كل مرة.

2. فرق التجارة الإلكترونية التي تحوّل صور المنتجات إلى حركة

غالبًا ما يملك متجر Shopify الذي يضم مئات وحدات SKU صورًا ثابتة، لا مسار إنتاج متكاملًا. سير العمل هنا مباشر: ارفع صورة المنتج، واطلب حركة قصيرة للمشهد الرئيسي، وحدد الخلفية ومسار الكاميرا وسلوك المنتج، ثم أنشئ نسخًا ملائمة للمنصات بنسبة 16:9 و9:16.

تزداد قيمة هذا الأسلوب عندما يصعب فهم المنتج من صورة ثابتة. فالأحذية والحقائب والأدوات المنزلية وأدوات التجميل وملحقات المكاتب والأجهزة الصغيرة تستفيد جميعًا من الحركة التي توضح الحجم والملمس وسياق الاستخدام.

رف تجارة إلكترونية طيني يحوّل صورة منتج واحدة إلى عدة إعلانات فيديو للجوال
حالة الاستخدام التجاري الأولى ليست السينما، بل تحريك المنتجات بسرعة إنتاج النسخ المتعددة.

3. الوكالات التي تنتج نسخًا أولية قبل التصوير

يمكن للوكالة استخدام Gemini Omni Flash كمساحة عمل لمرحلة ما قبل الإنتاج. وبدل عرض لوحة قصة على هيئة إطارات ثابتة، تستطيع تقديم ثلاثة توجهات للحركة: لقطة مقرّبة ثابتة للمنتج، أو لقطة حياتية بكاميرا محمولة، أو مونتاج اجتماعي سريع. وهكذا يعلّق العميل على الحركة والإيقاع والمزاج قبل حجز أي جلسة تصوير.

المكسب هو جودة القرار. فكثيرًا ما يوافق العملاء على فكرة مكتوبة، ثم لا تعجبهم عند رؤيتها متحركة. يكشف المقطع الأولي المصنوع بالذكاء الاصطناعي نقاط الخلاف في وقت أبكر.

4. فرق العقارات التي تصنع مقاطع تشويقية للعروض

يستطيع الوسيط العقاري استخدام صور العقار كمراجع، ثم طلب مقطع تشويقي قصير للعرض: اقتراب من الواجهة الخارجية، وحركة أفقية في غرفة المعيشة، وتفصيل من المطبخ، وشرفة وقت الغروب. العنصر الحاسم هنا هو الانضباط؛ ينبغي للمقطع أن يسوّق طابع العقار، لا أن يزيّف جولة داخله أو يختلق مزايا غير موجودة.

المكسب هو جذب الانتباه. فصفحات العروض الخالية لا تنافس جيدًا في خلاصات الشبكات الاجتماعية. ويمنح مقطع قصير، موضح بجلاء أنه أُنتج بمساعدة الذكاء الاصطناعي، الوسيط طريقة أسرع لتجهيز العرض من أجل Instagram أو YouTube Shorts أو الإعلانات المحلية.

5. فرق التدريب التي تحوّل الإجراءات المملة إلى مشاهد

يمكن لفرق العمليات تحويل إجراء مكتوب إلى تسلسل بصري: خطوة استلام في مستودع، أو قائمة تحقق للسلامة، أو تسليم للعميل، أو روتين افتتاح متجر. وبما أن Omni يستطيع ضبط توقيت الأحداث عبر الأوامر، يمكن للمدرّب طلب تسلسل من ثلاثة أجزاء تقع فيه كل خطوة عند لحظة محددة.

المكسب هو سهولة الاستيعاب. قد يتجاهل الموظف الجديد ملف PDF، لكن مقطعًا بصريًا واضحًا يستطيع أن يريه كيف يبدو الأداء الجيد قبل أن يبدأ العمل.

6. صنّاع المحتوى الذين ينتجون مقاطع بقالب متكرر

يمكن لصانع المحتوى تحديد قالب قابل للتكرار: لقطة واحدة متصلة، بلا حوار، وكلمة واحدة على الشاشة كل ثانية، ونمط موسيقي محدد، وإيقاع بصري ثابت. بعد ذلك يغيّر الموضوع مع إبقاء القالب سهل التعرّف.

المكسب هو انتظام الإنتاج. لا يزال صانع المحتوى بحاجة إلى الحس الإبداعي، لكن النموذج يقلل الاحتكاك بين الفكرة والمسودة القابلة للنشر.

7. فرق المنتجات التي تختبر لحظات الفيديو داخل المنتج

يمكن لفريق المنتج إعداد نموذج أولي لفيديو إطلاق ميزة، أو حركة تعريفية للمستخدم، أو لحظة نجاح داخل التطبيق، قبل أن تلتزم فرق التصميم والرسوم المتحركة بالتنفيذ. وبما أن Gemini Omni Flash يدعم النص داخل الفيديو، تستطيع الفرق أيضًا اختبار ما إذا كان ملصق أو رمز بصري بسيط سيجعل الرسالة أوضح.

المكسب هو توحيد الرؤية. إذ تستطيع فرق المنتج والنمو والتصميم تقييم العنصر المتحرك نفسه بدل الاختلاف حول نماذج ثابتة.

ما الذي يستحق البناء باستخدامه؟

أقوى فرصة هي إنشاء محرر لنسخ إعلانات الفيديو يعمل بالأوامر النصية. يتموضع هذا المنتج بين مولد فيديو عام وحزمة إبداعية متكاملة: ترفع المواد المصدرية، وتنشئ مقطعًا أساسيًا، ثم تنتج نسخًا مضبوطة مع الحفاظ على المشهد.

الطلب ظاهر بالفعل. تسجّل بيانات DFS نحو 27,100 عملية بحث شهرية عن ai video editor مع نية شرائية. وتُظهر البيانات نفسها 320 عملية بحث شهرية عن ai powered video ads، بصعوبة كلمات مفتاحية منخفضة وتكلفة نقرة مرتفعة جدًا تبلغ $97.83. حجم العبارة صغير، لكنها ترسل إشارة شراء قوية. وحتى أسئلة نتائج البحث تأتي بصيغة توحي بمنتج مطلوب: «هل يوجد ذكاء اصطناعي يستطيع تحرير الفيديو الخاص بي؟» و«هل يستطيع ChatGPT تحرير الفيديو؟» و«ما أفضل ذكاء اصطناعي لتحرير الفيديو؟»

الحد الأدنى للمنتج ضيق النطاق: اربط صور المنتجات وقواعد العلامة التجارية وقوالب الأوامر المعتمدة؛ أنشئ أول مقطع بنسبة 9:16؛ ثم أظهر أزرار تعديل للإضاءة والخلفية والإيقاع والنص والصوت والدعوة إلى اتخاذ إجراء. العقبة هي التشابه. فإذا حصل كل عميل على القالب نفسه، تحول المنتج إلى مجرد واجهة فوق النموذج. أما عنصر الدفاع الحقيقي فهو ذاكرة العلامة التجارية، وبيانات الأداء، وقوالب التحرير المنضبطة التي تجعل كل مقطع لاحق أكثر فائدة.

الفرصة الثانية هي استوديو يحوّل الصور إلى فيديو لكتالوجات التجارة الإلكترونية. تسجّل DFS نحو 40,500 عملية بحث شهرية عن image to video ai، وتمتلئ عمليات البحث المرتبطة بعبارات تكشف مواطن الاحتكاك: "without login" و"free without watermark" و"free unlimited" و"with prompt online free." لا تحمل هذه العبارات كلها نية شراء مرتفعة، لكنها تثبت وجود شريحة ضخمة في أعلى مسار التحويل.

الحد الأدنى للمنتج هو سير عمل خاص بوحدات SKU: ارفع صورة المنتج، واختر نوع المشهد، ثم السوق أو تنسيق الإعلان، وأنشئ مقطعًا، وبعدها غيّر المقاسات وصدّر النتائج على دفعات. العقبة هي هامش الربح. فسوق تحويل الصور إلى فيديو بصفة عامة مزدحم، وتتصدر نتائجه Canva وAdobe وVEED وPixlr ومولدات أصغر. لذلك يحتاج المنتج القابل للبيع إلى زاوية متخصصة، مثل عروض منتجات التجميل، أو قوائم Etsy، أو المقاطع الرئيسية في Amazon.

الفرصة الثالثة هي محرر فيديو بالذكاء الاصطناعي آمن لبيئات الإنتاج والتدريب الداخلي. يتيح للمدير تحويل إجراءات التشغيل القياسية إلى مقاطع قصيرة، وتعديلها بإنجليزية بسيطة، والاحتفاظ بمكتبة مرتبة حسب الدور أو الموقع. وقد لا يظهر حجم الطلب بوضوح في بيانات الكلمات المفتاحية، لكن ألم المشتري حقيقي: تحتاج فرق التدريب إلى شرح بصري متسق، لا إلى محتوى واسع الانتشار.

الحد الأدنى للمنتج هو مولد منضبط بهوية معتمدة، مع تعطيل المشاركة العامة افتراضيًا، وقواعد للاحتفاظ بالملفات، وقائمة انتظار للمراجعة. العقبة هي الامتثال؛ ففي هذه الفئة تتقدم سلامة المحتوى وسياسات الاحتفاظ وسجلات التدقيق على جودة النموذج الخام. تحتفظ Google بتفاعلات الفئة المدفوعة لمدة 55 يومًا افتراضيًا ما لم يكن store=false، لكن store=false يلغي إمكانية التعديل اللاحق عبر previous_interaction_id. لذلك يجب أن يوازن تصميم المنتج بين حماية الخصوصية وقابلية التحرير.

خريطة فرص طينية تربط نسخ الإعلانات وفيديوهات المنتجات ومقاطع التدريب بوحدة أوامر واحدة
أفضل المنتجات ستضع النموذج داخل سير عمل وصلاحيات وقوالب قابلة للتكرار.

ما الذي لا يحله Gemini Omni Flash؟

لا يلغي Gemini Omni Flash الحاجة إلى الذائقة. فهو يتيح إنتاج محاولات فيديو أكثر، ما يعني أن الفرق تحتاج إلى معايير تصفية أقوى لا أضعف.

كما أنه لا يستبدل كل أدوات الفيديو. تقول Google إن تمديد الفيديو والاستيفاء غير مدعومين. ولا يدعم تحرير الصوت البشري، أو المراجع الصوتية المرفوعة في إصدار API الحالي، أو استخدام مقاطع YouTube كمصادر للوسائط. كذلك لا يستطيع الاستدلال عبر عدة مقاطع فيديو، وتحذّر Google من أن محاولة استخدام أوامر متعددة الفيديو قد تخفض الأداء.

توجد قيود إقليمية أيضًا. فتحرير مقاطع الفيديو المرفوعة غير متاح حاليًا للمستخدمين في EEA وسويسرا والمملكة المتحدة، مع بقاء تحرير الفيديوهات التي ينشئها النموذج مدعومًا. وفي المناطق نفسها، لا يمكن رفع أو تعديل الصور التي تحتوي على قاصرين، كما لا يمكن رفع أو تعديل الصور التي تضم بعض الأشخاص الذين يمكن التعرّف إليهم.

وهناك مفاضلات على مستوى المنتج. للحصول على أسرع توليد متزامن، توصي Google بإعداد background=false وstore=false وstream=false. لكن عند ضبط store=false، لن تتمكن من استخدام previous_interaction_id في التعديلات اللاحقة. هذا هو قرار المنتج المحوري: سرعة وتخزين أقل، أم تحرير يحتفظ بالحالة؟

رأيي: استخدم Gemini Omni Flash عندما تكون القيمة الأساسية هي التكرار المنضبط. ولا تستخدمه إذا كنت تحتاج إلى استمرارية دقيقة على مستوى الإطار، أو تحرير طويل، أو استبدال الصوت، أو استدلال عبر عدة فيديوهات، أو مادة للعلامة التجارية يمكن التنبؤ بها بالكامل. تبلغ قوة النموذج ذروتها حين يستطيع المستخدم أن يقول: «النتيجة قريبة؛ احتفظ بالمشهد وغيّر هذا العنصر وحده».

كيف يقارن بالسوق الحالي؟

يدفع السوق بالفعل مقابل أدوات الفيديو بالذكاء الاصطناعي. تبدأ خطط Runway المدفوعة من $15 وتصل إلى $95 شهريًا قبل خطط المؤسسات. وتعرض Kapwing خطة Pro بسعر $24 شهريًا أو $16 عند الدفع السنوي، وخطة Business بسعر $64 شهريًا أو $50 عند الدفع السنوي. أما خطط Adobe Firefly فتتراوح بين $9.99 و$199.99 شهريًا.

هذه الأسعار مهمة لأن Gemini Omni Flash لا ينافس نماذج أخرى فحسب، بل يتحول إلى مادة أولية لبناء منتجات أفضل لسير العمل. لن تفوز الفرق التي تعرض مربع أوامر فارغًا. الفائزون هم من يحولون هذا المربع إلى مهمة قابلة للتكرار: عدّل هذا الإعلان، وحرّك هذا المنتج، وأنشئ مقطع التدريب هذا، واترك كل شيء آخر كما هو.

للمزيد من المقارنات، أحتفظ بقائمة منفصلة تضم أفضل مولدات الفيديو بالذكاء الاصطناعي وأفضل أدوات تحويل الصور إلى فيديو بالذكاء الاصطناعي. وللتعرّف إلى النموذج المجاور من Google والمخصص للصور، فإن أقرب نموذج هو Nano Banana، لأنه درّب المستخدمين على توقع تعديلات بصرية قائمة على الأوامر بدل لوحات الأدوات التقليدية.

هل يوجد ذكاء اصطناعي يستطيع تحرير الفيديو؟

نعم. يدعم Gemini Omni Flash تحرير الفيديو مع الاحتفاظ بالحالة عبر أوامر لاحقة، مستخدمًا previous_interaction_id للبناء على الفيديو السابق الذي أنشأه. كما يدعم تحرير الفيديو المرفوع من خلال Files API حيثما تتوفر الميزة، لكن Google تفرض قيودًا إقليمية وعدة حدود على التحرير.

هل يستطيع ChatGPT تحرير الفيديو؟

يظهر هذا السؤال ضمن نتائج البحث عن ai video editor، لكن Gemini Omni Flash هو نموذج API من Google لهذا المسار المحدد. والمقارنة المفيدة ليست بين اسمَي علامتين، بل بين قدرات الأدوات: هل تحافظ على حالة الفيديو، وتقبل الوسائط المرجعية، وتطبق تعديلات محدودة من دون إعادة بناء المشهد كله؟

ما أفضل ذكاء اصطناعي لتحرير الفيديو؟

في التحرير العام عبر المتصفح، تتصدر أدوات مثل Kapwing وAdobe وCanva وInVideo نتائج هذه المهمة بالفعل. أما Gemini Omni Flash فأهميته أكبر للمطورين، لأنه يوفر لهم API للتوليد بالأوامر وإجراء تعديلات لاحقة، لا مجرد تطبيق استهلاكي مكتمل.

عمّ يبحث الناس في مجال تحويل الصور إلى فيديو بالذكاء الاصطناعي؟

تشمل عمليات البحث المرتبطة بعبارة image to video ai في بيانات DFS خيارات تعتمد على الأوامر، وأخرى مجانية أو بلا تسجيل دخول أو علامة مائية. وهذا يعني أن السوق يضم شريحة فضول ضخمة، لكن المنتج المدفوع يحتاج إلى مشترٍ أدق من شخص يريد «تحويل أي صورة إلى فيديو».

إذا أردت بناء أحد مسارات عمل الفيديو هذه بما يلائم نشاطك، فابدأ بخدمة أنظمة إنتاج الذكاء الاصطناعي.

آخر تحديث

3 سبتمبر 2026

التصنيفDesign

فضّل هذا الموقع في Google

إضافة omidsaffari.com كمصدر مفضّل في بحث Google

اجعل omidsaffari.com مصدرًا مفضّلًا، وسيرفعه Google لك في Top Stories وAI Overviews وAI Mode.

المزيد من Design

عرض كل مقالات Design
النشرة البريدية

رسالة واحدة، كل يوم أحد. أنظمة تعمل، لا آراء ساخنة.

سجلات بناء، وأنظمة قيد التشغيل، وملاحظات ميدانية من إدارة محفظة مشاريع ذكاء اصطناعي.

أسبوعية. بلا إزعاج. يمكنك إلغاء الاشتراك متى شئت.