Gemini Omni FlashでAI動画生成は「作り直す」から「編集する」へ

Gemini Omni Flashは、AI動画生成を会話型の編集ワークフローへ変えるGoogleのプレビューAPIモデルです。画像から動画を作り、前の状態を保ったまま一箇所ずつ修正できる仕組み、料金、制約、広告・EC・研修での活用法と、実際に作る価値のあるプロダクトを解説します。

Thursday, September 3, 2026Omid Saffari
Gemini Omni FlashでAI動画生成は「作り直す」から「編集する」へ

AI動画生成は、もう当たりが出るまで回すスロットマシンのような作業ではありません。編集セッションの感覚に近づきました。クリップを作り、参照画像を渡し、変更点を一つだけ指示し、うまくいった部分はそのまま残せます。

これこそ、Gemini API向けに公開されたGoogleのプレビュー動画モデル、Gemini Omni Flashの本質です。Interactions APIを通じて、テキストからの動画生成、画像からの動画生成、参照素材を使った生成、さらに会話形式の追加編集まで行えます。市場の期待もすでに大きく、DFSではai video generatorがGoogleで月間246,000回、image to video aiが40,500回、ai video editorが27,100回検索されています。

Gemini Omni Flashとは何か:AI動画生成と対話編集の仕組み

Gemini Omni Flashは、高速な動画生成と会話形式の編集に対応するGoogleのプレビューモデルです。モデルIDはgemini-omni-flash-preview。Googleは、ネイティブなマルチモーダル処理、会話による編集、世界に関する知識という三つの考え方を軸に位置づけています。

イメージしやすいのは、「記憶を持つ撮影現場」です。一般的な動画生成ツールは、スタッフに企画を渡し、最初のテイクが成功することを祈るようなものです。Gemini Omni Flashなら、スタッフをその場に残したまま、「照明をもっとドラマチックに」「スマートフォンを見えなくして」と伝え、シーン全体を説明し直さずに次のテイクを依頼できます。

この記憶を支えるのがInteractions APIです。Interactionは、一つのタスクにおける一回分のやり取りを指します。previous_interaction_idを渡すと、サーバーは生成済み動画の状態を含む過去の会話履歴を取得し、次のリクエストへ引き継げます。Omniの動画ワークフローでは、追加編集を行うたびに新しい動画が生成されます。

テキスト、画像、動画、音声の入力から編集済みの動画シーンが生まれるクレイ・ジオラマ
重要な変化は状態を保持できることです。次の動画が前の動画を記憶できます。

入力には、テキストプロンプト、参照画像、アップロード動画を使うワークフローを利用できます。Googleはテキスト、画像、音声、動画をまたぐネイティブなマルチモーダルモデルとも説明していますが、プレビュー版には明確な実用上の境界があります。現行APIではアップロードした音声を参照素材として使えず、声の編集にも対応していません。

出力形式では、aspect_ratio16:9または9:16を指定でき、デフォルトは横長です。用途はgeneration_config.video_config.taskで指定し、text_to_videoimage_to_videoreference_to_videoeditから選べます。タスクを指定しなければ、モデルがプロンプトから意図を推測します。

料金は趣味で気軽に試せる水準ではありません。Gemini APIにおけるGemini Omni Flash Previewは有料ティア限定です。Googleの料金表では、テキスト、画像、動画、音声の入力が1Mトークンあたり$1.50。出力はテキストが1Mトークンあたり$9.00、動画が1Mトークンあたり$17.50です。720p動画は毎秒5,792出力トークンとして課金され、Standard料金では約$0.10/秒になるとGoogleは説明しています。

AI動画生成から編集まで、基本の使い方

流れはシンプルです。シーンを言葉で説明し、必要に応じてビジュアル素材を添付し、動画の縦横比を決め、変更点を絞って編集を重ねます。

新しい動画を作るときは、テキストプロンプトを送ります。Googleが推奨しているのは、シーン、カメラの動き、照明、ムードを含めることです。一つの連続したシーンにしたい場合は、「single unbroken shot」「single continuous shot」「no scene cuts」のように、カットを割らないことを明示するよう勧めています。

画像から動画を作る場合は、画像を添付して動きを説明します。商品写真なら、ゆっくり回転するヒーロー動画にできます。スケッチを実写風の映像にすることも可能です。Googleは「動かして」のような曖昧なプロンプトを避け、被写体の動き、カメラワーク、環境の変化まで具体的に書くよう注意しています。

参照素材を使う場合は、複数の画像を渡せます。Googleの例では、猫と毛糸という二枚の画像を入力し、猫が毛糸で遊ぶクリップを生成しています。プロンプトガイドでは役割タグにも対応しており、<FIRST_FRAME>で開始フレーム、<IMAGE_REF_N>で参照画像を指定できます。参照画像の番号は0から始まります。

編集用のプロンプトは、短いほうがうまくいくことが多いです。「照明をもっとドラマチックにしてください。それ以外はすべて同じままにしてください」。最後の一文が重要です。そこまで伝えないと、動画モデルが編集指示をシーン全体を大きく組み替える許可だと解釈することがあります。

出力ファイルが4 MBを超える場合、Googleは生成動画にresponse_format.delivery="uri"を指定するよう推奨しています。GoogleがホストするURIが返されるので、アプリ側でファイルがACTIVEになるまでポーリングし、その後ダウンロードします。アップロード素材については、Files APIがプロジェクト単位で最大20 GB、ファイル単位で2 GBに対応し、ファイルは48時間保存されます。リクエスト全体が100 MBを超える場合も、GoogleはFiles APIの利用を案内しています。

先に恩恵を受けるのは誰か:用途別ランキング

1. 広告動画のバリエーションを量産する運用チーム

広告運用担当者は、成果が出ている商品画像、短いブリーフ、9:16のような配信先向けの形式を起点にできます。Gemini Omni Flashで音付き動画を生成した後、画角を狭める、照明を変える、セリフをなくす、冒頭の動きを速める、単語を一つずつ表示するといった小さな修正を指示できます。

価値があるのは、試行の速さです。広告運用で高くつくのは、完成度の高い一本ではありません。広告費に見合う動画を見つけるまでに生まれる、惜しい失敗作の数十本です。会話形式の編集なら、ベースのシーンを残し、変数を一つずつ変えながら検証できます。

2. 商品画像を動画に変えるECチーム

数百のSKUを抱えるShopifyストアには、静止画はあっても映像制作の体制まではないのが一般的です。このワークフローなら、商品画像をアップロードし、短いヒーローモーションを依頼し、背景、カメラの軌道、商品の動きを指定したうえで、16:9と9:16の配信先別バージョンを作れます

静止画だけでは商品の特徴が伝わりにくいほど、効果を期待できます。靴、バッグ、生活雑貨、美容ツール、デスク用品、小型家電はいずれも、サイズ感、質感、使用場面を動きで見せるメリットがあります。

一枚の商品写真から複数のモバイル動画広告を作るクレイ調のEC商品棚
最初に広がる商用用途は映画ではありません。商品に動きを与え、素早くバリエーションを作ることです。

3. 本番制作前にラフ動画を作るエージェンシー

エージェンシーは、Gemini Omni Flashをプリプロダクションの場として使えます。絵コンテを静止画で提案する代わりに、安定した商品のマクロ撮影、手持ちカメラ風のライフスタイル映像、テンポの速いソーシャル向けモンタージュという三つの方向性を動画で見せられます。撮影を手配する前に、クライアントが動き、テンポ、ムードを確認できます。

利点は、意思決定の質が上がることです。文章で企画を承認したクライアントが、映像になった途端に違和感を覚えることは珍しくありません。AIで作ったラフ動画なら、その食い違いを早い段階で可視化できます。

4. 物件紹介のティザー動画を作る不動産チーム

不動産担当者は、物件写真を参照素材にして、外観へのアプローチ、リビングのパン、キッチンのディテール、夕暮れのパティオをつないだ短い紹介動画を作れます。大切なのは節度です。物件の雰囲気を伝えるために使うべきで、偽の内見映像を作ったり、存在しない設備を加えたりしてはいけません。

得られるのは注目度です。静的な物件ページは、ソーシャルフィードでは埋もれがちです。AIを利用したことが明確な短いティザーなら、Instagram、YouTube Shorts、地域広告向けに物件を素早く見せる手段になります。

5. 単調な手順書を場面に変える研修チーム

オペレーション担当は、文章の手順を映像の流れに変えられます。倉庫の入荷作業、安全チェックリスト、顧客への引き渡し、店舗の開店準備などが対象です。Omniはイベントのタイミングも指示できるため、各ステップが決まった時点で進む三部構成を作るよう依頼できます。

利点は理解しやすさです。新入社員がPDFを読み飛ばしても、明快な動画なら、実務に入る前に「望ましいやり方」がどのようなものかを示せます。

6. 定番フォーマットを繰り返し作るクリエイター

クリエイターは、一続きのショット、セリフなし、一秒ごとに画面へ一語を表示、特定の音楽スタイル、一貫した映像のリズムといった再利用可能な型を決められます。そのうえでフォーマットの印象を保ちながら、テーマだけを差し替えられます。

価値は、制作のリズムを整えられることです。センスが不要になるわけではありませんが、アイデアを公開可能な初稿へ変えるまでの摩擦をモデルが減らしてくれます。

7. プロダクト内の動画演出を試作するチーム

プロダクトチームは、デザインやモーションの担当者が本制作へ入る前に、新機能のローンチ動画、オンボーディング用アニメーション、アプリ内で成功を伝える演出を試作できます。Gemini Omni Flashは動画内のテキストにも対応するため、シンプルなラベルや看板でメッセージが伝わりやすくなるかも検証できます。

利点は、認識をそろえられることです。プロダクト、グロース、デザインの各チームが静止画のモックアップを前に議論するのではなく、同じ動く成果物を見て判断できます。

Gemini Omni Flashで作る価値があるプロダクト

最も有望なのは、広告チーム向けのプロンプト型動画バリエーション編集ツールです。汎用動画生成ツールと本格的なクリエイティブスイートの間に位置し、素材をアップロードしてベース動画を生成した後、シーンを保ちながら管理された差分を作れます。

需要はすでに数字に表れています。DFSによると、購入行動につながる検索意図を持つai video editorの月間検索数は27,100回です。同じデータではai powered video adsが月間320回検索され、キーワード難易度は低く、CPCは非常に高い$97.83です。検索数こそ少ないものの、購入意欲の強さがうかがえます。SERP上の質問もプロダクトに直結しています。「動画を編集できるAIはありますか?」「ChatGPTで動画編集はできますか?」「動画編集に最適なAIはどれですか?」といった内容です。

MVPの範囲は絞れます。商品画像、ブランドルール、承認済みのプロンプトプリセットを連携し、最初の9:16動画を生成。続いて、照明、背景、テンポ、テキスト、音声、CTAを変える編集ボタンを用意します。課題は画一化です。すべての顧客に同じテンプレートを渡せば、単なるラッパーになります。参入障壁になるのは、ブランドに関する記憶、パフォーマンスのフィードバック、次の動画をより有用にする制御済みの編集プリセットです。

二つ目の機会は、ECカタログ向けの画像から動画を作る商品スタジオです。DFSではimage to video aiが月間40,500回検索され、関連検索には「without login」「free without watermark」「free unlimited」「with prompt online free」のような不満や要望が並びます。すべてが収益につながる強い意図ではありませんが、ファネル上部に巨大な関心層がいることは確かです。

MVPはSKU単位のワークフローです。商品画像をアップロードし、シーンの種類とマーケットプレイスまたは広告の形式を選び、動画を生成してから、複数サイズへの変換と書き出しを一括で行います。問題は利益率です。汎用的な画像から動画への変換は競争が激しく、上位の検索結果にはCanva、Adobe、VEED、Pixlr、小規模な生成ツールが並びます。販売できるプロダクトにするには、美容商品のデモ、Etsyの商品ページ、Amazonのヒーロー動画といった特定領域への切り口が必要です。

三つ目は、社内研修向けの本番運用に耐えるAI動画編集ツールです。管理者がSOPを短い動画に変え、平易な言葉で編集し、職種や拠点ごとのライブラリに保管できるようにします。キーワードの検索数からは需要を捉えにくいものの、購入側の悩みは現実にあります。研修チームが必要としているのは、拡散されるコンテンツではなく、一貫した視覚的な説明です。

MVPは、承認済みのスタイル、デフォルトで外部公開しない設定、ファイル保持ルール、レビューキューを備えた制御型の生成ツールです。課題はコンプライアンス。ここでは、モデルそのものの品質より、コンテンツの安全性、保持期間、監査証跡が重要になります。Googleは有料ティアのInteractionsを、store=falseにしない限りデフォルトで55日間保持します。一方、store=falseにするとprevious_interaction_idを使った後続編集ができなくなるため、プロダクト設計ではプライバシー方針と編集可能性のどちらを優先するか決める必要があります。

広告のバリエーション、商品動画、研修用クリップを一つのプロンプト画面につなぐクレイ調の機会マップ
優れたプロダクトは、モデルをワークフロー、権限管理、再利用できるプリセットで包みます。

Gemini Omni Flashでも解決できないこと

Gemini Omni Flashがセンスの代わりになるわけではありません。動画の試行回数を増やせるからこそ、チームには甘い選別ではなく、より厳しい判断基準が必要です。

あらゆる動画ツールを置き換えるものでもありません。Googleによると、動画の延長と補間には非対応です。声の編集もできません。現行APIではアップロードした音声を参照素材として使えず、YouTube動画をメディアソースにすることもできません。複数の動画をまたぐ推論には対応しておらず、複数動画を同時にプロンプトへ渡すと性能が低下する可能性があるとGoogleは説明しています。

地域による制約もあります。EEA、スイス、英国のユーザーは現在、アップロード動画を編集できません。ただし、モデルが生成した動画の編集には対応しています。同じ地域では、未成年者が写った画像のアップロードと編集も非対応です。また、特定の識別可能な人物が写った画像もアップロードまたは編集できません。

プロダクト上のトレードオフもあります。同期生成を最速にしたい場合、Googleはbackground=falsestore=falsestream=falseを推奨しています。しかしstore=falseを指定すると、後からprevious_interaction_idを使って編集できません。つまり中心となる判断は、速度と保存量の削減を取るか、状態を維持した編集を取るかです。

私の見方では、Gemini Omni Flashが向くのは、制御された反復そのものが価値になる場面です。フレーム単位で正確な連続性が必要な場合、長尺編集、声の差し替え、複数動画をまたぐ推論、完全に決定論的なブランド素材が必要な場合には向きません。このモデルが最も力を発揮するのは、「惜しい。シーンはそのままに、ここだけ変えて」と指示できる状況です。

現在のAI動画市場と比べるとどうか

AI動画ツールには、すでに料金を払う市場があります。Runwayの有料プランは、エンタープライズを除き月額$15から$95です。KapwingはProが月払いで月額$24、年払いで月額$16、Businessが月払いで月額$64、年払いで月額$50です。Adobe Fireflyは月額$9.99から$199.99のプランを用意しています。

この価格帯が重要なのは、Gemini Omni Flashの競合がほかのモデルだけではないからです。より優れたワークフロー型プロダクトを作るための素材にもなります。勝つのは、空のプロンプト欄を見せるだけのチームではありません。「この広告を編集する」「この商品を動かす」「この研修動画を作る」「それ以外は同じままにする」という、繰り返せる仕事にプロンプト欄を組み込んだチームです。

ツール全体を比較したい場合は、別記事のおすすめAI動画生成ツールおすすめの画像から動画を作るAIツールを参照してください。Googleの関連画像モデルも知りたいなら、最も近い存在はNano Bananaです。従来型のツールパネルではなく、プロンプトでビジュアルを編集する体験をユーザーに定着させたモデルだからです。

動画を編集できるAIはありますか?

あります。Gemini Omni Flashは、previous_interaction_idで直前に生成した動画を引き継ぎ、追加プロンプトによる状態保持型の動画編集に対応しています。利用可能な地域ではFiles API経由でアップロード動画も編集できますが、Googleは地域制限と複数の編集上の制限を明記しています。

ChatGPTで動画編集はできますか?

この質問はai video editorのSERPにも表示されますが、ここで扱うGemini Omni Flashは、このワークフローに特化したGoogleのAPIモデルです。重要なのはブランド名同士の比較ではありません。動画の状態を維持し、参照素材を受け取り、シーン全体を作り直さずに限定的な編集を加えられるかどうかです。

動画編集に最適なAIはどれですか?

ブラウザで一般的な編集をするなら、Kapwing、Adobe、Canva、InVideoなどがすでに上位に挙がるツールです。Gemini Omni Flashが開発者にとって興味深いのは、完成済みの消費者向けアプリではなく、プロンプトによる生成と追加編集のためのAPIを提供する点です。

画像から動画を作るAIについて、何が検索されていますか?

DFSによると、image to video aiの関連検索には、プロンプト対応、無料、ログイン不要、透かしなしといった条件が含まれます。市場には巨大な関心層がいる一方、有料プロダクトには「どんな画像でも動画にする」より明確な購入者像が必要です。

自社向けにこうした動画ワークフローを構築したい場合は、AIプロダクションシステムサービスからご相談ください。

最終更新

2026年9月3日

カテゴリーDesign

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。