動画解析 AI「Gemini」の新機能を解説:トークン最大88%削減の実像

Gemini APIに加わったエージェント型の動画解析 AIを実務目線で解説。長時間動画でトークンを最大88%削減できる仕組み、静的処理との違い、対応モデルと料金、Interactions APIによる実装手順、レイテンシーや精度の注意点まで、導入前に押さえたい判断材料を具体的に整理します。

Wednesday, September 2, 2026Omid Saffari
Tools
動画解析 AI「Gemini」の新機能を解説:トークン最大88%削減の実像

2026年9月1日、Googleは動画解析 AI「Gemini API」に、長時間動画を読み取る新方式を導入しました。タイムライン全体を一定のレートで読み込む代わりに、モデルが質問への回答に必要なトランスクリプト、フレーム、音声だけを確認します。Googleによると、長時間動画ではトークンを最大88%削減できます。ただし、これは上限値であり、すべての請求額が一律に安くなるわけではありません。

動画解析 AI「Gemini」のエージェント型理解とは?

従来のデフォルトは静的処理です。Geminiは毎秒1フレームを抽出し、音声とともに処理してコンテキストウィンドウへ格納したうえで、1回の処理で回答します。質問にタイムライン全体が必要かどうかにかかわらず、一定のサンプリングレートで読み取るため、挙動を予測しやすい方式です。

新たに選べるのがエージェント型処理です。モデルはまず、回答にどの証拠が必要かを判断します。関連するトランスクリプトを取り出し、該当場面のフレームや音声を確認し、必要ならそのループを繰り返してから回答を作成します。平たく言えば、Geminiは動画について答える前に、動画の中を検索できるようになりました。

動画アーカイブで調査する担当者を思い浮かべると分かりやすいでしょう。静的モードでは、すべての映像を机の前で順番に再生します。エージェント型モードでは、まず目録を読み、該当しそうな映像を取り出して目的の場面を確認し、それだけでは足りない場合に限って次の資料へ戻ります。

対応モデルはgemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-liteです。Interactions APIとGenerateContent APIのどちらからでも利用できます。推奨されているのはInteractions APIです。以下でも、モデルの処理ステップをレスポンスで確認できるこの方法を使います。

判断項目静的モードエージェント型モード
読み取り方毎秒1フレームと音声を1回で処理必要に応じてトランスクリプト、フレーム、音声を読み込む
向いている用途短いクリップ、応答開始までの遅延を抑えたい用途、タイムライン全体を精密に扱う処理長時間動画と、特定の場面を狙った質問
トークンの傾向低メディア解像度で毎秒約100トークン変動制。長時間動画では最大88%削減
追加の制御クリップ範囲とカスタムフレームレートモデルが制御する動的なナビゲーション
デフォルトはいいいえ。processing: "agentic"を指定
静的モードでは全フレームを読み込み、エージェント型モードではトランスクリプト、フレーム、音声を選んで確認する粘土細工風の動画アーカイブ
静的モードはタイムラインを読み込みます。エージェント型モードは、質問への回答に必要な証拠を探しに戻ります。

このループを支える新しいレスポンスステップは2種類あります。processing_callは、モデルが別の動画区間やトランスクリプトを要求したことを示します。対応するprocessing_resultには、取得した結果が入ります。interaction.stepsにこの2種類があれば、エージェント型ナビゲーションが実行されたと確認できます。アプリケーション側では進捗として表示できますが、カスタム関数呼び出しのように応答する必要はありません。

押さえておくべき境界があります。これは動画の理解であり、動画生成ではありません。3つのモデルはいずれも動画を入力として受け取り、テキストを返します。動画を作成・編集したい場合は、別のGemini Omni Flashワークフローを使います。

最大88%削減が意味を持つ理由

静的な動画処理では、コストが機械的に膨らみます。低メディア解像度の場合、ガイドの目安は動画1秒当たり約100トークンです。そのため、1時間の動画は回答を生成する前の段階で約360,000入力トークンになります。2026年12月31日までのGemini 3.7 Flashまたは3.6 FlashのStandard料金は、100万入力トークン当たり$0.75です。この入力コストは約$0.27になります。

入力枠に88%の削減幅をそのまま当てはめると、43,200トークン、同じ料金なら約$0.0324です。長い録画について狙いを絞った質問をするとき、サンプリングした全フレームをコンテキストへ入れずに済む。これが最も魅力的なケースです。

ただし、請求全体が同じ割合で減るわけではありません。エージェント型の探索では思考トークンが発生し、出力料金で課金されます。読み込んだトランスクリプト、音声、フレームにはツール使用トークンもかかります。質問の範囲が広い場合や、視覚情報が密な動画では、確認する素材が増えることもあります。Googleは長時間コンテンツの品質が約7%向上すると報告していますが、公開ガイドにはその根拠となるベンチマークが掲載されていません。

モデルによって単価も変わります。Gemini 3.5 Flash-LiteのStandard料金は、100万トークン当たり入力が$0.30、出力が$2.50です。Gemini 3.7 Flashと3.6 Flashは2026年末まで入力が$0.75、出力が$3.75で、2027年1月1日には両方の予定料金が2倍になります。

つまり、エージェント型動画理解には2つの利点があります。より長い素材をコンテキスト予算に収められること、そしてモデルが確認する有料の素材量を減らせることです。動画が長く、質問の範囲が狭いほど効果は大きくなります。

一方で、影響をほとんど受けないケースもあります。30秒の商品動画を処理するチームでは、同じ効果は期待しにくいでしょう。必要なのが特定の5分間だとすでに分かっているワークフローなら、その部分を切り出して静的モードで処理するほうが適している場合があります。Geminiアプリの一般ユーザーにも新しい切り替え項目は追加されません。Googleが提供したのはAPIの処理パラメータであり、一般ユーザー向けの操作機能ではないからです。

すぐに活用できるのは誰か

1時間の研修録画を扱うL&D責任者

大企業のL&D責任者なら、録画した研修をアップロードし、主要な手順、それぞれに対応する事例、確認クイズの作成を依頼できます。エージェント型モードはまずトランスクリプトを確認し、スライドや実演が重要な場面だけフレームを取り出して、無関係な区間には触れずに進められます。

効果は要約コストの削減だけではありません。同じ動画に対して「登壇者はエスカレーションについて何と説明したか」といった具体的な質問をしても、先に全フレームでコンテキストウィンドウを埋める必要がありません。

顧客インタビューを検証するSaaSリサーチ責任者

プロダクトリサーチの責任者は、1時間のインタビューから、顧客がオンボーディングのつまずき、料金への戸惑い、足りないワークフローに触れた場面をすべて探すよう依頼できます。回答にタイムスタンプを含めれば、モデルの出力を製品判断に使う前に、担当者が元の録画へ戻って確認できます。

得られるのは、検証経路を残したままレビューを速められることです。Geminiが対象映像を絞り込み、主張の根拠となるクリップは人が確認します。

アーカイブを検索するメディア運用チーム

メディアチームは、長いウェビナー、全社会議、インタビューをGeminiに渡し、指定したトピックが登場する場面を探せます。長大なタイムラインから特定の情報を取り出す仕事は、まさにエージェント型モードが想定する用途です。

引き継ぎも速くなります。編集者が受け取るのは番組全体の曖昧な要約ではなく、該当する可能性が高い場面とタイムスタンプです。

検査映像を選別する製造業のQAエンジニア

QAエンジニアは、長時間のカメラ映像から、ガードが開く、警告灯の状態が変わるといった指定イベントをエージェント型モードで探せます。Geminiが疑わしい区間を見つけたら、その短い部分を静的モードで処理できます。

この2段階目が重要です。サンプリングしたすべてのフレームが重要な場面では、静的モードが今も適しています。またGoogleは、毎秒1フレームの処理では速い動きを見落とす可能性があると注意を促しています。このワークフローでは、エージェント型モードでおおよその区間を特定し、静的モードまたは専用のビジョンシステムでイベントを検証します。

講義との対話を続けられる教育プロダクト

教育プロダクトの開発者は、講義を中心に1つのインタラクションを作成し、学生がprevious_interaction_idを使って追加質問できるようにします。サーバー側に動画のコンテキストが保持されるため、ターンごとに会話全体を作り直す必要はありません。

単発の要約ではなく、継続的な学習セッションを実現できるのが利点です。ただし、状態管理には注意が必要です。ステートレスで動かす場合は、返された処理ステップをすべて再送しなければ、次の回答で動画のコンテキストが失われます。

Interactions APIでエージェント型モードを使う方法

本番運用を意識した最短の実装では、Google Gen AIの公式Python SDKとFiles APIを使います。ある程度の長さがある動画、複数回質問する予定の動画、またはリクエスト全体が20 MBを超える場合はFiles APIを選びます。

  1. APIキーを設定してSDKをインストールする

    Google AI StudioでGemini APIキーを作成し、GEMINI_API_KEYに設定してから、現行のSDKをインストールします。

    Bash
    export GEMINI_API_KEY="YOUR_API_KEY"
    pip install -U google-genai
  2. 動画をアップロードしてエージェント型処理を指定する

    パスをローカル動画のものに置き換えてください。以下は、Googleのエージェント型動画ガイドに掲載されたPythonの処理フローです。

    Python
    import time
    from google import genai
    
    client = genai.Client()
    
    # Upload a long video
    video_file = client.files.upload(file="path/to/lecture.mp4")
    
    while video_file.state.name == "PROCESSING":
        time.sleep(2)
        video_file = client.files.get(name=video_file.name)
    
    # Use agentic processing
    interaction = client.interactions.create(
        model="gemini-3.7-flash",
        input=[
            {
                "type": "video",
                "uri": video_file.uri,
                "mime_type": video_file.mime_type,
                "processing": "agentic"
            },
            {"type": "text", "text": "What are the three main arguments presented?"}
        ]
    )
    print(interaction.output_text)
  3. テスト結果を信頼する前にモードを確認する

    interaction.stepsを調べます。最終的なmodel_outputの前に、processing_callprocessing_resultの項目があるはずです。見当たらなければ、そのリクエストが動的ナビゲーションを使ったとは証明できません。

  4. 比較すべき指標を測定する

    実際の用途を代表する同じ動画と質問を使い、静的モードとエージェント型モードを比較します。入力トークンの総数、思考トークン、ツール使用トークン、最初のトークンが届くまでの時間、回答品質、最終コストを確認してください。88%はベンダーが示した最大値です。本番でも維持できるかどうかは、実際のプロンプト構成で決まります。

よくある間違いは、processingを動画オブジェクト内ではなく、リクエスト自体に置くことです。この指定は動画入力の中に記述します。1つのリクエストに複数の動画がある場合は、動画ごとにモードを選べます。そのため、長い講義をエージェント型にし、短い実験映像は静的モードのままにできます。

プロンプトの順序も重要です。動画1本とテキストを組み合わせる場合、Googleは上の例のように動画を先、テキストプロンプトを後に置くことを推奨しています。

導入前に知っておくべき現実

エージェント型モードは、固定的なスキャンを探索ループに置き換えます。5分未満のクリップでは、モデルが推論し、必要な素材を要求し、内部ツールの結果を待ってから最終回答を始めるため、最初のトークンまでの時間がわずかに長くなる場合があります。短いクリップを扱い、アプリケーションが遅延に敏感なら、静的モードのほうが素直な選択です。

カスタムのクリップ範囲とフレームレートにも明確な制約があります。start_offsetend_offset、カスタムfpsを使えるのは静的処理だけです。必要な区間がすでに分かっているなら、モデルにもう一度探させるより、静的リクエストで切り出すほうが簡単で予測しやすい場合があります。

入力上限については、Googleの現行ガイド内に矛盾があるため注意が必要です。比較表ではインラインデータを100 MB未満としていますが、詳細なインラインの節ではリクエスト全体を20 MB未満にする必要があるとし、20 MBを超える場合はFiles APIを使うよう明記しています。ページの記述が統一されるまでは、安全側の20 MBを基準にしてください。

File APIでは、有料アカウントで最大20 GB、無料アカウントで最大2 GBのファイルを扱えます。1,048,576トークンのコンテキストウィンドウを持つモデルでは、低解像度の動画を最大3時間、高解像度なら最大1時間処理できます。公開YouTube URLは利用できますが、非公開動画と限定公開動画には対応していません。無料枠では、YouTube入力も1日8時間までに制限されます。

マルチターンの状態管理には、本番環境で見落としやすい落とし穴があります。previous_interaction_idを使うステートフルなリクエストでは、動画のコンテキストがサーバーに保持されます。ステートレスなリクエストでは、すべてのprocessing_callprocessing_resultステップを送り返さなければなりません。現時点では省略してもエラーにはなりませんが、Googleによれば動画のコンテキストが消え、追加質問への回答品質が大きく低下します。ステップの再送には入力トークンも加算されます。

そして、検索は検証ではありません。Google自身も安全性ガイドで、モデルの出力には誤りがあり得るとし、後処理と人による評価が不可欠だと説明しています。医療、法律、安全、コンプライアンス、フレーム単位の精度が必要な判断では、Geminiは証拠の場所を特定するために使い、承認プロセスには人または決定論的なシステムを残してください。

いま取るべき判断

長時間の録画をGeminiへ送り、特定の場面、トピック、主張について狭い範囲の質問をするプロダクトなら、今週からエージェント型モードを試す価値があります。回答品質を優先する場合はGemini 3.7 Flashから始め、処理量とコストを重視する場合はGemini 3.5 Flash-Liteをテストします。

クリップが短い、初動の遅延が重要、クリップ範囲やカスタムフレームレートが必要、あるいはタイムライン全体を一貫して走査する必要があるなら、静的モードを維持してください。新しい方式が従来方式を不要にするわけではありません。読み取り方の選択肢が増えたのです。

個別の使用量項目をまだ取得できない、または回答を元動画のタイムスタンプと照合できないプロダクトは、導入を待つべきです。その根拠がなければ、エージェント型ナビゲーションで費用が減ったのか、トークンが別の分類へ移っただけなのかを判断できません。

必要としているのが動画生成、一般ユーザー向けGeminiの機能、決定論的なフレーム単位の解析であれば、今回の変更による影響はありません。いずれも別の製品であり、解くべき技術課題も異なります。

次のプラットフォーム変更も実際の判断に使える形で受け取りたい方は、ニュースレターにご登録ください。

最終更新

2026年9月2日

カテゴリーExplained

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

Explainedの他の記事

Explainedの記事をすべて見る
ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。