2026年版 AIエージェント向けマルチモーダルAIモデル徹底比較

コンピュータ操作を任せるAIエージェントは、精度だけでなくコストや安全設計まで含めて選ぶ必要があります。GPT-5.6 Sol、Claude Opus 5、Gemini 3.7 Flash、DeepSeek V4-Flash-Vision-Expを料金・操作ループ・ガバナンスで比較し、用途別の最適解を整理します。

Wednesday, September 2, 2026Omid Saffari
2026年版 AIエージェント向けマルチモーダルAIモデル徹底比較

2026年にコンピュータ操作を任せるAIエージェント向けモデルとして、総合首位はGPT-5.6 Solです。ただし、入力50,000トークン、出力5,000トークンのタスクにそろえて比較したモデル単体のコストは$0.40です。同じトークン条件ならGemini 3.7 Flashは$0.05625、DeepSeek V4-Flash-Vision-Expは$0.0143〜$0.0286に収まります。選ぶべきなのはトークン単価が最安のモデルではなく、受け入れ基準を満たしたタスク1件あたりのコストを最小化できる構成です。

AIエージェント向け4モデルの早見表

以下の4つは、それぞれ異なるコンピュータ操作ニーズに応える選択肢です。GPT-5.6 Sol、Claude Opus 5、Gemini 3.7 Flash には、アクションループが定義されたコンピュータ操作ツールがあります。一方、DeepSeek V4-Flash-Vision-Exp が提供するのは視覚モデルと汎用ツール呼び出しです。コンピュータ上の操作、実行基盤、承認、復旧ロジックはアプリケーション側で定義する必要があります。

価格は2026年8月22日に確認しました。「開始価格」はAPIの定価で、100万トークンあたりの入力/出力料金です。特記がない限り、実行基盤のホスティング、ツール料金、再試行、人によるレビューは含みません。

ツール最適な用途開始価格無料トライアル
GPT-5.6 Sol公開値で最高水準のコンピュータ操作品質$5/$30/100万トークンAPI無料枠なし
Claude Opus 5統制が必要な企業のデスクトップ/ブラウザ業務$5/$25/100万トークン新規ユーザー向け少額クレジット
Gemini 3.7 Flashネイティブなコンピュータ操作を最安で導入$0.75/$3.75/100万トークン(12月31日まで)Computer Useでは利用不可
DeepSeek V4-Flash-Vision-Expコスト優先の独自エージェント基盤$0.22/$0.66/100万トークン(オフピーク時)提供の記載なし

順位は次のとおりです。

  1. GPT-5.6 Sol:操作失敗の損失が大きく、この4候補で公開されている中から最も強いコンピュータ操作結果を求める場合の総合1位です。
  2. Claude Opus 5:ベンチマーク上の首位よりも、ブラウザ構造の活用、プロンプトインジェクション検知時の自動確認、データの取り扱い、規制対象ワークロードへの適格性を重視するなら、企業向けの統制面で優れています。
  3. Gemini 3.7 Flash:元に戻せるブラウザ、モバイル、デスクトップ自動化において、費用対効果が最も高いネイティブ構成です。モデルはGAですが、Computer UseはまだPreviewです。
  4. DeepSeek V4-Flash-Vision-Exp:実行基盤と評価スタックをすでに持つ技術チームにとってのコスト下限です。実験的な視覚コアであり、完成済みのコンピュータ操作システムではありません。

スクリーンショット内のボタンを見つけられるという理由だけで、コンピュータ操作モデルを買うべきではありません。本番用エージェントには、状態の認識、許可された操作の提案、隔離環境での実行、結果の観察、エラーからの復旧、影響を伴う操作前の承認停止までが必要です。「最良のモデル」とは、このループ全体を許容できるリスクの範囲で最も安く完遂できる選択肢です。

1分で分かる結論

状態の見落とし、座標の誤り、復旧失敗のいずれかで担当者の時間を数分失いかねない高価値業務では、まず GPT-5.6 Sol を選びます。OpenAIはSolについて、OSWorld 2.0で62.6%という結果を公表しています。これはベンダー報告のベンチマークであり、自社のCRM、保険金請求ポータル、デスクトップアプリでも同様に動く保証ではありません。それでも、現在の4候補が公開しているコンピュータ操作の数値では最も高い結果です。

統制レイヤーも購入判断に含めるなら Claude Opus 5 です。Anthropicの現行ツールセットは17種類のクライアント側アクションを備え、1ターンで複数の操作をまとめられます。ページ構造を読むブラウザ専用ツールがあり、スクリーンショットにプロンプトインジェクションの疑いがある場合は自動確認も行います。Computer useはClaude APIでGAになり、調達上の大きな懸念が一つ解消されました。ただし、環境とアクション実行を担うのは引き続きアプリケーション側です。

ネイティブなアクションスキーマを使いつつ、コストを下限近くに抑えたい可逆的なワークフローには Gemini 3.7 Flash が向きます。本稿の条件で正規化したトークンコストはSolを大幅に下回ります。Googleはアクションの意図と安全性判断も返すため、承認やログに役立ちます。注意点は提供状況です。Gemini 3.7 Flash自体はGAですが、Computer Use機能はPreviewのままで、Googleは機密性の高い操作や元に戻せない操作を厳重な監督なしで行わないよう警告しています。

「足りない制御基盤を自分たちで作る」ことが利点になる場合に限り、DeepSeek V4-Flash-Vision-Exp を選びます。ピーク時のトークン料金でもGeminiの現行Standard料金を下回り、最大サイズのスクリーンショット入力100枚は、テキストと出力を除けばピーク時でも $0.016896 以下です。この安さには意味があります。同時に、ファーストパーティーのコンピュータ操作ツールがないことも重要です。既存のブラウザ/デスクトップ用ハーネスを持たないチームは、実装と安全対策そのものを「導入準備」ではなく製品開発として見積もるべきです。

コンピュータ操作ワークロードをGPT-5.6、Claude、Gemini、DeepSeekに振り分ける判断フロー
まずタスクのリスクと必要な統制レイヤーを見極め、その後でモデル構成を選びます。

「22秒テスト」で分かる、トークン単価とタスクコストの違い

スクリーンショットを使うエージェントは、1回の推論ではなくループで動きます。アプリケーションがスクリーンショットと状態を送り、モデルが1つのアクションまたは短いアクション群を返します。実行基盤がそれを実行し、アプリケーションが新しい状態を取得して再度問い合わせます。ターンを重ねるたびに、画像トークン、ツール定義、アクション結果、レイテンシ、さらに復旧が必要になる可能性が加わります。

したがって、モデルが掲示する入力料金はあくまで下限です。購入時に見るべき指標は次の式です。

受け入れ済みタスクあたりのコスト =(モデルトークン + ツール料金 + 実行基盤の稼働費 + 人によるレビュー + 再試行)÷ 受け入れ基準を満たした完了件数。

重要なのは「受け入れ済み」であることです。モデルが完了を宣言しただけではタスク完了になりません。出力は、決定論的なチェックまたは明示された人の基準を満たす必要があります。フォーム入力なら、全項目が元の記録と一致し、最終送信は承認待ちのままであることが基準になり得ます。ビジュアルQAなら、対象フローが完了し、期待した要素が表示され、証拠となるスクリーンショットが保存されたことを確認します。

API料金を比較可能にするため、計測対象の入力トークン合計50,000、出力トークン5,000という共通タスクを使います。入力枠にはスクリーンショット、ツール定義、過去の状態、結果が含まれます。あらゆるワークフローを予測する数字ではなく、同じ物差しで比べるための条件です。

  • GPT-5.6 Solのモデルトークン費は $0.40 です。
  • Claude Opus 5は $0.375 です。
  • Gemini 3.7 Flash Standard Paidは2026年12月31日まで $0.05625 です。
  • DeepSeek V4-Flash-Vision-Expは、キャッシュミス入力の場合、オフピーク時 $0.0143ピーク時 $0.0286 です。

送信タスク1,000件に換算すると、下限は Solが$400、Opus 5が$375、Geminiが$56.25、DeepSeekが$14.30〜$28.60 です。実行基盤とベンダー固有のツール料金は含みません。また、同じ成功率ではなく、同じ計測トークン構成を前提にしています。

正規化したコンピュータ操作モデルのトークンコストを比べる立体的な棒グラフ
計測入力50Kトークン、出力5Kトークンにおけるモデル単体コスト。DeepSeekはピーク料金を使用しています。

ここに人件費を加えます。担当者の総人件費が 時給$60 なら、1分は$1です。DeepSeekのピーク料金に対するSolのモデル上乗せ額$0.3714は、労働時間 22.284秒 に相当します。Claudeの上乗せ分は 20.784秒、Geminiは 1.659秒 です。

これが 22秒テスト です。送信タスク1件につき、Solがレビュー、手直し、失敗ループからの復旧を22秒減らせれば、DeepSeekのピーク料金に対するトークン上乗せ分を相殺できます。1,000件ではSolのモデルトークン費が$371.40高く、損益分岐には担当者の作業を約6.19時間減らす必要があります。担当者がログを開き、状態を把握し、修正して実行を再開するまでを考えると、1回の介入だけでもそれ以上かかることは珍しくありません。

このテストは、Solが実際にその時間を短縮できると証明するものではありません。評価で何を測るべきかを示すものです。ベンチマークスコアはパイロット導入の根拠にはなりますが、予算の根拠になるのは自社の復旧時間ログだけです。

ベンダー固有の追加費用によって、下限は次のように変わります。

  • OpenAIのタスクで課金対象のcomputerツール呼び出しが20回発生すると、現行の1,000回あたり$2.50という料金により、実行基盤のホスティング前に $0.05 が加算されます。
  • ClaudeのOpus 5向けデフォルトcomputer toolsetは、キャッシュされていないリクエストに約 4,520入力トークンを加えます。基本入力料金では $0.0226 相当です。browser toolsetの約 6,610トークン$0.03305 相当です。Prompt cachingで繰り返しのオーバーヘッドを抑えられますが、毎ターンのキャッシュヒットを前提にせず、実際の計測使用量を確認してください。
  • GeminiのComputer Useは、出力トークンと思考トークンを含め、選択したモデルの通常料金で課金されます。長い検討が生じると、単純化した5,000トークンの物差しより出力側が増える可能性があります。
  • DeepSeekは各画像を 384入力トークンに制限しますが、独自アクションスキーマ、実行基盤の応答、再試行、安全確認にも費用と開発時間がかかり、この画像料金には含まれません。

画面操作を必要としないモデルも含めた価格ルーティングは、最安AI APIの比較で確認できます。コンピュータ操作は、スクリーンショット、状態遷移、復旧がターンごとに積み上がるため、独立した予算で考える必要があります。

1. GPT-5.6 Sol:失敗コストが高い業務の総合1位

GPT-5.6 SolはOpenAIのフロンティア・マルチモーダルAIモデルであり、コンピュータ操作の失敗から大きな復旧コストが生じる場合の第一候補です。gpt-5.6エイリアスはSolにルーティングされます。画像入力に対応し、1,050,000トークンのコンテキストウィンドウを持ち、Responses APIの現行computerツールを利用できます。

GPT-5.6向けOpenAIコンピュータ操作ドキュメント
GPT-5.6 Solのコンピュータ操作

OpenAIの公表値では、Solの OSWorld 2.0スコアは62.6% で、Terraは50.2%Lunaは45.6% です。OSWorldはデスクトップソフトウェアを操作するエージェントを測るため、一般的なチャットベンチマークより今回の購入判断に近い指標です。それでもOpenAIの評価環境で得られた結果である点は変わりません。自社の合格テストを省く理由ではなく、Solをパイロット候補に入れる根拠として扱ってください。

Solの強み

OpenAIの現行統合で価値があるのは柔軟性です。モデルはスクリーンショットを確認して組み込みツール経由でコンピュータ操作を返すことも、カスタムツールとコード実行ハーネスを通じて動くこともできます。そのため、技術チームはPlaywrightブラウザから始め、ワークフローがネイティブなデスクトップアプリにまたがる段階で完全な仮想マシンへ移行できます。

現行ガイドは、安全レイヤーを適切に優先しています。隔離したブラウザまたはVM、継承情報のない空の環境、可能な限り無効化した拡張機能とローカルファイルシステムへのアクセス、影響の大きい操作に対する明示的な承認を推奨しています。画面上の内容がプロンプトインジェクションに見える場合は、エージェントを停止するよう求めています。これらは自動保護機能ではなく実装上の指針ですが、パイロットをより安全な初期設定へ導きます。

特に向くのは、画面が複雑でも元に戻せる、高価値のワークフローです。たとえば中堅企業の財務チームが3つのWebポータルからデータを集め、元の記録と照合し、承認用の入力内容を準備する業務が該当します。状態追跡と復旧の強さによって担当者の後処理を少しでも減らせるなら、Solの上乗せ料金には合理性があります。一方、操作部品が変化せず、APIでデータを送れる整然としたフォームには適しません。

OpenAIの料金体系

現在、OpenAIにはコンピュータ操作に対応するGPT-5.6が3階層あります。

  • GPT-5.6 Sol: 入力100万トークンあたり$5.00、キャッシュ済み入力は$0.50、出力は$30.00です。
  • GPT-5.6 Terra: 入力100万トークンあたり$2.00、キャッシュ済み入力は$0.20、出力は$12.00です。
  • GPT-5.6 Luna: 入力100万トークンあたり$0.20、キャッシュ済み入力は$0.02、出力は$1.20です。

computer toolでは、課金対象のツール呼び出し1,000回あたり$2.50 が加わる場合があります。組み込みツールが消費したトークンは、選択モデルの料金で課金されます。Solに対応するAPI無料枠はありません。

このファミリーなら、実用的な段階別ルーティングを組めます。まずSolで品質上限を確立し、同じ合格タスクセットをTerraでも実行します。完了率とレビューの傾向が基準内に収まるタスク群だけをTerraへ移します。Lunaはさらに安価ですが、ベンダー公表のOSWorld結果は低くなります。入力料金がSolより大幅に安いという理由だけで既定にせず、合格基準を確認した後に、範囲が限定され元に戻せる業務へ割り当てるべきです。

安全なSolパイロットの進め方

  1. 範囲を絞ったワークフローを1つ選ぶ

    開始状態が明確で、完了を決定論的に確認でき、承認前には元に戻せない操作が発生しないタスクを選びます。ブラウザQA、証拠収集、レビュー用レコードの準備が好例です。最初の評価では購入、削除、公開、送信を避けてください。

  2. 実行環境を固定する

    隔離したブラウザプロファイル、コンテナ、VMのいずれかを使います。継承された環境変数を除去し、可能なら拡張機能とローカルファイルシステムへのアクセスを無効にします。必要なドメインだけを許可し、タスクに必要な認証情報だけを公開してください。

  3. 実行前の承認条件を定義する

    メッセージ送信、規約への同意、アカウント情報の変更、金銭的な確約など、常に人の承認を必要とする操作を書き出します。停止を強制するのはモデルの文章ではなく、実行基盤です。

  4. 状態と合格結果を記録する

    初期状態、各スクリーンショット、提案されたアクション、実行したアクション、ツール結果、安全停止、最終状態、合否結果を保存します。モデルの最終メッセージは合格判定ではありません。

  5. Solの合格後にだけ下位モデルへ振り分ける

    Solで達成可能な完了率とレビュー量の基準を作ります。その後、同じタスク、環境、承認ルールでTerraとLunaを比較します。下位モデルで失敗するタスク形状には、Solをエスカレーション先として残してください。

最適な用途: 復旧失敗のコストが高い、価値ある複数ステップのブラウザ/デスクトップ業務。
注目点: OpenAI公表のOSWorld 2.0スコアは62.6%で、現在の4候補が公開するコンピュータ操作結果では最高です。
料金: 入力/出力100万トークンあたり、Solは$5/$30、Terraは$2/$12、Lunaは$0.20/$1.20。該当するツール呼び出し料金が別途かかります。
無料トライアル: Solに対応するAPI無料枠はありません。

強み
得意なこと
8 points

  • この4候補で公開されている中では、コンピュータ操作ベンチマークの結果が最も高い。
  • GPT-5.6ファミリーでResponses APIのツール形式が共通しており、品質とコストのルーティングを実装しやすい。
  • 現行ガイドは隔離実行、プロンプトインジェクション、許可リスト、影響の大きい操作の承認を扱っている。
  • 周辺ハーネスを交換せず、Sol、Terra、Lunaによる幅広い価格階層を利用できる。
  • この比較では、Solの正規化したモデル単体タスクコストが最も高い。
  • computerツール呼び出しに別料金が加わる場合がある。
  • ブラウザ、VM、アクション実行基盤、合格チェック、ログは顧客側で構築または接続する必要がある。
  • ベンダーのベンチマーク首位は、非公開アプリケーションでの信頼性を保証しない。

見送るべきケース: 決定論的なAPIがある場合、タスクの価値が低く極めて反復的な場合、Terra、Luna、Geminiでも同じ合格基準を満たす場合は、Solを既定モデルにしないでください。通常の自動化でより安全に扱える安定した操作部品をクリックするために、フロンティアモデルの料金を払う必要はありません。

2. Claude Opus 5:企業の統制されたデスクトップ業務に最適

Claude Opus 5は、モデルの純粋な能力と同じくらいコンピュータ操作の統制レイヤーを重視する場合に最適です。Anthropicは2026年8月20日、新しいbrowser use toolと同時に、Claude APIのcomputer useを一般提供に移行しました。現行のcomputer_toolset_20260801では、1つの宣言から17種類のクライアント側ツールを利用でき、ベータヘッダーは不要です。

現行computer use toolsetを説明するClaude Platformドキュメント
Claude Opus 5のコンピュータ操作

computer useとbrowser useの違いは実務に直結します。computer useはスクリーンショットを基に、マウスとキーボードでデスクトップ全体を操作します。browser useはページ構造も読み取り、特定のページ要素を操作するため、Webアプリケーション内で完結するワークフローに適しています。画面座標だけに頼るより、構造を使う方が入力欄やボタンを狙いやすくなります。

どちらもクライアント側で実行するツールです。Claude自身がデスクトップへ接続するわけではありません。アプリケーションがコンテナ、VM、制御されたブラウザ内で各アクションを実行し、結果を返してモデルを再度呼び出します。computer useは現在Claude Managed Agents内では利用できません。Anthropicがデスクトップセッション全体をホストすると期待しているなら、製品の責任範囲を取り違えています。

Claudeがガバナンス面で選ばれる理由

Claudeは1回のモデルターンで複数のcomputer actionを返せます。実行基盤はそれらを順に実行し、最初の失敗で停止します。クリック、入力、観察のように安全な一連の操作では、モデルとの往復を減らせます。ただし、状態確認が必要な箇所をまたいでまとめてよいわけではありません。クリックによって別のアカウントを開く可能性があるなら、入力する前に結果を確認すべきです。

Anthropicは、プロンプトインジェクションの疑いがあるスクリーンショットを識別し、次のアクション前に確認を求めるようモデルを誘導する分類器も実行します。顧客はサポートに連絡すればオプトアウトできますが、信頼できないページを閲覧するワークフローでは、この初期設定が役立ちます。分類器は追加の防御層であり、ドメイン許可リスト、認証情報の境界、実行基盤での承認に代わるものではありません。

データの扱いもベータ時代より明確です。スクリーンショット、アクション、ファイルの保存はクライアントが管理し、Anthropicによればcomputer useはゼロデータ保持(ZDR)の対象になり得ます。AnthropicのBAAの下で、HIPAA規制対象ワークロードにも利用可能です。この適格性だけでアプリケーション全体が準拠するわけではありませんが、医療分野の調達審査におけるモデル側の障害を取り除ける場合があります。

この組み合わせは、有用なAPIがないソフトウェアを操作し、全アクションの証拠を残す必要がある保険金請求、保険、金融、業務運用のワークフローに合います。Anthropicは顧客事例として、Asteroidの最長の保険金請求ワークフローが 32分から13分に短縮され、タスクコストが約 30% 下がり、プロンプトを変更せず完了率が 100% に達したと紹介しています。これは特定顧客に帰属する結果であり、新規導入時に期待できる標準値ではありません。ただし、測るべき効果をよく示しています。ループのターン数減少と対象指定の改善は、単なるモデルスコアだけでなく運用コストを変えます。

Claudeの複数アクションに関する詳細なコスト分析では、アクションをまとめると費用を抑えられる場面と、操作間の観察が必須の場面を解説しています。

Claudeの料金体系

現行ツールセットはSonnet 5、Opus 5、Fable 5、提供範囲が限定されたMythos 5、Opus 4.8に対応しています。現在の主なモデル階層は次のとおりです。

  • Claude Sonnet 5: 基本入力100万トークンあたり$2、出力は$10です。5分キャッシュへの書き込みは$2.50、1時間キャッシュへの書き込みは$4、キャッシュヒットは100万トークンあたり$0.20です。
  • Claude Opus 5: 基本入力100万トークンあたり$5、出力は$25です。5分キャッシュへの書き込みは$6.25、1時間キャッシュへの書き込みは$10、キャッシュヒットは100万トークンあたり$0.50です。
  • Claude Fable 5とClaude Mythos 5: 基本入力100万トークンあたり$10、出力は$50です。Mythos 5は提供範囲が限定されています。
  • Opus 5 Fast mode: 入力100万トークンあたり$10、出力は$50です。
  • Opus 5 Batch: 入力100万トークンあたり$2.50、出力は$12.50です。Batchは非同期のモデル処理に役立ちますが、対話型のコンピュータ操作ループでは、依然として順番に観察して操作する必要があります。

新規APIユーザーには、金額が明示されていない少額の無料クレジットが付与されます。Anthropicは、期間を延長したトライアルを希望する企業に営業への問い合わせを案内しています。

見落としやすい費用はツール定義のオーバーヘッドです。デフォルトのcomputer toolsetは、1リクエストにつき Opus 5では約4,520入力トークンSonnet 5では約4,590入力トークンを加えます。zoomを無効にすると約 410トークン減ります。browser toolsetはさらに大きく、Opus 5では約 6,610トークン、Sonnet 5では約 6,670トークンを加え、任意のbrowser機能を4つすべて有効にすると約 880トークンが上乗せされます。

Opus 5の基本入力料金では、キャッシュされていないデフォルトcomputer toolset 1回分が、スクリーンショット、タスクコンテキスト、アクション結果、出力を含める前に約 $0.0226 かかります。同じ条件でbrowser toolsetは約 $0.03305 です。短いタスクでは、業務データよりも利用可能な操作面の宣言に多くの費用を使う場合があります。ワークフロー上可能なら固定の指示とツール定義をキャッシュし、使わない機能は無効にします。見積もりではなく、レスポンスに記録された使用量を信頼してください。

最適な用途: 明示的な統制、監査証跡、サポートされた移行経路を必要とする企業のブラウザ/デスクトップ業務。
注目点: GAのcomputer use、17種類のクライアント側アクション、連続アクションのまとめ実行、ページ構造を認識する独立したbrowser tool。
料金: 基本入力/出力100万トークンあたり、Sonnet 5は$2/$10、Opus 5は$5/$25、Fable 5または提供限定のMythos 5は$10/$50です。
無料トライアル: 新規APIユーザー向けの少額クレジットがありますが、金額は未公表です。企業向け評価は営業への問い合わせが必要です。

強み
得意なこと
9 points

  • computer useはClaude APIでGAとなり、現行ツールセットにベータヘッダーは不要。
  • browser useはWeb専用ワークフローでページ構造を利用でき、ピクセル座標だけに依存しない。
  • プロンプトインジェクション検知時の自動確認、顧客管理の実行環境、ZDR適格性により、本格的な統制設計を支えられる。
  • 安全なアクション群をまとめれば、モデルとの往復と経過時間を減らせる。
  • Sonnet 5では、同じ現行ツールセットをより低価格なモデルで使える。
  • computerとbrowserのツール定義により、1リクエストへ数千の入力トークンが追加される。
  • computer useはClaude Managed Agentsでは利用できない。
  • サンドボックス、実行基盤、認証情報、承認、ログ、失敗からの復旧は引き続きアプリケーション側の責任。
  • Claudeのドキュメントは、レイテンシ、座標ミス、スクロール失敗、ニッチなアプリや複数アプリにまたがる場合の信頼性低下を警告している。

見送るべきケース: タスクがWebページ内で完結し、browser useで対応できるなら、デスクトップ全体を扱うcomputer useは不要です。安定したAPIがあるなら両方とも使わないでください。可逆的なUIループを最安で動かすことだけが目的ならGeminiから始め、アクションハーネス全体をすでに持つならモデルコアとしてDeepSeekを見積もります。

3. Gemini 3.7 Flash:ネイティブなコンピュータ操作で費用対効果が最高

Gemini 3.7 Flashは、GoogleがComputer Useに推奨するモデルであり、ベンダー定義のアクションループを持つ候補の中で最も費用対効果に優れています。モデル自体はGAで、100万トークンのコンテキストウィンドウと64,000トークンの最大出力を備えます。Computer Useは引き続きPreviewです。

ブラウザ、モバイル、デスクトップのコンピュータ操作を説明するGoogle Gemini APIドキュメント
Gemini 3.7 Flash Computer Use

Googleはブラウザ、モバイル、デスクトップという3つの対象環境をサポートしています。アプリケーションがプロンプト、環境、スクリーンショットを送ると、Geminiはインターフェース操作の関数呼び出しを返します。クライアントは座標をスケーリングし、アクションを実行して、新しい画面を取得して返します。安全なVMまたはコンテナとクライアント側のアクションハンドラーは引き続き必要で、Googleの例ではPlaywrightが使われています。

Gemini 3.xには、承認レイヤーに特に役立つ2つのシグナルがあります。各アクションには、モデルがそれを選んだ理由を短く説明する intent を付けられます。独立した safety decision は、アクションを許可する、確認を求める、ブロックする、のいずれかに分類できます。intentはアクションが正しいことの証明ではありませんが、クリック座標だけの場合よりも、ポリシーエンジンとレビュー担当者へ多くの判断材料を渡せます。

安全システムはポリシーカテゴリーごとに設定でき、スクリーンショットに対するプロンプトインジェクション検知はオプトインです。この仕組みにより、独自の承認体験を作る製品チームにGeminiが適しています。アプリケーションは、提案されたアクション、モデルのintent、ポリシー判断、現在のスクリーンショットをまとめて表示し、ワークフロー上のリスクに応じて必要な箇所だけ人の承認を要求できます。

Geminiが適する場面

Geminiは、元に戻せる複数環境の業務で最初に試す合理的な選択肢です。モバイル製品チームなら、同じモデル構成でWebブラウザとモバイルビルドの登録フローを動かし、スクリーンショットを収集して、導線が分岐する箇所を特定できます。サポート業務チームなら、承認済みサイトから公開情報を集め、最終送信ボタンを押さずにレコードを準備できます。

正規化したトークン条件では、Geminiの現行Standard Paid下限は タスクあたり$0.05625、または 1,000タスクあたり$56.25 です。DeepSeekのピーク料金より1タスクあたり$0.02765高くなります。時給$60なら、このモデル上乗せ分を回収するのに必要な開発・レビュー時間の短縮はわずか 1.659秒 です。定義済みのアクションスキーマ、安全性判断、独自アダプターを作らずに済むことのいずれかで、この水準はすぐ超えられます。

警告すべきなのは細則ではなく提供状況です。Googleは、Computer Useにエラーやセキュリティ脆弱性が含まれる可能性があるとし、重要な判断、機密データ、重大で元に戻せない操作には厳重な監督なしで使わないよう助言しています。GAのモデルを使っても、PreviewのツールがGAになるわけではありません。調達、リスク審査、展開範囲はツール側の提供状況を基準に判断してください。

Geminiの料金体系

GoogleはGemini 3.7 Flashに4つの処理モードを用意しています。2026年12月31日までは次の料金です。

  • Standard: 入力100万トークンあたり$0.75、出力は$3.75、キャッシュ済みトークンは$0.075です。
  • Batch: 入力100万トークンあたり$0.375、出力は$1.875、キャッシュ済みトークンは$0.0375です。
  • Flex: 入力100万トークンあたり$0.375、出力は$1.875、キャッシュ済みトークンは$0.0375です。
  • Priority: 入力100万トークンあたり$1.35、出力は$6.75、キャッシュ済みトークンは$0.135です。

2027年1月1日以降、Standardは$1.50/$7.50、キャッシュ済み入力は$0.15になります。BatchとFlexは$0.75/$3.75、キャッシュ済み入力は$0.075になります。Priorityは$2.70/$13.50、キャッシュ済み入力は$0.27になります。

Standard Free tierではモデルの入力・出力トークンを無料で使えますが、Computer UseはFree tierでは利用できません。GoogleはPaidのComputer Useを通常のモデルトークンとして課金します。この違いはトライアル計画に明記すべきです。AI Studioで基本モデルを試せても、コンピュータ操作ループの本番テストが無料になるわけではありません。

対話型エージェントでは、Batchが示す非同期処理の経済性よりも、通常はStandardまたはPriorityが重要になります。Flexは、サービスの挙動がループに合うなら、実行時刻を調整できる処理に有力です。エンドツーエンドの対話パターンとレイテンシが業務に合うことを確かめず、最安モードを事業計画へ転記しないでください。

最適な用途: 低いトークン料金でネイティブなアクションスキーマを必要とする、元に戻せるブラウザ、モバイル、デスクトップ自動化。
注目点: 3つの環境にまたがって使える単一の推奨モデルで、action intent、設定可能な安全ポリシー、確認判断、任意のプロンプトインジェクション検知を備えます。
料金: 2026年12月31日まで、100万入力/出力トークンあたりStandardは$0.75/$3.75、BatchとFlexは$0.375/$1.875、Priorityは$1.35/$6.75です。
無料トライアル: モデルにはFree tierがありますが、Computer UseはPaid限定です。

強み
得意なこと
8 points

  • ベンダー定義のコンピュータ操作ツールを持つ3候補の中で、現在のトークン料金が最安。
  • ブラウザ、モバイル、デスクトップに対応し、製品QAや複数画面にまたがるワークフローに合う。
  • action intentとsafety decisionにより、承認・監査インターフェースを設計しやすい。
  • 料金ページ上、PaidのComputer Useには呼び出しごとの別料金がなく、通常のモデルトークンだけが課金される。
  • Gemini 3.7 Flash自体はGAでも、Computer Useは引き続きPreview。
  • Googleは、厳重な監督なしに機密性の高い操作、重要な操作、元に戻せない操作へ使わないよう明確に警告している。
  • 割安な現行料金は2026年末で終了する。
  • スクリーンショットのプロンプトインジェクション検知は有効化が必要で、実行基盤とサンドボックスも顧客側で用意する。

見送るべきケース: Previewのリスクを許容できない、規制対象または元に戻せない本番ワークフローにはGemini Computer Useを使わないでください。ブラウザだけでは足りず、対象デスクトップ環境を隔離できない場合も不適切です。品質上の失敗によって担当者の時間が少しでも多く失われるなら、トークン料金を最適化する前にSolとClaudeを比較してください。

4. DeepSeek V4-Flash-Vision-Exp:低予算の独自ハーネスに最適

DeepSeek V4-Flash-Vision-Expはこのランキングで最安のモデルコアであり、コンピュータ操作製品としての完成度は最も低い選択肢です。DeepSeekは2026年8月21日、実験的なマルチモーダルモデルを正確なAPI識別子deepseek-v4-flash-vision-expで公開しました。

画像入力と制限を示すDeepSeek V4 Flash Vision ExpのAPIドキュメント
DeepSeek V4-Flash-Vision-Expの視覚API

このモデルはテキストと画像を受け取り、汎用ツール呼び出しに対応します。OpenAI互換のChat Completions APIとResponses API、Anthropic互換インターフェースから利用できます。100万トークンのコンテキストウィンドウ、最大384,000トークンの出力、思考/非思考モード、2,500の同時実行上限を備えます。

いずれもコンピュータ操作AIエージェントに有用な要素ですが、ファーストパーティーのコンピュータ操作向けアクションツールではありません。DeepSeekにはスクリーンショットの送信方法と汎用ツールの呼び出し方法が記載されていますが、組み込みのブラウザ/デスクトップ用アクションスキーマ、実行基盤、承認判断、動作環境は説明されていません。この製品境界を踏まえ、本稿では編集上の推論として モデルコア と呼んでいます。

実際には、click、type、scroll、screenshot、wait、ask for approvalなどのツールをチーム側で定義します。引数を検証し、座標をマッピングし、隔離したブラウザまたはVMでアクションを実行し、新しい状態を返し、ループを検知し、エラー時に停止して、すべてを記録しなければなりません。成熟した自動化チームなら、その自由を好む場合があります。初めてコンピュータ操作エージェントを導入するチームは、これをアプリケーション開発として計上すべきです。

注目に値する価格

DeepSeekは、V4-Flash-Vision-ExpにFlash構成と同じピーク/オフピーク料金を設定しています。

  • オフピーク: キャッシュヒット入力100万トークンあたり$0.007、キャッシュミス入力は$0.22、出力は$0.66です。
  • ピーク: キャッシュヒット入力100万トークンあたり$0.014、キャッシュミス入力は$0.44、出力は$1.32です。

ピーク時間は 01:00〜04:00 UTC06:00〜10:00 UTC です。それ以外はすべてオフピークです。2026年8月23日から、北京時間の土曜・日曜は終日オフピーク料金になります。

料金ページに無料枠やトライアルの記載はありません。それでも実用的な評価費用はごく小さいものです。正規化した入力50,000/出力5,000トークンの条件では、モデル料金は オフピーク時$0.0143ピーク時$0.0286 です。トークンが主要費目になるまでに、かなりの実験量を確保できます。ただし、開発、レビュー、誤操作まで安くなるわけではありません。

視覚トークンのルールは非常に明確です。大きな画像はおよそ 800×800ピクセルの上限に合わせて縮小され、各画像は 最大384入力トークンです。ピーク時のキャッシュミス料金では、最大トークンのスクリーンショット100枚にかかる画像入力費は $0.016896以下です。オフピークなら $0.008448 です。この計算にテキスト、出力、繰り返し送る履歴、汎用ツール呼び出し、再試行は含まれません。

この上限はコスト面の利点であると同時に、知覚上の制約でもあります。情報量の多いスプレッドシート、小さなダイアログ、複数列のダッシュボードでは、画像の圧縮時に重要な細部が失われる可能性があります。必要に応じて対象を絞った切り抜きを送るか、文書化されているoriginal指定を使い、サービスがどう縮小するかを確認してください。画像トークンが安くても、小さな文字を正確に認識できるとは限りません。

DeepSeekはJPEG、PNG、GIF、WebPに対応しています。base64データ、公開URL、Files APIの参照を利用できます。1リクエストあたり 最大600画像、1辺 最大8,192ピクセル、画像が15枚以上の場合は1辺 最大4,096ピクセルです。base64とURL画像は最大 32 MiB、Files API画像は最大 64 MiB、インラインのリクエスト本文は最大 48 MiB です。

これらの上限は通常のスクリーンショットループを大きく上回るため、制約になるのはアップロード数ではなく独自の制御基盤です。チームは、アクションスキーマ、座標マッピング、承認、復旧ロジックによって合格結果を出せると証明しなければなりません。ボタンを認識できるモデルだからといって、そのボタンを押す許可を得たことにはなりません。

より広いモデル比較については、DeepSeekとChatGPTの比較で画面操作以外も含めて解説しています。

最適な用途: 独自のブラウザ/デスクトップ用ハーネス内で低価格な視覚コアを使いたい、経験豊富なエージェント開発チーム。
注目点: 画像1枚あたり最大384入力トークン、キャッシュミス入力/出力100万トークンあたりオフピーク料金$0.22/$0.66。
料金: キャッシュミス入力/出力100万トークンあたり、オフピーク時$0.22/$0.66、ピーク時$0.44/$1.32。キャッシュヒットはオフピーク時$0.007、ピーク時$0.014です。
無料トライアル: 現行料金ページに無料枠やトライアルの記載はありません。

強み
得意なこと
10 points

  • この4候補で、正規化したモデルトークン費が最も安い。
  • OpenAI互換、Responses API、Anthropic互換のリクエスト形式により、モデルアダプターの実装量を減らせる。
  • 汎用ツール呼び出しを使い、経験豊富なチームが独自のアクション語彙とポリシー境界を定義できる。
  • 画像あたり384トークンという予測可能な上限により、スクリーンショット入力費を見積もりやすい。
  • 大きなコンテキスト、出力、同時実行数、画像数の上限があり、複雑な独自ワークフローにも余裕がある。
  • 実験的モデルであるため、変更や本番リスクへの懸念がある。
  • ファーストパーティーとして文書化されたコンピュータ操作アクションツール、実行基盤、安全性判断、承認レイヤーがない。
  • 画像の自動縮小によって、インターフェースの細部が失われる場合がある。
  • ピーク/オフピークの時間帯があり、待機させられないトラフィックの予測が複雑になる。
  • 安いトークン料金の裏で、開発、評価、レビュー費が大きく膨らむ可能性がある。

見送るべきケース: 完成したアクションループやベンダー定義の安全性判断を求める場合、隔離した実行基盤と評価システムを持たない場合はDeepSeekを選ばないでください。小さな文字や情報密度の高い画面も、対象を絞ったスクリーンショットで代表的な視覚テストに合格するまでは避けるべきです。

どのモデルを選ぶべきか

資金調達済みの創業者が、元に戻せる競合調査を自動化するなら、まず Gemini 3.7 Flash を試すべきです。アクションループが用意され、ブラウザとデスクトップ環境に対応し、幅広い評価を実行できるほどモデル料金の下限が低く抑えられています。レビューや失敗ループからの復旧時間が、約22秒という上乗せ判断の目安を超えるならSolへ切り替えます。信頼できないWebコンテンツと承認設計の方が難題になればClaudeへ切り替えます。

中堅企業のCTOが、規制対象またはレガシーなアプリケーションでデータを移すなら、Claude Opus 5 または Sonnet 5 から始めます。computer useはClaude APIでGAとなり、スクリーンショット分類器は確認を要求でき、クライアントが環境を管理し、この機能はZDRの対象になり得ます。BAA下のHIPAA適格性はモデル審査で重要ですが、ワークフローには依然として最小権限の認証情報、保護されたログ、送信前の人による確認が必要です。全工程がWebページ内に収まるなら、デスクトップ全体を操作するcomputer useではなくbrowser useを選びます。

高価値で複雑なデスクトップ業務を自動化するシニアオペレーターなら、GPT-5.6 Sol から始めるべきです。ベンダー報告のOSWorld首位と短い人件費の損益分岐を考えれば、まず品質上限に料金を払う合理性があります。合格基準を把握できたら、安定したタスク形状をTerra、Luna、Geminiへ振り分けます。最安階層から始めて、強いモデルが復旧作業をどれほど減らせるかを一度も確認しないのは誤りです。

アクション実行基盤、ポリシーサービス、評価スイートをすでに持つ技術者は、候補に DeepSeek V4-Flash-Vision-Exp を加えるべきです。その成熟度なら、独自アクションスキーマの構築は新規プロジェクトにならず、オフピーク料金が大規模な評価やバッチ処理のコストを変え得ます。小さな文字の画面、曖昧な状態、繰り返す失敗には、より強い構成を残してください。

選択が変わるのは、次の4つの問いです。

  1. 安定したAPIがあるか? あるならAPIを使います。画面操作は、信頼できるプログラム経路がないインターフェースの代替手段です。
  2. 誤操作を元に戻せるか? 戻せないなら承認を必須にし、操作の重大性に提供状況、統制、調達条件が見合う構成を選びます。
  3. 実行基盤をすでに持っているか? 持っていなければ、DeepSeekのトークン節約では完成したソリューションを買えません。
  4. 上位モデルでレビュー時間を何秒減らせるか? 受け入れ済みタスクのログを使ってSol、Claude、Gemini、DeepSeekを選びます。料金表だけで決めてはいけません。

AIモデル比較の選定基準

このランキングでは、購入判断に直結する5つの基準を使いました。

  • コンピュータ操作としての完成度: ベンダーはアクションループを定義しているか、それとも視覚と汎用ツール呼び出しだけを提供しているか。
  • 現在の根拠: 現時点で確認できる、関連性の高いコンピュータ操作結果、提供状況、実装詳細が公開されているか。
  • 受け入れ済みタスクの経済性: 共通のトークン条件でいくらかかり、上位構成は何秒の人手を減らせばよいか。
  • 本番化の壁: サンドボックス、実行基盤、承認、プロンプトインジェクション対策、ログのうち、購入者側に残るものは何か。
  • 価格の持続性: 標準料金か、期間限定か、ピーク制か、Preview機能に付随する料金か。

各製品は、2026年8月22日時点の公開ドキュメント、料金ページ、モデルページ、出典が明記されたベンダー事例を基に比較しました。この調査では共通のブラウザ用ハーネスで実機検証していないため、本稿はテスト結果を主張しません。コストモデルは、確定した料金表から行った独自分析です。以下の240回プロトコルを使えば、購入者自身がワークフロー固有の証拠を作れます。

4つに絞ったのは、それぞれが最大の信頼性、企業向けの統制、低価格での柔軟な運用、独自スタックの経済性という異なる購入判断を代表するためです。どの候補にも、現在の差別化要因、料金体系、実装経路、率直に示せる限界があります。旧モデルは、移行中に購入者が遭遇し得る場合に限って以下で触れます。

アフィリエイト関係はランキングに影響しておらず、無関係な商用パートナーも加えていません。商用提供の有無によって順位を上下させることもありませんでした。

避けるべき選択肢

新規統合でOpenAI computer-use-previewを選ばない

OpenAIの現行GAリクエストでは、GPT-5.5以降のモデルをtools: [{ type: "computer" }]とともに使います。旧computer-use-previewモデルとcomputer_use_previewツールはアクション形式が異なり、従来のリクエスト設定が必要です。既存アプリケーションを移行する間だけ維持してください。新規開発を旧方式で始めると、将来置き換えると分かっている作業を増やすことになります。

3.7を使えるならGemini 2.5 Computer Use Previewを避ける

GoogleはGemini 2.5 Computer Use Previewを旧モデルと位置付けています。プロンプトが200,000トークン以下なら、入力100万トークンあたり $1.25、出力は $10、200,000トークンを超えると $2.50/$15 です。Gemini 3.7 FlashはGoogleがComputer Useに推奨するモデルで、2026年12月31日までは$0.75/$3.75です。計測済みでまだ解消できない互換性上の依存がある場合にだけ2.5を維持してください。

視覚プロキシで装ったテキスト専用DeepSeekを避ける

DeepSeek公式APIで画像を受け取れるのはdeepseek-v4-flash-vision-expだけです。他のDeepSeekモデルへ画像を入力すると400エラーになります。サードパーティー製アダプターを使えば、別モデルにスクリーンショットを説明させ、そのテキストをDeepSeekへ渡せます。しかし、それはDeepSeekの視覚的なコンピュータ操作ではなく、2モデル構成の評価です。価格、レイテンシ、情報損失、データの扱いがすべて変わります。プロキシを独立した構成要素として明記するか、正確な視覚モデルを使ってください。

合格テストのない画面操作エージェントはすべて避ける

「モデルが最後まで到達した」ことは業務成果ではありません。ブラウザエージェントは別のアカウントを開き、誤った入力欄へ文字を入れ、ページの変化を失敗と認識せず停止する可能性があります。決定論的なチェックまたは明示されたレビュー基準がないタスクは、どのモデルでも自律実行の準備ができていません。

モデル名より重要な本番運用チェックリスト

モデルは、制御されたシステムを構成する一要素です。処理量を増やす前に、本番レビューで次の問いに答える必要があります。

  • 環境: ブラウザまたはデスクトップは、ホスト、個人アカウント、ローカルファイル、無関係な認証情報から隔離されているか。
  • 到達範囲: ドメイン、アプリケーション、許可されたアクションがワークフロー内に制限されているか。
  • 秘密情報: 各タスクに必要な権限範囲の認証情報だけを渡し、スクリーンショットやログへ秘密が露出しないか。
  • 影響: どのアクションに常に人の確認が必要で、その停止を実行基盤が強制しているか。
  • インジェクション: ページ、画像、文書、ダイアログからタスクを無視するよう指示されたとき、何が起きるか。
  • 状態: 操作前に、どのアカウント、レコード、ウィンドウ、ステップを扱っているかを証明できるか。
  • 復旧: アクション失敗時にバッチを止め、証拠を残し、安全な再試行またはエスカレーションに十分な状態を返せるか。
  • 合格判定: どの機械チェックまたはレビュー担当者の判断でタスク完了とするか。
  • 経済性: モデルトークン、ツール呼び出し、実行時間、再試行、レビュー秒数を受け入れ済みタスクごとに記録しているか。
  • 変更: モデルのスナップショット、価格、ブラウザ、対象UIが変わった後も、同じタスクセットを再実行できるか。

モデルの切り替えは退屈なほど簡単であるべきです。アクションインターフェース、安全ポリシー、ログ、合格テストは維持したまま、背後のモデルだけを替えます。プロバイダーを変えるたびに制御基盤全体の書き直しが必要なら、そのシステムは1社のツール形式を製品アーキテクチャと取り違えています。

次の月曜日に始める240回の比較テスト

漠然とした「AIエージェントのパイロット」を計画してはいけません。来週は1つのタスク群を選び、1つのルーティング方針を決めます。代表的な20タスクを、このランキングの4構成で、それぞれ3回ずつ実行します。合計 240回です。3回繰り返せば、一度きりの偶然をある程度見抜けます。だからといって、普遍的なベンチマークだと装うことはできません。

  1. 月曜日:タスクと合格基準を固定する

    1つのワークフローから20タスクを選びます。通常ケース、小さな画面状態、ポップアップ、曖昧な操作部品、安全なプロンプトインジェクションのテスト素材を含めます。元に戻せない最終操作は除き、正確な合格条件とレビューが必要な状況を書き出してください。

  2. 火曜日:環境条件をそろえる

    すべての構成を、同じビューポート、ブラウザまたはVMイメージ、ドメイン許可リスト、初期状態、認証情報の権限範囲、アクション語彙、制限時間、承認ポリシーで実行します。DeepSeekでは、独自ツールをネイティブ構成と同じ実行基盤のアクションへ対応付けます。

  3. 水曜日:実行コストを漏れなく集める

    計測された入力、キャッシュ済み入力、出力、課金対象のツール呼び出し、実行基盤の稼働時間、経過時間、試行回数、安全停止、人によるレビュー秒数を取得します。最初の失敗状態と、合格した最終証拠を保存してください。

  4. 木曜日:受け入れ済みタスクあたりの費用を出す

    モデル料金、ツール料金、実行基盤コスト、合意した時給でのレビュー人件費、再試行コストを合算し、受け入れ基準を満たした完了件数で割ります。無修正で合格、修正後に合格、安全に拒否、安全でない失敗の割合も報告します。

  5. 金曜日:1つのタスク群をルーティングし、エスカレーションを残す

    合格基準と安全基準を満たす最安の構成を選びます。アクションの反復、状態への不確実性、インジェクションの疑い、検証失敗、影響の大きいステップには上位モデルへのエスカレーションを残します。判断を再現できるよう、モデル識別子と価格基準日を記録してください。

月曜日の一歩は意図的に小さくしています。計測された1つのタスク群なら、説明可能な予算項目を作れます。範囲の広いデモで残るのはスクリーンショットの山であり、ルーティングルールではありません。

よくある質問

コンピュータ操作に最適なAIはどれですか?

失敗コストが高い業務では、GPT-5.6 Solが総合的な第一候補です。公開されたOSWorld 2.0スコア62.6%と、トークン上乗せ分の短い人件費損益分岐が根拠です。企業向け統制ではClaude Opus 5、費用対効果ではGemini 3.7 Flash、アクションハーネスをすでに持つチームにはDeepSeek V4-Flash-Vision-Expが適しています。

最も優れたマルチモーダルAIはどれですか?

コンピュータ操作における最良のマルチモーダルAIとは、対象インターフェースを十分に認識し、必要なアクション/承認レイヤーと連携し、受け入れ基準を満たしたタスク1件あたりのコストを最小化できるモデルです。視覚推論だけでは、安全な実行基盤、安全ポリシー、完了チェックは得られません。

現時点で最も強力なAIモデルはどれですか?

あらゆるタスクでその主張を裏付ける単一のベンチマークはありません。OpenAIはGPT-5.6 SolについてOSWorld 2.0で62.6%と公表し、AnthropicはOpus 5のコンピュータ操作能力を強く打ち出し、Googleは自社ツールにGemini 3.7 Flashを推奨しています。こうした公開情報で候補を絞り、最終的には自社ワークフローでの合格件数、復旧時間、安全性によって順位を付けてください。

事業者向けAI Tools Mapをダウンロードし、この候補リストを1週間のコンピュータ操作比較テストへ落とし込みましょう。

最終更新

2026年9月2日

カテゴリーAI

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。