Grok 4.5 レビュー:$2/$6のコストで選ぶエージェントモデル

Grok 4.5 レビュー。入力$2・出力$6の料金、200Kで2倍になる価格体系、SpaceXAIベンチマーク、Cursorでの競合比較を検証します。最安でもコーディング首位でもないモデルが、長時間動くエージェントの有力候補になる条件と、導入前に押さえるべきキャッシュ、ツール料金、EUでの提供制限を整理しました。

Thursday, September 3, 2026Omid Saffari
Grok 4.5 レビュー:$2/$6のコストで選ぶエージェントモデル

Grok 4.5 レビューの結論は明快です。100万入力トークンあたり$2、100万出力トークンあたり$6ですが、新たなコーディング首位モデルではありません。すべてのベンチマークで勝つことより、エージェントのコストとトークン効率を重視し、プロンプトを価格が跳ね上がる200K未満に抑えられるなら、採用候補となるモデルです。

Grok 4.5 レビューの結論を1つの表で整理

Grok 4.5は、最安のコーディングモデルとベンチマーク首位モデルの間を埋める、コストパフォーマンス重視の選択肢です。CursorのComposer 2.5より高価で、SpaceXAI自身のエンジニアリング比較では大半の項目でClaude Fable 5を下回ります。それでもCursor内の出力料金はFableの$50に対して$6なので、長時間稼働するエージェントには十分な説得力があります。

料金、機能、利用方法を掲載したSpaceXAIのGrok 4.5モデル資料
Grok 4.5のモデル資料

比較に最も適しているのは、ファーストパーティモデルと最先端の競合モデルを同じ基準で確認できる現在のCursor料金表です。以下はすべて100万トークンあたりの料金です。

Cursor内のモデル適する用途入力キャッシュ読み取り出力判断のポイント
Grok 4.5コストを抑えたい長時間稼働のエージェント$2$0.50$6最先端に近い能力とエージェントコストのバランスが最良
Composer 2.5低コストの日常的なコーディング$0.50$0.20$2.50最大性能より料金を優先する場合に選択
Claude Fable 5掲載されたコーディング評価で最高の合格率$10$1$50失敗コストがトークン料金を上回る場合に追加費用を払う価値あり
GPT-5.6 SolOpenAI中心の本番環境$5$0.50$30エコシステムとの高い親和性が割高な料金を正当化する場合あり

月間ワークロードが新規入力1,000万トークン、出力200万トークンなら、請求額は単純計算でGrok 4.5が$32、Composer 2.5が$10、Claude Fable 5が$200、GPT-5.6 Solが$110です。さらにCursorではTeamsとEnterpriseでサードパーティモデルに100万トークンあたり$0.25が加算されますが、ファーストパーティのGrokとComposerは対象外です。

つまりCursor上のGrok 4.5は、最安でも最高スコアでもなく、その間のコスト圧力を逃がす選択肢という立ち位置です。

Grok 4.5と競合モデルのトークン料金を掲載したCursorのモデル・料金ページ
Cursorのモデル料金

結論は以上です。あとは、自社のワークロードがこの判断基準のどちら側にあるかを検証する必要があります。

Grok 4.5とは何か、どこで使えるのか

Grok 4.5は、単なる新しいチャット用プリセットではなく、コーディング、エージェント型タスク、知識労働向けの推論モデルです。CursorとSpaceXAIは共同学習したMixture of Experts(専門家混合)モデルと説明しており、各トークンの処理ではネットワーク全体ではなく、選択された専門コンポーネント群が動作します。

公開は2段階で進みました。Cursorが7月8日にGrok 4.5をリリースし、その後SpaceXAIが7月16日に正式発表しました。Cursorによると、学習データには開発者とエージェントのやり取りを記録した数兆トークンに加え、STEMタスク、研究論文、より広範な知識労働が含まれています。

現在のモデルIDはgrok-4.5です。テキストと画像を入力でき、出力はテキスト、コンテキストウィンドウは500,000トークンです。推論強度はlow、medium、highに対応し、デフォルトはhighです。ネイティブツールとして、Responses APIまたはChat Completions経由の関数呼び出し、Web検索、X検索、コード実行を利用できます。

新モデルとしては提供範囲が異例に広く、SpaceXAI APIで利用できるほか、Grok Buildのデフォルトモデルであり、Cursorの全プランでも動作します。さらにWord、PowerPoint、Excelのアドインを支え、OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaicにも掲載されています。Cursor内ではデスクトップ、Web、iOS、CLI、SDKをカバーします。

この広さは導入時の摩擦を減らしますが、モデルと、その周囲にある製品を区別する必要は残ります。直接APIのGrok 4.5とCursor内のGrok 4.5ではキャッシュ料金が異なり、Grok Buildはモデルの上にエージェントループを追加しています。以前のGrok Buildのコスト構造では定額サブスクリプションの利用条件が大きな要因でした。Grok 4.5ではモデルとエージェントの従量課金経路が明確になり、議論の前提が変わります。

Grok 4.5 ベンチマークが示すのは首位ではなく価値

SpaceXAIが掲載する5つのエンジニアリングベンチマークのうち、Grok 4.5が勝ったのは1つです。別の1つでは首位に肉薄する一方、残る3つではClaude Fable 5を下回ります。プロバイダー自身の数値を無視しない限り、新たなコーディング王者とは呼べません。

ベンチマークGrok 4.5掲載スコアの首位Grokの順位実務上の示唆
DeepSWE 1.062.0%Fable 5 at 66.1%3位競争力はあるが首位ではない
DeepSWE 1.153%Fable 5 at 70%4位信頼性に大きな差
SWE Marathon29.0%Grok 4.5 at 29.0%1位長期的な問題解決で最高の結果
Terminal Bench 2.183.3%Fable 5 at 84.3%3位、GPT-5.5との差は0.1実質的に先頭集団
SWE Bench Pro64.7%Fable 5 at 80.4%3位実用的だが首位とは大差

SpaceXAIの発表時チャートによれば、競合モデルの数値は各社のシステムカードまたはベンチマークリーダーボードから引用されています。そのため、この表は傾向をつかむには有用ですが、個別ワークロードでの評価に代わるものではありません。実行環境、推論設定、再試行、トークン予算の違いによって、購入判断が変わるほどコーディングスコアが動く可能性があります。

差は明確です。GrokはFable 5に対し、DeepSWE 1.0で4.1ポイント、DeepSWE 1.1で17ポイント、Terminal Bench 2.1で1ポイント、SWE Bench Proで15.7ポイント下回ります。明確に勝ったのはSWE Marathonで、29.0%はOpus 4.8の26.0%とFable 5の24.0%を上回りました。

より説得力があるのは効率性です。SpaceXAIによると、SWE Bench Proの1タスクあたり平均出力トークンはGrokが15,954、Opus 4.8 maxが67,020で、Grokは約4.2倍少なくなっています。これはプロバイダー公表データですが、注目すべき経済単位を正しく示しています。見るべきはトークン1個の表示価格ではなく、完了したタスクです。

独立した計測結果を加えると、評価の足場が安定します。Artificial AnalysisでGrok 4.5は54という高スコアを獲得し、GPT-5.5 xhighは55です。キャッシュ・入力・出力を7:2:1で混合した100万トークンあたりの価格は、Grokが$1.35、GPT-5.5が$4.35です。同じライブ比較では、出力速度はGrokが約70トークン/秒、GPT-5.5が約76トークン/秒でした。

SpaceXAIの公称値は毎秒80出力トークンですが、独立計測では約70です。この差自体は失敗を意味しません。ただし、実際の提供速度は変動し、ローンチ時のスループットがサービスレベルを保証するわけではないことが分かります。

ベンチマークから導ける結論は明快です。Grok 4.5は最先端の性能に十分近く、経済性を検討する価値があります。しかし、価格表だけを根拠に品質ゲートを置き換えられるほど強いわけではありません。

Grok 4.5 料金の実態

Grok 4.5の$2/$6という表示価格が当てはまるのは、コンテキストが200,000トークン未満の場合だけです。このしきい値に達すると、SpaceXAIはリクエスト全体について、新規入力、キャッシュ済み入力、出力の料金をすべて2倍にします。

SpaceXAI直接API新規入力キャッシュ済み入力出力
200Kコンテキスト未満$2$0.30$6
200Kコンテキスト以上$4$0.60$12

ここで重要なのは、500,000トークンのコンテキストウィンドウが示すのは容量であり、安価に使える容量ではない点です。入力250Kトークンを渡し、出力50Kトークンを生成するリクエストは、長文コンテキスト料金で**$1.60かかります。同じトークン数を短文コンテキスト料金で計算すれば$0.80**です。Web検索、コード実行、再試行を加算する前から、しきい値によってトークン料金は2倍になります。

200Kコンテキスト未満と以上で変わるGrok 4.5の料金の段差
200Kのしきい値を超えると、そのリクエストの直接トークン料金がすべて2倍になります。

一方、キャッシュはコストを引き下げます。新規入力1,000万トークン、出力200万トークンのワークロードは$32です。直接APIで入力の半分がキャッシュから提供されれば、請求額は$23.50まで下がります。節約額は$8.50、率にして約26.6%です。

ただし、この節約は自動ではありません。SpaceXAIはResponses APIでprompt_cache_keyを設定するか、Chat Completionsでx-grok-conv-idを使い、会話を同じサーバーへルーティングするよう推奨しています。設定しなければ、キャッシュが温まっていないサーバーに当たり、期待したキャッシュヒットが通常料金の入力に戻ることがあります。

ツール利用には別のメーターが加わります。Web検索、X検索、コード実行はいずれも1,000回あたり$5です。こうした呼び出しを25回行う実行では、その呼び出しの背後で使われるモデルトークンとは別に$0.125が加算されます。添付ファイル検索は1,000回あたり$10、コレクション検索は1,000回あたり$2.50です。

本番環境で何が問題になるのか

本番で最初に起きる障害はモデルの知能不足ではなく、気づかないうちの料金変更です。リポジトリ規模のプロンプトが200Kを少し超えた途端、リクエスト内の全トークンが長文コンテキスト料金へ移り、$2/$6を前提にしたコストモデルは即座に破綻します。

2つ目は、キャッシュへの過度な期待です。エージェントが何ターンも反復するとキャッシュが効きそうに見えますが、以前のプレフィックスを再利用できるようルーティングした場合に限り、直接APIの$0.30というキャッシュ済み入力料金が適用されます。SpaceXAIが明示するキャッシュキーの推奨設定は、最初のリクエストから料金設計に組み込むべきです。

3つ目は、コンテキストの蓄積です。長時間動くエージェントは、計画、ツール出力、差分、テスト、過去の説明を繰り返し読み込みます。500,000トークンのウィンドウは破綻を先送りするだけで、古いターンをすべて持ち運ぶことを合理化しません。SpaceXAIは長いループでコンテキスト圧縮を推奨しています。エージェントが価格のしきい値に達したり、自らの履歴に注意を奪われたりする前に、古くなった詳細を小さな作業状態へ置き換えるということです。

4つ目は、プロバイダーのベンチマークをリリースゲートとして扱うことです。Grok 4.5の掲載結果は、SWE Marathonの1位からDeepSWE 1.1でFable 5に17ポイント差まで幅があります。本番品質を左右するのは、自社のリポジトリ、実行ランナー、テスト網羅性、ツール権限、成功の定義です。

5つ目は、利用経路ごとの提供状況です。Cursorの現行Grok 4.5ページでは、同モデルはCursor経由では欧州連合内でまだ利用できないとされています。これはCursor側の制限であり、SpaceXAIの全アクセス経路が遮断されている証拠ではありません。それでも、EUのチームが現時点でGrok 4.5を前提にCursorへの移行を計画できなくなるには十分な制約です。

Grok 4.5を使うべき人、見送るべき人

200K未満を維持でき、自らの作業を検証できる、コスト重視のエージェントループにはGrok 4.5が適しています。掲載されたコーディング合格率の首位に追加料金を払う価値がある場合、Composer 2.5ですでに十分な場合、またはCursorユーザーがEUにいる場合は見送るべきです。

利用状況選択肢理由判断が変わる条件
長時間動くAPIエージェント、プロンプトは200K未満Grok 4.5入力$2、キャッシュ済み入力$0.30、出力$6Fableによる失敗削減が追加料金を回収できるほど大きい
厳しいコスト上限があるCursorでの日常的なコーディングComposer 2.5入力$0.50、出力$2.50Grokの合格率による再試行削減が高い料金を相殺する
失敗コストがトークン料金を大幅に上回るClaude Fable 5掲載された5ベンチマーク中4つで首位自社を代表するタスク群でGrokが同等になる
CursorでFastと名付けられたバリアントが必要Grok 4.5 Fast入力$4、出力$18で利用可能標準Grokが目標レイテンシを満たす
リクエストが常に200Kを超えるまず圧縮またはルーティング直接利用時のGrok料金がリクエスト全体で2倍長いコンテキストによって検索やオーケストレーションのコストが十分に減り、差額を回収できる
CursorユーザーがEUにいる待つか、利用可能なモデルを選ぶCursorではGrok 4.5が利用不可と記載Cursorが地域別の提供状況を変更する
Grok 4.5、Fable 5、Composer 2.5、待機を選び分ける判断マップ
選択を左右するのは、エージェントコスト、合格率の価値、速度ティア、コンテキスト長、地域です。
強み
得意なこと
8 points

  • 入力$2、出力$6の料金により、最先端に近いエージェント作業をCursor内のFable 5やGPT-5.6 Solより大幅に安く実行できます。
  • 500,000トークンのコンテキストウィンドウには、大規模なリポジトリと長いタスク履歴を収める余裕があります。
  • 関数呼び出し、Web検索、X検索、コード実行、構造化出力、2つの標準APIインターフェースによって統合作業を減らせます。
  • プロバイダーのデータでは、SWE Marathonで明確に勝利し、SWE Bench ProではOpus 4.8 maxより出力トークンが大幅に少ないことが示されています。
  • SpaceXAI自身の比較表にある5つのエンジニアリングベンチマークのうち、Grok 4.5は4つで首位ではありません。
  • 直接APIは、リクエストのコンテキストが200Kに達した時点で全トークンの料金が2倍になります。
  • 安定したキャッシュ節約には、明示的なルーティング管理が必要です。
  • 独立計測の速度はプロバイダー公称の毎秒80トークンを下回り、Cursorは除外済みベンチマーク1件の汚染を開示しています。

安全に評価するための計画

正しい導入テストで比較すべきなのは、単発のプロンプトではなく、一定の品質基準で完了した作業です。モデル間でタスク群、エージェントランナー、ツール権限、合格判定を同一に保ちます。

  1. 代表的なタスク群を固定する

    実際に委任する仕事からタスクを選びます。テストを伴うバグ修正、リポジトリ全体の変更、ツールを使う調査タスクに加え、必要なら文書やスプレッドシートの成果物も含めます。どのモデルにも見せる前に合否を定義してください。

  2. 推論とコンテキストの条件を揃える

    Grokの全実行で同じ推論設定を使い、正確なプロンプトサイズを記録し、200K未満のタスクと長文コンテキストのタスクを分けます。特定のモデルだけに追加ファイルや異なるツール予算を与えてはいけません。

  3. キャッシュを計測可能にする

    繰り返す会話にはprompt_cache_keyまたはx-grok-conv-idを設定します。再現可能な請求額をコスト比較へ反映できるよう、新規入力とキャッシュ済み入力を別々に記録してください。

  4. 完了タスクの経済性を合格基準にする

    合格率、人による修正、再試行、総トークン数、ツール呼び出し、経過時間を記録します。品質基準を下げずに、合格した成果物1件あたりのコストで既存モデルを上回った場合にのみGrokを採用してください。

資金調達済みの創業者なら、基準は開発者のレビュー時間かもしれません。中堅企業のCTOなら、流出した不具合と監査可能性でしょう。シニアオペレーターなら、Excelや調査の成果物が事実確認に耐えるかどうかです。個人の技術系開発者なら、安い料金で完了作業を増やしつつ、エージェントのレビューという別の仕事を生まないことが基準になる場合が多いでしょう。

よくある質問

Grok 4.5の評価は?

低いトークンコストで強力なエージェント能力が必要なら、優れた選択です。ただし、SpaceXAIが掲載した5つのエンジニアリングベンチマークのうち4つではFable 5が首位で、Grokの明確な強みはコスト効率に優れた長期タスクです。最大限のコーディング精度を求める際の最も安全なデフォルトではありません。

Grok 4.5の料金はいくらですか?

SpaceXAI直接APIでは、200Kコンテキスト未満の場合、100万トークンあたり新規入力$2、キャッシュ済み入力$0.30、出力$6です。200K以上ではリクエスト全体がそれぞれ$4、$0.60、$12になります。Cursorのファーストパーティ枠では、入力$2、キャッシュ読み取り$0.50、出力$6です。

Grok 4.5はどこで使えますか?

SpaceXAIの資料では、同社API、Grok Build、Cursor、Word、PowerPoint、Excel、OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaicから利用できます。Cursorはデスクトップ、Web、iOS、CLI、SDKに対応していますが、現時点では欧州連合内で利用できないと記載しています。

Claude Code + Codexのセットアップ用チェックリストが必要ですか?ニュースレターで受け取れます

最終更新

2026年9月3日

カテゴリーAI

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。