生成AI コスト削減に効くAIモデルゲートウェイ6選【2026年版】
生成AIの推論コストを抑えるAIモデルゲートウェイ6製品を、料金、キャッシュ、ルーティング、運用負荷で比較します。Vercel、LiteLLM、Cloudflare、TrueFoundry、Portkey、OpenRouterの節約額、無料枠、注意点、ワークロード別の選び方を2026年の検証済み価格で解説します。

生成AI コスト削減を目的にマネージド型ゲートウェイを選ぶなら、現時点ではVercel AI Gatewayが最有力です。GPT-5.6 Solを月間100 million入力トークン、20 million出力トークン利用するケースでは、OpenAIの現在の直接契約価格なら$800かかるところ、Vercelの現行Defaultティアなら$400に収まります。ただし、この$400の差額は今だけ活用できる導入機会であり、年間を通じた保証ではありません。Vercelの50%割引は2026年9月18日に終了します。
とはいえ、本当に重要なのは特定のキャンペーンではなく、もっと普遍的な判断基準です。AIモデルゲートウェイで請求額が下がるのは、ルーティング、レスポンスキャッシュ、予算上限の強制によって削減できるプロバイダー費用が、ゲートウェイの料金と運用負荷を上回る場合に限られます。運用不要の定番ならVercel、セルフホストならLiteLLM、完全一致レスポンスのキャッシュならCloudflare、マネージド型セマンティックキャッシュならTrueFoundry、$49からガバナンスを整えるならPortkey、プロバイダーのマーケットプレイスならOpenRouterが適しています。
生成AI コスト削減に効くAIモデルゲートウェイ早見表
以下のプラン名、公開価格、上限はすべて2026年8月24日時点の各社公式ページで確認済みです。「無料トライアル」は恒久的な無料枠と期間限定の評価版を区別しています。試作時は無料でも、本番移行後の実質的な上限が見えなければ、高額な依存関係になりかねないためです。
開始価格だけを見ても、最適解は決まりません。LiteLLMはライセンス無料でも、コントロールプレーンの運用に実際のエンジニア工数がかかります。Cloudflareのコア機能は無料でも、Unified Billingには5%が上乗せされます。TrueFoundryはセマンティック再利用によってモデル呼び出し自体をなくせますが、最初の本番ティアは月$499です。比べるべきなのは開始価格ではなく、ゲートウェイを適用した後に総請求額がいくら残るかです。
ランキングを見る前に押さえるべきコスト削減の計算式
予算判断に使うべき式は、残るプロバイダー費用 + ゲートウェイ料金 + 有料の統制機能 + 運用コストです。同じ数の合格アウトプットを得る条件で、この合計が直接利用より安くなって初めて、ゲートウェイを導入する価値があります。対応モデル数、洗練されたダッシュボード、幅広いフェイルオーバーは確かに利点ですが、支出や高コストな障害を減らさない限り、節約とは呼べません。
違いを明確にするため、条件をそろえた請求例で考えます。OpenAIが現在掲載しているGPT-5.6 Solの価格は、入力100万トークンあたり$4、出力100万トークンあたり$20です。したがって、100 million入力トークンと20 million出力トークンを使うワークフローは、キャッシュ入力割引、ツール、長文コンテキストの倍率を考慮する前で**$800**かかります。内訳は入力$400、出力$400です。
Vercelの8月の価格改定では、同じモデルが9月18日まで、割引適用のDefaultサービスティアで入力$2、出力$10とされています。同じ月間利用量なら**$400**となり、50%削減できます。272,000トークン以下のリクエストでは、いずれも100万トークンあたり、Flexが現在入力$1・出力$5、Priorityが入力$4・出力$20です。

モデル単価は、コストを下げる手段の一つにすぎません。レスポンスが完全一致してキャッシュヒットすれば、プロバイダー呼び出しを丸ごと回避できます。安価なモデルへ振り分ければ単価は下がりますが、出力が合格基準を満たすことが前提です。予算上限は暴走したエージェントを止められます。これはトークン割引ではないものの、その月で最大の節約になる可能性があります。運用で見るべき指標は、トークン単価だけではなく、再試行とレビューまで含めた合格結果1件あたりのコストです。
土台となるプロバイダー価格の候補を確認したい場合は、最安のAI API比較をご覧ください。本ランキングはその一段上で、ゲートウェイを挟むことで、実運用上さらに安くできるかを検証します。
1. Vercel AI Gateway:マネージド型で総合首位
Vercel AI Gatewayは、トークン料金の上乗せがないマネージド型ゲートウェイを使い、今すぐ実額を削減したいチームに最も適しています。

最大の強みは、節約額を具体的に計算できる点です。現行の料金ページによると、FreeとPaidはいずれもプロバイダー定価で、マークアップはゼロです。さらに現在はGPT-5.6 SolのDefaultモデル料金が50%割引されています。資金調達済みのスタートアップが、大量処理する抽出やサポートのワークフローを1つ移すだけでも、セルフホストのプロキシを抱えずに、標準化した$800のモデル費用を$400へ半減できます。
Freeティアには月$5分のクレジットが含まれ、対象モデルの一部を利用できますが、モデルごとのレート上限は低く、BYOKは使えません。Paidティアは購入クレジットを使い、提供中の全モデル、より高い上限、BYOKを利用でき、Vercelのゲートウェイ料金も契約期間の縛りもありません。クレジットを購入するとPaidへ移行するため、Freeの月$5クレジットは以後適用されません。
BYOKには、運用手順書へ明記すべき課金上の注意点があります。顧客側のプロバイダー認証情報を使ったリクエストが失敗すると、Vercelは信頼性確保のため自社のシステム認証情報で再試行する場合があり、そのフォールバック分はチームのゲートウェイクレジット残高から差し引かれます。全リクエストを交渉済みのプロバイダー契約に固定したいチームは、BYOKだからVercelクレジットが一切動かないと思い込まず、残高を監視してフォールバック通信を照合する必要があります。
「マークアップゼロ」という説明にも、有料の統制機能は含まれません。Custom Reportingは、タグ、ユーザーID、クォータ対象への書き込み1,000件あたり$0.075、レポートクエリ1,000件あたり$5です。チーム全体のプロバイダー許可リストは、ProとEnterpriseで成功リクエスト1,000件あたり$0.10ですが、リクエスト単位のプロバイダーフィルターは追加料金なしです。チーム全体へのゼロデータ保持の強制もリクエスト1,000件あたり$0.10です。ただし、ProとEnterpriseのリクエスト単位ZDRは無料です。
トレースドレインは、トレース1,000件あたり$0.05に加え、送信量1 GBあたり$0.50で、Proに無料枠はありません。1 million件の成功リクエストでは、チーム全体の許可リストが$100、チーム全体のZDRがさらに$100、1 million件のトレースが送信量を除いて$50です。それでも最安になる可能性はありますが、購入側が比べるべきなのはトークンのマークアップ表示ではなく、実際に構成した状態の請求総額です。
率直に言えば、弱点は期限です。Sol割引は移行を試す絶好の機会ですが、永続的なアーキテクチャを決める根拠にはなりません。キャンペーン後もVercelが魅力的なのは、マークアップなしのルーティング、予算管理、フェイルオーバー、可観測性によって、チームが本来自前で担う作業を置き換えられる場合です。1つの安定したプロバイダーモデルだけを使い、こうした統制が不要なら、割引終了後は直接課金のほうが再び有利になり得ます。
最適な用途: マネージド型ルーティング、支出統制、公開トークン料金への上乗せなしを求める小規模・中堅チーム。
注目点: 現行のGPT-5.6 Sol Default料金なら、標準化した直接利用$800の月額が9月18日まで$400になります。
料金: Freeは対象モデルに月$5込み。Paidはプロバイダー定価の購入クレジット制でマークアップなし。レポート、ポリシー、トレースなどのオプションは別料金です。
無料トライアル: 期間限定ではなく、継続利用できるFreeティアです。
- FreeとPaidのどちらにも公開上のトークン料金マークアップがありません。
- 現行のSol割引により、標準化したワークロードで50%という明確な削減が可能です。
- Paidでは、ゲートウェイ料金なしでBYOKを利用できます。
- リクエスト単位のプロバイダーフィルターなら、チーム全体の許可リスト料金がかかりません。
- 決定的なSol割引は2026年9月18日に終了します。
- クレジットを購入すると、毎月のFreeクレジット$5は付かなくなります。
- BYOKリクエストに失敗した際、システム認証情報へのフォールバックでVercelクレジットを消費する場合があります。
- レポート、チーム全体のポリシー、トレースが別の従量課金になります。
比較結果を後戻りできる状態に保つには、次の手順が安全です。
合否を数えられるワークフローを1つ切り出す
妥当な構造化抽出や承認済みのサポート回答など、合格条件を数えられるジョブを1つ選びます。専用のゲートウェイキーを割り当て、支出や失敗が製品全体の数値に埋もれないようにします。
直接利用の基準値を固定する
直接プロバイダーへ接続した代表的な1週間について、入力トークン、出力トークン、再試行、レイテンシ、合格結果を記録します。現在の単価差に意味があるのは、合格率が下がらない場合だけです。
上限を設けて10%だけ振り分ける
同じモデル、同じサービスティアのまま、そのワークフローの10%をVercelへ送ります。サンプル規模に合うキー単位の予算上限を設定し、構成ミスで比較テストが青天井の請求にならないようにします。
4つのコスト項目を照合する
モデル利用料、有料のレポートやポリシー統制、トレース、レビューまたは再試行の費用を合算します。BYOKの失敗により、システムクレジットが消費されていないかも確認します。
9月の継続判断を下す
合格結果1件あたりのコストが直接利用を下回り、マネージド統制がキャンペーン後の価格に見合う場合だけルートを維持します。9月18日を予算カレンダーに登録し、期限前に必ず再見積もりします。
2. LiteLLM:既存のプラットフォームチームに最適なセルフホスト型
すでに共通基盤を運用しており、ゲートウェイのライセンス費用を$0にしたい企業には、LiteLLMが最適なセルフホスト型ゲートウェイです。

Open Sourceプランは永続的に無料で、セルフホストできます。OpenAI互換APIひとつで100+のプロバイダーを扱え、仮想キー、ユーザーとチーム、支出追跡、予算、レート制限、フォールバック、ログ、Prometheusが含まれます。コンテナ、メトリクス、シークレット、オンコールをすでに運用するプラットフォーム部門がある中堅企業なら、月額のゲートウェイライセンスを増やさず、プロバイダーごとのロジックを集約できます。
ただし、無料なのはライセンスの境界までです。コンピュート、必要に応じたデータストア、デプロイパイプライン、アップグレード、セキュリティレビュー、可観測性、そしてゲートウェイ障害に対応する担当者は自社で用意します。LiteLLMがコスト面で勝つのは、こうした作業を既存プラットフォームチームの限界コスト内で吸収できる場合、またはセルフホストが必須要件の場合です。
Enterpriseプランは、年間のゲートウェイリクエスト容量、デプロイ構成、サポート要件に応じた年間個別契約で、トークン量による課金ではありません。SSOとSCIM、OIDCまたはJWTによる統制、監査ログ、シークレットマネージャー連携とキーローテーション、組織管理、マルチリージョン構成、正式サポート、エアギャップ環境へのデプロイが加わります。公開ページでは、クレジットカード不要の30日間Enterpriseトライアルを案内していますが、金額は公開していません。
この課金基準によって、損益分岐の考え方も変わります。トークン支出が非常に大きくてもリクエスト容量が中程度なら、高価なモデル利用額に対する割合課金を避けられます。一方、モデル支出が小さくプラットフォーム担当がいないチームでは、マネージドゲートウェイの料金以上に人の注意を消費しかねません。判断を分けるのはリクエスト量だけではなく、LiteLLMの月間追加運用コストが、置き換え対象となるホステッド基盤の料金と運用作業を下回るかどうかです。
データプレーンを自社環境内に置く必要がある規制対象企業にも、LiteLLMは適しています。その統制自体が、モデル費用を純粋には削減できない場合でも採用理由になり得ます。このときコスト削減は、プロバイダールーティング、予算、一元的統制から生まれる二次的な効果であり、セルフホストが本質的に安いことの証明ではありません。
最適な用途: 既存のプラットフォーム部門があるチーム、セルフホストが必須の組織、または割合制のゲートウェイ料金を避けたい規模の企業。
注目点: $0のオープンソースライセンスで、予算、仮想キー、フォールバック、ログ、100+のプロバイダーを利用できます。
料金: Open Sourceは永続的に$0。Enterpriseはリクエスト容量、構成、サポートに基づく年間個別見積もりです。
無料トライアル: Enterpriseはクレジットカード不要で30日間。Open Sourceは恒久的に無料でセルフホストできます。
- オープンソースのライセンス料も、トークン単位のゲートウェイ課金もありません。
- 100+のプロバイダーをまたいで、予算、キー、フォールバック、ログを一元管理できます。
- Enterpriseはガバナンスとエアギャップ環境へのデプロイに対応します。
- 高価格モデルの利用が増えても、トークン支出だけを理由にEnterpriseライセンスが自動で膨らむ仕組みではありません。
- Open Sourceでは、インフラ、アップグレード、信頼性、インシデント対応を導入側が担います。
- Enterpriseの価格は非公開で、Webサイトだけでは調達予算を試算できません。
- プラットフォームの余力がない小規模チームでは、無料ライセンスが最も高コストな運用選択になり得ます。
3. Cloudflare AI Gateway:完全一致する反復通信に最適
安全に再利用できる、バイト単位で同一のリクエストが相当数あり、BYOKを使えるチームなら、Cloudflare AI Gatewayが最も効果的にコストを削減できます。

Cloudflareのコア料金は非常に把握しやすくなっています。ダッシュボード分析、キャッシュ、レート制限は全プランで無料です。Workers Freeでは全ゲートウェイ合計で100,000件のログを保存でき、1アカウントあたり10ゲートウェイまで作れます。Workers Paidはゲートウェイごとに10 million件のログを保存でき、上限は20ゲートウェイです。LogpushはPaid限定で、月10 million件のリクエストが含まれ、超過分は追加1 million件あたり$0.05です。
実際の節約手段はキャッシュであり、その限界も明確です。Cloudflareのデフォルトキャッシュキーには、プロバイダー、エンドポイント、モデル、プロバイダーの認証ヘッダー、リクエスト本文全体が含まれます。メッセージ、ツール、モデルパラメーターのどれかが違えば、別のエントリーになります。キャッシュヒット時はプロバイダー呼び出しを省けますが、同じ意味でも表現が異なる2つのプロンプトは一致しません。意図的にカスタムキャッシュキーを設計し、その安全性を説明できる場合だけが例外です。
キャッシュの最短有効期間は60秒、最長は1か月で、キャッシュ対象にできるリクエストは最大25 MBです。繰り返し実行する分類処理、共通の固定説明、決定論的なバッチプロンプトには非常に向いています。反対に、個別対応のサポート、変化するソースデータ、確率的なクリエイティブ出力には標準設定のまま使うべきではありません。安くても古い回答は、新しいモデル呼び出しより大きな損害を生む可能性があるためです。
ヒット率と同じくらい、課金経路も重要です。BYOKならゲートウェイのコアは無料のままで、各プロバイダーへ直接支払います。Unified Billingはプロバイダーの推論価格をそのまま通しますが、購入クレジットに5%を加算するため、$100分のクレジットには$105かかります。また、ゲートウェイごとに60秒あたり200リクエストまでという制限があります。Cloudflareによると、このレート制限はBYOKには適用されません。
標準化した$800の請求に、安全な完全一致リクエストが25%あるという明示的な仮定を当てはめます。反復リクエストのトークン構成が同じなら、BYOKのキャッシュ後に残るプロバイダー費用は$600で、$200を節約できます。Unified Billingでは残った$600に5%が加わるため、合計は$630、純削減額は$170です。ヒット率が低ければ優位性は消え、高く安全なヒット率を実現できればCloudflareは極めて有力になります。
DLPスキャンは全プランで無料で、Zero Trust契約のないアカウントには2つの定義済みプロファイルがあります。一方、ガードレールは無料ではありません。評価にはWorkers AIモデルを使い、Workers AIのトークン料金が発生します。ここでも、正しい集計範囲を見極める必要があります。キャッシュが無料でも、安全性レイヤーが独自の推論費用を加える場合があります。
最適な用途: 決定論的な反復リクエストがあり、キャッシュの安全性を測定できるCloudflare利用チーム。
注目点: 完全一致レスポンスを無料でキャッシュし、ヒット時はプロバイダー呼び出し自体をなくせます。
料金: コアの分析、キャッシュ、レート制限は無料。Unified Billingは5%加算。ログ、Logpush、ガードレールには別の上限または従量課金があります。
無料トライアル: 期間限定ではなく、コア機能とWorkers Freeのログ保存枠を継続利用できます。
- コアのゲートウェイ分析、キャッシュ、レート制限は$0です。
- 完全一致のキャッシュヒットでは、プロンプトトークンを少し値引きするのではなく、プロバイダー呼び出しをなくせます。
- BYOKならUnified Billingの5%と、マネージド認証情報に対するレート制限を回避できます。
- キャッシュの挙動とハードリミットが明確に文書化されています。
- デフォルトキャッシュは完全一致が必要なため、会話表現が変わるとミスになります。
- Unified Billingは5%加算で、ゲートウェイごとに60秒あたり200リクエストまでです。
- Freeのログ保存枠は全ゲートウェイ共通で、100,000件が上限です。
- 安全でないカスタムキーは、古い内容や別コンテキストの内容を返す恐れがあります。
4. TrueFoundry AI Gateway:マネージド型セマンティックキャッシュに最適
表現は違っても、安全に再利用できる同じ質問が繰り返される環境では、TrueFoundry AI Gatewayがマネージド型の最適解です。

決め手はセマンティックキャッシュです。TrueFoundryのキャッシュドキュメントによると、完全一致モードはリクエスト全体をハッシュ化し、セマンティックモードは最後のメッセージを埋め込み表現にして、過去のリクエストとの意味の近さを比較します。それ以外のリクエストパラメーターは、引き続きすべて一致する必要があります。完全なレスポンスがキャッシュヒットすればLLM呼び出しを回避でき、LLM費用はゼロです。そのため、「パスワードをリセットする方法は?」という同じ意図の質問がさまざまな言い回しで届くサポート業務では、表現ごとに料金を払わず、承認済みの回答を再利用できます。
キャッシュはユーザーまたは仮想アカウントごとに自動分離され、任意の名前空間でテナントや環境も分けられます。ある顧客のキャッシュ回答が別の顧客へ渡るなら、どれほどヒット率が高くても意味がありません。セルフホスト型セマンティックキャッシュにはRedisと埋め込みモデルが必要ですが、SaaSではそのインフラも管理対象です。
公開料金ページには4つのティアがあります。Developerは月$0で、50,000リクエスト、3ユーザーです。Proは月$499で、1 millionリクエスト、10ユーザーです。追加の2 millionリクエストと5 APIキーには、さらに月$499かかります。Pro Plusは月$2,999で、1 millionリクエスト、25ユーザーです。追加利用分は営業への問い合わせとなります。Enterpriseはリクエスト数とユーザー数に応じた個別価格で、VPCとエアギャップ環境へのデプロイをサポートします。
料金ページは7日間の無料トライアルを案内し、ゲートウェイページではカード不要で、1,600+モデルを対象に毎月最初の50,000リクエストが無料としています。本番相当のキャッシュヒット率を測るには十分です。ただし、人工的に作ったFAQセットだけを根拠に、本番での節約を推定してはいけません。
モデル費用だけで見ると、支出が小さい環境で越えるべきハードルは高めです。標準化した$800のプロバイダー請求に対し、月$499のProが推論費用だけで勝つには、モデル支出を少なくとも$499、約62.4%削減する必要があります。ガバナンス、分離、可観測性、担当者の工数を考慮すれば、それより低いヒット率でもProを正当化できる場合はありますが、それらは別の便益として明示すべきです。
最大の壁は誤った再利用です。セマンティックしきい値が緩すぎると、関係がありそうに見えても、現在のユーザーの文脈やポリシーに反する過去回答を返す恐れがあります。安全なテストでは、キャッシュ回答と新規回答を同じ合格セットで評価し、テナント別に結果を分け、リアルタイムのアカウント情報、法律、医療、変動する在庫に関わる質問はキャッシュ対象外にします。
最適な用途: 意図は繰り返される一方、表現が変わるサポート、ナレッジ、FAQのワークロード。
注目点: アカウント単位の自動分離と任意の名前空間を備えた、マネージド型のセマンティック・フルレスポンスキャッシュです。
料金: Developer $0、Pro $499/月、Pro Plus $2,999/月。Enterpriseは個別見積もりで、各プランの公開リクエスト数とユーザー数は上記のとおりです。
無料トライアル: 7日間のトライアルに加え、月50,000リクエストの恒久的なDeveloperティアがあります。
- セマンティックキャッシュなら、完全一致キャッシュでは拾えない言い換えでもモデル呼び出し全体を削減できます。
- キャッシュエントリーは、デフォルトでユーザーまたは仮想アカウントごとに分離されます。
- Developerの月間枠で、範囲を限定したヒット率評価を行えます。
- EnterpriseはVPCとエアギャップ環境へのデプロイに対応します。
- Proは月$499からなので、それに見合う大きな節約またはガバナンス価値が必要です。
- Pro Plusは$2,999ですが、公称の月間リクエスト数は引き続き1 millionです。
- セマンティックな誤ヒットは、コスト上の利点を品質問題やデータ境界違反に変えかねません。
- セルフホストでセマンティックキャッシュを使うと、Redisと埋め込みモデルの運用が加わります。
5. Portkey:月$49から始めるマネージド型ガバナンス
試作段階を卒業したものの、月$499の本番ゲートウェイまでは正当化できないチームには、低価格で始められるマネージド型のPortkeyが最適です。

プラン構成は、セルフホスト型のOpen Sourceから始まります。リクエスト上限はなく、ユニバーサルAPI、再試行とタイムアウト、ルーティング、ガードレール、自動フォールバック、基本ダッシュボード、ロードバランシング、コミュニティサポートが含まれます。この方式のライセンス価格はページに明記されていないため、LiteLLMと同様に評価すべきです。統制力は高い一方、インフラと運用担当者のコストは導入側に残ります。
ホステッド型のDeveloperティアはFree Foreverで、月10,000リクエストまで利用でき、超過枠はありません。位置付けは試作と企業向け概念実証であり、本番向けではないと明記されています。Productionは月$49で100,000リクエストを含み、3 millionまでは追加100,000リクエストごとに月$9です。シンプルキャッシュとセマンティックキャッシュ、ロールベースアクセス、サービスアカウントキー、本番サポートも含まれます。
月1 millionリクエストでは、モデル利用料を除くProductionの料金は$130です。内訳は、最初の100,000件を含む$49に、残る900,000件分として$9の超過ブロックを9つ加えたものです。この比較点が実用的です。標準化したワークロードで手数料無料のゲートウェイより安くなるには、キャッシュ、ルーティング、予算強制、または運用作業によって$130を超える価値を回収する必要があります。
Enterpriseはリクエスト容量に応じた個別価格です。SSO、きめ細かな予算とレート制限、プライベートクラウドまたはVPCの選択肢、拡張されたコンプライアンス統制が加わります。規制対象の組織なら、プロバイダー請求が変わらなくてもガバナンス目的でこのティアを選ぶ可能性があります。
調達メモに残しておきたい名称上の食い違いがあります。現行の料金ページは月$49のティアをProductionと呼ぶ一方、現在のドキュメントでは同じ月$49のティアをProとしています。また、料金ページにはPortkeyが現在Prisma AIRS AI Gatewayになったとも記載されています。プランの自動チェックや更新ポリシーを名称にひも付ける前に、注文書で呼称を確認すべきです。
Portkeyは、公開情報だけでは節約の仕組みをTrueFoundryほど検証しやすくないため、セマンティックキャッシュの深さではTrueFoundryより下位です。一方、共有クレジットを購入するたびに割合手数料を払う方式ではなく、予測可能なホステッド基本料金を求めるチームにはOpenRouterより上位です。$49という入口なら、費用を把握しながら本番テストを進められます。
最適な用途: キャッシュ、ロール、キー、ルーティング、サポートをホステッド型で必要とし、コントロールプレーン予算を月3桁に収めたい成長中のAI製品。
注目点: Productionは月$49から始まり、モデル利用料を除いて月1 millionリクエストを$130で処理できます。
料金: Open Sourceはセルフホスト。DeveloperはFree Forever。Productionは月$49に加え、追加100,000リクエストごとに$9。Enterpriseは個別見積もりです。
無料トライアル: 継続利用できるDeveloperティアは月10,000リクエストですが、本番用途には適しません。
- 最初のホステッド型本番ティアは月$49からです。
- Productionにはシンプルキャッシュとセマンティックキャッシュが含まれます。
- リクエストブロック単位の予測可能な超過料金は、トークンに対する割合課金より予算を立てやすい仕組みです。
- Open SourceとEnterpriseが、対極にある統制要件をそれぞれカバーします。
- 1 millionリクエストでは、モデル推論前に$49という表示価格が$130になります。
- Developerは10,000リクエストで止まり、超過枠がなく、本番向けではありません。
- ProductionとProという名称の違いが、調達時に不要な曖昧さを生みます。
- Enterpriseの費用対効果は、営業から見積もりを得るまで分かりません。
6. OpenRouter:価格順でプロバイダーを選ぶマーケットプレイス
OpenRouterが最も力を発揮するのは、同じルートにゲートウェイを足して料金を削る場面ではなく、多数のプロバイダーとモデルから価格で選ぶ場面です。

Freeプランでは、4つの無料プロバイダーを通じて25+の無料モデルを使え、上限は1日50リクエスト、サポートはコミュニティ対応です。Pay-as-you-goでは最低利用額なしで500+モデル、80+プロバイダーを利用できますが、共有クレジットに5.5%のプラットフォーム料金が加わります。クレジット購入手数料の最低額は$0.80で、暗号資産による入金には5%かかります。
Enterpriseでも500+モデルと80+プロバイダーを利用でき、請求書払い、マネージド統制、任意の専用上限、契約上のSLA、共有Slackサポートチャンネルが加わります。価格は個別のボリュームコミットメントに基づき、手数料の割引が含まれる場合もあります。公開された席単位サブスクリプションではなく、調達向けのティアです。
BYOKを使うと判断は変わります。Pay-as-you-goには、定価換算で月$25,000までOpenRouter手数料なしのBYOK推論が含まれ、それを超える分に5%がかかります。Enterpriseでは無料枠が月$200,000へ上がり、超過分は同じく5%です。すでにプロバイダーと直接契約している企業なら、この枠内では共有クレジットの割合手数料を払わずにOpenRouterの統制レイヤーを使えます。
コスト削減の中核はプロバイダー選択です。OpenRouterは対象プロバイダーを価格順に並べ、上限価格を強制し、ルート障害時にはフォールバックできます。ベータ版のレスポンスキャッシュでは、完全一致するリクエストを課金対象外で返し、モデルをまたいで利用できますが、セマンティックキャッシュではありません。価格順ルーティングで節約できるのは、そのワークロードについて、品質、データポリシー、レイテンシ、可用性の要件を満たしたままプロバイダーを入れ替えられる場合だけです。
同じ$800のプロバイダー請求を共有クレジット経由にするだけなら、$44が加わり合計は$844です。したがって直接課金を下回るには、安価な対象プロバイダー、キャッシュヒット、障害コストの削減、または運用簡素化によって$44を超えて回収する必要があります。単一のプロバイダーが契約単価で安定してワークロードを処理できているなら、このマーケットプレイスは任意の追加コストです。
手数料の最低額、BYOKルール、入金リスク、ルーティングの詳細比較は、OpenRouter料金の完全解説にまとめています。ここでの結論はより限定的です。OpenRouterが節約ツールになるのは、チームが実際に市場機能を使う場合であり、同じリクエストの手前にURLを1つ増やすだけの場合ではありません。
最適な用途: プロバイダーやモデルファミリーを実際に切り替え、その選択による節約額を測定できるチーム。
注目点: 500+モデル、80+プロバイダーを対象に、価格順ルーティングと大きな手数料無料BYOK枠を利用できます。
料金: Free $0。Pay-as-you-goはモデル料金に共有クレジットの5.5%を加算。Enterpriseは個別価格で、手数料割引を利用できる場合があります。
無料トライアル: 25+の無料モデルを1日50リクエストまで使える、継続型のFreeプランです。
- 本比較で最も幅広いプロバイダーマーケットプレイスです。
- 価格順の並べ替え、上限価格、フォールバックをルーティングに設定できます。
- BYOKは、Pay-as-you-goで月$25,000、Enterpriseで月$200,000までゲートウェイ手数料がかかりません。
- 完全一致レスポンスのキャッシュヒットは、課金対象使用量ゼロとして記録されます。
- 基盤となるルートが変わらなくても、共有クレジットには5.5%が加わります。
- 最低$0.80の手数料があるため、少額のクレジット購入は表示された割合より割高です。
- 完全一致キャッシュでは、表現の異なるリクエストを再利用できません。
- モデル名が同じでも、プロバイダーを変えるとレイテンシ、ポリシー、出力品質が変わる可能性があります。
用途別に選ぶべきAIゲートウェイ
マネージド型ルーティングと公開上のマークアップゼロを求めるチームには、Vercelが標準的な選択です。ただし、現行モデルの割引終了後、残る統制機能で直接利用以上の節約ができなくなる場合や、チーム全体のポリシーとトレース設定による追加料金が無視できなくなる場合は、Vercel以外へ判断が傾きます。
セルフホストが必須、または既存のプラットフォームチームが低い限界コストでゲートウェイを吸収できるならLiteLLMです。LiteLLMのために新たな運用責任者やオンコール対応が必要になる場合、あるいはEnterprise見積もりがホステッド型の総請求額を上回る場合は、マネージド型が有利になります。
リクエスト本文が完全に一致し、キャッシュ回答を安全に再利用でき、BYOKが適合するならCloudflareが有力です。同じ意図でも表現が異なり、実測したセマンティックキャッシュが品質基準を満たすなら、TrueFoundryへ判断が移ります。鮮度、個別化、テナント文脈のため再利用が危険なら、どちらのキャッシュも使わない選択に戻ります。
TrueFoundryがマネージド型のセマンティック再利用で勝つのは、実環境の評価で、ティア料金をカバーできるだけの合格キャッシュヒットを証明した後です。より安いホステッド型の本番コントロールプレーンが必要で、リクエスト単位の料金体系に収まるならPortkeyが適しています。プロバイダーの価格順選択やBYOK集約で手数料以上を節約できるならOpenRouterです。

それでも最も有力な標準策は、ゲートウェイを使わないことかもしれません。単一プロバイダーで安定して大量処理でき、ネイティブの予算機能が充実し、障害コストが低く、再利用できる内容も少ないなら、ゲートウェイによる明確な節約はありません。ルーティング、キャッシュ、ガバナンス、運用のうち、具体的な便益が総コストを上回るときだけコントロールプレーンを追加すべきです。
選定方法
このランキングでは、購入側が検証できる経済性を重視しました。評価配分は、公開されたゲートウェイ料金と手数料の透明性が35%、モデル支出を減らす確かな仕組みが30%、本番移行時の壁が20%、運用負荷と移行時の摩擦が15%です。
料金ページ、プラン比較、機能ドキュメント、キャッシュ動作、リクエスト上限、GPT-5.6 Solの変更内容は、2026年8月24日に実際のページで確認しました。公開パイプラインでは、ランキング対象の各ゲートウェイについて料金ページの実際のスクリーンショットを保存しています。一方、今回の検証では本番通信を使ってツールを実行していません。そのため、レイテンシ、稼働率、キャッシュヒット率、出力品質について、テスト結果であるかのような主張はしていません。
最終候補を6つに絞ったのは、それぞれに明確で検証可能なコスト上の役割があるためです。Vercelはマネージド基盤のマークアップをなくし、現在は主要モデルを割引しています。LiteLLMはセルフホストによってライセンス費用をなくします。Cloudflareは完全一致する反復呼び出しをなくします。TrueFoundryは意味が同じ反復処理を対象にします。Portkeyは分かりやすい価格でマネージド型への移行手段を提供します。OpenRouterはプロバイダー間の価格競争を利用できます。
ベンダーが「最適化」と呼んでいるだけでは、その機能を節約として評価していません。コスト計算には、明示したワークロード、具体的な価格、明確なキャッシュ仮定を使っています。このランキングを自社へ当てはめる際は、年間契約を結ぶ前に、その入力値を自社のモデル構成、合格アウトプット率、運用担当者コストへ置き換えてください。
避けるべき選択肢
コスト最優先の新規導入でKong AI Gatewayを選ぶ
推論コストの削減だけが目的なら、Kong AI Gatewayは第一候補ではありません。Kongの現行料金ではKonnectを30日間試用できますが、その後、有料のAI GatewayプラグインはPlusのアドオンとなり、AIプラグインでプロキシする一意のモデルごとに月$100、上限は5モデルです。5モデルなら、推論利用料や他のプラットフォーム費用より前に、月$500のプロキシ料金が発生します。
だからといって、Kongが悪いプラットフォームというわけではありません。API、セキュリティ、サービスガバナンスをすでにKongへ標準化している企業なら、AI統制の追加費用は別ベンダーを導入するより安い可能性があります。ここでの助言は限定的です。マークアップゼロやコア無料のゲートウェイがある中で、トークン節約だけを狙い、AIの新規基盤へ総合APIプラットフォームを導入すべきではありません。
担当者不在の自社製プロキシ
薄い社内プロキシは、再試行、プロバイダー変更、予算、ログ、シークレット、インシデントを引き受けるまでは無料に見えます。ワークロードが十分安定して機能範囲を小さく保て、かつ担当チームが明確な場合だけ構築すべきです。それ以外では、マネージド型より統制機能が少ないまま、エンジニア工数の中にコストを隠すことになります。
再利用できるレスポンスがない単一プロバイダー環境にゲートウェイを置く
通信先が変わらないなら、ルーティングの選択肢に価値はありません。毎回新しい回答が必要なら、完全一致キャッシュにもセマンティックキャッシュにも価値はありません。プロバイダー純正の予算機能とログで足りる場合、直接APIが最も課金レイヤーが少なく、障害箇所も最小です。
9月の割引を前提に恒久計画を立てる
Vercelの現行Solキャンペーンは、本ランキングで今すぐ使える最良の条件である一方、最も誤用しやすい条件でもあります。9月18日を強制的な再見積もり日として扱ってください。移行テストのきっかけがキャンペーンだったとしても、アーキテクチャ自体はプロバイダー定価に戻っても成立する必要があります。
月曜日にやること:1ワークフローを「合格結果あたりコスト」で評価する
先週、無視できないモデル費用が発生し、二値の合格基準で評価できる本番ワークフローを1つ選びます。入力トークン、出力トークン、プロバイダー支出、再試行、合格結果をエクスポートしてください。選んだ経路で利用を承認されていない個人情報、機密情報、顧客データは、評価セットに含めません。
翌週の通信の10%を、ワークロードの特性に合うゲートウェイへ振り分けます。マネージド型のSol割引期間を使うならVercel、実証済みの完全一致反復ならCloudflare、表現は異なるが同じ質問ならTrueFoundry、既存のセルフホスト基盤があるならLiteLLM、低価格でマネージド統制を始めるならPortkey、実際にプロバイダー価格を競わせるならOpenRouterです。
分離したキーには厳格な予算上限を設定し、最初のリクエストを送る前に停止条件を決めます。合格結果率が下がる、キャッシュの安全性が崩れる、プロバイダールートがポリシーに違反する、ゲートウェイ総額が節約額を上回る、のいずれかで停止します。週末には、モデル支出、プラットフォーム料金、有料統制、再試行、レビュー費用を合計し、合格結果数で割ります。
月曜日に得るべき成果は、財務とエンジニアリングが共有できる「継続・切り替え・撤去」の判断です。Vercelが勝つなら、9月18日の再見積もりをカレンダーに登録します。キャッシュが勝つなら、テストに合格したリクエスト分類だけへ展開します。どれも勝たなければ直接利用を維持し、不要な複雑性に料金を払わないことが正解です。
よくある質問
Cloudflare AI Gatewayの料金はいくらですか?
Cloudflare AI Gatewayのコアとなる分析、キャッシュ、レート制限は全プランで無料です。Workers Freeでは全ゲートウェイ合計で100,000件、Workers Paidではゲートウェイごとに10 million件のログを保存できます。Unified Billingでは、プロバイダー価格にマークアップはないものの、購入クレジットに5%が加わります。Logpushとガードレール推論は別料金になる場合があります。
最もおすすめのAIゲートウェイはどれですか?
2026年8月24日時点で総合的に最も優れたマネージド型はVercel AI Gatewayです。公開上のトークン料金マークアップがなく、GPT-5.6 Solを9月18日まで50%割引しているためです。既存のセルフホスト基盤があるチームにはLiteLLM、完全一致キャッシュにはCloudflare、マネージド型セマンティックキャッシュにはTrueFoundry、月$49で本番導入するならPortkey、プロバイダーを価格順で選ぶならOpenRouterが適しています。
Cloudflare AI Gatewayに無料プランはありますか?
はい。コアの分析、キャッシュ、レート制限は無料で、Workers Freeのログ枠には全ゲートウェイ合計で100,000件を保存できます。無料アカウントの上限は10ゲートウェイです。プロバイダーの推論料金は別途必要で、任意のUnified Billing、ガードレール、有料ログ機能にも料金が発生する場合があります。
事業者向けAIツールマップを入手
このゲートウェイ選定を、各ツールのコスト発動条件と品質基準まで備えた導入スタックへ発展させましょう。無料のAIツールマップを受け取るには、ニュースレターへご登録ください。
2026年9月2日




