ChatGPT API 料金は高い?最安のAI APIを徹底比較
ChatGPT API 料金は本当に高いのか。DeepSeek、Gemini、DeepInfraなど主要8サービスを、2026年8月10日時点の入出力単価、無料枠、速度、プライバシー、本番機能で比較。月20,000回利用した場合の実額から、最安で実用的なAI APIの選び方を解説します。

ChatGPT API 料金を含めて比較すると、表示価格が最も安いのはDeepInfraです。Mistral Nemoは入力100万トークンあたり$0.019、出力100万トークンあたり$0.03で利用できます。ただし、本番環境で低コストを優先するなら、JSON、ツール呼び出し、1Mトークンのコンテキストウィンドウを備えた$0.14/$0.28のDeepSeek V4 Flashが有力です。無料でプロトタイプを作る用途ではGemini 2.5 Flash-Liteが最適です。実用上いちばん安いAPIとは、品質、プライバシー、レイテンシーという要件の最低ラインを満たす選択肢のなかで、最も低価格なものです。
ChatGPT API 料金も含むAI API 比較:最安の結論
本番のテキスト処理で低コストを重視するなら、DeepSeek V4 Flashが最もバランスのよいAI APIです。 通常料金でも入力1,000万トークンと出力200万トークンの合計は$1.96です。さらに、同じモデルでJSON出力、ツール呼び出し、Responses API、1Mトークンのコンテキストウィンドウを利用できます。最後の数十セントを削ることより、この組み合わせのほうが重要です。
「最安」が指す用途は1つではないため、勝者は3つに分かれます。
- 純粋なトークン単価が最安なのはDeepInfraです。 Mistral Nemoは入力100万トークンあたり$0.019、出力100万トークンあたり$0.03です。
- プロトタイプを最も安く作れるのはGoogle Geminiです。 Gemini 2.5 Flash-Liteには無料枠があり、有料のStandardティアでは100万トークンあたり入力$0.10、出力$0.40です。
- 本番で必要な機能まで含めて安いのはDeepSeekです。 V4 Flashはキャッシュミス時、100万トークンあたり入力$0.14、出力$0.28で、一般的なアプリケーションのバックエンドに必要なAPI機能を備えています。
以下の価格はすべて、2026年8月10日時点で各プロバイダーの公開料金ページまたはドキュメントを確認したものです。特記がない限り、料金は入力/出力100万トークンあたりです。
この表は品質ランキングではありません。どちらもchat-completions形式のリクエストを受け付けるとしても、$0.10/$0.10の3Bモデルと$0.14/$0.28の現行本番モデルは別の製品です。表示価格で候補を絞り、自社の合格基準で最終的なモデルを決めてください。
AI APIを月20,000回使うといくらかかる?
小規模から中規模の利用量では、ここで扱うどのプロバイダーも十分に安く、ワークフロー設計を1つ誤っただけでトークン料金の差を上回りかねません。 それでも同じ条件で比較する価値はあります。入力単価だけでは見えない、出力の多い処理にかかる料金や手数料が明確になるためです。
ある製品が月20,000回APIを呼び出すとします。1回あたりの入力は500トークン、出力は100トークンです。合計すると、入力1,000万トークン、出力200万トークンになります。
月額 = 10 × 入力料金 + 2 × 出力料金。

割合で見ると大差ですが、金額そのものはわずかです。このワークロードでは、DeepSeekはDeepInfraのMistral Nemoより$1.71高く、OpenAI LunaはDeepSeekより$2.44高いだけです。安いモデルがスキーマを壊す、顧客の依頼を取りこぼす、あるいは人手確認の待ち行列を生むなら、節約分はすぐに消えます。
ここで重要なのが品質の最低ラインです。追加作業なしで許容できる、タスクに必要な最低限のモデル性能を指します。出力が5つのラベルに限定された分類エンドポイントなら、必要水準は低めです。アカウントデータに基づく顧客向けサポート回答では、はるかに高くなります。レコード更新を許可されたエージェントでは、誤操作の代償がAPIの再呼び出しだけでは済まないため、さらに高い基準が必要です。
出力料金にも注意が必要です。要約ツールは長い文書を読み、短い結果を返すため、入力料金が支配的になりやすい一方、コーディングエージェント、営業メール生成、会話型アシスタントは出力が大幅に増える場合があります。OpenAI Lunaの出力単価$1.20は入力単価$0.20の6倍、Mistral Small 4の出力単価$0.60は入力単価$0.15の4倍です。小規模モデルの入力/出力同額料金は、出力の多い処理で魅力的に見えますが、そのモデルがタスクを完遂できることが前提です。
1. DeepSeek:本番向けで最もバランスのよい低価格API
本番アプリでトークン費用を抑えながらJSON、ツール、長いコンテキストを維持したいなら、最初の候補はDeepSeekです。 V4 Flash 0731は、キャッシュミス時の入力100万トークンあたり$0.14、出力100万トークンあたり$0.28です。APIでは1Mトークンのコンテキスト長、最大384Kの出力、JSON出力、ツール呼び出し、Responses API、Anthropic互換ルートが公開されています。価格表の最下段に近いモデルの多くと比べて、本番運用に必要な機能が幅広くそろっています。

課題は、予算の安定性です。DeepSeekの料金ページには、近い将来に全体的な値上げを予定しており、上昇幅も大きくなる見込みだと記載されています。スタートアップは現在の標準ワークロード$1.96という安さを活用できますが、調達担当者は余裕分や代替経路を用意せず、この金額を年間予算に固定すべきではありません。
最適な用途: 本番での抽出、構造化生成、低コストのエージェント、長いコンテキストを扱う処理
特長: 1Mコンテキストに加え、JSON、ツール呼び出し、Responses API、Anthropic APIをサポート
料金: V4 Flashは入力$0.14、キャッシュヒット入力$0.0028、出力$0.28(100万トークンあたり)
無料トライアル: 料金ページに常設の無料枠は記載なし
- 標準化した入力10M、出力2Mのワークロードで$1.96
- 1Mトークンのコンテキストと最大384Kの出力
- 低価格ティアでJSON出力とツール呼び出しに対応
- V4 Flashの公開同時実行上限は2,500
- ベンダーがすでに大幅な値上げを予告している
- 常設の無料枠は公表されていない
- 低コストの外部経路でも、購入者の用途に応じたプライバシー、信頼性、処理地域の確認が必要
DeepSeekを最有力候補にできる場面
安いモデルに単なるテキスト分類以上の仕事を任せるなら、DeepSeekが有力です。たとえば、アップロードされた契約書から更新日、契約金額、解約通知期間、明記されたリスクを抽出するB2B SaaSを考えてみます。出力はスキーマで検証できますが、長い文書を読めるコンテキスト容量と、必要項目を漏らさず返す指示追従力が欠かせません。V4 Flashは、最初の評価に適した価格とAPI機能の組み合わせを備えています。
キャッシュヒット単価は、入力100万トークンあたり$0.0028と非常に低く設定されています。同じ固定指示や参照情報のプレフィックスを繰り返す場合に有効です。ただし、すべての入力トークンが$0.0028になるわけではなく、この料金が適用されるのはキャッシュヒットだけです。実測データでヒット率を確認するまでは、キャッシュミス時の$0.14で予算を組みます。
1週間で行うDeepSeek評価
範囲を限定したタスクを1つ選ぶ
抽出、分類、要約、または読み取り専用のエージェント操作から始めます。トラフィックを送る前に、必要なフィールド、許可する出力、失敗条件を定義してください。
100件の評価セットを作る
ワークロードを代表する、機密情報を除いたリクエストを使います。短い入力、長い入力、曖昧な入力、不正形式、エッジケースを含め、簡単な例だけで最安経路が勝たないようにします。
機械的に検証できる出力を必須にする
スキーマがある処理ではJSON出力を使います。各呼び出しについて、有効なスキーマの割合、回答の合格率、レイテンシー、入力トークン、出力トークン、キャッシュヒットを記録します。
現在のモデルをフォールバックに残す
検証に失敗したケース、信頼度の低いケース、重大な影響を伴う操作は、現在信頼している経路へ送ります。初回の展開は元に戻せる状態にします。
価格変更アラートを設定する
DeepSeekは値上げ予定を公表しています。暫定価格をアーキテクチャの前提にせず、新料金が公開された時点で標準ワークロードを再計算します。
V4 Flashがタスクに合格し、組織として価格変動を許容できるならDeepSeekを選びます。年間単価の固定、特定の処理地域、既存ベンダーとの関係がトークン料金の差より重要なら、別の選択肢が適しています。
2. Google Gemini:AI API 無料枠の最有力候補
Google Geminiは、機密情報を除いたプロトタイプに最適な無料経路です。 Gemini 2.5 Flash-Liteでは、Freeティアの入力・出力トークンが無料です。有料のPaidへ移行すると、Standardはテキスト、画像、動画の入力100万トークンあたり$0.10、出力100万トークンあたり$0.40で、BatchとFlexは半額の$0.05/$0.20です。

無料枠には、判断材料として明示すべきプライバシー上の注意があります。Googleの料金ページでは、Freeティアのコンテンツを製品改善に利用するとされています。Paidティアのコンテンツは利用されません。Freeは合成プロンプト、公開文書、開発者のテストセットには適していますが、顧客レコード、機密文書、未公開コードに使う既定経路には向きません。
最適な用途: 無料プロトタイプ、マルチモーダル入力、バッチ処理、コスト重視の文書ワークフロー
特長: 入出力が無料の経路に加え、有料ではテキスト、画像、動画、音声入力に対応
料金: Freeティア、有料Standardはテキスト/画像/動画入力$0.10、出力$0.40、Batch/Flexは$0.05/$0.20
無料トライアル: あり、利用モデルが限定されたFreeティア
- Freeティアでは入力・出力トークンが無料
- Paid Standardで標準ワークロードが$1.80
- 同じ非同期ワークロードならBatchまたはFlexで$0.90
- Paidティアではコンテキストキャッシュを利用でき、コンテンツはGoogle製品の改善に使われない
- FreeティアのコンテンツはGoogle製品の改善に使われる
- 無料利用はモデルとクォータに制限がある
- Standardの音声入力は100万トークンあたり$0.30で、テキスト/画像/動画入力の3倍
無料から有料へ切り替えるタイミング
文書タグ付け機能を検証する創業者なら、公開文書や生成した文書をFreeティアで使い、レスポンス形式を確認し、課金設定前にトークン特性を把握できます。顧客文書を処理し始めたら、Paidへの移行は単なる利用量の問題ではありません。コンテンツ利用条件が変わり、本番向けの上限、コンテキストキャッシュ、Batchも利用できるようになります。
標準ワークロードの費用はPaid Standardで$1.80、BatchまたはFlexで$0.90です。非同期処理の表示価格ではGeminiがDeepSeekより安くなりますが、最終判断はどのモデルがタスクの合格基準を満たすかで決まります。即時に結果を返す必要がなければ、プロバイダーを変更する前に50%の割引を検証すべきです。
Gemini 2.5 Flash-Liteは、画像と動画の入力にもテキストと同じStandard入力単価$0.10を適用します。そのため、レシート、スクリーンショット、商品画像を読むワークフローでは、テキスト専用の小規模モデルより有力です。料金ページではFlash-Liteを、Googleで最小かつ大規模利用時に最も費用対効果の高いモデルと説明しており、より大きなGeminiモデルへ移る前の開始ティアに適しています。
無料で始めたい、マルチモーダル入力が必要、または非同期処理を半額にしたい場合はGeminiを選びます。機密データを扱うならFreeティアを避け、合格テストでより大きなモデルが必要だと判明した場合はFlash-Liteを使いません。
3. DeepInfra:純粋なトークン単価が最安
DeepInfraは、Mistral Nemo Instructの入力$0.019、出力$0.03という100万トークンあたりの単価で、純粋な価格では最安です。 月20,000リクエストの標準ワークロードは$0.25です。DeepInfraではMeta Llama 3.1 8Bも$0.02/$0.04、DeepSeek V4 Flashも$0.09/$0.18で提供されているため、別の請求アカウントを増やさず、同じホスト内でモデルのグレードを上げられます。

注意すべきは、その価格で使えるモデルです。Mistral NemoとLlama 3.1 8Bが安いのは、小規模かつ旧世代のオープンモデルだからです。厳密なラベル付けなら十分な場合もありますが、顧客向けワークフローに適用するなら、実際の評価で出力が許容範囲だと確認するまで低価格だけを採用理由にしてはいけません。
最適な用途: 大量かつ低リスクの分類、タグ付け、軽量な抽出、モデル価格の検証
特長: この比較で公開されているテキスト生成のトークン単価が最安
料金: Mistral Nemoは入力$0.019/出力$0.03、Llama 3.1 8Bは$0.02/$0.04
無料トライアル: なし、DeepInfraではカード登録または前払いが必要
- Mistral Nemoで標準ワークロードが$0.25
- テキスト、埋め込み、画像、音声、動画モデルを含む大規模なカタログ
- Standard、Priority、さらに低価格のFlexスケジューリング
- 自動スケーリングと、アカウントあたり同時200リクエストという公開上限
- 最低価格で買えるのは小規模モデルであり、汎用的な本番標準モデルではない
- カード登録または前払いが必要
- Flexは低速になる場合があり、利用できないこともある
出力候補が限られるならDeepInfraを試す
地域サービスのマーケットプレイスが、受信メッセージをquote、reschedule、cancel、billing、otherのいずれかに分類するとします。5つ以外の値を拒否し、曖昧なケースはフォールバックへ送れます。$0.019/$0.03のモデルを評価する価値があるのは、このように出力範囲が狭い仕事です。
一方、アカウント固有の質問に答えるサポートアシスタントは事情が異なります。正しいレコードを取得し、ポリシーを守り、ニュアンスを保ち、自信満々の誤答を避けなければなりません。標準ワークロードでDeepSeekより$1.71安いからといって、より高い合格実績もないまま、その仕事をMistral Nemoへ移す理由にはなりません。
DeepInfraのサービスティアには、もう1つの調整手段があります。Standardは基本料金の1倍、Priorityはピーク時のスケジューリングを速める代わりに1.5倍、Flexは応答が遅く、利用できない場合がある代わりに0.8倍です。Flexはバックフィル、オフラインのデータ拡充、再試行可能な夜間キューに使います。すでに数セント単位の請求をさらに20%削るだけのために、対話型の顧客応答へ使うべきではありません。
狭いタスクと強力なバリデーターによって、小規模モデルの節約を再現できるならDeepInfraを選びます。自由記述、複雑な推論、顧客データや業務データを変更し得る操作には、最安モデルを使わないでください。
4. Groq:レイテンシー重視なら安くて速い
対話型の処理で即時性が求められるなら、Groqが低コストな候補です。 本番向けのLlama 3.1 8B Instantは、毎秒約560トークン、入力100万トークンあたり$0.05、出力100万トークンあたり$0.08と記載されています。標準ワークロードは$0.66で、純粋な価格で首位のDeepInfraとの差はわずか$0.41です。

引き換えになるのは、モデルの処理能力とカタログの安定性です。最安経路は8Bモデルです。また、Groqは本番対応モデルと別にプレビューモデルを掲載し、プレビューは短期間の予告で提供を終了する場合があるとしています。したがって、プレビュー欄の価格を本番で継続される条件とはみなせません。
最適な用途: 低レイテンシーの分類、オートコンプリート、会話型UI、高速な一次振り分け
特長: 最安の本番モデルで毎秒約560出力トークン
料金: Llama 3.1 8B Instantは入力$0.05/出力$0.08、GPT OSS 20Bは$0.075/$0.30
無料トライアル: 確認したドキュメントページでは、公開トライアル条件の記載なし
- Llama 3.1 8Bの標準ワークロードが$0.66
- Llama 3.1 8Bで毎秒約560トークン
- OpenAI互換のベースURLと使い慣れたAPI形式
- 本番モデルとプレビューモデルの区分が明確
- 最安の本番オプションは8Bモデルに限られる
- アカウント固有のレート制限はダッシュボードで確認が必要
- プレビューの提供状況は短期間の予告で変わる可能性がある
レイテンシーも製品コストの一部
音声やライブチャットの製品では、API請求額が低くても、遅延によって会話の離脱や不自然なやり取りが生じます。モデルの品質が十分で、速度が制約になっている場合にGroqは有力です。ポリシーの多いサポート回答より、メッセージを担当ワークフローへ振り分ける短いインテントルーターのほうが適しています。
モデルページにはLlama 3.1 8Bのコンテキストウィンドウが131,072トークンと記載されていますが、容量と品質は同じではありません。長いプロンプトを受け付けられるからといって、関連する細部をすべて正しく利用できるとは限りません。最初にGroqへ任せる処理は、短く、範囲が限定され、機械的に検証できるものにします。
GroqのGPT OSS 20Bは、毎秒約1,000トークン、$0.075/$0.30で、モデル規模を一段上げる選択肢です。標準ワークロードは$1.35で、DeepSeekの$1.96よりまだ安いものの、同じ評価セットで選択を決めるべきです。数字が低いだけでは、指示追従、ツール、業務適合性が優れていることの証明にはなりません。
応答速度をユーザーが体感する場面で、小規模な本番モデルがタスクに合格するならGroqを選びます。高度な推論が必要な処理や、安定した本番提供のないプレビューモデルに依存する処理には向きません。
5. Mistral:小規模モデルを直接試せる最安クラスのラボ
Mistralは、小規模モデルを開発元から直接使いたい場合に、わかりやすい選択肢をそろえています。 Ministral 3Bは100万トークンあたり入力$0.10、出力$0.10から、8Bは$0.15/$0.15、14Bは$0.20/$0.20です。Mistral Small 4は$0.15/$0.60で、テキスト、エージェント、マルチモーダルを含む、より幅広い製品機能を備えています。

安価な3Bモデルを、自由度の高い顧客向け処理の標準候補にするべきではありません。分類、モデレーション前の振り分け、制約されたフィールド変換など、小さなモデルが強みを発揮できる場面で使います。一般的なアプリケーションにはMistral Small 4のほうが現実的で、標準ワークロードの費用は$2.70です。
最適な用途: 小規模モデルへの直接アクセス、開発元との直接契約、バッチ変換、同じプロンプトを繰り返すキャッシュ処理
特長: 入力$0.10/出力$0.10の最低価格に加え、Batchは50%、キャッシュ入力は90%割引
料金: Ministral 3Bは$0.10/$0.10、Mistral Small 4は$0.15/$0.60
無料トライアル: 主要テキストモデルに汎用的な無料本番ティアはなく、一部のLabsまたはモデレーション用エンドポイントのみ無料
- 3B、8B、14B、Smallの各ティアでわかりやすい開発元直販価格
- 大量の非同期処理に使える50%のバッチ割引
- 安定したプレフィックスを繰り返す場合の90%キャッシュ入力割引
- Mistral Small 4はテキスト、エージェント、マルチモーダルに対応
- $0.10/$0.10という目を引く料金は3Bモデルのもの
- Mistral Small 4の出力料金は入力の4倍
- 主要テキストモデルには幅広く使える無料本番ティアの記載がない
Mistralのモデル階層が有利になる処理
ECプラットフォームが、商品名、属性、説明文から夜間にカタログタグを生成するとします。処理は非同期で、各商品は固定スキーマに従い、人がサンプルのエラーを次回のカタログ反映前に確認できます。このワークフローならMinistral 3Bまたは8Bから始め、Batchで50%割引を適用し、固定された分類体系の指示をキャッシュ済みプレフィックスに置けます。
チャットアシスタントでは、費用の構造が変わります。標準ワークロードでMinistral 3Bは$1.20、Mistral Small 4は$2.70です。$1.50の差額で、より大きく、幅広い用途を想定したモデルを使えます。Small 4によってフォールバックや人手確認が減るなら、トークン単価が高くてもシステム全体では安くなる可能性があります。
モデル開発元から直接使いたい場合や、小規模モデルの段階的な選択肢を重視するならMistralを選びます。自由度の高いタスクで評価も済んでいないなら、3Bの目玉価格だけを見て採用してはいけません。
6. SiliconFlow:低価格な新興マルチモデルサービス
8Bより大きいモデルも選びたい場合、SiliconFlowはこの候補群で最安のマルチモデルホストです。 GPT OSS 20Bは、131Kのコンテキストウィンドウを備え、入力100万トークンあたり$0.04、出力100万トークンあたり$0.18です。標準ワークロードの請求額は$0.76で、新規アカウントには$1分のクレジットが付与されます。

重要なのはモデル名の違いです。GPT OSS 20Bはオープンウェイトの20Bモデルであり、OpenAIのGPT-5.6ファミリーを直接利用するものではありません。SiliconFlowではDeepSeek V4 Flashも、入力$0.13、キャッシュ入力$0.028、出力$0.28で提供しています。そのため、アカウントを変えずに、より高性能な経路へ切り替えられます。
最適な用途: 1つのプロバイダーアカウントで複数のオープンモデルを使いたい、コスト重視の開発者
特長: GPT OSS 20Bが$0.04/$0.18、開始時に$1分のクレジット
料金: GPT OSS 20Bは入力$0.04/出力$0.18、DeepSeek V4 Flashは$0.13/$0.28
無料トライアル: $1分の無料クレジット、最低利用額なし
- GPT OSS 20Bの標準ワークロードが$0.76
- $1分のクレジットで、表示価格上は標準テストワークロード1回分以上を賄える
- 公開料金ページに最低利用額の設定なし
- DeepSeek、Qwen、MiniMax、GPT OSSなどのオープンモデルを低価格で利用できる
- 最低価格の対象はオープンウェイトモデルであり、独自開発のフロンティアAPIではない
- モデル品質を評価する責任は購入者に残る
- 新しいマルチモデルホストのため、調達と信頼性を追加確認する必要がある場合がある
$1のクレジットでどこまで評価できるか
SiliconFlowの開始クレジットは、具体的な価値を計算しやすい仕組みです。GPT OSS 20Bの標準ワークロードは$0.76なので、再試行や別モデルの費用を除けば、$1のクレジットで標準化したテストを丸ごと1回実行できます。無料で本番環境を1か月動かせるという意味ではありません。大きな残高を前払いする前に、出力形式、レイテンシー、トークン計算を測定できるということです。
バックオフィスの要約キューなら、まずGPT OSS 20Bを使い、失敗または信頼度の低いケースを同じプラットフォーム上のDeepSeek V4 Flashへ送ります。料金体系は段階的で、安い経路が$0.04/$0.18、上位のDeepSeekが$0.13/$0.28です。アプリケーションでは、どのモデルが回答したかを必ず記録します。モデル別の合格データがない混合請求では、安いティアが本当に効果を上げているか判断できません。
1つの低価格ホストと幅広いオープンモデルのカタログで評価を簡素化できるなら、SiliconFlowを選びます。モデル開発元との直接契約が必要な購入者や、同じモデルを許容できる総費用で提供するゲートウェイをすでに利用している場合には向きません。
7. OpenRouter:モデルを切り替え続けるなら最安
モデル切り替えの価値が少額の請求手数料を上回るなら、OpenRouterは優れた低コストゲートウェイです。 プロバイダーの推論料金を上乗せなしで転嫁し、無料モデルを提供し、多数のプロバイダーを1つのAPIキーで利用できます。DeepSeek V4 Flash Latestは入力$0.08、出力$0.252と記載され、クレジット購入手数料を除く標準ワークロードのモデル利用料は$1.304です。

注意点はクレジットの購入方法です。OpenRouterではクレジット購入時に5.5%の手数料がかかり、最低額は$0.80です。$0.80を5.5%で割ると$14.5455になるため、およそ$14.55から最低額の影響がなくなります。したがって、$10分のクレジット購入では5.5%ではなく$0.80、つまり8%の手数料がかかります。
最適な用途: モデル比較、フォールバック経路の維持、アプリを書き換えずに行うプロバイダー変更
特長: プロバイダー料金を推論価格への上乗せなしで転嫁
料金: 無料モデルは$0、有料モデルは個別設定、DeepSeek V4 Flash Latestはクレジット手数料を除き$0.08/$0.252
無料トライアル: 新規ユーザー向けの少額利用枠と、1日あたりの上限が低い無料モデル
- 1つのAPIキーで多数のプロバイダーとモデルを利用できる
- 元の推論料金への上乗せなし
- 評価に使える無料モデル
- BYOKリクエストは毎月最初の1M件まで無料
- クレジット購入に5.5%の手数料、最低$0.80
- 無料モデルは、生涯クレジット購入額が$10に達するまで1日50リクエスト、到達後は1日1,000リクエスト
- 有料クレジットは未使用のまま1年経過すると失効
- 信頼性計画では、ゲートウェイと上流プロバイダー双方の障害を考慮する必要がある
ゲートウェイ手数料に見合う場面
DeepSeek、Gemini、オープンモデルを試す開発者は、推論そのものより、個別の認証、請求、再試行動作、レスポンス形式への対応に多くの開発時間を費やすことがあります。OpenRouterなら経路設定だけで切り替えられます。その利便性によってフォールバックを常時用意できる、あるいは品質の低い経路をすぐ交換できるなら、手数料は妥当です。
少額のチャージでは、コスト構造が歪みます。$10では最低手数料$0.80が8%に相当します。$100では5.5%が$5.50となり、表示どおりの比率です。小規模なプロトタイプなら、最低手数料を利便性の対価として受け入れるか、プロバイダー直販の無料枠を使います。OpenRouterのモデル単価を直接契約の単価と比べる際、クレジット手数料を忘れてはいけません。
BYOK経路には別のルールがあります。自分のプロバイダーキーを使うリクエストは、毎月最初の1M件まで無料です。それ以降、OpenRouter上の同じモデル/プロバイダー経路でかかる費用の5%が請求されます。BYOKならプロバイダー直販の上限を維持しながら経路を一元化できますが、2つの請求面と障害面を監視する必要は残ります。
1つの統合で素早く切り替えられる価値が手数料を上回るなら、OpenRouterを選びます。1つの安定したプロバイダーだけを使い、直接APIで必要な稼働率を満たし、追加ゲートウェイに運用上の価値がない場合には向きません。
8. OpenAI:主流サービスから低リスクで移行する最安経路
OpenAIはトークン単価の最安ではありませんが、すでにOpenAIで構築した製品には、GPT-5.6 Lunaが最もリスクの低い低価格経路になり得ます。 LunaのStandard料金は、短いコンテキストの入力100万トークンあたり$0.20、キャッシュ入力$0.02、出力$1.20です。BatchとFlexでは入出力単価が半額の$0.10/$0.60になり、標準ワークロードも$4.40から$2.20に下がります。

移行には、APIの請求書に載らないコストがあります。既存のスキーマ、プロンプト、モデレーション規則、ツール、トレーシング、フォールバック動作、ワークロード評価を考えれば、月$2.44の差は取るに足らない場合があります。現在のOpenAI経路が検証に合格している製品なら、プロバイダーを変更する前にLuna、キャッシュ、Batch/Flexを評価すべきです。
最適な用途: 既存のOpenAI製品、主流の開発者向けツール、固定プロンプトのキャッシュ、非同期バッチ処理
特長: 現行の低価格OpenAIモデルGPT-5.6 Lunaと、50%割引のBatch/Flex料金を組み合わせられる
料金: Standardは入力$0.20/キャッシュ$0.02/出力$1.20、Batch/Flexは$0.10/$0.01/$0.60
無料トライアル: 常設の無料APIティアは記載なし
- BatchまたはFlexなら標準ワークロードが$2.20
- キャッシュ入力は通常入力の10分の1
- 既存のOpenAIアプリケーションは、プロバイダーを移行せず低価格モデルを評価できる
- Standard、Batch、Flex、ロングコンテキストの料金が個別に明示されている
- Standardの出力料金は入力の6倍
- Standardの標準ワークロードは$4.40で、ここに掲載した経路では最高額
- 対象となる地域処理には10%の上乗せ
- Lunaのロングコンテキストには、より高い入力$0.40、出力$1.80の料金が適用される
OpenAI内で最適化してから移行する
GPT-5.6のルーティングレビューでは、Luna、Terra、Solを使い分ける場面を詳しく解説しています。今回のコスト判断で最初に行うことは、もっと単純です。短く繰り返し可能な処理をLunaへ移し、固定プレフィックスをキャッシュし、緊急性のない処理にはBatchまたはFlexを使い、現在の高性能モデルをフォールバックに残します。
入力1,000万トークン、出力200万トークンの場合、Luna Standardは$4.40、BatchまたはFlexは$2.20、DeepSeek V4 Flashは$1.96です。最適化後のOpenAIとDeepSeek直販の差は、この標準ワークロードで$0.24しかありません。この金額だけでプロバイダー移行を正当化することはできません。
ロングコンテキストや地域設定によって結果は変わります。LunaのロングコンテキストStandard料金は入力$0.40、出力$1.80で、対象となる地域処理には10%が上乗せされます。短いコンテキスト向けの目玉価格をすべてのトークンへ適用せず、リクエストと処理方法に合った料金を使ってください。
製品がすでにOpenAI上で動いている、主流プロバイダーとの直接契約を重視する、またはBatch/Flexで価格差の大半を埋められるならOpenAIを選びます。半額経路を使える再試行可能なオフライン処理にStandardを使うべきではありません。
用途別:どのAI APIを選ぶべきか
まず処理の影響度で経路を選び、要件を満たすなかで最安のモデルを比較します。 この原則だけで、見かけだけの節約をほとんど避けられます。

機密情報を含まない無料プロトタイプには、Gemini 2.5 Flash-Liteを選びます。 費用ゼロで始めやすく、$0.10/$0.40のPaid Standardへ素直に移行できます。FreeとPaidではコンテンツ利用条件が異なるため、顧客データや機密データをFreeへ送ってはいけません。
低リスクの本番処理には、DeepSeek V4 Flashから試します。 JSON、ツール呼び出し、1Mコンテキスト、標準ワークロード$1.96の組み合わせにより、総合的に最も有力な候補です。ベンダーが値上げを予告しているため、価格変動の余裕とフォールバックを用意します。
出力が限られる大量のラベル付けには、DeepInfraを最初に評価します。 $0.25という標準ワークロードの費用に意味があるのは、許可する出力を制約でき、失敗を低コストで検出できる場合だけです。タスクが自由記述へ広がったら、すぐ上位モデルへ移ります。
体感速度が重要なら、Groqを評価します。 毎秒560トークンのLlama 3.1 8Bは、$0.05/$0.08でインターフェースを軽快にできます。すべてのモデルを自動的に置き換えるのではなく、高性能なフォールバックを備えた高速レーンとして使います。
オフラインキューには、Gemini Batch/Flex、Mistral Batch、OpenAI Batch/Flexを比較します。 いずれも50%の割引を明記しています。最安のStandard価格ではなく、キューの合格基準を満たしたモデルでプロバイダーを決めます。
簡単に切り替えたいなら、OpenRouterを選びます。 とくにフォールバックやモデルの入れ替わりを製品設計に含める場合、複数の統合を維持するより手数料のほうが安くなる可能性があります。安定したプロバイダーを1社だけ使うなら、直接契約のほうが簡単です。
既存のOpenAIアプリケーションでは、移行前にLunaを試します。 Batch/Flexなら標準ワークロードは$2.20で、DeepSeekとの差はわずか$0.24です。既存の評価資産と運用体制には、この差額を簡単に上回る価値があります。
安い経路がワークロードの合格基準を下回った時点で、判断は逆転します。スキーマの有効率、回答の合格率、レイテンシー、プライバシー条件、復旧動作が要件を満たす間だけ低価格モデルを使い、どれか1つでも崩れたら上位へ移ります。数セントを節約するために、プロンプトの継ぎはぎを続けてはいけません。
APIを使う体験を顧客に提供する開発者は、認証、請求、レビュー、障害対応にも責任を負います。v0 APIの構築ガイドで説明しているように、基盤となるモデルやエージェントは製品を構成する1つの層にすぎません。
生成AI API 料金を比較した基準
このランキングは、切り離された入力単価の最低値ではなく、信頼して購入できる最安の判断を評価しています。 各プロバイダーについて、2026年8月10日時点の公式公開ページに基づいて料金を計算し、分析しました。APIを契約したり、本番で実際に使ったかのように記述したりはしていません。
判断基準は次のとおりです。
- 実用的な最低価格: 現在掲載されている具体的なモデルの入力・出力単価
- 品質の最低ライン: 制約されたタスク、またはより広い本番ワークフローにそのモデル層が現実的か
- 運用機能: JSON、ツール、コンテキスト、バッチ、キャッシュ、レート制限、フォールバックへの影響
- プライバシーと契約上の影響: 無料データの扱い、価格の安定性、別途ゲートウェイ手数料の有無
- 切り替えコスト: プロンプト、スキーマ、評価セット、監視、請求を移行する作業
8つのプロバイダーを選んだのは、それぞれ異なる購入判断に応えるからです。最安の本番テキスト経路がこの価格帯を大きく上回る場合、トークン単位に正規化できない場合、または他の選択肢と役割が重複し明確な利点がない場合は除外しました。画像、動画、音声、埋め込みに特化したAPIも、テキストの入出力トークンと単位を比較できないため対象外です。
費用計算は、1つの明示的なワークロードに基づく独自分析であり、ベンチマークではありません。合格した出力1件あたりのコストは、自社を代表するリクエスト、バリデーター、レビュープロセスを使って初めて算出できます。
避けるべき選び方
OpenRouterの無料モデルを本番の唯一の依存先にする
OpenRouterの無料モデルだけで、顧客向けの本番トラフィックを支えるのは避けてください。アカウントが少なくとも$10分のクレジットを購入するまでは無料モデルが1日50リクエスト、購入後も1日1,000リクエストに制限されます。これは評価用の利用枠であり、安定したキャパシティ計画ではありません。
顧客データや機密データをGemini Freeへ送る
機密性の高いコンテンツをGemini Freeへ送らないでください。GoogleはFreeティアのコンテンツを製品改善に使う一方、Paidティアのコンテンツは使わないとしています。標準ワークロードのPaid Standard料金は$1.80なので、その金額を節約するためにプライバシーの境界を危険にさらす意味はありません。
DeepInfra Mistral Nemoを自由度の高い顧客向け処理に使う
$0.019/$0.03の経路を、自由記述のサポート、法的解釈、自律的な操作へ直接昇格させるのは避けてください。この料金は小規模モデルのものです。制約と検証のある仕事に使い、合格データによって範囲を広げられると確認するまでは、より高性能なフォールバックを維持します。
値上げ時の代替経路なしでDeepSeekへ依存する
$0.14/$0.28を固定の年間単価として扱わないでください。DeepSeekは大幅な値上げを予告しています。現時点で最も有力な標準候補であることは変わりませんが、予算とアーキテクチャには第2の経路が必要です。
待てるオフライン処理でOpenAI Standardを使う
待機可能な処理にLunaのStandard料金$0.20/$1.20を支払うのは避けてください。BatchとFlexは$0.10/$0.60で、プロバイダーを変えずに標準ワークロードを$4.40から$2.20へ半減できます。
次の月曜日に実行すること
来週はアプリケーション全体ではなく、範囲を限定したタスクを1種類だけ移します。 100件の評価でも、本番トラフィックを流す前に明らかなスキーマ、レイテンシー、ルーティングの問題を見つけられます。ただし、その後の継続的な監視に代わるものではありません。
代表的なリクエストを100件集める
タスクを1つ選び、通常、難しい、曖昧、不正形式の入力をサンプリングします。無料ティアを使う前に、個人情報、機密情報、顧客データを削除してください。
3つの経路で実行する
現在のプロバイダー、DeepSeek V4 Flash、Gemini 2.5 Flash-Liteを比較します。純粋な価格またはレイテンシーを明確な目的とする場合に限り、DeepInfraまたはGroqを追加します。
4つの結果を採点する
有効なスキーマの割合、回答の合格率、エンドツーエンドのレイテンシー、正確な入出力トークン費用を記録します。人手によるレビュー時間は、別の運用指標として管理します。
合格したタスク1種類だけを振り分ける
合格した範囲限定タスクだけを、安いプロバイダーへ送ります。検証失敗、曖昧な入力、影響度の高い操作には従来の経路を残します。
ベンダー変更のたびに再計算する
計算式とワークロードの前提を保存します。DeepSeekの値上げ、モデル廃止、無料ティアやゲートウェイ上限の変更時に再計算してください。
この方法なら、料金一覧を元に戻せる予算判断へ変えられます。また、公開価格表では得られない唯一の数字、つまり合格した結果1件あたりの自社コストを算出できます。
よくある質問
最もAPI料金が安いAIはどれですか?
この比較でテキスト生成の純粋な単価が最安なのはDeepInfraです。Mistral Nemoは入力100万トークンあたり$0.019、出力100万トークンあたり$0.03です。JSON、ツール、長いコンテキストが必要なワークロードには、DeepSeek V4 Flashのほうが低コストな本番標準として適しています。
無料で使えるAI APIはありますか?
あります。Google GeminiはFreeティアで入力・出力トークンを無料提供し、OpenRouterにも無料モデルがあります。Gemini FreeのコンテンツはGoogle製品の改善に使われる場合があります。OpenRouterの無料モデルは1日50リクエスト、または生涯クレジット購入額が$10以上なら1日1,000リクエストに制限されます。
AI APIの料金はいくらですか?
月20,000回、入力10M・出力2Mトークンという条件では、掲載した経路の料金はDeepInfra Mistral Nemoの$0.25からOpenAI GPT-5.6 Luna Standardの$4.40までです。Batch、Flex、キャッシュ、ゲートウェイ手数料、再試行、品質の最低ラインを満たすモデルによって最終的な請求額は変わります。
ChatGPT API 料金はいくらですか?
ChatGPTのサブスクリプションとOpenAI APIの請求は別です。ここで比較した低価格なOpenAIモデルはGPT-5.6 Lunaで、短いコンテキストのStandard料金は入力100万トークンあたり$0.20、出力$1.20、BatchまたはFlexでは$0.10/$0.60です。
この料金帯を1週間のプロバイダー評価へ落とし込むには、AI業務ワークフロー監査チェックリストをダウンロードしてください。
2026年9月3日







