プログラミング AIモデルおすすめ4選【2026年】低コスト運用を徹底比較

2026年のプログラミング AI向け低コストモデルを徹底比較。GPT-5.6 Luna、DeepSeek V4 Flash、Gemini 3.7 Flash、Claude Haiku 4.5の料金、再試行コスト、用途別の選び方を、採用パッチ単価の視点から実務目線で詳しく解説します。

Wednesday, September 2, 2026Omid Saffari
プログラミング AIモデルおすすめ4選【2026年】低コスト運用を徹底比較

GPT-5.6 Lunaは、2026年のコーディングエージェント向けプログラミング AIで、低コスト運用の第一候補です。1タスクあたり入力100,000トークン、出力30,000トークンを使う月間10,000タスクのケースでは、定価ベースの費用は$560です。一方、DeepSeek V4 Flashはオフピークなら$418、ピーク時は$836になります。選定基準は、単純なトークン単価の安さではありません。再試行、テスト、人によるレビューまで含め、採用されたパッチにかかる予算が最も小さいモデルを選ぶべきです。

プログラミング AIモデルの結論

日常的な処理にはGPT-5.6 Luna、時間をずらせるオフピークのキューにはDeepSeek V4 Flash、難度の高い処理やマルチモーダル対応に高い試行単価を払う価値がある場合はGemini 3.7 Flash、すでにシステム全体がClaude基盤ならClaude Haiku 4.5を使うのが基本です。 これが最も短く、実用的な結論です。

モデルとコーディングエージェントは同じ製品ではありません。モデルは推論エンジンであり、エージェントはファイルを読み、コマンドを実行し、コードを編集し、コンテキストを維持し、承認を求める実行基盤です。Cursor、Claude Code、Codexなどは、この実行基盤に当たります。ここでは、トークンの費用対効果と再試行の挙動を左右するモデル層だけを比較します。実行基盤をまだ決めていない場合は、別記事のAIコーディングエージェント比較をご覧ください。

以下の料金はすべて、2026年8月22日時点の各ベンダーの公開ドキュメントで確認しました。入力・出力料金は、いずれも100万トークンあたりです。各モデルについて料金と仕様を分析したものであり、今回の調査で本番環境に投入して検証したかのような主張はしていません。

モデル最適な用途開始料金無料トライアル
GPT-5.6 Luna日常処理の総合ベスト入力$0.20 / 出力$1.20APIのFree tierなし。Replit Free ModeはLunaを使用
DeepSeek V4 Flashオフピークに実行するエージェントキューオフピーク$0.22 / $0.66、ピーク$0.44 / $1.32常設枠の記載なし
Gemini 3.7 Flash難度の高いマルチモーダルなコーディングループFree tierあり。有料は12月31日まで$0.75 / $3.75あり。Free tierのデータ条件に注意
Claude Haiku 4.5Claudeネイティブなサブエージェントと高速レビュー入力$1 / 出力$5新規ユーザー向けの少額APIクレジット

この順位は、先頭のモデルがあらゆるリポジトリ作業で勝つという意味ではありません。社内の評価データがない段階で、開発者にとって最も堅実な初期予算を組めるモデルを1位としています。DeepSeekは実行時間帯によってLunaより安くも高くもなります。失敗ループを十分に減らせるなら、採用パッチあたりではGeminiのほうが安くなる可能性があります。トークン料金が高くても、Anthropicで標準化した環境ではHaikuのほうが実装リスクを抑えられる場合があります。

採用パッチ予算でAI コーディングの順位は変わる

低価格なコーディングモデルでコストを削減できるのは、生成したパッチがテストに通り、レビューにも耐えられる場合だけです。 トークンは使用量のメーターであって、成果そのものではありません。3回試さなければならないモデル、ツール呼び出しを繰り返すモデル、長い修正ループを生むモデルは、1回で終える高単価モデルより結局高くつくことがあります。

実用的な指標を、ここでは採用パッチ予算と呼びます。

採用パッチ予算 = モデル費用の総額 ÷ 必須テストとレビューに合格したパッチ数

これはベンダーのベンチマークではありません。コーディングエージェントの運用者が、API使用量とマージ工程から算出できる実務上の指標です。

料金差を具体化するため、ある企業が月間10,000件のコーディングエージェント・タスクを処理すると仮定します。各タスクでは、リポジトリのコンテキスト、指示、ツール結果を通じてキャッシュされていない入力100,000トークンを使い、推論、パッチ、テスト、追加ターンで出力30,000トークンを使います。月間の総量は入力10億トークン、出力3億トークンです。4モデルのトークン料金を同じ条件で比較するため、キャッシュ、バッチ割引、有料ツール、サンドボックスの実行時間、人によるレビューの費用は除外しています。

モデルの経路月間モデル費用1試行あたりの費用選択が逆転する条件
GPT-5.6 Luna$560$0.056別の経路が採用パッチ費用を下げない限り既定値
DeepSeek V4 Flashオフピーク$418、ピーク$836$0.0418、$0.0836Lunaを下回るかどうかは実行時間で決まる
Gemini 3.7 Flash12月31日まで$1,875$0.1875Lunaの3.35倍の費用に見合うだけ失敗ループを減らす必要がある
Claude Haiku 4.5$2,500$0.25既存Claude環境との適合、または試行回数を4.46倍減らせることが条件
コーディングエージェント1,000試行あたりの費用を並べた比較ボード
ピークまたはStandard料金では、想定した1,000試行の費用はLunaが$56、DeepSeekが$83.60、Geminiが$187.50、Haikuが$250です。

DeepSeekは、目立つ最安料金だけで順位を決めてはいけないことを最もよく示しています。すべてオフピークなら、想定した月間費用は$418で、Lunaより$142安くなります。すべてピークなら$836となり、Lunaを$276上回ります。Lunaの請求額はDeepSeekのピーク時より33.01%低い計算です。ピーク時間帯に対話型エージェントを動かすチームでは、品質を比べる前からDeepSeekのほうが高くなる可能性があります。

再試行が増えると、オフピークの優位性はすぐに縮まります。この想定では、Lunaの1試行は$0.056、オフピークのDeepSeekは$0.0418です。採用パッチを1つ生成するLunaの1試行に対して、DeepSeekの平均が1.34試行を超えれば、見かけ上の節約分は消えます。数回の余分なツールループだけで、月間の勝者が変わり得るほど低いしきい値です。

Geminiは逆のケースです。導入期間中のStandard料金では1試行が$0.1875で、Lunaの3.35試行分に当たります。同じトークン構成でGeminiの1試行がLunaの3.35試行超を置き換える場合、またはLunaでは解けない課題を解決する場合に限り、成果単位でGeminiが安くなります。エスカレーション先としては適切でも、生の能力が高いというだけで全体の既定モデルにすべきではありません。

Haikuの想定試行単価は$0.25で、Lunaの4.46試行分です。一般的な価格競争では不利です。ただし、Claudeネイティブな構成で、プロバイダー変更に伴う実装、評価、ガバナンスの負担がトークン差による節約を上回るなら、Haikuが勝つことはあります。

キャッシュは入力側の費用を変えますが、コーディングループでは出力が依然として決定的です。Lunaで想定した入力の80%がキャッシュヒットになれば、10,000タスクの請求額は、初回のキャッシュ書き込み料金を除いて$560から$416へ下がります。出力分の$360は変わりません。入力料金が安いモデルより、短く正しいパッチを書くモデルのほうが有利になり得る理由です。

1. GPT-5.6 Luna:低コストなコーディングエージェントの総合ベスト

GPT-5.6 Lunaは、入力$0.20、出力$1.20という料金で、ツールを扱える一式のモデル機能を利用できるため、日常的なコーディングエージェント作業に最適な低コストモデルです。 OpenAIは、1,050,000トークンのコンテキストウィンドウ、最大128,000出力トークン、function calling、structured outputs、hosted shell、apply patch、Skills、MCP、tool searchを提供しています。単なる安価なテキストAPIではありません。リポジトリを読み、ファイルを編集し、検証を走らせるエージェントの実働モデルを担えます。

OpenAI GPT-5.6 Lunaのモデル・料金ページ
GPT-5.6 Luna

ビジネスへの影響は、多くのモデル比較記事が追いつく前に表れました。OpenAIは7月30日にLunaを80%値下げしました。8月19日には、OpenAIとReplitが、数百万人のユーザー向けReplit Free ModeをLunaが支えていると発表しています。Replitは、より高度な推論を必要とする作業をGPT-5.6 Solへ送り、プロジェクトのコンテキストを保ったままLunaへ戻します。安価なモデルが通常経路を担当し、高価なモデルは全トークンではなく不確実な場面だけを受け持つ、実用的な構成です。

導入事例はベンダーが公表したものであり、独立ベンチマークではなく、出典元の主張として読む必要があります。それでも、今回の判断には非常に参考になります。Rampは、バックグラウンドのエージェント自動化でLunaを既定モデルにしたと述べています。Blitzyは、数千件の本番呼び出しでGPT-5.4 miniと比較し、Lunaによりプロンプトキャッシュの再利用率が24%から90%へ上がり、扱えるコンテキストが2.2倍、出力トークンが8.5分の1となり、費用が87%減ったと報告しています。Dustは、同じエージェントタスクにおいて以前の既定モデルより40%高速かつ40%安価だったとしています。これらは、入力の表示価格よりも出力の抑制とキャッシュの挙動が重要になり得ること、そして実働モデルとエスカレーションモデルを分ける設計の妥当性を裏づけます。

最適な用途: 日常的な実装、テスト作成、範囲を限定したリファクタリング、バックグラウンド処理、大量のサブエージェント

注目点: hosted shell、apply patch、Skills、MCP、structured outputs、1,050,000トークンのコンテキストウィンドウを備えた、現在のコスト重視モデル

料金: 100万トークンあたり、入力$0.20、キャッシュ入力$0.02、出力$1.20

無料トライアル: APIのFree tierは非対応。ReplitはLunaを使う別サービスのFree Modeを提供

強み
得意なこと
9 points

  • 標準化した月間ワークロードでは$560で、この比較における最も低リスクな主要モデルの既定値
  • チャット補完だけでなく、リポジトリ操作に必要なツール機能を完備
  • noneからmaxまで6段階のreasoning effort設定
  • 最大128,000出力トークンで、長いパッチやツールループにも対応
  • 大規模な公開導入事例が、実働モデルとエスカレーションモデルを分ける方式を実証
  • 出力料金はキャッシュなし入力の6倍
  • 入力が272,000トークンを超えるリクエストは、そのリクエスト全体が入力2倍、出力1.5倍の料金
  • APIにFree tierがない
  • 長いコンテキストウィンドウが、精密な検索ではなく高コストなリポジトリ全体の投入を招きやすい

Lunaが日常処理に強い理由

「日常的」は「簡単」という意味ではありません。実行前に合格条件が明確であることを指します。実装範囲がはっきりしたチケット、既知の境界を持つ失敗テスト、依存関係の更新、lint修正、定型的なエンドポイント追加は、大規模コードベースでも日常処理に分類できます。エージェントは関連ファイルを取得し、変更を加え、指定されたチェックを実行し、レビュー用の差分を返せます。

Lunaの推論設定を使えば、同じモデル内でも処理量を調整できます。決定論的な編集では低いeffortを使い、複数の制約をすり合わせる必要がある場合に上げます。キュー内の一部に不確実なタスクがあるだけで、すべてにフロンティアモデルの料金を払う必要がなくなります。ただし、この設定にも評価は必要です。高いreasoning設定は出力を増やす可能性があり、Lunaでは出力側の料金が高いからです。

最大の壁は、長いコンテキストに適用される料金しきい値です。入力が272,000トークンを超えるプロンプトでは、リクエスト全体の入力料金が2倍、出力料金が1.5倍になります。モデル自体は1,050,000トークンを受け付けますが、容量があるからといって毎回リポジトリ全体を貼り付けてよいわけではありません。関連ファイルだけを選ぶ検索層があれば、少し余分なファイルを加えただけでリクエスト全体が再課金される事態を防げます。

Lunaを1週間試す方法

  1. 日常処理の範囲を決める

    テストコマンドとレビュー基準が明確なタスクを1種類選びます。範囲を限定したバグ修正、テスト生成、依存関係の更新、狭いリファクタリングが適しています。最初からアーキテクチャの再設計を選んではいけません。

  2. 現在のモデルをエスカレーション先として残す

    初回の試行をGPT-5.6 Lunaへ送ります。検証失敗、コンテキスト不足、明示された不確実性がある場合だけエスカレーションします。強いモデルが調査を最初から繰り返さないよう、タスクの状態を引き継ぎます。

  3. コンテキストとツールの境界を設定する

    関連するリポジトリファイルだけを取得します。作業に必要なshellとpatchツールを許可し、破壊的な操作は承認制のままにします。入力272,000トークンの料金しきい値を超えるリクエストには印を付けます。

  4. 採用パッチ予算を記録する

    各タスクについて、入力、キャッシュ入力、出力、試行回数、テスト、レビュー時間、パッチがマージされたかを記録します。採用データのないモデル費用だけでは、その経路が安いとは証明できません。

  5. 合格したタスクだけを移す

    試用後、品質とレビューの基準を満たしたタスク種別だけをLunaへ移します。失敗した作業、曖昧な作業、影響の大きい作業はエスカレーション経路に残します。

広く対応するAPI、最新のエージェントツール、安価な通常経路を求める企業にはLunaが向きます。アーキテクチャ上の判断、セキュリティ上重要な変更、料金しきい値を超えるリポジトリコンテキストが日常的に必要なら、単独モデルとしては避けるべきです。その場合の正解は、大きな既定請求額ではなく、適切な振り分けです。

2. DeepSeek V4 Flash:オフピークのコーディングエージェントに最適

DeepSeek V4 Flashがこの中で最も安価かつ高性能な経路になるのは、オフピークに実行できる場合だけです。 現在の料金は、オフピークが入力$0.22、出力$0.66、ピーク時が入力$0.44、出力$1.32です。夜間のテスト生成、キューに入れたマイグレーション、リポジトリのインデックス作成、再試行可能な保守処理に適しています。需要が時間帯に沿って発生するグローバルな対話型チームでは、既定モデルとしての魅力が下がります。

DeepSeek V4 Flashの現行モデル料金・機能表
DeepSeek V4 Flash

DeepSeekが定めるピーク時間は、UTCの01:00〜04:00と06:00〜10:00です。それ以外はすべてオフピークです。料金ページには、2026年8月23日の北京時間00:00から週末全体をオフピーク料金にするとも記載されています。これにより、スケジューリング自体が技術的なコスト削減手段になります。待機できるキューと、エディター内で返答を待つ開発者とでは、同じモデルでも料金が異なります。

V4 Flashは、小さな分類器ではありません。DeepSeekは、1,000,000トークンのコンテキスト、最大384,000出力トークン、JSON出力、tool calls、Responses API、Anthropic互換API、non-thinking modeでのFIM補完を挙げています。ベンダーによると、推論性能はV4 Proに迫り、単純なエージェントタスクではV4 Proに並びます。DeepSeekは、Claude Code、OpenClaw、OpenCodeとの統合も明記しています。いずれもベンダーの主張ですが、コーディングエージェントの評価対象として必要な製品機能を示しています。

最適な用途: 時間指定できるコード保守、オフピークのテスト生成、リポジトリ変換、OpenAI形式またはAnthropic形式のAPIを求めるチーム

注目点: オフピーク料金が$0.22/$0.66、同時実行上限が2,500の1,000,000トークン対応エージェントモデル

料金: オフピークはキャッシュヒット$0.007、キャッシュミス$0.22、出力$0.66。ピークはキャッシュヒット$0.014、キャッシュミス$0.44、出力$1.32

無料トライアル: 現在の料金ページに常設のFree tierは記載されていません

強み
得意なこと
9 points

  • 全タスクをオフピークに実行すれば、想定月間費用はこの中で最安
  • JSON、tool calls、Responses API、Anthropic API、FIMに対応
  • 1,000,000トークンのコンテキストと最大384,000出力トークン
  • 時間帯別料金により、実際の非同期キューなら費用を抑えられる
  • 記載上は2,500件の同時リクエストに対応し、大規模評価が可能
  • ピーク料金では、標準化した月間費用がLunaより49.29%高い
  • 最安料金はモデル選びだけでなくスケジューリングに依存
  • DeepSeekは料金を変更する権利を留保
  • API互換でも、調達、プライバシー、サービスリスクの審査は必要

実行時間もアーキテクチャの一部

マージ後にコードモダナイゼーションを走らせるプラットフォームチームなら、実行時間を指定できます。勤務中に失敗したビルドの修復をエージェントへ頼む開発者は、そうはいきません。この2つのワークロードに、同じ料金前提を使うべきではありません。

標準化したオフピークの試行単価は$0.0418、Lunaは$0.056です。DeepSeekに許される品質面の余裕は、わずか1.34試行です。追加の調査や修正ループが必要になり、このしきい値を頻繁に超える平均値になるなら、ピーク時間へ移る前から、採用パッチあたりではLunaのほうが安くなります。ピーク時は、想定したトークン構成ですでにDeepSeekのほうが高額です。

これはDeepSeekを面白いだけの選択肢へ格下げする話ではなく、勝てる条件を明確にする話です。再試行可能で緊急性のない作業をキューに入れ、テレメトリに課金時間帯を記録します。対話型の処理にはLunaか現在のプロバイダーを残します。こうすれば、開発者の応答時間を料金カレンダーに左右させずに、オフピークの費用対効果を取り込めます。

もう1つの壁は料金の安定性です。DeepSeekは料金を変更する権利を明示的に留保し、最新ページの確認を利用者に求めています。コーディングエージェントの構成では、大量のトークンが1社へ短期間で移る可能性があるため、この注意書きは重要です。モデルID、プロバイダー、課金時間帯、採用パッチの結果を同じログに残せば、値上げを想定外の請求ではなく振り分け変更の契機にできます。

時間帯別割引を現実に活かせる非同期キューと強力な検証があるなら、DeepSeekを選びます。対話時のレイテンシ、年間単価の予測可能性、固定された調達関係がオフピークの節約より重要なら、単独の経路としては避けるべきです。

3. Gemini 3.7 Flash:難しい・マルチモーダル作業の低コストなエスカレーション先

Gemini 3.7 Flashは、安価な実働モデルが複雑なコード、デザインからコードを作る作業、複数形式のリポジトリ資料で失敗し続けるときに追加すべきモデルです。 Googleは一般提供済みとし、複雑なコーディング、エージェント型ワークフロー、信頼性の高い多段階処理向けに位置づけています。テキスト、画像、動画、音声、PDFを入力でき、code execution、function calling、structured outputs、file search、low・medium・highのthinkingに対応します。

Google Gemini 3.7 Flashのモデル機能・制限ページ
Gemini 3.7 Flash

現在の料金は期間限定で割安です。有料のStandardは2026年12月31日まで入力$0.75、出力$3.75です。2027年1月1日には、それぞれ$1.50と$7.50になります。そのため、トラフィックがまったく変わらなくても、標準化した月間請求額は$1,875から$3,750へ上がります。導入料金だけを基に作った年間予算は、最初から正しくありません。

Googleは、実際のソフトウェアエンジニアリングとエージェント作業で性能が向上し、issue解決やエージェントの失敗ループにも改善があるとしています。既定値はmedium thinkingで、複雑なコードやエージェント用途にGoogleが推奨する設定でもあります。high thinkingは難しい推論を改善できる一方、トークン消費と費用を増やします。だからこそGeminiは、安価な初回試行によって、より多くの推論に値する課題だと判明した後にだけ使うエスカレーションモデルに適しています。

最適な用途: 複雑なバグ調査、マルチモーダルなUI作業、デザイン一致の監査、難しいツールループ、期間限定の高性能・低予算経路

注目点: コーディングとエージェント向けに設計され、code executionと調整可能なthinkingを備えた、一般提供済みの1,048,576トークン対応マルチモーダルモデル

料金: Free tierあり。有料Standardは2026年12月31日まで入力$0.75、出力$3.75、その後は$1.50、$7.50

無料トライアル: あり。ただしFree tierのコンテンツはGoogle製品の改善に使用され、有料枠のコンテンツは使用されません

強み
得意なこと
9 points

  • コーディング、エージェント型ワークフロー、多段階処理を明確な用途として設計
  • テキスト、画像、動画、音声、PDFの入力に対応
  • code execution、function calling、structured output、file searchを搭載
  • 入力上限1,048,576トークン、出力上限65,536トークン
  • Free tierにより、機密情報を除いた評価を低コストで実施可能
  • 導入期間中の有料料金は2027年1月1日に2倍になる
  • Free tierのコンテンツはGoogle製品の改善に使われる
  • high thinkingはトークン消費と費用を増やす
  • 移行時には旧世代の複数設定と、事前入力したmodel turnを削除する必要がある

Geminiで失敗ループを減らす

12月31日までのGeminiの想定試行単価は$0.1875で、Lunaの3.35試行分です。1回の実行で3.35回を超える安価な試行を置き換えられる場合、通常経路が扱えない入力形式に対応する場合、または高い初回費用を正当化できるほど重要な難題である場合に、Geminiを使う価値があります。

デザイン一致の修正は具体的な適用例です。エージェントはスクリーンショットやPDFを確認し、実装を読み、コードを実行して、構造化された結果を返せます。Lunaも画像入力に対応するため、マルチモーダルというだけでは選択は決まりません。そのタスク種別の評価で、Geminiがより多くの採用パッチを生成するか、レビューのサイクルを大幅に減らすと分かったときに選択が逆転します。

Free tierは、機密情報を除いた評価用であり、非公開リポジトリの処理にそのまま使うものではありません。Googleの現行ページでは、Free tierのコンテンツは製品改善に使われ、有料枠のコンテンツは使われないとされています。トークン料金が$0でも、コードを守る境界より優先されることはありません。

移行にも壁があります。GoogleはGemini 3.7 Flashへ移行するチームに、temperaturetop_ptop_kcandidate_count、事前入力したmodel turnを削除し、thinking_budgetthinking_levelへ置き換えるよう案内しています。フロンティアモデルより安くても、統合作業は切り替え費用に含めなければなりません。

難しい、またはマルチモーダルなタスク種別が採用パッチのしきい値を満たすなら、Geminiを選びます。LunaやオフピークのDeepSeekですでに合格する日常処理の既定値にはせず、独自コードにFree tierを使うことも避けてください。

4. Claude Haiku 4.5:Claude環境に最適な低コスト・サブエージェント

Claude Haiku 4.5は、周囲のエージェントシステムがすでにClaudeに対応し、高速・大量・単純なタスクを扱う場合に適した低コストモデルです。 Anthropic自身も、費用を重視する実装やサブエージェント作業では、効率優先でHaikuから始めることを推奨しています。料金は入力$1、出力$5、コンテキストウィンドウは200,000トークンです。extended thinkingに対応し、Anthropicの現行モデル比較表では最速のレイテンシを備えます。

Haiku 4.5を含むAnthropicの現行Claudeモデル比較
Claude Haiku 4.5

Haikuは一般的な価格競争では勝てません。標準化した月間費用は$2,500、1試行あたり$0.25で、Lunaの4.46試行分です。新規構築するチームが、知名度だけを理由にこの差額を払うべきではありません。一方、Anthropicで標準化済みのチームでは、プロンプト、ツールスキーマ、評価、可観測性、クラウド契約、フォールバックモデルがすでに整っているため、結論が変わり得ます。

最も有効なのは、Claude Sonnet 5またはOpus 5の配下で実働モデルとして使う形です。Haikuはリポジトリのラベル付け、テストのひな型作成、変更要約、単純なレビューパスなど、制約の明確なサブタスクを担当します。アーキテクチャ上の不確実性や長時間の自律作業はSonnetまたはOpusが受け持ちます。Anthropicの現行定価には、この階層がはっきり表れています。Sonnet 5は$2/$10、Opus 5は$5/$25、Fable 5は$10/$50です。

最適な用途: Claudeネイティブのサブエージェント、高速レビュー、リポジトリの分類、テストのひな型作成、大量の単純作業

注目点: extended thinkingを備え、Sonnet 5またはOpus 5へ直接エスカレーションできる、Anthropicの現行最速モデル

料金: 100万トークンあたり、入力$1、キャッシュヒット$0.10、出力$5

無料トライアル: APIの新規ユーザーには少額の無料クレジットが付与されます

強み
得意なこと
9 points

  • 既存のClaudeツールスキーマや評価スイートへ無理なく組み込める
  • Anthropicが、効率優先、大量処理、サブエージェント作業に推奨
  • キャッシュヒットは標準入力料金の10分の1
  • 範囲を限定したタスクで追加の処理が必要ならextended thinkingを利用可能
  • 最大64,000出力トークンで、相当量のパッチとレビューに対応
  • 標準化した月間費用は$2,500で、現時点のこのランキングでは最高額
  • 200,000トークンのコンテキストは、約1,000,000トークンの他候補より大幅に小さい
  • 想定トークン料金だけでLunaに勝つには、試行回数を4.46倍減らす必要がある
  • 2025年2月の信頼できる知識カットオフは、現行のフロンティアClaudeモデルより古い

コンテキストの壁が役割を決める

200,000トークンあれば、選んだファイル、変更依頼、ツール出力、レビューループを十分に収められます。一方、大規模リポジトリ全体と長い履歴を1つのプロンプトに保持する長時間稼働エージェントには余裕がありません。この境界が、サブエージェントという役割をさらに明確にします。調査、設計、実装、レビューを1つのコンテキストですべて任せるのではなく、対象ファイルと合格条件を絞ってHaikuへ渡します。

プロンプトキャッシュを使えば、繰り返し渡すリポジトリ指示を安くできます。Haikuのキャッシュヒットは100万トークンあたり$0.10、5分間のキャッシュ書き込みは$1.25、1時間の書き込みは$2です。安定したコンテキストを繰り返し使えば元が取れますが、1回限りでは取れません。すべての入力に最安行が適用されると決めつけず、キャッシュ作成と読み出しを分けて記録すべきです。

制約の明確なClaudeネイティブの実働タスクにはHaikuが向きます。リポジトリ全体を対象にした自律処理、新規構築する低コストAPI、200,000トークンの制限によってコンテキストを何度も組み直す必要がある作業には適しません。

用途別に選ぶべきモデル

正解は永続的な1位ではなく、振り分け規則です。 各モデルには、採用可能なパッチを安定して作れる範囲で、最小の仕事を割り当てます。

定常処理、オフピーク処理、難しい処理、Anthropic環境のコーディングタスクを4モデルへ割り当てる判断経路
タスクの性質で振り分けます。日常処理はLuna、オフピークのキューはDeepSeek、難しい作業やマルチモーダル作業はGemini、ClaudeネイティブのサブエージェントはHaikuです。

資金を確保し、エージェント製品を作る創業者はLunaから始めるべきです。 通常経路を想定1試行あたり$0.056に抑えつつ、必要なツール機能を一式使えます。失敗ループの減少によって3.35倍の試行単価に見合うと確認できたタスクだけ、Geminiを追加します。

夜間キューを持つ中堅企業のCTOはDeepSeekを評価すべきです。 マイグレーション、テスト生成、再試行可能な保守処理をオフピークへ移します。開発者が対話的に使う処理はピーク料金で予算化したうえで、1社と2社のどちらが運用を簡潔にできるか判断します。

スクリーンショット、PDF、コードを組み合わせるシニア担当者はGeminiを追加すべきです。 マルチモーダル入力とcode executionにより、UIの資料や複数種類の根拠が含まれるタスクで有力な候補になります。1月の値上げは、事業判断にあらかじめ含めてください。

Claudeで標準化した開発組織は、Haikuを実働層に残すべきです。 制約の明確な作業なら、既存のClaude契約を再利用できる価値がトークン料金差を上回ることがあります。ただし、プロバイダーへの慣れを理由に、Haikuを本来の選定範囲を超える長いコンテキストや高い自律性のタスクへ広げてはいけません。

個人の技術系開発者は、初日から4社構成にすべきではありません。 Lunaと現在のフロンティアモデルによるフォールバックから始めます。時間指定できるキューができたらDeepSeek、特定の難しいタスク種別で失敗したらGemini、利用ツールがClaudeを必須とするならHaikuを加えます。

切り替え規則は明快です。安価な実働モデルが採用パッチとレビューの基準を満たす間は、そのモデルを使い続けます。失敗試行、レビュー負担、コンテキスト制限、入力形式、リスクによって上位モデルのほうが成果単位で安くなるときにエスカレーションします。

AIモデル 比較の選定基準

このランキングで重視したのは、単一の最安トークンではなく、根拠を示せるコーディングエージェント予算です。 選んだ4モデルはそれぞれ異なる判断領域を持ち、料金、コンテキスト、ツール機能、制約を説明できるだけの最新の一次情報があります。

評価基準は次の5つです。

  • 採用パッチの費用対効果: 同じ10,000タスクのワークロードでトークン費用を標準化し、再試行で損益が逆転する点も比較しました。
  • エージェント機能: tool calls、structured output、リポジトリ操作、互換APIは、チャット品質だけより重要です。
  • コンテキスト料金: 最大ウィンドウと、それを使った場合の料金境界を別々に扱いました。
  • 運用適合性: スケジューリング、移行作業、プロバイダーへの習熟、プライバシー条件、エスカレーション経路によって、トークンだけの比較は逆転します。
  • 料金の持続性: 時間帯別料金と予定された値上げを、将来の脚注ではなく現在の順位に反映しました。

各ページは2026年8月22日に確認しました。今回の処理でモデルをテストしたとは記載していません。ベンダーの本番導入結果は、それを公表した企業の主張として示しています。独自の分析は、標準化したワークロード、採用パッチ予算、現行料金から算出した再試行の損益分岐点です。

候補は意図的に4モデルに絞りました。モデル層を選ぶ購入者に必要なのは、モデルエンジンとエージェント実行基盤を混在させた一覧ではなく、完全な料金、失敗条件、振り分け規則です。名前だけを長く並べるより、4つの完全な選定判断のほうが役立ちます。

また、ローカルで動かすweightsは対象外です。ローカルへのダウンロードでは、トークン費用がハードウェア、電力、保守、同時実行の費用に置き換わります。ローカルコーディングモデルのガイドではハードウェア面を、より広範な最安AI APIの分析ではコーディング以外のワークロードとゲートウェイの選択を解説しています。

避けるべき選び方

課金時間帯の計画なしにDeepSeekを使わない

DeepSeekには、固定された1つの安価な料金があるわけではありません。オフピークは$0.22/$0.66、ピークは$0.44/$1.32で予算化します。処理時間をずらせないなら、まずピーク料金で判断してください。対話型トラフィック全体にオフピーク料金を当てはめた表計算は、予算とは呼べません。

Geminiの導入料金を恒久料金として扱わない

Gemini 3.7 Flashは、2027年1月1日に$0.75/$3.75から$1.50/$7.50へ移行します。標準化した月間請求額は$1,875から$3,750へ倍増します。後の料金でも成立するか、置き換え先が文書化されている場合にだけ、この経路を承認します。

非公開ソースコードをFree tierへ送らない

Googleによると、GeminiのFree tierのコンテンツは製品改善に使われ、有料枠のコンテンツは使われません。無料評価では、生成したデータ、公開データ、または機密情報を除いた入力を使います。本番に移る前に、独自コードは承認済みの条件を持つ有料経路へ移してください。

フロンティアモデルを既定の実働モデルにしない

Claude Sonnet 5は$2/$10、Opus 5は$5/$25、Fable 5は$10/$50です。難しい処理のエスカレーション先として正しい場合はあります。単純なテスト、要約、範囲の明確な編集すべてにこの料金を払えば、安価で高性能なモデルが生んだ振り分けの機会を無駄にします。

コンテキストウィンドウを毎回埋めない

Lunaは1,050,000トークンを受け付けますが、入力が272,000トークンを超えると、リクエスト全体の料金が変わります。GeminiとDeepSeekも約1,000,000トークンのウィンドウを提供します。検索の質とコンテキストの大きさは別物です。モデルが受け付けるという理由ではなく、失敗したパッチから不足が判明したときにリポジトリ情報を追加してください。

合否だけを測らない

テストに通ったパッチでも、長いレビューを要したり、危険な設計判断を隠していたりすることがあります。テストに加えて、レビュー時間、再試行回数、ロールバック、エスカレーションも記録します。最安モデルとは、エンジニアリング基準を落とさず、採用パッチ予算全体を下げるモデルです。

月曜日から始める100タスクの評価

来週、代表的な100タスクを、小さく元に戻せるモデル階層へ振り分けてください。 目的は普遍的なベンチマークではなく、1つのリポジトリと1つのタスク種別について、運用上の判断を1つ得ることです。

  1. 繰り返し可能なタスクを1種類選ぶ

    テスト生成、依存関係の更新、小さなバグ修正、リポジトリ要約など、範囲の明確な分類を使います。最初の呼び出し前に、必須テスト、レビュー基準、禁止操作を定義します。

  2. Lunaを基準の実働モデルにする

    各タスクを、必要最小限のコンテキストとツールとともにGPT-5.6 Lunaへ送ります。検証失敗または明示された不確実性があった場合に、状態を引き継いでエスカレーションできるよう、現在の強いモデルを残します。

  3. 理由を1つ決めて対抗モデルを追加する

    時間指定できるオフピークのキューならDeepSeek、難しいまたはマルチモーダルなタスクならGemini、ClaudeネイティブのサブエージェントならHaikuを使います。APIが利用できるというだけで、すべてのモデルを追加してはいけません。

  4. 採用パッチ予算を測る

    入力、キャッシュ入力、出力、試行回数、経過時間、テスト、レビュー時間、エスカレーション、マージ、ロールバックを記録します。レビューが完了してから、モデル費用の総額を採用パッチ数だけで割ります。

  5. 勝者へ振り分け、退避経路は残す

    合格したタスク種別だけを移します。フォールバック、コンテキストログ、モデル識別子を残しておけば、値上げ、性能低下、新リリースがあってもワークフローを作り直さずに評価できます。

安価なエージェントモデルがもたらすのは、1つの高価なモデルにすべてを任せなくてよいという変化です。月曜日に始めるべきなのは、モデル構成を計測可能な作業階層に変えることです。安価な実働モデル、明確なエスカレーション規則、財務チームが監査できる採用パッチ予算を用意します。

よくある質問

プログラミングに最も安いAIモデルは?

この4モデルでは、DeepSeek V4 Flashがオフピーク時に最安で、100万トークンあたり入力$0.22、出力$0.66です。標準化したコーディングエージェントのワークロードでは、DeepSeekのピーク時間中はGPT-5.6 Lunaのほうが安いため、時間帯と再試行率で答えが決まります。

予算を抑えたい場合、どのAIコーディングエージェントが最適?

エージェントの実行基盤とモデルを分けて考えます。高機能な実行基盤でGPT-5.6 Lunaを日常処理の実働モデルにし、エスカレーション用に強いモデルを残します。月額のシート料金だけで選ばず、採用パッチあたりの費用を測ってください。

完全無料でプログラミングに使えるAIは?

Gemini 3.7 FlashにはFree tierがあり、ReplitにはLunaを使う別サービスのFree Modeがあります。ただし、無料でも上限、製品上の境界、データ条件があります。GoogleのFree tierのコンテンツは製品改善に使われるため、独自コードは承認済みの有料経路で扱うべきです。

2026年に最適なローカルAIコーディングモデルは?

このランキングは、低価格なホステッドAPIが対象です。ローカル環境については、専用のローカルコーディングモデル比較でハードウェアと性能のトレードオフを解説しています。ローカルweightsにはトークン料金がありませんが、メモリ、電力、保守、安全な実行基盤が必要です。

AIビジネス・ワークフロー監査チェックリストをダウンロードし、このモデル階層を1週間の振り分け評価に変えてください。

最終更新

2026年9月2日

カテゴリーBuild

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。