AIエージェント監視のコスト:20%増を見込む2026年予算ガイド

OpenAIが示した監視用推論コンピュートの約20%という基準を起点に、AIエージェント監視の費用計算、費用対効果が高い7つの用途、限界、Datadogの料金、今すぐ作れる事業機会まで解説します。監視を含む総予算の見積もり方と、人の承認や即時停止の対象にすべき操作を整理した2026年の実務ガイドです。

Wednesday, September 2, 2026Omid Saffari
Tools
AIエージェント監視のコスト:20%増を見込む2026年予算ガイド

高リスクなAIエージェントでは、AIエージェント監視そのものが第2の推論ワークロードになりつつあります。無料で使えるダッシュボードという位置づけではありません。OpenAIの現在の試算では、強化された監視に必要な計算資源は、監視対象となる推論コンピュートの約20%です。安全性はもはや目に見えない約束ではなく、モデルの採算性やシステム設計、さらにはリリース判断まで左右する予算項目になりました。

結論:計算資源を20%上乗せしたケースを予算に入れる

2026年の計画で最も実用的な目安は、監視対象の推論予算の1.2倍です。OpenAIは8月18日の開示で、現在の監視オーバーヘッドが、監視する推論コンピュートの約20%に相当するとしています。ただし、そのコストは学習や評価のワークロードによって大きく変わるとも注意を促しています。

これは市場全体に通用する一律料金ではありません。ソフトウェアのユーザーライセンス料でも、AI施策全体の20%でもありません。OpenAIが対象ワークロードを社内で監視するために追加投入している計算資源について、自ら示した基準値です。

実務上の判断は明快です。コードを書く、送金する、本番データに触れる、インターネットへアクセスするといった権限をエージェントに与えるなら、採算性を確定する前に、監視分として20%を上乗せして事業性を検証します。社内文書の下書きだけを行う読み取り専用アシスタントに、自律型セキュリティエージェントと同じ監視構成は必要ありません。

AIエージェント監視とは何か

ここでいうAIモデル監視とは、エージェントが作業している最中の振る舞いを、結果に至る一連の操作まで含めて見守ることです。通常のオブザーバビリティは、リクエスト後のレイテンシ、エラー、トークン使用量、コストを記録するのが中心ですが、その範囲を超えます。

空港の保安検査に置き換えると分かりやすいでしょう。まず高速なスキャナーですべてを確認し、疑わしい案件だけを、より時間をかけて調べられる高性能な検査担当へ回します。重大な懸念をシステムだけで解消できなければ、人間を呼び出します。

OpenAIの新しい仕組みも、この段階的な構成です。

  1. 検出器がサンプリング対象の全トークンを確認します。 OpenAIはこれを「activation classifier」と呼んでいます。モデルが生成中に示す内部活動を調べる検出器です。
  2. 懸念の可能性があれば上位の調査へ送ります。 より高度で計算負荷の高い調査役が、ツール操作、利用可能な推論内容、活動全体の流れを確認します。
  3. 具体的なリスクを探します。 公開されている検出対象には、不正アクセス、データ窃取、破壊的な挙動、セーフガードを破ろうとする試みが含まれます。
  4. 人が対応するループも残します。 OpenAIは、懸念のある活動が検出されてから30分以内のアラート発行を目標としています。重大な境界違反の可能性が高ければ、安全、セキュリティ、研究の各チームを呼び出します。30分以内に誤検知だと確認できない場合は、その活動を一時停止する想定です。
全トークンのスクリーニング、詳細調査、30分以内のアラート、一時停止の判断を示すクレイ風インフォグラフィック
コストは段階的に発生します。全トークンを検査し、エスカレーションにはより多くの計算資源を使い、最も難しい判断では人間を呼び出します。

この段階構成が重要なのは、最も高コストな調査役をすべてのやり取りに使えば、計算資源を浪費するからです。広い範囲には軽量なチェックをかけ、想定リスクが高い箇所にだけ重い推論を集中させます。

OpenAIは、Sol相当以上の能力を持つモデルでツールを使う、すべての強化学習と評価にこの監視を義務づけています。強化学習とは、より良い振る舞いに報酬を与えながら試行錯誤させる段階です。Astraが重大なサイバー能力を持つ可能性があると判断した後は、学習と評価だけでなく、ツールを使うAstraのすべての推論に監視範囲を広げました。

監視対象の範囲自体も変わっています。OpenAIによると、従来の監視対象は社内のフロンティアモデル導入とフロンティア強化学習の実行が中心で、ツールを使うすべての推論や学習を網羅していたわけではありません。新しい仕組みは、より多くの処理を対象にするため、必要な計算資源も増えます。

多くの予算計画が見落とす監視コストの計算

20%という数字は、監視対象の推論に掛ける倍率です。総合的な計算資源コストが比例すると仮定するなら、計画式は次のとおりです。

監視対象の推論予算 × 0.20 = 監視用の予算枠

監視対象の基本推論予算20%の計画枠合計計算資源の相当額計画上の用途
$1,000$200$1,200小規模パイロット
$10,000$2,000$12,000本番ワークフロー
$100,000$20,000$120,000大規模な監視対象ワークロード

これは単純計算のシナリオであり、OpenAIの料金表ではありません。低価格な監視モデルを使う企業、トラフィックの一部だけをサンプリングする企業、エスカレーション件数が少ない企業なら、この比率を下回る可能性があります。長い一連の動作を高性能な調査役へ送るワークロードなら、上回ることもあります。OpenAIも、コストは大きく変動すると明記しています。

基本推論100%、監視20%、合計計算資源120%のコスト式を示すクレイ風インフォグラフィック
分かりやすい計画モデルは、基本推論100%に監視用の20%を加え、計算資源換算で合計120%のストレスケースを置くことです。

ソフトウェア料金は別に考える必要があります。Datadog Agent Observabilityには、最大40,000 LLMスパン、保存期間15日の無料枠があります。Proは月額$160で、最大100,000スパン、保存期間は同じく15日です。LLMスパンとは、モデルプロバイダーへの1回の呼び出しを指します。Datadogでは、このモデル呼び出しのスパンが課金対象で、ツール、ワークフロー、エージェント、埋め込み、検索の各スパンは無料です。

$160で利用できるのは、トレーシング、評価、ダッシュボード、本番監視です。OpenAI社内の活性化レベルのセキュリティシステムを再現するものではありません。本格的に予算を組むなら、次の3項目が必要です。

  • オブザーバビリティソフトウェア: トレースの収集と検索。
  • 監視用コンピュート: 検出器と、より高度な調査役の実行。
  • 対応オペレーション: アラートの確認、活動の一時停止、インシデント対応。

最大の基礎費用を決めるのは、依然としてモデル選びです。監視費用を加える前に基本コストを下げるなら、最も安いAI APIの比較が役立ちます。OpenRouterの料金では、ゲートウェイ手数料とプロバイダー料金が監視レイヤーと並行して発生する仕組みを確認できます。

AIエージェント監視の費用対効果が高いのは誰か

エージェントの権限が広く、稼働時間が長く、価値の高いシステムへアクセスできるほど、監視のリターンは高まります。ここでは、費用対効果が高い順に7つの用途を並べます。

1. ツールを使うサイバーエージェントを運用するセキュリティチーム

セキュリティチームは、リポジトリの調査、コード実行、インフラへのクエリ、防御機構のテストをエージェントに任せることがあります。このワークフローでは、すべての動作軌跡を低コストでスクリーニングし、想定外のアクセスを試みたら詳細調査へ回し、重大な境界を越えた可能性があれば自動停止する仕組みが必要です。

得られる価値は被害の封じ込めです。認証情報の漏えいや未承認のネットワーク経路を1件防ぐだけでも、監視用コンピュートのコストを上回る意味があります。完全な20%のストレスケースを受け入れる根拠が最も明確な用途です。失敗時の問題は回答の質ではなく、現実のシステムで実行される操作だからです。

2. コーディングエージェントを社内導入するエンジニアリング責任者

エンジニアリング組織では、ソースコード、CI、パッケージレジストリ、デプロイツールへのアクセスをコーディングエージェントに与える場合があります。監視システムは、指示されたタスクとツール呼び出しを照合し、禁止コマンドを回避しようとする動きを検出し、破壊的な操作や外部への転送を人の確認へ回せます。

OpenAIの以前の社内コーディングエージェント監視では、推論強度を最大に設定したGPT-5.4 Thinkingを使い、やり取りの完了から30分以内にレビューしていました。確認対象は、会話履歴、利用可能な推論内容、メッセージ、ツール呼び出し、出力です。事業上の効果は、一律の厳しい制限を減らせることです。便利なエージェントには広いアクセスを維持しつつ、特に危険な挙動だけを重点的に監視できます。

3. 資金を扱う権限をエージェントに与える業務チーム

サポートやコマースのエージェントは、返金、サブスクリプション変更、クレジット付与、注文処理を行うことがあります。有効なAPI呼び出しかどうかを個別に確かめるだけでは、十分な監視とはいえません。一連の操作が顧客の依頼と一致しているか、再試行の繰り返しでコストが膨らんでいないか、未承認の金銭的結果へ逸脱していないかまで確認する必要があります。

効果は、すべての有効なAPI呼び出しを無条件に信頼することなく、定型業務の手動レビューを減らせる点にあります。高額取引には承認を必須とし、リスクの低いやり取りは速いまま維持できます。

4. エージェント支出を管理するプラットフォームチーム

エージェントは、1件のユーザー依頼を、多数のモデル呼び出し、ツール呼び出し、再試行へ広げることがあります。プラットフォームチームはジョブ全体をトレースし、顧客別または機能別にコストを割り当て、異常なコスト増を調査へ回せます。監視によって、「なぜこのタスクは高くなったのか」と「追加作業はユーザーの目的に沿っていたのか」の両方に答えられます。

効果はユニットエコノミクスの改善です。成功したタスク当たりのコストには、ループ、失敗、ツール利用も含まれるため、トークン当たりのコストより有用です。監視を通じて、より安いモデル、厳しい再試行上限、短いコンテキストのどれを使えば基本料金を下げられるかが見えてきます。

5. 規制対象のアシスタントを監督するコンプライアンスチーム

金融、医療、法務のオペレーションでは、エージェントが何を見て、何を試み、何が承認され、なぜセッションが止まったのかを示す証拠が必要になる場合があります。動作軌跡のログがあれば、モデルのメッセージ、ツール呼び出し、ポリシーチェック、人の判断、最終結果を、ひとつの検証可能な記録にまとめられます。

価値は、同じ証拠を繰り返し使えることです。散在するアプリケーションログから意思決定を復元せずとも、インシデントレビュー、内部監査、ポリシー調整で同じイベント履歴を参照できます。

6. 長時間稼働するエージェントを扱う研究チーム

長時間稼働するエージェントは、数時間から数日にわたって作業するため、弱い境界をすり抜ける経路を見つける機会も増えます。OpenAIの長期タスクに関する研究では、個別には許容できる手順でも、積み重なると承認されないはずの結果に至ることが分かりました。その対策として、セッションを一時停止し、ユーザーへ通知できる動作軌跡レベルの監視を採用しました。

得られる価値は、制御された持続性です。局所的に妥当な操作の連続が全体としても安全だと思い込むことなく、難しい作業をエージェントに探索させられます。

7. 強化学習を評価するモデルチーム

モデルチームは、学習と評価のロールアウトを監視し、報酬ハッキング、欺瞞、不正アクセス、環境を操作しようとする試みを検出できます。疑わしい事例は、新しい評価例や、セーフガード改善のための学習データとして活用できます。

価値は、導入後の証拠とモデル改善を結ぶ学習サイクルを短くできることです。戦略的な意義は大きいものの、自社でフロンティアモデルを学習する企業は少ないため、用途としては最も限定的です。

今から作れる事業機会

現在の米国における検索需要は小さいものの、商用意図は明確です。DataForSEOの推定月間検索数は、「LLM observability tools」が210、「AI agent monitoring」が90、「Datadog LLM observability pricing」が90、「AI model monitoring」が50です。この調査で確認した重複のない主要キーワードを合計すると、月間470件以上になります。さらに注目すべきは、「AI agent monitoring」のCPCが$50.04で、サジェストデータでは前年比100%増となっている点です。単なる情報収集ではなく、購入意欲のある検索者がいることを示します。

LLMツール、エージェント監視、モデル監視の検索需要からアクションファイアウォール製品へつながるクレイ風インフォグラフィック
最も強い需要が示すのは、アクションファイアウォールです。月間検索数は、LLM observability toolsが210、AI agent monitoringが90、AI model monitoringが50です。

1. AIエージェント向けアクションファイアウォール

機密性の高いツールを呼び出せるエージェントを運用する企業向けに、ポリシーと監視のレイヤーを構築します。操作全体の流れを監視して危険な挙動をスコア化し、指定した操作には承認を必須とし、インシデントの記録を残す製品です。

需要: 「AI agent monitoring」は、米国で月間90件、現在のサジェストデータでは前年比100%増、CPCは$50.04と推定されています。「LLM observability tools」は月間210件を上乗せし、CPCは$23.90、前年比24%増です。

販売可能な最小構成: メッセージとツール呼び出しを記録するSDKまたはゲートウェイ、金銭、データ転送、権限変更、削除を扱うルールエンジン、軽量な一次分類器、エスカレーション用の高性能な調査役を1つ、そしてSlackまたはPagerDutyへのアラートです。まずは非同期で始め、元に戻せない操作を短いリストに絞ってブロッキングを追加します。

注意点: 多くの開発者は、モデルプロバイダーのように非公開の活性化情報や隠れた推論を調べられません。そのため、観測可能なメッセージ、ツール呼び出し、出力、権限、結果だけでも機能する製品にする必要があります。ワークフローごとにポリシーを調整できず、誤検知が多ければ定着しません。

これは最も有望な事業機会です。検索数が実際に伸びており、調査したキーワード群ではCPCが最高で、買い手の課題が「もう1つダッシュボードが欲しい」といった好みではなく、本番環境のリスクに直結しているからです。

2. AI監視コストプランナー

エージェントのトレースを、監視費用を含む完全な予算へ変換する計算ツールを、プラットフォーム部門と財務部門向けに構築します。プロバイダーの推論、監視用の推論、オブザーバビリティ料金、ストレージ、保存期間、人によるレビューを分けて見積もります。

需要: 「Datadog LLM observability pricing」は米国で月間90件と推定され、サジェストデータでは前年比240%増、CPCは$17.18です。Datadogが公開する現在の価格基準は、月間40,000 LLMスパンまでが$0、100,000スパンまでが月額$160です。このほかに、基礎となるモデル料金と、別途必要なセキュリティ監視用コンピュートが加わります。

販売可能な最小構成: 1か月分のトークン使用量とトレースをアップロードし、監視対象の比率とエスカレーション率を選び、監視モデルを入力すると、オーバーヘッドが5%、10%、20%の場合を比較できるようにします。出力には、成功したタスク当たりのコストと、マネージドツールから内製システムへ切り替える損益分岐点を示します。

注意点: OpenAIの20%は、ひとつの社内基準であって、あらゆる環境に当てはまる比率ではありません。前提条件と信頼区間を編集できなければ、誤解を招く見積書生成ツールになってしまいます。

3. エージェント監査証跡レコーダー

規制対象または高価値のエージェントワークフロー向けに、追記専用の証跡レイヤーを構築します。アプリケーションの生ログをすべての担当者に見せることなく、何が起きたかを説明する必要があるコンプライアンス、リスク、セキュリティの各チームが買い手です。

需要: 「AI model monitoring」は米国で月間50件、KD 6と推定され、AI Overviewが表示され、ページ上部入札単価の高値は$30.33です。より広い「LLM observability tools」には、月間210件の検索があります。現在の関連検索セットには「LLM observability metrics」も含まれています。これは、証跡製品が答えるべき問いそのものです。

販売可能な最小構成: トレースイベント、ツール権限、ポリシー判断、人による承認、一時停止イベントを収集し、機密情報を伏せたうえで、簡潔なインシデント資料と定期的な統制レポートを生成します。

注意点: トレースの保存自体がプライバシー上の負債になり得ます。また、監査要件は企業や管轄地域によって異なります。グラフを増やす前に、厳格なデータ最小化と設定可能な保存期間が必要です。

20%の追加コストで保証されないこと

監視だけでエージェントが安全になるわけではありません。OpenAIも監視を、アラインメントや、ワークロード分離、ネットワーク分離、継続的テストなどのセキュリティ対策と並ぶ、ひとつのレイヤーとして明確に位置づけています。

重要な限界は5つあります。

  • 推定範囲は限定的です。 20%が当てはまるのは、OpenAIの対象ワークロード内で監視される推論コンピュートです。すべての推論や学習、顧客のAI関連支出全体に20%を掛けるものではありません。
  • 監視にも見逃しがあります。 OpenAIは、以前のコーディングエージェント監視が、把握していた従業員からのエスカレーションすべてと一致したと述べています。しかし、それだけで制約のないトラフィックにおける偽陰性率が分かるわけではありません。
  • 30分では間に合わない場合があります。 非同期アラートなら長時間の研究セッションを封じ込められる可能性はありますが、転送、削除、支払いを取り消すことはできません。元に戻せない操作には、権限チェック、分離、同期ブロッキングが引き続き必要です。
  • 参照できる推論情報には差があります。 OpenAIの方法は、内部活動と利用可能な推論内容にも一部依存します。外部モデルを使うアプリケーション開発者には、メッセージ、ツール呼び出し、出力しか見えない場合があります。
  • 完全なトレースには機密情報が含まれます。 監視では、プロンプト、データ、認証情報、ビジネスロジックを取得する可能性があります。アクセス範囲の限定、情報の伏せ字処理、保存期間の制限は、見栄えを整えるためのコンプライアンス対応ではなく、製品の必須要件です。

現実的な原則は、結果の重大性に応じて監視を強化することです。読み取り専用アシスタントには基本的なトレースを使い、ツールを持つエージェントには操作の流れを踏まえた検出を追加します。送金、データ漏えい、本番環境の破壊につながる操作には、強制的な権限境界と同期承認を設けます。

月曜日にまずやること

来週、本番稼働中のエージェントを1つ選び、そのエージェントが実行できる操作をすべて書き出します。「読み取り専用」「元に戻せる書き込み」「元に戻せない、または外部へ作用する操作」の3種類に分類してください。一連の動作全体を計測し、3番目の種類には厳格な承認ルールを設定し、それ以外には非同期監視を実行します。パイロットの基本推論予算に、監視用コンピュートとして20%の枠を追加し、2週間後に実測コストへ置き換えます。

最も大規模なオブザーバビリティ製品を買うところから始める必要はありません。まず決めるべきなのは、どの操作を止めるのか、誰を呼び出すのか、どれほど速く対応する必要があるのかです。

オブザーバビリティに最適なAIツールは何ですか?

最適な製品カテゴリは目的によって異なります。レイテンシ、トークンコスト、エラー、評価スコアにはトレースのオブザーバビリティを、ルーティングとリクエスト制御にはゲートウェイを、危険なツール操作や一連の動作全体には専用の振る舞い監視を使います。一般的なダッシュボードで、OpenAI社内の活性化レベル監視と同等になるものはありません。

DatadogのLLMオブザーバビリティとは何ですか?

Datadogの製品は、モデル呼び出しのスパンを記録し、トレース、評価、ダッシュボード、本番監視へ結びつけます。公開ページの料金は、月間40,000 LLMスパンまでが$0、100,000スパンまでが月額$160で、どちらも保存期間は15日です。

オープンソースのLLM監視ツールには何がありますか?

トレーシング、評価、ゲートウェイ、コスト追跡には、オープンソースの選択肢があります。導入形態、トレースの網羅性、評価機能、プライバシー制御、データのエクスポート機能で選んでください。オープンソースで不要になるのはライセンス料であり、ストレージ、監視用推論、運用、インシデント対応の費用は残ります。

無料で使えるLLMオブザーバビリティツールはありますか?

あります。Datadogには、月間40,000 LLMスパンまで、保存期間15日の無料枠があり、オープンソース製品はセルフホストできます。ただし、ソフトウェアが無料でも、モデル呼び出し、インフラ、ストレージ、対応スタッフの費用は必要です。

重視すべきLLMオブザーバビリティ指標は何ですか?

成功したタスク当たりのコスト、レイテンシ、エラー、評価品質、再試行、ツール呼び出し量、権限違反、エスカレーション率、アラート精度、一時停止までの時間、インシデントの重大度を追跡します。トークンコストだけでは、エージェントが正しい仕事を安全に完了したかどうかは分かりません。

実際のエージェントワークフローに合わせて監視と制御のレイヤーを構築するなら、AI本番システムからご相談ください。

最終更新

2026年9月2日

カテゴリーAI

Googleでこのサイトを優先する

omidsaffari.comをGoogle検索の優先ソースに追加

omidsaffari.comを優先ソースに設定すると、GoogleがTop Stories・AI Overviews・AI Modeであなたのために優先表示します。

ニュースレター

毎週日曜、一通の手紙。 動くシステムの話。感想戦ではなく。

AIベンチャーのポートフォリオ運営から生まれるビルドログ、稼働中のシステム、現場ノート。

週刊。スパムなし。いつでも解除できます。