LLMオブザーバビリティツールおすすめ8選【2026年】AIエージェントのトークン・コスト追跡
AIエージェントのトークン使用量とコストを追跡できるLLMオブザーバビリティツール8製品を比較。最新料金、コスト配賦、予算上限、セルフホスト、評価機能を検証し、Langfuse、Portkey、Heliconeなどをチーム規模や運用目的に合わせて選ぶポイントをわかりやすく解説します。
2026年の**AIエージェント向けLLMオブザーバビリティツール**を比較すると、総合1位は明快です。Langfuseなら、本番チームに必要なコスト配賦とユーザー数無制限を$29/monthから利用できます。Claude Codeでは新しい /usage のLoops行だけで、個人開発者には別のダッシュボードが不要になりました。追加ツールを導入すべきなのは、複数モデルをまたぐ費用配賦、強制力のある予算上限、またはトレース単位の説明責任が必要な場合です。
LLMオブザーバビリティツール8選【2026年】:早見表
多くのプロダクトチームやプラットフォームチームには、Langfuseが最もバランスのよい選択です。 $29/monthのCoreプランに、トークン・コスト追跡、ユーザー数無制限、実用的な保持期間、トレースコンテキスト、そして予算責任者にも説明しやすい料金体系がそろっています。予算の境界でリクエストを確実に止める必要があるならPortkey、インフラ運用の手間を避けることよりデータ所有権を優先するならOpenLITが有力です。
以下の料金と上限は、2026年9月1日に各ベンダーの公開ページで確認しました。「開始価格」は、小規模な本番チームが現実的に使える最初の有料プラットフォームプランを指します。特記がない限り、モデル推論料、ストレージ超過料、セルフホスト用インフラ、導入作業の人件費は別途必要です。
8製品の比較一覧
無料のダッシュボードが、そのまま無料のコントロールプレーンになるわけではありません。Claude Code、Langfuse、Braintrust、Arize、LangSmith、Datadogは支出を可視化できますが、可視化だけでは次の高額な実行を自動的に防げません。PortkeyはEnterpriseおよび一部のProプランで詳細な予算・レート制限を提供します。Heliconeは、ユーザーや任意のカスタムプロパティ単位でリクエスト数またはセント建てコストを制限できます。UIの好みより先に、この違いで候補を絞るべきです。
AIエージェント監視はトークン集計の先にある
エージェントオブザーバビリティとは、エージェントが何を行い、各ステップにいくらかかり、誰の処理として発生し、その支出に見合う結果だったかを説明できる状態です。 トークンカウンターで分かるのは、この一連の問いの一部にすぎません。エージェントはモデルを5回呼び出し、コンテキストを取得し、ツールを実行し、エラーを再試行した末に、質の低い回答を返すことがあります。財務上の問いは「トークンをいくつ使ったか」ではなく、「どの顧客ワークフローが消費し、その処理は成功したか」です。
Claude Codeによって最低ラインは上がりました。現在の/usageドキュメントでは、Sessionビューに詳細なトークン統計とローカル推定の金額が表示されます。サブスクリプションプランでは、Claude Code v2.1.242以降になると、負荷の大きい /loop またはスケジュールタスクを示すLoops行も表示され、実行回数、総トークン数、1実行あたりのトークン数、直近の実行を確認できます。個人の技術者なら、別のダッシュボードを買わなくても暴走した定期タスクを特定できます。
ただし、このローカル表示には明確な限界があります。DayとWeekは、過去24時間または7日間のローカルセッション履歴から算出する概算値です。別のデバイスやclaude.aiでの作業は含まれません。組織全体のユーザー別メトリクスをほぼリアルタイムで取得するために文書化されている方法は、OpenTelemetryを自社のオブザーバビリティ基盤へエクスポートすることです。
LLMオブザーバビリティが加えるワークフロー文脈
あるサポートエージェントが、1件のチケットに$0.18、別のチケットに$1.40を使ったとします。トークン画面を見れば高額なチケットは分かります。LLMオブザーバビリティがあれば、2件目では同じツールを4回再試行し、エスカレーション後に高性能モデルを使い、それでも最後は人へ引き継がれたことまで追えます。担当者はルーティングを変更し、予算を設定し、プロンプト単価ではなく解決済みチケット単価を測れるようになります。
役に立つ記録は、次の4層で構成されます。
- 実行: モデル呼び出しとツールを含む、エージェントの1回の完全な試行。
- 帰属: その実行を所有する顧客、ユーザー、チーム、環境、ワークフロー、機能。
- 結果: 成功、失敗、エスカレーション、レイテンシ、品質スコア、収益イベント。
- 制御: 予算超過が深刻になる前のアラートと、ワークフローを止めるべき時に実行できる上限。
安価なダッシュボードでも、結果的に高くつく理由はここにあります。毎週金曜日に2時間かけてモデルの請求書と顧客IDを突合しているなら、$29のプラットフォームでも短期間で元が取れます。一方、データを確認する担当者も単位コスト目標の責任者もいなければ、無料のオープンソース基盤でさえ運用対象を1つ増やすだけです。
LLMオブザーバビリティツールの選定基準
ここで扱うAIエージェント監視ツールは、実地トライアルの印象ではなく、各社の公開中の製品ページで料金と機能を比較しました。 8製品を選んだのは、いずれもモデル使用量を、より詳しい本番運用の記録に結び付けられるからです。プロバイダー請求額の表示だけにとどまる製品、一般的なチャットボット総額を推定するだけの製品、現時点の公開根拠なしにオブザーバビリティをうたう製品は除外しました。
エージェント監視ツールに必要な4つのテスト
順位は、次の4つの実務テストで決めました。
- コストを正確に計算できるか。 プロバイダーが報告した使用量を受け取るか、モデル名とトークン数を現行価格へ対応付けられる必要があります。非公開モデルにはカスタム価格を設定できる経路が必要です。何も知らせずに
$0.00と表示するくらいなら、「不明」と明示するほうが安全です。 - コストの帰属先を示せるか。 ユーザー、顧客、ワークフロー、モデル、環境、結果のタグがあれば、請求額を意思決定へ変えられます。所有者のない合計額では費用配賦を行えません。
- 次のリクエストを制御できるか。 アラートも一部評価しますが、実行を変えられるコスト予算、リクエスト制限、ゲートウェイポリシーをより高く評価します。
- 購入者が課金単位を理解できるか。 トレース、スパン、リクエスト、オブザベーション、スコア、処理済みGBは互換ではありません。不透明な営業見積もりより公開料金を重視します。
同点なら、トレースの文脈と評価機能で差を付けました。コスト急増の裏にある失敗したツール呼び出しまで見せるプラットフォームは、上昇線だけを描くものより有用です。特に、プロンプト、出力、顧客メタデータを別のSaaSへ送れない企業にとっては、データ所有権も重要です。
LLMオブザーバビリティはダッシュボード代に見合うか
優れたLLMオブザーバビリティツールは、毎週の意思決定を変えて初めて導入価値を得ます。プロダクト責任者が数分で答えられるべき問いは3つです。どのワークフローの単位コストが上がったのか。原因は処理量、モデル選択、再試行、長いコンテキストのどれか。次に変えるべきものは、ルーティング、プロンプト、キャッシュ、ポリシーのどれかです。
この3問に答えられないプラットフォームは、コスト管理ではなくテレメトリの保管庫です。デバッグには使えても、トークン管理の予算から買うべきとは限りません。この違いがあるため、本ランキングにはBraintrustやArizeのような評価中心の製品を含めつつ、純粋なコスト制御ではPortkeyとHeliconeを上位に置いています。
おすすめLLMオブザーバビリティツール8製品
1. Langfuse:総合力で選ぶなら最有力
総合1位はLangfuseです。Langfuseは、$29/monthという開始価格で、本番チームにコスト配賦、トレースコンテキスト、柔軟なホスティング、ユーザー数無制限を提供します。 B2B SaaSなら、生成ごとに顧客、機能、環境、リリースをタグ付けし、ダッシュボードまたはMetrics APIで完了ワークフローあたりのコストを比較できます。弱点は強制制御です。Langfuseが明記しているのはしきい値アラートであり、予算超過リクエストを拒否するにはゲートウェイかアプリケーション側のポリシーが別途必要です。端的に言えば、台帳とトレースを一体化したいならLangfuseを選び、損失リスクに見合う箇所だけ強制制御を追加するのが適切です。

Langfuseの料金では、1トレース、1オブザベーション、1スコアのいずれも1課金単位として数えます。そのため、1回の実行に複数のオブザベーションがあれば、複数単位を消費します。Cloud Hobbyは無料で、月50,000単位、データアクセス30日間、2ユーザーを含みます。Coreは100,000単位、データアクセス90日間、ユーザー数無制限で$29/monthです。追加利用は100,000単位あたり$8から始まり、ボリュームに応じて下がります。Proは100,000単位、データアクセス3年間、保持期間管理、高いレート上限、ユーザー数無制限を含み、$199/monthです。任意のTeamsアドオンは$300/monthです。Enterpriseは100,000単位込みで$2,499/month、年間ボリューム料金は個別設定です。セルフホスト版Open SourceはMITライセンスで無料、利用量は無制限です。セルフホスト版Enterpriseは個別見積もりです。
Langfuseはモデル定義からコストを推定できますが、トレースと一緒に値が送信された場合は、推定値より送信値を優先します。プロバイダーとの交渉レートや社内モデルには妥当な挙動です。コストはタグやユーザーで絞り込み、Metrics APIから財務ダッシュボードや顧客別粗利レポートへ出力できます。
最適な用途: 1席ごとの料金を負担せず、トレース単位のコスト所有者を明確にしたいプロダクト・プラットフォームチーム
注目点: ユーザー・タグフィルター、取り込んだカスタムコスト、クラウドまたはセルフホスト
料金: Hobby $0、Core $29/month、Pro $199/month、Teamsアドオン $300/month、Enterprise $2,499/month、セルフホスト版Open Source $0、セルフホスト版Enterpriseは個別見積もり
無料トライアル: 無料Hobbyプラン。期間限定トライアルは不要
- Coreはユーザー数無制限のため、利用量超過前なら10人のレビューチームでも$29/monthに収まる
- 取り込んだコスト値が推定値より優先され、カスタム料金や割引料金に対応しやすい
- Metrics APIとタグフィルターで顧客・機能・ワークフロー別の費用配賦ができる
- MIT-licensedのセルフホストにより、現実的なデータ所有の選択肢がある
- 多数のオブザベーションやスコアを含む実行は、見かけのトレース数より多くの単位を消費する
- しきい値アラートはゲートウェイの強制上限を代替しない
- 任意の$300 Teams add-onより前に、Proは$29から$199/monthへ上がる
Langfuseで実用的なコスト台帳を作る
最短の導入方法は、全社規模の計装ではなく、1つのワークフローから始めることです。
事業価値の単位を1つ決める
解決済みチケット、有望リード、受理されたコード変更、処理済み請求書など、完了した成果を1つ選びます。「エージェント実行」は、価値を生まずに失敗することもあるため、事業単位には向きません。
4つのディメンションを付ける
顧客またはアカウント、ワークフロー、環境、モデルをトレースのメタデータかタグとして送ります。さらに成功、エスカレーション、失敗、スコアなどの結果フィールドを加え、役に立った処理でコストを割れるようにします。
非公開レートは価格を明示する
対応プロバイダーにはLangfuseのモデル定義を使います。交渉済み、セルフホスト、非公開の料金であれば、使用量とコストを直接取り込み、未知のモデルが無料に見えないようにします。
しきい値アラートを1つ設定する
ワークフローの日次合計または単位コストの境界にアラートを設定します。通知先は、埋もれやすい一般チャンネルではなく、ルーティングやプロンプトを変更できる担当者にします。
支出と失敗を並べて確認する
高コストなトレースを開き、価値のある複雑さと、再試行、過剰なコンテキスト、ツール障害を切り分けます。失敗が支出の大半を占めるなら、エージェント障害分析ツールの比較で、より深いデバッグ層を選びます。
2. Portkey:ゲートウェイで予算を強制するなら最適
トークン追跡と、予算を強制できるリクエスト経路を同じ場所に置くなら、Portkeyが最適です。 プラットフォームチームはモデル通信をゲートウェイ経由にし、ユーザー、チーム、ワークフロー、機能のタグを付けて、入力トークン、出力トークン、総コスト、予算消化率を監視できます。注意点はプランとモデル対応です。コスト・トークン予算はEnterpriseおよび一部のProプランで利用でき、未対応モデルは$0.00と表示され、プロバイダー予算上限にも加算されません。独立した評価スイートより制御経路を重視するならPortkeyを選びます。

Portkeyの公開料金は、リクエスト上限なし・プラン料金なしと明記されたOpen Sourceのセルフホスト型ゲートウェイから始まります。Developerは無期限無料で、月10,000件の記録ログ、ログ保持3日間、メトリクス保持30日間が含まれます。上限後もリクエスト自体は続きますが、超過分のログは記録されません。つまり、トラフィックが増えたまさにその時に証跡が欠けます。
Productionは100,000件の記録ログ、ログ保持30日間、メトリクス保持90日間、アラート、RBAC、サービスアカウントキーを含み、$49/monthです。300万件までは、追加100,000リクエストごとに$9かかります。Enterpriseは個別見積もりで、月1,000万件超の記録ログから始まり、詳細な予算・レート制限、カスタム保持期間、プライベートデプロイ、データエクスポート、エンタープライズサポートが加わります。
購入前に確認すべきなのは、未対応モデルの扱いです。非公開ファインチューニングモデルや登場直後のモデルは、予算を信頼する前に価格を明示的に定義する必要があります。定義しなければ、ダッシュボードが平穏に見える一方で、プロバイダー請求だけが増える可能性があります。
最適な用途: 1つのゲートウェイ経路でコスト配賦と強制制御を行いたいチーム
注目点: メタデータによる費用配賦と、対象プランでの詳細な予算・レート制限
料金: Open Sourceは明記されたプラン料金$0、Developer $0、Production $49/month(300万件まで追加100,000リクエストごとに$9)、Enterpriseは個別見積もり
無料トライアル: 無料Developerプラン。確定済みの料金ページにはProductionの期間限定トライアル記載なし
- ゲートウェイ配置により、測定をルーティングや強制制御へつなげられる
- ユーザー、チーム、ワークフロー、機能ごとのコスト表示をメタデータが支える
- Productionは$49/monthでアラート、RBAC、サービスアカウントキーを含む
- セルフホスト版Open Sourceには明記されたリクエスト上限がない
- Developerは10,000を超えてもリクエストを通し続け、超過ログだけが記録されなくなる
- 未対応モデルは$0.00と表示され、プロバイダー予算上限にも加算されない
- 詳細な予算機能にはEnterpriseまたは対象となる一部Proプランが必要
3. Helicone:プロキシ経由ですぐにコスト制御
ゲートウェイやプロキシにモデル通信を通せるチームなら、Heliconeは、生のモデルリクエストからコスト制御までを最短でつなげられます。 複数のモデル機能を持つプロダクトでは、ユーザー、機能、環境、ワークフローをカスタムプロパティとして付与し、複数呼び出しをセッションにまとめ、同じ境界でリクエスト数またはセント建てコストを制限できます。注意点は、統合方法によって精度が異なることです。Heliconeは、ゲートウェイ経由の計算はModel Registryに基づき正確と説明する一方、プロバイダーへ直接つなぐ経路では300を超えるモデルを収録したベストエフォートの価格リポジトリを使います。高度な評価やインフラ相関より、コストベースのレート制限へ素早く到達したいならHeliconeが向いています。

Heliconeの料金は、$0のHobbyから始まります。内容は月10,000リクエスト、ストレージ1 GB、1席、1組織、保持期間7日間です。Proは$79/monthで、席数無制限、1組織、アラート、レポート、HQL、保持期間1カ月を含み、付属の10,000リクエストと1 GBを超えると従量料金が発生します。Teamは$799/monthで、5組織、保持期間3カ月、SOC 2とHIPAA対応、専用Slackチャンネルが含まれます。ProとTeamには、それぞれ7日間のトライアルがあります。Enterpriseは個別見積もりで、組織数無制限、無期限保持、SAML SSO、オンプレミスデプロイ、クラウドの一括割引、最大毎分30,000ログの取り込みを提供します。
Heliconeのレート制限は、全体、ユーザー別、カスタムプロパティ別に設定できます。制限対象はリクエスト数またはセント建てコストです。トークンベースのレート制限は現在もcoming soonとされているため、文字どおりのトークン上限が必要な購入者は、コスト上限を同じ機能だと考えるべきではありません。
最適な用途: プロキシを素早く組み込み、コストベースでリクエストを制御したいSaaSチーム
注目点: セッションとカスタムプロパティにより、複数呼び出しのワークフローをユーザー・機能別の採算へ結び付けられる
料金: Hobby $0、Pro $79/month+従量料金、Team $799/month+従量料金、Enterpriseは個別見積もり
無料トライアル: ProとTeamは7日間。Hobbyは無料
- コスト制限をアカウント全体だけでなく、ユーザーまたはカスタムプロパティ単位で適用できる
- Proはunlimited seatsで、エンジニアが増えても共同作業の席料金が発生しない
- Sessionsで複数の呼び出しを1つのワークフロー表示にまとめられる
- Enterpriseではon-premises deploymentを選べる
- 直接統合の価格精度はベストエフォートで、ゲートウェイに示された基準とは異なる
- トークンベースのレート制限はまだ利用できない
- Teamは$799/monthへ大きく上がり、5 organizationsとコンプライアンス支援が必要でない場合は割高
4. OpenLIT:コーディングエージェントをセルフホストで追跡
コーディングエージェントのセッション、トークンコスト、リポジトリ上の動きをOpenTelemetryネイティブな基盤で管理するなら、OpenLITが最適なセルフホスト候補です。 すでにClickHouseとOpenTelemetry Collectorを運用している企業なら、プロンプト、トレース、履歴を自社環境内に保ちながら、コーディングエージェントとモデル呼び出しをまとめて計装できます。負担になるのは運用責任です。$0のライセンスでも、デプロイ、アップグレード、ストレージ、バックアップ、アクセス制御はエンジニアリング予算から出ます。テレメトリを自社環境に置くことが「好み」ではなく「要件」ならOpenLITを選びます。

OpenLITの料金では、Apache 2.0 Open Sourceプランが$0です。セルフホストでの利用量、ユーザー数、プロジェクト数、環境数、履歴データはいずれも無制限です。Cloudは「近日提供予定」と表示され、価格は公開されていません。オープンソースパッケージには、OpenTelemetryネイティブのトレーシング、コーディングエージェントのセッション・コスト・トークン・リポジトリアクティビティ追跡、カスタムダッシュボードが含まれます。
OpenLITには更新可能なデフォルト料金ファイルがあり、非公開、ファインチューニング済み、未対応モデルにはカスタム料金JSONを指定できます。セルフホスト型プラットフォームはSaaSのカタログにないモデルと組み合わせることが多いため、この明示的な上書きは重要です。ただし、計画上のコストはゼロではありません。データベースストレージ、Collectorの容量、アップグレード、インシデント対応、担当者の費用をライセンス代に加える必要があります。
最適な用途: 厳格なデータ所有要件またはコーディングエージェントのテレメトリ需要があり、インフラを運用できるチーム
注目点: Apache 2.0、OpenTelemetryネイティブな追跡、カスタムモデル料金
料金: Open Sourceは$0ライセンスでセルフホスト利用無制限、Cloudは近日提供予定で価格未公開
無料トライアル: Open Sourceはトライアル不要。Cloudは料金を確認できる状態ではない
- オープンソースプランでは、セルフホストのユーザー数、プロジェクト数、環境数、履歴が無制限
- コーディングエージェントのセッションから、トークンコストとリポジトリアクティビティを結び付けられる
- カスタム料金JSONにより、非公開モデルがコストゼロに見える問題を防げる
- OpenTelemetryにより、既存のテレメトリアーキテクチャへデータを移しやすい
- OpenLIT、ClickHouse、OpenTelemetry Collectorを購入者側で運用する
- Cloudはまだ購入可能な近道になっていない
- オンコールとアップグレードの工数を含めると、$0ライセンスでもSaaSより高くなる場合がある
5. Braintrust:コストと品質を一緒に判断する評価基盤
モデル支出をスコア、エラー、プロダクト品質へ結び付ける必要があるなら、BraintrustはAIオブザーバビリティ兼評価プラットフォームとして最も強力です。 サポート自動化チームなら、プロンプト、completion、cache-read、cache-creation、total tokensを、推定コスト、ツール呼び出し、エラー、レイテンシと並べて集計し、SQLでユーザー別またはモデル別に分析できます。限界は強制制御です。BraintrustはStarterとPro向けにカスタム月次支出アラートを明記していますが、支出の強制上限は明記していません。安価なモデルへ切り替えてよいかを、評価済み出力の品質と一緒に判断するならBraintrustが適しています。

Braintrustの料金では、Starterは$0/monthで、$10のモデルクレジット(以降はトークン料金)、処理データ1 GB(以降は1 GBあたり$4)、10,000スコア(以降は1,000件あたり$2.50)、保持期間14日間、ユーザー数無制限が含まれます。Proは$249/monthで、$100のモデルクレジット(以降はトークン料金)、処理データ5 GB(以降は1 GBあたり$3)、50,000スコア(以降は1,000件あたり$1.50)、保持期間30日間を含みます。Proの延長保持は毎月1 GBあたり$0.50です。Enterpriseは個別見積もりで、カスタム保持期間とエクスポート、RBAC、プレミアムサポート、ホステッドまたはオンプレミスデプロイを提供します。
複数の課金メーターには、それぞれ意味があります。処理データはトレース量、スコアは評価アクティビティ、モデルトークンは推論に対する料金です。プロンプトのバージョンを比較するチームは、$249のプラットフォーム料金だけを総額と見なさず、3つすべてをモデル化する必要があります。
最適な用途: モデルコストを下げても評価済み品質を維持できるか判断したいプロダクトチーム
注目点: トークン・コスト集計と、スコア、エラー、ツール呼び出し、SQL分析を同じ場所で扱える
料金: Starter $0+従量料金、Pro $249/month+従量料金、延長保持 $0.50/GB/month、Enterpriseは個別見積もり
無料トライアル: モデルクレジットと利用枠を含む無料Starterプラン
- コスト、キャッシュ使用、ツール呼び出し、エラー、レイテンシ、評価スコアを同じトレースモデルで扱える
- SQLでユーザー別またはモデル別の帰属分析ができる
- StarterとProはunlimited usersで、席数を決める必要がない
- Enterpriseはhostedとon-premisesの両方に対応し、厳しいデプロイ要件も満たせる
- 支出アラートはリクエストを止めない
- 処理データ、スコア、モデル使用量、保持期間という複数の従量メーターがある
- 評価作業を伴わないコスト追跡だけでは、Proの$249 baseを正当化しにくい
6. Arize AX and Phoenix:OpenTelemetryと評価を両立
Arize AX and Phoenixは、最初からゲートウェイに固定せず、OpenTelemetry準拠のトレース、トークン・コスト追跡、評価を導入したいチームに適しています。 Arize AXはマネージド製品、Phoenixはオープンソースでローカルファーストのトレーシング・評価手段です。プラットフォーム担当者は開発時にPhoenixから始め、マネージドな保持、取り込み、共同運用が必要になった時にAXを使えます。限界は制御の配置です。この組み合わせは実行を説明・評価できますが、強制予算で処理を止めるには、リクエスト経路にゲートウェイまたはアプリケーションポリシーが別途必要です。ネイティブな支出強制より、オープンテレメトリと評価の深さを優先するならArizeを選びます。

Arizeの料金では、AX Freeは$0で、月25,000トレーススパン、取り込み1 GB、保持期間15日間、ユーザー数無制限、評価数無制限を含みます。AX Proは$50/monthで、50,000スパン、取り込み10 GB、保持期間30日間、ユーザー数無制限、評価数無制限です。Enterpriseは個別見積もりで、スパン数、取り込み量、保持期間を個別設定でき、SaaSまたはセルフホストを選べます。Phoenixはオープンソースかつローカルファーストです。
注目すべき課金単位は、最上位のトレースではなくスパンです。モデル呼び出しやツールが多いエージェント実行は多数のスパンを出すため、50,000スパンの利用枠で処理できるエンドユーザーのジョブは50,000件を大きく下回る場合があります。請求額を予測する前に、代表的なワークフローを1つ計装し、スパン数の中央値を数えるべきです。
最適な用途: OpenTelemetryを標準化し、マネージドまたはローカルファーストの評価を必要とするチーム
注目点: AXのユーザー・評価数無制限と、オープンソースのPhoenixという選択肢
料金: AX Free $0、AX Pro $50/month、AX Enterpriseは個別見積もり、Phoenixはオープンソース
無料トライアル: 無料AXプランとオープンソースPhoenix
- OpenTelemetry準拠のトレーシングにより、計装のロックインを抑えられる
- FreeとProはusersとevaluationsがunlimited
- Phoenixにより、開発者はローカルファーストのオープンソース環境から始められる
- AXは評価データと並べてtokens、latency、costを追跡する
- スパン数はエンドユーザーワークフロー数よりはるかに速く増えることがある
- マネージド環境の保持期間はFreeが15日間、Proが30日間
- 予算でリクエストを止めるには別の制御層が必要
7. LangSmith:LangChain中心の改善ループに最適
チームがすでにLangChainを使い、オブザーバビリティを継続的な評価・改善ループにつなげるなら、LangSmithが適切なトークン追跡ツールです。 モデル名とトークン数を料金へ対応付け、カスタムモデル料金も登録できます。また、保持期間14日のベーストレースと、保持期間400日の延長トレースを区別します。弱点は席料金です。Plusは1席あたり$39/monthなので、10人のチームは追加トレース利用料より前に$390/monthを支払います。最安の共有コストダッシュボードではなく、LangChain中心の統合トレーシングと評価を求める場合にLangSmithを選びます。

LangSmithの料金では、Developerは1席あたり$0/monthで、1席と月5,000ベーストレースを含み、以降は従量課金です。Plusは1席あたり$39/monthで、組織全体に毎月10,000ベーストレースが付属し、席の追加と枠超過後の従量利用が可能です。Enterpriseは個別見積もりで、セルフホストとハイブリッド、カスタムSSO、ABAC、RBAC、ワークスペース、席、サポートSLAが加わります。
追加のベーストレースは、1件あたり0.005 LangSmith使用単位、つまりLSUです。1 LSUは$1.00、1 LangChain使用単位、つまりLCUは$1.50です。この独自の単位体系も、LangSmithをリクエスト単位やスパン単位の製品と比較する前に、実際のワークフローをモデル化すべき理由です。
最適な用途: トレース確認と評価を通常のプロダクト開発に組み込んでいるLangChainチーム
注目点: LangSmithの幅広い改善ループ内で、モデルコスト対応表とカスタム料金を利用できる
料金: Developerは1席$0、Plus $39/seat/month、Enterpriseは個別見積もり、追加ベーストレースは1件0.005 LSU(1 LSUは$1、1 LCUは$1.50)
無料トライアル: 無料Developerプラン。確定済みの料金ページにはPlusの期間限定トライアル記載なし
- 成熟したトレーシング・評価ワークフローの中でコストを追跡できる
- カスタムモデル料金により、非公開または交渉済みの推論料金を扱える
- 延長トレースは400日間保持できる
- Enterpriseはセルフホストとハイブリッドデプロイを提供する
- 複数の競合がユーザー数無制限なのに対し、Plusは席単位で課金される
- Plusを10 seats契約すると、追加利用料より前に年$4,680かかる
- ベーストレースと延長トレースで保持期間と料金構造が異なる
8. Datadog Agent Observability:Datadog運用中のチームに最適
Datadog Agent Observabilityが最も力を発揮するのは、エージェントのコストを、すでにDatadogにあるアプリケーション、インフラ、ユーザーセッションのテレメトリと関連付けたい場合です。 800を超えるテキストモデルについて、トークン数からリクエストコストを自動推定し、非公開・未対応モデルには手動コストを渡せます。弱点はゼロから導入する場合の料金です。Proは年契約で$160/monthから始まります。このプレミアムが回収できるのは、システム横断の相関分析によって手作業のインシデント調査が減る時であり、個人開発者がトークングラフだけを求める時ではありません。エージェントが単独の実験ではなく、既存の本番システムの一部ならDatadogを選びます。

Datadog Agent Observabilityの料金では、Freeは$0で、月最大40,000 LLMスパン、トレース保持15日間、コンテキストと評価数無制限、全機能へのアクセスを含みます。Proは月100,000 LLMスパンを含み、年契約なら$160/month、月契約なら$200、オンデマンドなら$240です。追加スパン10,000件ごとの料金は、年契約で$3.50、月契約で$4.20、オンデマンドで$5です。
デフォルトのトレース保持期間は15日間です。月10,000 LLMスパンごとの保持期間アドオンは、30日が$1.50、60日が$3、90日が$4です。月間100万LLMスパンを年契約料金で使うと、保持期間アドオンより前にProは$475/monthになります。内訳は$160の基本料金に、$3.50の超過ブロックを90個加えた額です。
最適な用途: サービス、インフラ、セッション、エージェントの調査をすでにDatadogから始めている運用チーム
注目点: エージェントトレースを、本番環境のその他のテレメトリ全体と関連付けられる
料金: Free $0、Proは年契約$160/month・月契約$200・オンデマンド$240、超過料金と保持期間アドオンは別途
無料トライアル: 利用枠内で全機能を使える無料プラン
- 800を超えるテキストモデルを対象にコストを自動推定する
- 手動コストにより、非公開・未対応モデルも扱える
- 既存のDatadogユーザーは、エージェントの挙動とサービス・インフラのインシデントを結び付けられる
- Freeは40,000 LLMスパンと全機能へのアクセスを含む
- Proの基本料金は、このランキング上位にあるコスト重視SaaSの中で最も高い
- 多段階のエージェントは、1ユーザーワークフローで多数のスパンを消費することがある
- 保持期間を延ばすと、スパン単位の料金がさらに加わる
LLM監視ツールは目的別にこう選ぶ
判断の順番は、強制制御、ホスティング、評価、最後に価格です。 まず、支出が増えた時にシステムへ何をさせる必要があるかを決めます。トラフィックをブロック、迂回、減速させる必要があるならPortkeyかHeliconeを候補にし、必要な予算制御が購入予定プランに含まれるか確認します。通知して原因を説明できればよいなら、選択肢は広がります。
AIエージェント監視ツールの選択ルール
モデルを問わない汎用コスト台帳、トレースコンテキスト、低い共同利用コストを求めるならLangfuseです。トレースを自社環境外へ出せず、支えるインフラをすでに運用しているならOpenLITを選びます。コスト変更のたびに出力品質を評価する必要があるならBraintrustまたはArizeです。席料金の回避よりLangChainとの統合に価値があるならLangSmith、インシデント調査をすでにDatadogから始めているならDatadogが合います。

LLMオブザーバビリティツールが必要になる境目
LLMオブザーバビリティツールを購入する価値が生まれるのは、2人目の責任者が同じ証拠を必要とした時です。たとえば、モデルコストを顧客へ配賦する財務担当、ローカルデータを求めるセキュリティ担当、失敗した自動化を説明するサポート担当、成果1件あたりのコストを比較するプロダクト担当です。それまでは、内蔵の使用量表示で足りる場合があります。
導入の境目は具体的です。
- 開発者1人、デバイス1台、モデルワークフロー1つ: Claude Code
/usageとプロバイダー請求を使い続ける。 - 複数の開発者またはデバイス: OpenTelemetryをエクスポートするか、共有プラットフォームを導入する。
- 複数の顧客またはプロダクト機能: メタデータによるコスト配賦を必須にする。
- 暴走ループが重大な損失を生む: ゲートウェイで強制できる予算を必須にする。
- 安価なモデルで品質が下がる可能性がある: ルーティング変更前に評価を追加する。
- プロンプトデータを環境外へ出せない: OpenLIT、Langfuseのセルフホスト、Phoenix、またはEnterpriseのセルフホストプランを比較する。
ここでゲートウェイの役割も明確になります。ゲートウェイはリクエスト経路を制御し、オブザーバビリティ製品は経路の通過後と経路横断で何が起きたかを説明します。ルーティング、フェイルオーバー、ポリシーを一体化する必要が出たら、次はマネージドエージェントゲートウェイ比較で判断できます。
生成AIコスト管理:ダッシュボードが回収すべき金額
トークンダッシュボードは、無駄の防止または照合作業の削減によって、プラットフォーム料金の全額を回収できるべきです。 諸経費込みのエンジニア人件費を1時間$100とする明示的な計画仮定では、Langfuse Coreの月額$29は17.4分に相当します。Portkey Productionの$49は29.4分、Arize AX Proの$50は30分、Helicone Proの$79は47.4分、Datadog Proの年契約$160は96分、Braintrust Proの$249は149.4分、LangSmith Plusを10席契約した$390は234分です。
これは損益分岐を考えるための線であり、節約を保証する数字ではありません。資金調達済みの創業者なら、どの定期作業が消えるのかを問うべきです。「毎月3時間、誰かがプロバイダーのCSVと顧客データを手作業で結合する」なら、ほぼすべての有料候補が基準を超えます。「グラフがきれいになる」だけなら、どれも超えません。

年間基本料金にすると、共同利用の価格差が見えます。Langfuse Coreは$348、Portkey Productionは$588、Arize AX Proは$600、Helicone Proは$948、年契約のDatadog Proは$1,920、Braintrust Proは$2,988、LangSmith Plus 10席は$4,680です。OpenLITのライセンスは$0ですが、インフラとエンジニアリング工数は価格に含まれていません。
ただし、これを誤った単価競争にしてはいけません。Langfuseはトレース、オブザベーション、スコア、Portkeyは記録リクエスト、DatadogはLLMスパンを課金単位にします。Braintrustはモデル利用に加えて処理データとスコア、LangSmithは独自の使用単位を通じたトレースで課金します。1つの顧客ワークフローが、1リクエスト、複数の生成、数十のスパン、複数のスコアを生むこともあります。
正しい予測には、代表的なワークフローを使います。
- モデル呼び出し、トレース、オブザベーション、スパン、スコアの中央値を数えます。
- 毎月の成功実行数と失敗実行数を掛けます。
- 保持期間、席数、処理データ、モデル推論料を加えます。
- 壊れたツールは価値を増やさずコストだけを倍増させるため、再試行シナリオを加えます。
- エージェント実行数ではなく、成功した事業成果で総額を割ります。
最後に得られる数値が運用指標です。解決済みチケット、受理されたコード変更、処理済み保険請求、有望リード1件あたりのコストなら、プロンプトやモデルをまたいで比較できます。総トークン数では比較できません。
LLMコスト管理では避けたい選択
予算課題と関係の薄い機能を強みにする広範なオブザーバビリティ製品は、購入を避けるべきです。 製品選定を誤ると、測定項目は増えても制御力は下がります。
- チームの費用配賦にClaude Code
/usageだけを使う: 1人の開発者と1台のローカル履歴には便利ですが、別のデバイスやclaude.aiは含みません。単独では顧客別の共有コスト台帳になりません。 - 今日が調達期限なのにOpenLIT Cloudを選ぶ: 料金ページは現在もcoming soonで、価格は公開されていません。担当者を置ける場合に限って、オープンソース経路を使います。
- コスト共有だけのためにLangSmith Plusを契約する: 10 seatsで追加トレース前に年$4,680です。LangChainのトレーシング・評価ループに価値がある時に支払うべきで、Langfuse Coreが年$348で共有できる合計値のためではありません。
- 通知だけの監視にBraintrust Proを使う: scoresとexperimentsがモデル選択を導くなら$249/monthに意味があります。要件が支出通知だけなら、正当化は難しくなります。
- ゼロから作る個人エージェントにDatadog Proを使う: 年契約の$160/monthは、本番環境を横断した有用な相関分析を買う料金です。その責任者ができるまでは、ローカルの
/usage表示または無料プランから始めるほうが適切です。 - 未知のモデル料金でゲートウェイ予算を使う: Portkeyは、未対応モデルが$0.00と表示され、プロバイダー予算にも加算されないと明記しています。上限を信頼する前に、非公開モデルと新モデルの料金を定義します。
このカテゴリーで最も危険なのは、特定のベンダーではありません。モデル対応の不足や欠落した実行があるのに、精密そうなコストを表示するダッシュボードです。不明コストが見える状態を必須とし、プロバイダー請求と照合し、予算を任せる前に制御されたリクエストで上限をテストします。
月曜日に始めること:高コストなワークフローを1つ計装する
月曜日には、予想外の請求を最も生みそうなワークフローを1つだけ計装します。 すべてのモデル呼び出しから始めてはいけません。再試行やコンテキスト量にすでに不安がある定期コーディングループ、サポートのエスカレーション、リサーチエージェント、文書パイプラインのいずれかを選びます。
各実行に、顧客またはアカウント、ワークフロー、環境、結果という4 fieldsを付けます。モデルとリリースもディメンションとして追加します。調査に値する単位コストへアラートを設定します。暴走した実行が重大な損失を生むなら、ゲートウェイにコストまたはリクエスト上限を置き、有効化前にフォールバック動作を定義します。
金曜日には3 groupsを確認します。中央値に近い成功実行、最も高額な成功実行、高額な失敗です。この比較で、必要な複雑さと無駄を切り分けられます。高性能モデルは高くても、再試行や人へのエスカレーションを防ぐなら有利です。安価なモデルでも、トレースと失敗対応が長くなれば不利です。
導入テストには、毎週1つの意思決定を使います。ルーティングルールを変える、コンテキストを短くする、ツールの再試行を直す、カスタム料金を更新する、あるいはダッシュボードを解約します。4 reviewsを経ても意思決定を1つも生まない測定システムは、展開範囲を広げる価値を証明できていません。
よくある質問
2026年、最も優れたAIエージェントは?
あらゆる業務で最良になるAIエージェントはありません。コスト制御で重要なのは、すでに本番稼働しているエージェントを囲むオブザーバビリティ層です。幅広いコスト配賦にはLangfuse、強制制御にはPortkeyまたはHelicone、価格と品質を並べて判断するなら評価中心のツールを使います。
2026年に学ぶべきAIツールは?
運用する技術スタックに合うツールを学びます。Claude Codeを1人で使うなら、まず /usage とOpenTelemetryを理解すべきです。プロダクトチームはメタデータ付きトレーシングと単位コスト分析を学びます。モデルルーティングを担うプラットフォームチームは、ゲートウェイ予算とフォールバックポリシーを学びます。
代表的なAIエージェントツールは?
エージェントの実行基盤と、それを監視するツールは分けて考えます。本ランキングが対象にするのは、トークン、コスト、トレース、制御のためのLangfuse、Portkey、Helicone、OpenLIT、Braintrust、Arize AX and Phoenix、LangSmith、Datadog Agent Observabilityです。実際の事業タスクを実行するエージェントのランキングではありません。
2026年、世界で最も優れたAIアプリは?
仕事、ワークフロー、データ境界、予算によって価値が決まるため、普遍的な1位を合理的に選ぶことはできません。AIエージェントのトークン追跡では、この比較の総合1位はLangfuseですが、強制可能な予算が最優先要件ならPortkeyが上回ります。
ChatGPTより優れたAIは?
モデルの好みだけではコストを帰属できません。本番エージェントはOpenAI、Anthropic、Google、オープンモデル、または複数のプロバイダーを1つのワークフローで使う場合があります。追跡層は、その選択をまたいで顧客、ワークフロー、結果、コストの証拠を保持すべきです。
2026年で最も高度なAIは?
能力は変化が速く、恒久的な答えを1つに固定できません。オブザーバビリティ製品はモデルに依存せず、カスタム料金を受け入れ、基盤モデルが変わっても過去のコストと結果を比較できるものを選ぶべきです。
Elon Muskが使っているAIは?
著名人が選んだモデルは、トークン追跡の有用な判断基準ではありません。自社ワークフローが呼び出すモデル、予算責任者が必要とするメタデータ、守るべきデータ境界、上限を強制する必要性で基盤を選びます。
最も強力なAIツールは?
このカテゴリーでいう強さは、支出をワークフローへ結び付け、次の動作を変えられることです。帰属先のない詳細なトレースは不完全です。損失を封じ込める必要があるのに強制できない正確なアラートも不完全です。必要な境界を、使わない機能まで増やさず満たすツールが最も強力です。
2026年はClaudeとChatGPTのどちらがよい?
必要なタスク品質、レイテンシ、コンテキスト、商用条件に合わせてClaudeかChatGPTを選びます。追跡層は別に選び、モデルを変更するたび台帳を作り直さず、組織がモデル横断で成功成果あたりのコストを比較できるようにします。
ダッシュボードを増やす前にワークフローを監査する
追跡ツールは最初ではなく最後のステップです。AI Business Workflow Audit Checklistを無料で入手し、別のプラットフォームを予算に加える前に、ワークフロー、責任者、成果、制御点を特定してください。
2026年9月2日







