LangSmith料金を比較:チーム規模で選ぶLLM可観測性ツール6選【2026年】
LangSmith料金を軸に、Langfuse、Helicone、Arize Phoenix、Braintrust、Datadogを比較します。月100,000回の実行を同じ条件で試算し、チーム人数、課金単位、保持期間、セルフホストのライセンス、OpenTelemetry対応から本番運用に合うツールを選びます。

トレーシングと評価を備えるLangfuseは、小規模な本番運用チームが最初に検討したいツールです。以下で試算する月100,000回の実行では、Coreの料金は月額$69.80です。モデルと評価処理の計算費用は別途かかります。LangSmith料金も含め、LLM可観測性ツールの選択は、評価を軸にしたリリース判断、ゲートウェイ、プライベートホスティング、既存のDatadog環境での障害調査のどれが必要かによって変わります。
LLM可観測性ツールは、用途別にどう選べばよいですか?
本番のダッシュボードを共有したいならLangfuse、LangChainを中心に改善を回すならLangSmith、ゲートウェイでリクエストを監視するならHelicone、自社でプライベート環境を運用するならArize Phoenix、評価結果をリリース判断につなげるならBraintrust、アプリケーション全体にまたがる本番障害を調べるならDatadog Agent Observabilityが出発点になります。 障害の記録を確認する人それぞれに料金がかかる製品では、チームの人数が特に効いてきます。
トレースは、アプリケーションの一回の実行を記録したものです。スパンは、その中にあるモデル呼び出し、検索、ツール実行などの個々の処理を表します。評価はevalとも呼ばれ、結果がルールや品質基準を満たしたかを確かめます。誤った操作をした後で、もっともらしい回答を返したエージェントを説明するには、この三つが必要です。
料金は2026年10月5日に、各ベンダーの公開料金ページで確認しています。 金額はUSDです。明記した場合を除き、開始価格に追加の従量料金やモデルプロバイダーの料金は含みません。この比較は公開料金とドキュメントに基づいており、実機検証による性能順位ではありません。
出典:Langfuseの料金、LangSmithの料金、Heliconeの料金、Arizeの料金、Braintrustの料金、Datadogの料金。
比較で重要なのは、基本料金に「何の従量料金」が加わるかです。アプリケーションのトレース単位で課金する製品と、モデル呼び出し、観測イベント、スコア、GB単位で課金する製品では、同じ処理でも課金対象の量が変わります。プランを比べる前に、自社のアプリケーションがどのような記録を出すかを見積もってください。
LangSmith料金はいくら?月100,000回の実行で六ツールを比較します
以下の条件では、同じエージェントを運用する五人のチームでも、Langfuseは$69.80、LangSmithは$645の月額料金になります。 この金額は品質の評価ではありません。イベントの数え方、含まれる利用枠、シート料金の違いから生じる差です。
試算では、本番ワークロードを次のように置きます。
- エージェントの完全な実行が月100,000回。一回の実行につき一つのトレースを記録します。
- 一回の実行で五つの処理を観測。ルートのワークフロー、二回のモデル呼び出し、一回の検索、一回のツール呼び出しです。
- 合計で200,000回のモデル呼び出しと500,000件の観測対象処理が発生します。
- 外部で計算したコード評価のスコアが10,000件。サンプリングした実行ごとに一つ付けます。追加のモデル呼び出しや評価器のトレースは、この試算に含めません。
- ダッシュボードにアクセスするユーザーは五人です。
- Braintrustで処理するデータは5 GB。これとは別に、Heliconeの課金対象ストレージを5 GBとします。各社のバイト単位の計測は互換ではないため、独立した前提です。
問い合わせを読み、注文を検索し、注文管理ツールを呼び出し、最後の回答をモデルに作らせるサポートエージェントに近い構成です。これらの数値は予算計算の前提であり、稼働中のアプリケーションから測定したものではありません。リトライ、分岐、プラットフォーム内での評価器実行がある場合は、出力される記録が変わります。

上記は、先ほどのリンク先にある各社の公開料金から計算しています。LangSmithは、現在の料金ツールチップにあるベーストレース一件あたり$0.005と、組織全体で10,000件のトレースを含む枠を使いました。Heliconeを範囲で示したのは、同社ページ内に不一致があるためです。プラン表では1 GBが無料ですが、計算ツールは最初のGBからストレージ料金を計上します。Phoenixにライセンスベースの従量料金はなく、運用インフラの費用は実際の構成と規模に応じて算出する必要があります。
これらの合計を、長いトレースを持つあらゆるエージェントの見積もりとして使わないでください。モデル呼び出しが二回から反復的な推論ループに増えれば、DatadogとHeliconeで計上されるモデル処理も増えます。観測イベントや保存するスコアを加えれば、Langfuseのユニットが増えます。トレース数が同じでも、大きな文書を送ればBraintrustの処理バイト数が増えます。プロバイダーへの支出を顧客や機能に配賦する方法は、エージェントのトークン追跡ツール比較で詳しく扱っています。
どの基準で六つのツールを選んだのですか?
小規模な本番運用チームが導入理由を説明しやすい製品から、特定の運用モデルで価値を発揮する製品へ、順に紹介します。 開発者とAI責任者のチームには、誤った結果の原因調査、顧客別コストの把握、失敗をリリース前のチェックに変える作業が必要です。その一つだけを担う製品でも、専門ツールとして適した選択になり得ます。
おすすめを判断する基準は五つです。
- 課金対象が理解できること。 トレース、処理、人、スコア、データ量のどれで料金が増えるかを、無料枠と次の上限まで含めて把握できることです。
- 本番の記録が調査に役立つこと。 失敗した回答を、その原因となったモデル、検索、ツールの処理に結びつけられることです。
- 改善のワークフローがあること。 記録が孤立したログにとどまらず、評価、データセット、実験、レビュー判断に使えることです。
- 運用範囲が明確であること。 無料のセルフホスト、商用のエンタープライズライセンス、顧客が管理するデータプレーンを区別していることです。
- 計装方法が文書化されていること。 OpenTelemetryへの対応は、ベンダーの現行の連携手順を基に評価します。記載がある場合は、プロトコルとフィールドのマッピングも確認します。
六つに絞ったのは、それぞれが異なる選択肢を代表するためです。汎用的なトレーシング、フレームワーク中心の開発、ゲートウェイ、ローカル利用を基本にするプライベート基盤、評価、運用スイートをカバーします。この予算と担当範囲の判断において、製品数を増やしても判断が良くなるとは限りません。取り込み速度、画面の使いやすさ、稼働率、評価精度の実測値を比較したものではありません。
「無料」は、使える利用枠として評価します。請求がずっとゼロになるという意味ではありません。Braintrust StarterやLangSmith Developerでも従量料金が発生します。Phoenixはライセンス料がゼロでも、データベースの保守やオンコール対応には無視できない負担があります。適切な無料枠とは、終えたい実験の条件に合う枠です。
本番運用との相性で見る六つのツール
1. Langfuse:小規模な本番運用チームの第一候補
LangfuseのCoreでは、シート料金なしで、トレーシングの共有、トークンとコストの追跡、プロンプト管理、評価を利用できます。 SaaSのサポートアシスタントなら、モデル呼び出しに顧客、ワークフロー、リリースを紐づけ、費用のかかった失敗と成功した実行を並べて確認できます。予算上の主な制約は保存する記録の数です。エージェントの一回の実行から、トレース、複数の観測イベント、スコアが作られます。トレースとコストを一緒に見たいチームや、将来のセルフホストも視野に入れるチームに向いています。

向いているチーム: 開発者とAI責任者が同じ本番実行を確認する、小規模または成長中のプロダクトチーム
特徴: Coreのユーザー数無制限、トレース単位でのコスト確認、MITライセンスのセルフホスト用コア
料金: Coreは月額$29から。有料Cloudプランにはユニット単位の従量料金が加わります
無料利用: Hobbyはクレジットカード不要の無料プランです。期間限定のトライアルではなく、継続的な利用枠があります
現行プランの違いと、選択を変える上限
公開料金ページによると、Hobbyは$0で、月50,000ユニット、ユーザー二人、30日間のデータアクセスを含みます。Coreは月額$29で、100,000ユニット、ユーザー数無制限、90日間のデータアクセスです。Proは月額$199で、含まれるユニット数は同じですが、三年間のデータアクセス、保持期間管理、より高いレート上限が付きます。Proの任意のTeamsアドオンは月額$300で、エンタープライズSSO、その利用の強制、より細かなアクセス制御を追加します。Enterpriseは月額$2,499で、100,000ユニット、監査ログ、SCIM、契約上のサービス保証を含みます。年間契約では、個別のボリューム料金が設定される場合があります。
有料Cloudの従量料金は段階制です。100,000から100万ユニットまでの区分は100,000ユニットあたり$8、100万から1,000万までは100,000ユニットあたり$7、1,000万から5,000万までは100,000ユニットあたり$6.50です。低い単価は、その区分に属するユニットだけに適用されます。上限を超えても、先の区分に属する分までさかのぼって安くなるわけではありません。
取り込み上限はCoreが毎分4,000リクエスト、Proが毎分20,000リクエストです。これは取り込みリクエストの上限であり、課金ユニットの定義とは異なります。一つのバッチに複数の保存イベントを含められます。月間ユニット予算に加え、エクスポーターが作る瞬間的なトラフィックも確認してください。
Langfuseのトレース料金には、観測イベントとスコアも含まれます
Langfuseのトレースは実行の記録ですが、課金式はトレース+観測イベント+スコアです。試算ワークロードでは、100,000 + 500,000 + 10,000 = 610,000ユニットとなります。したがってCoreの料金は**$29 + 5.1 × $8 = 月額$69.80です。同じ保存量をProで扱うと月額$239.80**になります。
この式を踏まえると、計装の設計も変わります。検索処理や返金ツールの操作は記録を増やしますが、原因を説明する重要な証拠です。料金を下げるために削ると、失敗を説明できなくなる恐れがあります。費用の大きい結果や害のある結果を調べる証拠は残し、価値の低い成功実行には意図的なサンプリング方針を適用するほうがよいでしょう。
ホスティング、ライセンス、OpenTelemetry対応
セルフホストのOpen Sourceは、MITライセンスでライセンス料不要です。利用量は無制限で、コアのトレーシング、評価、データセット、プロンプト管理APIを使えます。セルフホストのEnterpriseは商用ライセンスで、料金は個別見積もりです。現行の料金ページでは、Langfuseのエンタープライズ料金は、対応するClickHouseの商用プラン料金に上乗せされると説明しています。クラウド契約とエンタープライズのセルフホスト見積もりは、別の購入です。
OpenTelemetryドキュメントでは、HTTP/JSONまたはHTTP/protobufによるOTLPに対応し、gRPCには対応しないとしています。ベースエンドポイントは/api/public/otelで、プロジェクトの公開キーと秘密キーを使ったBasic認証を行います。現行のv4経路に直接取り込んでリアルタイムに処理するには、x-langfuse-ingestion-version: 4ヘッダーが必要です。付けない場合は最大10分の遅延があり得るとドキュメントに記載されています。ユーザー、セッション、リリースなどのトレース属性も、フィルタリングや集計の対象となるスパンへ伝播させる必要があります。
すでにgRPCでCollectorへ出力しているプラットフォームチームにとって、ここは連携上の重要な条件です。Collectorは受信と送信に異なるプロトコルを使えますが、Langfuseへの最後の経路は、指定のHTTPエンドポイントと属性マッピングに合わせなければなりません。ペイロードが受け付けられても、顧客メタデータが欠けていれば連携は完成していません。
LangfuseをPythonで使うなら、公式SDKの手順から始めます
ベンダーはPythonでの利用に自社SDKを推奨しています。Langfuse固有のフィールド、属性の伝播、エクスポートを管理するためです。現行のトレーシングクイックスタートに従い、プロジェクトの認証情報と、選んだリージョンまたは自社環境に対応するLANGFUSE_HOSTを設定します。業務処理全体を、現行の観測コンテキストで包んでください。検索やツールの処理もその中に置くと、誤った回答の原因をトレースに残せます。
可能な限り、プロバイダーが返す利用量を使ってください。Langfuseのコスト追跡は、モデルの公開価格から推定した費用より、取り込んだ費用を優先します。Project Settings > Modelsでは独自の定義を登録できます。プロバイダーとの契約に交渉済みの単価がある場合や、社内モデルに公開価格がない場合に重要です。表示される見積額は、管理したい実際の契約単価と一致させる必要があります。
LangfuseとLangChainでは、リクエスト全体を同じコンテキストに置きます
LangChain連携では、呼び出し時のcallbacksにコールバックハンドラーを渡します。外側のリクエストにトレースコンテキストを与え、その配下にチェーンを入れてください。ドキュメントは、キューに入ったバックグラウンドイベントにも注意を促しています。短時間で終了するプロセスは、終了前にエクスポーターをフラッシュするかシャットダウンする必要があります。JavaScriptのサーバーレス環境では、ガイドの指定どおりバックグラウンドのコールバックをawaitしてください。
最初の導入は、手動で確認できる規模に絞ります。
本番トレーシング用のプロジェクトを一つ作ります
Cloudのリージョンまたはセルフホストのアドレスを選び、プロジェクトキーを作成し、現行のクイックスタートに従ってホストを設定します。本番と開発の記録を見分けられるようにしてください。
業務処理を最初から最後までトレースします
リクエストのルート、モデル呼び出し、検索、ツールを計装します。顧客、ワークフロー、リリース、結果のメタデータを適切なスパンに付け、必要なトレース属性が伝播することを確認してください。
プロバイダーのレスポンスと費用を照合します
完了したトレースを開き、モデル、利用量、費用を確認します。公開単価からの推定が契約に合わない場合は、独自のモデル単価を設定してください。
スコアを保存し、利用量のカウントを確認します
既知の例を採点し、意図した実行にスコアが付くことを確認します。その後、トレース、観測イベント、スコアの件数をUsage Managementダッシュボードと照合してください。短時間で終了するワーカーは、終了前にエクスポーターをフラッシュします。
- Coreでは、必要なレビュー担当者が追加のシート料金なしで参加できます
- モデル呼び出し、ツール、検索、費用、評価スコアを同じ記録にまとめられます
- 取り込んだ費用と独自のモデル定義で、交渉済み単価や非公開価格を扱えます
- MITライセンスのコアをセルフホストし、自社でインフラを管理する選択肢があります
- トレース、観測イベント、保存するスコアのすべてがCloudの利用枠を消費します
- 利用量が変わらなくても、ProやTeamsアドオンで固定費が増えます
- OTel受信には、HTTPでの出力と正しい属性伝播が必要です
2. LangSmith:LangChainを中心に開発と評価を回すチーム向け
LangSmithは、LangChainやLangGraphでエージェントを開発・レビューするチーム向けのトレーシング・評価基盤です。他のフレームワーク向けの計装方法も文書化されています。 開発責任者は、本番の失敗をデータセット、オンラインまたはオフライン評価、人によるレビュー、プロンプト修正につなげられます。購入時の主な制約はシート数とトレース数です。レビュー担当者を招待すれば基本料金が増え、トレース量にも別の料金がかかります。各レビュー担当者の有料シートを正当化できるほど、開発と評価のワークフローに価値がある場合に選んでください。

向いているチーム: LangChainやLangGraphを中心に、エージェントの改善を進めている開発チーム
特徴: トレーシング、データセット、アノテーションキュー、オンライン・オフライン評価を一つの製品で利用できます
料金: Plusはシートあたり月額$39。トレースや他の製品利用には追加の従量料金がかかります
無料利用: Developerは一人のユーザー向けの継続的な無料枠です。含まれるトレース数を超えると従量料金が発生します
LangSmith料金:各プランと組織で共有するトレース枠
Developerはシートあたり月額$0で、一シートに対応します。月5,000件のベーストレースを含み、超過分は従量課金です。Plusはシートあたり月額$39で、有料シートを追加でき、月10,000件のベーストレースを合計で含みます。料金計算ツールは、この枠を組織全体で共有するものとして明記しています。Enterpriseは個別見積もりで、ハイブリッドやセルフホストの選択肢、セキュリティ制御、サポート体制を提供します。
現行ページの料金ツールチップには、ベーストレース一件あたり0.005 LangChain Standard Units、延長保持へのアップグレード一件あたり0.0025とあります。LSUの一単位は$1なので、それぞれベーストレース一件あたり$0.005、アップグレード一件あたり$0.0025です。通常の保持期間は14日、延長すると180日です。過去に覚えたトレース単価を、今回確認した予算計算にそのまま使わないでください。
Plusの五シートと100,000件のベーストレースでは、シート料金$195+追加トレース料金$450=月額$645となります。10,000件のトレースを延長保持にアップグレードすると**$25**が加わり、評価の計算費用や他の製品利用を含める前で$670です。アップグレードは記録を長く残すための料金で、Plusを契約すれば無料で付く機能ではありません。
Tuned Evaluatorsには、別の公開課金単位があります。成功したPerceived Error評価の実行一回あたり0.015 LSUです。ページのツールチップでは、フィードバックを追加するTuned Evaluatorは、そのトレースを延長保持にもアップグレードすると説明しています。Deployment、Engine、Fleet、Sandboxesには、それぞれ別の利用量ルールがあります。可観測性だけを購入するなら、予算をそのサービスに絞ってください。シート料金にエージェントの実行基盤全体が含まれると考えるべきではありません。
シート数が増えると、なぜおすすめが変わるのですか?
五人の開発者がトレースを見る場合と、その五人にプロダクトや品質管理の幅広いレビュー担当者が加わる場合では、費用が変わります。同じ100,000件のベーストレースでも、Plusの十五シートは月額$1,035です。シート料金が**$585になり、追加トレース料金は$450**のままだからです。シートを増やしても、共有の無料トレース枠は人数倍になりません。
各担当者が日常的にトレースを使い、プロンプト修正、データセット、リリース判断につなげるなら、費用を正当化できます。多くのユーザーがたまにコストダッシュボードを見るだけなら、説明は難しくなります。生の記録をレビューする人、エクスポートした結果で作業できる人、契約の価値を生むワークフローを整理してください。
商用セルフホストとOpenTelemetry対応
セルフホストのLangSmithは、商用ライセンスキーが必要なEnterpriseアドオンです。フロントエンドとバックエンドのサービスに加え、ClickHouse、PostgreSQL、Redisを導入します。ガイドは、本番で外部のストレージサービスを使うことを推奨しています。企業向け環境を自社で運用する方式であり、フレームワークがオープンソースだからサーバーライセンスも無料だと判断できるものではありません。
OpenTelemetryガイドには、対応アプリケーションからのトレース、標準属性のマッピング、同じスパンストリームを複数のバックエンドに送るCollectorのファンアウトが記載されています。LangChainやLangGraphでは、トレーシングと併せてLANGSMITH_OTEL_ENABLED=trueを設定すると、統合された経路を有効にできます。標準HTTPエクスポーターのベースエンドポイントはhttps://api.smith.langchain.com/otelです。x-api-keyで認証し、任意でLangsmith-Projectヘッダーを付けます。
エンドポイントの指定形式に注意してください。共通のOTLPベース変数では、HTTPエクスポーターが/v1/tracesを追加します。トレース専用の変数には完全なパスを指定します。両方にシグナルのパスを付けると、誤ったURLになります。OTel出力が完了したと判断する前に、指定したプロジェクトで同じトレースを確認し、モデル、入力、出力、親子関係を照合してください。
- LangChainとLangGraph向けの統合トレーシング経路が文書化されています
- データセット、アノテーションキュー、オンライン・オフライン評価で改善の手順を組めます
- OTel取り込みとCollectorのファンアウトにより、一つのフレームワークに限らず連携できます
- Enterpriseでは、ライセンスを得て自社インフラでバックエンドを運用できます
- Plusはレビュー担当者一人につき月額$39です。招待したユーザーもシートに数えられます
- 含まれるトレース枠は共有であり、シートごとには付与されません
- トレースの延長保持と専用評価器の利用には、別途料金がかかります
3. Helicone:ゲートウェイ導入とリクエスト監視をまとめたい場合
Heliconeは、リクエストの可観測性とAIゲートウェイを組み合わせた製品です。ゲートウェイは、ルーティングなどの制御を適用しながらモデルへのリクエストを転送します。 プロバイダーへのリクエスト確認、フォールバック管理、モデル支出の分類が主な課題である小規模アプリケーションなら、この境界で有用な記録を得られます。制約は、ゲートウェイとエージェント全体の違いです。モデルリクエストの記録だけでは、検索や業務ツールを説明するためのアプリケーション側の文脈が足りません。ゲートウェイをすでに設計に組み込む予定で、まずリクエスト監視が必要な場合に選んでください。

向いているチーム: リクエスト監視とゲートウェイ機能をまとめて導入するプロダクトチーム
特徴: OpenAI互換のゲートウェイと、別経路の非同期ログ記録
料金: Proは月額$79。段階制のログ記録リクエスト料金とストレージ料金が加わります
無料利用: Hobbyは無料です。ProとTeamには7日間の無料トライアルを記載しています
現行プランと、瞬間的な取り込み上限
現行の料金ページによると、Hobbyは$0で、月10,000リクエスト、ストレージ1 GB、一シート、一組織、七日間の保持を含みます。Proは月額$79で、シート数無制限、アラート、レポート、クエリ言語のHQLを追加し、保持期間は一か月です。Teamは月額$799で、五組織、三か月の保持、専用Slackチャンネル、記載されたコンプライアンス対応を追加します。Enterpriseは個別見積もりで、SAML SSO、オンプレミス導入、個別の契約条件に対応します。
有料プラン表には無料リクエスト10,000件と無料ストレージ1 GBを含み、それ以降は従量課金とあります。公開されている取り込み上限は、Hobbyが毎分10ログ、Proが1,000、Teamが15,000、Enterpriseが30,000です。月間利用枠には余裕があっても、瞬間的な負荷が取り込み上限を超える場合があります。キューを使う文書処理ジョブが大量の記録をまとめてフラッシュするなら、月間件数と併せてスループットも確認してください。
ProからTeamへの差額は、従量料金を含めず月額$720です。組織数、保持期間、サポートの要件を満たすために購入してください。リクエスト数が増えたというだけで、この差額が次に必ず発生するわけではありません。
リクエスト料金と、ストレージ無料枠の不一致
料金ページの計算ツールでは、リクエスト単価を段階制で計算します。最初の10,000件は無料、次の20,000件は一件$0.0007、次の60,000件は一件$0.00035、90,001から250,000件までは一件$0.000175です。さらに利用量が増えると、公開された後続の区分では一件$0.0000875、$0.00004375、$0.00002へ下がります。これらは他社の比較記事ではなく、Helicone自身の計算ツールにある数値です。
200,000件のモデルリクエストを記録する場合、リクエスト料金は**$14 + $21 + $19.25 = $54.25**です。Proの基本料金を加えると、ストレージ料金を含めず$133.25となります。サンプルのエージェントでは二回のモデル呼び出しを両方数えてください。アプリケーション全体を100,000「リクエスト」と表すと、この課金対象を少なく見積もってしまいます。
計算ツールのストレージ料金は、最初の30 GBが$3.25/GBで、より大きい区分では**$2/GB**、$1.25/GB、$0.75/GB、$0.50/GBとなります。ただし、プラン表で無料ストレージを案内しているのに、計算ツールはゼロから最初の区分の料金を計上します。課金対象ストレージ5 GBで無料枠を適用するとストレージ料金は**$13**、計算ツールに従うと**$16.25です。そのため、この試算でのProの合計は$146.25-$149.50**になります。
ゲートウェイ、非同期ログ、OTel連携の対応範囲
ゲートウェイのクイックスタートでは、OpenAI互換クライアントの接続先をhttps://ai-gateway.helicone.aiにし、自動ログ記録とフォールバックを使います。自分のプロバイダーキーを持ち込むこともできます。モデルプロバイダーへの支出は、可観測性の基本料金やログ記録リクエスト料金とは別です。
ProxyとAsyncの比較ガイドは、構成上のトレードオフを明確にしています。Proxy連携ではHeliconeがリクエスト経路に入り、キャッシュ、リトライ制御、独自のレート制限などのゲートウェイ機能を利用できます。Asyncのログ記録は、その重要な経路の外側で動きますが、同じプロキシ制御は使えません。設定の手間を比較する前に、処理を転送するのか、バックグラウンドで観測するのかを決めてください。
OpenTelemetryについては、OpenLLMetry Async連携が文書化されています。現行の例では、@helicone/asyncとhelicone-asyncのロガーを使います。これは記載された連携経路の根拠ですが、このガイドには汎用的なOTLP Collector受信先の設定はありません。要件が「Collectorのエクスポーターだけを変更すること」なら、その経路自体を検証してください。OTelに関連する連携があるだけで、そのまま差し替えられるOTLPバックエンドとは判断できません。
セルフホストは、手動インストール、Docker Compose、Kubernetes、クラウド導入に対応します。リポジトリのライセンスはApache 2.0です。専用サポートとエンタープライズサービスは別途相談となります。小規模チームでは、ソフトウェアのライセンスが無料でも、継続的な運用費用がテレメトリーの請求額を上回る場合があります。
導入時は、リクエストが表示されることだけで終わらせず、アプリケーションの疑問に答えられるかを確認してください。ワークフローと顧客の識別子を付け、既知のモデル呼び出しを送り、記録を調べ、意図した呼び出しがセッションでまとまることを確かめます。リトライや失敗した応答でも同じ確認を行ってください。余分なモデル処理を生んだ業務処理が分かると、ゲートウェイの画面は本番調査の証拠になります。
- Proではシート数が無制限で、リクエスト監視を共有できます
- ゲートウェイと非同期の経路から、リクエスト経路への影響を選べます
- 段階制のリクエスト料金を、ベンダーの公開ページから計算できます
- Apache 2.0ライセンスと文書化された導入方法で、セルフホストが可能です
- モデルリクエストと、エージェントの完全な実行では単位が異なります
- 公開されたストレージ無料枠と計算ツールの扱いを確認する必要があります
- 非同期ログでは、ゲートウェイのキャッシュ、リトライ、レート制限は利用できません
- 引用した連携ガイドでは、汎用的なCollectorからOTLPへの取り込み経路は確認できません
4. Arize Phoenix:インフラ担当者を置き、プライベートに運用したい場合
Arize Phoenixは、ローカル利用を基本にしたトレーシング、評価、実験の基盤です。ライセンス料なしで、自社インフラに導入できます。 検索を使うアシスタントを調べるプラットフォームエンジニアは、モデル呼び出し、検索したコンテキスト、ツールの処理を確認し、失敗をデータセットに集め、修正したアプリケーションと比較できます。主な制約は運用責任です。サービスを運用し、ライセンスの範囲を理解する担当者が必要です。プライベートで制御可能なトレーシング・評価環境に、インフラ担当者を割り当てるだけの価値がある場合に選んでください。

向いているチーム: トレーシングと評価のバックエンドを自社で運用したい技術チーム
特徴: OTLPトレースとOpenInference計装、ローカルのデータセットと実験
料金: Phoenixのセルフホストにライセンス料は不要です。現行のArize料金ページにPhoenixの有料プランは公開されていません
無料利用: セルフホストのPhoenixは、ライセンスの範囲内で無料で使えます。Arize AXには別の無料プランがあります
月額$50はPhoenixではなく、AXのプランです
現行のArize料金ページはAXの料金を示し、Phoenixをローカル利用を基本にする別の基盤として説明しています。AX Freeは月25,000トレーススパン、月1 GBの取り込み、15日間の保持を含み、ユーザー数と評価数は無制限です。AX Proは月額$50で、50,000スパン、月10 GBの取り込み、30日間の保持を含み、ユーザー数と評価数は無制限です。AX Enterpriseは個別見積もりで、利用量と保持期間を個別に設定し、SaaSまたはセルフホストで導入できます。
このページには、Phoenixの有料インスタンス料金や超過料金表は公開されていません。Phoenixを「月額$50」と呼ぶと、別の製品を混同します。Arizeのマネージド製品を購入したいなら、AX自身のスパンとバイトの上限で評価してください。Phoenixを選ぶなら、自社で運用するインフラの予算を立てます。
試算したアプリケーションの500,000スパンは、AX Proに含まれるスパン数の十倍です。公開ページには、この場合の超過単価がありません。価格を外挿するより、見積もりを依頼することが適切です。一回の実行で五スパンとすると、AX Freeのスパン枠は5,000回の実行、Proは10,000回に相当します。ただし、バイト数などの上限にも収まることが前提です。
セルフホストのPhoenixは、この試算量でもソフトウェアのライセンス料がゼロのままです。ただし、500,000件のスパンを無料で保存できるという主張ではありません。保存方針を決め、ペイロードの大きさを見積もり、バックアップを含め、アップグレードと復旧を担う人を割り当ててください。すでにインフラを運用している場合と、新しいプライベート基盤が必要な場合とでは、総費用が変わります。
バックエンドのライセンス条件を確認します
Phoenixバックエンドの現行リポジトリのライセンスはElastic License 2.0です。制約の範囲内での利用を認める一方、製品の主要な機能をホステッドサービスやマネージドサービスとして第三者に提供することを禁じています。ライセンスキー機能の回避やライセンス表示の削除にも制限があります。LangfuseのMITコアやHeliconeのApache 2.0とは、許諾の仕組みが異なります。
調達時の説明でも区別してください。「コードが公開されている」「自社の導入では無料」「サービスとして再提供できる制約の少ないライセンス」は、それぞれ別の主張です。この記事が勧めるのは、自社アプリケーションのトレーシングと評価のためにPhoenixを運用することです。Phoenixをホステッド製品として再販する権利を前提にはしていません。
セルフホストガイドでは、セルフホストにライセンス料、利用量の上限、機能制限はなく、完全に外部ネットワークから隔離したエアギャップ環境でも動かせると説明しています。ターミナル、Docker/Compose、Kubernetes/Helm、クラウドへの導入方法が文書化されています。プライベートに導入する場合でも、保存するデータに合った構成と復旧計画が必要です。
OpenTelemetryから、評価と改善につなげます
PhoenixはOTLPトレースを受け付け、OpenTelemetryとOpenInferenceの計装を中心に構築されています。文書化された記録には、モデル呼び出し、検索、ツール、独自のロジックが含まれます。評価には、モデルによる判定、コードによるチェック、人によるラベルを使えます。データセットと実験では、異なるアプリケーションのバージョンを同じ入力で再実行できます。プロンプト用のツールは、バージョン管理とリプレイに対応します。
トレーシング設定ガイドでは、Python用のphoenix.otelとTypeScript用の@arizeai/phoenix-otelに加え、プロジェクトとセッションの整理方法を示しています。Collectorを使うチームは、他の基盤で使っている意味づけのフィールドが、Phoenixでも実際に保持されるかを確認してください。トレースIDを残すことは有用ですが、誤ったコンテキストを検索した処理まで分かってこそ、対応につながります。
検索を使うアシスタントでは、既知の失敗から始めます。たとえば、無関係な文書を基にモデルが自信のある回答を出したケースです。検索スパンに、検索自体の問題と回答生成の問題を見分けるための証拠があるかを調べてください。入力と期待する動作をデータセットに残し、検索またはプロンプトの設定を一つ変えて、結果を比較します。再現可能な例が、問題の観測と再発防止をつなぎます。
- ガイドでは、セルフホストにソフトウェアのライセンス料や利用量の上限はないとしています
- エアギャップ環境への導入が文書化されています
- OTLPとOpenInferenceで、一般的な計装経路とトレーシングを接続できます
- データセット、実験、複数の評価方法を使って、回帰を確認できます
- ELv2には、制約の少ないライセンスと一括りにすると見落とす制約があります
- インフラ、保持期間、アップグレード、復旧は自社の責任です
- 有料AXの上限と料金は、Phoenixの有料契約を示すものではありません
5. Braintrust:評価結果をリリース判断の軸にするチーム向け
Braintrustは、採点した例、データセット、実験を基にリリースを決めるチーム向けの評価・可観測性基盤です。 プロンプト修正を比較するプロダクトのAI責任者は、トレースを見ながら、新しい出力が旧版と同じチェックを通過したかを判断できます。予算上の主な制約は処理データ量とスコア数で、モデルの計算費用や長期保持の料金が加わります。評価のワークフローに担当者がいて、その結果がリリース内容を変える場合に選んでください。上限と機能が合うならStarterから始めます。

向いているチーム: 評価用データセットとリリース基準を維持しているAIプロダクトチーム
特徴: Starterでも、ユーザー、プロジェクト、データセット、プレイグラウンド、実験の数が無制限です
料金: Starterの基本料金は$0で、従量料金がかかります。Proは月額$249+従量料金です
無料利用: Starterには継続的な無料枠があり、開始時にクレジットカードは不要です
現行プランと、データ・スコアの二つの課金単位
Starterの月額基本料金は$0です。処理データは月1 GBまで含み、超過分は**$4/GBです。スコアは月10,000件まで含み、超過分は1,000件あたり$2.50**です。保持期間は14日で、モデルクレジットは月$10です。ユーザー、プロジェクト、データセット、プレイグラウンド、実験の数は無制限です。そのため、評価用ワークスペースを共有する必要があっても、すぐにProが必要とは限りません。
Proは月額$249です。処理データ5 GBを含み、超過分は**$3/GBです。スコア50,000件を含み、超過分は1,000件あたり$1.50です。保持期間は30日で、追加の保持は月$0.50/GB**、モデルクレジットは月$100です。独自のチャート、環境、ロールベースのアクセス制御、優先サポートを追加します。Enterpriseは個別見積もりで、保持期間とエクスポート、サポート、オンプレミスまたはホステッド導入の条件を個別に設定します。
スコアは、モデルによる判定、自動評価、独自コードのスコアラーで評価した出力です。その保存や処理の料金と、スコアを生成した計算の費用は別です。付属するモデルクレジットにも適用範囲があり、あらゆるアプリケーションのプロバイダー請求を払い戻すものではありません。
試算の5 GBと10,000スコアでは、Starterはデータ超過分の**$16で、スコアの超過料金はありません。Proは追加利用を含める前で$249**です。無料プランの機能範囲でデータセット、実験、トレースを共有できるなら、$249のアップグレードには、機能または保持期間の理由が必要です。
低い従量単価は、どこから費用面で有利になりますか?
同じ処理データ5 GBで月100,000スコアの場合、モデル利用や保持期間延長を含める前の費用は、Starterが**$241**、Proが**$324**です。Proの従量単価が低くても、固定費を自動的に上回る節約にはなりません。
同じバイト量の前提では、従量料金だけで見た損益分岐は月183,000スコアで、両プランとも**$448.50**になります。この計算には、異なるモデルクレジット、保持期間、機能を含めていません。それらを理由に早めのアップグレードが適切な場合もあります。これは予算上の境界であり、有用なアクセス制御を先送りするための目安ではありません。
運用で問うべきなのは、どのチェックが費用に見合うかです。サポート業務では、すべての実行に決定的なツール引数チェックを行い、サンプルに対してモデルで回答品質を評価する構成が考えられます。目的も計算費用も異なるチェックです。リリース用の既知のデータセットを維持し、本番をサンプリングして、データセットで想定していなかった失敗を探してください。
平均スコアが高いだけで、リリース判断が完了したと考えないでください。ワークフローと結果で例を分け、簡単な回答の改善が、顧客にとって重要な難しい操作の悪化を隠さないようにします。これは評価を設計・レビューする実務であり、どのプラットフォームも正しい評価基準を自動的に与えるという主張ではありません。
OTel取り込みと、商用のデータプレーンホスティング
OpenTelemetry連携には、OTLPトレースエクスポーター、Braintrustスパンプロセッサー、ログエクスポーター、ログのCollector転送が文書化されています。ベースAPIエンドポイントはhttps://api.braintrust.dev/otelです。認証情報とx-bt-parent=project_id:...ヘッダーで、対象プロジェクトを指定します。シグナル専用エンドポイントには、トレースまたはログのパスを含めます。別パッケージの@braintrust/otelは、記載されたJavaScript連携に対応します。
連携のフィールドマッピング手順に従い、取り込み後の入力、出力、メタデータを確認してください。ログ行もアプリケーションのスパンも受け付けられるからといって、評価用の記録として同じものになるわけではありません。予定している実験の入力に、どのオブジェクトを使うのかを確かめます。
導入プランでは、BYOCとセルフホストをEnterpriseに限定しています。商用プラットフォームの購入であり、オープンソースのバックエンドライセンスではありません。さらに、アーキテクチャガイドによると、UI、認証、管理メタデータを含むコントロールプレーンはBraintrustのSaaSに残ります。トレース、データセット、その他のAIデータを置くデータプレーンは、自社のクラウドアカウントで動かせます。ブラウザーは、そのデータプレーンと直接通信します。
この違いが調達判断を左右する場合があります。プロンプトと出力の保存先を自社で管理すれば、データの保管場所に関する要件を満たせる場合がありますが、ベンダーのコントロールプレーンへの依存は残ります。製品のすべての構成要素をオフラインにする必要がある組織は、契約前に、Phoenixで文書化されているエアギャップ導入と比較してください。
- Starterでは、シート料金なしで評価用ワークスペースを共有できます
- 処理データとスコアの利用枠が分かれ、予算の内訳を把握できます
- Proは、チャート、環境、アクセス制御、保持期間の明確な機能アップグレードです
- 文書化されたOTel経路で、既存の計装ストリームを受け付けられます
- 大きなペイロードとスコア数は、それぞれ従量料金の原因になります
- Proの低い従量単価で、基本料金$249を必ず相殺できるわけではありません
- 判定モデルの計算と長期保持には、それぞれの予算が必要です
- データ保存先をセルフホストしても、SaaSのコントロールプレーンは自社インフラに移りません
6. Datadog Agent Observability:既存の運用環境と障害調査をつなげたい場合
Datadog LLM Observabilityとして検索されることが多い製品の現行名称は、Datadog Agent Observabilityです。最も適しているのは、すでにDatadogでアプリケーションの障害を調査しているチームです。 サポートエージェントのタイムアウトは、モデル呼び出し、遅いサービス、ユーザーセッションの問題から起きる場合があります。エージェントの記録を、より広い運用状況と結びつけられることが価値です。制約は、契約形態と保持期間の選択、さらに必要な周辺Datadog製品の費用です。障害対応の担当者がすでにDatadogを使い、共有された文脈によって調査が変わる場合に選んでください。

向いているチーム: AIの失敗をアプリケーションやインフラの障害と結びつけるSRE・プラットフォームチーム
特徴: 検索、ツール、ワークフローの全処理ではなく、LLMスパンに課金します
料金: Proは年間契約で月額$160、月ごとの契約で$200、オンデマンドで$240です。追加のLLMスパン料金が加わります
無料利用: Freeは月40,000件のLLMスパンを含みます。料金ページにはトライアルの申し込みもあります
Datadog LLM Observabilityの料金
現行の料金ページによると、Freeは$0で、月40,000件のLLMスパン、15日間のトレース保持、コンテキストと評価の無制限利用、全機能へのアクセスを含みます。Proは月100,000件のLLMスパンを含み、こちらもトレース保持は15日です。基本料金は年間契約で月額$160、月ごとの契約で$200、オンデマンドで$240です。
追加のLLMスパンは、年間契約料金では10,000件あたり$3.50、月契約では$4.20、オンデマンドでは$5です。200,000件のLLMスパンの試算合計は、それぞれ**$195**、$242、$290になります。契約条件を明示して比較してください。年間契約の見出し価格は、月契約の請求額ではありません。
課金単位はモデル呼び出しであり、トレース内のすべての処理ではありません。ベンダーは、ツール、検索、それらを囲むワークフローのスパンをLLMスパンとしては課金しないと説明しています。一回の実行につきモデルを二回呼ぶなら、Freeの利用枠は20,000回の完全な実行に相当します。ただし、他のプラン条件にも従う必要があります。ツールの計装を増やしても、課金対象のLLMスパンが増えるとは限りません。一方、モデルを繰り返し呼ぶ推論ループでは増えます。
保持期間の延長は可能ですが、この比較に使える公開単価はページにありません。過去の障害を調査する必要があるなら、その要件の見積もりを取ってください。十分に計装された記録でも、すでに期限切れで消えていれば、後日の顧客との問題を調べる材料にはなりません。
DatadogのAI可観測性を、既存の運用環境で生かします
Agent Observabilityは単独で購入できます。ベンダーは、他のDatadog契約は不要としています。料金ページでは、APM、インフラ監視、Real User Monitoringを使っている場合に、それらと相関づける追加の価値も説明しています。新規導入では、可観測性の契約に他のDatadog製品も含まれると考えず、別々に予算を立ててください。
公開されている各プランには、データセット、実験、評価、アノテーション、ダッシュボードが含まれます。コスト画面では、プロバイダー、モデル、プロンプトの識別子やバージョン別に利用量を分け、トレースやスパンでも費用を確認できます。障害担当者は、トラフィックの増加と、アプリケーションが行うモデル処理の変化を見分けられます。
プラットフォーム責任者は、導入検証で相関づけの価値を具体的に確かめてください。失敗したエージェント実行から始め、ツールの応答を担ったサービスまでリクエストをたどります。境界を越えてもトレースの識別情報が保たれ、担当者がモデルの遅延と他の処理時間を区別できるかを確認します。購入するのは、この調査のワークフローです。支出グラフだけでは、その価値を確認できません。
SaaSのライセンスとOpenTelemetry対応
Datadogは、この製品を契約に基づく商用SaaSとして提供します。利用規約では、ホステッドサービスにMSAが適用されるとしています。現行の製品料金ページに、セルフホストのAgent Observabilityバックエンドはありません。Datadog AgentやOTel Collectorを自分で動かしても、ストレージ、UI、評価基盤を自社でホストすることにはなりません。
OpenTelemetryガイドでは、GenAIセマンティック規約1.37以降、または対応するOpenInference規約に沿ったトレースを受け付けます。Datadog AgentやAgent Observability SDKを必要としない直接取り込みが文書化されています。例示されたエクスポーターはOTLP/HTTP protobufを使い、dd-api-keyとdd-otlp-source=llmobsのヘッダーを付けます。
外部評価には、固有の連携条件があります。OTelスパンでは、ドキュメントがsource:otelタグと、十進数の文字列にしたトレースID・スパンIDを要求しています。OTel本来のIDは十六進数なので、送信前に変換が必要です。トレーシングが連携できるから評価も自動的に紐づくと考えず、既知のトレースに一つの評価を付けて検証してください。
- 公開された従量課金の対象はLLMスパンだけで、ツールや検索のスパンは除外されます
- 既存のDatadog運用担当者が、エージェントの記録を本番全体の状況と結びつけられます
- FreeとProに、記載された評価・実験機能が含まれます
- Datadog AgentなしでのOTel直接取り込みが文書化されています
- 最安の公開料金には年間契約が必要です
- 公開されている両プランのトレース保持は15日です
- 他のDatadogサービスは別の購入になります
- セルフホストの可観測性サーバーではなく、商用のホステッドバックエンドです
チーム規模ごとに、どのツールを選べばよいですか?
まず記録を見て行動する人を決め、次にアプリケーションとともに増える課金対象を確認します。 人数は予算の要素ですが、担当者が開発者、AIプロダクト責任者、障害対応者のどれかを理解する代わりにはなりません。
開発者が一人か二人の場合: 最初の本番レビューを完了できる無料枠から始めます。Langfuse Hobbyは二人で画面を共有する用途に合いますが、一回の実行から複数の処理を記録すると50,000ユニットはすぐに減ります。LangSmith Developerは一人のユーザー向けです。管理されたデータセットと採点によるリリースチェックがすでに目的なら、Braintrust Starterが有力です。Phoenixは、バックエンドを自社で運用することを意識的に選ぶ場合に適しています。
三人から十人の場合: 複数の開発者とプロダクト責任者が日常的にアクセスするなら、Langfuse Coreが第一候補です。評価中心のワークフローで、データ、スコア、保持期間、機能の上限が合えば、Braintrust Starterのほうが安くなる場合があります。ゲートウェイとリクエスト監視が購入目的に含まれるなら、Helicone Proの料金に意味があります。レビュー担当者が開発の改善サイクルを積極的に使うなら、LangSmith Plusのシート料金を正当化できます。
部門をまたぐ大きなレビュー体制の場合: 品質管理、プロダクト、サポートの担当者をワークスペースに加える前に、有料のLangSmithユーザーをすべて数えてください。ユーザー数無制限のプランなら、参加者が増えても基本料金を一定に保てます。ただし、トレース、バイト、スコアの量は引き続き管理が必要です。製品固有のワークフローで削減できるレビュー工数や防げる失敗の価値が、基本料金の差を上回るなら、選択は変わります。
すでにDatadogを使うSRE・プラットフォームチームの場合: エージェントの障害をサービスやユーザーセッションと一緒に調べる必要があるなら、Datadogを優先してください。既存の担当体制とトレースの文脈があると、別の専門コンソールを持つ価値が小さくなる場合があります。モデル以外の処理が多いエージェントでは、LLMのみを数える従量課金にも注目してください。
プライベートホスティングが要件の場合: PhoenixとLangfuseでは、ライセンスと導入の選択肢が大きく異なります。HeliconeにはApacheライセンスの選択肢があります。LangSmithとBraintrustのセルフホストには、商用のエンタープライズ契約が必要です。Braintrustは、自社管理のデータプレーンでもベンダーのコントロールプレーンを使います。どのプランが安いかを決める前に、何を自社インフラ内に置く必要があるかを決めてください。
判断のルールは明確です。本番の判断を変えるワークフローに支払い、そのワークフローが生む記録と参加者を予測します。 変えたい判断を具体的に言えないなら、より狭い範囲から導入してください。
OpenTelemetry対応は、経路とフィールドをどう確認しますか?
OpenTelemetry対応が役立つのは、アプリケーションの重要なフィールドが取り込み後も保持される場合です。 OTelは標準的な計装の仕組みで、OTLPはテレメトリーの送信プロトコルです。スパンストリームの送信に成功しても、バックエンドでモデル、利用量、顧客の文脈、ツールと呼び出し元の関係が欠ける場合があります。
文書化された経路は製品ごとに異なります。LangfuseはOTLPエンドポイントでHTTPのJSONまたはprotobufを受け付け、gRPCは非対応としています。LangSmithはGenAI、OpenInferenceなどの属性をマッピングしたOTelトレースを受け付け、Collectorのファンアウトを文書化しています。PhoenixはOTLPを受け付け、OpenInference計装を使います。Braintrustはトレース、スパンプロセッサー、ログの取り込み経路を文書化しています。Datadogは対応するGenAIまたはOpenInference規約を指定します。HeliconeにはOpenLLMetryの非同期連携がありますが、引用したガイドでは汎用のCollector用OTLP受信先は確認できません。
導入検証では、代表的な一回の実行を経路全体で保持してください。親子関係、モデル名、トークン、費用、入出力の取り扱い方針、リリースのメタデータを確認します。二つのサービスが関わるなら、境界を越えてコンテキストが伝わるかを調べます。会話をセッションにまとめる製品では、共通のトレースIDで会話全体がまとまると決めつけず、セッション識別子を検証してください。
エンドポイントの変数も慎重に確認します。共通のベースエンドポイントと、トレース専用のシグナル別エンドポイントは、異なる設定形式です。ベンダーが指定するリージョン、認証、パスに従ってください。その後、送信先プロジェクトの記録を確認します。HTTPレスポンスの成功は受け付けを示すだけで、正しい業務への紐づけを保証するものではありません。
最後に、重複する出力経路を数えます。フレームワークのコールバックと、別の自動計装ライブラリが、同じモデル呼び出しを観測する場合があります。費用が急増したと判断する前に、モデル処理が増えたのか、同じ処理を二重に記録したのかを確認してください。失敗分析ツールの比較では、得られたトレースを具体的なデバッグの問いにつなげています。
どのような導入・契約を避けるべきですか?
候補に挙がる製品でも、目的に合わない買い方は避けてください。 次の例は、文書化された課金方式や運用モデルと要件が合わないケースです。
- 共有のコスト画面だけのためにLangSmith Plusを選ぶこと: 試算した五人のワークロードは、保持期間のアップグレードと評価の計算費用を含めず$645です。改善のワークフローも業務に含まれる場合に、その料金を払ってください。レビュー担当者を増やす目的も明確にする必要があります。
- Starterに収まる軽い評価用途でBraintrust Proを選ぶこと: 試算ではStarterが$16、Proが$249です。機能、保持期間、サポートのアップグレードを意図して購入してください。
- 調達見積もりを「Phoenixは$50」と置くこと: その価格はAX Proのものです。サンプルの量ではAXの公開スパン枠が足りず、超過単価も公開されていません。自社で運用するPhoenixのインフラには、別の予算が必要です。
- 瞬間的な負荷の高い本番ワーカーにHelicone Hobbyを使うこと: 月10,000リクエストの枠があっても、公開されている毎分10ログの取り込み上限はなくなりません。無料枠を前提にする前に、トラフィックの出方を確認してください。
- 月次予算の承認にDatadogの年間契約価格を使うこと: $160は年間契約の基本料金です。月契約の基本料金は$200で、月契約料金での試算合計は$242です。
- 担当者を決めずにセルフホストすること: 無料ライセンスは、バックアップからの復旧、アップグレード、データアクセスの責任を割り当てません。商用の「セルフホストのデータプレーン」も、製品全体が自動的に自社環境へ移るという意味ではありません。
利用量が欠けたコストグラフは、細かい数字を表示していても、予算管理には不十分です。既知のリクエストについて、プロバイダーの利用量と保存された記録を比べ、集計値を実際の請求額と照合してください。観測基盤は支出を説明します。処理を止める方針は、アプリケーションの次の動作に反映されなければなりません。
週明けに始めること:失敗した実行をリリーステストにします
導入範囲を広げる前に、価値のあるワークフローを一つ計装し、既知の失敗を一つ再現可能にしてください。 注文検索をリトライする、誤った文書を選ぶ、根拠のない返金を案内するサポートアシスタントは、期待する動作を担当者が説明できるため、よい候補になります。

ワークフローの担当者、リリースの識別子、業務上の結果を明確にします。実行全体を記録し、モデルとツールの処理を調べ、利用量のフィールドを検証してください。エクスポーターが遅い場合や、短時間で終了するワーカーが終わる場合の挙動も確認します。最初の導入テストは、担当者の疑問に答えられるだけの文脈を持つ記録が届くかどうかです。
次に、既知の失敗を、明確な期待結果とともにデータセットへ入れます。期待結果は「ツールの承認なしに返金を約束しない」「この顧客に適用される検索済みのポリシーを引用する」といった内容です。ルールが決定的ならコードで確認し、判断が必要ならレビュー済みの品質基準を使ってください。入力とルールを残しておくと、後のプロンプト変更やモデル変更を同じテストにかけられます。
リリースの合否基準を明示してください。平均が合格でも、守りたい操作の失敗を隠してはいけません。指定した難しいケースの結果をレビューし、失敗したらトレースを調べます。その後、本番をサンプリングし、データセットに加えるべき新しいケースを探してください。
次に契約を判断する前に、実際のトレース数、トレースあたりの処理数、モデル呼び出し、保存スコア、処理または保持するバイト数、レビュー担当者、必要な保持期間を記録します。その数字で料金を再計算してください。最初の週に得たい成果は、修正されたワークフローと、根拠を説明できる予算です。それぞれに責任者を置きます。
よくある質問
AIの可観測性には、どのツールがおすすめですか?
トレースとコストを共有したい小規模な本番運用チームには、Langfuseが第一候補です。評価を軸にリリースを決めるならBraintrust、自社でプライベートなバックエンドを管理するならPhoenix、既存の運用ワークフローに組み込むならDatadogが合います。第一候補から専門ツールへ切り替えるかは、担当者と導入・運用の範囲で決まります。
LLMの可観測性では、どの指標を追うべきですか?
トークンとプロバイダー費用、レイテンシー、エラー、リトライ、検索とツールの結果、評価結果を追います。顧客、ワークフロー、リリースごとに整理してください。失敗やリトライが相応の費用を消費する場合は、総トークン数より、業務上の成果を一件成功させるためのコストが役立ちます。
可観測性ツールの上位3製品は何ですか?
この比較にある三つの本番運用上の役割なら、一般的なトレーシング共有にはLangfuse、評価を軸にしたプロダクト開発にはBraintrust、運用状況との関連づけにはDatadogを選びます。役割に基づく候補であり、すべての機能や導入環境で性能が優れていると実測した順位ではありません。
LLM可観測性で使えるオープンソースのツールはありますか?
LangfuseのコアはMITライセンス、HeliconeのリポジトリはApache 2.0です。Phoenixは無料でセルフホストできますが、バックエンドはホステッドサービスへの制約があるElastic License 2.0を使います。オープンソースと説明される製品をすべて制約の少ないライセンスと考えず、実際のバックエンドのライセンスを確認してください。
LLM可観測性ツールとは何ですか?
大規模言語モデルを使うアプリケーションがどう実行されたかを記録するツールです。モデル呼び出し、ツール、検索、処理時間、利用量、出力のチェックを含みます。役に立つ成果は、失敗した実行を説明でき、その記録を修正と再現可能なリリーステストにつなげられることです。
Langfuseの料金はいくらですか?
2026年10月5日の確認では、Hobbyは無料、Coreは月額$29、Proは月額$199、Enterpriseは月額$2,499です。Proの任意のTeamsアドオンは月額$300です。有料プランには、トレース、観測イベント、スコアの従量料金が加わります。試算した610,000ユニットのワークロードは、Coreで$69.80です。
Langfuseは無料で使えますか?
はい。Hobbyには月50,000ユニット、ユーザー二人、30日間のデータアクセスが含まれます。MITライセンスのコアを、ソフトウェアのライセンス料なしでセルフホストすることもできます。その場合、インフラ費用と運用は自社で負担します。商用のエンタープライズ機能には、別の条件があります。
Langfuseの代替ツールには何がありますか?
LangChainやLangGraphの改善サイクルにはLangSmith、ゲートウェイを軸にしたリクエスト監視にはHelicone、プライベートなバックエンドにはPhoenix、データセットと評価中心のリリースにはBraintrust、既存の運用環境内でエージェント障害を調べるならDatadogが合います。プラットフォームを変える前に、実際の課金単位と必要な保持期間を比較してください。
Langfuseをローカルで動かせますか?
はい。LangfuseはDockerを使うセルフホストを文書化し、MITライセンスのコア向けに導入ガイドを提供しています。ただし、ローカルで起動しただけでは、本番用のバックアップ、可用性、アップグレードの担当体制は整いません。本番のトレーシングサービスにするなら、それらの要件を決めてください。
AI Business Workflow Audit Checklistを入手すると、導入する本番ツールを増やす前に、ワークフロー、担当者、成果、制御すべき箇所を整理できます。
- 最終更新
- 2026年10月5日
- カテゴリー
- Build







