2026 年 AI Agent 可观测性工具推荐:8 款 Token 与成本追踪平台

对比 2026 年 8 款 AI Agent 可观测性工具,涵盖 Langfuse、Portkey、Helicone 与 OpenLIT 等平台。逐项拆解 Token 和成本归因、硬预算、Trace、自托管、评估能力、实时价格及免费方案,帮助产品与平台团队按工作流选型,避免失控支出。

Wednesday, September 2, 2026Omid Saffari
2026 年 AI Agent 可观测性工具推荐:8 款 Token 与成本追踪平台

在 2026 年的 AI Agent 工具栈中,AI Agent 可观测性与 Token 追踪工具已经有了明确的首选:Langfuse 每月 $29 起,就能为生产团队提供成本归因和不限用户数的协作空间。Claude Code 新增的 /usage 循环统计,让个人开发者不必再单独购买仪表盘;只有当团队需要跨模型分摊成本、设置硬预算,或把责任追溯到具体 Trace 时,额外的平台才真正有必要。

2026 年 AI Agent 可观测性工具速览

**对大多数产品和平台团队来说,Langfuse 是综合表现最好的选择。**它的 Core 方案每月 $29,集 Token 与成本追踪、不限用户数、实用的数据保留周期和 Trace 上下文于一体,计费方式也足够清楚,预算负责人可以轻松说明。Portkey 更适合必须在触及预算边界时直接拦截请求的场景。如果数据所有权比减少基础设施运维更重要,OpenLIT 则是更合适的答案。

下文所有价格和限额均于 2026 年 9 月 1 日逐一对照各厂商在线页面核验。“起步价”指小型生产团队实际可用的首个付费平台档位。除非另有说明,模型推理费、超额存储费、自托管基础设施和实施人力均需另行计算。

8 款入选工具一览

工具最适合起步价免费试用
Langfuse综合成本归因Core $29/月免费 Hobby 方案
Portkey网关预算与速率限制Production $49/月免费 Developer 方案
Helicone快速接入的代理式控制Pro $79/月7 天
OpenLIT自托管编程 Agent 遥测$0 OSS 许可证无需试用
Braintrust将成本与评估关联Pro $249/月免费 Starter 方案
Arize AX and PhoenixOpenTelemetry 与评估AX Pro $50/月免费 AX 档位及 Phoenix OSS
LangSmith深度依赖 LangChain 的改进闭环Plus $39/席位/月免费 Developer 方案
Datadog Agent Observability已在使用 Datadog 的运维团队Pro $160/月,按年付费免费档位

免费仪表盘不等于免费的控制平面。Claude Code、Langfuse、Braintrust、Arize、LangSmith 和 Datadog 都能让支出变得可见,但“看得见”并不会自动阻止下一次昂贵运行。Portkey 在 Enterprise 和部分 Pro 方案中提供细粒度预算与速率限制;Helicone 则可按用户或其他自定义属性,对请求数或以美分计的成本设置上限。在比较界面偏好之前,应该先用这一区别缩小候选范围。

AI Agent 可观测性,始于 Token 计数之外

**Agent 可观测性的核心,是说清 Agent 做了什么、每一步花了多少、成本由谁产生,以及最终结果是否值得。**Token 计数器只能回答其中一环。一次 Agent 运行可能调用模型 5 次、检索上下文、调用工具、在报错后重试,最后仍给出错误答案。财务真正关心的不是“用了多少 Token”,而是“哪个客户工作流消耗了这些 Token,这次工作流是否成功”。

Claude Code 已经抬高了基础能力的门槛。其当前的 /usage 文档 显示,Session 视图会给出详细 Token 统计和本地估算的美元金额。订阅方案使用 Claude Code v2.1.242 或更高版本时,还会显示 Loops 行,列出消耗最高的 /loop 或定时任务,包括运行次数、Token 总数、每次运行的 Token 数,以及最近一次运行。个人技术开发者因此无需购买另一套仪表盘,也能发现失控的周期任务。

不过,本地视图的边界很明确。Day 和 Week 只是根据本地 Session 历史,对过去 24 小时或 7 天做出的近似统计;其他设备和 claude.ai 上的使用量不在其中。官方文档给出的组织级方案,是把 OpenTelemetry 导出到企业自己的可观测性技术栈,以获得接近实时的逐用户指标。

AI Agent 可观测性如何补上工作流上下文

假设一个客服 Agent 处理一张工单花费 $0.18,处理另一张却花了 $1.40。Token 页面只能指出哪张工单更贵。AI Agent 可观测性还能解释:第二张工单对同一个工具重试了 4 次,升级后切换到了高价模型,最后仍转交人工。负责人由此可以调整路由、设置预算,并衡量“每张已解决工单的成本”,而不是“每条 Prompt 的成本”。

真正有用的记录包含 4 层:

  • **运行:**一次完整的 Agent 尝试,包括模型调用和工具调用。
  • **归因:**这次运行归属于哪个客户、用户、团队、环境、工作流或功能。
  • **结果:**成功、失败、升级、延迟、质量分数或收入事件。
  • **控制:**预算变得棘手之前先告警;必须停止工作流时,还要有可强制执行的上限。

这也解释了为什么便宜的仪表盘可能并不便宜。如果团队每周五都要花 2 小时把模型账单和客户 ID 拼在一起,一套 $29 的平台很快就能回本。反过来,如果没有人查看数据,也没有人为单位成本目标负责,即便是免费的开源栈也只会多出一套需要维护的系统。

这 8 款 AI Agent 可观测性工具如何入选

**这份榜单依据各产品的实时页面核对价格和能力,并非伪装成亲测报告。**最终入选的 8 款工具,都能把模型用量连接到更完整的生产记录。只展示供应商账单、只估算通用聊天机器人成本,或只有可观测性描述却拿不出当前公开依据的产品,均未进入榜单。

Agent 可观测性工具要通过 4 项检验

排名取决于 4 个实际问题。

  1. **成本能否准确计算?**工具必须能够接收供应商上报的用量,或按当前价格把模型与 Token 数映射为成本。私有模型必须支持自定义价格。悄悄显示 $0.00,比明确标注“未知”更糟。
  2. **成本能否准确归因?**用户、客户、工作流、模型、环境和结果标签,才能把账单转化为决策。没有责任主体的总额,无法用于内部成本分摊。
  3. **能否控制下一次请求?**告警只能得部分分。成本预算、请求限额或网关策略更有价值,因为它们可以直接改变执行。
  4. **买方能否看懂计量单位?**Trace、Span、请求、Observation、Score 和已处理 GB 不能互相替代。公开价格比含糊的销售报价权重更高。

Trace 上下文和评估能力用于打破平局。相比只画出一条上升曲线,能定位成本突增背后那次失败工具调用的平台更有用。数据所有权同样重要,尤其是那些不能把 Prompt、输出或客户元数据交给另一家 SaaS 的企业。

LLM 可观测性工具必须证明仪表盘有用

最好的 LLM 可观测性工具,应当能改变每周的实际决策。产品负责人应该在几分钟内回答 3 个问题:哪个工作流的单位成本上升了?上涨源于流量、模型选择、重试,还是上下文变长?下一步该调整路由、Prompt、缓存,还是策略?

回答不了这些问题的平台,只是遥测数据仓库,不是成本管理工具。它或许仍适合调试,但不该占用 Token 管理预算。这也解释了为什么榜单纳入 Braintrust、Arize 这类以评估为中心的产品,却在纯成本控制场景中把更强调执行约束的 Portkey 和 Helicone 排在前面。

8 款工具排名

1. Langfuse Agent Observability:综合表现最佳

**Langfuse Agent Observability 位列综合第一,是因为 Langfuse 从每月 $29 起,就能为生产团队提供成本归因、Trace 上下文、灵活部署和不限用户数。**B2B SaaS 平台可以按客户、功能、环境和版本标记每次生成,再通过仪表盘或 Metrics API 比较每个已完成工作流的成本。它的短板在执行约束:Langfuse 提供的是阈值告警,超预算请求仍需由网关或应用策略拒绝。结论可以概括为:成本账本与 Trace 必须放在一起时,选 Langfuse;只有潜在损失值得时,再增加强制限制。

展示 Cloud 与自托管方案的 Langfuse 价格页面
Langfuse

Langfuse 价格页把 1 个 Trace、Observation 或 Score 都分别定义为 1 个计费单位,因此一次包含多个 Observation 的运行会消耗多个单位。Cloud Hobby 方案免费,每月含 50,000 个单位、30 天数据访问期和 2 个用户。Core 每月 $29,含 100,000 个单位、90 天数据访问期和不限用户数;超额用量起价为每 100,000 个单位 $8,并随用量增加而下降。Pro 每月 $199,含 100,000 个单位、3 年数据访问期、保留策略管理、更高速率限制和不限用户数;可选 Teams 附加项每月 $300。Enterprise 每月 $2,499,含 100,000 个单位,并按年度用量定制价格。自托管 Open Source 采用 MIT 许可证,免费且不限用量;自托管 Enterprise 则为定制价格。

Langfuse 可以根据内置模型定义推算成本;如果 Trace 同时携带了成本值,则优先采用传入值。对于协商后的供应商费率或内部模型,这是正确的处理方式。成本可按标签和用户筛选,再通过 Metrics API 导出,用于财务仪表盘或客户利润率报告。

**最适合:**需要在不按席位计费的前提下,把成本归属到具体 Trace 的产品与平台团队
**突出优势:**用户与标签筛选、传入自定义成本、Cloud 或自托管部署
**价格:**Hobby $0;Core $29/月;Pro $199/月;Teams 附加项 $300/月;Enterprise $2,499/月;自托管 Open Source $0;自托管 Enterprise 定制价格
**免费试用:**免费 Hobby 方案,无需限时试用

优势
做得好的地方
7 points

  • Core 不限用户数,在计算用量前,10 人评审协作仍只需每月 $29
  • 传入的成本值会覆盖估算值,适合自定义或折扣费率
  • Metrics API 与标签筛选支持按客户、功能和工作流分摊成本
  • MIT 许可的自托管版本提供了可信的数据所有权路径
  • 一次运行如果包含多个 Observation 和 Score,消耗的单位会高于 Trace 数
  • 阈值告警不能替代网关硬限制
  • 在增加可选的 $300 Teams 附加项之前,Pro 已从 $29 跃升至 $199/月

一套可落地的 Langfuse 成本账本

最快的上线方式,是先做 1 条工作流,而不是一开始就铺开全公司的埋点项目。

  1. 选定业务价值单位

    选择一种已完成的结果,例如已解决工单、合格线索、已接受的代码变更或已处理发票。不要把“Agent 运行”当成业务单位,因为一次运行可能失败,无法产生价值。

  2. 附加 4 个维度

    把客户或账户、工作流、环境和模型作为 Trace 元数据或标签发送。再加入成功、升级、失败或 Score 等结果字段,才能用成本除以真正有价值的工作量。

  3. 私有推理必须传入价格

    受支持的供应商可使用 Langfuse 的模型定义。对于协商费率、自托管模型或私有模型,应直接传入用量和成本值,避免未知模型被显示成免费。

  4. 设置 1 条阈值告警

    可针对工作流每日总额或单位成本边界发出告警。告警应发送给能够修改路由或 Prompt 的负责人,而不是丢进一个最终沦为背景噪声的公共频道。

  5. 把失败与支出放在一起复盘

    打开高成本 Trace,把必要的复杂度与重试、过长上下文和工具故障区分开。如果大部分支出来自失败运行,可参考 Agent 故障分析工具对比,选择更深入的调试层。

2. Portkey:最适合网关级预算

**如果 Token 追踪必须位于同一条能够执行预算的请求路径上,Portkey 是最佳选择。**平台团队可以让模型流量经过网关,按用户、团队、工作流或功能标记请求,并监控输入 Token、输出 Token、总成本和预算使用率。它的限制在方案档位与模型覆盖:成本和 Token 预算只在 Enterprise 及部分 Pro 方案提供;不受支持的模型会显示为 $0.00,也不会计入供应商预算上限。如果控制请求路径比单独拥有一套评估系统更重要,选 Portkey。

展示各方案日志记录量与保留期的 Portkey 价格页面
Portkey

Portkey 在线价格页首先列出自托管 Open Source 网关:无请求上限,也无方案费。Developer 永久免费,每月可记录 10,000 条日志,日志保留 3 天,指标保留 30 天。超过额度后请求仍会继续,但多出的日志不会记录——流量越高,证据反而越不完整。

Production 每月 $49,包含 100,000 条日志、30 天日志保留、90 天指标保留、告警、RBAC 和服务账户密钥。超出后每增加 100,000 次请求收费 $9,最高至 3 million。Enterprise 采用定制价格,从每月 10 million-plus 条日志起,并增加细粒度预算与速率限制、自定义保留期、私有部署、数据导出和企业支持。

选购时必须验证“不受支持模型”这一行为。私有微调模型或新发布模型,需要先显式定义价格,预算才可信。否则仪表盘看似平静,供应商账单却可能持续上涨。

**最适合:**希望在同一条网关路径中完成成本归因与强制控制的团队
**突出优势:**基于元数据的成本分摊,以及符合条件方案中的细粒度预算和速率限制
**价格:**Open Source 标称方案费 $0;Developer $0;Production $49/月,超出后每 100,000 次请求另收 $9,最高至 3 million;Enterprise 定制价格
**免费试用:**免费 Developer 方案;锁定的价格页面未注明 Production 限时试用

优势
做得好的地方
7 points

  • 位于网关层,可把计量、路由和强制控制连接起来
  • 元数据支持按用户、团队、工作流或功能查看成本
  • Production 每月 $49,包含告警、RBAC 和服务账户密钥
  • 自托管 Open Source 没有标明请求上限
  • Developer 超过 10,000 条后会停止记录日志,但请求仍会继续
  • 不受支持的模型显示为 $0.00,也不会计入供应商预算上限
  • 细粒度预算需要 Enterprise 或符合条件的部分 Pro 方案

3. Helicone:最适合快速接入的代理式成本控制

**如果团队愿意让流量经过网关或代理,Helicone 是从原始模型请求快速走向成本控制的最短路径。**一个包含多个模型功能的产品,可以用自定义属性标记用户、功能、环境或工作流,把多次调用组合为 Session,并在同样的维度上限制请求数或以美分计的成本。它的边界是不同集成方式下的精度:Helicone 称网关数据可根据 Model Registry 准确计算,而直连供应商的路径依赖覆盖 300 多个模型的尽力而为价格库。如果快速获得基于成本的速率限制,比深度评估或基础设施关联更重要,选 Helicone。

展示 Hobby、Pro、Team 与 Enterprise 档位的 Helicone 价格页面
Helicone

Helicone 价格页的 Hobby 档位为 $0,每月包含 10,000 次请求、1 GB 存储、1 个席位、1 个组织和 7 天保留期。Pro 每月 $79,不限席位,包含 1 个组织、告警、报告、HQL、1 个月保留期;超过内含的 10,000 次请求和 1 GB 后按用量收费。Team 每月 $799,包含 5 个组织、3 个月保留期、SOC 2 与 HIPAA 支持,以及专属 Slack 频道。Pro 和 Team 均提供 7 天试用。Enterprise 定制价格,包含不限组织数、永久保留、SAML SSO、本地部署、大批量云折扣,以及最高每分钟 30,000 条日志的摄取能力。

Helicone 的速率限制可以应用于全局、单个用户或自定义属性,并可限制请求数或以美分计的成本。基于 Token 的速率限制仍标注为即将推出,因此需要严格 Token 上限的买方,不能假设成本限制具有完全相同的效果。

**最适合:**需要快速完成代理埋点和基于成本的请求控制的 SaaS 团队
**突出优势:**Session 与自定义属性,把多次调用的工作流连接到用户或功能层面的经济性
**价格:**Hobby $0;Pro $79/月另加用量费;Team $799/月另加用量费;Enterprise 定制价格
**免费试用:**Pro 和 Team 均为 7 天;Hobby 免费

优势
做得好的地方
7 points

  • 成本限制可按用户或自定义属性执行,不局限于账户级
  • Pro 不限席位,工程团队扩大后也不会增加协作席位费
  • Session 可把多次调用合并到一条工作流视图中
  • Enterprise 支持本地部署
  • 直连接入的价格精度是尽力而为,低于网关所宣称的标准
  • 基于 Token 的速率限制尚未提供
  • Team 直接升至 $799/月,为 5 个组织和合规支持付出的档位跨度很大

4. OpenLIT:最适合自托管的编程 Agent 追踪

**对于希望在 OpenTelemetry 原生技术栈中查看编程 Agent Session、Token 成本和代码仓库活动的开发者,OpenLIT 是最佳自托管选择。**已经运维 ClickHouse 和 OpenTelemetry Collector 的企业,可以把 Prompt、Trace 与历史数据留在自己的环境中,同时对编程 Agent 和模型调用统一埋点。代价是所有权责任:$0 的许可证并不覆盖部署、升级、存储、备份和访问控制,这些仍要计入工程预算。只有当遥测数据必须留在自有环境,而不仅是偏好如此时,才应选择 OpenLIT。

展示开源档位与 Cloud 状态的 OpenLIT 价格页面
OpenLIT

OpenLIT 价格页列出的 Apache 2.0 Open Source 档位为 $0,自托管用量、用户、项目、环境和历史数据均不设上限。Cloud 标注为“即将推出”,尚无公开价格。开源套件提供 OpenTelemetry 原生追踪、编程 Agent Session、成本、Token 和仓库活动追踪,以及自定义仪表盘。

OpenLIT 自带可更新的默认价格文件,也支持用自定义价格 JSON 覆盖私有、微调或不受支持的模型。这一显式覆盖机制很重要,因为自托管平台往往会接入 SaaS 目录无法识别的模型。不过,规划成本依然不可能是 0:数据库存储、Collector 容量、升级、事件响应和明确的负责人,都必须计入许可证之外。

**最适合:**具备基础设施能力、对数据所有权或编程 Agent 遥测有严格要求的团队
**突出优势:**Apache 2.0、OpenTelemetry 原生追踪,以及自定义模型价格
**价格:**Open Source 许可证 $0,自托管用量不限;Cloud 即将推出,暂无公开价格
**免费试用:**Open Source 无需试用;Cloud 尚不可购买,因此无法定价

优势
做得好的地方
7 points

  • 开源档位对自托管用户、项目、环境和历史数据均不设上限
  • 编程 Agent Session 能把 Token 成本与代码仓库活动关联起来
  • 自定义价格 JSON 可防止私有模型被误显示为零成本
  • OpenTelemetry 便于把数据带入现有遥测架构
  • 买方需要自行运维 OpenLIT、ClickHouse 和 OpenTelemetry Collector
  • Cloud 尚不能作为可购买的省事方案
  • 计入值班和升级人力后,$0 许可证可能比 SaaS 更贵

5. Braintrust:最适合权衡成本与质量的 AI 可观测性及评估平台

**当预算负责人必须把模型支出与 Score、错误和产品质量关联起来时,Braintrust 是能力最强的 AI 可观测性及评估平台。**客服自动化团队可以汇总 Prompt、Completion、缓存读取、缓存创建和 Token 总量,同时查看估算成本、工具调用、错误及延迟,再用 SQL 按用户或模型分组。它的边界仍是执行约束:Braintrust 为 Starter 和 Pro 提供自定义月度支出告警,但没有说明支持硬支出上限。只有当更便宜的模型在评估后仍足够好时才能采用,这种场景应选 Braintrust。

展示 Starter、Pro 与 Enterprise 档位的 Braintrust 价格页面
Braintrust

Braintrust 价格页显示,Starter 为 $0/月,含 $10 模型额度,之后按 Token 费率计费;含 1 GB 已处理数据,之后每 GB $4;含 10,000 个 Score,之后每 1,000 个 $2.50;数据保留 14 天,用户数不限。Pro 每月 $249,含 $100 模型额度,之后按 Token 费率计费;含 5 GB 已处理数据,之后每 GB $3;含 50,000 个 Score,之后每 1,000 个 $1.50;数据保留 30 天。Pro 的延长保留期每 GB 每月 $0.50。Enterprise 定制价格,提供自定义保留与导出、RBAC、高级支持,以及托管或本地部署。

这些不同的计量项都有实际意义:已处理数据对应 Trace 容量,Score 对应评估活动,模型 Token 对应推理费用。比较 Prompt 版本的团队,应同时建模这 3 项,而不能把 $249 平台费当成完整账单。

**最适合:**需要判断降低模型成本后,评估质量能否维持的产品团队
**突出优势:**Token 与成本汇总可和 Score、错误、工具调用及 SQL 分析一起查看
**价格:**Starter $0 另加用量费;Pro $249/月另加用量费;延长保留期 $0.50/GB/月;Enterprise 定制价格
**免费试用:**免费 Starter 方案,附带模型额度和用量额度

优势
做得好的地方
7 points

  • 成本、缓存使用、工具调用、错误、延迟和评估 Score 共用同一套 Trace 模型
  • SQL 支持按用户或模型进行归因分析
  • Starter 与 Pro 均不限用户数,无需做席位数量决策
  • Enterprise 的托管与本地部署可覆盖更严格的部署要求
  • 支出告警不会停止请求
  • 已处理数据、Score、模型用量和保留期形成多个浮动计量项
  • 如果不做评估工作,Pro 的 $249 基础费很难仅靠成本追踪来证明合理

6. Arize AX and Phoenix:最适合 OpenTelemetry 与评估组合

**Arize AX and Phoenix 适合希望获得符合 OpenTelemetry 的 Trace、Token 与成本追踪及评估能力,又不想先绑定网关的团队。**Arize AX 是托管产品,Phoenix 则是开源、本地优先的追踪和评估方案。平台负责人可以在开发阶段从 Phoenix 起步,等到托管保留、数据摄取和协同运维更重要时再使用 AX。它的短板是控制所在的位置:这套组合能解释和评估运行,但硬预算必须停止执行时,请求路径仍需要网关或应用策略。如果开放遥测和评估深度比原生支出执行更重要,选 Arize。

展示 AX Free、Pro 与 Enterprise 方案的 Arize 价格页面
Arize AX and Phoenix

Arize 价格页列出:AX Free 为 $0,每月包含 25,000 个 Trace Span、1 GB 摄取量、15 天保留期、不限用户数和不限评估次数。AX Pro 每月 $50,包含 50,000 个 Span、10 GB 摄取量、30 天保留期、不限用户数和不限评估次数。Enterprise 定制价格,Span、摄取量和保留期均可定制,并支持 SaaS 或自托管部署。Phoenix 开源且本地优先。

真正要关注的计量单位是 Span,而不是顶层 Trace。一次包含多个模型和工具调用的 Agent 运行可能产生多个 Span,因此 50,000 个 Span 的额度,可能远远覆盖不了 50,000 个终端用户任务。预测账单之前,应先为一条有代表性的工作流埋点,并统计其中位 Span 数。

**最适合:**已经标准化使用 OpenTelemetry,并需要托管或本地优先评估的团队
**突出优势:**AX 不限用户和评估次数,同时提供开源 Phoenix 路径
**价格:**AX Free $0;AX Pro $50/月;AX Enterprise 定制价格;Phoenix 开源
**免费试用:**免费 AX 档位与开源 Phoenix

优势
做得好的地方
7 points

  • 符合 OpenTelemetry 的追踪方式可降低埋点锁定风险
  • Free 和 Pro 均不限用户数与评估次数
  • Phoenix 为开发者提供开源、本地优先的起点
  • AX 可在评估数据旁查看 Token、延迟和成本
  • Span 数可能比终端用户工作流数增长得快得多
  • 托管数据在 Free 仅保留 15 天,在 Pro 仅保留 30 天
  • 需要按预算停止请求时,必须另加控制层

7. LangSmith:最适合深度依赖 LangChain 的改进闭环

**如果团队已经使用 LangChain,并让可观测性持续进入评估和改进闭环,LangSmith 就是合适的 Token 追踪选择。**它会把模型名称和 Token 数映射到价格,支持自定义模型价格,并区分保留 14 天的基础 Trace 与保留 400 天的扩展 Trace。它的短板是席位经济性:Plus 每个席位每月 $39,因此 10 人团队在额外 Trace 用量之前,就要支付 $390/月。选择 LangSmith,是为了 LangChain 技术栈中集成的追踪与评估,而不是为了得到最便宜的共享成本仪表盘。

展示 Developer、Plus 与 Enterprise 档位的 LangSmith 价格页面
LangSmith

LangSmith 价格页显示,Developer 每个席位每月 $0,包含 1 个席位和每月 5,000 个基础 Trace,之后按用量付费。Plus 每个席位每月 $39,整个组织每月共享 10,000 个基础 Trace,可增加更多席位,超过额度后按用量付费。Enterprise 定制价格,并增加自托管及混合部署、自定义 SSO、ABAC、RBAC、Workspace、席位和支持 SLA。

每个额外基础 Trace 消耗 0.005 个 LangSmith usage unit,即 LSU。1 个 LSU 价格为 $1.00;1 个 LangChain usage unit,即 LCU,价格为 $1.50。不同计量单位的术语本身,就再次说明了为什么在把 LangSmith 与按请求或 Span 计费的产品比较前,必须先对真实工作流建模。

**最适合:**把 Trace 复盘和评估作为日常产品开发流程的 LangChain 团队
**突出优势:**在更完整的 LangSmith 改进闭环中,完成模型成本映射和自定义定价
**价格:**Developer $0,含 1 个席位;Plus $39/席位/月;Enterprise 定制价格;额外基础 Trace 每个 0.005 LSU,1 LSU 为 $1,1 LCU 为 $1.50
**免费试用:**免费 Developer 方案;锁定的价格页面未注明 Plus 限时试用

优势
做得好的地方
7 points

  • 成本追踪位于成熟的 Trace 与评估工作流之中
  • 自定义模型价格可覆盖私有或协商费率的推理
  • 扩展 Trace 可保留 400 天
  • Enterprise 提供自托管与混合部署
  • Plus 按席位收费,而多款竞品不限用户数
  • 10 个 Plus 席位每年需 $4,680,且尚未计算额外用量
  • 基础 Trace 与扩展 Trace 的保留方式和经济性不同

8. Datadog Agent Observability:最适合现有 Datadog 团队

**当 Agent 成本需要与 Datadog 中已有的应用、基础设施和用户 Session 遥测关联时,Datadog Agent Observability 最为合适。**它能根据 Token 数,自动估算 800 多个文本模型的请求成本,也允许为私有或不受支持的模型手动传入成本。它的短板是从零采用时的经济性:Pro 按年承诺起价为 $160/月。只有当跨系统关联能够替代手工事件排查时,这笔溢价才会回本;如果个人开发者只想看一张 Token 图表,就不划算。当 Agent 只是现有生产系统的一部分,而非孤立实验时,选 Datadog。

展示 Free 与 Pro 方案的 Datadog Agent Observability 价格页面
Datadog Agent Observability

Datadog Agent Observability 价格页列出:Free 为 $0,每月最多 40,000 个 LLM Span,Trace 保留 15 天,上下文和评估不限量,并开放全部功能。Pro 每月包含 100,000 个 LLM Span;按年承诺为 $160/月,按月为 $200/月,按需为 $240/月。每增加 10,000 个 Span,按年、按月和按需价格分别为 $3.50、$4.20 和 $5。

默认 Trace 保留期为 15 天。每月每 10,000 个 LLM Span 的保留附加费分别为:30 天 $1.50、60 天 $3、90 天 $4。按年价格计算,每月 1 million 个 LLM Span 时,Pro 在计算保留附加费之前为 $475/月:$160 基础费,加 90 个每份 $3.50 的超额区间。

**最适合:**已经在 Datadog 中排查服务、基础设施、Session 和 Agent 的运维团队
**突出优势:**Agent Trace 可与其他生产遥测资产关联
**价格:**Free $0;Pro 按年 $160/月、按月 $200/月、按需 $240/月;超额用量与保留附加费另计
**免费试用:**免费档位在额度内开放全部功能

优势
做得好的地方
7 points

  • 自动成本估算覆盖 800 多个文本模型
  • 手动成本支持私有和不受支持的模型
  • 现有 Datadog 用户可以把 Agent 行为与服务及基础设施事件关联起来
  • Free 包含 40,000 个 LLM Span,并开放全部功能
  • 在本榜单靠前的成本优先型 SaaS 中,Pro 的基础费最高
  • 多步骤 Agent 每个用户工作流可能消耗多个 Span
  • 延长保留期会增加另一个按 Span 计费的项目

LLM 监控工具应该怎么选

**决策顺序应该是:先看执行控制,再看托管方式,然后看评估,最后才是价格。**首先明确支出上涨时,系统必须采取什么动作。如果必须阻止、改道或降低流量,应优先比较 Portkey 和 Helicone,并确认所购方案确实包含所需的预算控制。如果只需告警并解释原因,可选范围就会更广。

AI Agent 监控工具:一条实用决策规则

需要通用、模型无关的成本账本,同时保留 Trace 上下文并降低协作成本,选 Langfuse。Trace 不能离开自有环境,且组织已有相应基础设施运维能力,选 OpenLIT。每一次成本变化都要与输出质量一起评估,选 Braintrust 或 Arize。LangChain 集成价值高于节省席位费,选 LangSmith。如果事件复盘原本就从 Datadog 开始,继续选 Datadog。

从内置 Token 追踪走向团队成本归因与硬控制的决策流程
当个人用量视图变成团队控制问题时,采购决策也随之改变。

何时值得购买 LLM 可观测性工具

当第二位责任人需要查看同一套证据时,最好的 LLM 可观测性工具才开始值得购买。这个人可能是要把模型成本分摊给客户的财务负责人、要求数据留在本地的安全负责人、需要解释自动化失败的客服负责人,或比较每个有效结果成本的产品负责人。在此之前,内置用量统计可能已经够用。

几个明确的转折点如下:

  • **1 名开发者、1 台设备、1 条模型工作流:**继续使用 Claude Code /usage 和供应商账单。
  • **多名开发者或多台设备:**导出 OpenTelemetry,或采用共享平台。
  • **多个客户或产品功能:**必须支持基于元数据的归因。
  • **失控循环可能造成实质损失:**必须配置可强制执行的网关预算。
  • **更便宜的模型可能降低质量:**改变路由前先加入评估。
  • **Prompt 数据不能离开所在环境:**比较 OpenLIT、Langfuse 自托管、Phoenix,或 Enterprise 自托管方案。

网关也正是在这里发挥作用:它负责控制请求路径,可观测性产品则解释路径上及跨路径发生了什么。如果需要把路由、故障转移和策略放在一起,下一步可查看托管 Agent 工具网关对比

预算怎么算:仪表盘至少要赚回多少钱

**一套 Token 仪表盘,至少应该通过避免浪费或减少对账工作,赚回全部平台费用。**采用每个满负荷工程小时 $100 的透明规划假设,Langfuse Core 每月 $29 相当于 17.4 分钟;Portkey Production $49 相当于 29.4 分钟;Arize AX Pro $50 相当于 30 分钟;Helicone Pro $79 相当于 47.4 分钟;Datadog Pro 按年支付的 $160 相当于 96 分钟;Braintrust Pro $249 相当于 149.4 分钟;10 个 LangSmith Plus 席位共 $390,相当于 234 分钟。

这些只是盈亏平衡规划线,不是收益承诺。获得融资的创始人应该问:哪项重复工作会因此消失?如果答案是“每月有人要花 3 小时,手工把供应商 CSV 与客户对应起来”,几乎所有付费选项都能越过回本线。如果答案只是“图表更好看”,那就没有一款值得买。

Langfuse、Portkey、Helicone 与 10 个 LangSmith 席位的年度基础成本对比
未计浮动用量的年度基础费;按席位计费的方案以 10 个席位计算。

年度基础成本能直观看出协作定价差异:Langfuse Core 为 $348,Portkey Production 为 $588,Arize AX Pro 为 $600,Helicone Pro 为 $948,Datadog Pro 按年承诺为 $1,920,Braintrust Pro 为 $2,988,10 个 LangSmith Plus 席位为 $4,680。OpenLIT 许可证为 $0,但其基础设施和工程人力尚未计价。

不要把这组数字误读成单位价格竞赛。Langfuse 按 Trace、Observation 和 Score 计费,Portkey 按已记录请求计费,Datadog 按 LLM Span 计费,Braintrust 除模型用量外还按已处理数据和 Score 计费,LangSmith 则通过自有用量单位对 Trace 计费。一条客户工作流可能产生 1 次请求、多次生成、几十个 Span 和多个 Score。

正确的预测方法,是选择一条有代表性的工作流:

  1. 统计其中位模型调用数、Trace 数、Observation 数、Span 数和 Score 数。
  2. 乘以每月预计成功与失败的运行次数。
  3. 加上保留期、席位、已处理数据和模型推理费用。
  4. 纳入重试情景,因为故障工具会放大成本,却不会增加价值。
  5. 用总成本除以成功的业务结果,而不是 Agent 运行次数。

最后得到的才是运营指标。每张已解决工单、每次已接受代码变更、每笔已处理理赔或每条合格线索的成本,都可以跨 Prompt 和模型比较;Token 总数做不到。

只为成本控制时,应避开哪些选择

**如果一款综合可观测性平台最强的能力与预算问题无关,就不应为了成本控制而购买。**选错产品,可能收集了更多数据,却获得更少控制力。

  • **只用 Claude Code /usage 做团队成本分摊:**它适合查看 1 名开发者的本地历史,但不包含其他设备或 claude.ai,无法单独成为共享的客户成本账本。
  • **今天就有采购期限,却选择 OpenLIT Cloud:**价格页仍显示即将推出,也没有公开价格。只有明确有人能够负责运维时,才使用开源路径。
  • **只为成本协作购买 LangSmith Plus:**10 个席位每年 $4,680,还不含额外 Trace。只有 LangChain 追踪与评估闭环本身有价值时才值得支付;如果只需共享总额,Langfuse Core 每年 $348 就能做到。
  • **只为告警监控购买 Braintrust Pro:**只有 Score 和实验会指导模型选择时,$249/月才合理。如果唯一需求只是支出通知,很难证明这笔费用值得。
  • **为从零搭建的个人 Agent 购买 Datadog Pro:**按年承诺的 $160/月可以买到有价值的生产关联能力。在这项关联有明确负责人之前,本地 /usage 视图或免费档位是更好的起点。
  • **模型价格未知,却信任任意网关预算:**Portkey 明确说明,不受支持的模型显示为 $0.00,且不会计入供应商预算。在依赖上限前,先为私有模型和新模型定义价格。

这个品类中最危险的并非某一家厂商,而是那种模型覆盖不完整或遗漏运行,却仍报告出看似精确成本的仪表盘。必须让未知成本显式可见,与供应商账单对账,并用一次受控请求测试预算后,才能真正依赖它。

周一就做:先为 1 条昂贵工作流埋点

**到了周一,先为最可能制造意外账单的那 1 条工作流埋点。**不要一上来就覆盖所有模型调用。先选择一条已经令人担心的周期编程任务、客服升级流程、研究 Agent 或文档流水线,因为它的重试次数和上下文长度最容易推高成本。

给每次运行添加 4 个字段:客户或账户、工作流、环境和结果;再把模型与版本作为维度。设置一个值得调查的单位成本告警。如果某次失控运行可能造成实质损失,就在网关中加入成本或请求上限,并在启用前定义好后备行为。

到周五时,复盘 3 组运行:接近中位成本的成功运行、成本最高的成功运行,以及昂贵的失败运行。这样才能把必要复杂度与浪费区分开。高价模型如果能减少重试或人工升级,成本更高也可能获胜;低价模型如果拉长 Trace 并增加失败处理,反而可能输掉。

以每周产生 1 项决策作为采用测试:修改路由规则、缩短上下文、修复工具重试、更新自定义价格,或者取消仪表盘。如果一个测量系统连续 4 次复盘都没有带来任何决策,就不值得进一步推广。

常见问题

2026 年最好的 AI Agent 是什么?

不存在适合所有任务的最佳 AI Agent。对成本控制来说,真正需要选择的是围绕现有生产 Agent 的可观测性层:广泛的成本归因选 Langfuse,需要强制控制选 Portkey 或 Helicone,必须同时判断质量与价格时则选以评估为中心的工具。

2026 年最值得学习的 AI 工具有哪些?

应学习与你所运维技术栈匹配的工具。个人 Claude Code 用户先掌握 /usage 与 OpenTelemetry;产品团队应学习基于元数据的 Trace 和单位成本分析;负责模型路由的平台团队则应学习网关预算和后备策略。

主流 AI Agent 工具有哪些?

需要把 Agent 运行时与负责观察它们的工具分开。本榜单比较 Langfuse、Portkey、Helicone、OpenLIT、Braintrust、Arize AX and Phoenix、LangSmith 和 Datadog Agent Observability,聚焦 Token、成本、Trace 与控制,并不评选执行底层业务任务的 Agent。

2026 年全球最好的 AI 应用是什么?

任务、工作流、数据边界和预算共同决定价值,因此不存在站得住脚的通用第一。就 Agent Token 追踪而言,Langfuse 是本次对比的综合首选;如果首要需求是可强制执行的预算,Portkey 更胜一筹。

哪个 AI 比 ChatGPT 更好?

模型偏好不能替代成本归因。一个生产 Agent 可能在同一条工作流中使用 OpenAI、Anthropic、Google、开源模型或多个供应商。无论如何选择,追踪层都应完整保留客户、工作流、结果和成本证据。

2026 年最先进的 AI 是什么?

能力变化太快,不可能有永久不变的答案。可观测性平台应保持模型无关,支持自定义价格,并在底层模型更换后,仍能持续比较历史成本与结果数据。

Elon Musk 使用哪款 AI?

公众人物选择哪款模型,并不是选择 Token 追踪工具的有效标准。应依据工作流实际调用的模型、预算负责人需要的元数据、必须保护的数据边界,以及系统是否需要强制限制来选基础设施。

哪款 AI 工具最强大?

在这个品类里,“强大”意味着能把支出关联到工作流,并改变下一步行动。没有归因的深度 Trace 并不完整;需要控制损失时,只有精准告警却不能执行限制也不完整。覆盖必要边界、又不引入无用范围的工具,才是最强的工具。

2026 年 Claude 和 ChatGPT 哪个更好?

Claude 或 ChatGPT 应按任务质量、延迟、上下文与商业条款选择。追踪层则应单独选择,让组织能够跨模型比较每个成功结果的成本,而不必每次切换模型后重建账本。

增加下一套仪表盘前,先审计工作流

追踪工具是最后一步,而不是第一步。免费获取 AI 业务工作流审计清单,先明确工作流、负责人、结果与控制点,再让另一套平台进入预算。

最近更新

2026年9月2日

分类Build

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Build 文章

查看全部 Build 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。