LLM observability: 8 herramientas para controlar tokens y costos de IA en 2026

Compara 8 herramientas de observabilidad para agentes de IA por costos, límites y trazas, desde Langfuse hasta Datadog, con precios verificados.

Wednesday, September 2, 2026Omid Saffari
LLM observability: 8 herramientas para controlar tokens y costos de IA en 2026

La lista de las mejores herramientas de LLM observability para seguir tokens de agentes de IA en 2026 tiene un ganador claro: Langfuse ofrece a los equipos de producción atribución de costos y usuarios ilimitados desde $29 al mes. Las nuevas filas de bucles de /usage en Claude Code hacen innecesario un panel aparte para un solo desarrollador; conviene pagar por uno únicamente cuando se necesita repartir costos entre modelos, imponer presupuestos estrictos o rastrear responsabilidades hasta cada traza.

LLM observability en 2026: comparación rápida

Langfuse es la mejor opción general para la mayoría de los equipos de producto y plataforma. Su plan Core de $29 al mes reúne seguimiento de tokens de IA y costos, usuarios ilimitados, una retención útil, contexto de trazas y un modelo de facturación que cualquier responsable presupuestario puede explicar. Portkey pasa al frente cuando las solicitudes deben detenerse al alcanzar un límite presupuestario. OpenLIT es la alternativa más sólida cuando controlar los datos importa más que evitar el trabajo de infraestructura.

Los precios y límites que aparecen a continuación se verificaron en las páginas activas de cada proveedor el 1 de septiembre de 2026. El precio inicial corresponde al primer nivel de pago que un equipo pequeño de producción podría usar de forma realista. Salvo que se indique lo contrario, la inferencia de modelos, los excedentes de almacenamiento, la infraestructura para alojamiento propio y el trabajo de implementación se pagan aparte.

Las ocho opciones de un vistazo

HerramientaIdeal paraPrecio inicialPrueba gratis
LangfuseAtribución general de costosCore $29 al mesPlan Hobby gratuito
PortkeyPresupuestos y límites de frecuencia en el gatewayProduction $49 al mesPlan Developer gratuito
HeliconeControles rápidos mediante proxyPro $79 al mes7 días
OpenLITTelemetría autoalojada para agentes de programaciónLicencia OSS de $0No requiere prueba
BraintrustCostos vinculados con evaluaciónPro $249 al mesPlan Starter gratuito
Arize AX and PhoenixOpenTelemetry más evaluaciónAX Pro $50 al mesNivel AX gratuito y Phoenix OSS
LangSmithCiclos de mejora centrados en LangChainPlus $39 por usuario al mesPlan Developer gratuito
Datadog Agent ObservabilityOperaciones que ya usan DatadogPro $160 al mes con pago anualNivel gratuito

Un panel gratuito no equivale a una capa de control gratuita. Claude Code, Langfuse, Braintrust, Arize, LangSmith y Datadog pueden hacer visible el gasto, pero verlo no evita automáticamente la siguiente ejecución costosa. Portkey ofrece presupuestos granulares y límites de frecuencia en Enterprise y determinados planes Pro. Helicone permite limitar la cantidad de solicitudes o el costo en centavos por usuario u otra propiedad personalizada. Esa diferencia debería definir la lista corta antes que las preferencias de interfaz.

La observabilidad de agentes empieza donde termina el conteo de tokens

La observabilidad de agentes permite explicar qué hizo un agente, cuánto costó cada paso, quién lo originó y si el resultado justificó el gasto. Un contador de tokens solo responde una parte de esa cadena. Un agente puede llamar cinco veces a un modelo, recuperar contexto, utilizar herramientas, reintentar tras un error y terminar con una respuesta deficiente. La pregunta financiera no es «¿cuántos tokens?», sino «¿qué workflow de cliente los consumió y tuvo éxito?».

Claude Code elevó el punto de partida. Su documentación actual de /usage indica que la vista Session muestra estadísticas detalladas de tokens y un importe estimado localmente en dólares. En los planes de suscripción, Claude Code v2.1.242 o posterior también incorpora una fila Loops para las tareas /loop o programadas de mayor consumo, con el número de ejecuciones, los tokens totales, los tokens por ejecución y la ejecución más reciente. Así, un desarrollador técnico que trabaja por su cuenta ya puede encontrar una tarea recurrente fuera de control sin comprar otro panel.

Esa vista local tiene un límite claro. Day y Week son aproximaciones calculadas a partir del historial local de sesiones de las últimas 24 horas o 7 días. No incluyen el trabajo realizado en otros dispositivos ni en claude.ai. La vía documentada para obtener métricas casi en tiempo real y por usuario en toda una organización es exportar OpenTelemetry a la propia plataforma de observabilidad de la empresa.

La observabilidad de agentes de IA aporta contexto al workflow

Imagine un agente de soporte que gasta $0.18 en un ticket y $1.40 en otro. Una pantalla de tokens identifica el ticket caro. La observabilidad de agentes de IA revela que el segundo ticket reintentó cuatro veces la misma herramienta, recurrió a un modelo premium después de escalar el caso y aun así terminó derivado a una persona. Con ese contexto, el responsable puede cambiar el enrutamiento, fijar un presupuesto y medir el costo por ticket resuelto en vez del costo por prompt.

Un registro útil consta de cuatro capas:

  • Ejecución: un intento completo del agente, incluidas las llamadas al modelo y a las herramientas.
  • Atribución: el cliente, usuario, equipo, entorno, workflow o función a quien pertenece la ejecución.
  • Resultado: éxito, fallo, derivación, latencia, puntuación de calidad o evento de ingresos.
  • Control: una alerta antes de que el presupuesto se vuelva problemático y un límite aplicable cuando el workflow deba detenerse.

Por eso un panel barato puede salir caro. Si cada viernes el equipo dedica dos horas a relacionar las facturas de los modelos con identificadores de clientes, una plataforma de $29 puede amortizarse rápidamente. Si nadie revisa los datos ni se responsabiliza de un objetivo de costo unitario, incluso una solución gratuita y de código abierto se convierte en otro sistema que mantener.

Cómo se eligieron estas herramientas de observabilidad para agentes de IA

Estas herramientas de observabilidad para agentes de IA se compararon y valoraron con sus páginas de producto activas; no se presentan como pruebas prácticas. Ocho productos entraron en la lista porque todos pueden vincular el uso del modelo con un registro de producción más completo. Se descartaron los que solo muestran la factura de un proveedor, estiman el total de un chatbot genérico o hablan de observabilidad sin evidencia pública vigente.

Cuatro pruebas que toda herramienta de observabilidad de agentes debe superar

La clasificación depende de cuatro pruebas prácticas.

  1. ¿Calcula el costo con precisión? La herramienta debe aceptar el consumo informado por el proveedor o relacionar el modelo y el número de tokens con un precio vigente. Los modelos privados necesitan una vía para introducir precios personalizados. Un $0.00 silencioso es peor que un «desconocido» visible.
  2. ¿Puede atribuir el costo? Las etiquetas de usuario, cliente, workflow, modelo, entorno y resultado convierten una factura en una decisión. Un total sin responsable no permite repartir costos.
  3. ¿Puede controlar la siguiente solicitud? Las alertas solo resuelven una parte del problema. Los presupuestos de costos, límites de solicitudes o políticas de gateway puntúan mejor porque pueden cambiar la ejecución.
  4. ¿Puede el comprador entender la unidad de cobro? Las trazas, spans, solicitudes, observaciones, puntuaciones y gigabytes procesados no son intercambiables. Los precios públicos pesan más que una cotización comercial opaca.

El contexto de las trazas y la evaluación resuelven los empates. Una plataforma que muestra qué llamada de herramienta falló detrás de un pico de costos resulta más útil que otra que solo dibuja una línea ascendente. La propiedad de los datos también cuenta, sobre todo para empresas que no pueden enviar prompts, respuestas o metadatos de clientes a otro producto SaaS.

Las herramientas de observabilidad LLM deben justificar el panel

Las mejores herramientas de observabilidad LLM se ganan su lugar cuando cambian una decisión semanal. Un responsable de producto debería responder tres preguntas en minutos: ¿qué workflow aumentó su costo unitario? ¿El alza se debió al volumen, a la elección del modelo, a los reintentos o a un contexto más largo? ¿Qué cambio de enrutamiento, prompt, caché o política corresponde hacer después?

Una plataforma incapaz de responderlas es un almacén de telemetría, no una solución de gestión de costos. Puede seguir siendo útil para depurar, pero no debería pagarse con el presupuesto de tokens. Esta diferencia también explica que la lista incluya productos centrados en evaluación, como Braintrust y Arize, aunque Portkey y Helicone —orientados a aplicar controles— queden por encima para una tarea pura de control de costos de IA.

Las 8 herramientas, ordenadas

1. Langfuse Agent Observability: la mejor opción general

Langfuse Agent Observability ocupa el primer puesto porque Langfuse ofrece a un equipo de producción atribución de costos, contexto de trazas, alojamiento flexible y usuarios ilimitados desde $29 al mes. Una plataforma SaaS B2B puede etiquetar cada generación por cliente, función, entorno y versión, y luego usar paneles o Metrics API para comparar el costo por workflow completado. Su límite está en la aplicación de controles: Langfuse documenta alertas por umbral, pero aún hace falta un gateway o una política de la aplicación para rechazar solicitudes que excedan el presupuesto. El veredicto se resume así: elija Langfuse cuando el registro financiero y la traza deban permanecer unidos, y añada controles solo donde la exposición a pérdidas lo justifique.

Página de precios de Langfuse con los planes Cloud y de alojamiento propio
Langfuse

La página de precios de Langfuse define una unidad facturable como una traza, observación o puntuación; por tanto, una ejecución con varias observaciones consume varias unidades. El plan Cloud Hobby es gratuito e incluye 50,000 unidades al mes, 30 días de acceso a los datos y dos usuarios. Core cuesta $29 al mes por 100,000 unidades, 90 días de acceso a los datos y usuarios ilimitados; el consumo adicional parte de $8 por cada 100,000 unidades y baja con el volumen. Pro cuesta $199 al mes por 100,000 unidades, tres años de acceso a los datos, gestión de la retención, límites de frecuencia elevados y usuarios ilimitados; el complemento opcional Teams cuesta $300 al mes. Enterprise cuesta $2,499 al mes, incluye 100,000 unidades y ofrece precios personalizados por volumen anual. Open Source autoalojado es gratuito bajo licencia MIT e incluye uso ilimitado, mientras que Enterprise autoalojado tiene precio personalizado.

Langfuse puede inferir el costo a partir de sus definiciones de modelos, pero, cuando recibe ambos valores, da prioridad a los suministrados con la traza. Es el comportamiento adecuado para tarifas negociadas con el proveedor o modelos internos. El costo se puede filtrar por etiquetas y usuarios, y después exportarse mediante Metrics API a un panel financiero o un informe de margen por cliente.

Ideal para: Equipos de producto y plataforma que necesitan asignar costos a nivel de traza sin pagar por usuario
Destacado: Filtros por usuario y etiqueta, costos personalizados incorporados y despliegue en la nube o autoalojado
Precio: Hobby $0; Core $29 al mes; Pro $199 al mes; complemento Teams $300 al mes; Enterprise $2,499 al mes; Open Source autoalojado $0; Enterprise autoalojado con precio personalizado
Prueba gratis: Plan Hobby gratuito; no requiere prueba con plazo limitado

Lo bueno
Lo que hace bien
7 points

  • Core incluye usuarios ilimitados, por lo que un ciclo de revisión de diez personas se mantiene en $29 al mes antes del consumo
  • Los valores de costo incorporados prevalecen sobre las estimaciones, algo útil con tarifas personalizadas o con descuento
  • Metrics API y los filtros por etiquetas permiten repartir costos por cliente, función y workflow
  • El alojamiento propio con licencia MIT ofrece una vía creíble para conservar el control de los datos
  • Una ejecución con muchas observaciones y puntuaciones consume más unidades de lo que sugiere el número de trazas
  • Las alertas por umbral no sustituyen un límite estricto en el gateway
  • Pro salta de $29 a $199 al mes antes del complemento opcional Teams de $300

Un registro práctico de costos con Langfuse

La implementación más rápida comienza con un workflow, no con un proyecto de instrumentación para toda la empresa.

  1. Elija la unidad de valor empresarial

    Seleccione un resultado completado, como un ticket resuelto, un lead calificado, un cambio de código aceptado o una factura procesada. Evite usar «ejecución del agente» como unidad de negocio, ya que una ejecución puede fallar sin generar valor.

  2. Añada cuatro dimensiones

    Envíe el cliente o la cuenta, el workflow, el entorno y el modelo como metadatos o etiquetas de la traza. Agregue un campo de resultado —éxito, derivación, fallo o puntuación— para poder dividir el costo entre el trabajo útil.

  3. Indique el precio cuando la inferencia sea privada

    Use las definiciones de modelos de Langfuse para los proveedores compatibles. Si la tarifa es negociada, autoalojada o privada, incorpore directamente los valores de uso y costo para evitar que un modelo desconocido aparezca como gratuito.

  4. Configure una alerta por umbral

    Active una alerta sobre el total diario de un workflow o un límite de costo unitario. Envíela a quien pueda cambiar el enrutamiento o los prompts, no a un canal general donde termine convertida en ruido de fondo.

  5. Revise los fallos junto con el gasto

    Abra las trazas costosas y separe la complejidad productiva de los reintentos, el contexto excesivo y los fallos de herramientas. Si los fallos dominan el gasto, consulte la comparación para analizar fallos de agentes y elija una capa de depuración más profunda.

2. Portkey: la mejor para presupuestos a nivel de gateway

Portkey es la mejor opción cuando el seguimiento de tokens debe residir en la misma ruta capaz de hacer cumplir un presupuesto. Un equipo de plataforma puede dirigir el tráfico de los modelos por el gateway, etiquetar las solicitudes por usuario, equipo, workflow o función, y supervisar tokens de entrada, tokens de salida, costo total y uso del presupuesto. El límite está en la disponibilidad por plan y en la cobertura de modelos: los presupuestos de costos y tokens se ofrecen en Enterprise y determinados planes Pro, y un modelo no compatible aparece como $0.00 y no cuenta para el límite presupuestario del proveedor. Elija Portkey cuando controlar la ruta importe más que disponer de una suite de evaluación independiente.

Página de precios de Portkey con los registros guardados y la retención de cada plan
Portkey

Los precios vigentes de Portkey parten de un gateway Open Source autoalojado que declara no tener límite de solicitudes ni tarifa de plan. Developer es gratuito de forma permanente, con 10,000 registros guardados al mes, tres días de retención de registros y 30 días de retención de métricas. Las solicitudes siguen procesándose una vez agotado el cupo, pero los registros excedentes no se guardan; justo cuando aumenta el tráfico aparece un vacío de evidencia.

Production cuesta $49 al mes e incluye 100,000 registros guardados, 30 días de registros, 90 días de métricas, alertas, RBAC y claves de cuentas de servicio. Cada bloque adicional de 100,000 solicitudes cuesta $9 hasta llegar a 3 millones. Enterprise tiene precio personalizado, comienza en más de 10 millones de registros guardados al mes e incorpora presupuestos y límites de frecuencia granulares, retención personalizada, despliegue privado, exportación de datos y soporte empresarial.

El comportamiento con modelos no compatibles es la prueba decisiva antes de comprar. Un fine-tune privado o un modelo recién lanzado necesita una definición explícita de precio antes de confiar en el presupuesto. De lo contrario, el panel puede parecer tranquilo mientras aumenta la factura del proveedor.

Ideal para: Equipos que quieren atribución y aplicación de costos en la misma ruta del gateway
Destacado: Reparto de costos basado en metadatos, además de presupuestos granulares y límites de frecuencia en los planes que cumplen los requisitos
Precio: Open Source con tarifa de plan declarada de $0; Developer $0; Production $49 al mes más $9 por cada 100,000 solicitudes adicionales hasta 3 millones; Enterprise con precio personalizado
Prueba gratis: Plan Developer gratuito; la página de precios consultada no indica una prueba temporal de Production

Lo bueno
Lo que hace bien
7 points

  • Su posición en el gateway permite conectar la medición con el enrutamiento y la aplicación de controles
  • Los metadatos permiten analizar costos por usuario, equipo, workflow o función
  • Production incluye alertas, RBAC y claves de cuentas de servicio por $49 al mes
  • Open Source autoalojado no declara ningún límite de solicitudes
  • Developer deja de guardar registros por encima de 10,000 sin detener las solicitudes
  • Los modelos no compatibles aparecen como $0.00 y no cuentan para los límites presupuestarios del proveedor
  • Los presupuestos granulares requieren Enterprise o uno de los planes Pro que los incluyen

3. Helicone: la mejor para controlar costos rápidamente mediante proxy

Helicone ofrece la ruta más rápida desde las solicitudes sin procesar de los modelos hasta los controles de costos cuando el equipo acepta pasar el tráfico por un gateway o proxy. Un producto con varias funciones respaldadas por modelos puede añadir propiedades personalizadas de usuario, función, entorno o workflow, agrupar sesiones con múltiples llamadas y limitar las solicitudes o el costo en centavos en esas mismas dimensiones. Su límite es la precisión entre integraciones: Helicone describe como exactos los cálculos del gateway basados en su Model Registry, mientras que las conexiones directas con proveedores aplican precios orientativos a partir de un repositorio que cubre más de 300 modelos. Elija Helicone cuando llegar pronto a límites de frecuencia basados en costos importe más que una evaluación profunda o la correlación con la infraestructura.

Página de precios de Helicone con los niveles Hobby, Pro, Team y Enterprise
Helicone

Los precios de Helicone comienzan con Hobby a $0 por 10,000 solicitudes al mes, 1 GB de almacenamiento, un puesto, una organización y siete días de retención. Pro cuesta $79 al mes e incluye puestos ilimitados, una organización, alertas, informes, HQL, un mes de retención y cargos por uso después de las 10,000 solicitudes y 1 GB incluidos. Team cuesta $799 al mes por cinco organizaciones, tres meses de retención, compatibilidad con SOC 2 y HIPAA, y un canal de Slack dedicado. Tanto Pro como Team ofrecen una prueba de siete días. Enterprise tiene precio personalizado e incluye organizaciones ilimitadas, retención indefinida, SAML SSO, despliegue en las propias instalaciones, descuentos por volumen en la nube e ingesta de hasta 30,000 registros por minuto.

Los límites de frecuencia de Helicone pueden aplicarse globalmente, por usuario o por propiedad personalizada. Permiten limitar la cantidad de solicitudes o el costo en centavos. Los límites basados en tokens todavía figuran como una función futura, de modo que quien necesite un techo literal de tokens no debería asumir que los límites de costo se comportan igual.

Ideal para: Equipos SaaS que necesitan instrumentación rápida mediante proxy y controles de solicitudes basados en costos
Destacado: Las sesiones y propiedades personalizadas vinculan workflows de múltiples llamadas con los costos de cada usuario o función
Precio: Hobby $0; Pro $79 al mes más consumo; Team $799 al mes más consumo; Enterprise con precio personalizado
Prueba gratis: Siete días para Pro y Team; Hobby es gratuito

Lo bueno
Lo que hace bien
7 points

  • Los límites de costos pueden aplicarse por usuario o propiedad personalizada, no solo a nivel de cuenta
  • Los puestos ilimitados de Pro evitan que la colaboración se encarezca al crecer el equipo de ingeniería
  • Las sesiones reúnen varias llamadas en una sola vista del workflow
  • Enterprise permite el despliegue en las propias instalaciones
  • En integraciones directas, los precios son orientativos y no alcanzan el estándar de precisión declarado para el gateway
  • Los límites de frecuencia basados en tokens todavía no están disponibles
  • Team salta a $799 al mes, un aumento importante por cinco organizaciones y soporte de cumplimiento

4. OpenLIT: la mejor para seguir agentes de programación con alojamiento propio

OpenLIT es la mejor opción autoalojada para quienes buscan sesiones de agentes de programación, costos de tokens y actividad de repositorios en una plataforma nativa de OpenTelemetry. Una empresa que ya opera ClickHouse y un OpenTelemetry Collector puede conservar prompts, trazas e historial en su propio entorno mientras instrumenta conjuntamente agentes de programación y llamadas a modelos. El límite es la responsabilidad operativa: la licencia de $0 deja el despliegue, las actualizaciones, el almacenamiento, las copias de seguridad y el control de acceso dentro del presupuesto de ingeniería. Elija OpenLIT cuando mantener la telemetría en su entorno sea un requisito y no una simple preferencia.

Página de precios de OpenLIT con el nivel de código abierto y el estado de Cloud
OpenLIT

Los precios de OpenLIT presentan el nivel Open Source con licencia Apache 2.0 a $0 y uso, usuarios, proyectos, entornos y datos históricos ilimitados en alojamiento propio. Cloud figura como «coming soon» y no publica ningún precio. El paquete de código abierto incluye trazas nativas de OpenTelemetry, seguimiento de sesiones de agentes de programación, costos, tokens y actividad de repositorios, además de paneles personalizados.

OpenLIT distribuye un archivo predeterminado de precios que se puede actualizar y admite un JSON de precios personalizado para modelos privados, con ajuste fino o no compatibles. Esa sustitución explícita importa porque una plataforma autoalojada suele combinarse con un modelo que un catálogo SaaS no reconoce. Sin embargo, la cifra de planificación no es cero: al costo de la licencia hay que sumar almacenamiento de base de datos, capacidad de OpenTelemetry Collector, actualizaciones, respuesta a incidentes y una persona responsable.

Ideal para: Equipos con capacidad de infraestructura y requisitos estrictos de propiedad de datos o telemetría de agentes de programación
Destacado: Seguimiento con licencia Apache 2.0 y nativo de OpenTelemetry, con precios personalizados para modelos
Precio: Licencia Open Source de $0 con uso autoalojado ilimitado; Cloud estará disponible próximamente y no publica precio
Prueba gratis: Open Source no requiere prueba; Cloud todavía no está disponible para consultar su precio

Lo bueno
Lo que hace bien
7 points

  • Usuarios, proyectos, entornos e historial ilimitados en alojamiento propio dentro del nivel de código abierto
  • Las sesiones de agentes de programación vinculan el costo de tokens con la actividad del repositorio
  • El JSON de precios personalizado evita que los modelos privados parezcan gratuitos
  • OpenTelemetry permite trasladar los datos a una arquitectura de telemetría existente
  • El comprador debe operar OpenLIT, ClickHouse y OpenTelemetry Collector
  • Cloud aún no es una alternativa lista para comprar
  • Una licencia de $0 puede costar más que un SaaS al contabilizar las guardias y el trabajo de actualización

5. Braintrust: la mejor plataforma de observabilidad y evaluación de IA para decidir entre costo y calidad

Braintrust es la plataforma de observabilidad y evaluación de IA más sólida cuando el responsable del presupuesto debe relacionar el gasto del modelo con puntuaciones, errores y calidad del producto. Un equipo de automatización de soporte puede consolidar los tokens de prompt, finalización, lectura de caché, creación de caché y totales junto con el costo estimado, las llamadas a herramientas, los errores y la latencia; después puede agrupar esas métricas por usuario o modelo mediante SQL. Su límite es la aplicación de controles: Braintrust documenta alertas personalizadas de gasto mensual para Starter y Pro, pero no límites estrictos de gasto. Elija Braintrust cuando un modelo más barato solo sea aceptable si la evaluación demuestra que su respuesta conserva la calidad necesaria.

Página de precios de Braintrust con los niveles Starter, Pro y Enterprise
Braintrust

Los precios de Braintrust indican que Starter cuesta $0 al mes e incluye $10 en créditos de modelos, tras los cuales se aplican las tarifas por token; 1 GB de datos procesados, seguido de $4 por GB; 10,000 puntuaciones, seguido de $2.50 por cada 1,000; 14 días de retención y usuarios ilimitados. Pro cuesta $249 al mes e incluye $100 en créditos de modelos, tras los cuales se aplican las tarifas por token; 5 GB de datos procesados, seguido de $3 por GB; 50,000 puntuaciones, seguido de $1.50 por cada 1,000; y 30 días de retención. La retención ampliada en Pro cuesta $0.50 por GB al mes. Enterprise tiene precio personalizado e incorpora retención y exportación personalizadas, RBAC, soporte premium y despliegue alojado o en las propias instalaciones.

Sus múltiples unidades de cobro son relevantes. Los datos procesados pagan el volumen de trazas, las puntuaciones pagan la actividad de evaluación y los tokens del modelo pagan la inferencia. Un equipo que compare versiones de prompts debe modelar las tres partidas en vez de tratar los $249 de la plataforma como la factura completa.

Ideal para: Equipos de producto que deciden si un menor costo de modelo conserva la calidad evaluada
Destacado: Los resúmenes de tokens y costos conviven con puntuaciones, errores, llamadas a herramientas y análisis SQL
Precio: Starter $0 más consumo; Pro $249 al mes más consumo; retención ampliada a $0.50 por GB al mes; Enterprise con precio personalizado
Prueba gratis: Plan Starter gratuito con créditos de modelos y cupos incluidos

Lo bueno
Lo que hace bien
7 points

  • Costo, uso de caché, llamadas a herramientas, errores, latencia y puntuaciones de evaluación comparten un mismo modelo de trazas
  • SQL permite analizar la atribución por usuario o modelo
  • Los usuarios ilimitados en Starter y Pro eliminan la decisión por número de puestos
  • Las opciones Enterprise alojada y en las propias instalaciones cubren necesidades de despliegue más estrictas
  • Las alertas de gasto no detienen las solicitudes
  • Los datos procesados, las puntuaciones, el uso del modelo y la retención crean varias unidades variables de cobro
  • La base de $249 de Pro resulta difícil de justificar para seguir costos si no se realizan evaluaciones

6. Arize AX and Phoenix: la mejor combinación de OpenTelemetry y evaluación

Arize AX and Phoenix encajan en equipos que buscan trazas compatibles con OpenTelemetry, seguimiento de tokens y costos, y evaluación sin comprometerse primero con un gateway. Arize AX es el producto gestionado, mientras que Phoenix ofrece trazas y evaluación locales y de código abierto. Un responsable de plataforma puede empezar con Phoenix durante el desarrollo y pasar a AX cuando importen la retención gestionada, la ingesta y las operaciones compartidas. El límite está en la capa de control: esta combinación explica y evalúa las ejecuciones, pero la ruta de solicitudes sigue necesitando un gateway o una política de aplicación cuando un presupuesto estricto deba frenar la ejecución. Elija Arize si la telemetría abierta y la profundidad de evaluación pesan más que aplicar controles de gasto de forma nativa.

Página de precios de Arize con los planes AX Free, Pro y Enterprise
Arize AX and Phoenix

Los precios de Arize sitúan AX Free en $0 con 25,000 spans de traza al mes, 1 GB de ingesta, 15 días de retención, usuarios ilimitados y evaluaciones ilimitadas. AX Pro cuesta $50 al mes e incluye 50,000 spans, 10 GB de ingesta, 30 días de retención, usuarios ilimitados y evaluaciones ilimitadas. Enterprise tiene precio personalizado, con volúmenes personalizados de spans, ingesta y retención, además de despliegue SaaS o autoalojado. Phoenix es de código abierto y prioriza el uso local.

La unidad que se debe vigilar son los spans, no las trazas de nivel superior. Una ejecución de agente con muchas llamadas a modelos y herramientas puede emitir numerosos spans, por lo que el cupo de 50,000 spans podría cubrir muchas menos de 50,000 tareas de usuarios finales. Instrumente un workflow representativo y cuente su mediana de spans antes de proyectar la factura.

Ideal para: Equipos estandarizados en OpenTelemetry que necesitan evaluación gestionada o con prioridad local
Destacado: Usuarios y evaluaciones ilimitados con AX, además de la vía de código abierto de Phoenix
Precio: AX Free $0; AX Pro $50 al mes; AX Enterprise con precio personalizado; Phoenix de código abierto
Prueba gratis: Nivel AX gratuito y Phoenix de código abierto

Lo bueno
Lo que hace bien
7 points

  • Las trazas compatibles con OpenTelemetry reducen la dependencia de una instrumentación propietaria
  • Free y Pro incluyen usuarios y evaluaciones ilimitados
  • Phoenix ofrece a los desarrolladores un punto de partida local y de código abierto
  • AX sigue tokens, latencia y costos junto con los datos de evaluación
  • El número de spans puede crecer mucho más rápido que el de workflows de usuarios finales
  • La retención gestionada es de 15 días en Free y 30 días en Pro
  • Hace falta una capa de control independiente cuando el presupuesto debe detener solicitudes

7. LangSmith: la mejor para un ciclo de mejora muy centrado en LangChain

LangSmith es la opción adecuada para seguir tokens cuando el equipo ya utiliza LangChain y la observabilidad alimenta un ciclo continuo de evaluación y mejora. Relaciona los nombres de modelos y el número de tokens con precios, acepta entradas personalizadas de precios de modelos y diferencia las trazas base con 14 días de retención de las trazas ampliadas con 400 días. El límite es la economía por puesto: Plus cuesta $39 por puesto al mes, de modo que un grupo de diez personas paga $390 al mes antes del consumo adicional de trazas. Elija LangSmith por sus trazas y evaluación integradas en una plataforma muy basada en LangChain, no como el panel compartido de costos más barato.

Página de precios de LangSmith con los niveles Developer, Plus y Enterprise
LangSmith

Los precios de LangSmith fijan Developer en $0 por puesto al mes para un puesto y 5,000 trazas base mensuales; a partir de ahí, se cobra por uso. Plus cuesta $39 por puesto al mes e incluye 10,000 trazas base mensuales para toda la organización, permite añadir puestos y cobra por uso después del cupo. Enterprise tiene precio personalizado e incorpora opciones autoalojadas e híbridas, SSO personalizado, ABAC, RBAC, espacios de trabajo, puestos y un SLA de soporte.

Cada traza base adicional cuesta 0.005 LangSmith usage units, o LSUs. Un LSU cuesta $1.00, mientras que una LangChain usage unit, o LCU, cuesta $1.50. Este vocabulario de unidades es otra razón para modelar el workflow real antes de comparar LangSmith con un producto que cobre por solicitud o por span.

Ideal para: Equipos de LangChain donde revisar trazas y evaluar forma parte del desarrollo habitual del producto
Destacado: Asignación de costos a modelos, con precios personalizados, dentro del ciclo general de mejora de LangSmith
Precio: Developer $0 para un puesto; Plus $39 por puesto al mes; Enterprise con precio personalizado; trazas base adicionales a 0.005 LSU cada una, con 1 LSU a $1 y 1 LCU a $1.50
Prueba gratis: Plan Developer gratuito; la página de precios consultada no indica una prueba temporal de Plus

Lo bueno
Lo que hace bien
7 points

  • El seguimiento de costos forma parte de un workflow maduro de trazas y evaluación
  • Las entradas personalizadas de precios cubren inferencias privadas o negociadas
  • Las trazas ampliadas pueden conservar datos durante 400 días
  • Enterprise ofrece despliegue autoalojado e híbrido
  • Plus cobra por puesto, mientras varios competidores incluyen usuarios ilimitados
  • Diez puestos Plus cuestan $4,680 al año antes del consumo adicional
  • Las trazas base y ampliadas tienen una retención y una estructura de costos diferentes

8. Datadog Agent Observability: la mejor para equipos que ya usan Datadog

Datadog Agent Observability encaja mejor cuando el costo de los agentes debe correlacionarse con la telemetría de aplicaciones, infraestructura y sesiones de usuario que ya existe en Datadog. Estima automáticamente el costo de solicitudes a modelos de texto a partir del número de tokens para más de 800 modelos y acepta costos introducidos manualmente para modelos privados o no compatibles. Su límite es el costo en un proyecto nuevo: Pro parte de $160 al mes con un compromiso anual, un desembolso que se recupera cuando la correlación entre sistemas elimina trabajo manual durante incidentes, no cuando un desarrollador independiente solo quiere un gráfico de tokens. Elija Datadog cuando el agente sea una parte de un sistema de producción existente, no un experimento aislado.

Página de precios de Datadog Agent Observability con los planes Free y Pro
Datadog Agent Observability

Los precios de Datadog Agent Observability incluyen Free a $0 con hasta 40,000 spans de LLM al mes, 15 días de retención de trazas, contexto y evaluaciones ilimitados, y acceso a todas las funciones. Pro incluye 100,000 spans de LLM mensuales y cuesta $160 al mes con compromiso anual, $200 mes a mes o $240 bajo demanda. Cada 10,000 spans adicionales cuestan $3.50 con pago anual, $4.20 mes a mes o $5 bajo demanda.

La retención predeterminada de trazas es de 15 días. Los complementos de retención por cada 10,000 spans de LLM al mes cuestan $1.50 para 30 días, $3 para 60 días o $4 para 90 días. Con un millón de spans de LLM al mes y precio anual, Pro alcanza $475 al mes antes de los complementos de retención: la base de $160 más 90 bloques excedentes a $3.50.

Ideal para: Equipos de operaciones que ya investigan servicios, infraestructura, sesiones y agentes en Datadog
Destacado: Las trazas de agentes se correlacionan con el resto de la telemetría de producción
Precio: Free $0; Pro $160 al mes con pago anual, $200 mes a mes o $240 bajo demanda; excedentes y complementos de retención aparte
Prueba gratis: Nivel gratuito con todas las funciones hasta alcanzar su cupo

Lo bueno
Lo que hace bien
7 points

  • Las estimaciones automáticas de costos cubren más de 800 modelos de texto
  • Los costos manuales permiten trabajar con modelos privados y no compatibles
  • Los usuarios actuales de Datadog pueden relacionar el comportamiento de los agentes con incidentes de servicios e infraestructura
  • Free incluye 40,000 spans de LLM y acceso a todas las funciones
  • Pro tiene el precio base más alto entre las opciones SaaS centradas en costos que encabezan esta clasificación
  • Un agente de varios pasos puede consumir numerosos spans por workflow de usuario
  • Una retención más larga añade otra unidad de cobro por span

Qué herramientas de monitoreo LLM convienen en cada caso

La regla de decisión es: primero aplicación de controles, después alojamiento, luego evaluación y, por último, precio. Comience por la acción que el sistema debe realizar cuando aumente el gasto. Si tiene que bloquear, redirigir o ralentizar el tráfico, incluya Portkey o Helicone en la lista corta y compruebe que el plan adquirido ofrece el control presupuestario necesario. Si solo debe alertar y explicar, se abren más opciones.

Herramientas de monitoreo de agentes de IA: la regla de decisión

Elija Langfuse para disponer de un registro de costos general, independiente del modelo, con contexto de trazas y bajo costo de colaboración. Elija OpenLIT si las trazas no pueden salir de su entorno y la organización ya opera la infraestructura necesaria. Elija Braintrust o Arize cuando todo cambio de costos deba contrastarse con la calidad de la respuesta. Elija LangSmith cuando la integración con LangChain valga más que evitar el cobro por puesto. Elija Datadog cuando la revisión de incidentes ya comience allí.

Flujo de decisión desde el seguimiento integrado de tokens hasta la atribución de costos en equipo y los controles estrictos
La decisión de compra cambia cuando una vista individual de consumo se convierte en un problema de control para el equipo.

Mejores herramientas de observabilidad LLM: el punto de inflexión

Las mejores herramientas de observabilidad LLM justifican la compra en el momento en que un segundo responsable necesita las mismas evidencias. Puede ser finanzas asignando el costo de un modelo a un cliente, seguridad exigiendo datos locales, soporte explicando una automatización fallida o producto comparando el costo por resultado aceptado. Hasta entonces, el seguimiento integrado puede bastar.

Los puntos de inflexión son concretos:

  • Un desarrollador, un dispositivo y un workflow de modelo: mantenga Claude Code /usage y la facturación del proveedor.
  • Varios desarrolladores o dispositivos: exporte OpenTelemetry o adopte una plataforma compartida.
  • Varios clientes o funciones de producto: exija atribución basada en metadatos.
  • Un bucle descontrolado puede causar una pérdida material: exija un presupuesto aplicable en el gateway.
  • Un modelo más barato podría reducir la calidad: añada evaluación antes de cambiar el enrutamiento.
  • Los datos de los prompts no pueden salir del entorno: compare OpenLIT, el alojamiento propio de Langfuse, Phoenix o un plan Enterprise autoalojado.

Aquí también encajan los gateways. Controlan la ruta de la solicitud, mientras un producto de observabilidad explica lo ocurrido tanto dentro como fuera de esa ruta. La comparación de gateways gestionados para agentes es la siguiente decisión cuando el enrutamiento, el failover y las políticas deben convivir.

Las cuentas del presupuesto: cuánto debe amortizar el panel

Un panel de tokens debería recuperar toda la tarifa de la plataforma al evitar desperdicios o eliminar trabajo de conciliación. Con un supuesto de planificación transparente de $100 por hora total de ingeniería, la cuota mensual de $29 de Langfuse Core equivale a 17.4 minutos. Portkey Production a $49 equivale a 29.4 minutos. Arize AX Pro a $50 equivale a 30 minutos. Helicone Pro a $79 equivale a 47.4 minutos. Datadog Pro a $160 con facturación anual equivale a 96 minutos. Braintrust Pro a $249 equivale a 149.4 minutos. Diez puestos de LangSmith Plus a $390 equivalen a 234 minutos.

Estas cifras son referencias de equilibrio, no ahorros prometidos. Un fundador con financiación debería preguntar qué tarea recurrente desaparecerá. Si la respuesta es «alguien relaciona manualmente durante tres horas al mes los CSV de los proveedores con los clientes», casi todas las opciones de pago superan el umbral. Si la respuesta es «el gráfico se ve mejor», ninguna lo hace.

Comparación del costo base anual de Langfuse, Portkey, Helicone y diez puestos de LangSmith
Tarifas base anuales antes del consumo variable, con diez puestos cuando el plan cobra por puesto.

El costo base anual hace visible el precio de la colaboración. Langfuse Core cuesta $348, Portkey Production $588, Arize AX Pro $600, Helicone Pro $948, Datadog Pro con compromiso anual $1,920, Braintrust Pro $2,988 y diez puestos de LangSmith Plus $4,680. La licencia de OpenLIT cuesta $0, pero la infraestructura y el trabajo de ingeniería quedan sin valorar.

No convierta la lista en una falsa carrera por el precio unitario. Langfuse cobra trazas, observaciones y puntuaciones. Portkey cobra solicitudes guardadas. Datadog cobra spans de LLM. Braintrust cobra datos procesados y puntuaciones además del uso del modelo. LangSmith cobra trazas mediante sus propias unidades de consumo. Un workflow de cliente puede generar una solicitud, varias generaciones, docenas de spans y varias puntuaciones.

Una proyección correcta parte de un workflow representativo:

  1. Cuente su mediana de llamadas a modelos, trazas, observaciones, spans y puntuaciones.
  2. Multiplíquela por las ejecuciones correctas y fallidas previstas cada mes.
  3. Sume retención, puestos, datos procesados e inferencia de modelos.
  4. Aplique un escenario de reintentos, porque una herramienta defectuosa puede multiplicar el costo sin multiplicar el valor.
  5. Divida el total entre los resultados empresariales satisfactorios, no entre las ejecuciones del agente.

Ese último número es la métrica operativa. El costo por ticket resuelto, cambio de código aceptado, expediente procesado o cliente potencial calificado permite comparar prompts y modelos. El total de tokens no.

Qué evitar si el objetivo es controlar costos

Evite comprar una plataforma amplia de observabilidad cuando su mayor fortaleza no tiene relación con el problema presupuestario. El producto equivocado puede medir más y controlar menos.

  • Claude Code /usage por sí solo para repartir costos en un equipo: resulta útil para un desarrollador y un historial local, pero no incluye otros dispositivos ni claude.ai. Por sí solo no puede convertirse en un registro compartido de costos por cliente.
  • OpenLIT Cloud si la compra debe cerrarse hoy: la página de precios todavía dice «coming soon» y no publica ningún precio. Use la opción de código abierto solo si alguien puede responsabilizarse de ella.
  • LangSmith Plus para colaborar únicamente en costos: diez puestos cuestan $4,680 al año antes de las trazas adicionales. Pague esa cantidad cuando aporten valor las trazas y el ciclo de evaluación de LangChain, no por un total compartido que Langfuse Core puede mostrar por $348 al año.
  • Braintrust Pro solo para recibir alertas: $249 al mes tiene sentido cuando las puntuaciones y los experimentos orientan la elección del modelo. Es difícil defenderlo si el único requisito es una notificación de gasto.
  • Datadog Pro para un agente individual desde cero: $160 al mes con compromiso anual compran una valiosa correlación de producción. Una vista local de /usage o el nivel gratuito son un mejor primer paso hasta que esa correlación tenga responsable.
  • Cualquier presupuesto de gateway con precios desconocidos de modelos: Portkey documenta que los modelos no compatibles aparecen como $0.00 y no cuentan para el presupuesto de un proveedor. Defina los precios de los modelos privados y nuevos antes de confiar en un techo.

El producto más peligroso de la categoría no es un proveedor concreto. Es un panel que muestra un costo aparentemente preciso pese a una cobertura incompleta de modelos o ejecuciones ausentes. Exija que el costo desconocido sea visible, concílielo con la factura del proveedor y pruebe el presupuesto con una solicitud controlada antes de depender de él.

La acción del lunes: instrumentar un workflow costoso

El lunes, instrumente únicamente el workflow con mayor probabilidad de provocar una factura inesperada. No empiece con todas las llamadas a modelos. Elija el bucle recurrente de programación, el caso escalado de soporte, el agente de investigación o el pipeline de documentos cuyos reintentos y tamaño de contexto ya generan inquietud.

Etiquete cada ejecución con cuatro campos: cliente o cuenta, workflow, entorno y resultado. Añada el modelo y la versión como dimensiones. Configure una alerta en un costo unitario que merezca investigación. Si una ejecución fuera de control puede ocasionar una pérdida material, establezca un límite de costo o solicitudes en el gateway y defina el comportamiento alternativo antes de activarlo.

El viernes, revise tres grupos: ejecuciones correctas cercanas a la mediana, las ejecuciones correctas más caras y los fallos costosos. La comparación separa la complejidad necesaria del desperdicio. Un modelo premium puede costar más y aun así ganar si evita reintentos o una intervención humana. Un modelo barato puede perder si crea trazas más largas y más trabajo para resolver fallos.

Use una decisión semanal como prueba de adopción. Cambie una regla de enrutamiento, reduzca el contexto, corrija el reintento de una herramienta, actualice un precio personalizado o cancele el panel. Un sistema de medición que no genera ninguna decisión después de cuatro revisiones no se ha ganado una implementación más amplia.

Preguntas frecuentes

¿Cuál es el mejor agente de IA en 2026?

Ningún agente de IA es el mejor para todas las tareas. En control de costos, la decisión relevante es la capa de observabilidad que rodea al agente que ya trabaja en producción. Use Langfuse para atribuir costos de forma amplia, Portkey o Helicone para aplicar límites y una herramienta centrada en evaluación cuando la calidad deba juzgarse junto con el precio.

¿Cuáles son las mejores herramientas de IA para aprender en 2026?

Aprenda la herramienta que corresponda a la plataforma que opera. Quien use Claude Code en solitario debería entender primero /usage y OpenTelemetry. Un equipo de producto debería aprender trazas basadas en metadatos y análisis del costo unitario. Un equipo de plataforma responsable del enrutamiento de modelos debería dominar los presupuestos del gateway y las políticas de respaldo.

¿Cuáles son las principales herramientas para agentes de IA?

Separe los entornos de ejecución de agentes de las herramientas que los observan. Esta clasificación incluye Langfuse, Portkey, Helicone, OpenLIT, Braintrust, Arize AX and Phoenix, LangSmith y Datadog Agent Observability para trabajar con tokens, costos, trazas y controles. No clasifica los agentes que realizan la tarea empresarial subyacente.

¿Cuál es la mejor aplicación de IA del mundo en 2026?

No existe un ganador universal defendible, porque el valor depende de la tarea, el workflow, los límites de datos y el presupuesto. Para seguir tokens de agentes, Langfuse es la mejor opción general de esta comparación, pero Portkey gana cuando la prioridad son los presupuestos aplicables.

¿Qué IA es mejor que ChatGPT?

La preferencia de modelo no sustituye la atribución de costos. Un agente de producción puede utilizar OpenAI, Anthropic, Google, un modelo abierto o varios proveedores dentro de un mismo workflow. La capa de seguimiento debe conservar evidencias de cliente, workflow, resultado y costo entre todas esas opciones.

¿Cuál es la IA más avanzada en 2026?

Las capacidades cambian demasiado rápido como para dar una respuesta permanente. La plataforma de observabilidad debería ser independiente del modelo, aceptar precios personalizados y permitir comparar el historial de costos y resultados cuando cambie el modelo subyacente.

¿Qué IA utiliza Elon Musk?

El modelo que elija una figura pública no es un criterio útil para seguir tokens. Seleccione esta infraestructura según los modelos que llaman sus workflows, los metadatos que necesita el responsable del presupuesto, el límite de datos que debe proteger y si el sistema tiene que aplicar un tope.

¿Cuál es la herramienta de IA más potente?

En esta categoría, potencia significa relacionar el gasto con un workflow y cambiar la siguiente acción. Una traza profunda sin atribución está incompleta. Una alerta precisa sin aplicación de límites está incompleta cuando importa contener pérdidas. La herramienta más sólida es la que cubre el límite necesario sin añadir funciones que no se usarán.

¿Qué es mejor en 2026, Claude o ChatGPT?

Elija Claude o ChatGPT por la calidad para la tarea, la latencia, el contexto y las condiciones comerciales que necesite. Elija por separado la capa de seguimiento, para que la organización compare el costo por resultado correcto entre modelos en lugar de reconstruir su registro tras cada cambio de modelo.

Audite el workflow antes de añadir otro panel

La herramienta de seguimiento es el último paso, no el primero. Obtenga gratis la lista de verificación para auditar flujos de trabajo empresariales de IA e identifique el workflow, el responsable, el resultado y el punto de control antes de sumar otra plataforma al presupuesto.

Última actualización

2 sept 2026

CategoríaBuild

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Newsletter

Una carta, cada domingo. Sistemas que funcionan, no opiniones calientes.

Build logs, sistemas en producción y notas de campo de un portafolio de ventures de IA.

Semanal. Sin spam. Cancele cuando quiera.