LLM observability en 2026: qué herramienta conviene a tu equipo y cuánto cuesta

Compara Langfuse, LangSmith, Helicone, Phoenix, Braintrust y Datadog por tamaño de equipo, costos para 100,000 ejecuciones mensuales y opciones de alojamiento.

Monday, October 5, 2026Omid Saffari
LLM observability en 2026: qué herramienta conviene a tu equipo y cuánto cuesta

Entre las herramientas de LLM observability, Langfuse, una plataforma de trazado y evaluación, es la opción más recomendable para un equipo pequeño que ya trabaja en producción: el ejemplo de 100,000 ejecuciones que calculamos más abajo cuesta $69.80/mes en Core, antes del cómputo de los modelos y los evaluadores. La elección cambia si necesitas decidir lanzamientos mediante evaluaciones, usar un gateway, alojar la plataforma en privado o investigar incidentes dentro de un entorno que ya utiliza Datadog.

LLM observability: las mejores herramientas de un vistazo

Empieza con Langfuse si necesitas un panel de producción compartido; con LangSmith, si tu proceso de mejora gira en torno a LangChain; con Helicone, para monitorear solicitudes desde un gateway; con Arize Phoenix, para operar una instalación privada; con Braintrust, para decidir lanzamientos a partir de evaluaciones; y con Datadog Agent Observability, para investigar incidentes de producción que afectan a distintas capas de la aplicación. El tamaño del equipo pesa especialmente cuando la plataforma cobra por cada persona que necesita revisar un fallo.

Una traza registra una ejecución de la aplicación. Un span representa una operación dentro de esa traza, como una llamada al modelo, una recuperación de información o una invocación de herramienta. Una evaluación, también llamada eval, comprueba si el resultado cumple una regla o un criterio de calidad. Los tres elementos hacen falta para explicar por qué un agente dio una respuesta convincente después de ejecutar la acción equivocada.

Precios verificados en las páginas oficiales de cada proveedor el 5 de octubre de 2026. Todos los importes en dólares están expresados en USD. Salvo que se indique lo contrario, los precios iniciales no incluyen consumo adicional ni cargos del proveedor de modelos. La comparación se basa en los precios y la documentación vigentes; no pretende clasificar el rendimiento a partir de pruebas prácticas.

HerramientaPara quién convienePrecio inicial de pagoPlan gratuito / prueba
LangfuseEquipos pequeños en producción que necesitan compartir trazas y costosCore $29/mes más unidadesHobby: 50k unidades/mes, 2 usuarios; núcleo gratuito en infraestructura propia
LangSmithEquipos que ya mejoran agentes de LangChain o LangGraphPlus $39/usuario/mes más trazasDeveloper: 1 usuario, 5k trazas base/mes
HeliconeMonitoreo de solicitudes junto con un gateway de modelosPro $79/mes más solicitudes y almacenamientoHobby: 10k solicitudes/mes, 1 usuario; los planes de pago anuncian una prueba de 7 días
Arize PhoenixTrazado y evaluación privados con un responsable de infraestructuraSin plan de pago publicado para Phoenix; AX Pro es otro producto y cuesta $50/mesPhoenix no cobra licencia por alojarlo en infraestructura propia; AX Free incluye 25k spans/mes
BraintrustConjuntos de datos de evaluación compartidos y comparaciones entre versionesPro $249/mes; Starter puede generar cargos por consumoStarter: 1 GB procesado/mes, 10k puntuaciones, usuarios ilimitados
Datadog Agent ObservabilityEquipos de operaciones que ya relacionan fallos de agentes con serviciosPro $160/mes con pago anual; $200 de mes a mes; $240 bajo demandaFree: 40k spans de LLM/mes, retención de 15 días

Fuentes: precios de Langfuse, precios de LangSmith, precios de Helicone, precios de Arize, precios de Braintrust y precios de Datadog.

La diferencia clave está en la unidad que se suma al precio del plan. Una plataforma que factura por traza de aplicación contabiliza un volumen distinto de otra que cobra por cada llamada al modelo, observación, puntuación o gigabyte. Antes de comparar suscripciones, calcula qué registros emite tu aplicación.

¿Cuánto cuestan 100,000 ejecuciones de un agente al mes?

Con los supuestos que se detallan a continuación, un equipo de cinco personas que ejecuta el mismo agente puede pagar $69.80 en Langfuse o $645 en LangSmith. Ninguno de esos importes mide la calidad. La diferencia está en cómo se cuentan los eventos, el volumen incluido y los cargos por usuario.

Tomemos esta carga de producción como modelo explícito:

  • 100,000 ejecuciones completas del agente al mes, con una traza por ejecución.
  • Cinco operaciones observadas por ejecución: el flujo de trabajo raíz, dos llamadas al modelo, una recuperación de información y una llamada a herramienta.
  • 200,000 llamadas al modelo y 500,000 operaciones observadas en total.
  • 10,000 puntuaciones de evaluación mediante código calculadas externamente, una por cada ejecución de la muestra. Este escenario no incluye llamadas adicionales al modelo ni trazas de evaluadores.
  • Cinco usuarios que necesitan acceder al panel.
  • 5 GB de datos procesados en Braintrust y, por separado, 5 GB de almacenamiento medido en Helicone. Son supuestos independientes: los proveedores no miden los bytes de la misma manera.

El ejemplo se parece a un agente de soporte que lee una solicitud, recupera un pedido, llama a una herramienta de gestión de pedidos y pide al modelo que prepare la respuesta final. Las cifras son supuestos para presupuestar, no mediciones de una aplicación desplegada. Un agente que reintenta, abre ramas de ejecución o utiliza evaluadores dentro de la plataforma genera un registro diferente.

Una ejecución de agente sin puntuación, representada como un flujo de trabajo, dos llamadas al modelo, una recuperación de información y una herramienta, con distintos contadores de facturación por proveedor
Una ejecución sin puntuación puede equivaler a una traza, seis unidades de Langfuse o dos solicitudes facturables al modelo. Las puntuaciones tienen su propio contador.
Herramienta / planVolumen que contabilizaCosto mensual calculado de la plataformaQué más hay que presupuestar
Langfuse Core610k unidades: trazas + observaciones + puntuaciones$69.80Los eventos adicionales de los evaluadores aumentan las unidades
LangSmith Plus100k trazas base, 5 usuarios$645La ampliación de retención de trazas y el uso de evaluadores generan cargos adicionales
Helicone Pro200k solicitudes al modelo registradas, 5 GB de almacenamientoEstimación de $146.25-$149.50La tabla del plan y la calculadora discrepan sobre el almacenamiento incluido
Phoenix en infraestructura propiaLos spans y datos de evaluación que conserves$0 de licencia + tu infraestructuraNo se presupone un precio de infraestructura alojada; AX requiere una cotización para este volumen
Braintrust Starter / Pro5 GB procesados, 10k puntuaciones$16 / $249El consumo de modelos y las ampliaciones de retención se cobran por separado
Datadog Pro200k spans de LLM facturables$195 con tarifa anual; $242 de mes a mes; $290 bajo demandaOtros productos de Datadog y la retención ampliada se cobran por separado

Los cálculos utilizan las tarifas publicadas por los proveedores en los enlaces anteriores. El total de LangSmith toma los $0.005 por traza base que muestra la ayuda de precios actual, con 10,000 trazas incluidas para toda la organización. El intervalo de Helicone conserva una discrepancia de su propia página: la tabla del plan incluye 1 GB gratuito, pero la calculadora cobra almacenamiento desde el primer gigabyte. Phoenix no cobra licencia en función del volumen; para calcular el costo de su infraestructura hace falta dimensionar tu instalación.

Estos totales no sirven como cotización universal para un agente con trazas más largas. Si el flujo pasa de dos llamadas al modelo a un bucle de razonamiento repetido, Datadog y Helicone contabilizan más operaciones de modelo. Si añades observaciones y puntuaciones almacenadas, Langfuse suma más unidades. Si envías documentos más grandes sin cambiar el número de trazas, Braintrust procesa más bytes. La comparativa de seguimiento de tokens de agentes profundiza en cómo atribuir el gasto del proveedor a un cliente o una función.

Cómo seleccionamos las herramientas

La clasificación empieza por la compra que un equipo pequeño en producción puede justificar y continúa con herramientas cuyo valor depende de una forma concreta de operar. Un equipo de desarrollo con un responsable de IA necesita diagnosticar resultados incorrectos, seguir el costo por cliente y convertir los fallos en controles antes de cada lanzamiento. Un producto que resuelva solo una de esas tareas puede seguir siendo el especialista adecuado.

Cada recomendación responde a cinco criterios:

  1. Una unidad de cobro comprensible. Quien compra puede determinar si la factura depende de trazas, operaciones, personas, puntuaciones o volumen de datos, incluidos el consumo gratuito y el siguiente límite.
  2. Un registro útil de producción. Una respuesta fallida puede vincularse con las operaciones de modelo, recuperación de información y herramientas que la generaron.
  3. Un proceso de mejora. El registro sirve para una evaluación, un conjunto de datos, un experimento o una decisión de revisión, en lugar de quedar como un log aislado.
  4. Un alcance de despliegue bien definido. Se distinguen el alojamiento gratuito en infraestructura propia, la licencia comercial empresarial y el plano de datos controlado por el cliente.
  5. Instrumentación documentada. La compatibilidad con OpenTelemetry se valora a partir de las instrucciones de integración vigentes del proveedor, incluidos el protocolo y la correspondencia de campos cuando se especifican.

La selección incluye seis productos porque representan opciones distintas: una plataforma de trazado de uso amplio, un proceso de desarrollo centrado en un framework, un gateway, una plataforma privada pensada para funcionar localmente, una plataforma de evaluación y una suite de operaciones. Un catálogo más extenso añadiría opciones sin mejorar esta decisión concreta sobre presupuesto y responsabilidad. Esta comparación no afirma haber medido la velocidad de ingesta, la facilidad de uso, la disponibilidad ni la precisión de las evaluaciones.

Consideramos lo gratuito como un volumen incluido que se puede aprovechar, no como la promesa de una factura siempre en cero. Braintrust Starter y LangSmith Developer pueden generar cargos por consumo. Phoenix puede tener un costo de licencia nulo y, aun así, exigir un trabajo significativo de mantenimiento de bases de datos y guardias. El plan gratuito adecuado es aquel cuyos límites encajan con el experimento que quieres completar.

Las seis herramientas según su encaje en producción

1. Langfuse: la opción más recomendable para un equipo pequeño en producción

Langfuse ofrece trazado compartido, seguimiento de tokens y costos, gestión de prompts y evaluación para equipos pequeños en producción, sin cobrar por usuario en Core. Un asistente de soporte SaaS puede asociar un cliente, un flujo de trabajo y una versión a sus llamadas al modelo, y después revisar los fallos costosos junto con las ejecuciones correctas. Su principal límite presupuestario es el número de registros almacenados: una ejecución del agente puede generar una traza, varias observaciones y puntuaciones. Elígelo si quieres reunir la traza y el registro de costos, con una vía viable para alojarlo más adelante en tu propia infraestructura.

Página de precios vigente de Langfuse con los planes Hobby, Core, Pro y Enterprise
Langfuse

Ideal para: Un equipo de producto pequeño o en crecimiento cuyos desarrolladores y responsable de IA necesitan revisar las mismas ejecuciones de producción
Lo más destacado: Usuarios ilimitados en Core, contexto de costos por traza y un núcleo con licencia MIT que puedes alojar en infraestructura propia
Precio: Core parte de $29/mes; los planes Cloud de pago añaden consumo facturado en unidades
Prueba gratuita: El plan gratuito Hobby no requiere tarjeta de crédito; ofrece un volumen incluido recurrente, no una prueba con fecha de vencimiento

Planes disponibles y límites que cambian la decisión

La página de precios vigente ofrece Hobby por $0, con 50,000 unidades/mes, dos usuarios y 30 días de acceso a los datos. Core cuesta $29/mes, con 100,000 unidades, usuarios ilimitados y 90 días de acceso a los datos. Pro cuesta $199/mes, incluye las mismas unidades y ofrece tres años de acceso a los datos, gestión de retención y límites de tráfico más altos. El complemento opcional Teams de Pro cuesta $300/mes y añade SSO empresarial, aplicación obligatoria de SSO y controles de acceso más detallados. Enterprise cuesta $2,499/mes, con 100,000 unidades incluidas, logs de auditoría, SCIM y compromisos contractuales de servicio; los contratos anuales pueden incorporar precios personalizados por volumen.

El consumo de Cloud de pago se cobra por tramos. El tramo de 100,000 a un millón de unidades cuesta $8 por cada 100,000; el de un millón a diez millones cuesta $7 por cada 100,000; y el de diez millones a cincuenta millones cuesta $6.50 por cada 100,000. Las tarifas más bajas se aplican a las unidades de su tramo. Cruzar un umbral no abarata retroactivamente las unidades del tramo anterior.

El límite de ingesta de Core es de 4,000 solicitudes/minuto, frente a las 20,000 solicitudes/minuto de Pro. Se trata de solicitudes de ingesta, no de la definición de unidad facturable. Un lote puede contener varios eventos almacenados. Revisa tanto el presupuesto mensual de unidades como las ráfagas de tráfico que genera el exportador.

Trazas de Langfuse: también cuentan las observaciones y las puntuaciones

Una traza de Langfuse registra una ejecución, pero la fórmula de facturación es trazas + observaciones + puntuaciones. Para la carga del ejemplo, son 100,000 + 500,000 + 10,000 = 610,000 unidades. Por tanto, Core cuesta $29 + 5.1 × $8 = $69.80/mes. Ese mismo volumen almacenado en Pro cuesta $239.80/mes.

Esta fórmula cambia la conversación sobre instrumentación. Una operación de recuperación de información o de una herramienta de reembolsos aporta evidencia útil, aunque aumente los registros. Eliminarla para reducir la factura puede impedir que expliques el fallo. Conviene aplicar una política de muestreo deliberada a las ejecuciones correctas de poco valor y conservar la evidencia necesaria para diagnosticar resultados costosos o perjudiciales.

Alojamiento, licencia y OpenTelemetry

Open Source en infraestructura propia no cobra licencia bajo MIT y ofrece uso ilimitado y las API del núcleo para trazado, evaluación, conjuntos de datos y gestión de prompts. Enterprise en infraestructura propia utiliza una licencia comercial y tiene precio personalizado. Su página de precios actual indica que el precio empresarial de Langfuse se suma al plan comercial de ClickHouse correspondiente. Una suscripción en la nube y una cotización empresarial para infraestructura propia son compras diferentes.

La documentación de OpenTelemetry admite OTLP mediante HTTP/JSON o HTTP/protobuf e indica que no hay compatibilidad con gRPC. El endpoint base es /api/public/otel y se autentica mediante Basic auth con las claves pública y secreta del proyecto. La ingesta directa por la vía v4 actual requiere la cabecera x-langfuse-ingestion-version: 4 para procesar en tiempo real; la documentación advierte de una demora de hasta diez minutos si falta. También deben propagarse los atributos de usuario, sesión, versión y otros datos de la traza a los spans que quieras filtrar y agregar.

Este requisito supone un límite de integración relevante para un equipo de plataforma que ya exporta gRPC a un Collector. El Collector puede recibir un protocolo y exportar otro, pero el último tramo hacia Langfuse debe ajustarse al endpoint HTTP y a la correspondencia de atributos documentados. Que se acepte una carga sin los metadatos del cliente no significa que la integración esté terminada.

Langfuse con Python: empieza por el SDK documentado

El proveedor recomienda su propio SDK para Python porque gestiona los campos de Langfuse, su propagación y la exportación. Sigue la guía rápida de trazado vigente, configura las credenciales del proyecto y LANGFUSE_HOST para la región elegida o tu propia instalación, y engloba toda la operación de negocio en el contexto de observación actual. Mantén la recuperación de información y las herramientas dentro de ese contexto para que la traza conserve la causa de una respuesta incorrecta.

Utiliza el consumo que informa el proveedor siempre que sea posible. El seguimiento de costos de Langfuse da prioridad a los costos recibidos frente a los inferidos a partir de las tarifas de modelos, y Project Settings > Models permite definir modelos personalizados. Esto importa cuando el contrato utiliza una tarifa negociada o un modelo interno no tiene precio público. La estimación que se muestra debe coincidir con la tarifa comercial que necesitas controlar.

Langfuse con LangChain: conserva toda la solicitud en el mismo contexto

La integración de LangChain utiliza un manejador de callbacks que se pasa mediante callbacks al invocar la cadena. Asigna un contexto de traza a la solicitud que la engloba e incluye la cadena dentro de ese contexto. La documentación también señala que hay eventos en cola que se envían en segundo plano: los procesos de corta duración deben vaciar los eventos pendientes del exportador o cerrarlo antes de salir. En entornos JavaScript sin servidor, espera a que terminen los callbacks en segundo plano como indica la guía.

La primera implementación debe ser lo bastante acotada como para revisarla manualmente:

  1. Crea un proyecto de trazado para producción

    Elige la región de Cloud o la dirección de tu instalación, crea las claves del proyecto y configura el host siguiendo la guía rápida vigente. Distingue los registros de producción de los de desarrollo.

  2. Traza una operación de negocio completa

    Instrumenta la raíz de la solicitud, las llamadas al modelo, la recuperación de información y las herramientas. Asocia los metadatos de cliente, flujo de trabajo, versión y resultado a los spans correspondientes; comprueba que se propaguen los atributos de traza necesarios.

  3. Contrasta el costo con la respuesta del proveedor

    Abre una traza completa y confirma el modelo, el consumo y el costo. Configura precios personalizados cuando la tarifa pública inferida no refleje tu contrato.

  4. Guarda una puntuación y revisa el contador

    Evalúa un ejemplo conocido, verifica que la puntuación quede asociada a la ejecución correcta y compara los recuentos de trazas, observaciones y puntuaciones con el panel Usage Management. Vacía los eventos pendientes del exportador antes de que termine un proceso de corta duración.

Lo bueno
Lo que hace bien
7 points

  • Core permite incorporar a todas las personas que necesitan revisar los registros sin añadir usuarios de pago
  • El registro puede combinar llamadas al modelo, herramientas, recuperación de información, costos y puntuaciones de evaluación
  • Los costos recibidos y las definiciones de modelos personalizadas permiten gestionar tarifas negociadas o privadas
  • El núcleo MIT ofrece una opción de despliegue bajo la responsabilidad de tu equipo de infraestructura
  • Las trazas, las observaciones y las puntuaciones almacenadas consumen el volumen incluido de Cloud
  • Pro y su complemento Teams pueden aumentar el cargo fijo aunque el consumo no cambie
  • El receptor OTel requiere exportación por HTTP y una propagación correcta de atributos

2. LangSmith: para equipos que mejoran agentes con LangChain

LangSmith es una plataforma de trazado y evaluación para equipos que ya desarrollan y revisan agentes con LangChain o LangGraph, aunque también documenta la instrumentación de otros frameworks. Un responsable de desarrollo puede vincular un fallo de producción con un conjunto de datos, una evaluación en línea o fuera de línea, una revisión humana y un cambio de prompt. El límite de compra está en los usuarios y las trazas: invitar a más revisores aumenta la suscripción, mientras que el volumen de trazas genera sus propios cargos. Elígelo si ese proceso de desarrollo y evaluación aporta suficiente valor como para pagar por cada persona que revisa los registros.

Precios de LangSmith con los planes Developer, Plus y Enterprise y los cargos por consumo
LangSmith

Ideal para: Un equipo de desarrollo que ya organiza la mejora de sus agentes en torno a LangChain o LangGraph
Lo más destacado: Trazado, conjuntos de datos, colas de anotación y evaluación en línea y fuera de línea en el mismo producto
Precio: Plus cuesta $39/usuario/mes, más el consumo de trazas y de otros servicios del producto
Prueba gratuita: Developer ofrece un volumen gratuito recurrente para un usuario, con cargos por consumo cuando se superan las trazas incluidas

Planes disponibles y trazas incluidas para toda la organización

Developer cuesta $0 por usuario/mes, admite un usuario e incluye 5,000 trazas base/mes antes de empezar a cobrar por consumo. Plus cuesta $39 por usuario/mes, permite añadir usuarios de pago e incluye 10,000 trazas base al mes en total. La calculadora de precios indica expresamente que ese volumen se comparte entre toda la organización. Enterprise tiene precio personalizado y ofrece las opciones híbridas y de alojamiento en infraestructura propia, los controles de seguridad y los acuerdos de soporte.

La ayuda de precios de la página actual indica 0.005 LangChain Standard Units por traza base y 0.0025 por ampliación de retención de una traza. Una LSU equivale a $1, por lo que las tarifas son $0.005 por traza base y $0.0025 por la ampliación. La retención base es de 14 días y la ampliada, de 180 días. Una tarifa por traza que recuerdes de antes no sirve para elaborar un presupuesto verificado hoy.

Con cinco usuarios de Plus y 100,000 trazas base, la factura es de $195 en usuarios + $450 en trazas adicionales = $645/mes. Si amplías la retención de 10,000 trazas, añade $25: el total pasa a $670 antes del cómputo de evaluadores o del consumo de otros servicios del producto. La ampliación conserva el registro durante más tiempo; no se obtiene gratis por contratar Plus.

Tuned Evaluators tiene otra unidad de cobro publicada: 0.015 LSU por ejecución correcta de una evaluación Perceived Error. La ayuda de la página indica que un Tuned Evaluator que añade feedback también amplía la retención de la traza. Deployment, Engine, Fleet y Sandboxes tienen sus propias reglas de consumo. Quien solo compra observabilidad debe limitar el presupuesto a ese servicio, sin considerar que el pago por usuario incluye todo el entorno de ejecución de agentes.

Por qué el número de usuarios cambia la recomendación

No es lo mismo que cinco desarrolladores revisen trazas a que se sumen también responsables de producto y calidad. Con las mismas 100,000 trazas base, quince usuarios de Plus cuestan $1,035/mes: la parte de usuarios pasa a $585, mientras que las trazas adicionales siguen costando $450. Añadir usuarios no multiplica las trazas gratuitas compartidas.

El gasto puede justificarse si cada revisor convierte habitualmente las trazas en correcciones de prompts, conjuntos de datos o decisiones de lanzamiento. Resulta más difícil justificarlo si la mayoría solo necesita consultar de vez en cuando un panel de costos. Define quién debe revisar los registros originales, quién puede trabajar con un resultado exportado y qué proceso hace productiva la suscripción.

Alojamiento con licencia comercial y OpenTelemetry

LangSmith en infraestructura propia es un complemento de Enterprise que requiere una clave de licencia comercial. La instalación incluye servicios de frontend y backend, además de ClickHouse, PostgreSQL y Redis; la guía recomienda servicios de almacenamiento externos para producción. Es una instalación empresarial que debes operar, no una licencia gratuita de servidor que se pueda deducir del carácter abierto del framework.

Su guía de OpenTelemetry describe trazas de aplicaciones compatibles, correspondencias de atributos estándar y la distribución desde un Collector de un mismo flujo de spans a varios backends. Quienes utilizan LangChain y LangGraph pueden activar la integración con LANGSMITH_OTEL_ENABLED=true, junto con el trazado. Un exportador HTTP estándar utiliza el endpoint base https://api.smith.langchain.com/otel, autenticación mediante x-api-key y una cabecera opcional Langsmith-Project.

Presta atención al formato del endpoint. La variable de base OTLP compartida permite que el exportador HTTP añada /v1/traces; una variable específica para trazas contiene la ruta completa. Añadir la ruta de la señal en ambos lugares genera una URL incorrecta. Revisa la misma traza en el proyecto elegido y confirma el modelo, las entradas, las salidas y las relaciones entre spans padre e hijo antes de dar por terminada la exportación OTel.

Lo bueno
Lo que hace bien
7 points

  • LangChain y LangGraph tienen una vía integrada de trazado documentada
  • Los conjuntos de datos, las colas de anotación y las evaluaciones en línea y fuera de línea permiten definir un proceso de mejora explícito
  • La ingesta OTel y la distribución desde el Collector admiten aplicaciones de distintos frameworks
  • Enterprise ofrece una vía con licencia para operar el backend en tu infraestructura
  • Cada revisor de Plus cuesta $39/mes, incluidos los usuarios invitados que ocupan un puesto de pago
  • Las trazas incluidas se comparten; no se asignan por usuario
  • La retención ampliada y el uso de evaluadores especializados generan cargos separados

3. Helicone: cuando necesitas comprar también el gateway

Helicone combina la observabilidad de solicitudes con un gateway de IA: un servicio que reenvía las solicitudes a modelos y aplica reglas de enrutamiento y controles relacionados. Una aplicación pequeña que necesita principalmente revisar solicitudes a proveedores, gestionar alternativas ante fallos y agrupar el gasto en modelos puede obtener registros útiles en ese punto. El límite está en la diferencia entre el gateway y el agente completo: el registro de una solicitud al modelo sigue necesitando contexto de la aplicación para explicar la recuperación de información y las herramientas de negocio. Elígelo si el gateway ya forma parte de tu diseño y la tarea inmediata es monitorear las solicitudes.

Página de precios de Helicone con los planes Hobby, Pro, Team y Enterprise y la calculadora de consumo
Helicone

Ideal para: Un equipo de producto que compra monitoreo de solicitudes junto con las funciones del gateway
Lo más destacado: Un gateway compatible con OpenAI y una vía separada de registro asíncrono
Precio: Pro cuesta $79/mes, más cargos por solicitudes registradas y almacenamiento calculados por tramos
Prueba gratuita: Hobby es gratuito; Pro y Team anuncian una prueba gratuita de 7 días

Planes disponibles y límites de ingesta en ráfagas

La página de precios vigente ofrece Hobby por $0, con 10,000 solicitudes/mes, 1 GB de almacenamiento, un usuario, una organización y siete días de retención. Pro cuesta $79/mes, añade usuarios ilimitados, alertas, informes y HQL, su lenguaje de consultas, y conserva los datos durante un mes. Team cuesta $799/mes, añade cinco organizaciones, tres meses de retención, un canal dedicado de Slack y la oferta de cumplimiento normativo indicada. Enterprise tiene precio personalizado, con SAML SSO, despliegue en instalaciones propias y opciones de contrato a medida.

La tabla de los planes de pago incluye 10,000 solicitudes gratuitas y 1 GB de almacenamiento gratuito; después se cobra por consumo. El límite de ingesta publicado para Hobby es de 10 logs/minuto, frente a 1,000 en Pro, 15,000 en Team y 30,000 en Enterprise. El volumen mensual puede parecer suficiente mientras una sola ráfaga ya supera el límite de ingesta. Un trabajo de documentos basado en colas que envía muchos registros juntos necesita comprobar la capacidad de ingesta, además del recuento mensual.

Pasar de Pro a Team añade $720/mes antes del consumo. Contrátalo por las necesidades de organización, retención y soporte que resuelve. Que aumenten las solicitudes no significa, por sí solo, que ese salto sea el siguiente cargo inevitable.

Cobro por solicitudes y discrepancia en el almacenamiento

La calculadora de la página de precios aplica tarifas por tramos: las primeras 10,000 solicitudes son gratuitas, las 20,000 siguientes cuestan $0.0007 cada una, las 60,000 siguientes cuestan $0.00035 cada una y las solicitudes de la 90,001 a la 250,000 cuestan $0.000175 cada una. Los tramos posteriores publicados bajan a $0.0000875, $0.00004375 y $0.00002 por solicitud conforme crece el volumen. Estas cifras proceden de la calculadora del propio Helicone, no de una comparativa de otro proveedor.

Con 200,000 solicitudes al modelo registradas, el componente de solicitudes suma $14 + $21 + $19.25 = $54.25. Al añadir Pro, son $133.25 antes del almacenamiento. Cuenta las dos llamadas al modelo del agente del ejemplo: describir la aplicación como 100,000 «solicitudes» se quedaría corto para esta unidad de cobro.

Los tramos de almacenamiento de la calculadora empiezan en $3.25/GB para los primeros 30 GB, seguidos de $2/GB, $1.25/GB, $0.75/GB y $0.50/GB para volúmenes mayores. Sin embargo, la calculadora cobra el primer tramo desde cero, pese al gigabyte gratuito anunciado en la tabla del plan. Con 5 GB de almacenamiento medido, descontar el volumen incluido da $13 de almacenamiento; seguir la calculadora da $16.25. Por eso, el total ilustrativo de Pro queda en $146.25-$149.50.

Gateway, registro asíncrono y alcance documentado de OTel

La guía rápida del gateway utiliza un cliente compatible con OpenAI que apunta a https://ai-gateway.helicone.ai, con registro automático y alternativas ante fallos. También puedes utilizar tus propias claves de los proveedores. El gasto en modelos se cobra aparte de la suscripción de observabilidad y de las solicitudes registradas.

La guía de Proxy frente a Async explica directamente la decisión de arquitectura. La integración mediante proxy sitúa a Helicone en la ruta de la solicitud y ofrece funciones del gateway como caché, controles de reintentos y límites de tráfico personalizados. El registro asíncrono queda fuera de esa ruta crítica, pero no proporciona los mismos controles del proxy. Antes de comparar el esfuerzo de configuración, decide si necesitas reenviar el trabajo o observarlo en segundo plano.

Para OpenTelemetry, Helicone documenta una integración asíncrona con OpenLLMetry. Los ejemplos actuales utilizan los componentes de registro @helicone/async y helicone-async. Esto respalda esa vía concreta de integración; la guía citada no ofrece una configuración de receptor OTLP genérico para un Collector. Si el requisito es «cambiar solo el exportador del Collector», valida esa ruta específica en lugar de dar por hecho que una integración relacionada con OTel funciona como sustituto directo de un backend OTLP.

El alojamiento en infraestructura propia admite instalación manual, Docker Compose, Kubernetes y despliegue en la nube. La licencia del repositorio es Apache 2.0. El soporte dedicado y los servicios empresariales se acuerdan por separado. Para un equipo pequeño, el costo recurrente de operar la plataforma puede superar la factura de telemetría aunque la licencia de software sea gratuita.

La implementación debe responder una pregunta sobre la aplicación, más allá de mostrar una solicitud. Añade los identificadores de flujo de trabajo y cliente, envía una llamada conocida al modelo, revisa el registro y confirma que una sesión vincule las llamadas que querías agrupar. Repite después la comprobación con un reintento o una respuesta fallida. La vista del gateway aporta evidencia útil de producción cuando permite identificar qué operación de negocio causó el trabajo adicional del modelo.

Lo bueno
Lo que hace bien
8 points

  • Pro incluye usuarios ilimitados para compartir el monitoreo de solicitudes
  • Las vías de gateway y registro asíncrono permiten decidir cómo intervenir en la ruta de la solicitud
  • Los cargos por solicitudes se pueden calcular por tramos a partir de la página vigente del proveedor
  • Apache 2.0 y las opciones de despliegue documentadas permiten el alojamiento en infraestructura propia
  • Una solicitud al modelo y una ejecución completa del agente son unidades diferentes
  • Hay que aclarar la discrepancia entre el almacenamiento incluido publicado y la calculadora
  • El registro asíncrono no incluye los controles de caché, reintentos ni límites de tráfico del gateway
  • La guía de integración citada no establece una vía genérica de ingesta OTLP desde un Collector

4. Arize Phoenix: trazado privado con un responsable de infraestructura

Arize Phoenix es una plataforma de trazado, evaluación y experimentación pensada para funcionar localmente, que puedes ejecutar en tu infraestructura sin pagar licencia. Un ingeniero de plataforma que investiga un asistente de recuperación de información puede revisar las llamadas al modelo, el contexto recuperado y las herramientas, reunir los fallos en un conjunto de datos y comparar una versión revisada de la aplicación. El límite está en la responsabilidad operativa: alguien debe mantener el servicio y comprender las condiciones de la licencia. Elígelo si disponer de una instalación privada y controlable para trazado y evaluación justifica asignar un responsable de infraestructura.

Documentación de Arize Phoenix con trazado, evaluaciones, prompts, conjuntos de datos y experimentos
Arize Phoenix

Ideal para: Un equipo técnico que quiere operar su propio backend de trazado y evaluación
Lo más destacado: Trazas OTLP e instrumentación OpenInference, con conjuntos de datos y experimentos locales
Precio: Phoenix no cobra licencia por alojarlo en infraestructura propia; la página de precios actual de Arize no publica un plan de pago para Phoenix
Prueba gratuita: Phoenix en infraestructura propia se puede utilizar gratis dentro de las condiciones de su licencia; Arize AX tiene un plan gratuito separado

El plan de $50 de AX no corresponde a Phoenix

La página de precios actual de Arize publica tarifas de AX y describe Phoenix por separado como su plataforma pensada para funcionar localmente. AX Free incluye 25,000 spans de trazas/mes, 1 GB/mes de ingesta, 15 días de retención y usuarios y evaluaciones ilimitados. AX Pro cuesta $50/mes, con 50,000 spans, 10 GB/mes de ingesta, 30 días de retención y usuarios y evaluaciones ilimitados. AX Enterprise tiene precio personalizado, con volumen y retención a medida y despliegue SaaS o en infraestructura propia.

Esa página no publica un precio de instancia de pago para Phoenix ni tarifas por exceso de consumo de Phoenix. Afirmar que Phoenix cuesta «$50/mes» mezclaría dos productos. Si buscas un servicio gestionado de Arize, evalúa AX con sus propios límites de spans y bytes; si buscas Phoenix, presupuesta la infraestructura que vas a operar.

En la aplicación del ejemplo, los 500,000 spans equivalen a diez veces el volumen de spans incluido en AX Pro. La página pública no ofrece una tarifa por exceso para ese caso, así que corresponde pedir una cotización en lugar de extrapolar un precio. Con cinco spans por ejecución, el volumen de AX Free equivale a 5,000 ejecuciones y el de Pro a 10,000, siempre que también se respeten los límites de bytes y los demás límites.

En Phoenix alojado en infraestructura propia, la licencia de software sigue costando cero con el volumen del ejemplo. Eso no significa que conservar 500,000 spans almacenados no cueste nada. Define una política de almacenamiento, estima el tamaño de los datos enviados, incluye copias de seguridad y asigna a alguien las actualizaciones y la recuperación. «Ya operamos esta infraestructura» y «necesitamos una nueva plataforma privada» llevan a costos totales diferentes.

Licencia: revisa las condiciones del backend

La licencia actual del repositorio del backend de Phoenix es Elastic License 2.0. Permite el uso sujeto a sus restricciones y prohíbe ofrecer una parte sustancial de las funciones del producto a terceros como servicio alojado o gestionado. También restringe eludir funciones basadas en claves de licencia y eliminar avisos de licencia. Este régimen de permisos difiere del núcleo MIT de Langfuse y de la licencia Apache 2.0 de Helicone.

Refleja esa distinción al tramitar la compra. «El código está disponible», «nuestro despliegue es gratuito» y «la licencia permite convertirlo libremente en un servicio» son afirmaciones diferentes. La recomendación de este artículo se refiere a operar Phoenix para el trazado y la evaluación de tu aplicación; no presupone el derecho a revender Phoenix como producto alojado.

La guía de alojamiento en infraestructura propia indica que Phoenix no tiene cargos de licencia, límites de uso ni funciones restringidas por plan en esta modalidad, y que puede funcionar completamente aislado de la red. Documenta opciones de despliegue mediante terminal, Docker/Compose, Kubernetes/Helm y nube. Una instalación privada sigue necesitando una configuración y un plan de recuperación adecuados para los datos que almacena.

OpenTelemetry y el proceso de evaluación

Phoenix acepta trazas OTLP y se basa en OpenTelemetry y la instrumentación OpenInference. El registro documentado incluye llamadas al modelo, recuperación de información, herramientas y lógica personalizada. Las evaluaciones pueden utilizar modelos jueces, comprobaciones mediante código o etiquetas humanas. Los conjuntos de datos y los experimentos permiten volver a ejecutar distintas versiones de la aplicación con las mismas entradas, mientras que las herramientas de prompts admiten control de versiones y repetición.

La guía de configuración del trazado ofrece phoenix.otel para Python y @arizeai/phoenix-otel para TypeScript, además de organización por proyectos y sesiones. Un equipo que trabaja con Collector debe comprobar en Phoenix los mismos campos semánticos concretos que utiliza en otros destinos. Conservar el ID de traza es útil; conservar qué operación recuperó el contexto equivocado es lo que permite actuar.

Para un asistente de recuperación de información, empieza por un fallo conocido: el modelo dio una respuesta segura a partir de un documento irrelevante. Revisa si el span de recuperación contiene la evidencia necesaria para distinguir un problema de búsqueda de uno de generación de respuesta. Guarda esa entrada y el comportamiento esperado en un conjunto de datos, cambia un ajuste de recuperación o del prompt y compara el resultado. Un ejemplo reproducible conecta la observación del problema con la prevención de su reaparición.

Lo bueno
Lo que hace bien
7 points

  • La guía no establece cargos de licencia de software ni un límite máximo de uso para el alojamiento en infraestructura propia
  • La documentación admite un despliegue aislado de la red
  • OTLP y OpenInference conectan el trazado con vías habituales de instrumentación
  • Los conjuntos de datos, los experimentos y los distintos tipos de evaluación permiten comprobar regresiones
  • ELv2 tiene restricciones que quedarían ocultas al resumirla como una licencia permisiva
  • Tu organización se hace cargo de la infraestructura, la retención, las actualizaciones y la recuperación
  • Los límites y precios de AX de pago no describen una suscripción de pago de Phoenix

5. Braintrust: cuando las evaluaciones deciden qué lanzar

Braintrust es una plataforma de evaluación y observabilidad para equipos que deciden sus lanzamientos a partir de ejemplos puntuados, conjuntos de datos y experimentos. Un responsable de IA de producto que compara un cambio de prompt puede revisar las trazas y determinar si la nueva salida supera las mismas comprobaciones que la versión anterior. El límite presupuestario está en los datos procesados y las puntuaciones, a los que se suman el cómputo de modelos y la retención ampliada. Elígelo si el proceso de evaluación tiene un responsable e influye en lo que lanzas; empieza con Starter si sus límites y funciones cubren tus necesidades.

Precios de Braintrust con los planes Starter, Pro y Enterprise y los contadores de datos procesados y puntuaciones
Braintrust

Ideal para: Un equipo de producto de IA que mantiene conjuntos de datos de evaluación y criterios de lanzamiento
Lo más destacado: Usuarios, proyectos, conjuntos de datos, entornos de prueba y experimentos ilimitados en Starter
Precio: Starter tiene una cuota de plataforma de $0 con consumo de pago; Pro cuesta $249/mes más consumo
Prueba gratuita: Starter ofrece un volumen gratuito recurrente y no requiere tarjeta de crédito para empezar

Planes disponibles y las dos unidades de cobro

Starter tiene una cuota mensual de plataforma de $0, incluye 1 GB de datos procesados/mes y después cobra $4/GB; incluye 10,000 puntuaciones/mes y después cobra $2.50 por cada 1,000; ofrece 14 días de retención y $10 mensuales en créditos para modelos. Los usuarios, proyectos, conjuntos de datos, entornos de prueba y experimentos son ilimitados. Por tanto, necesitar un espacio compartido de evaluación no obliga a contratar Pro de inmediato.

Pro cuesta $249/mes, incluye 5 GB de datos procesados y después cobra $3/GB; incluye 50,000 puntuaciones y después cobra $1.50 por cada 1,000; ofrece 30 días de retención, con retención adicional a $0.50/GB/mes, y $100 mensuales en créditos para modelos. Añade gráficos personalizados, entornos, controles de acceso por roles y soporte prioritario. Enterprise tiene precio personalizado, con retención y exportación a medida, soporte y acuerdos de despliegue en instalaciones propias o alojado.

Una puntuación es una salida evaluada, ya sea por un modelo juez, una evaluación automatizada o una función de puntuación mediante código personalizado. El cargo por almacenar o procesar esa puntuación es distinto del cómputo que la produjo. Los créditos de modelos incluidos tienen su propio alcance; no son un reembolso de todas las facturas de proveedores de la aplicación.

Con los 5 GB y 10,000 puntuaciones del ejemplo, Starter cobra $16 por exceso de datos y nada por exceso de puntuaciones. Pro cuesta $249 antes de cualquier consumo adicional. Si lo que necesitas ahora son conjuntos de datos compartidos, experimentos y trazas dentro de las funciones del plan gratuito, el salto de $249 debe responder a una necesidad de funciones o de retención.

¿Cuándo empiezan a compensar las tarifas de consumo más bajas?

Con 100,000 puntuaciones/mes y los mismos 5 GB de datos procesados, Starter cuesta $241 y Pro $324, antes del consumo de modelos y las ampliaciones de retención. La tarifa por unidad más baja de Pro no compensa automáticamente su cuota fija.

Con ese mismo supuesto de bytes, el punto de equilibrio solo por consumo está en 183,000 puntuaciones/mes, cuando ambos planes alcanzan $448.50. El cálculo excluye las diferencias en créditos para modelos, retención y funciones, que pueden justificar subir de plan antes. Es un umbral presupuestario, no una recomendación de posponer controles de acceso que necesitas.

La pregunta operativa es qué comprobaciones justifican su costo. Un flujo de soporte puede necesitar una comprobación determinista de argumentos de herramientas en cada ejecución y una revisión de calidad de respuestas con un modelo sobre una muestra. Esas comprobaciones tienen propósitos y costos de cómputo distintos. Mantén un conjunto de datos conocido para los lanzamientos y toma muestras de producción para descubrir fallos que ese conjunto no había previsto.

Evita tratar una puntuación media alta como una decisión de lanzamiento completa. Agrupa los ejemplos por flujo de trabajo y resultado, para que una mejora en respuestas fáciles no oculte una regresión en la acción difícil que importa a tus clientes. Esto es un criterio editorial de evaluación, no la afirmación de que una plataforma proporcione automáticamente una rúbrica correcta.

Ingesta OTel y alojamiento comercial del plano de datos

La integración de OpenTelemetry documenta un exportador de trazas OTLP, un procesador de spans de Braintrust, un exportador de logs y el reenvío de logs mediante Collector. El endpoint base de la API es https://api.braintrust.dev/otel; la autenticación y la cabecera x-bt-parent=project_id:... dirigen los datos al proyecto previsto. Los endpoints específicos de cada señal incluyen la ruta de trazas o logs. El paquete separado @braintrust/otel admite la integración de JavaScript documentada.

Sigue las instrucciones de correspondencia de campos para comprobar las entradas, las salidas y los metadatos después de la ingesta. Que se acepten tanto una línea de log como un span de aplicación no los convierte en registros de evaluación equivalentes. Confirma qué objeto servirá de entrada para el experimento que quieres ejecutar.

Los planes de despliegue reservan BYOC y el alojamiento en infraestructura propia para Enterprise. Se trata de comprar una plataforma comercial, no una licencia de backend de código abierto. Más concretamente, la guía de arquitectura mantiene el plano de control, incluidos la interfaz, la autenticación y los metadatos de gestión, en el SaaS de Braintrust. El plano de datos, donde residen las trazas, los conjuntos de datos y otros datos de IA, puede ejecutarse en tu propia cuenta de nube. El navegador se comunica directamente con ese plano de datos.

Esta distinción determina algunas decisiones de compra. Controlar dónde residen los prompts y las salidas puede cumplir un requisito de ubicación de datos y, al mismo tiempo, mantener la dependencia del plano de control del proveedor. Una organización que exige que todos los componentes del producto funcionen sin conexión debe comparar esa arquitectura con la opción aislada de la red documentada por Phoenix antes de firmar.

Lo bueno
Lo que hace bien
8 points

  • Starter permite compartir un espacio de evaluación sin cargos por usuario
  • Los volúmenes incluidos de datos procesados y puntuaciones permiten distinguir componentes del presupuesto
  • Pro ofrece una ampliación clara de funciones para gráficos, entornos, acceso y retención
  • Las vías OTel documentadas pueden recibir un flujo de instrumentación existente
  • Las cargas de datos grandes y el volumen de puntuaciones generan cargos por consumo separados
  • Las tarifas por unidad más bajas de Pro no siempre compensan su suscripción de $249
  • El cómputo del modelo juez y la retención ampliada necesitan un presupuesto propio
  • Alojar los datos en tu infraestructura no traslada allí el plano de control SaaS

6. Datadog Agent Observability: para equipos que ya operan con Datadog

Datadog Agent Observability es el nombre actual del producto que suele buscarse como Datadog LLM Observability, y encaja especialmente en equipos que ya investigan incidentes de aplicaciones en Datadog. Un timeout de un agente de soporte puede deberse a una llamada al modelo, a un servicio lento o a un problema en la sesión del usuario. El valor de la plataforma está en conectar el registro del agente con ese contexto operativo más amplio. Sus límites están en el compromiso de contratación, la retención y el costo de los demás productos de Datadog que necesites. Elígelo si quienes responden al incidente ya trabajan en Datadog y compartir ese contexto cambia la investigación.

Precios de Datadog Agent Observability con los volúmenes de spans de LLM incluidos en Free y Pro
Datadog Agent Observability

Ideal para: Un equipo de SRE o plataforma que relaciona fallos de IA con incidentes de aplicaciones e infraestructura
Lo más destacado: Facturación por spans de LLM en lugar de por cada operación de recuperación, herramienta o flujo de trabajo
Precio: Pro cuesta $160/mes con compromiso anual, $200 de mes a mes o $240 bajo demanda, más los spans de LLM adicionales
Prueba gratuita: Free incluye 40,000 spans de LLM/mes; la página de precios también permite registrarse para una prueba

Precios de Datadog LLM Observability

La página de precios vigente ofrece Free por $0, con 40,000 spans de LLM/mes, 15 días de retención de trazas, contexto y evaluaciones ilimitados y acceso a todas las funciones. Pro incluye 100,000 spans de LLM/mes, también con 15 días de retención de trazas. El precio base es de $160/mes con facturación anual, $200 de mes a mes o $240 bajo demanda.

Los spans de LLM adicionales cuestan $3.50 por cada 10,000 con la tarifa anual, $4.20 de mes a mes o $5 bajo demanda. Para 200,000 spans de LLM, los totales del ejemplo son $195, $242 y $290, respectivamente. Compara expresamente los compromisos de contratación: el precio anunciado con tarifa anual no es la factura de un contrato de mes a mes.

La unidad facturable es una llamada al modelo, no cada operación de la traza. El proveedor indica que los spans de herramientas, recuperación de información y del flujo de trabajo que los engloba no se facturan como spans de LLM. Con dos llamadas al modelo por ejecución, el volumen de Free equivale a 20,000 ejecuciones completas, sujeto al resto de las condiciones del plan. Instrumentar más herramientas no tiene por qué generar más spans de LLM facturables; un bucle de razonamiento que llama repetidamente al modelo sí.

Existe retención ampliada, pero la página pública no proporciona una tarifa que pueda incorporarse a esta comparación. Pide un precio para ese requisito cuando necesites investigar incidentes antiguos. Un registro completamente instrumentado que ya haya caducado no sirve para resolver después una disputa con un cliente.

Observabilidad de IA de Datadog dentro del entorno de operaciones

Agent Observability se puede contratar por separado; el proveedor indica que no exige otras suscripciones de Datadog. Su página de precios también describe el valor adicional de correlacionar los datos con APM, monitoreo de infraestructura y Real User Monitoring cuando utilizas esos productos. Quien empieza desde cero debe presupuestarlos aparte, en vez de asumir que la suscripción de observabilidad incluye el resto de Datadog.

El producto incluye conjuntos de datos, experimentos, evaluaciones, anotaciones y paneles en todos sus planes publicados. La vista de costos desglosa el consumo por proveedor, modelo e identidad o versión del prompt, con costos disponibles en trazas y spans. Esto permite al responsable del incidente distinguir un aumento de tráfico de un cambio en el trabajo que la aplicación exige al modelo.

Un responsable de plataforma debe comprobar esa correlación con un caso concreto. Empieza por una ejecución fallida del agente y sigue la solicitud hasta el servicio responsable de la respuesta de la herramienta. Verifica que la identidad de la traza se conserve al cruzar ese límite y que el operador pueda distinguir la latencia del modelo del tiempo dedicado a otras operaciones. Ese es el proceso que estás comprando; un gráfico de gasto aislado no demuestra su valor.

Licencia SaaS y OpenTelemetry

Datadog ofrece este producto como servicio SaaS comercial bajo su contrato de suscripción. Sus condiciones indican que el MSA rige el servicio alojado. La página de precios actual del producto no ofrece un backend de Agent Observability para alojar en infraestructura propia. Ejecutar por tu cuenta un Datadog Agent o un OTel Collector no significa que alojes el almacenamiento, la interfaz y la plataforma de evaluación.

La guía de OpenTelemetry acepta trazas que siguen las convenciones semánticas GenAI 1.37 o posteriores, o las convenciones de OpenInference admitidas. Documenta ingesta directa sin exigir el Datadog Agent ni el SDK de Agent Observability. El exportador del ejemplo utiliza OTLP/HTTP protobuf, con las cabeceras dd-api-key y dd-otlp-source=llmobs.

Las evaluaciones externas tienen un detalle específico de integración: para spans OTel, la documentación exige la etiqueta source:otel y los ID de traza y span como cadenas decimales. Los ID nativos de OTel son hexadecimales, por lo que deben convertirse antes del envío. Valida una evaluación contra una traza conocida, en vez de asumir que la compatibilidad de trazado también garantiza que se asocien automáticamente las evaluaciones.

Lo bueno
Lo que hace bien
8 points

  • Solo los spans de LLM determinan el consumo publicado; se excluyen los spans de herramientas y recuperación de información
  • Quienes ya operan con Datadog pueden conectar los registros del agente con el contexto más amplio de producción
  • Free y Pro incluyen las funciones de evaluación y experimentación indicadas
  • La ingesta OTel directa está documentada y no requiere un Datadog Agent
  • La tarifa anunciada más baja exige un compromiso anual
  • La retención de trazas incluida es de 15 días en ambos planes publicados
  • Los demás servicios de Datadog se compran por separado
  • El producto utiliza un backend comercial alojado por el proveedor, en lugar de un servidor de observabilidad en infraestructura propia

Qué herramienta elegir según el tamaño del equipo

Elige primero según quién debe actuar sobre los registros y después según qué unidad de cobro crece con la aplicación. El número de personas influye en el presupuesto, pero no sustituye saber si el responsable es un desarrollador, un líder de producto de IA o quien responde a los incidentes.

Uno o dos desarrolladores: Empieza con el volumen gratuito que te permita completar la primera revisión de producción. Langfuse Hobby sirve para compartir una vista entre dos personas, aunque sus 50,000 unidades se consumen rápido cuando cada ejecución emite varias operaciones. LangSmith Developer encaja con un usuario. Braintrust Starter resulta atractivo cuando el objetivo ya es mantener un conjunto de datos y comprobar los lanzamientos mediante puntuaciones. Phoenix encaja si decides conscientemente operar el backend.

De tres a diez personas: Langfuse Core es la opción más recomendable cuando varios desarrolladores y un responsable de producto necesitan acceso habitual. Braintrust Starter puede costar menos si sus límites de datos, puntuaciones, retención y funciones cubren un proceso centrado en la evaluación. Helicone Pro justifica su cuota cuando el gateway y el monitoreo de solicitudes forman parte de la compra. LangSmith Plus justifica su costo por usuario cuando los revisores utilizan activamente su proceso de desarrollo.

Un grupo de revisión más amplio, con distintas funciones: Cuenta cada usuario de pago de LangSmith antes de incorporar al espacio de trabajo a personas de calidad, producto o soporte. Los planes con usuarios ilimitados pueden mantener estable la suscripción aunque aumente la participación. Aun así, hay que gestionar el volumen de trazas, bytes y puntuaciones. La decisión cambia cuando el proceso específico de una plataforma ahorra más trabajo de revisión o evita más fallos repetidos de lo que cuesta la diferencia de suscripción.

Un equipo de SRE o plataforma que ya utiliza Datadog: Prioriza Datadog cuando haya que investigar un incidente del agente junto con servicios y sesiones de usuarios. Tener responsables y contexto de trazas ya definidos puede reducir la utilidad de una consola especializada aparte. Su contador, limitado a spans de LLM, también merece atención cuando el agente realiza muchas operaciones que no llaman al modelo.

Un requisito de alojamiento privado: Phoenix y Langfuse ofrecen opciones de licencia y despliegue sustancialmente diferentes; Helicone añade una alternativa con licencia Apache. El alojamiento de LangSmith y Braintrust en infraestructura propia requiere acuerdos empresariales comerciales. El plano de datos de Braintrust controlado por el cliente sigue utilizando el plano de control del proveedor. Decide qué debe permanecer en tu infraestructura antes de determinar qué plan resulta barato.

La regla explícita es sencilla: paga por el proceso que cambia una decisión de producción y después proyecta los registros y las personas que ese proceso genera. Si no puedes identificar esa decisión, empieza con una implementación más acotada.

Compatibilidad con OpenTelemetry: comprueba la ruta y los campos

La compatibilidad con OpenTelemetry solo sirve si los campos importantes de tu aplicación sobreviven a la ingesta. OTel es un sistema estándar de instrumentación; OTLP es el protocolo con el que se envía su telemetría. Un flujo de spans puede llegar correctamente y, aun así, el backend no recibir el modelo, el consumo, el contexto del cliente o la relación entre una herramienta y quien la invocó.

Las vías documentadas son distintas. Langfuse acepta HTTP JSON o protobuf en su endpoint OTLP e indica que no admite gRPC. LangSmith acepta trazado OTel con correspondencias de atributos GenAI, OpenInference y otros, y documenta la distribución desde un Collector a varios destinos. Phoenix acepta OTLP y utiliza instrumentación OpenInference. Braintrust documenta vías de ingesta de trazas, procesamiento de spans y logs. Datadog especifica qué convenciones GenAI u OpenInference admite. Helicone documenta su integración asíncrona con OpenLLMetry; la guía citada no establece un receptor OTLP genérico para Collector.

Para comprobar el encaje, conserva una ejecución representativa a lo largo de toda la ruta. Confirma las relaciones entre spans padre e hijo, el nombre del modelo, los tokens, el costo, la política de entradas y salidas y los metadatos de versión. Si participan dos servicios, comprueba que el contexto cruce ese límite. Si la plataforma agrupa conversaciones en sesiones, verifica el identificador de sesión en lugar de asumir que un ID de traza común cubre toda la conversación.

Revisa con cuidado la variable del endpoint. Un endpoint base compartido y uno específico de trazas son formas de configuración diferentes. Sigue las instrucciones del proveedor sobre región, autenticación y ruta. Después revisa el registro en el proyecto de destino: una respuesta HTTP correcta confirma que se aceptaron los datos, pero no que se atribuyeron correctamente a la operación de negocio.

Por último, identifica las vías de exportación duplicadas. Un callback del framework y una biblioteca separada de instrumentación automática pueden observar la misma llamada al modelo. Antes de dar por hecho que el costo se disparó, comprueba si añadiste trabajo del modelo o lo registraste dos veces. La comparativa de análisis de fallos ayuda a conectar la traza resultante con una pregunta concreta de diagnóstico.

Compras que conviene evitar

Evita una compra que no encaje con la tarea, aunque el producto forme parte de esta selección. Estos son desajustes concretos con los modelos de facturación u operación documentados.

  • LangSmith Plus solo para compartir una pantalla de costos: La carga de cinco personas del ejemplo cuesta $645 antes de ampliar la retención o pagar el cómputo de evaluación. Ese gasto se justifica cuando el proceso de mejora forma parte del trabajo; ampliar la lista de revisores debe responder a un propósito claro.
  • Braintrust Pro para un uso ligero de evaluación que cabe en Starter: El ejemplo cuesta $16 en Starter frente a $249 en Pro. Compra de forma deliberada la ampliación de funciones, retención o soporte.
  • Presupuestar «Phoenix por $50»: Ese precio corresponde a AX Pro. Con el volumen del ejemplo, los spans públicos incluidos en AX no bastan y no se publica una tarifa por exceso. La infraestructura de Phoenix que tú operas tiene otro presupuesto.
  • Helicone Hobby para un proceso de producción con muchas ráfagas: El volumen de 10,000 solicitudes mensuales no elimina el límite de ingesta publicado de 10 logs/minuto. Verifica el patrón de tráfico antes de depender del plan gratuito.
  • Usar el precio anual anunciado de Datadog para aprobar un presupuesto de mes a mes: $160 es la base con tarifa anual; la base de mes a mes es $200 y el total calculado del ejemplo con esa tarifa es $242.
  • Cualquier opción de alojamiento propio sin responsable: Una licencia gratuita no asigna la responsabilidad de recuperar copias de seguridad, actualizar ni controlar el acceso a los datos. Un «plano de datos en infraestructura propia» de un producto comercial tampoco traslada automáticamente todo el producto a tu entorno.

Un gráfico de costos que parece preciso pero omite consumo es un control presupuestario deficiente. Compara el consumo informado por el proveedor para una solicitud conocida con el registro almacenado y concilia el total con la factura que pagas. Una plataforma de observabilidad explica el gasto; una política de detención debe influir en la siguiente acción de la aplicación.

Por dónde empezar el lunes: convierte un fallo en una prueba de lanzamiento

Instrumenta un flujo de trabajo valioso y haz reproducible un fallo conocido antes de ampliar la implementación. Un asistente de soporte que reintenta consultar un pedido, selecciona el documento equivocado o redacta un reembolso sin respaldo es un buen candidato, porque su responsable puede definir el comportamiento esperado.

Un conector defectuoso pasa de representar un fallo de producción aislado a un ejemplo conservado en un conjunto de datos y un indicador de pruebas de lanzamiento
Conserva el ejemplo fallido y utiliza la misma entrada para comprobar la siguiente versión.

Identifica al responsable del flujo de trabajo, la versión y el resultado de negocio. Captura la ejecución completa, revisa sus operaciones de modelo y herramientas y verifica los campos de consumo. Comprueba qué ocurre cuando el exportador va lento o termina un proceso de corta duración. La primera prueba de adopción consiste en determinar si los registros llegan con contexto suficiente para responder la pregunta del responsable.

Después incorpora el fallo conocido a un conjunto de datos con un resultado esperado claro. Puede ser «no prometas un reembolso sin la aprobación de la herramienta» o «cita la política recuperada que se aplica a este cliente». Utiliza una comprobación mediante código cuando la regla sea determinista y una rúbrica de calidad revisada cuando haga falta juicio. Conserva la entrada y la regla para que un cambio de prompt o modelo tenga que superar más adelante la misma prueba.

Define expresamente el control de aprobación del lanzamiento. Una media aprobatoria no debe ocultar un fallo en la acción que intentas proteger. Revisa el resultado del caso difícil que has identificado e inspecciona la traza cuando falle. Después toma muestras de producción para encontrar nuevos casos que deban incorporarse al conjunto de datos.

Antes de la siguiente decisión de suscripción, registra tus recuentos reales de trazas, operaciones por traza, llamadas al modelo, puntuaciones almacenadas, bytes procesados o conservados, revisores y necesidades de retención. Recalcula la factura con esas cifras. El resultado útil de la primera semana es un flujo corregido y un presupuesto justificable, cada uno con una persona responsable.

Preguntas frecuentes

¿Cuál es la mejor herramienta de observabilidad de IA?

Langfuse es la opción más recomendable para un equipo pequeño en producción que necesita compartir trazas y costos. Braintrust encaja con decisiones de lanzamiento basadas en evaluaciones; Phoenix, con un backend privado bajo tu responsabilidad; y Datadog, con un proceso de operaciones ya existente. El responsable y los requisitos de despliegue determinan qué especialista debe sustituir a la opción inicial.

¿Qué métricas se usan para observar aplicaciones con LLM?

Sigue los tokens y el costo del proveedor, la latencia, los errores, los reintentos, los resultados de recuperación de información y herramientas, y las evaluaciones. Agrúpalos por cliente, flujo de trabajo y versión. El costo por resultado de negocio correcto es más útil que el total de tokens cuando los fallos y los reintentos consumen una parte significativa del gasto.

¿Cuáles son las 3 principales herramientas de observabilidad?

Para los tres perfiles de producción de esta comparación, elige Langfuse para trazado compartido general, Braintrust para trabajo de producto guiado por evaluaciones y Datadog para contexto de operaciones. La selección responde a esos perfiles; no afirma una superioridad medida en todas las funciones o modalidades de despliegue.

¿Qué herramientas de código abierto hay para la observabilidad de LLM?

El núcleo de Langfuse utiliza licencia MIT y el repositorio de Helicone, Apache 2.0. Phoenix se puede alojar gratis en infraestructura propia, pero su backend utiliza Elastic License 2.0, con restricciones sobre servicios alojados. Revisa la licencia real del backend en lugar de asumir que cualquier producto descrito como de código abierto tiene una licencia permisiva.

¿Qué son las herramientas de observabilidad de LLM?

Registran cómo se ejecutó una aplicación basada en un modelo de lenguaje grande: llamadas al modelo, herramientas, recuperación de información, tiempos, consumo y comprobaciones de salida. El resultado útil es una ejecución fallida que se pueda explicar, que oriente una corrección y que se convierta en una prueba reproducible antes de cada lanzamiento.

¿Cuánto cuesta Langfuse?

Precios verificados el 5 de octubre de 2026: Hobby es gratuito, Core cuesta $29/mes, Pro $199/mes y Enterprise $2,499/mes. El complemento opcional Teams de Pro cuesta $300/mes. Los planes de pago añaden consumo por trazas, observaciones y puntuaciones; la carga de 610,000 unidades del ejemplo cuesta $69.80 en Core.

¿Se puede usar Langfuse gratis?

Sí. Hobby incluye 50,000 unidades al mes, dos usuarios y 30 días de acceso a los datos. También puedes alojar el núcleo con licencia MIT en tu infraestructura sin pagar licencia de software, asumiendo el costo y la operación de esa infraestructura. Las funciones empresariales comerciales tienen condiciones separadas.

¿Qué alternativas hay a Langfuse?

LangSmith encaja con un proceso de mejora de LangChain o LangGraph; Helicone, con monitoreo de solicitudes desde un gateway; Phoenix, con un backend privado; Braintrust, con conjuntos de datos y lanzamientos basados en evaluaciones; y Datadog, con incidentes de agentes dentro de un entorno de operaciones existente. Compara la unidad de cobro real y los requisitos de retención antes de cambiar de plataforma.

¿Se puede ejecutar Langfuse en local?

Sí. Langfuse documenta el alojamiento con Docker en infraestructura propia y ofrece guías de despliegue para el núcleo con licencia MIT. Empezar en local no proporciona copias de seguridad de producción, disponibilidad ni un responsable de actualizaciones. Define esos requisitos si la instalación va a convertirse en el servicio de trazado de producción.

Consigue la lista de verificación para auditar flujos de negocio con IA e identifica el flujo, el responsable, el resultado y el punto de control antes de ampliar tus herramientas de producción.

Última actualización
5 oct 2026
Categoría
Build

Prefiera este sitio en Google

Añadir omidsaffari.com como fuente preferida en la Búsqueda de Google

Marque omidsaffari.com como fuente preferida y Google lo destacará para usted en Top Stories, AI Overviews y AI Mode.

Artículos relacionados
OpenCode: tu agente de IA para programar, paso a paso

OpenCode: tu agente de IA para programar, paso a paso

Aprende a usar OpenCode: instala el agente, conecta tus modelos, configura AGENTS.md y plugins, revisa los cambios y entiende los costos de API y Zen.4 oct 2026Build
Netlify gratis y de pago: planes, créditos y costos en 2026

Netlify gratis y de pago: planes, créditos y costos en 2026

Compara Netlify gratis, Personal y Pro: precios en USD, consumo de créditos y presupuestos mensuales para un sitio, una app Next.js o una agencia.4 oct 2026Build
Softr: opiniones, precios y límites para elegir bien

Softr: opiniones, precios y límites para elegir bien

Descubre si Softr encaja con tu portal de clientes o herramienta interna: precios, permisos, límites de usuarios y registros, funciones de IA y alternativas.4 oct 2026Build
¿Tiene Claude Code precio fijo? Compara costos y alternativas en 2026

¿Tiene Claude Code precio fijo? Compara costos y alternativas en 2026

Compara el precio de Claude Code con OpenCode, Codex CLI, Pi y Gemini CLI: suscripciones, costos de modelos y lo que implica cambiar de agente.4 oct 2026Build
MCP server: cuándo añadir un gateway y cuánto cuesta

MCP server: cuándo añadir un gateway y cuánto cuesta

Qué aporta un gateway a un MCP server, cuándo lo necesita tu equipo y cuánto cuesta: compara Cloudflare, Docker y Lasso con sus límites operativos.4 oct 2026Build
OpenAI API Pricing 2026: cuánto gastar con GPT-6.1 Sol

OpenAI API Pricing 2026: cuánto gastar con GPT-6.1 Sol

Tarifas de OpenAI API y tres presupuestos con GPT-6.1 Sol, Luna y Astra. Calcula el gasto en tokens, voz, imágenes, búsquedas y contenedores.3 oct 2026Build
Pi: un asistente de programación con IA a tu medida

Pi: un asistente de programación con IA a tu medida

Configura Pi 1.0 con tu cuenta de modelos, añade AGENTS.md y completa una primera tarea. Con precios de proveedores y límites explicados sin rodeos.3 oct 2026Build
Agentes de IA sin programar: qué plataforma elegir en 2026

Agentes de IA sin programar: qué plataforma elegir en 2026

Compara 8 plataformas para crear agentes de IA sin programar. Precios, límites y permisos de Gumloop, MindStudio, n8n y más para elegir según tu trabajo.1 oct 2026Build
Newsletter

Una carta, cada domingo.Sistemas que funcionan, no opiniones calientes.

Semanal. Sin spam. Cancele cuando quiera.