Monitoreo de modelos de IA: el costo real en 2026
Calcula el costo real de monitorear agentes de IA en 2026: reserva 20% extra de cómputo, separa observabilidad y prioriza los controles críticos.

En los agentes de alto riesgo, el monitoreo de modelos de IA se está convirtiendo en una segunda carga de inferencia, no en un panel gratuito. OpenAI calcula ahora que su sistema ampliado de supervisión consume cerca del 20% del cómputo de inferencia que vigila. Así, la seguridad deja de ser una promesa invisible y pasa a ocupar una partida presupuestaria capaz de cambiar la economía del modelo, el diseño del sistema y hasta la decisión de lanzarlo.
La respuesta breve: reserve un margen de cómputo del 20%
La cifra más útil para planificar en 2026 es 1.2 veces el presupuesto de inferencia monitoreada. En su publicación del 18 de agosto, OpenAI sitúa el costo adicional actual de su monitoreo en cerca del 20% del cómputo de inferencia supervisado, aunque advierte que varía mucho según la carga de entrenamiento y evaluación.
No es un precio universal de mercado, ni una licencia de software, ni el 20% de todo un programa de IA. Es una referencia de primera mano sobre el cómputo adicional que usa el sistema interno de OpenAI en las cargas cubiertas.
La decisión práctica es sencilla: si un agente puede escribir código, mover dinero, acceder a datos de producción o conectarse a internet, pruebe la viabilidad económica con una reserva del 20% para monitoreo antes de cerrar las cuentas. Un asistente de solo lectura que redacta textos internos no necesita la misma infraestructura que un agente de seguridad autónomo.
Qué significa realmente el monitoreo de modelos de IA
En este contexto, monitorear un modelo de IA significa observar la conducta del agente mientras trabaja, incluida la secuencia de acciones que conduce al resultado. Va más allá de la observabilidad convencional, que suele registrar latencia, errores, uso de tokens y costos después de cada solicitud.
Puede imaginarse como el control de seguridad de un aeropuerto aplicado al trabajo de un agente. Un escáner rápido revisa todo. Solo los casos sospechosos pasan a un investigador más lento y capaz. Cuando el sistema no logra descartar un riesgo grave, avisa a una persona.
El nuevo esquema de OpenAI sigue ese patrón:
- Un detector revisa cada token muestreado. OpenAI lo denomina clasificador de activaciones: un detector que inspecciona la actividad interna del modelo mientras genera la respuesta.
- Los posibles riesgos escalan. Investigadores más sofisticados y exigentes en cómputo analizan las acciones ejecutadas con herramientas, el razonamiento disponible y la secuencia completa de actividad.
- El sistema busca riesgos concretos. Entre los objetivos publicados están el acceso no autorizado, el robo de datos, las conductas destructivas y los intentos de eludir las salvaguardas.
- Se mantiene un circuito de respuesta humana. OpenAI busca emitir una alerta en un plazo de 30 minutos desde que detecta una actividad preocupante. Una posible vulneración crítica de límites avisa a los equipos de seguridad, protección e investigación. Si en 30 minutos no consiguen demostrar que se trata de un falso positivo, deben pausar la actividad.

La cascada es importante porque aplicar el investigador más costoso a cada interacción desperdiciaría cómputo. El sistema hace una comprobación ligera de forma general y concentra el razonamiento más intensivo allí donde el riesgo previsto es mayor.
OpenAI exige este monitoreo en todo entrenamiento por aprendizaje por refuerzo y en las evaluaciones que usan herramientas con modelos de capacidad Sol o superior. El aprendizaje por refuerzo es la etapa de prueba y error en la que se recompensa al modelo por mejorar su conducta. Después de determinar que Astra podría tener capacidades cibernéticas críticas, OpenAI amplió el monitoreo a toda la inferencia de Astra con herramientas, no solo al entrenamiento y las evaluaciones.
También ha cambiado el alcance. OpenAI explica que su supervisión anterior se centraba en implementaciones internas de frontera y sesiones de aprendizaje por refuerzo de frontera, no en cada inferencia o entrenamiento que utilizara herramientas. El nuevo sistema cubre más trabajo y, por lo tanto, consume más cómputo.
La cuenta de costos que muchos presupuestos omiten
El 20% multiplica la inferencia que se monitorea. Si el costo total de cómputo se mantiene proporcional, la fórmula de planificación es:
presupuesto de inferencia monitoreada × 0.20 = reserva para monitoreo
Son escenarios aritméticos, no precios de OpenAI. Una empresa que emplee un monitor más barato, muestree solo parte del tráfico o escale pocos casos podría quedar por debajo de esa proporción. Una carga que envíe trayectorias largas a un investigador potente podría superarla. OpenAI señala expresamente que el costo varía de forma considerable.

La factura del software va por separado. Datadog Agent Observability ofrece un nivel gratuito con hasta 40,000 spans de LLM y retención de 15 días, seguido de un nivel Pro de $160 al mes con hasta 100,000 spans y la misma retención. Un span de LLM equivale a una llamada a un proveedor de modelos. Datadog cobra por esos spans de llamadas al modelo; los de herramientas, flujos de trabajo, agentes, embeddings y recuperación son gratuitos.
Esos $160 cubren trazas, evaluaciones, paneles y monitoreo en producción. No reproducen el sistema interno de seguridad de OpenAI que opera en el nivel de las activaciones. Por eso, un presupuesto serio contempla tres partidas:
- Software de observabilidad: recopilación y consulta de trazas.
- Cómputo del monitor: ejecución de detectores e investigadores más profundos.
- Operaciones de respuesta: revisión de alertas, pausa de actividades y resolución de incidentes.
La elección del modelo sigue definiendo la mayor parte del costo base. La comparativa de la API de IA más barata ayuda a reducir esa base antes de añadir el monitoreo, mientras que el análisis de precios de OpenRouter muestra cómo la comisión de un gateway y la factura del proveedor pueden coexistir con la capa de supervisión.
Quién obtiene más valor del monitoreo
El retorno crece con los permisos del agente, su persistencia y su acceso a sistemas valiosos. Estos siete usos están ordenados de mayor a menor solidez económica.
1. Equipos de seguridad que operan agentes cibernéticos con herramientas
Un equipo de seguridad puede permitir que un agente inspeccione repositorios, ejecute código, consulte infraestructura y pruebe defensas. El flujo necesita una revisión de bajo costo para cada trayectoria, un análisis más profundo cuando el agente busca accesos inesperados y una pausa automática si existe la posibilidad de que haya cruzado un límite crítico.
El beneficio es la contención. Evitar una sola filtración de credenciales o una ruta de red no autorizada puede valer más que el cómputo destinado al monitoreo. Es el caso más claro para aceptar la reserva completa del 20%: el riesgo no es una respuesta deficiente, sino una acción dentro de un sistema real.
2. Responsables de ingeniería que despliegan agentes de programación internos
Una organización de ingeniería puede dar a sus agentes de programación acceso al código fuente, la integración continua, los registros de paquetes y las herramientas de despliegue. Un monitor podría contrastar la tarea declarada con las llamadas a herramientas, señalar intentos de eludir comandos bloqueados y enviar a revisión humana las acciones destructivas o las transferencias externas.
El monitor interno anterior de OpenAI para agentes de programación funcionaba con GPT-5.4 Thinking al máximo nivel de esfuerzo de razonamiento y revisaba las interacciones en los 30 minutos posteriores a su finalización. Abarcaba el historial de conversación, el razonamiento disponible, los mensajes, las llamadas a herramientas y los resultados. El beneficio empresarial es reducir las restricciones indiscriminadas: los agentes útiles conservan un acceso amplio y las conductas más arriesgadas reciben una supervisión específica.
3. Equipos de operaciones que autorizan a los agentes a manejar dinero
Un agente de soporte o comercio puede emitir reembolsos, modificar suscripciones, aplicar créditos o realizar pedidos. Un monitor útil no se limita a comprobar si cada llamada a la API es válida. También verifica si la secuencia sigue respondiendo a la solicitud del cliente, si los reintentos están multiplicando el costo y si el agente se desvía hacia un resultado financiero no aprobado.
El beneficio es reducir la revisión manual de tareas rutinarias sin asumir que toda llamada válida a una API es confiable. Las transacciones de alto valor pueden exigir aprobación y las interacciones de bajo riesgo pueden seguir siendo rápidas.
4. Equipos de plataforma que gestionan el gasto de los agentes
Un agente puede convertir una sola solicitud del usuario en numerosas llamadas a modelos y herramientas, además de múltiples reintentos. Los equipos de plataforma pueden rastrear el trabajo completo, atribuir el costo por cliente o función y enviar a inspección cualquier crecimiento inusual del gasto. El monitor responde dos preguntas: «¿Por qué costó más esta tarea?» y «¿Ese trabajo adicional servía al objetivo del usuario?».
El beneficio es mejorar la economía unitaria. El costo por tarea completada con éxito resulta más útil que el costo por token porque incluye bucles, fallos y uso de herramientas. El monitoreo puede revelar dónde un modelo más barato, un límite de reintentos más estricto o un contexto más corto reducirían la factura base.
5. Equipos de cumplimiento que supervisan asistentes regulados
Un equipo de operaciones financieras, sanitarias o legales puede necesitar pruebas de lo que vio un agente, qué intentó hacer, qué recibió aprobación y por qué se pausó una sesión. Un registro de trayectoria puede reunir los mensajes del modelo, las llamadas a herramientas, las verificaciones de políticas, las decisiones humanas y los resultados finales en un único expediente revisable.
El beneficio es disponer de evidencia reutilizable. La investigación de incidentes, la auditoría interna y el ajuste de políticas pueden partir del mismo historial de eventos, en vez de reconstruir una decisión a partir de registros dispersos de la aplicación.
6. Equipos de investigación que ejecutan agentes de larga duración
Los agentes de larga duración pueden trabajar durante horas o días, lo que les da más oportunidades de encontrar una vía alrededor de un límite débil. El trabajo de OpenAI sobre horizontes largos concluyó que pasos aceptables por separado pueden desembocar en un resultado que no habría sido aprobado. Su respuesta fue un monitoreo de trayectorias capaz de pausar una sesión y alertar al usuario.
El beneficio es una persistencia bajo control. Los equipos pueden dejar que un agente explore tareas difíciles sin suponer que una secuencia de acciones válidas en lo local también es segura en su conjunto.
7. Equipos de modelos que evalúan el aprendizaje por refuerzo
Un equipo de modelos puede observar las ejecuciones de entrenamiento y evaluación para detectar manipulación de recompensas, engaño, acceso no autorizado o intentos de alterar el entorno. Los casos sospechosos pueden convertirse en nuevos ejemplos de evaluación y datos de entrenamiento para mejorar las salvaguardas.
El beneficio es cerrar el ciclo entre la evidencia del despliegue y la mejora del modelo. Tiene un gran valor estratégico, pero es el uso más limitado porque pocas empresas entrenan por sí mismas modelos de frontera.
Qué se puede construir hoy con el monitoreo de agentes de IA
La demanda de búsqueda actual en Estados Unidos es reducida, pero tiene una intención comercial clara. DataForSEO estima 210 búsquedas mensuales para «LLM observability tools», 90 para «AI agent monitoring», 90 para «Datadog LLM observability pricing» y 50 para «AI model monitoring». Los términos principales sin solapamiento analizados en esta ocasión suman al menos 470 búsquedas al mes. Más revelador aún: «AI agent monitoring» tiene un CPC de $50.04 y un crecimiento anual del 100% en los datos de sugerencias, señal de compradores y no de simple curiosidad.

1. Firewall de acciones para agentes de IA
Cree una capa de políticas y monitoreo para empresas cuyos agentes pueden utilizar herramientas sensibles. Esta capa observaría la secuencia completa de acciones, puntuaría las conductas de riesgo, exigiría aprobación para determinadas operaciones y conservaría un historial de incidentes.
Demanda: se estiman 90 búsquedas mensuales en Estados Unidos para «AI agent monitoring», un 100% más interanual según los datos de sugerencias actuales, con un CPC de $50.04. «LLM observability tools» aporta otras 210 búsquedas mensuales, un CPC de $23.90 y un crecimiento anual del 24%.
Versión mínima vendible: un SDK o gateway que registre mensajes y llamadas a herramientas; un motor de reglas para movimientos de dinero, transferencias de datos, cambios de permisos y eliminaciones; un clasificador ligero de primera pasada; un investigador más potente para los casos que escalen; y alertas mediante Slack o PagerDuty. Empiece de forma asíncrona y añada bloqueos solo para una lista breve de acciones irreversibles.
El obstáculo: la mayoría de los desarrolladores no puede inspeccionar activaciones privadas ni razonamientos ocultos como sí puede hacerlo el proveedor de un modelo. El producto debe funcionar aun limitándose a mensajes observables, llamadas a herramientas, resultados, permisos y desenlaces. Los falsos positivos impedirán su adopción si los equipos no pueden ajustar las políticas a cada flujo de trabajo.
Esta es la oportunidad más sólida. El crecimiento de las búsquedas es real, el CPC es el más alto del grupo analizado y el problema del comprador está ligado al riesgo en producción, no a una preferencia por otro panel.
2. Calculadora de costos de monitoreo de IA
Cree una calculadora para equipos de plataforma y finanzas que convierta las trazas de los agentes en un presupuesto integral de monitoreo. Debe separar la inferencia del proveedor, la inferencia del monitor, las tarifas de observabilidad, el almacenamiento, la retención y la revisión humana.
Demanda: se estiman 90 búsquedas mensuales en Estados Unidos para «Datadog LLM observability pricing», y los datos de sugerencias muestran un crecimiento anual del 240% y un CPC de $17.18. La referencia de precios publicada por Datadog es de $0 por 40,000 spans de LLM al mes y $160 al mes por 100,000 spans, antes de sumar la factura del modelo subyacente y cualquier cómputo independiente del monitor de seguridad.
Versión mínima vendible: cargue un mes de uso de tokens y trazas, elija las tasas de cobertura y escalamiento, indique el modelo que actuará como monitor y compare escenarios con un costo adicional del 5%, 10% y 20%. El resultado debe mostrar el costo por tarea completada con éxito y el punto de equilibrio entre una herramienta gestionada y una infraestructura interna.
El obstáculo: el 20% de OpenAI es una referencia interna, no una proporción universal. El producto necesita supuestos editables e intervalos de confianza; de lo contrario, se convierte en un generador de cotizaciones engañosas.
3. Registro de evidencia para auditorías de agentes
Cree una capa de evidencia inmutable para flujos de agentes regulados o de alto valor. Los compradores serían equipos de cumplimiento, riesgo y seguridad que necesitan demostrar qué ocurrió sin entregar a cada revisor los registros sin procesar de la aplicación.
Demanda: se estiman 50 búsquedas mensuales en Estados Unidos para «AI model monitoring», con KD 6, un AI Overview y una puja alta en la parte superior de la página de $30.33. La consulta más amplia «LLM observability tools» añade 210 búsquedas mensuales. El conjunto activo de búsquedas relacionadas también incluye «LLM observability metrics», precisamente la pregunta que debe responder un producto de evidencia.
Versión mínima vendible: recopile eventos de traza, permisos de herramientas, decisiones de políticas, aprobaciones humanas y eventos de pausa; oculte el contenido sensible; y genere después un expediente conciso del incidente y un informe periódico de controles.
El obstáculo: almacenar trazas puede convertirse en una responsabilidad de privacidad, y los requisitos de auditoría cambian según la empresa y la jurisdicción. Antes de incorporar más gráficos, el producto necesita una minimización estricta de datos y una retención configurable.
Lo que el 20% no compra
El monitoreo no vuelve seguro a un agente por sí solo. OpenAI lo considera explícitamente una capa adicional a la alineación y a controles de seguridad como el aislamiento de cargas de trabajo, el aislamiento de red y las pruebas continuas.
Hay cinco límites importantes:
- La estimación tiene un alcance acotado. El 20% se aplica al cómputo de inferencia que OpenAI monitorea dentro de las cargas cubiertas. No corresponde al 20% de toda la inferencia, todo el entrenamiento ni la factura total de IA de un cliente.
- El monitor puede omitir incidentes. OpenAI afirma que su sistema anterior para agentes de programación coincidió con todos los casos escalados por empleados de los que tenía conocimiento, pero eso no establece una tasa de falsos negativos para tráfico abierto.
- Treinta minutos pueden ser demasiado. Una alerta asíncrona puede contener una sesión de investigación prolongada, pero no puede deshacer una transferencia, una eliminación o un pago. Las acciones irreversibles todavía requieren controles de permisos, aislamiento o bloqueo síncrono.
- El acceso al razonamiento es desigual. El enfoque de OpenAI se apoya en parte en la actividad interna y el razonamiento disponible. Quien desarrolla una aplicación con un modelo externo quizá solo pueda ver mensajes, llamadas a herramientas y resultados.
- Las trazas completas contienen información sensible. El monitoreo puede capturar prompts, datos, credenciales y lógica empresarial. El acceso restringido, la ocultación de datos y los límites de retención son requisitos del producto, no un mero detalle de cumplimiento.
La regla sensata es monitorear en proporción a las consecuencias. Use trazas básicas para asistentes de solo lectura. Añada detección consciente de la secuencia para los agentes con herramientas. Incorpore límites estrictos de permisos y aprobación síncrona para acciones que puedan mover dinero, exponer datos o dañar la producción.
La acción para el lunes
Elija un agente de producción la próxima semana y enumere todas las acciones que puede ejecutar. Sepárelas en tres clases: solo lectura, escritura reversible e irreversible o externa. Instrumente la trayectoria completa, establezca reglas de aprobación estrictas para la tercera clase y aplique un monitor asíncrono al resto. Añada una reserva de cómputo del 20% al presupuesto base de inferencia del piloto y sustitúyala por el costo medido después de dos semanas.
No empiece por comprar la mayor suite de observabilidad. Empiece por decidir qué acción debe detenerse, quién recibirá la alerta y con qué rapidez puede permitirse responder la empresa.
¿Cuáles son las mejores herramientas de observabilidad para IA?
La categoría adecuada depende del objetivo. Use observabilidad de trazas para latencia, costo de tokens, errores y puntuaciones de evaluación; un gateway para el enrutamiento y los controles de solicitudes; y un monitor de conducta específico para acciones de riesgo con herramientas y trayectorias completas. Ningún panel convencional equivale al monitor interno de OpenAI que opera en el nivel de las activaciones.
¿Qué es la observabilidad de LLM en Datadog?
El producto de Datadog registra spans de llamadas al modelo y los conecta con trazas, evaluaciones, paneles y monitoreo en producción. Su página pública indica $0 por hasta 40,000 spans de LLM al mes y $160 al mes por hasta 100,000, ambos con retención de 15 días.
¿Qué herramientas de observabilidad de LLM son de código abierto?
Hay opciones de código abierto para trazas, evaluación, gateways y seguimiento de costos. Elija según el modelo de despliegue, la cobertura de trazas, las funciones de evaluación, los controles de privacidad y la posibilidad de exportar datos. El código abierto elimina el costo de licencia, no el almacenamiento, la inferencia del monitor, las operaciones ni la respuesta a incidentes.
¿Hay herramientas gratuitas de observabilidad de LLM?
Sí. Datadog ofrece un nivel gratuito con hasta 40,000 spans de LLM al mes y retención de 15 días, y las herramientas de código abierto pueden alojarse en infraestructura propia. El software gratuito no elimina del presupuesto las llamadas al modelo, la infraestructura, el almacenamiento ni la respuesta del personal.
¿Qué métricas de observabilidad de LLM son importantes?
Mida el costo por tarea completada con éxito, la latencia, los errores, la calidad de las evaluaciones, los reintentos, el volumen de llamadas a herramientas, las vulneraciones de permisos, la tasa de escalamiento, la precisión de las alertas, el tiempo hasta la pausa y la gravedad de los incidentes. El costo por token no revela por sí solo si el agente completó de forma segura la tarea correcta.
Si necesita una capa de monitoreo y control adaptada al flujo real de sus agentes, los sistemas de IA en producción son el punto de partida adecuado.
2 sept 2026







