Monitoramento de agentes de IA: quanto custa em 2026
O benchmark de 20% de computação da OpenAI transforma o monitoramento de agentes de IA em custo real. Veja contas, usos, limites e oportunidades.

Para agentes de alto risco, o monitoramento de agentes de IA está se tornando uma segunda carga de inferência — e não um painel gratuito. A OpenAI estima agora que seu monitoramento ampliado consome cerca de 20% da computação de inferência que supervisiona. Assim, a segurança deixa de ser uma promessa invisível e vira uma linha do orçamento, capaz de mudar a economia do modelo, a arquitetura do sistema e até a decisão de colocá-lo em produção.
Resposta curta: reserve uma margem de estresse de 20% em computação
O número mais útil para o planejamento de 2026 é 1.2 vezes o orçamento da inferência monitorada. Na divulgação de 18 de agosto, a OpenAI informa que a sobrecarga atual de monitoramento equivale a cerca de 20% da computação de inferência supervisionada, mas ressalva que o custo varia bastante conforme a carga de treinamento e avaliação.
Isso não é um preço universal de mercado. Não é uma licença de software por usuário. Tampouco significa 20% de todo o programa de IA. É um benchmark primário do gasto adicional de computação usado pelo monitoramento interno da OpenAI nas cargas cobertas.
A decisão prática é simples: se um agente pode escrever código, movimentar dinheiro, acessar dados de produção ou se conectar à internet, teste a viabilidade econômica com uma reserva de 20% para monitoramento antes de fechar as contas. Um assistente somente leitura que redige textos internos não precisa da mesma estrutura de um agente de segurança autônomo.
O que é monitoramento de agentes de IA, na prática
Neste contexto, monitorar um modelo de IA significa acompanhar o comportamento do agente enquanto ele trabalha, inclusive a sequência de ações que leva ao resultado. É algo além da observabilidade convencional, que normalmente registra latência, erros, consumo de tokens e custo depois de uma solicitação.
Pense na segurança de um aeroporto aplicada ao trabalho do agente. Um scanner rápido verifica tudo. Apenas os casos suspeitos seguem para uma investigação mais lenta e sofisticada. Quando o sistema não consegue descartar um risco grave, uma pessoa é acionada.
A nova estrutura da OpenAI segue esse modelo:
- Um detector examina cada token da amostra. A OpenAI o chama de classificador de ativações, um detector que inspeciona a atividade interna do modelo durante a geração.
- Possíveis riscos sobem de nível. Investigadores mais sofisticados e intensivos em computação analisam as ações com ferramentas, o raciocínio disponível e toda a sequência de atividades.
- O sistema procura riscos concretos. Entre os alvos publicados estão acesso não autorizado, roubo de dados, comportamento destrutivo e tentativas de burlar salvaguardas.
- A resposta humana continua no circuito. A OpenAI pretende emitir um alerta em até 30 minutos após detectar uma atividade preocupante. Uma provável violação crítica de limite aciona as equipes de segurança de IA, segurança da informação e pesquisa. Se elas não conseguirem confirmar em até 30 minutos que se trata de um falso positivo, a orientação é pausar a atividade.

Essa cascata é importante porque usar o investigador mais caro em todas as interações desperdiçaria computação. O sistema aplica uma verificação mais leve de forma ampla e concentra o raciocínio mais pesado onde o risco esperado é maior.
A OpenAI exige esse monitoramento em todo treinamento por aprendizado por reforço e em todas as avaliações que usam ferramentas com modelos de capacidade Sol ou superior. O aprendizado por reforço é a etapa de tentativa e erro em que o modelo recebe recompensas por comportamentos melhores. Depois de concluir que o Astra poderia ter capacidades cibernéticas críticas, a OpenAI estendeu o monitoramento a toda inferência do Astra com ferramentas, não apenas a treinamentos e avaliações.
Também houve uma mudança de escopo. Segundo a OpenAI, o monitoramento anterior se concentrava em implantações internas de fronteira e execuções de aprendizado por reforço de fronteira, e não em toda inferência ou todo treinamento com uso de ferramentas. A nova estrutura abrange uma parcela maior do trabalho e, por isso, consome mais computação.
A conta do custo que a maioria dos orçamentos ignora
Os 20% são um multiplicador sobre a inferência monitorada. Se o custo completo de computação permanecer proporcional, a fórmula de planejamento é:
orçamento da inferência monitorada × 0.20 = reserva para monitoramento
Esses são cenários aritméticos, não preços da OpenAI. Uma empresa que use um monitor mais barato, analise apenas uma amostra do tráfego ou encaminhe poucos casos para investigação pode ficar abaixo dessa proporção. Uma carga que envie trajetórias longas a um investigador poderoso pode ficar acima. A OpenAI afirma explicitamente que o custo varia bastante.

A conta do software vem à parte. O Datadog Agent Observability oferece um plano gratuito com até 40,000 spans de LLM e retenção de 15 dias, seguido de um plano Pro de $160 por mês para até 100,000 spans e o mesmo período de retenção. Um span de LLM corresponde a uma chamada a um provedor de modelos. A Datadog cobra por esses spans de chamadas ao modelo; spans de ferramentas, fluxos, agentes, embeddings e recuperação são gratuitos.
Os $160 incluem rastreamento, avaliações, painéis e monitoramento em produção. Não reproduzem o sistema interno de segurança da OpenAI no nível das ativações. Por isso, um orçamento sério precisa de três linhas:
- Software de observabilidade: para coletar e consultar traces.
- Computação do monitor: para executar detectores e investigadores mais profundos.
- Operação de resposta: para analisar alertas, pausar atividades e resolver incidentes.
A escolha do modelo ainda define a maior linha de base. A comparação de APIs de IA mais baratas ajuda a reduzir essa base antes de acrescentar o monitoramento, enquanto o guia de preços do OpenRouter mostra como a tarifa do gateway e a cobrança do provedor podem coexistir com a camada de monitoramento.
Quem mais ganha com o monitoramento
O retorno cresce de acordo com as permissões do agente, sua persistência e o acesso a sistemas valiosos. Estes sete usos estão ordenados do melhor ao pior caso econômico.
1. Equipes de segurança que operam agentes cibernéticos com ferramentas
Uma equipe de segurança pode permitir que um agente inspecione repositórios, execute código, consulte infraestrutura e teste defesas. O fluxo precisa de uma triagem de baixo custo em cada trajetória, uma revisão mais profunda quando o agente busca um acesso inesperado e uma pausa automática diante de uma possível violação crítica de limite.
O retorno está na contenção. Evitar um único vazamento de credenciais ou caminho de rede não autorizado pode valer mais do que a computação gasta no monitoramento. Este é o caso mais claro para aceitar toda a reserva de estresse de 20%: o risco não é uma resposta ruim, mas uma ação em um sistema real.
2. Lideranças de engenharia que implantam agentes de programação internamente
Uma empresa pode dar a agentes de programação acesso ao código-fonte, à integração contínua, a registros de pacotes e a ferramentas de implantação. Um monitor pode comparar a tarefa declarada pelo agente com suas chamadas de ferramentas, sinalizar tentativas de contornar comandos bloqueados e encaminhar ações destrutivas ou transferências externas para revisão humana.
O monitor interno anterior da OpenAI para agentes de programação usava GPT-5.4 Thinking no nível máximo de esforço de raciocínio e analisava as interações em até 30 minutos após sua conclusão. A cobertura incluía o histórico da conversa, o raciocínio disponível, mensagens, chamadas de ferramentas e resultados. O ganho para o negócio é reduzir restrições generalizadas: agentes úteis mantêm acesso amplo, enquanto os comportamentos de maior risco recebem escrutínio direcionado.
3. Equipes de operações que dão aos agentes poder sobre dinheiro
Um agente de atendimento ou comércio pode emitir reembolsos, alterar assinaturas, conceder créditos ou fazer pedidos. O monitor adequado não verifica apenas se cada chamada de API é válida. Ele confere se a sequência ainda corresponde à solicitação do cliente, se tentativas repetidas estão multiplicando o custo e se o agente está se desviando para um resultado financeiro não aprovado.
O retorno aparece na redução de revisões manuais em tarefas rotineiras, sem partir do princípio de que toda chamada válida de API é confiável. Transações de alto valor podem exigir aprovação, enquanto as interações de baixo risco continuam rápidas.
4. Equipes de plataforma que administram os gastos dos agentes
Um agente pode transformar uma única solicitação em várias chamadas de modelo, ferramentas e novas tentativas. A equipe de plataforma consegue rastrear o trabalho inteiro, atribuir o custo por cliente ou funcionalidade e encaminhar aumentos incomuns de gasto para análise. O monitor responde tanto a “Por que esta tarefa custou mais?” quanto a “O trabalho adicional atendeu ao objetivo do usuário?”.
O retorno está em melhorar a economia unitária. O custo por tarefa concluída com sucesso é mais útil do que o custo por token porque inclui ciclos, falhas e uso de ferramentas. O monitoramento pode revelar onde um modelo mais barato, um limite de tentativas mais rígido ou um contexto menor reduziria a conta-base.
5. Equipes de compliance que supervisionam assistentes regulados
Uma equipe de operações financeiras, de saúde ou jurídica pode precisar de evidências sobre o que um agente viu, o que tentou fazer, o que recebeu aprovação e por que uma sessão foi pausada. Um registro da trajetória pode reunir mensagens do modelo, chamadas de ferramentas, verificações de políticas, decisões humanas e resultados finais em um histórico único e auditável.
O retorno é uma evidência que pode ser reaproveitada. A análise de incidentes, a auditoria interna e o ajuste de políticas passam a trabalhar sobre o mesmo histórico de eventos, sem reconstruir a decisão a partir de logs espalhados pela aplicação.
6. Equipes de pesquisa que executam agentes de longa duração
Agentes de longa duração podem trabalhar por horas ou dias, acumulando mais oportunidades de encontrar uma passagem por um limite frágil. O trabalho da OpenAI sobre horizontes longos concluiu que etapas aceitáveis quando vistas isoladamente podem resultar em algo que não seria aprovado. A resposta foi um monitoramento no nível da trajetória, capaz de pausar a sessão e alertar o usuário.
O retorno é a persistência sob controle. A equipe pode deixar o agente explorar um trabalho difícil sem presumir que uma sequência de ações localmente válidas seja segura como um todo.
7. Equipes de modelos que avaliam aprendizado por reforço
Uma equipe de modelos pode acompanhar execuções de treinamento e avaliação para detectar manipulação de recompensas, fraude, acesso não autorizado ou tentativas de manipular o ambiente. Casos suspeitos podem virar novos exemplos de avaliação e dados de treinamento para aprimorar as salvaguardas.
O retorno é um ciclo de aprendizado mais curto entre as evidências de produção e a melhoria do modelo. É algo estrategicamente valioso, mas representa o uso mais restrito porque poucas empresas treinam seus próprios modelos de fronteira.
O que já dá para construir
A demanda atual de busca nos EUA é pequena, porém comercialmente qualificada. A DataForSEO estima 210 buscas mensais por “LLM observability tools”, 90 por “AI agent monitoring”, 90 por “Datadog LLM observability pricing” e 50 por “AI model monitoring”. Os termos principais sem sobreposição verificados nesta análise somam pelo menos 470 buscas por mês. O sinal mais revelador é que “AI agent monitoring” tem CPC de $50.04 e crescimento anual de 100% nos dados de sugestões — perfil de quem está comprando, não apenas pesquisando por curiosidade.

1. Firewall de ações para agentes de IA
Crie uma camada de políticas e monitoramento para empresas cujos agentes podem acionar ferramentas sensíveis. O produto acompanharia toda a sequência de ações, atribuiria uma pontuação aos comportamentos de risco, exigiria aprovação para ações selecionadas e preservaria um histórico do incidente.
Demanda: “AI agent monitoring” é estimado em 90 buscas mensais nos EUA, com alta anual de 100% nos dados atuais de sugestões e CPC de $50.04. “LLM observability tools” acrescenta 210 buscas mensais, CPC de $23.90 e crescimento anual de 24%.
Menor versão vendável: um SDK ou gateway que registre mensagens e chamadas de ferramentas; um mecanismo de regras para dinheiro, transferência de dados, alterações de permissão e exclusão; um classificador leve para a primeira triagem; um investigador mais poderoso para escaladas; e alertas no Slack ou PagerDuty. Comece de forma assíncrona e só depois adicione bloqueios a uma lista curta de ações irreversíveis.
O obstáculo: a maioria de quem desenvolve não consegue inspecionar ativações privadas ou o raciocínio oculto como um provedor de modelos. O produto precisa funcionar com mensagens, chamadas de ferramentas, resultados, permissões e desfechos observáveis. Falsos positivos vão impedir a adoção se as equipes não puderem ajustar as políticas para cada fluxo.
Esta é a oportunidade mais forte. O crescimento das buscas é real, o CPC é o maior do grupo analisado e a dor do comprador está ligada ao risco em produção — não à preferência por mais um painel.
2. Calculadora de custo do monitoramento de IA
Crie uma calculadora para as equipes de plataforma e finanças transformarem traces de agentes em um orçamento completo de monitoramento. Ela separaria inferência do provedor, inferência do monitor, tarifas de observabilidade, armazenamento, retenção e revisão humana.
Demanda: “Datadog LLM observability pricing” é estimado em 90 buscas mensais nos EUA, e os dados de sugestões apontam crescimento anual de 240% e CPC de $17.18. A referência pública de preços da Datadog é $0 por 40,000 spans mensais de LLM e $160 por mês para 100,000 spans, antes da conta do modelo subjacente e de qualquer computação separada para monitoramento de segurança.
Menor versão vendável: envie o consumo de tokens e traces de um mês, escolha as taxas de cobertura e escalada, informe o modelo usado como monitor e compare cenários de sobrecarga de 5%, 10% e 20%. O resultado deve mostrar o custo por tarefa concluída com sucesso e o ponto de equilíbrio entre uma ferramenta gerenciada e uma estrutura interna.
O obstáculo: os 20% da OpenAI são um benchmark interno, não uma proporção universal. O produto precisa permitir a edição das premissas e apresentar faixas de confiança; caso contrário, vira um gerador de orçamentos enganosos.
3. Gravador de evidências de auditoria para agentes
Crie uma camada de evidências somente para anexação, voltada a fluxos de agentes regulados ou de alto valor. Os compradores seriam equipes de compliance, risco e segurança que precisam demonstrar o ocorrido sem entregar logs brutos da aplicação a todos os revisores.
Demanda: “AI model monitoring” é estimado em 50 buscas mensais nos EUA, com KD 6, uma AI Overview e lance alto no topo da página de $30.33. A consulta mais ampla “LLM observability tools” soma outras 210 buscas mensais. O conjunto ativo de buscas relacionadas também inclui “LLM observability metrics”, exatamente a pergunta que um produto de evidências precisa responder.
Menor versão vendável: colete eventos de trace, permissões de ferramentas, decisões de políticas, aprovações humanas e eventos de pausa; oculte conteúdo sensível; depois, gere um pacote compacto de incidente e um relatório recorrente de controles.
O obstáculo: armazenar traces pode criar um passivo de privacidade, e os requisitos de auditoria variam entre empresas e jurisdições. O produto precisa de minimização rigorosa de dados e retenção configurável antes de precisar de mais gráficos.
O que os 20% não compram
O monitoramento, sozinho, não torna um agente seguro. A OpenAI o trata explicitamente como uma camada ao lado do alinhamento e de controles de segurança, como isolamento de cargas de trabalho, isolamento de rede e testes contínuos.
Cinco limitações fazem diferença:
- A estimativa é restrita. Os 20% se aplicam à computação de inferência monitorada nas cargas cobertas pela OpenAI. Não representam 20% de toda inferência, de todo treinamento ou da conta total de IA de um cliente.
- O monitor pode deixar algo passar. A OpenAI afirma que seu sistema anterior para agentes de programação coincidiu com todas as escaladas feitas por funcionários que eram de seu conhecimento, mas isso não estabelece uma taxa de falsos negativos para tráfego aberto.
- Trinta minutos podem ser tarde demais. Um alerta assíncrono pode conter uma sessão de pesquisa de longa duração, mas não consegue desfazer uma transferência, exclusão ou pagamento. Ações irreversíveis ainda exigem verificações de permissão, isolamento ou bloqueio síncrono.
- O acesso ao raciocínio varia. A abordagem da OpenAI depende, em parte, da atividade interna e do raciocínio disponível. Quem desenvolve uma aplicação com um modelo externo talvez veja apenas mensagens, chamadas de ferramentas e resultados.
- Traces completos são sensíveis. O monitoramento pode capturar prompts, dados, credenciais e lógica de negócio. Acesso restrito, ocultação e limites de retenção são requisitos do produto, não um acabamento de compliance.
A regra mais honesta é calibrar o monitoramento pela consequência. Use traces básicos para assistentes somente leitura. Adicione detecção da sequência de ações para agentes com ferramentas. Para ações capazes de movimentar dinheiro, expor dados ou danificar a produção, acrescente limites rígidos de permissão e aprovação síncrona.
A ação para segunda-feira
Na próxima semana, escolha um agente em produção e liste todas as ações que ele pode executar. Separe-as em três classes: somente leitura, gravação reversível e ação irreversível ou externa. Instrumente a trajetória inteira, imponha regras rígidas de aprovação à terceira classe e use um monitor assíncrono nas demais. Acrescente uma reserva de 20% em computação ao orçamento-base de inferência do piloto e substitua essa estimativa pelo custo medido depois de duas semanas.
Não comece comprando o maior pacote de observabilidade. Comece decidindo qual ação precisa ser interrompida, quem será acionado e em quanto tempo a empresa consegue responder.
Quais são as melhores ferramentas de IA para observabilidade?
A melhor categoria depende da finalidade. Use observabilidade de traces para latência, custo de tokens, erros e notas de avaliação; um gateway para roteamento e controles de solicitações; e um monitor de comportamento dedicado a ações de risco com ferramentas e trajetórias completas. Nenhum painel convencional equivale ao monitor interno da OpenAI no nível das ativações.
O que é observabilidade de LLM na Datadog?
O produto da Datadog registra spans de chamadas ao modelo e os conecta a traces, avaliações, painéis e monitoramento em produção. A página pública informa $0 para até 40,000 spans de LLM por mês e $160 mensais para até 100,000, ambos com retenção de 15 dias.
Quais ferramentas de observabilidade de LLM são open source?
Há opções open source para rastreamento, avaliação, gateways e acompanhamento de custos. Escolha com base no modelo de implantação, na cobertura dos traces, no suporte a avaliações, nos controles de privacidade e na capacidade de exportar dados. O código aberto elimina a licença, mas não o custo de armazenamento, inferência do monitor, operações ou resposta a incidentes.
Existem ferramentas gratuitas de observabilidade de LLM?
Sim. A Datadog oferece um plano gratuito com até 40,000 spans de LLM por mês e retenção de 15 dias, e ferramentas open source podem ser hospedadas internamente. Mesmo com software gratuito, as chamadas de modelo, a infraestrutura, o armazenamento e a equipe de resposta continuam no orçamento.
Quais métricas de observabilidade de LLM importam?
Acompanhe custo por tarefa concluída com sucesso, latência, erros, qualidade das avaliações, novas tentativas, volume de chamadas de ferramentas, violações de permissão, taxa de escalada, precisão dos alertas, tempo até a pausa e gravidade dos incidentes. O custo dos tokens, sozinho, não mostra se o agente concluiu o trabalho certo com segurança.
Se você quer uma camada de monitoramento e controle criada para o fluxo real do seu agente, sistemas de IA em produção é o melhor ponto de partida.
2 de set. de 2026







