LLM observability em 2026: quais ferramentas compensam para sua equipe?

Compare seis ferramentas de LLM observability: preços para 100,000 execuções mensais, custos por tamanho de equipe, licenças e suporte a OpenTelemetry.

Monday, October 5, 2026Omid Saffari
LLM observability em 2026: quais ferramentas compensam para sua equipe?

Entre as ferramentas de LLM observability, Langfuse, plataforma de tracing e avaliação, é a melhor escolha inicial para uma equipe pequena que já opera em produção: a carga de 100,000 execuções detalhada abaixo custa $69.80/mês no Core, antes do processamento dos modelos e avaliadores. A escolha muda quando você precisa de releases orientados por avaliações, um gateway, hospedagem privada ou contexto para investigar incidentes em uma stack que já usa Datadog.

LLM observability: qual ferramenta atende melhor a cada cenário?

Comece com Langfuse para um painel de produção compartilhado, LangSmith para um ciclo de melhoria centrado em LangChain, Helicone para monitorar requisições por meio de um gateway, Arize Phoenix para uma instalação privada operada pela equipe, Braintrust para decidir releases com base em avaliações e Datadog Agent Observability para incidentes de produção que atravessam a stack da aplicação. O tamanho da equipe pesa mais quando a plataforma cobra por cada pessoa que precisa investigar uma falha.

Um trace registra uma execução da aplicação. Um span representa uma operação dentro desse registro, como uma chamada ao modelo, uma recuperação de dados ou o acionamento de uma ferramenta. Uma avaliação, muitas vezes chamada de eval, verifica se o resultado cumpriu uma regra ou um padrão de qualidade. Os três são necessários para explicar por que um agente deu uma resposta plausível depois de tomar a decisão errada.

Preços conferidos nas páginas oficiais dos fornecedores em 5 de outubro de 2026. Todos os valores em dólares estão em USD. Os preços de entrada não incluem uso adicional nem cobranças dos provedores de modelos, salvo indicação expressa. A comparação se baseia nos preços e na documentação atuais; não apresenta um ranking de desempenho medido em testes práticos.

FerramentaMais indicada paraPreço inicial do plano pagoPlano gratuito / teste
LangfuseEquipes pequenas em produção que precisam compartilhar traces e custosCore $29/mês mais unidadesHobby: 50k unidades/mês, 2 usuários; núcleo gratuito em infraestrutura própria
LangSmithEquipes que já trabalham na melhoria de agentes com LangChain ou LangGraphPlus $39/usuário/mês mais tracesDeveloper: 1 usuário, 5k traces base/mês
HeliconeMonitoramento de requisições junto com um gateway de modelosPro $79/mês mais requisições e armazenamentoHobby: 10k requisições/mês, 1 usuário; planos pagos anunciam teste de 7 dias
Arize PhoenixTracing e avaliação privados, com um responsável pela infraestruturaNenhum plano pago de Phoenix publicado; AX Pro é separado e custa $50/mêsPhoenix em infraestrutura própria não cobra licença; AX Free inclui 25k spans/mês
BraintrustDatasets de avaliação compartilhados e comparação entre releasesPro $249/mês; Starter pode gerar cobranças por usoStarter: 1 GB processado/mês, 10k scores, usuários ilimitados
Datadog Agent ObservabilityEquipes de operações que já usam a plataforma e precisam relacionar falhas de agentes a serviçosPro $160/mês na contratação anual; $200 no mês a mês; $240 sob demandaFree: 40k spans de LLM/mês, retenção de 15 dias

Fontes: preços de Langfuse, preços de LangSmith, preços de Helicone, preços de Arize, preços de Braintrust e preços de Datadog.

A diferença decisiva está na unidade cobrada além da assinatura. Uma plataforma que cobra por trace da aplicação contabiliza um volume diferente de outra que cobra por chamada ao modelo, observação, score ou gigabyte. Antes de comparar assinaturas, estime quais registros sua aplicação gera.

Quanto custam 100,000 execuções de agentes por mês?

Uma equipe de cinco pessoas que opera o mesmo agente pode pagar $69.80 em Langfuse ou $645 em LangSmith, nas condições abaixo. Nenhum desses valores mede qualidade. A diferença vem da forma de contabilizar eventos, do volume incluído e da cobrança por usuário.

Considere esta carga de produção, modelada de forma explícita:

  • 100,000 execuções completas de agentes por mês, com um trace por execução.
  • Cinco operações observadas por execução: um workflow raiz, duas chamadas ao modelo, uma recuperação de dados e uma chamada a ferramenta.
  • 200,000 chamadas ao modelo e 500,000 operações observadas no total.
  • 10,000 scores de avaliações por código calculados externamente, um para cada execução da amostra. Chamadas adicionais ao modelo ou traces de avaliadores ficam fora deste cenário.
  • Cinco usuários com acesso ao painel.
  • 5 GB de dados processados em Braintrust e, separadamente, 5 GB de armazenamento contabilizado em Helicone. São premissas independentes: as métricas de bytes dos fornecedores não são intercambiáveis.

Esse cenário se parece com um agente de atendimento que lê uma solicitação, consulta um pedido, aciona uma ferramenta de gestão de pedidos e pede ao modelo que prepare a resposta final. Os números são premissas de orçamento, não medições de uma aplicação implantada. Um agente que repete tentativas, abre ramificações ou executa avaliadores dentro da plataforma gera outros registros.

Uma execução de agente sem score representada por um workflow, duas chamadas ao modelo, recuperação de dados e uma ferramenta, com diferentes contadores de cobrança por fornecedor
Uma execução sem score pode representar um trace, seis unidades de Langfuse ou duas requisições de modelo cobradas. Os scores têm sua própria contagem.
Ferramenta / planoVolume contabilizado na cobrançaCusto mensal modelado da plataformaO que considerar no orçamento
Langfuse Core610k unidades: traces + observações + scores$69.80Eventos adicionais de avaliadores aumentam as unidades
LangSmith Plus100k traces base, 5 usuários$645Upgrades para traces com retenção estendida e uso de avaliadores geram cobranças
Helicone Pro200k requisições de modelo registradas, 5 GB de armazenamentoEstimativa de $146.25-$149.50A franquia do plano e a calculadora divergem sobre armazenamento
Phoenix em infraestrutura própriaSpans e dados de avaliação que você mantém$0 de licença + sua infraestruturaNão há um preço implícito de infraestrutura hospedada; AX exige uma cotação nesse volume
Braintrust Starter / Pro5 GB processados, 10k scores$16 / $249Uso de modelos e extensão da retenção são cobrados à parte
Datadog Pro200k spans de LLM cobrados$195 na tarifa anual; $242 no mês a mês; $290 sob demandaOutros produtos Datadog e retenção estendida são cobrados à parte

Os cálculos usam as tarifas atuais dos fornecedores nos links acima. O total de LangSmith considera $0.005 por trace base, conforme o tooltip de preços atual, e 10,000 traces incluídos para toda a organização. A faixa de Helicone preserva uma divergência na própria página: a tabela do plano inclui 1 GB gratuito, mas a calculadora cobra armazenamento desde o primeiro gigabyte. Phoenix não cobra por volume na licença; para estimar o custo de operar sua infraestrutura, é preciso dimensionar a instalação real.

Esses totais não servem como cotação geral para agentes com traces mais longos. Se o workflow passar de duas chamadas ao modelo para um ciclo repetido de raciocínio, Datadog e Helicone contabilizam mais operações de modelo. Se você adicionar observações e scores armazenados, Langfuse contabiliza mais unidades. Se enviar documentos maiores com a mesma quantidade de traces, Braintrust contabiliza mais bytes processados. O comparativo de rastreamento de tokens de agentes aprofunda a atribuição dos gastos com provedores a um cliente ou recurso.

Como selecionamos as ferramentas?

O ranking começa pela compra que uma equipe pequena em produção consegue justificar e avança para ferramentas cujo valor depende de uma forma específica de operar. Desenvolvedores e um responsável por IA precisam investigar resultados ruins, acompanhar custos por cliente e transformar falhas em verificações de release. Um produto que resolve apenas uma dessas tarefas ainda pode ser a opção especializada certa.

Cada recomendação considera cinco critérios:

  1. Uma cobrança compreensível. Quem compra consegue identificar se a conta depende de traces, operações, pessoas, scores ou volume de dados, incluindo a franquia gratuita e o próximo limite.
  2. Um registro de produção útil. Uma resposta que falhou pode ser relacionada às operações de modelo, recuperação de dados e ferramentas que a produziram.
  3. Um fluxo de melhoria. O registro alimenta uma avaliação, dataset, experimento ou decisão de revisão, em vez de continuar como um log isolado.
  4. Clareza sobre os limites da implantação. Hospedagem própria gratuita, licença empresarial comercial e plano de dados na infraestrutura do cliente são tratados separadamente.
  5. Instrumentação documentada. O suporte a OpenTelemetry é analisado pelas instruções atuais de integração do fornecedor, incluindo protocolo e mapeamento de campos quando informados.

Os seis produtos cobrem escolhas diferentes: uma plataforma de tracing de uso amplo, um fluxo de desenvolvimento centrado em um framework, um gateway, uma plataforma privada que prioriza a execução local, uma plataforma de avaliação e uma suíte de operações. Um catálogo maior acrescentaria opções sem ajudar nesta decisão específica sobre orçamento e responsabilidades. A comparação não faz afirmações sobre velocidade de ingestão medida, usabilidade da interface, disponibilidade ou precisão das avaliações.

“Gratuito” significa uma franquia utilizável, não a promessa de que a conta ficará zerada. Braintrust Starter e LangSmith Developer podem gerar cobranças por uso. A licença de Phoenix pode custar zero, enquanto a manutenção do banco de dados e o trabalho de plantão continuam relevantes. O melhor plano gratuito é aquele cujos limites permitem concluir o experimento que você precisa fazer.

As seis ferramentas, por adequação ao uso em produção

1. Langfuse: a escolha inicial para equipes pequenas em produção

Langfuse oferece tracing compartilhado, acompanhamento de tokens e custos, gestão de prompts e avaliação sem cobrança por usuário no Core. Um assistente de atendimento SaaS pode vincular cliente, workflow e release às chamadas ao modelo e investigar falhas caras junto com execuções bem-sucedidas. O principal limite para o orçamento é a quantidade de registros armazenados: uma execução de agente pode gerar um trace, várias observações e scores. Escolha Langfuse se você precisa reunir trace e custo no mesmo registro, com uma opção viável de hospedagem própria no futuro.

Página atual de preços de Langfuse com os planos Hobby, Core, Pro e Enterprise
Langfuse

Mais indicado para: Uma equipe de produto pequena ou em crescimento, em que desenvolvedores e o responsável por IA precisam analisar as mesmas execuções de produção
Destaque: Usuários ilimitados no Core, contexto de custos por trace e núcleo com licença MIT para hospedagem própria
Preços: Core a partir de $29/mês; os planos pagos de Cloud acrescentam uso cobrado em unidades
Teste gratuito: Hobby é gratuito e não exige cartão de crédito; oferece uma franquia contínua, sem prazo de teste

Planos atuais e os limites que mudam a escolha

A página atual de preços lista Hobby por $0, com 50,000 unidades/mês, dois usuários e 30 dias de acesso aos dados. Core custa $29/mês, com 100,000 unidades, usuários ilimitados e 90 dias de acesso aos dados. Pro custa $199/mês, com a mesma quantidade de unidades incluídas, três anos de acesso aos dados, gestão de retenção e limites de taxa maiores. O adicional opcional Teams do Pro custa $300/mês e acrescenta SSO empresarial com uso obrigatório e controles de acesso mais granulares. Enterprise custa $2,499/mês, com 100,000 unidades incluídas, logs de auditoria, SCIM e compromissos contratuais de serviço; contratos anuais podem trazer preços personalizados por volume.

O uso pago de Cloud tem cobrança progressiva. A faixa de 100,000 a um milhão de unidades custa $8 por 100,000; de um milhão a dez milhões, $7 por 100,000; de dez milhões a cinquenta milhões, $6.50 por 100,000. As tarifas menores valem para as unidades da respectiva faixa. Ultrapassar um limite não reduz retroativamente o preço da faixa anterior.

O limite de ingestão do Core é de 4,000 requisições/minuto, enquanto o Pro informa 20,000 requisições/minuto. Essa contagem trata de requisições de ingestão, não da definição de unidade cobrada. Um lote pode conter vários eventos armazenados. Verifique tanto o orçamento mensal de unidades quanto os picos de tráfego gerados pelo exportador.

Traces em Langfuse: observações e scores também entram na conta

Um trace de Langfuse registra uma execução, mas a fórmula de cobrança é traces + observações + scores. Na carga modelada, 100,000 + 500,000 + 10,000 = 610,000 unidades. Assim, o Core custa $29 + 5.1 × $8 = $69.80/mês. O mesmo volume armazenado no Pro custa $239.80/mês.

Essa fórmula muda a conversa sobre instrumentação. A recuperação de dados e o acionamento de uma ferramenta de reembolso são evidências valiosas, mesmo que aumentem os registros. Removê-las para reduzir a conta pode impedir a explicação de uma falha. Prefira uma política deliberada de amostragem para execuções bem-sucedidas de menor valor, preservando as evidências necessárias para diagnosticar resultados caros ou prejudiciais.

Hospedagem, licença e OpenTelemetry

A opção Open Source em infraestrutura própria não cobra licença sob MIT, oferece uso ilimitado e inclui as APIs centrais de tracing, avaliação, datasets e gestão de prompts. Enterprise em infraestrutura própria tem licença comercial e preço personalizado. A página atual informa que o preço empresarial de Langfuse é somado ao plano comercial de ClickHouse aplicável. A assinatura em nuvem e a cotação empresarial de hospedagem própria são compras diferentes.

A documentação de OpenTelemetry aceita OTLP por HTTP/JSON ou HTTP/protobuf e informa que não há suporte a gRPC. O endpoint base é /api/public/otel, com autenticação Basic usando as chaves pública e secreta do projeto. A ingestão direta pelo caminho atual v4 exige o cabeçalho x-langfuse-ingestion-version: 4 para processamento em tempo real; a documentação alerta para um atraso de até dez minutos sem ele. Atributos de usuário, sessão, release e outros atributos do trace também precisam ser propagados aos spans que você quer filtrar e agregar.

Esse é um ponto relevante para uma equipe de plataforma que já exporta gRPC para um Collector. O Collector pode receber um protocolo e exportar outro, mas o envio final a Langfuse precisa seguir o endpoint HTTP e o mapeamento de atributos documentados. Aceitar um payload sem os metadados do cliente não significa concluir a integração.

Langfuse com Python: comece pelo SDK documentado

O fornecedor recomenda seu próprio SDK para Python, pois ele gerencia os campos de Langfuse, a propagação e a exportação. Siga o guia rápido de tracing atual, configure as credenciais do projeto e LANGFUSE_HOST para a região escolhida ou sua própria instalação e envolva toda a operação de negócio no contexto de observação atual. Mantenha a recuperação de dados e as ferramentas nesse contexto para que o trace preserve a causa de uma resposta ruim.

Sempre que possível, use o consumo informado pelo provedor. O acompanhamento de custos de Langfuse prioriza o custo recebido na ingestão em relação ao preço de modelo inferido, e Project Settings > Models aceita definições personalizadas. Isso importa quando o contrato com o provedor tem uma tarifa negociada ou um modelo interno não possui preço público. A estimativa exibida precisa refletir a tarifa comercial que você pretende administrar.

Langfuse com LangChain: mantenha a requisição inteira no mesmo contexto

A integração com LangChain usa um handler de callback fornecido em callbacks na invocação. Crie um contexto de trace para a requisição completa e inclua a chain dentro dele. A documentação também destaca os eventos enfileirados em segundo plano: processos de curta duração devem descarregar a fila ou encerrar o exportador antes de terminar. Em ambientes JavaScript serverless, aguarde os callbacks de segundo plano conforme as instruções do guia.

A primeira implantação prática deve ser pequena o bastante para uma inspeção manual:

  1. Crie um projeto de tracing de produção

    Escolha a região de Cloud ou o endereço da instalação própria, crie as chaves do projeto e configure o host pelo guia rápido atual. Mantenha os registros de produção identificáveis em relação aos de desenvolvimento.

  2. Registre uma operação de negócio completa

    Instrumente a raiz da requisição, as chamadas ao modelo, a recuperação de dados e as ferramentas. Vincule metadados de cliente, workflow, release e resultado aos spans apropriados e confirme a propagação dos atributos necessários do trace.

  3. Confira o custo na resposta do provedor

    Abra um trace concluído e confirme a identidade do modelo, o consumo e o custo. Configure preços personalizados quando a tarifa pública inferida não corresponder ao seu contrato.

  4. Armazene um score e confira a contagem

    Avalie um exemplo conhecido, verifique se o score foi associado à execução correta e compare as quantidades de traces, observações e scores com o painel Usage Management. Descarregue a fila do exportador antes de encerrar um worker de curta duração.

O ponto forte
O que faz bem
7 points

  • Core permite incluir todos os revisores necessários sem contratar mais usuários
  • O registro pode reunir chamadas ao modelo, ferramentas, recuperação de dados, custo e scores de avaliação
  • Custos recebidos na ingestão e definições personalizadas de modelos acomodam preços negociados ou privados
  • O núcleo MIT permite uma instalação operada na sua própria infraestrutura
  • Traces, observações e scores armazenados consomem a franquia de Cloud
  • Pro e o adicional Teams podem elevar o custo fixo antes de qualquer mudança no uso
  • O receptor OTel exige exportação HTTP e propagação correta de atributos

2. LangSmith: para um ciclo de melhoria centrado em LangChain

LangSmith é uma plataforma de tracing e avaliação para equipes que já desenvolvem e revisam agentes com LangChain ou LangGraph, embora também documente a instrumentação de outros frameworks. Um líder de desenvolvimento pode conectar uma falha de produção a um dataset, avaliações online ou offline, revisão humana e uma alteração de prompt. O limite de orçamento combina usuários e traces: convidar mais revisores aumenta a assinatura, enquanto o volume de traces gera sua própria cobrança. Escolha LangSmith se esse fluxo de desenvolvimento e avaliação justificar pagar pelo acesso de cada revisor.

Preços de LangSmith com Developer, Plus, Enterprise e cobranças por uso
LangSmith

Mais indicado para: Uma equipe de desenvolvimento que já organiza a melhoria de agentes em torno de LangChain ou LangGraph
Destaque: Tracing, datasets, filas de anotação e avaliações online e offline no mesmo produto
Preços: Plus $39/usuário/mês, mais traces e outros usos do produto
Teste gratuito: Developer oferece uma franquia gratuita contínua para um usuário, com cobrança pelo uso além dos traces incluídos

Planos atuais e a franquia compartilhada de traces

Developer custa $0 por usuário/mês, permite um usuário e inclui 5,000 traces base/mês, com cobrança por uso além da franquia. Plus custa $39 por usuário/mês, permite contratar usuários adicionais e inclui 10,000 traces base por mês no total. A calculadora de preços trata explicitamente essa franquia como compartilhada por toda a organização. Enterprise tem preço personalizado e oferece opções híbridas e de hospedagem própria, controles de segurança e condições de suporte.

O tooltip da página atual informa 0.005 LangChain Standard Units por trace base e 0.0025 por upgrade de trace para retenção estendida. Uma LSU equivale a $1, portanto as tarifas são $0.005 por trace base e $0.0025 pelo upgrade. A retenção base é de 14 dias; a estendida, de 180 dias. Um preço por trace lembrado de uma versão antiga não serve para um orçamento conferido hoje.

Com cinco usuários Plus e 100,000 traces base, a conta é de $195 em usuários + $450 em traces adicionais = $645/mês. Fazer o upgrade de 10,000 traces para retenção estendida acrescenta $25, chegando a $670 antes do processamento de avaliadores ou de outros usos do produto. O upgrade preserva o registro por mais tempo; contratar Plus não o inclui gratuitamente.

Tuned Evaluators têm outra unidade de cobrança publicada: 0.015 LSU por execução bem-sucedida de avaliação Perceived Error. O tooltip informa que um Tuned Evaluator que adiciona feedback também faz o upgrade do trace para retenção estendida. Deployment, Engine, Fleet e Sandboxes têm regras de uso próprias. Quem compra apenas observabilidade deve delimitar o orçamento a esse serviço, sem tratar o acesso de um usuário como um ambiente de execução de agentes com tudo incluído.

Por que o número de usuários muda a recomendação?

Cinco desenvolvedores analisando traces representam uma situação diferente de cinco desenvolvedores acompanhados de um grupo maior de produto e qualidade. Para os mesmos 100,000 traces base, quinze usuários Plus custam $1,035/mês: a parcela de usuários passa a $585, enquanto a de traces adicionais permanece em $450. Mais usuários não multiplicam a franquia compartilhada de traces gratuitos.

O investimento pode fazer sentido quando cada revisor transforma traces com frequência em prompts corrigidos, datasets ou decisões de release. É mais difícil justificá-lo quando a maioria precisa apenas consultar um painel de custos ocasionalmente. Defina quem precisa revisar os registros brutos, quem pode trabalhar com um resultado exportado e qual fluxo torna a assinatura produtiva.

Hospedagem própria comercial e OpenTelemetry

LangSmith em infraestrutura própria é um adicional de Enterprise que exige uma chave de licença comercial. A instalação inclui serviços de frontend e backend, além de ClickHouse, PostgreSQL e Redis; o guia recomenda serviços externos de armazenamento para produção. Trata-se de uma instalação empresarial operada pela equipe, não de uma licença gratuita de servidor presumida a partir de um framework de código aberto.

O guia de OpenTelemetry descreve traces de aplicações compatíveis, mapeamentos de atributos padrão e fanout pelo Collector, que encaminha o mesmo fluxo de spans a mais de um backend. Quem usa LangChain e LangGraph pode ativar o caminho integrado com LANGSMITH_OTEL_ENABLED=true, junto com o tracing. Um exportador HTTP padrão usa o endpoint base https://api.smith.langchain.com/otel, autenticação x-api-key e o cabeçalho opcional Langsmith-Project.

Observe o formato do endpoint. A variável base compartilhada de OTLP permite que o exportador HTTP acrescente /v1/traces; uma variável específica de traces já contém o caminho completo. Adicionar o caminho do sinal nos dois pontos gera uma URL incorreta. Confira o mesmo trace no projeto escolhido e confirme modelo, entradas, saídas e estrutura de pais e filhos antes de considerar a exportação OTel concluída.

O ponto forte
O que faz bem
7 points

  • LangChain e LangGraph têm um caminho integrado de tracing documentado
  • Datasets, filas de anotação e avaliações online e offline sustentam um fluxo explícito de melhoria
  • A ingestão OTel e o fanout pelo Collector atendem aplicações além de um único framework
  • Enterprise oferece uma opção licenciada para operar o backend na sua infraestrutura
  • Cada revisor Plus custa $39/mês, incluindo convidados contabilizados como usuários
  • A franquia de traces incluídos é compartilhada, não concedida por usuário
  • Retenção mais longa de traces e uso de avaliadores especializados geram cobranças separadas

3. Helicone: quando o gateway faz parte da compra

Helicone combina observabilidade de requisições com um gateway de IA, serviço que encaminha chamadas aos modelos e aplica roteamento e controles relacionados. Uma aplicação pequena que precisa principalmente inspecionar requisições a provedores, gerenciar alternativas em caso de falha e agrupar gastos com modelos pode obter registros úteis nesse ponto. O limite está na diferença entre o gateway e o agente completo: o registro de uma requisição ao modelo ainda precisa do contexto da aplicação para explicar a recuperação de dados e as ferramentas de negócio. Escolha Helicone se o gateway já faz parte da arquitetura e a necessidade imediata é monitorar requisições.

Página de preços de Helicone com Hobby, Pro, Team, Enterprise e calculadora de uso
Helicone

Mais indicado para: Uma equipe de produto que contrata monitoramento de requisições junto com os recursos de gateway
Destaque: Gateway compatível com OpenAI e um caminho separado para registro assíncrono de logs
Preços: Pro $79/mês, mais cobranças progressivas por requisições registradas e armazenamento
Teste gratuito: Hobby é gratuito; Pro e Team anunciam teste gratuito de 7 dias

Planos atuais, incluindo os limites para picos de tráfego

A página atual de preços lista Hobby por $0, com 10,000 requisições/mês, 1 GB de armazenamento, um usuário, uma organização e sete dias de retenção. Pro custa $79/mês, acrescenta usuários ilimitados, alertas, relatórios e HQL, sua linguagem de consultas, e mantém os dados por um mês. Team custa $799/mês, acrescenta cinco organizações, três meses de retenção, um canal dedicado no Slack e a oferta de conformidade listada. Enterprise tem preço personalizado, com SAML SSO, implantação local e opções de contrato personalizado.

A tabela dos planos pagos inclui 10,000 requisições gratuitas e 1 GB de armazenamento gratuito, seguidos de cobranças por uso. O limite de ingestão publicado de Hobby é de 10 logs/minuto, contra 1,000 no Pro, 15,000 no Team e 30,000 no Enterprise. A franquia mensal pode parecer suficiente enquanto um pico já excede o limite de ingestão. Um processamento de documentos orientado por fila que envia muitos registros juntos precisa de uma verificação de vazão, além da contagem mensal.

A passagem de Pro para Team acrescenta $720/mês antes do uso. Contrate essa mudança pelas necessidades de organização, retenção e suporte que ela atende. O aumento das requisições, por si só, não torna esse salto a próxima cobrança inevitável.

Cobrança por requisição e a divergência sobre armazenamento

A calculadora atual da página aplica tarifas progressivas de requisições: as primeiras 10,000 são gratuitas, as 20,000 seguintes custam $0.0007 cada, as 60,000 seguintes custam $0.00035 cada e as requisições de 90,001 a 250,000 custam $0.000175 cada. As faixas seguintes publicadas caem para $0.0000875, $0.00004375 e $0.00002 por requisição, conforme o volume cresce. Esses dados vêm da própria calculadora de Helicone, não da comparação de outro fornecedor.

Com 200,000 requisições de modelo registradas, a parcela de requisições é de $14 + $21 + $19.25 = $54.25. Somando Pro, são $133.25 antes do armazenamento. Conte as duas chamadas ao modelo do agente do exemplo; chamar as 100,000 execuções da aplicação de “requisições” subestimaria essa cobrança.

As faixas de armazenamento da calculadora começam em $3.25/GB para os primeiros 30 GB, seguidas de $2/GB, $1.25/GB, $0.75/GB e $0.50/GB nas faixas maiores. Mas a calculadora cobra a primeira faixa desde zero, apesar do gigabyte gratuito anunciado na tabela do plano. Com 5 GB de armazenamento contabilizado, aplicar a franquia resulta em $13 de armazenamento; seguir a calculadora resulta em $16.25. Assim, o total ilustrativo de Pro fica em $146.25-$149.50.

Gateway, Async e o alcance documentado de OTel

O guia rápido do gateway usa um cliente compatível com OpenAI apontado para https://ai-gateway.helicone.ai, com registro automático de logs e alternativas em caso de falha. Você também pode usar suas próprias chaves de provedores. O gasto com provedores de modelos é separado da assinatura de observabilidade e da cobrança por requisições registradas.

O guia de Proxy versus Async explica diretamente a escolha de arquitetura. A integração por proxy coloca Helicone no caminho da requisição e oferece recursos de gateway como cache, controles de novas tentativas e limites de taxa personalizados. O registro assíncrono fica fora desse caminho crítico, mas não oferece os mesmos controles de proxy. Decida se você quer encaminhar o processamento ou observá-lo em segundo plano antes de comparar o esforço de configuração.

Para OpenTelemetry, Helicone documenta uma integração OpenLLMetry Async. Os exemplos atuais usam os loggers @helicone/async e helicone-async. Isso comprova o caminho de integração descrito; o guia citado não fornece uma configuração genérica de receptor OTLP para o Collector. Se o requisito é “mudar apenas o exportador do Collector”, valide essa rota específica, em vez de presumir que uma integração relacionada a OTel funciona como um backend OTLP substituível diretamente.

A hospedagem própria aceita instalação manual, Docker Compose, Kubernetes e implantação em nuvem. O repositório tem licença Apache 2.0. Suporte dedicado e serviços empresariais continuam sujeitos a uma contratação separada. Para uma equipe pequena, o custo recorrente de operar a stack pode superar a conta de telemetria mesmo quando a licença do software é gratuita.

A implantação deve responder a uma pergunta sobre a aplicação, sem se limitar a exibir uma requisição. Vincule os identificadores de workflow e cliente, envie uma chamada conhecida ao modelo, inspecione o registro e confirme se a sessão conecta as chamadas que você pretendia agrupar. Repita a verificação com uma nova tentativa ou uma resposta que falhou. A visão do gateway se torna uma evidência útil de produção quando permite identificar qual operação de negócio causou o trabalho adicional do modelo.

O ponto forte
O que faz bem
8 points

  • Pro inclui usuários ilimitados para compartilhar o monitoramento de requisições
  • Os caminhos de gateway e assíncrono permitem escolher como interferir no caminho da requisição
  • As cobranças progressivas por requisição podem ser calculadas pela página atual do fornecedor
  • Apache 2.0 e opções documentadas de implantação permitem hospedagem própria
  • Requisições ao modelo são uma unidade diferente de execuções completas de agentes
  • A franquia de armazenamento publicada e a calculadora precisam ser conciliadas
  • O registro assíncrono não oferece os controles de cache, novas tentativas ou limites de taxa do gateway
  • O guia de integração citado não estabelece uma rota genérica de ingestão do Collector para OTLP

4. Arize Phoenix: tracing privado com um responsável pela infraestrutura

Arize Phoenix é uma plataforma de tracing, avaliação e experimentação que prioriza a execução local e pode rodar na sua infraestrutura sem cobrança de licença. Um engenheiro de plataforma que investiga um assistente de recuperação de dados pode inspecionar chamadas ao modelo, o contexto recuperado e as operações de ferramentas, reunir falhas em um dataset e comparar uma versão revisada da aplicação. O limite está na responsabilidade operacional: alguém precisa operar o serviço e entender as restrições da licença. Escolha Phoenix se manter uma instalação privada e controlável de tracing e avaliação for importante o bastante para definir um responsável pela infraestrutura.

Documentação de Arize Phoenix com tracing, avaliações, prompts, datasets e experimentos
Arize Phoenix

Mais indicado para: Uma equipe técnica que quer operar seu próprio backend de tracing e avaliação
Destaque: Traces OTLP e instrumentação OpenInference, com datasets e experimentos locais
Preços: Phoenix em infraestrutura própria não cobra licença; a página atual de preços de Arize não publica um plano pago de Phoenix
Teste gratuito: Phoenix em infraestrutura própria é gratuito dentro das condições de sua licença; Arize AX tem um plano gratuito separado

O plano AX de $50 é um produto diferente de Phoenix

A página atual de preços de Arize informa preços de AX e descreve Phoenix separadamente como sua plataforma voltada à execução local. AX Free inclui 25,000 spans de traces/mês, 1 GB/mês de ingestão, 15 dias de retenção e usuários e avaliações ilimitados. AX Pro custa $50/mês, com 50,000 spans, 10 GB/mês de ingestão, 30 dias de retenção e usuários e avaliações ilimitados. AX Enterprise tem preço personalizado, com volume e retenção personalizados e implantação SaaS ou em infraestrutura própria.

A página não publica preço de instância paga de Phoenix nem tabela de excedentes de Phoenix. Atribuir “$50/mês” a Phoenix misturaria dois produtos. Se você quer contratar um serviço gerenciado de Arize, avalie AX com seus próprios limites de spans e bytes; se quer Phoenix, orce a infraestrutura que irá operar.

Na aplicação modelada, 500,000 spans representam dez vezes o volume de spans incluído em AX Pro. A página pública não informa uma tarifa de excedente para esse caso, portanto a resposta útil é uma cotação, não um preço extrapolado. Com cinco spans por execução, a franquia de spans de AX Free corresponde a 5,000 execuções, e a de Pro a 10,000, desde que os limites de bytes e as demais condições também sejam atendidos.

No Phoenix em infraestrutura própria, a licença de software continua custando zero no volume modelado. Isso não significa que manter 500,000 spans armazenados não tenha custo. Defina uma política de armazenamento, estime o tamanho dos payloads, inclua backups e atribua a alguém a responsabilidade por atualizações e recuperação. “Já operamos essa infraestrutura” e “precisamos de uma nova plataforma privada” levam a custos totais diferentes.

Licença: confira os termos do backend

A licença atual do repositório do backend de Phoenix é Elastic License 2.0. Ela permite o uso sujeito às suas restrições e proíbe oferecer uma parte substancial das funcionalidades do produto a terceiros como serviço hospedado ou gerenciado. Também restringe contornar funcionalidades de chave de licença e remover avisos de licenciamento. É um modelo de permissões diferente do núcleo MIT de Langfuse e da licença Apache 2.0 de Helicone.

Use essa distinção na contratação. “O código está disponível”, “é gratuito para nossa instalação” e “tem licença permissiva para oferecer como serviço” são afirmações diferentes. A recomendação deste artigo trata de operar Phoenix para tracing e avaliação da sua aplicação; não presume o direito de revender Phoenix como produto hospedado.

O guia de hospedagem própria informa que Phoenix não cobra licença, não impõe limites de uso nem restringe funcionalidades nessa modalidade e pode operar totalmente isolado da rede. Ele documenta opções por terminal, Docker/Compose, Kubernetes/Helm e nuvem. Uma instalação privada ainda precisa de configuração e de um plano de recuperação adequados aos dados que armazena.

OpenTelemetry e o fluxo de avaliação

Phoenix aceita traces OTLP e se baseia em OpenTelemetry e instrumentação OpenInference. O registro documentado inclui chamadas ao modelo, recuperação de dados, ferramentas e lógica personalizada. As avaliações podem usar modelos juízes, verificações por código ou rótulos humanos. Datasets e experimentos permitem executar novamente versões diferentes da aplicação com as mesmas entradas, enquanto as ferramentas de prompts oferecem versionamento e reexecução.

O guia de configuração de tracing oferece phoenix.otel para Python e @arizeai/phoenix-otel para TypeScript, além de organização por projeto e sessão. Uma equipe que usa Collector deve conferir em Phoenix os mesmos campos semânticos que utiliza em outros sistemas. Preservar o ID do trace ajuda; preservar qual operação recuperou o contexto errado é o que permite agir sobre a falha.

Para um assistente de recuperação de dados, comece por uma falha conhecida: o modelo produziu uma resposta confiante a partir de um documento irrelevante. Verifique se o span de recuperação contém as evidências necessárias para distinguir um problema de busca de um problema na geração da resposta. Preserve a entrada e o comportamento esperado em um dataset, altere uma configuração de recuperação ou de prompt e compare o resultado. Um exemplo reproduzível conecta a observação do problema à prevenção de sua recorrência.

O ponto forte
O que faz bem
7 points

  • O guia não estabelece cobrança de licença de software nem teto de uso para hospedagem própria
  • A documentação permite uma implantação totalmente isolada da rede
  • OTLP e OpenInference conectam o tracing a caminhos comuns de instrumentação
  • Datasets, experimentos e vários tipos de avaliação ajudam no trabalho de regressão
  • ELv2 tem restrições que o rótulo de licença permissiva esconderia
  • Sua organização responde por infraestrutura, retenção, atualizações e recuperação
  • Os preços e limites de AX pago não descrevem uma assinatura paga de Phoenix

5. Braintrust: quando as avaliações decidem os releases

Braintrust é uma plataforma de avaliação e observabilidade para equipes que decidem releases com base em exemplos pontuados, datasets e experimentos. Um responsável por IA de produto que compara uma revisão de prompt pode inspecionar traces e verificar se a nova saída passou pelas mesmas verificações da versão anterior. O limite de orçamento combina dados processados e scores, aos quais se somam o processamento dos modelos e a retenção mais longa. Escolha Braintrust se o fluxo de avaliação tem um responsável e muda o que você coloca em produção; comece por Starter quando os limites e recursos forem suficientes.

Preços de Braintrust com Starter, Pro e Enterprise e métricas de cobrança por dados processados e scores
Braintrust

Mais indicado para: Uma equipe de produto de IA que mantém datasets de avaliação e critérios de release
Destaque: Usuários, projetos, datasets, playgrounds e experimentos ilimitados no Starter
Preços: Starter tem assinatura de $0 com uso cobrado; Pro custa $249/mês mais uso
Teste gratuito: Starter oferece uma franquia gratuita contínua e não exige cartão de crédito para começar

Planos atuais e as duas métricas de cobrança

Starter tem assinatura mensal de $0, 1 GB de dados processados/mês, seguido de $4/GB; 10,000 scores/mês, seguidos de $2.50 por 1,000; 14 dias de retenção; e $10 em créditos mensais de modelos. Usuários, projetos, datasets, playgrounds e experimentos são ilimitados. Assim, uma equipe pode precisar de um ambiente compartilhado de avaliação sem precisar imediatamente de Pro.

Pro custa $249/mês, com 5 GB de dados processados, seguidos de $3/GB; 50,000 scores, seguidos de $1.50 por 1,000; 30 dias de retenção, com retenção adicional cobrada a $0.50/GB/mês; e $100 em créditos mensais de modelos. Acrescenta gráficos personalizados, ambientes, controles de acesso baseados em papéis e suporte prioritário. Enterprise tem preço personalizado, com retenção e exportação personalizadas, suporte e condições para implantação local ou hospedada.

Um score corresponde a uma saída avaliada, seja por um modelo juiz, uma avaliação automatizada ou um avaliador personalizado em código. A cobrança pelo armazenamento ou processamento desse score é separada do processamento que o produziu. Os créditos de modelos incluídos têm escopo próprio; não são um reembolso da fatura de provedores de todas as aplicações.

Na carga modelada de 5 GB e 10,000 scores, a conta de Starter é de $16 por dados excedentes, sem excedente de scores. Pro custa $249 antes de qualquer uso adicional. Se a necessidade imediata é compartilhar um dataset, experimentos e traces dentro dos recursos do plano gratuito, o upgrade de $249 precisa ser justificado por funcionalidades ou retenção.

Quando as tarifas menores de uso começam a compensar?

Com 100,000 scores/mês e os mesmos 5 GB de dados processados, Starter custa $241, e Pro, $324, antes do uso de modelos e de extensões de retenção. A tarifa unitária menor de Pro não compensa automaticamente seu custo fixo.

Com essa mesma premissa de bytes, o ponto de equilíbrio considerando apenas as cobranças de uso e assinatura é de 183,000 scores/mês, quando ambos os planos chegam a $448.50. O cálculo não considera diferenças nos créditos de modelos, na retenção e nas funcionalidades, que podem justificar um upgrade antes disso. É um limite para planejamento de orçamento, não uma recomendação para adiar controles de acesso úteis.

A pergunta operacional é quais verificações justificam seu custo. Um fluxo de atendimento pode precisar de uma verificação determinística dos argumentos da ferramenta em todas as execuções e de uma análise de qualidade da resposta por modelo em uma amostra. Essas verificações têm objetivos e custos de processamento diferentes. Mantenha um dataset conhecido para os releases e use amostras de produção para descobrir falhas que ele não antecipou.

Uma média alta de scores não basta para decidir um release. Agrupe exemplos por workflow e resultado para que a melhora em respostas fáceis não esconda uma regressão na ação difícil que importa para os clientes. Essa é uma prática de avaliação editorial, não a afirmação de que alguma plataforma fornece automaticamente uma rubrica correta.

Ingestão OTel e hospedagem comercial do plano de dados

A integração com OpenTelemetry documenta um exportador de traces OTLP, um processador de spans de Braintrust, um exportador de logs e o encaminhamento de logs pelo Collector. O endpoint base da API é https://api.braintrust.dev/otel; a autenticação e o cabeçalho x-bt-parent=project_id:... direcionam os dados ao projeto correto. Os endpoints específicos de cada sinal incluem o caminho de traces ou logs. O pacote separado @braintrust/otel atende à integração JavaScript documentada.

Siga as instruções de mapeamento de campos da integração para verificar entradas, saídas e metadados após a ingestão. Aceitar tanto uma linha de log quanto um span de aplicação não os torna registros de avaliação equivalentes. Confirme qual objeto será usado como entrada no experimento que você pretende executar.

Os planos de implantação reservam BYOC e hospedagem própria para Enterprise. É uma contratação comercial de plataforma, não uma licença de backend de código aberto. Mais especificamente, o guia de arquitetura mantém o plano de controle, incluindo interface, autenticação e metadados de gestão, no SaaS de Braintrust. O plano de dados, onde ficam traces, datasets e outros dados de IA, pode rodar na sua própria conta de nuvem. O navegador se comunica diretamente com esse plano de dados.

Essa distinção determina algumas decisões de contratação. Controlar onde prompts e saídas ficam pode atender a uma exigência de localização de dados, mantendo a dependência do plano de controle do fornecedor. Uma organização que exige todos os componentes do produto offline deve comparar essa arquitetura com a opção de Phoenix documentada para ambientes totalmente isolados antes de assinar.

O ponto forte
O que faz bem
8 points

  • Starter oferece um ambiente compartilhado de avaliação sem cobrança por usuário
  • As franquias de dados processados e scores tornam visíveis parcelas separadas do orçamento
  • Pro oferece um upgrade claro de recursos para gráficos, ambientes, acesso e retenção
  • Os caminhos OTel documentados podem receber um fluxo de instrumentação existente
  • Payloads grandes e volume de scores geram cobranças de uso separadas
  • As tarifas unitárias menores de Pro nem sempre compensam a assinatura de $249
  • O processamento dos modelos juízes e a retenção mais longa exigem orçamento próprio
  • Armazenar os dados em infraestrutura própria não transfere o plano de controle SaaS para seu ambiente

6. Datadog Agent Observability: para uma stack de operações já existente

Datadog Agent Observability é o nome atual dado pelo fornecedor ao produto normalmente buscado como Datadog LLM Observability; seu melhor encaixe é uma equipe que já investiga incidentes de aplicações em Datadog. Um timeout do agente de atendimento pode vir de uma chamada ao modelo, de um serviço lento ou de um problema na sessão do usuário. O valor da plataforma está em conectar o registro do agente a esse contexto operacional mais amplo. O limite envolve a decisão sobre prazo de contratação e retenção, além do custo dos outros produtos Datadog necessários. Escolha essa opção se os responsáveis pelos incidentes já trabalham em Datadog e o contexto compartilhado muda a investigação.

Preços de Datadog Agent Observability com as franquias de spans de LLM dos planos Free e Pro
Datadog Agent Observability

Mais indicado para: Uma equipe de SRE ou plataforma que conecta falhas de IA a incidentes de aplicações e infraestrutura
Destaque: Cobrança por spans de LLM, em vez de cada operação de recuperação de dados, ferramenta ou workflow
Preços: Pro $160/mês com contratação anual, $200 no mês a mês ou $240 sob demanda, mais spans adicionais de LLM
Teste gratuito: Free inclui 40,000 spans de LLM/mês; a página de preços também oferece cadastro para teste

Quanto custa Datadog LLM Observability?

A página atual de preços lista Free por $0, com 40,000 spans de LLM/mês, 15 dias de retenção de traces, contexto e avaliações ilimitados e acesso completo aos recursos. Pro inclui 100,000 spans de LLM/mês, também com 15 dias de retenção de traces. O preço base é de $160/mês com cobrança anual, $200 no mês a mês ou $240 sob demanda.

Spans adicionais de LLM custam $3.50 por 10,000 na tarifa anual, $4.20 no mês a mês ou $5 sob demanda. Para 200,000 spans de LLM, os totais modelados são $195, $242 e $290, respectivamente. Compare os prazos de contratação de forma explícita: o preço em destaque da tarifa anual não é a conta do mês a mês.

A unidade cobrada é uma chamada ao modelo, não cada operação do trace. O fornecedor informa que spans de ferramentas, recuperação de dados e workflow ao redor dessas operações não são cobrados como spans de LLM. Com duas chamadas ao modelo por execução, a franquia de Free corresponde a 20,000 execuções completas, sujeitas às demais condições do plano. Instrumentar mais ferramentas não precisa gerar mais spans de LLM cobrados; um ciclo de raciocínio que chama o modelo repetidamente gera.

Há retenção estendida disponível, mas a página pública não fornece uma tarifa para incluí-la nesta comparação. Solicite o preço dessa necessidade quando precisar investigar incidentes mais antigos. Um registro totalmente instrumentado que já expirou não poderá fundamentar uma disputa posterior com um cliente.

Observabilidade de IA em Datadog e a stack de operações

Agent Observability pode ser contratado separadamente; o fornecedor informa que outras assinaturas Datadog não são obrigatórias. A página de preços também descreve o valor adicional da correlação com APM, monitoramento de infraestrutura e Real User Monitoring quando esses produtos são usados. Quem começa do zero deve orçá-los separadamente, sem presumir que a assinatura de observabilidade inclui o restante de Datadog.

O produto inclui datasets, experimentos, avaliações, anotações e painéis em todos os planos publicados. A visão de custos detalha o uso por provedor, modelo e identidade ou versão do prompt, com custos disponíveis em traces e spans. Isso permite que o responsável pelo incidente diferencie um aumento de tráfego de uma mudança no processamento de modelos executado pela aplicação.

Um líder de plataforma deve testar essa correlação de forma concreta. Comece por uma execução de agente que falhou e siga a requisição até o serviço responsável pela resposta da ferramenta. Verifique se a identidade do trace atravessa essa fronteira e se o operador consegue separar a latência do modelo do tempo gasto em outros pontos. Esse é o fluxo que você está comprando; um gráfico isolado de gastos não demonstraria seu valor.

Licenciamento SaaS e OpenTelemetry

Datadog oferece o produto como serviço SaaS comercial sujeito ao contrato de assinatura. Seus termos identificam o MSA como o contrato que rege o serviço hospedado. A página atual de preços do produto não oferece um backend de Agent Observability para hospedagem própria. Operar um Datadog Agent ou OTel Collector não significa hospedar o armazenamento, a interface e a plataforma de avaliação.

O guia de OpenTelemetry aceita traces que seguem as convenções semânticas GenAI 1.37 ou posteriores, ou convenções OpenInference compatíveis. Ele documenta ingestão direta sem exigir Datadog Agent ou o SDK de Agent Observability. O exportador do exemplo usa OTLP/HTTP protobuf, com os cabeçalhos dd-api-key e dd-otlp-source=llmobs.

As avaliações externas têm um detalhe específico de integração: para spans OTel, a documentação exige a tag source:otel e IDs de trace e span como strings decimais. Os IDs nativos de OTel são hexadecimais e precisam ser convertidos antes do envio. Valide uma avaliação em um trace conhecido, em vez de presumir que a compatibilidade do tracing também garante a associação automática das avaliações.

O ponto forte
O que faz bem
8 points

  • Apenas spans de LLM determinam a cobrança por volume publicada; spans de ferramentas e recuperação de dados ficam de fora
  • Operadores que já usam Datadog podem conectar os registros de agentes ao contexto mais amplo de produção
  • Free e Pro incluem os recursos listados de avaliação e experimentação
  • A ingestão direta de OTel é documentada sem exigir um Datadog Agent
  • A menor tarifa anunciada exige contratação anual
  • A retenção de traces incluída é de 15 dias nos dois planos publicados
  • Outros serviços Datadog continuam sendo compras separadas
  • O produto usa um backend comercial hospedado, sem oferecer um servidor de observabilidade para hospedagem própria

Qual ferramenta escolher para cada tamanho de equipe?

Escolha primeiro por quem precisa agir sobre os registros e depois pela métrica de cobrança que cresce com a aplicação. O número de pessoas entra no orçamento, mas não substitui saber se o responsável é um desenvolvedor, um líder de produto de IA ou alguém que responde a incidentes.

Um ou dois desenvolvedores: Comece pela franquia gratuita que permite concluir a primeira revisão de produção. Langfuse Hobby atende uma visão compartilhada por duas pessoas, embora suas 50,000 unidades se esgotem rapidamente quando uma execução gera várias operações. LangSmith Developer atende um usuário. Braintrust Starter é atraente quando o objetivo já é manter um dataset e verificar releases com scores. Phoenix faz sentido quando você escolhe conscientemente operar o backend.

Três a dez pessoas: Langfuse Core é a escolha inicial quando vários desenvolvedores e um responsável por produto precisam de acesso rotineiro. Braintrust Starter pode custar menos quando seus limites de dados, scores, retenção e recursos atendem a um fluxo orientado por avaliações. Helicone Pro justifica seu preço quando as funções de gateway e monitoramento de requisições fazem parte da compra. LangSmith Plus justifica a cobrança por usuário quando os revisores usam ativamente seu ciclo de desenvolvimento.

Um grupo maior de revisão com várias áreas: Conte cada usuário pago de LangSmith antes de incluir pessoas de qualidade, produto ou atendimento no ambiente. Planos com usuários ilimitados podem manter a assinatura estável enquanto a participação cresce. Isso não elimina a necessidade de administrar o volume de traces, bytes e scores. A decisão muda quando o fluxo específico de uma plataforma economiza mais esforço de revisão ou evita mais falhas repetidas do que custa a diferença entre assinaturas.

Uma equipe de SRE ou plataforma que já usa Datadog: Prefira Datadog quando um incidente de agente precisa ser investigado junto com serviços e sessões de usuários. As responsabilidades já estabelecidas e o contexto dos traces podem reduzir a utilidade de um console especializado separado. A cobrança de volume restrita a spans de LLM também merece atenção quando o agente tem muitas operações que não envolvem modelos.

Uma exigência de hospedagem privada: Phoenix e Langfuse têm escolhas de licença e implantação bastante diferentes; Helicone acrescenta uma opção com licença Apache. A hospedagem própria de LangSmith e Braintrust envolve contratos empresariais comerciais. O plano de dados de Braintrust na infraestrutura do cliente ainda usa o plano de controle do fornecedor. Defina o que precisa permanecer na sua infraestrutura antes de decidir qual plano é barato.

A regra é direta: pague pelo fluxo que muda uma decisão de produção e depois projete os registros e as pessoas que ele envolve. Se você não consegue identificar essa decisão, comece com uma implantação mais restrita.

Suporte a OpenTelemetry: confira o caminho e os campos

O suporte a OpenTelemetry só é útil quando os campos importantes da sua aplicação são preservados na ingestão. OTel é um sistema padrão de instrumentação; OTLP é o protocolo que envia sua telemetria. Um fluxo de spans pode chegar sem erros enquanto o backend perde a identidade do modelo, o consumo, o contexto do cliente ou a relação entre uma ferramenta e quem a chamou.

Os caminhos documentados variam. Langfuse aceita HTTP JSON ou protobuf no endpoint OTLP e informa que gRPC não é suportado. LangSmith aceita tracing OTel com mapeamento de atributos GenAI, OpenInference e outros, além de documentar fanout pelo Collector. Phoenix aceita OTLP e usa instrumentação OpenInference. Braintrust documenta caminhos de ingestão para traces, processadores de spans e logs. Datadog especifica convenções GenAI ou OpenInference compatíveis. Helicone documenta a integração assíncrona OpenLLMetry; o guia citado não estabelece um receptor OTLP genérico para o Collector.

Para validar a adequação, preserve uma execução representativa ao longo de todo o caminho. Confirme as relações entre pais e filhos, o nome do modelo, tokens, custo, política de entradas e saídas e metadados de release. Se dois serviços participarem, verifique se o contexto atravessa essa fronteira. Se a plataforma agrupa conversas em sessões, confira o identificador de sessão, sem presumir que um ID de trace comum representa toda a conversa.

Confira a variável de endpoint com atenção. Um endpoint base compartilhado e um endpoint de traces específico do sinal são formatos de configuração diferentes. Siga as instruções do fornecedor sobre região, autenticação e caminho. Depois inspecione o registro no projeto de destino: uma resposta HTTP bem-sucedida comprova a aceitação, não a atribuição correta ao contexto de negócio.

Por fim, conte os caminhos duplicados de exportação. Um callback de framework e uma biblioteca separada de instrumentação automática podem observar a mesma chamada ao modelo. Antes de concluir que houve um pico de custos, verifique se você acrescentou processamento de modelo ou registrou o mesmo processamento duas vezes. O comparativo de análise de falhas ajuda a relacionar o trace resultante a uma pergunta concreta de depuração.

Quais compras evitar?

Evite contratar uma ferramenta que não atende ao trabalho necessário, mesmo que ela faça parte da seleção. Estes são desencontros específicos com a cobrança ou a forma de operação documentadas.

  • LangSmith Plus apenas para compartilhar um painel de custos: A carga modelada para cinco pessoas custa $645 antes dos upgrades de retenção e do processamento de avaliações. Pague isso quando o ciclo de melhoria fizer parte do trabalho; ampliar a lista de revisores deve ter um objetivo claro.
  • Braintrust Pro para avaliações leves que cabem no Starter: A conta modelada de Starter é de $16, contra $249 no Pro. Contrate o upgrade de recursos, retenção ou suporte de forma deliberada.
  • Orçamentos de contratação com “Phoenix por $50”: Esse preço pertence a AX Pro. No volume do exemplo, a franquia pública de spans de AX é insuficiente e não há tarifa de excedente publicada. A infraestrutura operada de Phoenix tem outro orçamento.
  • Helicone Hobby para um worker de produção com grandes picos: A franquia mensal de 10,000 requisições não elimina o limite publicado de ingestão de 10 logs/minuto. Verifique o padrão do tráfego antes de depender do plano gratuito.
  • O preço anual em destaque de Datadog para aprovar um orçamento mês a mês: $160 é o valor base da tarifa anual; a base do mês a mês é $200, e o total modelado na tarifa mensal é $242.
  • Qualquer opção de hospedagem própria sem responsável definido: Uma licença gratuita não atribui a ninguém a responsabilidade por recuperação de backups, atualizações ou acesso aos dados. Um “plano de dados em infraestrutura própria” comercial também não transfere automaticamente todo o produto para seu ambiente.

Um gráfico de custos que parece preciso, mas não registra todo o consumo, é um controle de orçamento fraco. Compare o uso informado pelo provedor em uma requisição conhecida com o registro armazenado e reconcilie o total com a conta que você realmente paga. Uma plataforma de observabilidade explica o gasto; uma política de interrupção precisa influenciar a próxima ação da aplicação.

O primeiro passo: transforme uma falha em teste de release

Instrumente um workflow valioso e torne uma falha conhecida reproduzível antes de ampliar a implantação. Um assistente de atendimento que repete uma consulta de pedido, seleciona o documento errado ou prepara um reembolso sem fundamento é um bom candidato, pois o responsável consegue definir o comportamento esperado.

Um conector com defeito passa de uma falha isolada de produção a um exemplo preservado em dataset e a um medidor de testes de release
Preserve o exemplo que falhou e use a mesma entrada para verificar o próximo release.

Defina o responsável pelo workflow, o identificador do release e o resultado de negócio. Capture a execução completa, inspecione as operações de modelo e ferramentas e verifique os campos de consumo. Confira o que acontece quando o exportador fica lento ou um worker de curta duração termina. O primeiro teste de adoção é saber se os registros chegam com contexto suficiente para responder à pergunta do responsável.

Em seguida, coloque a falha conhecida em um dataset com um resultado esperado claro. Esse resultado pode ser “não prometer reembolso sem aprovação da ferramenta” ou “citar a política recuperada que se aplica a este cliente”. Use uma verificação por código quando a regra for determinística e uma rubrica de qualidade revisada quando houver necessidade de julgamento. Preserve a entrada e a regra para que uma mudança de prompt ou modelo enfrente o mesmo teste depois.

Torne explícito o critério de aprovação do release. Uma média aprovada não deve esconder uma falha na ação que você está tentando proteger. Revise o resultado do caso difícil identificado e inspecione o trace quando ele falhar. Depois use amostras de produção para encontrar novos casos que precisam entrar no dataset.

Antes de decidir a próxima assinatura, registre a quantidade real de traces, operações por trace, chamadas ao modelo, scores armazenados, bytes processados ou retidos, revisores e necessidade de retenção. Recalcule a conta com esses números. O resultado útil da primeira semana é um workflow corrigido e um orçamento justificável, cada um com um responsável definido.

Perguntas frequentes

Qual é a melhor ferramenta para observabilidade de IA?

Langfuse é a escolha inicial para uma equipe pequena em produção que precisa compartilhar tracing e custos. Braintrust atende decisões de release orientadas por avaliações, Phoenix atende um backend privado operado pela própria equipe e Datadog atende um fluxo de operações já existente. O responsável e os limites da implantação determinam qual opção especializada deve substituir a escolha inicial.

Quais métricas acompanhar na observabilidade de LLMs?

Acompanhe tokens e custos dos provedores, latência, erros, novas tentativas, resultados de recuperação de dados e ferramentas e resultados das avaliações. Agrupe tudo por cliente, workflow e release. O custo por resultado de negócio bem-sucedido é mais útil que o total de tokens quando execuções que falham e novas tentativas consomem uma parcela relevante dos gastos.

Quais são as 3 principais ferramentas de observabilidade?

Para os três papéis de produção desta comparação, escolha Langfuse para tracing compartilhado de uso geral, Braintrust para trabalho de produto orientado por avaliações e Datadog para contexto operacional. É uma seleção por função, não uma afirmação de superioridade medida em todos os recursos ou tipos de implantação.

Quais ferramentas de código aberto oferecem observabilidade de LLMs?

O núcleo de Langfuse tem licença MIT, e o repositório de Helicone usa Apache 2.0. Phoenix permite hospedagem própria gratuita, mas seu backend usa Elastic License 2.0, com restrições para serviços hospedados. Confira a licença real do backend, em vez de presumir que todo produto descrito como código aberto tem licença permissiva.

O que são ferramentas de observabilidade de LLMs?

Elas registram como uma aplicação de grandes modelos de linguagem foi executada, incluindo chamadas ao modelo, ferramentas, recuperação de dados, tempos, consumo e verificações das saídas. O resultado útil é uma execução com falha que pode ser explicada, orientar uma correção e virar um teste de release reproduzível.

Quanto custa Langfuse?

Conferido em 5 de outubro de 2026: Hobby é gratuito, Core custa $29/mês, Pro custa $199/mês e Enterprise custa $2,499/mês. O adicional opcional Teams do Pro custa $300/mês. Os planos pagos acrescentam uso de traces, observações e scores; a carga modelada de 610,000 unidades custa $69.80 no Core.

Posso usar Langfuse gratuitamente?

Sim. Hobby inclui 50,000 unidades por mês, dois usuários e 30 dias de acesso aos dados. Você também pode hospedar o núcleo com licença MIT sem pagar licença de software, assumindo os custos e a operação da infraestrutura. Os recursos empresariais comerciais têm condições separadas.

Quais são as alternativas a Langfuse?

LangSmith atende um ciclo de melhoria com LangChain ou LangGraph; Helicone atende o monitoramento de requisições por gateway; Phoenix atende um backend privado; Braintrust atende datasets e releases orientados por avaliações; Datadog atende incidentes de agentes dentro de uma stack de operações existente. Compare a métrica real de cobrança e a necessidade de retenção antes de trocar de plataforma.

É possível executar Langfuse localmente?

Sim. Langfuse documenta hospedagem própria baseada em Docker e fornece guias de implantação do núcleo com licença MIT. Começar localmente não resolve backups de produção, disponibilidade ou responsabilidade pelas atualizações. Defina esses requisitos se a instalação for se tornar o serviço de tracing de produção.

Receba o checklist de auditoria de workflows de IA para negócios para identificar o workflow, o responsável, o resultado e o ponto de controle antes de ampliar suas ferramentas de produção.

Última atualização
5 de out. de 2026
Categoria
Build

Prefira este site no Google

Adicionar omidsaffari.com como fonte preferida na Busca do Google

Marque omidsaffari.com como fonte preferida e o Google destaca o site para você em Top Stories, AI Overviews e AI Mode.

Artigos relacionados
OpenCode na prática: instalação, modelos e custos

OpenCode na prática: instalação, modelos e custos

Aprenda a instalar e usar OpenCode, conectar modelos e Ollama, configurar AGENTS.md e plugins e entender a cobrança de API e os custos do Zen.4 de out. de 2026Build
Hospedagem Netlify: preços, créditos e planos em 2026

Hospedagem Netlify: preços, créditos e planos em 2026

Veja os preços da hospedagem Netlify, os limites de créditos e quanto custam um site, um app Next.js e uma agência. Compare Free, Personal e Pro.4 de out. de 2026Build
Softr vale a pena? Preços, planos e limites em outubro de 2026

Softr vale a pena? Preços, planos e limites em outubro de 2026

Softr vale a pena para portais de clientes e sistemas internos? Veja preços em USD, planos, limites de usuários e recursos de IA antes de escolher.4 de out. de 2026Build
Claude Code: preço e alternativas no terminal em 2026

Claude Code: preço e alternativas no terminal em 2026

Compare o preço do Claude Code com OpenCode, Codex CLI, Pi e Gemini CLI: planos, custos dos modelos, limites de uso e o que muda ao trocar de agente.4 de out. de 2026Build
Docker MCP Gateway e alternativas: quando usar e quanto custa

Docker MCP Gateway e alternativas: quando usar e quanto custa

Entenda quando usar Docker MCP Gateway, Cloudflare ou Lasso, quais controles verificar e como calcular custos de hospedagem, operação e auditoria.4 de out. de 2026Build
OpenAI API pricing: quanto custa um app com GPT-6.1 Sol?

OpenAI API pricing: quanto custa um app com GPT-6.1 Sol?

Veja os preços da API OpenAI para GPT-6.1 Sol, Luna e Astra, com três orçamentos mensais de apps e custos de voz, imagens, buscas e contêineres em USD.3 de out. de 2026Build
IA para programar: comece com o Pi Coding Agent 1.0

IA para programar: comece com o Pi Coding Agent 1.0

Configure o Pi Coding Agent 1.0, conecte sua conta de modelos e conclua uma tarefa com testes. Veja custos de uso, personalização e limites do agente.3 de out. de 2026Build
Agentes de IA sem código: 8 plataformas comparadas em 2026

Agentes de IA sem código: 8 plataformas comparadas em 2026

Compare oito plataformas para criar agentes de IA sem código: preços, integrações, cobrança por uso e limites para escolher a ferramenta certa para sua equipe.1 de out. de 2026Build
Newsletter

Uma carta, todo domingo.Sistemas que funcionam, não hot takes.

Semanal. Sem spam. Cancele quando quiser.