LLM observability: costi e strumenti per il tuo team

Confronta Langfuse, LangSmith, Helicone, Phoenix, Braintrust e Datadog: prezzi, costi per team, self-hosting e OpenTelemetry per scegliere con criterio.

Monday, October 5, 2026Omid Saffari
LLM observability: costi e strumenti per il tuo team

Langfuse, piattaforma per tracing e valutazione, è la scelta di partenza più sensata per un piccolo team che lavora in produzione: nello scenario da 100,000 esecuzioni illustrato qui sotto, Core costa $69.80/mese, esclusi i costi di calcolo dei modelli e dei valutatori. La scelta degli strumenti di LLM observability cambia quando servono rilasci guidati dalle valutazioni, un gateway, un'installazione privata o il contesto degli incidenti in uno stack Datadog già in uso.

LLM observability: gli strumenti da valutare a colpo d'occhio

Parti da Langfuse se ti serve una dashboard di produzione condivisa, da LangSmith per un ciclo di miglioramento basato su LangChain, da Helicone per monitorare le richieste attraverso un gateway, da Arize Phoenix per gestire un'installazione privata, da Braintrust per decidere i rilasci in base alle valutazioni e da Datadog Agent Observability per indagare incidenti di produzione che coinvolgono più livelli dello stack applicativo. Le dimensioni del team pesano soprattutto quando la piattaforma fa pagare ogni persona che deve analizzare un errore.

Una trace registra un'esecuzione dell'applicazione. Uno span rappresenta una singola operazione al suo interno, per esempio una chiamata al modello, il recupero di informazioni o l'invocazione di uno strumento. Una valutazione, spesso abbreviata in eval, verifica se il risultato rispetta una regola o uno standard di qualità. Servono tutti e tre per capire perché un agente abbia restituito una risposta plausibile dopo aver compiuto l'azione sbagliata.

Prezzi verificati sulle pagine ufficiali dei singoli fornitori il 5 ottobre 2026. Tutti gli importi in dollari sono in USD. Salvo indicazione esplicita, i prezzi di partenza escludono consumi aggiuntivi e addebiti dei fornitori dei modelli. Il confronto si basa su prezzi e documentazione attuali: non propone una classifica delle prestazioni misurate con prove sul campo.

StrumentoIdeale perPrezzo iniziale a pagamentoPiano gratuito / prova
LangfusePiccoli team in produzione che devono condividere trace e costiCore $29/mese più unitàHobby: 50k unità/mese, 2 utenti; core self-hosted gratuito
LangSmithTeam che già migliorano agenti LangChain o LangGraphPlus $39/utente/mese più traceDeveloper: 1 utente, 5k trace di base/mese
HeliconeMonitoraggio delle richieste insieme a un gateway per modelliPro $79/mese più richieste e storageHobby: 10k richieste/mese, 1 utente; i piani a pagamento indicano una prova di 7 giorni
Arize PhoenixTracing e valutazione privati con un responsabile dell'infrastrutturaNessun piano Phoenix a pagamento pubblicato; AX Pro è separato e costa $50/mesePhoenix self-hosted non prevede costi di licenza; AX Free include 25k span/mese
BraintrustDataset di valutazione condivisi e confronto tra rilasciPro $249/mese; Starter può generare addebiti a consumoStarter: 1 GB elaborato/mese, 10k punteggi, utenti illimitati
Datadog Agent ObservabilityTeam operativi già attivi che collegano gli errori degli agenti ai serviziPro $160/mese con impegno annuale; $200 mese per mese; $240 on-demandFree: 40k span LLM/mese, conservazione per 15 giorni

Fonti: prezzi Langfuse, prezzi LangSmith, prezzi Helicone, prezzi Arize, prezzi Braintrust e prezzi Datadog.

La differenza decisiva è l'unità che segue quel «più». Una piattaforma che fattura le trace applicative conta un volume diverso da una che addebita ogni chiamata al modello, osservazione, punteggio o gigabyte. Prima di confrontare gli abbonamenti, stima i record che emette la tua applicazione.

Quanto costano 100,000 esecuzioni di un agente al mese?

Con le ipotesi riportate sotto, un team di cinque persone che usa lo stesso agente può spendere $69.80 con Langfuse oppure $645 con LangSmith. Nessuno dei due importi misura la qualità. La differenza dipende da come si contano gli eventi, dal volume incluso e dal costo degli utenti.

Il confronto usa questo scenario di produzione, modellato in modo esplicito:

  • 100,000 esecuzioni complete dell'agente al mese, con una trace per esecuzione.
  • Cinque operazioni osservate per esecuzione: un workflow principale, due chiamate al modello, un recupero di informazioni e una chiamata a uno strumento.
  • 200,000 chiamate al modello e 500,000 operazioni osservate complessive.
  • 10,000 punteggi di valutazione tramite codice calcolati esternamente, uno per ogni esecuzione campionata. Questo scenario esclude ulteriori chiamate al modello e trace dei valutatori.
  • Cinque utenti che devono accedere alla dashboard.
  • 5 GB di dati elaborati in Braintrust e, separatamente, 5 GB di storage conteggiato in Helicone. Sono ipotesi indipendenti, perché i contatori di byte dei fornitori non sono intercambiabili.

Lo scenario ricorda un agente di assistenza che legge una richiesta, recupera un ordine, chiama uno strumento di gestione degli ordini e chiede a un modello di preparare la risposta finale. I numeri sono ipotesi per il budget, non misurazioni di un'applicazione già distribuita. Un agente che ripete i tentativi, segue percorsi alternativi o esegue valutatori dentro la piattaforma produce record diversi.

Un'esecuzione di agente senza punteggio rappresentata da un workflow, due chiamate al modello, un recupero di informazioni e uno strumento, con diversi contatori di fatturazione dei fornitori
Una singola esecuzione senza punteggio può valere una trace, sei unità Langfuse o due richieste al modello fatturabili. I punteggi hanno un contatore separato.
Strumento / pianoVolume conteggiato per la fatturazioneCosto mensile della piattaforma nello scenarioVoci da considerare nel budget
Langfuse Core610k unità: trace + osservazioni + punteggi$69.80Altri eventi dei valutatori aumentano le unità
LangSmith Plus100k trace di base, 5 utenti$645Conservazione estesa delle trace e uso dei valutatori aggiungono costi
Helicone Pro200k richieste al modello registrate, 5 GB di storageStima di $146.25-$149.50La tabella del piano e il calcolatore indicano condizioni diverse per lo storage
Phoenix self-hostedGli span e i dati di valutazione che conservi$0 di licenza + la tua infrastrutturaNon è incluso un prezzo per infrastruttura gestita; AX richiede un preventivo a questo volume
Braintrust Starter / Pro5 GB elaborati, 10k punteggi$16 / $249Uso dei modelli e conservazione estesa sono separati
Datadog Pro200k span LLM fatturabili$195 a tariffa annuale; $242 mensile; $290 on-demandAltri prodotti Datadog e conservazione estesa sono separati

I calcoli usano le tariffe attuali dei fornitori, collegate sopra. Il totale LangSmith applica i $0.005 per trace di base indicati nel tooltip dei prezzi, con 10,000 trace incluse per l'intera organizzazione. L'intervallo di Helicone mantiene una discrepanza presente nella sua pagina: la tabella del piano include 1 GB gratuito, mentre il calcolatore addebita lo storage fin dal primo gigabyte. Phoenix non applica costi di licenza legati al volume; il costo dell'infrastruttura va stimato sul dimensionamento effettivo della tua installazione.

Questi totali non sono preventivi validi per qualsiasi agente con trace più lunghe. Se il workflow passa da due chiamate al modello a un ciclo di ragionamento ripetuto, Datadog e Helicone contano più operazioni del modello. Se aggiungi osservazioni e punteggi memorizzati, Langfuse conta più unità. Se invii documenti più grandi mantenendo lo stesso numero di trace, Braintrust conta più byte elaborati. Il confronto sul monitoraggio dei token degli agenti approfondisce come attribuire la spesa dei fornitori a un cliente o a una funzionalità.

Come sono stati scelti gli strumenti?

La classifica parte dall'acquisto che un piccolo team in produzione può giustificare, poi passa agli strumenti il cui valore dipende da uno specifico modello operativo. Un gruppo di sviluppatori con un responsabile AI deve capire gli esiti sbagliati, seguire i costi per cliente e trasformare gli errori in controlli prima del rilascio. Un prodotto che risolve soltanto uno di questi problemi può comunque essere lo specialista adatto.

Ogni raccomandazione si basa su cinque criteri:

  1. Un contatore comprensibile. Chi acquista deve poter capire se la fattura dipende da trace, operazioni, persone, punteggi o volume dei dati, inclusi la quota gratuita e il limite successivo.
  2. Record di produzione utili. Una risposta errata deve poter essere collegata alle operazioni del modello, al recupero di informazioni e agli strumenti che l'hanno prodotta.
  3. Un processo di miglioramento. Il record deve servire per una valutazione, un dataset, un esperimento o una decisione di revisione, anziché restare un log isolato.
  4. Confini di deployment dichiarati con chiarezza. Self-hosting gratuito, licenza enterprise commerciale e data plane gestito dal cliente sono descritti separatamente.
  5. Strumentazione documentata. Il supporto OpenTelemetry è valutato sulle istruzioni di integrazione attuali del fornitore, compresi protocollo e mappatura dei campi quando specificati.

I sei prodotti coprono scelte diverse: una piattaforma di tracing di uso generale, un processo di sviluppo centrato su un framework, un gateway, una piattaforma privata pensata anzitutto per l'uso locale, una piattaforma di valutazione e una suite operativa. Un catalogo più ampio aumenterebbe le opzioni senza aiutare questa specifica decisione su budget e responsabilità. Il confronto non esprime giudizi basati su misurazioni della velocità di ingestione, dell'usabilità dell'interfaccia, della disponibilità del servizio o dell'accuratezza delle valutazioni.

«Gratuito» indica una quota utilizzabile, non la promessa che la fattura resti a zero. Braintrust Starter e LangSmith Developer possono generare addebiti a consumo. La licenza di Phoenix può costare zero mentre manutenzione del database e reperibilità restano voci rilevanti. Il piano gratuito giusto è quello i cui limiti permettono di completare l'esperimento che hai in mente.

I sei strumenti: quale si adatta meglio alla produzione?

1. Langfuse: la scelta di partenza per un piccolo team in produzione

Langfuse offre a un piccolo team in produzione tracing condiviso, monitoraggio di token e costi, gestione dei prompt e valutazione, senza costi per utente sul piano Core. Un assistente SaaS per il supporto può associare cliente, workflow e rilascio alle chiamate al modello, poi analizzare gli errori costosi insieme alle esecuzioni riuscite. Il principale limite di budget è il numero di record memorizzati: un'esecuzione dell'agente può creare una trace, più osservazioni e diversi punteggi. Sceglilo se vuoi tenere insieme trace e costi, con un percorso concreto verso il self-hosting in futuro.

Pagina attuale dei prezzi Langfuse con i piani Hobby, Core, Pro ed Enterprise
Langfuse

Ideale per: Un team di prodotto piccolo o in crescita in cui sviluppatori e responsabile AI devono analizzare le stesse esecuzioni di produzione
Punto di forza: Utenti illimitati su Core, costi contestualizzati nella trace e core self-hosted con licenza MIT
Prezzi: Core parte da $29/mese; i piani Cloud a pagamento aggiungono consumi fatturati in unità
Prova gratuita: Hobby non richiede carta di credito; è una quota gratuita continuativa, non una prova a tempo

Piani attuali: quali limiti fanno cambiare la scelta?

La pagina attuale dei prezzi indica Hobby a $0, con 50,000 unità/mese, due utenti e 30 giorni di accesso ai dati. Core costa $29/mese, con 100,000 unità, utenti illimitati e 90 giorni di accesso ai dati. Pro costa $199/mese, con le stesse unità incluse, tre anni di accesso ai dati, gestione della conservazione e limiti di frequenza più alti. L'add-on Teams opzionale di Pro costa $300/mese e aggiunge SSO enterprise, applicazione vincolante delle policy e controlli di accesso più granulari. Enterprise costa $2,499/mese, con 100,000 unità incluse, log di audit, SCIM e impegni contrattuali sul servizio; gli impegni annuali possono prevedere prezzi personalizzati per volume.

I consumi Cloud a pagamento si calcolano per scaglioni. La fascia da 100,000 a un milione di unità costa $8 ogni 100,000; quella da un milione a dieci milioni costa $7 ogni 100,000; quella da dieci milioni a cinquanta milioni costa $6.50 ogni 100,000. Le tariffe più basse si applicano soltanto alle unità nella rispettiva fascia. Superare una soglia non riduce retroattivamente il prezzo delle unità nella fascia precedente.

Il limite di ingestione di Core è di 4,000 richieste/minuto, mentre Pro indica 20,000 richieste/minuto. Sono richieste di ingestione, non l'unità usata per la fatturazione. Un batch può contenere più eventi da memorizzare. Verifica sia il budget mensile delle unità sia i picchi di traffico generati dall'exporter.

Trace Langfuse: vanno contati anche osservazioni e punteggi

Una trace Langfuse registra un'esecuzione, ma la formula di fatturazione è trace + osservazioni + punteggi. Nello scenario del confronto, 100,000 + 500,000 + 10,000 = 610,000 unità. Core costa quindi $29 + 5.1 × $8 = $69.80/mese. Lo stesso volume memorizzato su Pro costa $239.80/mese.

Questa formula cambia il modo di discutere la strumentazione. Un'operazione di recupero delle informazioni e una chiamata allo strumento per i rimborsi sono prove preziose, anche se aumentano i record. Eliminarle per ridurre la fattura può impedire di spiegare l'errore. Meglio definire una politica di campionamento consapevole per le esecuzioni riuscite di scarso valore, conservando le informazioni necessarie a diagnosticare esiti costosi o dannosi.

Hosting, licenza e OpenTelemetry

La versione Open Source self-hosted non prevede costi di licenza con MIT, offre utilizzo illimitato e include le API principali per tracing, valutazione, dataset e gestione dei prompt. Enterprise self-hosted richiede una licenza commerciale e un preventivo. La pagina attuale dei prezzi specifica che il prezzo enterprise di Langfuse si aggiunge al relativo piano commerciale ClickHouse. Un abbonamento cloud e un preventivo enterprise per il self-hosting sono acquisti diversi.

La documentazione OpenTelemetry supporta OTLP su HTTP/JSON o HTTP/protobuf e dichiara l'assenza di supporto gRPC. L'endpoint di base è /api/public/otel, con autenticazione Basic tramite le chiavi pubblica e segreta del progetto. L'ingestione diretta nel percorso v4 attuale richiede l'header x-langfuse-ingestion-version: 4 per l'elaborazione in tempo reale; senza questo header, la documentazione avverte di un ritardo fino a dieci minuti. Anche gli attributi di utente, sessione, rilascio e altri attributi della trace devono propagarsi agli span che vuoi filtrare e aggregare.

È un vincolo di integrazione concreto per un team di piattaforma che esporta già via gRPC verso un Collector. Il Collector può ricevere con un protocollo ed esportare con un altro, ma l'ultimo passaggio verso Langfuse deve rispettare l'endpoint HTTP e la mappatura degli attributi documentati. Un payload accettato a cui mancano i metadati del cliente non basta a completare l'integrazione.

Langfuse con Python: partire dal percorso SDK documentato

Il fornitore consiglia il proprio SDK per Python perché gestisce i campi Langfuse, la propagazione e l'esportazione. Segui la guida rapida al tracing attuale, imposta le credenziali del progetto e LANGFUSE_HOST per la regione scelta o per la tua installazione, e racchiudi l'intera operazione di business nel contesto di osservazione previsto. Mantieni al suo interno anche recupero delle informazioni e uso degli strumenti, così la trace conserva la causa di una risposta sbagliata.

Quando possibile, usa i consumi comunicati dal fornitore. Il monitoraggio dei costi Langfuse dà priorità ai costi ricevuti in ingestione rispetto alle stime ricavate dai prezzi dei modelli; Project Settings > Models permette definizioni personalizzate. Questo conta se il contratto con il fornitore prevede una tariffa negoziata o se un modello interno non ha un prezzo pubblico. La stima mostrata deve corrispondere alla tariffa commerciale che vuoi gestire.

Langfuse con LangChain: tutta la richiesta nello stesso contesto

L'integrazione LangChain usa un callback handler passato tramite callbacks nell'invocazione. Assegna un contesto di trace alla richiesta che racchiude l'operazione, poi inserisci la chain al suo interno. La documentazione richiama anche gli eventi in coda elaborati in background: i processi di breve durata devono svuotare le code dell'exporter o arrestarlo correttamente prima di terminare. Negli ambienti JavaScript serverless, attendi i callback in background come specificato dalla guida.

Il primo rollout deve essere abbastanza circoscritto da poterlo controllare a mano:

  1. Crea un progetto di tracing per la produzione

    Scegli la regione Cloud o l'indirizzo self-hosted, crea le chiavi del progetto e configura l'host seguendo la guida rapida attuale. Tieni distinguibili i record di produzione da quelli di sviluppo.

  2. Traccia un'operazione di business completa

    Aggiungi la strumentazione alla radice della richiesta, alle chiamate al modello, al recupero delle informazioni e agli strumenti. Associa agli span corretti i metadati di cliente, workflow, rilascio ed esito; verifica che gli attributi necessari della trace si propaghino.

  3. Verifica il costo rispetto alla risposta del fornitore

    Apri una trace completata e controlla identità del modello, consumi e costo. Imposta prezzi personalizzati del modello quando una tariffa pubblica usata per la stima non rispecchia il tuo accordo.

  4. Memorizza un punteggio e controlla i consumi

    Valuta un esempio noto, verifica che il punteggio sia associato all'esecuzione prevista e confronta i conteggi di trace, osservazioni e punteggi con la dashboard Usage Management. Svuota le code dell'exporter prima che termini un worker di breve durata.

I punti di forza
Cosa fa bene
7 points

  • Core permette a tutte le persone coinvolte nella revisione di accedere senza pagare un altro utente dell'abbonamento
  • Il record può riunire chiamate al modello, strumenti, recupero delle informazioni, costi e punteggi di valutazione
  • Costi ricevuti in ingestione e definizioni personalizzate dei modelli gestiscono tariffe negoziate o private
  • Il self-hosting del core MIT offre un'opzione di deployment sotto la responsabilità di chi gestisce l'infrastruttura
  • Trace, osservazioni e punteggi memorizzati consumano tutti la quota Cloud
  • Pro e il suo add-on Teams possono aumentare il costo fisso prima che cambino i consumi
  • Il ricevitore OTel richiede esportazione HTTP e propagazione corretta degli attributi

2. LangSmith: per migliorare gli agenti con LangChain

LangSmith è una piattaforma di tracing e valutazione per team che già sviluppano e revisionano agenti con LangChain o LangGraph, ma documenta anche la strumentazione per altri framework. Un responsabile dello sviluppo può collegare un errore di produzione a un dataset, a una valutazione online o offline, a una revisione umana e a una modifica del prompt. Il vincolo economico è dato da utenti più trace: invitare altre persone alla revisione aumenta l'abbonamento, mentre il volume delle trace genera un addebito a parte. Sceglilo se questo processo di sviluppo e valutazione vale abbastanza da giustificare un utente a pagamento per ogni revisore.

Prezzi LangSmith con i piani Developer, Plus, Enterprise e gli addebiti a consumo
LangSmith

Ideale per: Un team di sviluppo che già organizza il miglioramento degli agenti attorno a LangChain o LangGraph
Punto di forza: Tracing, dataset, code di annotazione e valutazione online/offline nello stesso prodotto
Prezzi: Plus $39/utente/mese, più consumi delle trace e degli altri servizi del prodotto
Prova gratuita: Developer offre una quota gratuita continuativa per un utente, con addebiti a consumo oltre le trace incluse

Piani attuali e quota di trace condivisa

Developer costa $0 per utente/mese, supporta un utente e include 5,000 trace di base/mese, oltre le quali si paga a consumo. Plus costa $39 per utente/mese, permette di aggiungere utenti a pagamento e include 10,000 trace di base al mese in totale. Il calcolatore dei prezzi tratta esplicitamente questa quota come condivisa dall'intera organizzazione. Enterprise richiede un preventivo e offre opzioni ibride e self-hosted, controlli di sicurezza e accordi di supporto.

Il tooltip della pagina attuale indica 0.005 LangChain Standard Units per trace di base e 0.0025 per passaggio di una trace alla conservazione estesa. Una LSU equivale a $1, quindi le tariffe sono $0.005 per trace di base e $0.0025 per il passaggio. La conservazione di base dura 14 giorni; quella estesa 180 giorni. Un vecchio prezzo per trace ricordato a memoria non è un dato adatto a un budget verificato oggi.

Con cinque utenti Plus e 100,000 trace di base, la fattura è $195 per gli utenti + $450 per le trace aggiuntive = $645/mese. Estendere la conservazione di 10,000 trace aggiunge $25, per un totale di $670 prima del calcolo dei valutatori o dei consumi di altri servizi del prodotto. L'estensione conserva il record più a lungo: non è un vantaggio gratuito incluso nell'acquisto di Plus.

I Tuned Evaluators hanno un altro contatore pubblicato: 0.015 LSU per ogni esecuzione riuscita di una valutazione Perceived Error. Il tooltip specifica che un Tuned Evaluator che aggiunge feedback porta anche la trace alla conservazione estesa. Deployment, Engine, Fleet e Sandboxes hanno regole di consumo separate. Chi acquista soltanto l'osservabilità dovrebbe limitare il budget a quel servizio, senza considerare l'utente pagato come un runtime per agenti tutto compreso.

Perché il numero di utenti cambia la raccomandazione?

Cinque sviluppatori che analizzano trace non sono la stessa cosa di cinque sviluppatori affiancati da un gruppo più ampio di revisione del prodotto e della qualità. A parità di 100,000 trace di base, quindici utenti Plus costano $1,035/mese: la componente utenti sale a $585, mentre le trace aggiuntive restano a $450. Aggiungere utenti non moltiplica la quota gratuita condivisa delle trace.

La spesa può essere giustificata se ogni revisore trasforma regolarmente le trace in prompt corretti, dataset o decisioni di rilascio. Lo è meno se la maggior parte degli utenti deve consultare solo occasionalmente una dashboard dei costi. Stabilisci chi deve esaminare i record originali, chi può lavorare su un risultato esportato e quale processo rende utile l'abbonamento.

Self-hosting commerciale e OpenTelemetry

LangSmith self-hosted è un add-on Enterprise che richiede una chiave di licenza commerciale. L'installazione comprende servizi frontend e backend, oltre a ClickHouse, PostgreSQL e Redis; la guida consiglia servizi di storage esterni per la produzione. È un'installazione enterprise da gestire, non una licenza server gratuita deducibile dal fatto che il framework sia open source.

La guida OpenTelemetry descrive trace da applicazioni compatibili, mappature standard degli attributi e distribuzione tramite Collector verso più destinazioni: lo stesso flusso di span viene inviato a più backend. Chi usa LangChain e LangGraph può abilitare il percorso integrato con LANGSMITH_OTEL_ENABLED=true insieme al tracing. Un exporter HTTP standard usa l'endpoint di base https://api.smith.langchain.com/otel, con autenticazione x-api-key e un header opzionale Langsmith-Project.

Fai attenzione alla forma dell'endpoint. La variabile OTLP di base condivisa permette all'exporter HTTP di aggiungere /v1/traces; la variabile specifica per le trace contiene invece il percorso completo. Aggiungere il percorso del segnale a entrambe produce un URL errato. Controlla la stessa trace nel progetto scelto e verifica modello, input, output e struttura padre-figlio prima di considerare completa l'esportazione OTel.

I punti di forza
Cosa fa bene
7 points

  • LangChain e LangGraph dispongono di un percorso di tracing integrato e documentato
  • Dataset, code di annotazione e valutazioni online/offline sostengono un processo di miglioramento esplicito
  • L'ingestione OTel e la distribuzione tramite Collector supportano applicazioni che vanno oltre un singolo framework
  • Enterprise offre un percorso con licenza per gestire il backend nella propria infrastruttura
  • Ogni revisore Plus costa $39/mese, inclusi gli utenti invitati conteggiati come accessi a pagamento
  • La quota di trace inclusa è condivisa, non assegnata a ciascun utente
  • Conservazione più lunga delle trace e uso di valutatori specializzati aggiungono costi separati

3. Helicone: quando serve anche il gateway

Helicone unisce l'osservabilità delle richieste a un gateway AI, un servizio che inoltra le richieste ai modelli applicando instradamento e controlli collegati. Una piccola applicazione che deve soprattutto analizzare le richieste ai fornitori, gestire i fallback e raggruppare la spesa dei modelli può ottenere record utili a questo livello. Il limite è la distanza tra il gateway e l'agente completo: il record di una richiesta al modello ha ancora bisogno del contesto applicativo per spiegare il recupero delle informazioni e gli strumenti di business. Sceglilo se il gateway fa già parte del progetto e la priorità immediata è monitorare le richieste.

Pagina dei prezzi Helicone con Hobby, Pro, Team, Enterprise e il calcolatore dei consumi
Helicone

Ideale per: Un team di prodotto che acquista il monitoraggio delle richieste insieme alle funzioni del gateway
Punto di forza: Gateway compatibile con OpenAI, con un percorso separato di logging asincrono
Prezzi: Pro $79/mese, più addebiti per richieste registrate a scaglioni e storage
Prova gratuita: Hobby è gratuito; Pro e Team indicano una prova gratuita di 7 giorni

Piani attuali e limiti nei picchi di traffico

La pagina attuale dei prezzi indica Hobby a $0, con 10,000 richieste/mese, 1 GB di storage, un utente, un'organizzazione e sette giorni di conservazione. Pro costa $79/mese, aggiunge utenti illimitati, avvisi, report e HQL, il suo linguaggio di query, e conserva i dati per un mese. Team costa $799/mese, aggiunge cinque organizzazioni, tre mesi di conservazione, un canale Slack dedicato e l'offerta di compliance elencata. Enterprise richiede un preventivo, con SAML SSO, deployment on-prem e opzioni contrattuali personalizzate.

La tabella dei piani a pagamento include 10,000 richieste gratuite e 1 GB di storage gratuito, poi applica addebiti a consumo. Il limite di ingestione pubblicato per Hobby è di 10 log/minuto, contro 1,000 su Pro, 15,000 su Team e 30,000 su Enterprise. La quota mensile può sembrare sufficiente anche quando un picco supera già il limite di ingestione. Un job su documenti alimentato da una coda, che invia molti record tutti insieme, richiede una verifica della capacità di ingestione oltre al conteggio mensile.

Il passaggio da Pro a Team aggiunge $720/mese prima dei consumi. Fallo per le esigenze di organizzazione, conservazione e supporto che risolve. La sola crescita del numero di richieste non rende quel salto la prossima spesa inevitabile.

Costo delle richieste e discrepanza sullo storage

Il calcolatore attuale della pagina dei prezzi usa tariffe per scaglioni: le prime 10,000 richieste sono gratuite, le successive 20,000 costano $0.0007 ciascuna, le successive 60,000 costano $0.00035 ciascuna e quelle da 90,001 a 250,000 costano $0.000175 ciascuna. Negli scaglioni successivi pubblicati, le tariffe scendono a $0.0000875, $0.00004375 e $0.00002 per richiesta all'aumentare del volume. Questi dati provengono dal calcolatore di Helicone, non dal confronto di un altro fornitore.

Con 200,000 richieste al modello registrate, la componente richieste è $14 + $21 + $19.25 = $54.25. Aggiungendo Pro si arriva a $133.25 prima dello storage. Nell'agente di esempio vanno contate entrambe le chiamate al modello: descrivere l'applicazione come 100,000 «richieste» sottostimerebbe questo contatore.

Gli scaglioni di storage del calcolatore partono da $3.25/GB per i primi 30 GB, poi passano a $2/GB, $1.25/GB, $0.75/GB e $0.50/GB nelle fasce maggiori. Il calcolatore, però, addebita il primo scaglione a partire da zero, nonostante il gigabyte gratuito pubblicizzato nella tabella del piano. Con 5 GB di storage conteggiato, applicare la quota gratuita produce $13 di storage; seguire il calcolatore produce $16.25. Il totale indicativo di Pro è quindi $146.25-$149.50.

Gateway, Async e confini del supporto OTel documentato

La guida rapida al gateway usa un client compatibile con OpenAI indirizzato a https://ai-gateway.helicone.ai, con logging e fallback automatici. Puoi anche usare le tue chiavi dei fornitori. La spesa dei fornitori dei modelli resta separata dall'abbonamento di osservabilità e dagli addebiti per le richieste registrate.

La guida Proxy e Async espone direttamente il compromesso architetturale. L'integrazione Proxy mette Helicone sul percorso della richiesta e offre funzioni del gateway come cache, controlli sui nuovi tentativi e limiti di frequenza personalizzati. Il logging Async resta fuori da quel percorso critico, ma non offre gli stessi controlli del proxy. Prima di confrontare lo sforzo di configurazione, decidi se vuoi inoltrare il lavoro oppure osservarlo in background.

Per OpenTelemetry, Helicone documenta un'integrazione OpenLLMetry Async. Gli esempi attuali usano i logger @helicone/async e helicone-async. Questo conferma il percorso di integrazione descritto; la guida citata non fornisce una configurazione generica di ricevitore OTLP per Collector. Se il requisito è «cambiare soltanto l'exporter del Collector», verifica quel percorso preciso, senza considerare un'integrazione collegata a OTel come un backend OTLP direttamente sostituibile.

Il self-hosting supporta installazione manuale, Docker Compose, Kubernetes e deployment cloud. Il repository ha licenza Apache 2.0. Supporto dedicato e servizi enterprise richiedono accordi separati. Per un piccolo team, il costo ricorrente di gestione dello stack può superare la fattura della telemetria anche quando la licenza software è gratuita.

Un rollout deve rispondere a una domanda sull'applicazione, senza fermarsi alla semplice presenza di una richiesta nell'interfaccia. Associa gli identificativi di workflow e cliente, invia una chiamata al modello nota, analizza il record e verifica che una sessione colleghi le chiamate che volevi raggruppare. Ripeti poi il controllo con un nuovo tentativo o una risposta fallita. La vista del gateway diventa una prova utile in produzione quando permette di capire quale operazione di business abbia causato il lavoro aggiuntivo del modello.

I punti di forza
Cosa fa bene
8 points

  • Pro include utenti illimitati per condividere il monitoraggio delle richieste
  • I percorsi gateway e asincrono permettono di scegliere il compromesso sul percorso della richiesta
  • Gli addebiti per richieste a scaglioni sono calcolabili dalla pagina attuale del fornitore
  • La licenza Apache 2.0 e le opzioni di deployment documentate supportano il self-hosting
  • Le richieste ai modelli sono un'unità diversa dalle esecuzioni complete dell'agente
  • La quota di storage pubblicata e il calcolatore vanno riconciliati
  • Il logging Async non offre cache, controlli sui nuovi tentativi o limiti di frequenza del gateway
  • La guida di integrazione citata non dimostra un percorso generico di ingestione da Collector a OTLP

4. Arize Phoenix: tracing privato con un responsabile dell'infrastruttura

Arize Phoenix è una piattaforma local-first per tracing, valutazione e sperimentazione, eseguibile nella propria infrastruttura senza costi di licenza. Un ingegnere di piattaforma che analizza un assistente basato sul recupero di informazioni può esaminare chiamate al modello, contesto recuperato e operazioni degli strumenti, raccogliere gli errori in un dataset e confrontare una versione modificata dell'applicazione. Il vincolo è la responsabilità: qualcuno deve gestire il servizio e conoscere i confini della licenza. Sceglilo se un'installazione privata e controllabile per tracing e valutazione conta abbastanza da assegnarle un responsabile dell'infrastruttura.

Documentazione Arize Phoenix con tracing, valutazioni, prompt, dataset ed esperimenti
Arize Phoenix

Ideale per: Un team tecnico che vuole gestire il proprio backend di tracing e valutazione
Punto di forza: Trace OTLP e strumentazione OpenInference, con dataset ed esperimenti locali
Prezzi: Phoenix self-hosted non prevede costi di licenza; la pagina attuale dei prezzi Arize non pubblica un piano Phoenix a pagamento
Prova gratuita: Phoenix self-hosted è utilizzabile gratuitamente nei limiti della licenza; Arize AX ha un piano gratuito separato

Il piano AX da $50 va distinto da Phoenix

La pagina attuale dei prezzi Arize presenta i prezzi di AX e descrive separatamente Phoenix come piattaforma local-first. AX Free include 25,000 span di trace/mese, 1 GB/mese di ingestione, 15 giorni di conservazione, utenti e valutazioni illimitati. AX Pro costa $50/mese, con 50,000 span, 10 GB/mese di ingestione, 30 giorni di conservazione, utenti e valutazioni illimitati. AX Enterprise richiede un preventivo, con volumi e conservazione personalizzati e deployment SaaS o self-hosted.

Su quella pagina non sono pubblicati né un prezzo per un'istanza Phoenix a pagamento né tariffe Phoenix per i consumi eccedenti. Attribuire a Phoenix un prezzo di «$50/mese» confonderebbe due prodotti. Per un servizio Arize gestito, valuta AX con i suoi limiti di span e byte; per Phoenix, metti a budget l'infrastruttura che dovrai gestire.

Nell'applicazione modellata, 500,000 span sono dieci volte il volume di span incluso in AX Pro. La pagina pubblica non indica una tariffa per l'eccedenza in questo caso: serve quindi un preventivo, non un prezzo estrapolato. Con cinque span per esecuzione, la quota di AX Free corrisponde a 5,000 esecuzioni e quella di Pro a 10,000, a condizione di rispettare anche i limiti sui byte e gli altri vincoli.

Per Phoenix self-hosted, il costo della licenza software resta zero al volume dello scenario. Questo non significa che conservare 500,000 span memorizzati non costi nulla. Scegli una politica di storage, stima le dimensioni dei payload, includi i backup e assegna a una persona aggiornamenti e ripristino. «Gestiamo già questa infrastruttura» e «ci serve una nuova piattaforma privata» portano a costi totali diversi.

Licenza: leggere le condizioni del backend

Il backend Phoenix ha attualmente licenza Elastic License 2.0 nel repository. Consente l'uso nel rispetto delle restrizioni e vieta di offrire a terzi una parte sostanziale delle funzionalità del prodotto come servizio hosted o gestito. Limita anche l'aggiramento delle funzionalità legate alla chiave di licenza e la rimozione degli avvisi di licenza. È un modello di autorizzazioni diverso da quello del core MIT di Langfuse e della licenza Apache 2.0 di Helicone.

Usa questa distinzione anche nei documenti di acquisto. «Il codice è disponibile», «è gratuito per la nostra installazione» e «ha una licenza permissiva per riproporlo come servizio» sono affermazioni diverse. La raccomandazione riguarda la gestione di Phoenix per tracing e valutazione della tua applicazione; non presume il diritto di rivenderlo come prodotto hosted.

La guida al self-hosting dichiara che Phoenix non prevede costi di licenza, limiti di utilizzo o funzionalità bloccate per il self-hosting e può funzionare in un ambiente completamente isolato dalla rete, air-gapped. Documenta deployment da terminale, Docker/Compose, Kubernetes/Helm e cloud. Un'installazione privata richiede comunque una configurazione e un piano di ripristino adatti ai dati che conserva.

OpenTelemetry e il processo di valutazione

Phoenix accetta trace OTLP ed è costruito attorno alla strumentazione OpenTelemetry e OpenInference. Il record documentato comprende chiamate al modello, recupero di informazioni, strumenti e logica personalizzata. Le valutazioni possono usare modelli giudici, controlli tramite codice o etichette umane. Dataset ed esperimenti permettono di rieseguire diverse versioni dell'applicazione sugli stessi input, mentre gli strumenti per i prompt supportano versionamento e riesecuzione.

La guida alla configurazione del tracing offre phoenix.otel per Python e @arizeai/phoenix-otel per TypeScript, oltre all'organizzazione per progetto e sessione. Un team che usa un Collector dovrebbe verificare in Phoenix gli stessi campi semantici effettivi che usa altrove. Conservare l'ID della trace è utile; conservare quale operazione abbia recuperato il contesto sbagliato permette di intervenire sul problema.

Per un assistente basato sul recupero di informazioni, parti da un errore noto: il modello ha prodotto una risposta sicura di sé a partire da un documento irrilevante. Verifica se lo span di recupero contiene le prove necessarie a distinguere un problema di ricerca da uno di generazione della risposta. Conserva input e comportamento atteso in un dataset, cambia un'impostazione del recupero o del prompt e confronta il risultato. Un esempio ripetibile collega l'osservazione del problema alla possibilità di impedirne il ritorno.

I punti di forza
Cosa fa bene
7 points

  • La guida non indica costi di licenza software né tetti di utilizzo per il self-hosting
  • La documentazione supporta un deployment air-gapped
  • OTLP e OpenInference collegano il tracing a percorsi di strumentazione comuni
  • Dataset, esperimenti e più tipi di valutazione sostengono i controlli di regressione
  • ELv2 ha restrizioni che l'etichetta sintetica di licenza permissiva nasconderebbe
  • Infrastruttura, conservazione, aggiornamenti e ripristino sono responsabilità della tua organizzazione
  • Limiti e prezzi di AX a pagamento non descrivono un abbonamento Phoenix a pagamento

5. Braintrust: quando le valutazioni decidono i rilasci

Braintrust è una piattaforma di valutazione e osservabilità per team che decidono i rilasci sulla base di esempi valutati, dataset ed esperimenti. Un responsabile AI di prodotto che confronta una modifica del prompt può analizzare le trace e stabilire se il nuovo output supera gli stessi controlli della versione precedente. Il vincolo di budget è dato da dati elaborati più punteggi, a cui si aggiungono il calcolo dei modelli e la conservazione più lunga. Sceglilo se il processo di valutazione ha un responsabile e cambia ciò che rilasci; parti da Starter se limiti e funzionalità sono adeguati.

Prezzi Braintrust con Starter, Pro ed Enterprise e i contatori di dati elaborati e punteggi
Braintrust

Ideale per: Un team di prodotto AI con dataset di valutazione mantenuti nel tempo e criteri di rilascio
Punto di forza: Utenti, progetti, dataset, playground ed esperimenti illimitati su Starter
Prezzi: Starter ha un canone di piattaforma di $0 e consumi a pagamento; Pro costa $249/mese più consumi
Prova gratuita: Starter offre una quota gratuita continuativa e non richiede una carta di credito per iniziare

Piani attuali e i due contatori di consumo

Starter ha un canone mensile di piattaforma di $0, 1 GB di dati elaborati/mese, poi $4/GB; 10,000 punteggi/mese, poi $2.50 ogni 1,000; 14 giorni di conservazione; e $10 di crediti mensili per i modelli. Utenti, progetti, dataset, playground ed esperimenti sono illimitati. Un team può quindi avere bisogno di uno spazio di valutazione condiviso senza dover passare subito a Pro.

Pro costa $249/mese, con 5 GB di dati elaborati, poi $3/GB; 50,000 punteggi, poi $1.50 ogni 1,000; 30 giorni di conservazione, con conservazione aggiuntiva a $0.50/GB/mese; e $100 di crediti mensili per i modelli. Aggiunge grafici personalizzati, ambienti, controlli di accesso basati sui ruoli e supporto prioritario. Enterprise richiede un preventivo, con conservazione ed esportazione personalizzate, supporto e accordi di deployment on-prem o hosted.

Un punteggio è un output valutato, prodotto da un modello giudice, da una valutazione automatizzata o da un valutatore personalizzato in codice. L'addebito per memorizzare o elaborare quel punteggio è distinto dal calcolo che l'ha prodotto. I crediti per i modelli inclusi hanno un ambito specifico: non rimborsano la fattura del fornitore di qualsiasi applicazione.

Nello scenario con 5 GB e 10,000 punteggi, la fattura Starter è di $16 per l'eccedenza dei dati, senza eccedenza dei punteggi. Pro costa $249 prima di ulteriori consumi. Se l'esigenza immediata è condividere un dataset, esperimenti e trace entro i limiti funzionali del piano gratuito, il passaggio da $249 deve essere giustificato da una funzionalità o dalla conservazione.

Quando iniziano a pesare le tariffe a consumo più basse?

Con 100,000 punteggi/mese e gli stessi 5 GB di dati elaborati, Starter costa $241 e Pro $324, prima dell'uso dei modelli e delle estensioni di conservazione. La tariffa unitaria più bassa di Pro non compensa automaticamente il canone fisso.

A parità di questa ipotesi sui byte, il pareggio basato soltanto sui consumi è a 183,000 punteggi/mese, quando entrambi i piani arrivano a $448.50. Il calcolo esclude le differenze nei crediti per i modelli, nella conservazione e nelle funzionalità, che possono giustificare un passaggio anticipato. È una soglia per il budget, non un invito a rimandare controlli di accesso utili.

La domanda operativa è quali controlli valgano il loro costo. Un workflow di assistenza può richiedere una verifica deterministica degli argomenti degli strumenti a ogni esecuzione e una revisione della qualità della risposta tramite modello su un campione. Sono controlli con finalità e costi di calcolo diversi. Mantieni un dataset noto per i rilasci, poi campiona la produzione per scoprire errori che il dataset non aveva previsto.

Non considerare un punteggio medio alto come una decisione di rilascio completa. Raggruppa gli esempi per workflow ed esito, così un miglioramento sulle risposte facili non nasconde una regressione sull'azione difficile che conta per i clienti. È un criterio editoriale di valutazione, non l'affermazione che una piattaforma fornisca automaticamente una griglia di valutazione corretta.

Ingestione OTel e hosting commerciale del data plane

L'integrazione OpenTelemetry documenta un exporter di trace OTLP, un processore di span Braintrust, un exporter di log e l'inoltro dei log tramite Collector. L'endpoint API di base è https://api.braintrust.dev/otel; autenticazione e header x-bt-parent=project_id:... indirizzano i dati al progetto previsto. Gli endpoint specifici per segnale includono il percorso delle trace o dei log. Il pacchetto separato @braintrust/otel supporta l'integrazione JavaScript documentata.

Usa le istruzioni di mappatura dei campi dell'integrazione per verificare input, output e metadati dopo l'ingestione. Il fatto che vengano accettati sia una riga di log sia uno span applicativo non li rende record di valutazione equivalenti. Verifica quale oggetto diventerà l'input dell'esperimento che vuoi eseguire.

I piani di deployment riservano BYOC e self-hosting a Enterprise. Si acquista una piattaforma commerciale, non una licenza di backend open source. Più precisamente, la guida architetturale mantiene il control plane, inclusi interfaccia, autenticazione e metadati di gestione, nel SaaS di Braintrust. Il data plane, dove risiedono trace, dataset e altri dati AI, può essere eseguito nel proprio account cloud. Il browser comunica direttamente con quel data plane.

Questa distinzione può decidere alcuni acquisti. Controllare dove risiedono prompt e output può soddisfare un requisito sulla localizzazione dei dati, mantenendo però una dipendenza dal control plane del fornitore. Un'organizzazione che richiede ogni componente del prodotto offline dovrebbe confrontare questa architettura con l'opzione air-gapped documentata di Phoenix prima di firmare.

I punti di forza
Cosa fa bene
8 points

  • Starter supporta uno spazio di valutazione condiviso senza costi per utente
  • Le quote di dati elaborati e punteggi rendono visibili componenti separate del budget
  • Pro offre un ampliamento chiaro delle funzionalità per grafici, ambienti, accessi e conservazione
  • I percorsi OTel documentati possono accettare un flusso di strumentazione già esistente
  • Payload grandi e volume dei punteggi generano addebiti a consumo distinti
  • Le tariffe unitarie inferiori di Pro non compensano sempre l'abbonamento da $249
  • Il calcolo dei modelli giudici e una conservazione più lunga richiedono un budget separato
  • Il self-hosting dello storage dei dati non sposta il control plane SaaS nella tua infrastruttura

6. Datadog Agent Observability: per chi usa già Datadog nelle operations

Datadog Agent Observability è il nome attuale dato dal fornitore al prodotto comunemente cercato come Datadog LLM Observability; è soprattutto adatto a un team che già indaga gli incidenti applicativi in Datadog. Un timeout di un agente di assistenza può nascere da una chiamata al modello, da un servizio lento o da un problema nella sessione utente. Il valore della piattaforma sta nel collegare il record dell'agente a quel contesto operativo più ampio. I vincoli sono l'impegno contrattuale e la conservazione, oltre al costo degli altri prodotti Datadog eventualmente necessari. Sceglilo se le persone responsabili dell'incidente lavorano già in Datadog e il contesto condiviso cambia il modo di indagare.

Prezzi Datadog Agent Observability con le quote di span LLM dei piani Free e Pro
Datadog Agent Observability

Ideale per: Un team SRE o di piattaforma che collega gli errori AI agli incidenti applicativi e infrastrutturali
Punto di forza: Fatturazione degli span LLM anziché di ogni operazione di recupero, strumento o workflow
Prezzi: Pro $160/mese con impegno annuale, $200 mese per mese o $240 on-demand, più span LLM aggiuntivi
Prova gratuita: Free include 40,000 span LLM/mese; la pagina dei prezzi offre anche l'iscrizione a una prova

Prezzi di Datadog LLM Observability

La pagina attuale dei prezzi indica Free a $0, con 40,000 span LLM/mese, 15 giorni di conservazione delle trace, contesto e valutazioni illimitati e accesso a tutte le funzionalità. Pro include 100,000 span LLM/mese, sempre con 15 giorni di conservazione delle trace. Il prezzo di base è $160/mese con fatturazione annuale, $200 mese per mese o $240 on-demand.

Gli span LLM aggiuntivi costano $3.50 ogni 10,000 alla tariffa annuale, $4.20 mese per mese o $5 on-demand. Per 200,000 span LLM, i totali dello scenario sono rispettivamente $195, $242 e $290. Confronta esplicitamente gli impegni: il prezzo in evidenza con tariffa annuale non coincide con la fattura mese per mese.

L'unità fatturabile è una chiamata al modello, non ogni operazione della trace. Il fornitore dichiara che gli span di strumenti, recupero delle informazioni e workflow circostante non vengono fatturati come span LLM. Con due chiamate al modello per esecuzione, la quota Free corrisponde a 20,000 esecuzioni complete, nel rispetto delle altre condizioni del piano. Più strumentazione degli strumenti non implica necessariamente più span LLM fatturabili; un ciclo di ragionamento che richiama ripetutamente il modello, invece, sì.

La conservazione estesa è disponibile, ma la pagina pubblica non offre una tariffa da usare in questo confronto. Fatti quotare il requisito quando devi indagare incidenti più vecchi. Un record completamente strumentato ma già scaduto non può aiutarti in una successiva contestazione di un cliente.

Datadog AI Observability nello stack operativo esistente

Agent Observability si può acquistare separatamente; il fornitore dichiara che non servono altri abbonamenti Datadog. La pagina dei prezzi descrive anche il valore aggiuntivo della correlazione con APM, monitoraggio dell'infrastruttura e Real User Monitoring quando si usano questi prodotti. Chi parte da zero dovrebbe metterli a budget separatamente, senza presumere che l'abbonamento di osservabilità comprenda il resto di Datadog.

Il prodotto include dataset, esperimenti, valutazioni, annotazioni e dashboard in tutti i piani pubblicati. La vista dei costi suddivide i consumi per fornitore, modello e identità o versione del prompt, con costi disponibili su trace e span. Il responsabile dell'incidente può così distinguere un aumento del traffico da un cambiamento nel lavoro svolto dai modelli per l'applicazione.

Un responsabile di piattaforma dovrebbe rendere concreta la correlazione durante una verifica di adeguatezza. Parti da un'esecuzione dell'agente fallita e segui la richiesta fino al servizio responsabile della risposta dello strumento. Controlla che l'identità della trace si mantenga oltre quel confine e che l'operatore distingua la latenza del modello dal tempo trascorso altrove. È questo il processo che stai acquistando; un grafico isolato della spesa non ne dimostrerebbe il valore.

Licenza SaaS e OpenTelemetry

Datadog fornisce il prodotto come servizio SaaS commerciale secondo il proprio contratto di abbonamento. Le condizioni indicano il MSA come accordo che disciplina il servizio hosted. La pagina attuale dei prezzi del prodotto non offre un backend Agent Observability self-hosted. Gestire autonomamente un Datadog Agent o un OTel Collector non significa ospitare lo storage, l'interfaccia e la piattaforma di valutazione.

La guida OpenTelemetry accetta trace che seguono le convenzioni semantiche GenAI 1.37 o successive, oppure le convenzioni OpenInference supportate. Documenta l'ingestione diretta senza richiedere Datadog Agent o Agent Observability SDK. L'exporter mostrato usa OTLP/HTTP protobuf, con gli header dd-api-key e dd-otlp-source=llmobs.

Le valutazioni esterne hanno un dettaglio di integrazione specifico: per gli span OTel, la documentazione richiede il tag source:otel e gli ID di trace e span come stringhe decimali. Gli ID OTel nativi sono esadecimali e vanno quindi convertiti prima dell'invio. Verifica una valutazione su una trace nota, senza presumere che la compatibilità del tracing renda automatico anche il collegamento delle valutazioni.

I punti di forza
Cosa fa bene
8 points

  • Soltanto gli span LLM alimentano il contatore di volume pubblicato; quelli di strumenti e recupero delle informazioni sono esclusi
  • Gli operatori già attivi in Datadog possono collegare i record degli agenti al contesto di produzione più ampio
  • Free e Pro includono le funzionalità di valutazione e sperimentazione elencate
  • L'ingestione OTel diretta è documentata senza richiedere un Datadog Agent
  • La tariffa pubblicizzata più bassa richiede un impegno annuale
  • La conservazione delle trace inclusa è di 15 giorni in entrambi i piani pubblicati
  • Gli altri servizi Datadog restano acquisti separati
  • Il prodotto è un backend commerciale hosted, anziché un server di osservabilità self-hosted

Quale scegliere in base alle dimensioni del team?

Scegli prima in base a chi deve agire sui record, poi in base al contatore che cresce insieme all'applicazione. Il numero di persone è un dato per il budget, non sostituisce la necessità di sapere se il responsabile sia uno sviluppatore, un responsabile AI di prodotto o chi gestisce gli incidenti.

Uno o due sviluppatori: Parti dalla quota gratuita che permette di completare la prima revisione della produzione. Langfuse Hobby offre una vista condivisa per due persone, anche se le sue 50,000 unità si esauriscono rapidamente quando un'esecuzione emette più operazioni. LangSmith Developer è adatto a un utente. Braintrust Starter è interessante se l'obiettivo è già mantenere un dataset e verificare i rilasci con punteggi. Phoenix è adatto se scegli consapevolmente di gestire il backend.

Da tre a dieci persone: Langfuse Core è la scelta di partenza quando più sviluppatori e un responsabile di prodotto hanno bisogno di accesso abituale. Braintrust Starter può costare meno se i suoi limiti di dati, punteggi, conservazione e funzionalità sono adatti a un processo centrato sulla valutazione. Helicone Pro giustifica il canone quando gateway e monitoraggio delle richieste fanno parte dell'acquisto. LangSmith Plus giustifica il costo per utente quando i revisori usano attivamente il suo ciclo di sviluppo.

Un gruppo di revisione più ampio, con funzioni diverse: Conta ogni utente LangSmith a pagamento prima di aggiungere al workspace persone della qualità, del prodotto o dell'assistenza. I piani con utenti illimitati possono mantenere stabile l'abbonamento mentre aumenta la partecipazione. Restano comunque da gestire i volumi di trace, byte e punteggi. La scelta cambia quando il processo specifico di una piattaforma fa risparmiare più lavoro di revisione o evita più errori ripetuti di quanto costi la differenza di abbonamento.

Un team SRE o di piattaforma già attivo in Datadog: Preferisci Datadog quando un incidente dell'agente va indagato insieme ai servizi e alle sessioni utente. Responsabilità già definite e contesto delle trace possono rendere meno utile una console specialistica separata. Il suo contatore, più limitato perché riguarda soltanto gli LLM, merita attenzione anche quando l'agente esegue molte operazioni che non coinvolgono modelli.

Un requisito di hosting privato: Phoenix e Langfuse offrono scelte di licenza e deployment sostanzialmente diverse; Helicone aggiunge un'opzione con licenza Apache. Il self-hosting di LangSmith e Braintrust richiede accordi enterprise commerciali. Il data plane di Braintrust gestito dal cliente usa comunque il control plane del fornitore. Decidi cosa deve restare nella tua infrastruttura prima di stabilire quale piano sia economico.

La regola esplicita è semplice: paga per il processo che cambia una decisione di produzione, poi prevedi i record e le persone che quel processo coinvolge. Se non sai indicare quella decisione, comincia con un rollout più circoscritto.

Supporto OpenTelemetry: controllare il percorso e i campi

Il supporto OpenTelemetry è utile soltanto se i campi importanti dell'applicazione arrivano integri dopo l'ingestione. OTel è un sistema standard di strumentazione; OTLP è il protocollo usato per inviarne la telemetria. Un flusso di span può essere trasmesso correttamente anche se al backend mancano identità del modello, consumi, contesto del cliente o relazione tra uno strumento e chi lo chiama.

I percorsi documentati sono diversi. Langfuse accetta HTTP JSON o protobuf sul proprio endpoint OTLP e dichiara che gRPC non è supportato. LangSmith accetta tracing OTel con mappatura di attributi GenAI, OpenInference e altri, e documenta l'invio a più destinazioni tramite Collector. Phoenix accetta OTLP e usa la strumentazione OpenInference. Braintrust documenta percorsi di ingestione per trace, processori di span e log. Datadog specifica le convenzioni GenAI o OpenInference supportate. Helicone documenta l'integrazione asincrona OpenLLMetry; la guida citata non dimostra la disponibilità di un ricevitore OTLP generico per Collector.

Per verificare l'adeguatezza della soluzione, conserva un'esecuzione rappresentativa lungo l'intero percorso. Controlla relazioni padre-figlio, nome del modello, token, costi, policy di input/output e metadati di rilascio. Se partecipano due servizi, verifica che il contesto passi dall'uno all'altro. Se la piattaforma raggruppa le conversazioni in sessioni, controlla l'identificativo della sessione senza presumere che un ID di trace comune copra l'intera conversazione.

Controlla con attenzione la variabile dell'endpoint. Un endpoint di base condiviso e un endpoint delle trace specifico per segnale sono forme di configurazione diverse. Segui le istruzioni del fornitore su regione, autenticazione e percorso. Poi verifica il record nel progetto di destinazione: una risposta HTTP riuscita dimostra che i dati sono stati accettati, non che siano attribuiti correttamente al contesto di business.

Infine, conta i percorsi di esportazione duplicati. Un callback del framework e una libreria separata di strumentazione automatica possono osservare la stessa chiamata al modello. Prima di segnalare un picco di costi, verifica se hai aggiunto lavoro del modello oppure lo hai registrato due volte. Il confronto sull'analisi degli errori aiuta a collegare la trace risultante a una domanda concreta di debugging.

Quali acquisti evitare?

Evita un acquisto inadatto al lavoro da svolgere, anche quando il prodotto merita di entrare nella selezione. Questi sono casi precisi di mancata corrispondenza con il modello di fatturazione o di gestione documentato.

  • LangSmith Plus soltanto per condividere una schermata dei costi: Lo scenario con cinque persone costa $645 prima delle estensioni di conservazione e del calcolo delle valutazioni. Paga questa cifra se il processo di miglioramento fa parte del lavoro; una lista più ampia di revisori deve avere uno scopo chiaro.
  • Braintrust Pro per valutazioni leggere che rientrano in Starter: La fattura Starter dello scenario è di $16, contro $249 su Pro. Scegli consapevolmente il passaggio per funzionalità, conservazione o supporto.
  • Stime di acquisto con «Phoenix a $50»: Quel prezzo appartiene ad AX Pro. Al volume dell'esempio, la quota pubblica di span AX è insufficiente e non viene pubblicata una tariffa per l'eccedenza. L'infrastruttura Phoenix da gestire richiede un budget diverso.
  • Helicone Hobby per un worker di produzione con forti picchi: La quota mensile di 10,000 richieste non elimina il limite pubblicato di ingestione di 10 log/minuto. Verifica l'andamento del traffico prima di affidarti al piano gratuito.
  • Il prezzo annuale in evidenza di Datadog per approvare un budget mensile: $160 è il prezzo di base alla tariffa annuale; la base mese per mese è $200 e il totale dello scenario a tariffa mensile è $242.
  • Qualsiasi opzione self-hosted senza un responsabile: Una licenza gratuita non assegna la responsabilità del ripristino dei backup, degli aggiornamenti o dell'accesso ai dati. Anche un «data plane self-hosted» commerciale non trasferisce automaticamente l'intero prodotto nel tuo ambiente.

Un grafico dei costi che sembra preciso ma omette consumi è un controllo di budget debole. Confronta i consumi del fornitore per una richiesta nota con il record memorizzato e riconcilia il totale con la fattura che paghi davvero. Una piattaforma di osservabilità spiega la spesa; una politica di arresto deve influenzare l'azione successiva dell'applicazione.

Da fare lunedì: trasformare un errore in un test di rilascio

Aggiungi la strumentazione a un workflow di valore e rendi ripetibile un errore noto prima di ampliare il rollout. Un assistente di supporto che ripete la ricerca di un ordine, sceglie il documento sbagliato o prepara un rimborso non autorizzato è un buon candidato, perché il responsabile può indicare il comportamento atteso.

Un connettore difettoso passa da un errore isolato in produzione a un esempio conservato in un dataset e a un indicatore di test per il rilascio
Conserva l'esempio fallito, poi usa lo stesso input per verificare il rilascio successivo.

Indica il responsabile del workflow, l'identificativo del rilascio e il risultato di business. Acquisisci l'esecuzione completa, analizza le operazioni del modello e degli strumenti e verifica i campi dei consumi. Controlla cosa succede quando l'exporter è lento o termina un worker di breve durata. La prima prova di adozione è capire se i record arrivano con un contesto sufficiente a rispondere alla domanda del responsabile.

Poi inserisci l'errore noto in un dataset, con un risultato atteso chiaro. Potrebbe essere «non promettere un rimborso senza l'approvazione dello strumento» oppure «cita la policy recuperata che si applica a questo cliente». Usa un controllo tramite codice quando la regola è deterministica e una griglia di qualità sottoposta a revisione quando serve un giudizio. Conserva input e regola, così una modifica al prompt o al modello affronta in seguito lo stesso test.

Rendi esplicito il criterio che autorizza il rilascio. Una media sufficiente non deve nascondere un errore nell'azione che vuoi proteggere. Rivedi l'esito del caso difficile identificato e analizza la trace quando fallisce. Poi campiona la produzione per trovare nuovi casi da aggiungere al dataset.

Prima di decidere il prossimo abbonamento, registra i tuoi numeri effettivi: conteggio delle trace, operazioni per trace, chiamate al modello, punteggi memorizzati, byte elaborati o conservati, revisori e necessità di conservazione. Ricalcola la fattura usando quei dati. Il risultato utile della prima settimana è un workflow corretto e un budget giustificabile, con una persona indicata come responsabile di ciascuno.

Domande frequenti

Qual è lo strumento migliore per l'osservabilità AI?

Langfuse è la scelta di partenza per un piccolo team in produzione che deve condividere tracing e costi. Braintrust è adatto a decidere i rilasci tramite valutazioni, Phoenix a un backend privato gestito internamente e Datadog a un processo operativo già esistente. Il responsabile e i confini del deployment determinano quale specialista debba sostituire la scelta di partenza.

Quali metriche si usano per l'osservabilità degli LLM?

Segui token e costi del fornitore, latenza, errori, nuovi tentativi, esiti del recupero delle informazioni e degli strumenti, e risultati delle valutazioni. Raggruppali per cliente, workflow e rilascio. Il costo per risultato di business riuscito è più utile del totale dei token quando esecuzioni fallite e nuovi tentativi assorbono una spesa rilevante.

Quali sono i 3 principali strumenti di osservabilità?

Per i tre ruoli di produzione di questo confronto, scegli Langfuse per il tracing condiviso di uso generale, Braintrust per il lavoro di prodotto guidato dalle valutazioni e Datadog per il contesto operativo. È una selezione basata sui ruoli, non una dichiarazione di superiorità misurata su ogni funzionalità o deployment.

Quali strumenti open source esistono per la LLM observability?

Il core di Langfuse ha licenza MIT e il repository Helicone ha licenza Apache 2.0. Phoenix è disponibile gratuitamente in self-hosting, ma il backend usa Elastic License 2.0 con restrizioni sui servizi hosted. Controlla la licenza effettiva del backend, senza considerare permissiva quella di ogni prodotto descritto come open source.

A cosa servono gli strumenti di LLM observability?

Registrano come è stata eseguita un'applicazione basata su un modello linguistico di grandi dimensioni, comprese chiamate ai modelli, strumenti, recupero delle informazioni, tempi, consumi e controlli degli output. Il risultato utile è un'esecuzione fallita di cui si possono ricostruire le cause, che può guidare una correzione e diventare un test di rilascio ripetibile.

Quanto costa Langfuse?

Verificato il 5 ottobre 2026: Hobby è gratuito, Core costa $29/mese, Pro $199/mese ed Enterprise $2,499/mese. L'add-on opzionale Teams per Pro costa $300/mese. I piani a pagamento aggiungono consumi per trace, osservazioni e punteggi; lo scenario da 610,000 unità costa $69.80 su Core.

Si può usare Langfuse gratis?

Sì. Hobby include 50,000 unità al mese, due utenti e 30 giorni di accesso ai dati. Puoi anche gestire autonomamente il core con licenza MIT senza costi di licenza software, pagando e gestendo però l'infrastruttura. Le funzionalità enterprise commerciali hanno condizioni separate.

Quali sono le alternative a Langfuse?

LangSmith è adatto a un ciclo di miglioramento con LangChain o LangGraph; Helicone al monitoraggio delle richieste tramite gateway; Phoenix a un backend privato; Braintrust a dataset e rilasci guidati dalle valutazioni; Datadog agli incidenti degli agenti in uno stack operativo già esistente. Prima di cambiare piattaforma, confronta il contatore effettivo e le esigenze di conservazione.

Langfuse si può eseguire in locale?

Sì. Langfuse documenta il self-hosting basato su Docker e fornisce guide di deployment per il core con licenza MIT. Avviarlo in locale non garantisce backup di produzione, disponibilità o un responsabile degli aggiornamenti. Definisci questi requisiti se l'installazione diventerà il servizio di tracing della produzione.

Ottieni la checklist per l'audit dei workflow aziendali AI per identificare workflow, responsabile, risultato e punto di controllo prima di ampliare gli strumenti usati in produzione.

Ultimo aggiornamento
5 ott 2026
Categoria
Build

Preferisca questo sito su Google

Aggiungi omidsaffari.com come fonte preferita nella Ricerca Google

Segni omidsaffari.com come fonte preferita e Google lo mette in evidenza per lei in Top Stories, AI Overviews e AI Mode.

OpenCode: dal primo avvio a una modifica verificata

OpenCode: dal primo avvio a una modifica verificata

Installa OpenCode, collega i tuoi modelli e affronta un bug reale. Guida a AGENTS.md, plugin e costi API e Zen, con un metodo per verificare ogni modifica.4 ott 2026Build
Netlify hosting: quanto costano piani e crediti nel 2026

Netlify hosting: quanto costano piani e crediti nel 2026

Quanto costa Netlify? Confronta Free, Personal e Pro e calcola i crediti per un sito aziendale, un’app Next.js o un’agenzia, con esempi di budget mensile.4 ott 2026Build
Softr: recensione, costi e scelta del piano a ottobre 2026

Softr: recensione, costi e scelta del piano a ottobre 2026

Recensione di Softr per portali clienti e strumenti interni: prezzi mensili e annuali, limiti di utenti e record, funzioni IA e guida alla scelta del piano.4 ott 2026Build
Claude Code gratis? Alternative da terminale e costi nel 2026

Claude Code gratis? Alternative da terminale e costi nel 2026

Cerchi Claude Code gratis? Confronta OpenCode, Codex CLI, Pi e Gemini CLI: costi dei modelli, limiti degli abbonamenti e cosa serve per cambiare agente.4 ott 2026Build
Server MCP: quando serve un gateway e quanto costa

Server MCP: quando serve un gateway e quanto costa

Come gestire gli accessi ai server MCP con un gateway: quando serve a un piccolo team, quali controlli verificare e quanto costano Cloudflare, Docker e Lasso.4 ott 2026Build
OpenAI API pricing 2026: tre budget per scegliere il modello

OpenAI API pricing 2026: tre budget per scegliere il modello

Quanto costano le API OpenAI? Prezzi di GPT-6.1 Sol, Luna e Astra, tre budget mensili e costi di ricerca, container, voce e immagini, tutti in USD.3 ott 2026Build
Pi Coding Agent: installazione e prima prova con Pi 1.0

Pi Coding Agent: installazione e prima prova con Pi 1.0

Configura Pi 1.0, collega il modello che già usi e completa una prima attività. Guida a installazione, AGENTS.md, costi dei provider e limiti pratici.3 ott 2026Build
Agenti AI senza codice: 8 piattaforme a confronto nel 2026

Agenti AI senza codice: 8 piattaforme a confronto nel 2026

Confronta 8 piattaforme per creare agenti AI senza codice: prezzi, crediti, integrazioni e limiti per scegliere lo strumento adatto al tuo lavoro.1 ott 2026Build
Newsletter

Una lettera, ogni domenica.Sistemi che funzionano, non hot take.

Settimanale. Niente spam. Si cancella quando vuole.