I 10 migliori AI gateway per app multi-modello nel 2026
Confronto tra 10 AI gateway per app multi-modello: prezzi, limiti, routing e governance per scegliere tra LiteLLM, Vercel, Portkey e altre soluzioni.

LiteLLM è il miglior AI gateway in assoluto per un'app multi-modello, a condizione che ci sia un responsabile di piattaforma in grado di gestirlo; Vercel AI Gateway è invece la scelta gestita più equilibrata. L'accordo da oltre $8 miliardi che, secondo le indiscrezioni, porterà Stripe ad acquisire OpenRouter chiarisce il requisito decisivo: in produzione serve un gateway che l'app possa escludere senza dover essere riscritta.
Il 17 agosto 2026 Axios ha riferito che Stripe avrebbe raggiunto un accordo per acquisire OpenRouter per oltre $8 miliardi, tra contanti e azioni. La testata ha anche precisato che le aziende non avevano rilasciato commenti e che si attendeva ancora un annuncio ufficiale. È una distinzione importante, ma la lezione operativa resta valida anche se l'operazione non si conclude: un gateway elimina il lock-in verso i fornitori di modelli solo se non diventa, a sua volta, il nuovo lock-in.
Risposta breve: quale AI gateway scegliere?
LiteLLM è la scelta giusta per mantenere il controllo, Vercel AI Gateway per la semplicità di un servizio gestito, Portkey per la governance enterprise e OpenRouter solo quando l'ampiezza del catalogo vale una commissione percentuale e una dipendenza in più. Un AI gateway è il livello che gestisce le richieste tra l'applicazione e i provider dei modelli. Può uniformare le API, custodire le credenziali, instradare il traffico, riprovare le chiamate fallite, registrare i costi e applicare le policy.
Prezzi e limiti di prodotto riportati di seguito sono stati verificati sulle pagine ufficiali dei singoli fornitori il 18 agosto 2026. La classifica comprende 10 prodotti e valuta soprattutto il primo vero ostacolo che ciascuno presenta in produzione, non il numero di funzionalità che entra in una scheda commerciale.
La prima decisione non riguarda il numero di funzioni, bensì chi controlla il percorso delle richieste. Un gateway self-hosted mantiene processo, credenziali, database, log e policy nell'ambiente aziendale, ma affida al team anche la reperibilità operativa. Un gateway gestito elimina questo carico; in compenso, ogni chiamata a un modello dipende dai suoi disservizi, dalle variazioni di prezzo, dalle acquisizioni e dalla roadmap del prodotto.
La soglia economica è più netta di quanto lascino intendere le pagine delle funzionalità. Supponiamo che un gateway self-hosted richieda otto ore al mese al team di piattaforma, a un costo complessivo di $150 l'ora. Ne risulta un costo operativo indicativo di $1,200 al mese, non un prezzo dichiarato da un fornitore. Una commissione del 5.5% raggiunge $1,200 quando la spesa mensile per i modelli arriva a $21,818; con il 5%, la soglia è $24,000.

Questo calcolo copre soltanto la voce di budget. Un vincolo di deployment, un percorso dati regolamentato, un contratto diretto con il provider o l'obbligo di avere un audit trail possono giustificare il self-hosting ben prima del pareggio economico. Al contrario, una piccola startup non dovrebbe creare un'attività interna di piattaforma per risparmiare una commissione inferiore al costo di una giornata di un ingegnere.
Perché il gateway è diventato una voce di budget e un piano d'uscita
Il valore di un gateway nasce dalla rapidità con cui cambiano i modelli; il rischio emerge quando l'applicazione non può più funzionare senza quel gateway. La notizia su OpenRouter arriva meno di tre mesi dopo che Palo Alto Networks ha completato l'acquisizione di Portkey, annunciando che Portkey sarebbe diventato una componente centrale di Prisma AIRS. In un solo trimestre, due control plane indipendenti possono entrare in piattaforme più grandi. In questa categoria i cambi di proprietà vanno considerati prevedibili, non casi limite.
La conseguenza per il business è la concentrazione. Un'applicazione multi-modello può usare OpenAI per un workflow, Anthropic per un altro e un modello open per un processo in background ad alto volume. Collocare tutti e tre dietro un unico gateway semplifica codice, fatturazione, policy e osservabilità. Significa però anche che una sola variazione di prezzo o di policy può coinvolgerli tutti contemporaneamente.
L'architettura prudente si compone di tre livelli:
- Un client interno per i modelli definisce il ristretto insieme di operazioni necessarie all'app, come generazione di testo, output strutturato, embedding e uso di tool.
- Un adapter per il gateway traduce queste operazioni per il gateway scelto senza propagare header proprietari nel resto del codebase.
- Un adapter diretto verso il provider rimane configurato e documentato, anche se normalmente non riceve traffico di produzione.
Questa struttura rende possibile quella che nella guida chiameremo uscita in 10 minuti: tramite configurazione e un deployment controllato, un operatore deve poter deviare un workload di produzione fuori dal gateway senza modificare la logica di business. I dieci minuti sono un obiettivo operativo editoriale, non uno SLA del fornitore. Se per aggirare il gateway occorre riscrivere il client, riprogettare l'identità o migrare tutti i nomi dei modelli, il gateway controlla una quota dell'applicazione persino maggiore dei provider stessi.
È anche il motivo per cui una funzione come il fallback automatico va analizzata con attenzione. Il fallback è utile soltanto se conserva il protocollo di risposta, lo schema dei tool, la policy sui dati e il perimetro di costo attesi dall'applicazione. Anche una risposta HTTP riuscita da un modello diverso può rappresentare un errore applicativo, se cambia l'output strutturato o se la tool call non è compatibile.
Per approfondire il livello di inferenza sotto il gateway, il confronto tra le API AI più economiche separa il prezzo del modello dalla commissione di routing. Se invece il caso d'uso immediato riguarda strumenti per sviluppatori e non un'applicazione rivolta ai clienti, la guida più specifica agli AI gateway per coding agent tratta configurazione dei coding agent e attribuzione nel repository.
Come abbiamo selezionato questi AI gateway
La classifica premia la reversibilità e l'aderenza operativa prima dell'ampiezza del catalogo. Disporre di centinaia di modelli è utile nella fase esplorativa, ma conta poco quando un'applicazione in produzione si stabilizza su tre route approvate.
Ogni gateway è stato valutato secondo cinque criteri:
- Portabilità: l'app può mantenere account dei provider, nomi dei modelli, policy e percorso diretto sotto il proprio controllo?
- Resilienza deterministica: gli operatori possono controllare retry, ordine dei provider, comportamento del fallback e condizioni che interrompono una richiesta?
- Visibilità dei costi: è possibile attribuire la spesa a un'applicazione, un cliente, un team o una chiave e prevedere la commissione dai prezzi pubblici?
- Perimetro di governance: il gateway soddisfa i requisiti dell'acquirente per deployment, identità, retention, audit e residenza dei dati?
- Maturità operativa: il gateway è disponibile in versione generale, supportabile, osservabile e prezzato in modo coerente con la fase in cui verrà adottato?
Questo lavoro ha verificato prezzi e documentazione; non è una prova prodotto mascherata. Non dichiariamo di aver effettuato deployment reali, test di carico o sottoscrizioni. Ogni piano, limite e funzionalità specifica proviene da una pagina del fornitore consultata il 18 agosto 2026; i confronti di costo sono semplici calcoli applicati a quei dati.
La selezione è stata circoscritta ai prodotti che oggi possono inserirsi nel percorso delle richieste di un'app multi-modello. Il catalogo di modelli di un singolo cloud può comunque essere la piattaforma giusta, ma non offre routing neutrale. E un prodotto presente soltanto in roadmap non può superare in classifica un gateway che l'acquirente può già distribuire e prezzare.
1. LiteLLM: il migliore in assoluto per un control plane gestito dall'app
LiteLLM è il miglior AI gateway in assoluto quando un responsabile di piattaforma ben identificato può occuparsene. Il proxy open source espone 100+ provider attraverso un'unica API compatibile con OpenAI e comprende chiavi virtuali, team, monitoraggio della spesa, budget, rate limit, fallback, log di richieste e risposte e metriche Prometheus.

Ideale per: aziende di prodotto che richiedono un gateway self-hosted e controllato dall'app
Punto di forza: ampio supporto dei provider, con budget, chiavi, fallback e metriche nel piano OSS da $0
Prezzi: Open Source $0; Enterprise annuale e su preventivo in base a capacità, architettura e supporto
Prova gratuita: 30 giorni di Enterprise senza carta di credito; OSS rimane gratuito
La pagina dei prezzi di LiteLLM definisce con chiarezza il confine del software. Open Source è gratuito per il self-hosting in produzione. Enterprise non applica un prezzo per token: il preventivo annuale dipende dalla capacità di richieste, dall'architettura di deployment e dalle esigenze di supporto. Il piano Enterprise aggiunge SSO e SCIM, autenticazione OIDC o JWT, audit log, integrazioni con secret manager, rotazione delle chiavi, un control plane multi-regione, deployment air-gapped e supporto fino a 24/7.
L'etichetta $0 è corretta, ma non racconta tutto. Il team si assume la responsabilità di proxy, Postgres, segreti, scalabilità, aggiornamenti, modifiche alle API dei provider, archiviazione dei log, dashboard e incidenti. Con l'ipotesi indicativa di otto ore a $150, questa responsabilità costa $1,200 al mese prima dell'infrastruttura. LiteLLM supera economicamente una commissione del 5.5% oltre $21,818 di spesa mensile per i modelli, ma un deployment regolamentato può sceglierlo molto prima per ragioni di controllo anziché di risparmio.
Il quickstart Docker documentato avvia gateway e Postgres con curl -sSL https://docs.litellm.ai/docker-compose.yml | docker compose -f - up -d, quindi rende disponibile l'interfaccia di amministrazione sulla porta 4000. È un buon percorso di valutazione, non un progetto completo per la produzione. La stessa guida avverte che il valore segnaposto LITELLM_SALT_KEY deve essere sostituito prima di salvare credenziali permanenti e non deve più cambiare: le chiavi dei provider cifrate con il vecchio valore non possono essere recuperate con uno nuovo.
Il vero ostacolo in produzione è l'ambiguità sulla responsabilità. LiteLLM è un eccellente componente di piattaforma, ma un pessimo progetto secondario. Se il proxy appartiene a «chiunque lo abbia aggiunto», una modifica del provider può trasformare un singolo application engineer nel team del gateway, senza budget, reperibilità o policy di aggiornamento.
Partire da un deployment usa e getta
Usare il quickstart Docker Compose documentato in un account non di produzione. Verificare che gateway e Postgres si avviino, sostituire i segreti segnaposto e mantenere l'ambiente separato dal traffico dei clienti.
Esporre due route con un nome stabile
Aggiungere soltanto il modello principale e un fallback compatibile. Usare alias interni stabili come
support-primaryesupport-fallback, così il codice dell'applicazione non dipende dalla stringa pubblica usata da ogni provider per il modello.Emettere una chiave virtuale per l'applicazione
Creare una chiave virtuale per un unico servizio, con accesso ai modelli, budget mensile e rate limit dedicati. Non distribuire la chiave master di LiteLLM ai workload applicativi.
Mantenere un adapter diretto
Configurare lo stesso servizio affinché possa chiamare direttamente il provider principale tramite un feature flag. La route del gateway resta quella predefinita; quella del provider è il bypass già collaudato.
Provocare l'errore del modello principale
Attivare in modo controllato una route non disponibile, verificare che il fallback sia visibile nei log, quindi abilitare l'adapter diretto e cronometrare il passaggio. Se il bypass non rispetta l'obiettivo di uscita in 10 minuti, correggere l'astrazione prima di aggiungere traffico.
- Licenza OSS da $0 per la produzione, senza commissioni del gateway per token
- 100+ provider dietro un'unica API compatibile con OpenAI
- Chiavi virtuali, budget per team, rate limit, fallback, log e Prometheus inclusi in OSS
- Percorso dati self-hosted, con opzioni Enterprise air-gapped e multi-regione
- Prezzo Enterprise legato alla capacità, non alla spesa per i modelli
- Disponibilità, aggiornamenti, salute del database, segreti e incidenti restano in carico all'acquirente
- Il prezzo Enterprise non è pubblico
- La comodità del quickstart può nascondere il lavoro necessario per rendere il sistema adatto alla produzione
- Un proxy condiviso introduce un nuovo dominio di errore interno
2. Vercel AI Gateway: la migliore scelta gestita
Vercel AI Gateway è la migliore opzione gestita per un team di prodotto che cerca un solo endpoint senza rincari sui token. I controlli di routing includono filtri e ordine dei provider, fallback tra modelli e scelta del provider basata sui dati recenti di uptime e latenza.

Ideale per: startup e team di prodotto che vogliono adottare rapidamente un servizio gestito
Punto di forza: token ai prezzi di listino dei provider, senza rincaro del gateway
Prezzi: Free include $5 di credito mensile; Paid utilizza crediti acquistati ai prezzi di listino dei provider
Prova gratuita: piano Free continuativo sui modelli idonei, con limiti inferiori per ciascun modello
La pagina dei prezzi attuale separa nettamente l'offerta gratuita da quella a pagamento. Free include ogni mese $5 di credito. Acquistando crediti, l'account passa a Pay as you go: diventano disponibili tutti i modelli, aumentano i limiti e termina il credito mensile di $5. Entrambi i piani applicano i prezzi di listino dei provider senza rincari sui token.
Bring Your Own Key è disponibile soltanto dopo il passaggio dell'account a Paid. Vercel non applica commissioni del gateway su BYOK; tuttavia, una richiesta fallita con le proprie credenziali può essere riprovata con credenziali di sistema Vercel, addebitando il fallback sul saldo dei crediti del gateway. Questo comportamento aumenta la disponibilità, ma può smentire l'ipotesi finanziaria secondo cui tutto l'utilizzo resterà nel contratto diretto con il provider. Va verificato prima di usare BYOK come scorciatoia negli acquisti.
I token non hanno rincari, ma alcuni controlli sì. Custom Reporting costa $0.075 ogni 1,000 scritture e $5 ogni 1,000 query di reporting. Una allowlist dei provider estesa a tutto il team costa $0.10 ogni 1,000 richieste riuscite, mentre il filtro only applicato alla singola richiesta non comporta costi aggiuntivi. Anche la zero data retention per l'intero team costa $0.10 ogni 1,000 richieste. I trace drain costano $0.05 ogni 1,000 trace, più $0.50 per GB di traffico in uscita.
Su un milione di richieste, abilitare la allowlist per il team, la ZDR per il team e un trace per richiesta aggiunge $250 più il traffico in uscita dei trace. Per molte app è ancora una cifra contenuta rispetto alla spesa per i modelli, ma «nessun rincaro» non significa che ogni controllo sia gratuito.
Il limite è il controllo del deployment. Vercel gestisce il gateway: il suo data plane non gira nel cluster dell'acquirente. È la scelta giusta quando il confine del servizio gestito è accettabile e la rapidità operativa conta. LiteLLM o Bifrost sono preferibili quando il deployment privato è un requisito, non una semplice preferenza.
- Nessun rincaro sui token con Free, Paid e BYOK
- Credito Free mensile di $5 per un progetto pilota circoscritto
- Ordinamento e filtro dei provider, fallback e accesso gestito ai modelli
- Nessun gateway o database da gestire operativamente
- I controlli per provider e ZDR sulla singola richiesta possono evitare i supplementi estesi al team
- Nessun processo gateway self-hosted
- BYOK richiede l'acquisto di crediti
- Le chiamate BYOK fallite possono passare a credenziali Vercel soggette a pagamento
- Reporting, policy per il team e trace drain hanno contatori separati
3. Portkey: il migliore per la governance enterprise gestita
Portkey è la migliore soluzione gestita quando l'acquisto è motivato da policy, guardrail, budget e opzioni di deployment privato. Il gateway combina un'API universale con retry, timeout, fallback, bilanciamento del carico, caching, chiavi virtuali e osservabilità.

Ideale per: aziende mid-market ed enterprise che acquistano governance gestita
Punto di forza: un piano Production pubblico e un percorso Enterprise per cloud privato e hosting VPC
Prezzi: Open Source self-hosted; Developer $0; Production $49/mese; Enterprise su preventivo
Prova gratuita: Developer resta gratuito per prototipi e valutazioni
La pagina dei prezzi definisce con insolita chiarezza il confine tra i piani. Developer registra 10,000 log al mese, conserva i log per tre giorni e le metriche per 30 giorni; viene inoltre dichiarato esplicitamente non adatto alla produzione. Production costa $49 al mese, include 100,000 log registrati, addebita $9 per ogni ulteriore blocco di 100,000 fino a tre milioni, conserva i log per 30 giorni e le metriche per 90 giorni.
Con un milione di log registrati, Production costa $130 al mese: $49 di base più nove blocchi aggiuntivi da $9. È una cifra ancora accessibile per un'app in crescita. La stessa pagina sconsiglia Production quando servono controlli di sicurezza personalizzati o garanzie sulla residenza dei dati. Questi acquirenti passano a Enterprise, che offre 10 milioni o più di log registrati, retention personalizzata, SSO, budget e limiti granulari, cloud privato, hosting VPC, esportazioni verso data lake e compliance avanzata.
Il limite del prodotto non è la capacità tecnica, ma l'ampiezza dell'acquisto. Una startup a cui servono soltanto un base URL e un fallback ricava meno valore organizzativo di quello per cui Portkey è stato progettato. Un team di piattaforma con più applicazioni, policy sui modelli approvati, controlli PII e requisiti di audit può invece usare le stesse funzioni ogni settimana.
La proprietà merita una domanda specifica in fase di acquisto. Palo Alto Networks ha completato l'acquisizione di Portkey il 29 maggio 2026 e ha dichiarato che Portkey sarebbe diventato un AI Gateway centrale per Prisma AIRS. L'integrazione può rafforzare sicurezza e supporto enterprise, ma può anche cambiare packaging e priorità della roadmap. Occorre chiedere quale nome di prodotto comparirà sul contratto, come verranno trasferiti gli account indipendenti a Prisma AIRS e quale percorso di esportazione sopravvivrà a un futuro consolidamento.
- Percorsi Open Source, Developer gratuito, Production pubblico a $49 ed Enterprise privato
- Fallback, retry, timeout, bilanciamento del carico, caching, chiavi e osservabilità
- Limiti chiari per log e retention nei piani self-service
- Opzioni Enterprise per deployment e compliance
- Esempio prevedibile da $130 per un milione di log registrati
- Developer viene esplicitamente escluso dall'uso in produzione
- Production non è il piano per sicurezza personalizzata o garanzie di residenza
- Il prezzo Enterprise richiede un preventivo
- L'integrazione dopo l'acquisizione apre interrogativi su packaging e roadmap
4. Cloudflare AI Gateway: il migliore per controllare l'edge a basso costo
Cloudflare AI Gateway è la scelta più conveniente quando Cloudflare controlla già l'edge, la sicurezza o il runtime Workers dell'applicazione. Analisi, caching e rate limit di base sono gratuiti con tutti i piani.

Ideale per: app che usano già la rete e i controlli di sicurezza Cloudflare
Punto di forza: gateway di base da $0 con scansione DLP gratuita
Prezzi: funzioni base $0; l'acquisto di crediti con Unified Billing aggiunge il 5%; i guardrail seguono i prezzi Workers AI
Prova gratuita: le funzioni di base restano gratuite, senza scadenza
La documentazione aggiornata sui prezzi di Cloudflare assegna limiti di archiviazione concreti all'offerta gratuita. Workers Free conserva 100,000 log complessivi per tutti i gateway dell'account. Workers Paid ne conserva 10 milioni per gateway. La scansione DLP è gratuita, anche se un account privo di abbonamento Zero Trust riceve soltanto due profili DLP predefiniti. La valutazione dei guardrail viene addebitata separatamente come inferenza di token Workers AI.
Unified Billing applica il 5% quando si acquistano crediti, mentre l'inferenza di terze parti viene trasferita senza rincari sui token. Con $20,000 di crediti acquistati al mese, la commissione è di $1,000. Quel 5% riguarda i crediti comprati tramite Unified Billing, non il gateway di base da $0.
Prima del lancio va considerato anche un limite di throughput. La pagina dei limiti attuale limita il traffico Unified Billing a 200 richieste ogni 60 secondi per gateway e, oltre questa soglia, restituisce un errore 429. Il limite non si applica al traffico BYOK. Cloudflare limita inoltre i log archiviati a 500 al secondo per gateway, le richieste memorizzabili in cache a 25 MB, il TTL della cache a un mese e i metadati personalizzati a cinque elementi per richiesta.
Il vero limite è l'aderenza alla piattaforma circostante. Cloudflare è convincente per un team che conosce già il suo modello di account, i log, DLP, Workers e il comportamento dell'edge. Lo è molto meno se occorre adottare tutti questi concetti soltanto per evitare un abbonamento gateway da $49. Il gateway con il prezzo nominale più basso può generare il costo di integrazione più alto.
- Analisi, caching e rate limit di base a $0
- Scansione DLP gratuita con ogni piano
- Ottima integrazione con le operazioni edge e di sicurezza Cloudflare già esistenti
- Ampia capacità per i log nel piano a pagamento
- BYOK evita il limite di richieste di Unified Billing
- Unified Billing aggiunge il 5% all'acquisto dei crediti
- Unified Billing è limitato a 200 richieste ogni 60 secondi per gateway
- Nel piano Free i log si fermano a 100,000 per l'intero account
- Guardrail e profili DLP aggiuntivi possono comportare costi in prodotti adiacenti
5. OpenRouter: il miglior marketplace di modelli, ma non come unica route
OpenRouter è il gateway migliore quando la scelta di modelli e provider è ancora aperta. Il piano Pay as you go elenca 400+ modelli di 80+ provider dietro un unico account.

Ideale per: esplorare rapidamente modelli, confrontare provider e accedere a un catalogo ampio
Punto di forza: routing granulare dei provider per prezzo, throughput, latenza, policy e disponibilità
Prezzi: Free $0; Pay as you go con commissione di piattaforma del 5.5%; Enterprise su preventivo con sconti
Prova gratuita: piano Free con 25+ modelli, 4 provider e 50 richieste al giorno
La pagina dei prezzi presenta tre piani. Free offre 25+ modelli gratuiti di quattro provider, con un limite di 50 richieste al giorno. Pay as you go porta il catalogo a 400+ modelli e 80+ provider, alza i limiti globali e non impone una spesa minima; applica però una commissione di piattaforma del 5.5%. Enterprise mantiene il catalogo e aggiunge sconti sulle commissioni, fatturazione, SSO o SAML, SLA contrattuali e uno SLA di supporto con canale Slack condiviso.
Con BYOK cambia il confine delle commissioni. Pay as you go include ogni mese $25,000 di inferenza al prezzo di listino senza commissioni BYOK, quindi applica il 5%. Enterprise porta la franchigia a $200,000, dopodiché applica il 5%. Chi ha impegni diretti con i provider deve calcolare separatamente la franchigia BYOK e i crediti OpenRouter acquistati.
La profondità del routing è il punto di forza di OpenRouter. La sua documentazione sulla selezione dei provider spiega che il comportamento predefinito esclude i provider con disservizi significativi nei 30 secondi precedenti, poi assegna un peso ai provider stabili e meno costosi secondo l'inverso del quadrato del prezzo, usando quelli rimanenti come fallback. In alternativa, gli operatori possono ordinare per prezzo, throughput o latenza; indicare l'ordine dei provider; disabilitare i fallback; imporre il supporto di determinati parametri; escludere i provider che raccolgono dati; richiedere endpoint con zero data retention; oppure fissare un tetto di prezzo.
Questi controlli possono migliorare sia l'uptime sia i costi. Rendono però il comportamento predefinito parte del contratto di produzione. Se l'applicazione richiede output strutturato o tool use, conviene impostare require_parameters e una allowlist, anziché presumere che ogni endpoint associato allo slug di un modello si comporti nello stesso modo.
Su $20,000 di crediti acquistati, il 5.5% equivale a $1,100 al mese. È ancora meno del costo mensile indicativo del self-hosting, pari a $1,200. La percentuale continua però a crescere anche quando l'onere operativo di un gateway self-hosted stabile può appiattirsi: il confronto va riaperto quando la spesa supera $21,818.
L'accordo con Stripe riportato dalla stampa aumenta il costo della dipendenza, non giustifica una migrazione precipitosa. OpenRouter resta il marketplace più ampio di questa classifica. La risposta prudente consiste in un adapter diretto verso il provider, una policy esportata e un bypass testato. L'analisi completa dei prezzi di OpenRouter approfondisce commissioni e soglie BYOK.
- 400+ modelli e 80+ provider nei piani a pagamento
- Controlli avanzati per ordinamento, selezione, policy e fallback dei provider
- Nessuna spesa minima con Pay as you go
- Franchigie BYOK utili prima dell'applicazione della commissione del 5%
- Il percorso più rapido per mantenere aperta l'esplorazione dei modelli
- La commissione del 5.5% sui crediti acquistati cresce direttamente con la spesa
- Le 50 richieste giornaliere del piano Free non bastano per la produzione
- Senza una policy esplicita, il comportamento predefinito può instradare le richieste tra provider diversi
- Il cambio di proprietà riportato dalla stampa aumenta il lavoro necessario per gestire le dipendenze dal fornitore
6. Bifrost: la migliore alternativa OSS per controllare i retry
Bifrost è la migliore alternativa open source per i team che cercano un comportamento dei retry esplicito, OpenTelemetry e una superficie gateway più contenuta. Il piano OSS è gratuito senza scadenza e può essere eseguito in Docker, come workload Kubernetes o come binario Go.

Ideale per: team di piattaforma che vogliono self-hosting e controlli di resilienza trasparenti
Punto di forza: retry e fallback annidati, con la cronologia del routing per ogni richiesta
Prezzi: OSS $0; Enterprise su preventivo
Prova gratuita: 14 giorni di Enterprise
La pagina dei prezzi di Bifrost include nel piano OSS un'unica API compatibile con OpenAI per 1,000+ modelli, metriche e trace OTel, osservabilità, budget e limiti per le chiavi virtuali, routing personalizzato, fallback automatici, caching e un gateway MCP. Enterprise aggiunge deployment VPC, on-premise e air-gapped; modalità cluster; bilanciamento adattivo del carico; SAML e OIDC; integrazioni con vault; audit log; RBAC e supporto garantito da SLA.
La documentazione di Bifrost su retry e fallback è particolarmente precisa. Gli errori di rete e le risposte 5xx fanno riprovare lo stesso provider. I rate limit e gli errori legati a una singola chiave possono attivare la rotazione delle credenziali. La richiesta passa al fallback successivo soltanto quando il provider principale ha esaurito il proprio budget di retry; ogni fallback riceve a sua volta l'intero budget.
Questa trasparenza mette in luce il limite: i retry possono moltiplicarsi. Un provider principale con tre retry e due fallback, ciascuno con tre retry, può generare fino a 12 tentativi prima di restituire un errore. In un'app interattiva, il disservizio del provider può così trasformarsi in un problema di latenza e in un conto più alto. Serve un budget di latenza complessivo, mentre gli errori di sicurezza o compliance devono interrompere la catena e non lasciare che il sistema proceda permissivamente.
Bifrost compete soprattutto con LiteLLM. LiteLLM prevale per familiarità dell'ecosistema e ampiezza del suo control plane consolidato. Bifrost è preferibile quando l'impronta Go-native, la cronologia esplicita del routing o la semantica dei retry si adattano meglio al modello operativo del team di piattaforma. Entrambi perdono valore se nessuno è finanziato per gestire il proxy.
- Piano OSS da $0
- Deployment tramite Docker, Kubernetes o binario Go
- OTel, budget, limiti, caching, routing e fallback inclusi in OSS
- Semantica precisa per retry, rotazione delle chiavi e fallback
- Deployment privato e controlli di identità nel piano Enterprise
- Il gateway e il relativo dominio di errore restano a carico dell'acquirente
- Il prezzo Enterprise è su preventivo
- Budget di retry annidati possono amplificare latenza e costi
- Ecosistema più piccolo rispetto a LiteLLM
7. Helicone: il miglior gateway per chi mette l'osservabilità al primo posto
Helicone è la scelta migliore quando il debugging delle sessioni e l'attribuzione della spesa contano quanto il routing. Riunisce un gateway senza rincari, osservabilità, caching, rate limit, fallback automatici, gestione dei prompt e ricerca tra le richieste.

Ideale per: team il cui problema principale è comprendere il comportamento dei modelli in produzione
Punto di forza: il traffico del gateway confluisce direttamente in un prodotto per osservabilità e debugging
Prezzi: Hobby gratuito; Pro $79/mese; Team $799/mese; Enterprise su preventivo
Prova gratuita: 7 giorni per Pro e Team
La pagina dei prezzi rende visibili le soglie che impongono l'upgrade. Hobby include 10,000 richieste, 1 GB di storage, un posto, un'organizzazione, retention di sette giorni e 10 log al minuto. Pro costa $79 al mese e include posti illimitati, un'organizzazione, retention di un mese, 1,000 log al minuto e 10 chiamate API al minuto, con prezzi a consumo oltre le quantità incluse di richieste e storage.
Team costa $799 al mese e porta l'offerta a cinque organizzazioni, retention di tre mesi, 15,000 log al minuto, 60 chiamate API al minuto, supporto SOC 2 e HIPAA e un canale Slack dedicato. Enterprise è su preventivo e aggiunge organizzazioni illimitate, retention permanente, 30,000 log al minuto, 1,000 chiamate API al minuto, SAML SSO, deployment on-premise e condizioni commerciali personalizzate.
La documentazione della piattaforma descrive due modalità operative: crediti pass-through per 100+ modelli senza rincari oppure BYOK per i team che mantengono la fatturazione dei provider. Entrambe conservano l'osservabilità a livello di richiesta. È questo il vantaggio di Helicone rispetto a un proxy minimale: un'interazione utente fallita può essere ricostruita per tutta la sessione, anziché ridotta al conteggio degli errori di un provider.
Il limite di Hobby emerge subito. Dieci log al minuto bastano per esaminare un prototipo, ma sono troppo pochi per molte applicazioni reali. I 1,000 log al minuto di Pro rappresentano il primo confine plausibile per una produzione a traffico moderato. L'acquirente sta scegliendo insieme un piano di osservabilità e un gateway: deve quindi valutarne il valore complessivo, non considerare gratuito il livello di routing.
- Crediti senza rincaro oppure BYOK
- Gateway, fallback, caching, limiti e osservabilità in un solo sistema
- Confini pubblici per piani e ingestione
- Posti illimitati dal piano Pro in poi
- Opzione Enterprise on-premise
- Il limite di ingestione di Hobby, 10 log al minuto, è restrittivo
- Pro e Team aggiungono costi a consumo oltre le quantità incluse
- Il prezzo passa da $79 per Pro a $799 per Team
- La superficie di osservabilità può essere eccessiva per un'app a cui serve soltanto un gateway semplice
8. Braintrust Gateway: il migliore quando le valutazioni decidono i rilasci
Braintrust Gateway è la soluzione più adatta quando i trace devono diventare valutazioni, dataset, punteggi e controlli di rilascio. Il gateway supporta OpenAI, Anthropic, Google, AWS e altri provider tramite un'API unificata con caching, osservabilità e supporto multi-provider.

Ideale per: team di prodotto AI in cui i risultati delle valutazioni governano le modifiche al routing
Punto di forza: i trace del gateway confluiscono direttamente in una piattaforma di valutazione
Prezzi: Starter $0; Pro $249/mese; Enterprise su preventivo; Gateway gestito gratuito durante la beta
Prova gratuita: Starter non richiede una carta di credito; il Gateway è gratuito finché resta in beta
I prezzi della piattaforma Braintrust partono da Starter a $0. Il piano include 1 GB di dati elaborati, poi $4 per GB; 10,000 punteggi, poi $2.50 ogni 1,000; retention di 14 giorni; utenti, progetti, dataset, playground ed esperimenti illimitati. Pro costa $249 al mese e comprende 5 GB di dati elaborati, poi $3 per GB; 50,000 punteggi, poi $1.50 ogni 1,000; retention di 30 giorni, con i dati conservati oltre la quota addebitati a $0.50 per GB al mese. Enterprise è su preventivo.
Lo stato del gateway è diverso. La documentazione del Gateway Braintrust indica che l'endpoint gestito è in beta e gratuito, mentre i prezzi verranno annunciati prima della disponibilità generale. L'endpoint globale usa il routing DNS in base alla latenza e controlli di integrità nelle regioni gestite. Il logging può scrivere i trace del gateway nel data plane configurato dall'organizzazione.
Questa integrazione cambia la logica d'acquisto. Se il team campiona i trace di produzione, assegna punteggi alle risposte, crea dataset di regressione e blocca i rilasci quando la qualità peggiora, il gateway elimina passaggi di strumentazione e mantiene le evidenze collegate al traffico. Se invece servono soltanto retry e tetti di spesa, è difficile giustificare i $249 del piano Pro rispetto a un gateway più semplice.
Il limite riguarda il prezzo futuro e lo stato beta. Un prodotto gratuito in beta può essere progettato per la produzione senza disporre ancora di un contatore commerciale stabile. Va usato con un bypass diretto verso il provider e con un tetto di prezzo interno stabilito prima della GA: il prezzo temporaneo di $0 non deve determinare un'architettura permanente.
- I trace del gateway si collegano a valutazioni, dataset, punteggi e workflow di rilascio
- Accesso unificato alle principali famiglie di provider
- Gateway gestito gratuito durante la beta
- Routing globale per latenza e controlli di integrità
- Utenti illimitati nei piani di piattaforma Starter e Pro
- Il gateway gestito è ancora in beta
- I prezzi del gateway cambieranno prima della disponibilità generale
- Pro costa $249 al mese prima degli extra a consumo
- Profondità di piattaforma eccessiva per i team a cui serve soltanto il routing
9. Requesty: il miglior control plane semplice con prezzo percentuale
Requesty è la migliore opzione gestita con prezzo percentuale per un piccolo team che cerca routing, caching, fallback, budget e residenza dei dati nell'UE senza un abbonamento. Pay as you go offre 600+ modelli di 20+ provider.

Ideale per: startup che preferiscono una commissione legata direttamente all'uso dei modelli
Punto di forza: nessun abbonamento, costo per posto, spesa minima o tariffa separata per i controlli di routing principali
Prezzi: Free $0; Pay as you go aggiunge il 5%; Enterprise su preventivo
Prova gratuita: piano Free con 200 richieste al giorno sui modelli gratuiti, senza carta
La pagina dei prezzi assegna a Free 200 richieste al giorno sui modelli gratuiti e include routing, caching, fallback, analisi della spesa e residenza dei dati nell'UE. Pay as you go applica un rincaro del 5% ai costi base dei modelli e comprende BYOK, policy di routing, caching, fallback, limiti di spesa, un MCP Gateway, osservabilità avanzata e supporto via email. Enterprise aggiunge SSO, RBAC, audit log, policy sui modelli approvati, budget per team, guardrail, rilevamento PII, account di servizio, supporto dedicato e SLA personalizzati.
La percentuale semplifica il budget iniziale. Con $2,000 di spesa per i modelli, la commissione è $100. A $20,000 sale a $1,000. A $24,000 raggiunge il costo mensile indicativo di $1,200 per il self-hosting. Una startup può così evitare un progetto di piattaforma finché il traffico è incerto e riaprire la decisione quando l'utilizzo si stabilizza.
Il limite nasce dalla stessa semplicità: la commissione cresce con la spesa per i modelli, anche quando il lavoro operativo del gateway non aumenta. Un'azienda con un elevato consumo di token, un team di piattaforma e contratti diretti con i provider dovrebbe confrontare il preventivo Enterprise di Requesty o un proxy self-hosted prima di accettare indefinitamente il 5%.
Requesty si colloca dopo Helicone perché qui il suo punto di forza è un controllo gestito efficiente, non un ciclo differenziato di evidenze dalla produzione. Resta però l'acquisto migliore quando l'assenza di abbonamento e una percentuale prevedibile contano più di valutazioni approfondite o policy enterprise.
- Nessun abbonamento, costo per posto o spesa minima con Pay as you go
- 600+ modelli di 20+ provider
- Routing, caching, fallback, budget, MCP e residenza nell'UE
- Il piano Free non richiede carta di credito
- Percorso Enterprise per identità, audit, policy e controlli PII
- La commissione del 5% cresce direttamente con la spesa per i modelli
- Il prezzo Enterprise è su preventivo
- Il traffico Free è limitato ai modelli gratuiti e a 200 richieste al giorno
- Meno conveniente quando un team di piattaforma finanziato può gestire un proxy
10. Kong AI Gateway: il migliore per chi usa già Kong
Kong AI Gateway è la scelta migliore quando Kong governa già le API aziendali e il traffico AI deve ereditare lo stesso modello operativo. Plus include un'API LLM universale, fino a cinque modelli distinti esposti tramite proxy, traffico agent-to-agent illimitato, proxy illimitati per server MCP, sanificazione PII, guardrail, controllo degli accessi, rate limit sui token, caching semantico e analisi dei costi.

Ideale per: aziende che eseguono già Kong Konnect o Kong Gateway
Punto di forza: policy AI all'interno di una piattaforma più ampia per API, identità, portali e governance dei servizi
Prezzi: prova di 30 giorni a $0; Plus con prezzo a consumo; Enterprise annuale su preventivo
Prova gratuita: 30 giorni senza carta di credito e senza limiti del gateway
La pagina dei prezzi di Kong espone i contatori di Plus. Un control plane Serverless costa $25 al mese, Hybrid $200 e Dedicated Cloud $500 più $0.15 per GB. Plus include un milione di richieste API; oltre questa soglia, ogni milione aggiuntivo costa $200, fino a un massimo mensile di 10 milioni.
Il proxy dei modelli AI costa altri $100 al mese per ogni modello LLM distinto, con un limite di cinque nel piano Plus. Un'app con quattro modelli e un unico control plane Serverless parte quindi da $425 al mese prima dei token dei modelli: $25 per il control plane più $400 per i quattro proxy. I plugin AI a pagamento sono componenti aggiuntivi separati in Plus e sono inclusi in Enterprise.
Enterprise elimina i limiti su gateway e modelli, supporta AI gateway completamente self-hosted e aggiunge audit log, SSO, supporto dedicato, servizi professionali e SLA più elevati. Il prezzo è personalizzato e fatturato annualmente.
Il limite è il peso della piattaforma. Kong ha senso quando governance delle API, control plane, identità, analisi, catalogo dei servizi e supporto esistono già nel budget. Per una nuova app multi-modello, pagare per control plane, modello e richiesta introduce concetti aggiuntivi prima ancora che il prodotto ne abbia dimostrato la necessità. Vercel, Cloudflare, Requesty o un proxy OSS riducono più rapidamente il perimetro della decisione.
- Si integra nel modello di controllo e supporto Kong già esistente
- API LLM universale con policy, caching, guardrail e analisi dei costi
- Percorsi Serverless, Hybrid, Dedicated Cloud ed Enterprise self-hosted
- I contatori pubblici di Plus permettono di calcolare una configurazione di base
- Solido percorso enterprise per identità e audit
- $100 per ogni modello esposto tramite proxy nel piano Plus
- L'esempio Serverless con quattro modelli parte da $425 prima dell'inferenza
- Plus limita il proxy AI a cinque modelli e il traffico a 10 milioni di richieste
- Eccessivamente complesso e costoso come scelta predefinita per un nuovo progetto
Quale AI gateway scegliere in base al proprio caso?
Partire dal vincolo che bloccherebbe il lancio e soltanto dopo confrontare le commissioni. Un routing sofisticato non compensa un perimetro di deployment sbagliato; allo stesso modo, una tariffa bassa non rimedia all'assenza di controlli di audit o rollback.
Per una startup che pubblica un'app rivolta ai clienti, con pochi modelli approvati e nessun requisito di deployment privato, la scelta è Vercel AI Gateway. La decisione passa a Cloudflare se Cloudflare controlla già edge e sicurezza, oppure a Requesty se una commissione a consumo del 5% è più facile da finanziare di un abbonamento di piattaforma.
Per un'azienda di prodotto con un responsabile di piattaforma, standard già definiti per container e database e un requisito rigido sul percorso dati, la scelta è LiteLLM. Lo stesso vale quando, con l'ipotesi operativa indicata, la spesa mensile per i modelli si avvicina o supera circa $22,000-$24,000. Bifrost diventa preferibile se la sua semantica dei retry, il deployment Go o l'approccio OTel-first si adattano meglio al team.
Per un acquirente mid-market o enterprise che richiede identità gestita, guardrail, budget, retention, opzioni di deployment privato e supporto, la scelta è Portkey. Passa a Kong quando Kong è già la piattaforma API aziendale e il consolidamento dei controlli giustifica la tariffa per modello.
Scegliere Helicone quando l'attività quotidiana ruota attorno all'analisi delle richieste, al debugging delle sessioni e all'attribuzione della spesa. Scegliere Braintrust Gateway quando gli stessi trace devono alimentare valutazioni e controlli di rilascio. Finché Braintrust resta in beta, sono indispensabili sia un bypass diretto sia un tetto di prezzo interno.
Scegliere OpenRouter finché un piccolo team tecnico sta ancora confrontando molti modelli o ha bisogno dell'ampiezza di un marketplace di provider. Mantenere una route diretta al provider. Quando l'app si stabilizza su pochi modelli approvati, confrontare la commissione del 5.5% sui crediti con il rincaro sui token pari a zero di Vercel, il 5% di Requesty o un self-hosting adeguatamente finanziato.

La condizione esplicita per cambiare è semplice: migrare quando il costo o il controllo mancanti superano l'onere operativo e di migrazione della soluzione successiva. Non basta che un concorrente presenti un elenco di funzioni più lungo. È il momento di migrare quando il gateway in uso non riesce a rispettare un budget di latenza misurato, un perimetro di deployment, un requisito di audit, un tetto alle commissioni o un obiettivo di uscita.
Quali gateway evitare come unica route di produzione
Nessun gateway dovrebbe essere l'unica route quando il suo confine commerciale o operativo è ancora in movimento. Tre prodotti richiedono questa cautela, ciascuno per un motivo diverso.
Evitare OpenRouter come unica route di produzione durante il cambio di proprietà riportato dalla stampa. Catalogo e routing restano eccellenti e non c'è motivo di affermare che le condizioni peggioreranno. Il problema è la concentrazione: accesso ai modelli, policy dei provider, crediti e comportamento dei fallback dipendono tutti dallo stesso account. Conservare una chiave diretta di un provider e un adapter testato al di fuori di esso.
Evitare Braintrust Gateway come unica route finché rimane in beta. Braintrust dichiara che il gateway gestito è progettato per la produzione, ne pubblica l'uptime e lo offre gratuitamente durante la beta. Dichiara anche che i prezzi saranno annunciati prima della disponibilità generale. Considerare $0 come prezzo pilota, stabilire la soglia che farebbe scattare una migrazione e mantenere pronto il bypass.
Evitare Kong AI Gateway come scelta predefinita per un nuovo progetto se l'azienda non usa già Kong. Quattro modelli esposti tramite proxy su un control plane Serverless Plus partono da $425 al mese prima dell'inferenza; inoltre, l'acquirente eredita i concetti di control plane e programma API di Kong. Per un cliente Kong esistente può essere un ottimo consolidamento; per una nuova app, un peso di piattaforma superfluo.
Evitare anche un semplice passthrough sviluppato internamente quando ne dipende più di un'applicazione. Un proxy per il base URL è facile da costruire. Streaming corretto, normalizzazione degli errori, parametri specifici dei provider, fallback, budget, isolamento delle chiavi, log e gestione dei modelli deprecati costituiscono invece un prodotto da mantenere. Conviene svilupparlo soltanto quando una policy davvero unica giustifica una responsabilità permanente.
La mossa di lunedì: dimostrare che il gateway è reversibile
La prossima settimana non deve iniziare con una migrazione aziendale. Basta una route con caratteristiche di produzione e una prova dell'uscita in 10 minuti. Il risultato deve essere una decisione operativa misurata, non soltanto un diagramma architetturale più ordinato.
Inventariare una route
Scegliere un workflow rivolto ai clienti e annotare provider attuale, modello, metodo di autenticazione, spesa mensile, obiettivo di latenza p95, requisiti di output strutturato o tool e policy sui dati. La route deve essere abbastanza rappresentativa da far emergere le difficoltà, ma abbastanza piccola da consentire il rollback.
Collocare il gateway dietro un client interno
Inserire nel percorso delle richieste soltanto l'adapter del gateway. Tenere header specifici dei provider, alias dei modelli e policy di fallback fuori dalla logica di business. Conservare la precedente configurazione diretta accanto a quella del gateway.
Impostare un modello principale e un fallback compatibile
Non iniziare da un albero di routing. Scegliere un fallback che supporti lo stesso protocollo di risposta, output strutturato, tool e perimetro dei dati. Impostare un limite di latenza complessivo per l'intera catena di retry.
Provocare l'errore
Disabilitare o instradare in modo errato il modello principale durante una finestra controllata. Verificare quali tentativi sono stati eseguiti e fatturati, quale provider ha risposto, quanto è durata la catena e se l'applicazione ha ricevuto lo schema previsto.
Eseguire l'uscita in 10 minuti
Escludere il gateway tramite configurazione e un deployment controllato. Se il servizio non riesce a tornare alla route diretta verso il provider entro 10 minuti, registrare la dipendenza che lo ha impedito e correggerla prima di ampliare il rollout.
Acquistare il controllo che ha cambiato una decisione
Adottare il gateway solo se ha recuperato richieste, applicato una policy, reso evidente chi genera la spesa, rispettato un vincolo di deployment o ridotto un costo operativo misurabile. Una dashboard che nessun responsabile consulta non è un risultato di produzione.
Per la maggior parte dei piccoli team di prodotto, il progetto pilota di lunedì dovrebbe usare Vercel AI Gateway senza componenti aggiuntivi a pagamento finché un requisito non li rende necessari. Un team di piattaforma con un rigido confine privato dovrebbe usare LiteLLM e assegnare la responsabilità prima che il proxy riceva traffico. In un progetto di governance enterprise, acquisti e validazione tecnica devono iniziare insieme, perché retention, identità, deployment, supporto e condizioni d'uscita influenzano tutti l'architettura.
L'acquisizione riportata è il fattore scatenante, non la decisione. La decisione è se il prossimo cambio di modello, provider o gateway potrà avvenire come aggiornamento controllato della configurazione, invece di richiedere una riscrittura e un budget d'emergenza.
Domande frequenti sugli AI gateway
Qual è il miglior LLM gateway?
LiteLLM è il migliore in assoluto quando un responsabile di piattaforma può gestire il gateway e l'azienda dà valore al controllo del deployment. Vercel AI Gateway è la migliore scelta gestita. Portkey offre una governance enterprise gestita più solida, mentre OpenRouter prevale finché l'obiettivo principale è esplorare un ampio catalogo di modelli.
Quali sono alcuni esempi di AI gateway?
Tra gli esempi attuali rientrano LiteLLM, Vercel AI Gateway, Portkey, Cloudflare AI Gateway, OpenRouter, Bifrost, Helicone, Braintrust Gateway, Requesty e Kong AI Gateway. Coprono proxy self-hosted, gateway gestiti, marketplace di modelli, piattaforme incentrate sull'osservabilità e piattaforme API enterprise.
Qual è il miglior AI gateway open source?
LiteLLM è la migliore scelta open source perché il piano da $0 riunisce 100+ provider, chiavi virtuali, budget, rate limit, fallback, log e Prometheus. Bifrost è l'alternativa migliore quando a decidere sono il comportamento esplicito dei retry annidati, un binario Go o la sua implementazione OpenTelemetry.
Quale AI gateway conviene a una startup e quale a un'azienda enterprise?
In genere una startup dovrebbe iniziare con Vercel, Cloudflare o Requesty, evitando di creare un'attività interna di piattaforma. Un'azienda enterprise deve scegliere in base a governance e perimetro di deployment: Portkey per i controlli gestiti, LiteLLM o Bifrost per un'infrastruttura di proprietà e Kong quando l'organizzazione standardizza già lì il traffico API.
3 set 2026







