I migliori AI gateway per coding agent: confronto 2026
Confronto tra i 6 migliori AI gateway per coding agent: costi, fallback, governance e self-hosting per scegliere tra Vercel, Requesty e gli altri.

Vercel AI Gateway è il miglior AI gateway per la maggior parte dei team che usano coding agent: oggi basta un comando per configurare nove agenti e il livello base non applica maggiorazioni sui token. Su una spesa mensile di $2,000 per i modelli, il gateway costa $0 con Vercel, $100 con Requesty e $110 con OpenRouter, prima degli eventuali controlli opzionali. Non è più una voce da relegare agli esperimenti: è una decisione che incide sul budget di ingegneria.
Risposta breve: quale AI gateway conviene scegliere?
La scelta predefinita è Vercel AI Gateway, a meno che requisiti specifici di deployment, attribuzione dei costi o governance non portino altrove. Oggi offre il percorso più lineare per passare da configurazioni separate di Claude Code, Codex, Cursor e OpenCode a un'unica fattura per i modelli, un solo sistema di fallback e una vista consolidata della spesa.
Ci sono cinque casi netti in cui conviene discostarsi da Vercel. Scegliete Requesty quando l'area finance deve sapere quale repository, branch o sviluppatore ha generato la spesa. Preferite LiteLLM se traffico dei modelli e chiavi dei provider devono restare nell'infrastruttura aziendale. Puntate su OpenRouter quando l'accesso al catalogo più ampio di modelli e provider conta più di una configurazione pensata per i singoli coding tool. Portkey è la scelta giusta se il budget è destinato a guardrail gestiti, circuit breaker e policy. Cloudflare AI Gateway ha invece senso quando Workers, logging e sicurezza Cloudflare costituiscono già il piano di controllo.
Un AI gateway è il livello di controllo tra un coding agent e i provider dei modelli. Il coding agent continua a pianificare, modificare file, eseguire comandi e chiamare tool. Il gateway stabilisce dove inviare le richieste, quanto possono costare, quale provider le riceve, che cosa accade dopo un timeout e quali dati vengono registrati.
È una distinzione essenziale. Un gateway non rende migliore un modello di coding mediocre, non corregge istruzioni di repository scritte male e non esamina codice non sicuro. Può però impedire che il down di un provider interrompa un'esecuzione lunga, limitare una chiave fuori controllo e mostrare che un branch di migrazione ha consumato quattro volte il budget di un normale bug fix. Va acquistato per il controllo, non per l'intelligenza.
Perché i coding agent trasformano il gateway in una voce di budget
Con i coding agent, una piccola scelta di routing diventa una decisione sui costi operativi, perché un solo task può innescare una catena di chiamate ai modelli. Una risposta in chat può richiedere un'unica generazione. Un coding agent, invece, può ispezionare un repository, cercare simboli, proporre una patch, eseguire i test, leggere gli errori, correggere la patch e chiedere a un modello più potente di verificare il risultato.
L'indice di produzione di Vercel ha rilevato che il 22.2% delle richieste ha generato il 58.9% dei token: le richieste che usano tool consumano quindi circa 2.6 volte più token rispetto al resto del traffico. Lo stesso dataset segnala che i fallback hanno recuperato il 3.5% delle richieste. Se un carico da 10,000 richieste seguisse la stessa distribuzione aggregata, circa 350 richieste verrebbero completate tramite fallback anziché fallire al primo provider. È un esempio, non la promessa dello stesso tasso di recupero su altri workload, ma chiarisce perché l'affidabilità vada valutata insieme al prezzo del modello.
Il costo base dei gateway si confronta meglio mantenendo invariata la fattura dei modelli upstream. Con $2,000 al mese di inferenza ai prezzi dei provider:
- Vercel aggiunge $0 di maggiorazione sui token.
- La maggiorazione del 5% di Requesty aggiunge $100.
- La commissione Pay as you go del 5.5% di OpenRouter aggiunge $110.
- Cloudflare Unified Billing aggiunge $100 quando i crediti vengono acquistati tramite il servizio.
- Portkey parte da $49 al mese per 100,000 log registrati, con un'unità di misura diversa dalla spesa in token.
- La licenza open source di LiteLLM aggiunge $0, mentre hosting e tempo degli operatori restano a carico dell'azienda.

La differenza percentuale non esaurisce la decisione. I $100 in più di Requesty possono essere convenienti se l'attribuzione a livello di branch impedisce a un repository fuori controllo di consumare molto di più. I $49 di Portkey possono valere la spesa se un circuit breaker preserva un workflow di rilascio. E la licenza gratuita di LiteLLM può diventare costosa quando un platform engineer finisce per essere il reperibile permanente del proxy.
Il gateway dovrebbe ridurre il costo del passaggio tra modelli, provider e coding tool. Se si limita a sostituire sei fatture dei provider con una settima fattura, non si è guadagnato il proprio posto nello stack.
Come sono stati selezionati questi AI gateway
I sei prodotti sono stati valutati in base al lavoro generato dai coding agent, non attraverso una checklist generica di funzioni API. Prezzi e pagine prodotto sono stati verificati il 15 agosto 2026. I tool non sono stati provati in produzione durante questa analisi: la classifica deriva quindi dalla documentazione attuale, da un confronto normalizzato dei costi e dalle conseguenze concrete dei confini di ciascun prodotto.
L'ordine dipende da sei criteri:
- Configurazione dei coding tool: un gateway che documenta Claude Code, Codex, Cursor e agenti analoghi presenta meno rischi di integrazione rispetto a uno che promette soltanto un endpoint compatibile con OpenAI.
- Affidabilità del routing: ordine dei provider, timeout, retry, fallback dei modelli e circuit breaker sono decisivi, perché un agente può perdere un'intera catena all'ultima chiamata.
- Visibilità dei costi: la spesa dei modelli dovrebbe essere attribuibile a una chiave, un agente, un repository, uno sviluppatore, un team o una policy, invece di apparire come un unico totale indistinto di token.
- Controllo delle policy: allowlist dei provider, elenchi di modelli approvati, budget, controlli sulla conservazione dei dati e audit log determinano se il team può superare la fase degli esperimenti individuali.
- Carico operativo del deployment: i gateway gestiti fanno pagare la rimozione dell'operatività. Quelli self-hosted eliminano le commissioni di piattaforma, ma restituiscono al cliente disponibilità, aggiornamenti, storage e risposta agli incidenti.
- Prezzo attuale: ogni piano e limite proviene dalla pagina live del vendor. I prezzi di inferenza dei modelli sono esclusi dalla classifica, perché variano per modello e provider e perché il confronto mantiene costante la fattura upstream.
Helicone è stato preso in esame ma non inserito in classifica. È un valido prodotto di osservabilità con funzioni gateway, tuttavia il suo vantaggio più evidente riguarda tracing e analisi, non la configurazione di un'ampia gamma di coding tool. Sono stati esclusi anche i gateway API generici: possono fare da proxy al traffico HTTP, ma i coding agent richiedono fallback consapevoli dei modelli, budget di token, controlli su prompt e risposte e compatibilità con diversi protocolli di comunicazione.
Ne risulta una lista più breve, con una regola decisionale più rigorosa. Ciascun prodotto ha un compito in cui eccelle e un limite oltre il quale un'alternativa diventa l'acquisto migliore.
1. Vercel AI Gateway: il migliore in assoluto per i coding agent
Vercel AI Gateway è la scelta predefinita migliore perché elimina il lavoro di configurazione che finora teneva i gateway fuori dai workflow individuali dei coding agent. La CLI attuale può creare una chiave, mostrare in anteprima le modifiche alla configurazione e impostare nove agenti supportati tramite vercel ai-gateway coding-agents setup.

La tabella di supporto live include Claude Code, Cline, OpenAI Codex, Cursor, Hermes, Kilo Code, OpenClaw, OpenCode e Pi. Vercel documenta anche procedure manuali per altri strumenti. Claude Code, Codex e Cursor dispongono di endpoint di compatibilità dedicati, perché il loro comportamento sul protocollo richiede più della superficie OpenAI generica. È la funzione che cambia davvero la decisione d'acquisto: il gateway non è più soltanto l'infrastruttura dietro un'applicazione sviluppata internamente. Può stare dietro gli strumenti di coding che gli ingegneri usano già.
Per un product team di 12 persone, il risultato concreto è un unico budget e una sola policy di fallback per stili di lavoro diversi. Un ingegnere può restare su Claude Code, un altro eseguire Codex dal terminale e un terzo usare Cursor. Le loro richieste confluiscono comunque in un'unica vista della spesa, senza costringere l'azienda a scegliere un solo editor o un unico produttore di modelli.
Ideale per: team che usano più coding agent e cercano la configurazione gestita più rapida
Punto di forza: un unico workflow CLI per nove agenti supportati, più endpoint dedicati per Claude Code, Codex e Cursor
Prezzo: $5 di credito mensile gratuito; inferenza a pagamento ai prezzi di listino dei provider, senza maggiorazione sui token
Prova gratuita: piano gratuito continuativo sui modelli idonei, non una prova a tempo
Il prezzo del livello base è insolitamente trasparente. La pagina dei prezzi live di Vercel dichiara che sui token non vengono applicati né maggiorazioni né costi di piattaforma. Il piano gratuito comprende $5 di credito mensile, un sottoinsieme di modelli idonei e limiti inferiori per modello. L'acquisto di crediti sposta l'account su Pay as you go e interrompe il credito mensile gratuito. Bring Your Own Key è disponibile solo dopo il passaggio al piano a pagamento e Vercel non applica commissioni BYOK.
Ci sono due aspetti da considerare. Primo: l'assenza di maggiorazioni vale per i token, non per ogni controllo. L'allowlist dei provider e la zero data retention per tutto il team costano ciascuna $0.10 ogni 1,000 richieste. I trace drain costano $0.05 ogni 1,000 tracce, più $0.50 per GB di egress. Il reporting personalizzato ha contatori separati per scritture e query. Un piccolo team può ignorare gran parte di queste funzioni; un'organizzazione regolamentata dovrebbe includerle nei calcoli prima di definire gratuito il gateway.
Secondo: una richiesta BYOK non riuscita può essere ritentata con credenziali di sistema Vercel e il consumo del fallback può essere addebitato al saldo crediti del gateway. È un'impostazione predefinita sensata per l'affidabilità, ma introduce un caso limite per il budget. Se finance si aspetta che ogni richiesta rimanga sul contratto esistente con il provider, il percorso di fallback va verificato, non dato per scontato.
I controlli di routing sono adeguati per la maggior parte dei product team. Vercel documenta filtri, ordine di priorità e criteri di sorting dei provider, caching automatico, timeout dei provider e fallback dei modelli. Il normale traffico di completamento del codice può essere inviato a un provider preferito, con failover rapido quando la latenza supera la soglia accettabile e un modello più costoso come ultimo percorso di recupero.
Il limite principale riguarda la proprietà del deployment. Vercel AI Gateway è gestito: non è adatto a un team che pretende di eseguire gateway, database, chiavi e log nella propria rete. Con questo requisito, LiteLLM vince prima ancora di confrontare le funzioni.
- Un comando di configurazione documentato per nove coding agent
- Endpoint di compatibilità dedicati per Claude Code, Codex e Cursor
- Nessuna maggiorazione e nessun costo di piattaforma sui token
- Ordinamento dei provider, timeout, caching e fallback dei modelli
- Un'unica fattura e una vista della spesa per 200+ modelli
- Nessun deployment self-hosted del gateway
- BYOK richiede il piano a pagamento
- Reporting avanzato, tracce, allowlist e ZDR per tutto il team hanno contatori separati
- Dopo che la CLI ha creato la chiave, Cursor richiede comunque gli ultimi clic nelle impostazioni dell'account
Configurare Vercel AI Gateway senza trasformare la migrazione in un progetto
La procedura più sicura conserva un rollback diretto verso il provider e parte da un unico repository. Non conviene modificare contemporaneamente la configurazione di ogni sviluppatore e di ogni agente.
Create una chiave pilota con limiti precisi
Create una chiave gateway per il solo repository pilota e assegnatele un budget di spesa settimanale o mensile. Non riutilizzate una chiave applicativa aziendale, perché i loop dei coding agent hanno bisogno di un proprio punto di arresto.
Eseguite il comando di configurazione documentato
Eseguite
vercel ai-gateway coding-agents setup. Lasciate che la CLI rilevi gli agenti installati, selezionate solo gli strumenti del pilota e controllate il diff mostrato prima di accettare qualsiasi scrittura della configurazione.Mantenete un modello primario e un solo fallback
Partite dal modello di cui il team si fida già. Aggiungete un unico fallback di provider o modello con un comportamento comparabile nell'uso dei tool. Un albero di routing esteso rende più difficile spiegare un'esecuzione fallita.
Verificate identità ed etichette di spesa
Eseguite un task circoscritto da ciascun agente configurato. Controllate che la dashboard identifichi agente, modello, provider, uso dei token, costo, latenza e stato del fallback nel modo atteso da chi acquista il servizio.
Conservate il percorso diretto
Mantenete la precedente configurazione del provider in un file di rollback documentato. Se il gateway modifica tool calling, individuazione dei modelli o latenza, il pilota deve poter essere annullato in pochi minuti.
2. Requesty: il migliore per attribuire i costi a branch, repository e sviluppatori
Requesty è il gateway migliore quando l'engineering manager deve collegare la spesa dei modelli al lavoro che l'ha generata. L'integrazione con Claude Code consente di etichettare le richieste per branch, repository, sviluppatore e versione dell'agente, trasformando una fattura di token in un dato su cui il team può indagare.

Per i team che gestiscono migrazioni parallele, feature branch e revisioni automatiche, questa attribuzione vale più di una commissione contenuta. Un team B2B SaaS potrebbe scoprire che la revisione in background costa poco, mentre il loop test-correzione di un singolo repository assorbe gran parte della spesa mensile. A quel punto l'intervento è mirato: si modifica la policy di quel repository o modello, senza ridurre l'accesso a tutti gli sviluppatori.
Ideale per: team che devono conoscere il costo dei coding agent per branch, repository o sviluppatore
Punto di forza: tag analitici di Claude Code, policy di routing, residenza dei dati nell'UE e gateway MCP
Prezzo: $0 sui modelli gratuiti; Pay as you go aggiunge il 5% ai costi base dei modelli; Enterprise su preventivo
Prova gratuita: piano gratuito con 200 richieste al giorno, senza carta di credito
La pagina dei prezzi attuale di Requesty elenca 600+ modelli di 20+ provider. Pay as you go non prevede abbonamento, costo per postazione, spesa minima né addebiti separati per routing, caching, fallback e residenza dei dati nell'UE. Su $2,000 di inferenza mensile ai prezzi dei provider, la maggiorazione del 5% equivale a $100.
Quei $100 si giustificano facilmente se i metadati evitano un'esecuzione fuori controllo più costosa o rendono possibile il chargeback. Sono invece più difficili da difendere per uno sviluppatore indipendente che vuole soltanto cambiare base URL. OpenRouter dichiara un catalogo più ampio, mentre Vercel offre un percorso senza maggiorazioni più lineare per i coding agent supportati.
Il piano Enterprise di Requesty aggiunge SSO, RBAC, audit log, policy sui modelli approvati, rilevamento dei dati PII, budget di gruppo, service account per CI/CD e SLA personalizzati. Sono caratteristiche credibili per un'organizzazione di ingegneria più grande, ma il prezzo è su preventivo. Nessun team può confrontare davvero Enterprise senza un'offerta e un profilo di richieste rappresentativo.
Va segnalata una discrepanza nella documentazione. La pagina commerciale dei prezzi indica 600+ modelli, mentre la pagina di integrazione con Claude Code, modificata il 10 agosto 2026, parla ancora di 300+ modelli. In questo confronto viene usato il dato più alto per il catalogo a pagamento, perché è la pagina live dei prezzi a definire l'offerta. La discordanza suggerisce comunque di verificare nell'account library i modelli effettivamente necessari, senza considerare garantito nessuno dei due numeri promozionali.
La configurazione di Claude Code è meno ampia della CLI multi-agente di Vercel, ma approfondisce maggiormente l'attribuzione. La CLI di Requesty può scrivere la configurazione di Claude ed eseguire il backup del file esistente. Un wrapper shell opzionale inserisce all'avvio della sessione header relativi a repository, branch, utente e versione dell'agente. Il wrapper è visibile nella configurazione della shell e gli header vengono rimossi prima di inoltrare la richiesta al provider del modello.
Il limite è il contatore percentuale. La maggiorazione del 5% cresce insieme alla spesa dei modelli, anche se il lavoro svolto dal piano di controllo del gateway non aumenta. A $20,000 al mese diventa $1,000. Un cliente più grande dovrebbe confrontare quella cifra con l'abbonamento di Portkey, il costo operativo di LiteLLM e un preventivo Enterprise personalizzato di Requesty.
- Attribuzione dei costi per branch, repository, sviluppatore e versione dell'agente
- 200 richieste gratuite al giorno sui modelli gratuiti
- Routing, caching, fallback, limiti di spesa e residenza dei dati nell'UE con Pay as you go
- Gateway MCP e service account per CI/CD
- Nessun abbonamento, costo per postazione o spesa minima con Pay as you go
- La maggiorazione del 5% cresce direttamente con la spesa di inferenza
- Il prezzo Enterprise richiede un preventivo
- La configurazione multi-agente è meno unificata rispetto alla CLI Vercel per nove agenti
- Le pagine live non concordano su un catalogo di 300+ oppure 600+ modelli
3. LiteLLM: il miglior LLM gateway self-hosted
LiteLLM è la scelta migliore quando il controllo su deployment e dati viene prima della comodità. Il proxy open source può essere ospitato gratuitamente in produzione e riunisce 100+ provider dietro un'unica API compatibile con OpenAI.

Per il CTO di un'azienda di medie dimensioni con un perimetro di rete privato, il vantaggio è immediato: chiavi dei modelli, traffico delle richieste, chiavi virtuali, budget, log e metriche Prometheus restano nell'infrastruttura gestita dall'azienda. LiteLLM dichiara di non poter vedere dati o traffico del cliente nel prodotto self-hosted. Si elimina così un gateway gestito dal percorso dei dati dei modelli.
Ideale per: platform team che richiedono accesso ai modelli self-hosted o air-gapped
Punto di forza: proxy open source gratuito con 100+ provider, chiavi virtuali, budget, fallback e Prometheus
Prezzo: $0 per l'open source; Enterprise annuale e su preventivo in base a capacità e deployment
Prova gratuita: 30 giorni di Enterprise senza carta di credito; l'open source resta gratuito
Il prezzo del software è il dato più semplice del confronto, nonché quello più facile da fraintendere. Il gateway open source costa $0, anche per l'uso in produzione. Include utenti e team, monitoraggio della spesa, rate limit, logging di richieste e risposte e fallback LLM. Non esiste una licenza LiteLLM calcolata per token.
Il costo operativo, però, non è $0. Qualcuno deve distribuire il proxy, amministrarne database e secret, scalarlo, monitorarlo, aggiornarlo quando i provider modificano le API, conservare i log, verificare i fallback e intervenire quando il gateway diventa il punto di errore condiviso. LiteLLM converte una fattura del vendor in una responsabilità infrastrutturale. Può essere uno scambio vantaggioso per un platform team e pessimo per una startup di cinque persone.
Enterprise aggiunge SSO, SCIM, autenticazione OIDC o JWT, audit log, integrazioni con secret manager, rotazione delle chiavi, controlli organizzativi, piano di controllo multi-region, supporto, SLA e deployment air-gapped. Il prezzo è annuale e dipende da capacità di richieste, architettura del deployment e supporto, non dai token. È un confine importante: un'azienda regolamentata può partire dall'open source e avere comunque bisogno di Enterprise non appena identità, audit o assistenza continua diventano obbligatori.
LiteLLM presenta inoltre due superfici di prodotto che spesso vengono confuse. L'SDK Python è una libreria applicativa. Il Proxy Server è il gateway centralizzato con autenticazione, spesa multi-tenant, chiavi virtuali e dashboard amministrativa. Un rollout di coding agent che richiede policy condivise dovrebbe valutare il proxy, non limitarsi ad aggiungere l'SDK a qualche script.
Il limite sul fronte dei coding tool riguarda documentazione e responsabilità operativa. LiteLLM offre un endpoint compatibile utilizzabile da molti agenti, ma non l'installer unico e attuale di Vercel per nove strumenti specifici. Variabili d'ambiente, formato delle risposte, individuazione dei modelli e comportamento nell'uso dei tool devono essere validati per ogni agente. Il comportamento di Codex con la Responses API e il protocollo Anthropic di Claude Code meritano verifiche pilota separate.
- Licenza open source da $0 per il self-hosting in produzione
- 100+ provider tramite un'unica API compatibile con OpenAI
- Chiavi virtuali, budget, rate limit, fallback, log e metriche Prometheus
- Traffico e chiavi restano nell'infrastruttura gestita dal cliente
- Percorso Enterprise per identità, audit, air gap, supporto e controllo multi-region
- Disponibilità, aggiornamenti, storage, scalabilità e incidenti sono responsabilità del cliente
- Il prezzo Enterprise non è pubblico
- La configurazione per i singoli coding tool è meno strutturata rispetto a Vercel
- Un proxy centrale distribuito con leggerezza può diventare un nuovo dominio di errore interno
4. OpenRouter: il migliore per ampiezza dei modelli ed esperimenti rapidi
OpenRouter è il gateway migliore per confrontare un ampio mercato di modelli con un solo account. La pagina live di Pay as you go elenca 500+ modelli di 80+ provider: il catalogo dichiarato più esteso tra quelli selezionati.

Questa ampiezza è preziosa per uno sviluppatore tecnico indipendente o un piccolo team orientato alla ricerca. Un coding agent può confrontare un modello frontier per pianificare il repository, uno più rapido per ricerca e classificazione e un modello open per trasformazioni ordinarie, senza aprire un account di fatturazione presso ogni provider.
Ideale per: confronto rapido tra modelli e accesso a un vasto mercato di provider
Punto di forza: 500+ modelli, 80+ provider e un Auto Router consapevole del task
Prezzo: $0 sul piano gratuito; Pay as you go applica una commissione di piattaforma del 5.5%; sconti Enterprise su preventivo
Prova gratuita: piano gratuito con 25+ modelli, 4 provider e 50 richieste al giorno
Il compromesso commerciale è esplicito. Il piano Pay as you go di OpenRouter non impone una spesa minima, ma applica una commissione di piattaforma del 5.5%. Su $2,000 di crediti acquistati equivale a $110. Bring Your Own Key prevede attualmente una franchigia mensile di $25,000 di inferenza a prezzo di listino, oltre la quale si applica una commissione del 5%. Enterprise porta la franchigia a $200,000 e offre sconti sulle commissioni tramite preventivo.
Il piano gratuito è utile per verificare la compatibilità, ma insufficiente per un lavoro continuativo degli agenti. Cinquanta richieste al giorno possono esaurirsi durante un lungo loop di coding. Va considerato un test di connessione, non un budget per il team.
L'Auto Router di OpenRouter è più interessante del semplice numero di modelli. La documentazione attuale sul routing dichiara che classifica i prompt in circa 30 tipi di task, tra cui debug del codice e pianificazione di agenti in più fasi, quindi ordina i modelli in base alla spesa aggregata in una finestra mobile di sette giorni. Tiene conto di capacità, supporto dei tool, costo, restrizioni dell'account e opzioni di fallback.
Questo segnale di mercato semplifica gli esperimenti e complica la riproducibilità. Il router può scegliere un modello diverso a ogni turno. La persistenza di sessione preferisce il modello precedente quando resta tra i candidati migliori, ma un cambio di task può comunque modificare la scelta. Per un coding agent che costruisce una patch nell'arco di molti turni, cambiare modello a metà sessione può alterare sintassi dei tool, stile di ragionamento o disciplina dell'output.
La soluzione non è rinunciare al routing, ma decidere dove quello dinamico sia appropriato. È adatto a valutazioni, classificazioni a basso rischio o attività in background ben delimitate. Per una patch critica ai fini del rilascio, conviene fissare un modello approvato e una policy di provider, salvo che il team abbia già verificato la continuità tra modelli.
OpenRouter espone anche routing basato su policy e fallback tra provider. È utile quando lo stesso modello viene offerto da più host di inferenza; lo è meno quando servono chargeback a livello di repository, controllo self-hosted o guardrail enterprise gestiti. Requesty, LiteLLM e Portkey sono più forti in questi tre ambiti distinti.
- Il catalogo dichiarato più ampio della selezione, con 500+ modelli e 80+ provider
- Un modo rapido per confrontare modelli senza account separati presso i provider
- Auto Router basato sul task corrente e sui segnali del mercato
- Fallback tra provider, controlli di spesa e routing basato su policy
- Piano gratuito per i test di compatibilità
- La commissione Pay as you go del 5.5% cresce con la spesa
- Le 50 richieste giornaliere del piano gratuito non bastano per loop continuativi degli agenti
- Il routing dinamico può cambiare modello tra un turno e l'altro
- Configurazione per i singoli coding tool e attribuzione ai repository meno complete rispetto ai primi due prodotti
5. Portkey: il miglior livello di governance gestita
Portkey è la scelta migliore quando il requisito finanziato è un piano di controllo gestito, non soltanto un endpoint unificato. Il suo gateway combina fallback, routing condizionale, retry, circuit breaker, bilanciamento del carico, canary test, supporto MCP, budget, rate limit, cache e guardrail.

Questo insieme di funzioni risponde alle esigenze di un platform team di medie dimensioni che passa dalle chiavi individuali degli agenti a un accesso approvato. Una sola policy può limitare i modelli, un budget può porre un tetto a un team e un circuit breaker può interrompere chiamate ripetute verso un provider non disponibile. Il prodotto è pensato per il momento in cui “date una chiave gateway agli sviluppatori” diventa un problema di identità, policy e gestione degli incidenti.
Ideale per: routing gestito, guardrail e governance in un platform team in crescita
Punto di forza: circuit breaker, canary test, controlli MCP, routing condizionale e gateway locale open source
Prezzo: $0 Developer, $49/mese Production, Enterprise su preventivo
Prova gratuita: il piano Developer è gratuito per sempre, ma dichiaratamente non adatto alla produzione
I confini dei piani sono esposti con insolita chiarezza. Il piano Developer di Portkey registra 10,000 log al mese, conserva i log per tre giorni e le metriche per 30 giorni. La pagina specifica esplicitamente che non è adatto alla produzione.
Production costa $49 al mese e registra 100,000 log; vengono addebitati $9 per ogni ulteriore blocco di 100,000 richieste fino alla soglia pubblicata. I log vengono conservati per 30 giorni e le metriche per 90 giorni. Con 200,000 log registrati, l'abbonamento è di $58 prima dell'inferenza upstream. La stessa pagina afferma che Production non è consigliato quando servono controlli di sicurezza personalizzati o garanzie sulla residenza dei dati.
Per questi requisiti occorre il piano Enterprise. Il prezzo è personalizzato e comprende oltre 10 milioni di log registrati, conservazione su misura, SSO, budget e rate limit granulari, hosting su private cloud e VPC, esportazione verso data lake e conformità avanzata. È un salto significativo da un acquisto da $49 a un processo di procurement.
Portkey pubblica anche un gateway locale open source, eseguibile con npx @portkey-ai/gateway. Consente di provare la superficie di routing o di ospitare autonomamente il percorso dei dati. Chi acquista deve comunque distinguere il gateway locale dall'osservabilità gestita, dalle policy, dal supporto e dai controlli Enterprise che giustificano la posizione di Portkey in questa classifica.
L'attuale transizione del prodotto merita attenzione. La documentazione di Portkey ora lo definisce Prisma AIRS AI Gateway. Le pagine del gateway e i prezzi restano online, ma prima dell'acquisto è opportuno chiedere quale nome comparirà sul contratto, quale roadmap sarà applicata e come gli account Portkey autonomi confluiranno nel portafoglio Palo Alto Networks. È normale diligenza in fase di procurement, non un motivo per scartare lo strumento.
Per i coding agent, il limite è la configurazione. Portkey può operare dietro protocolli compatibili e offre un piano di controllo generale più articolato rispetto a Vercel, ma al momento non propone la stessa esperienza con un comando e nove coding tool. Va scelto quando le policy giustificano il lavoro di integrazione, non perché l'elenco delle funzioni è più lungo.
- Routing gestito completo, con circuit breaker, retry, fallback e canary test
- Supporto MCP, guardrail, budget e rate limit
- Piano Production pubblico da $49 con un contatore chiaro dei log registrati
- Opzione gateway locale open source
- Percorso Enterprise per SSO, deployment privato, residenza e conformità
- Il piano gratuito è esplicitamente inadatto alla produzione
- Il piano Production da $49 è dichiaratamente inadatto a controlli di sicurezza personalizzati o garanzie di residenza
- Il prezzo Enterprise è su preventivo
- La configurazione dei coding tool è meno strutturata rispetto a Vercel
- La transizione a Prisma AIRS solleva domande su contratto e roadmap
6. Cloudflare AI Gateway: il migliore per i team già su Workers
Cloudflare AI Gateway è la scelta a minor attrito quando Cloudflare gestisce già edge, log e sicurezza dell'applicazione. Le funzioni core del gateway sono attualmente gratuite su ogni piano, incluse analytics, caching e rate limiting.

Il prodotto è convincente per un team il cui agente o la cui piattaforma interna per sviluppatori gira già su Workers. Con lo stesso account è possibile chiamare modelli di terze parti e modelli ospitati da Cloudflare attraverso un'interfaccia REST compatibile con OpenAI, registrare costi ed errori, memorizzare in cache le richieste ripetute sicure, applicare rate limit, rilevare dati sensibili e ritentare le chiamate non riuscite.
Ideale per: team che usano già Workers, il logging Cloudflare o i controlli di sicurezza Cloudflare
Punto di forza: gateway core gratuito, integrazione edge, DLP, caching e accesso compatibile con OpenAI a modelli di terze parti
Prezzo: funzioni core a $0; gli acquisti di crediti con Unified Billing aggiungono il 5%; i guardrail seguono i prezzi di Workers AI
Prova gratuita: le funzioni core del gateway sono gratuite, non offerte soltanto per un periodo limitato
La pagina dei prezzi definisce un limite concreto per l'offerta gratuita. Workers Free conserva 100,000 log complessivi tra tutti i gateway. Workers Paid conserva 10 milioni di log per gateway. Log persistenti, analytics, caching e rate limiting sono disponibili su tutti i piani.
Unified Billing aggiunge una commissione del 5% quando i crediti vengono acquistati tramite Cloudflare. Un acquisto di crediti da $2,000 costa quindi $2,100, mentre l'inferenza del provider continua a essere trasferita senza maggiorazioni. La differenza è importante: il prezzo del modello non cambia, ma il consolidamento di credenziali e fatturazione ha un costo.
La scansione Data Loss Prevention è gratuita su tutti i piani. Gli account senza abbonamento Zero Trust ricevono due profili DLP predefiniti, mentre gli altri profili dipendono dall'abbonamento Cloudflare One. I guardrail non rientrano nelle funzioni core gratuite: Cloudflare fattura la valutazione di prompt e risposte come inferenza di token Workers AI.
Cloudflare offre inoltre controlli utili sulle richieste. La documentazione REST supporta timeout per singola richiesta, metodi di retry, fino a cinque tentativi e un ritardo di retry fino a 5,000 millisecondi. Questi controlli possono evitare che un provider lento blocchi per sempre il loop di un agente.
Il limite riguarda l'ergonomia dei coding tool. Cloudflare spiega come le applicazioni chiamano il gateway, ma non offre lo stesso livello di configurazione per agenti specifici proposto da Vercel o dal workflow Requesty per Claude Code. Chi sviluppa deve verificare, per ogni coding tool, come cambiano base URL, autenticazione, individuazione dei modelli e protocollo. Il costo software può essere $0, ma la voce integrazione ricade sul team di ingegneria.
- Analytics core, caching e rate limiting gratuiti
- Accesso compatibile con OpenAI ai modelli Cloudflare e di terze parti
- Scansione DLP gratuita su tutti i piani
- Ottima integrazione con Workers, log Cloudflare e prodotti di sicurezza
- Controlli espliciti per retry e timeout
- Unified Billing aggiunge il 5% agli acquisti di crediti
- Lo storage gratuito dei log si ferma a 100,000 in tutto l'account
- I guardrail generano costi separati di inferenza Workers AI
- Nessuna configurazione dei coding tool comparabile con quella a comando singolo
- I profili DLP completi possono richiedere un abbonamento Zero Trust separato
Quale AI gateway scegliere per ogni esigenza?
Il gateway migliore è quello che elimina l'attuale costo di coordinamento del team senza creare un carico operativo maggiore. Partite dal vincolo non negoziabile, quindi confrontate le commissioni.
Scegliete Vercel AI Gateway per un gruppo eterogeneo che usa Claude Code, Codex, Cursor, OpenCode e agenti simili. La scelta cambia quando il self-hosting è obbligatorio oppure quando i costi devono essere attribuiti a repository e sviluppatori, non soltanto ad agente, chiave e modello.
Scegliete Requesty per un'agenzia, una società di consulenza o un'organizzazione di prodotto che necessita dell'attribuzione per branch, repository e sviluppatore. La scelta cambia quando quei metadati non influenzano le decisioni di budget, perché in tal caso la maggiorazione del 5% acquista informazioni che nessuno usa.
Scegliete LiteLLM per un platform team con pratiche consolidate per container, database, secret, logging e reperibilità. La scelta passa a un gateway gestito quando il proxy finirebbe sotto la responsabilità informale di un product engineer.
Scegliete OpenRouter finché uno sviluppatore indipendente o un team di ricerca sta ancora confrontando modelli e provider. La scelta cambia quando la rosa dei candidati si stabilizza e la commissione ricorrente del 5.5% supera il valore dell'accesso a un catalogo ampio.
Scegliete Portkey quando modelli approvati, guardrail, circuit breaker, canary test e governance gestita costituiscono la motivazione d'acquisto. La scelta cambia se all'organizzazione bastano un endpoint e una dashboard della spesa.
Scegliete Cloudflare AI Gateway quando Workers e la sicurezza Cloudflare sono già pagati e conosciuti dal team. La scelta cambia se adottare la piattaforma circostante richiederebbe più lavoro di integrazione di quello eliminato dal gateway.

C'è un'ultima regola: la scelta del gateway va tenuta separata da quella del coding tool. Claude Code, Codex e Cursor risolvono problemi di ingegneria diversi, mentre il gateway ne controlla il traffico verso i modelli. Un'azienda può standardizzare il gateway senza uniformare l'editor. Spesso è questo il confine di controllo più utile.
Per una selezione più ampia di agenti, confrontate i migliori AI coding agent. Per domande su SSO, conservazione, audit e rollout che vanno oltre il gateway, consultate il confronto dei coding agent per aziende.
Quali soluzioni evitare per questo scopo
Evitate Helicone come acquisto principale quando il problema immediato è configurare i coding tool. Il piano Hobby di Helicone è gratuito per 10,000 richieste, Pro costa $79 al mese e Team $799 al mese. Osservabilità, sessioni, prompt e analisi possono essere preziosi, ma la classifica cambia solo se il problema principale è la visibilità. Per questa ricerca, Helicone non supera l'attuale percorso di configurazione di Vercel, l'attribuzione ai repository di Requesty o il controllo sul deployment di LiteLLM.
Evitate un gateway API generico scelto soltanto perché l'azienda lo possiede già. I gateway tradizionali comprendono route, autenticazione e policy HTTP. Il traffico dei coding agent aggiunge modelli specifici dei provider, conteggio dei token, compatibilità con l'uso dei tool, prompt caching, fallback dei modelli e diversi protocolli di risposta. Estendere un gateway generico può avere senso per un platform team, ma “abbiamo già Kong” non è un piano di implementazione.
Evitate un proxy passthrough sviluppato internamente quando più agenti iniziano a dipenderne. Cambiare una base URL è facile. Gestire adapter dei provider, retry sicuri, risposte in streaming, contatori di budget, isolamento delle chiavi, conservazione dei log e deprecazioni dei modelli significa mantenere un prodotto. Costruitelo solo quando un vincolo unico di policy o deployment giustifica una responsabilità permanente.
Evitate il routing dinamico dei modelli in ogni fase di un loop dell'agente critico per il rilascio finché non avrete valutato la continuità tra modelli. Un router può scegliere un modello efficiente per ciascun task e rendere comunque una patch lunga più difficile da riprodurre. Fissate il modello nelle fasi che producono modifiche, poi usate il routing dinamico per attività di supporto circoscritte.
Infine, evitate di instradare tutti gli sviluppatori fin dal primo giorno. Un gateway può cambiare autenticazione, individuazione dei modelli, caching, gestione degli errori e selezione dei fallback, pur lasciando apparentemente invariata l'interfaccia del coding agent. Ecco perché nel rollout servono un pilota limitato e un rollback diretto verso il provider.
Domande frequenti
Qual è il miglior LLM gateway?
Vercel AI Gateway è la scelta predefinita migliore per i coding agent, perché abbina una configurazione a comando singolo per nove agenti supportati all'assenza di maggiorazioni sui token. LiteLLM è preferibile quando il self-hosting è obbligatorio, Requesty quando conta soprattutto l'attribuzione a repository e sviluppatori e Portkey quando l'acquisto è motivato dalla governance gestita.
Quali sono prezzi e commissioni di OpenRouter nel 2026?
Il piano live Pay as you go di OpenRouter applica una commissione di piattaforma del 5.5%, include 500+ modelli e 80+ provider e non prevede spesa minima. Il piano gratuito è limitato a 25+ modelli gratuiti, 4 provider e 50 richieste al giorno. L'attuale franchigia BYOK di Pay as you go copre $25,000 al mese di inferenza a prezzo di listino, prima dell'applicazione di una commissione del 5%.
Quanto costa Cloudflare AI Gateway nel 2026?
Le funzioni core di Cloudflare AI Gateway sono gratuite. Gli acquisti di crediti con Unified Billing aggiungono il 5%, Workers Free conserva 100,000 log complessivi nell'account, Workers Paid conserva 10 milioni di log per gateway e i guardrail vengono fatturati separatamente come inferenza Workers AI.
Un unico gateway può instradare sia Claude Code sia Codex?
Sì. Il gateway deve supportare i protocolli attesi da ciascun coding tool oppure offrire endpoint di compatibilità dedicati. Vercel documenta endpoint distinti per Claude Code e Codex; con gateway self-hosted o generalisti, invece, spetta all'acquirente validare la configurazione di ogni strumento.
Il piano operativo per la prossima settimana
Non iniziate la settimana migrando l'intera azienda. Usatela per dimostrare che un solo gateway può ridurre l'incertezza sui costi e il rischio legato ai provider in un repository rappresentativo.
Lunedì: definite il perimetro di controllo
Scegliete un repository, un piccolo gruppo di sviluppatori e i due coding agent che usano già. Riassumete in una frase il motivo finanziato: consolidare la fatturazione, recuperare i guasti dei provider, attribuire la spesa, imporre modelli approvati oppure mantenere il traffico in un deployment privato. Se la frase contiene tre obiettivi scollegati, restringete il pilota.
Create una chiave gateway dedicata con un limite rigido di spesa. Selezionate un modello primario e un fallback con supporto comparabile per l'uso dei tool. Conservate la configurazione diretta del provider in un file di rollback e annotate la fattura attuale del provider prima di spostare qualsiasi traffico.
Martedì: collegate il gateway e controllate il diff
Con Vercel, eseguite il comando di configurazione documentato e verificate ogni modifica prima della scrittura. Con Requesty, salvate una copia delle impostazioni di Claude Code e abilitate soltanto gli header di attribuzione che il team utilizzerà. Con LiteLLM, distribuite il proxy attraverso il normale percorso infrastrutturale, non da un portatile. Qualunque sia il gateway, controllate che i secret finiscano nello store approvato.
Eseguite un task circoscritto da ciascun agente. Controllate selezione del modello, chiamate ai tool, streaming, errori, comportamento della cache, costo e identità associata alla richiesta. Una risposta corretta non basta, se la dashboard non sa spiegare chi ha sostenuto la spesa o quale fallback ha risposto.
Mercoledì e giovedì: forzate il percorso di errore
Provocate un timeout controllato oppure usate una route di test che invii il modello primario a un provider non disponibile. Verificate che il fallback conservi il formato di comunicazione richiesto dal coding agent. Controllate se il tentativo fallito viene fatturato, se il fallback usa credenziali diverse e se la traccia identifica entrambi i tentativi.
Assegnate al pilota un bug ordinario, una modifica su più file, un loop di correzione dei test e un task di revisione. Registrate il costo per task completato, gli errori dei provider, le richieste recuperate, il tempo dedicato alle modifiche della configurazione e gli attriti segnalati dagli sviluppatori. Non confrontate il numero dei prompt senza considerare l'esito del lavoro.
Venerdì: acquistate il controllo che ha cambiato una decisione
Adottate il gateway solo se le informazioni o l'affidabilità offerte modificano una decisione operativa. Una richiesta recuperata conta. Lo sforamento del budget di un repository conta. Una violazione delle policy dei provider conta. Una dashboard piena di grafici sui token che nessun responsabile esamina non conta.
Per la maggior parte dei team che usano agenti diversi, la scelta del lunedì è Vercel AI Gateway, con una chiave pilota, un modello primario, un fallback e nessuna funzione aggiuntiva a pagamento finché una policy non la richiede. La scelta diventa Requesty quando la responsabilità dei costi deve arrivare fino a repository e sviluppatore. Diventa LiteLLM quando il percorso dei dati deve rimanere nell'infrastruttura aziendale.
Mantenete versionata la configurazione del gateway, documentato il rollback e ridotta la policy dei modelli. L'obiettivo non è passare attraverso più vendor, ma trasformare il prossimo down di un provider, il prossimo rilascio di un modello e la prossima revisione del budget in una modifica di configurazione anziché in una migrazione aziendale.
3 set 2026







