AI gateway: i migliori per ridurre i costi di inferenza nel 2026
Confronto tra Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey e OpenRouter: prezzi, cache, routing e soglie di pareggio per ridurre i costi AI.

Vercel AI Gateway è oggi il miglior gateway gestito per ridurre i costi di inferenza: con un carico mensile GPT-5.6 Sol da 100 milioni di token in input e 20 milioni in output, la spesa scende dagli $800 dell'attuale prezzo diretto di OpenAI ai $400 dell'attuale tariffa Default di Vercel. Quel risparmio di $400 è una finestra d'acquisto, non una promessa annuale, perché lo sconto del 50% di Vercel termina il 18 settembre 2026.
La lezione destinata a durare va oltre una singola promozione. Un AI gateway riduce la spesa soltanto quando il routing, la cache delle risposte o i budget obbligatori eliminano più costi lato provider di quanti ne aggiunga il gateway tra commissioni e gestione operativa. Vercel è la scelta predefinita senza oneri operativi, LiteLLM quella self-hosted, Cloudflare quella per la cache di richieste perfettamente identiche, TrueFoundry quella gestita per la cache semantica, Portkey quella per la governance da $49 e OpenRouter quella per il marketplace di provider.
I migliori AI gateway in sintesi
Tutti i nomi dei piani, i prezzi pubblici e i limiti riportati di seguito sono stati verificati sulle pagine attive dei fornitori il 24 agosto 2026. La voce "Prova gratuita" distingue un'opzione gratuita permanente da una valutazione a tempo: un prototipo gratis può trasformarsi in una costosa dipendenza di produzione se il suo vero limite resta nascosto.
Il prezzo iniziale, da solo, non rivela il vincitore. La licenza di LiteLLM può essere gratuita mentre il suo control plane assorbe ore di lavoro tecnico. Le funzioni principali di Cloudflare possono essere gratuite, mentre Unified Billing aggiunge il 5%. TrueFoundry può evitare intere chiamate al modello grazie al riuso semantico, ma il primo piano di produzione costa $499 al mese. Il confronto corretto riguarda ciò che resta sulla fattura complessiva dopo che il gateway ha svolto il proprio lavoro.
L'equazione del risparmio prima della classifica
L'equazione utile per il budget è spesa residua per i provider + commissioni del gateway + controlli a pagamento + costo operativo. Un gateway merita un posto soltanto se questo totale è inferiore a quello dell'accesso diretto per lo stesso numero di risultati accettati. Numero di modelli, qualità della dashboard e ampiezza del failover sono vantaggi, ma diventano risparmi solo quando eliminano spesa o errori costosi dal workflow.
Per mettere in luce le differenze, partiamo da una fattura normalizzata. OpenAI indica attualmente GPT-5.6 Sol a $4 per milione di token in input e $20 per milione di token in output. Un workflow che usa 100 milioni di token in input e 20 milioni in output costa quindi $800, prima di sconti sugli input in cache, tool o moltiplicatori per il contesto lungo: $400 per l'input e $400 per l'output.
L'aggiornamento dei prezzi di Vercel pubblicato ad agosto quota lo stesso modello a $2 per l'input e $10 per l'output nel livello di servizio Default scontato fino al 18 settembre. Il mese normalizzato scende a $400, con una riduzione del 50%. Flex costa attualmente $1 per l'input e $5 per l'output, mentre Priority costa $4 per l'input e $20 per l'output, sempre per milione di token e per richieste fino a 272,000 token inclusi.

La tariffa del modello è soltanto la prima leva. Una risposta trovata nella cache esatta può evitare del tutto la chiamata al provider. Il routing verso un modello più economico può ridurre il costo unitario, ma solo se i risultati continuano a superare la soglia di accettazione. Un tetto di spesa può fermare un agente fuori controllo: non è uno sconto sui token, ma può diventare il maggior risparmio del mese. La metrica operativa corretta è il costo per risultato accettato, inclusi tentativi ripetuti e revisione, non il costo per token preso isolatamente.
Per la selezione dei prezzi dei provider sottostanti, consulta il confronto delle API AI più economiche. Questa classifica parte dal livello superiore e valuta se un gateway riesce, nella pratica, a rendere ancora più convenienti quei prezzi.
1. Vercel AI Gateway: la scelta migliore per ridurre i costi con un servizio gestito
Vercel AI Gateway è la scelta migliore in assoluto per un team che cerca un gateway gestito, senza ricarico sui token e con una riduzione concreta dei costi disponibile subito.

Il suo argomento più forte è insolitamente concreto. La pagina dei prezzi attuale specifica che sia Free sia Paid applicano le tariffe di listino dei provider senza ricarico; l'attuale promozione su GPT-5.6 Sol dimezza poi di un ulteriore 50% la tariffa Default del modello. Un founder con capitale disponibile che sposta un workflow ad alto volume, per esempio di estrazione dati o assistenza, può dimezzare la voce normalizzata del modello da $800 a $400 senza doversi fare carico di un proxy self-hosted.
Il piano Free include $5 di credito mensile, copre un sottoinsieme di modelli idonei, applica limiti di traffico più bassi e specifici per modello e non consente il bring-your-own-key. Il piano Paid usa crediti acquistati, apre tutti i modelli disponibili, innalza i limiti e abilita BYOK senza commissioni del gateway Vercel né vincoli contrattuali. L'acquisto di crediti trasferisce il team su Paid, quindi il credito mensile di $5 del piano Free non si applica più.
BYOK presenta un dettaglio di fatturazione che merita una voce nel runbook. Quando una richiesta effettuata con le credenziali del provider del cliente fallisce, Vercel può ritentare con le proprie credenziali di sistema per garantire l'affidabilità; quel fallback viene addebitato sul saldo dei crediti gateway del team. Chi si aspetta che ogni richiesta resti sul proprio account negoziato con il provider dovrebbe monitorare il saldo e riconciliare il traffico di fallback, invece di considerare BYOK una garanzia che i crediti Vercel non verranno mai toccati.
Il messaggio "zero ricarico" esclude inoltre i controlli a pagamento. Custom Reporting costa $0.075 ogni 1,000 scritture di tag, ID utente o entità di quota e $5 ogni 1,000 query di reporting. Una allowlist dei provider valida per l'intero team costa $0.10 ogni 1,000 richieste riuscite sui piani Pro ed Enterprise, mentre un filtro dei provider per singola richiesta non comporta costi aggiuntivi. L'applicazione della conservazione zero dei dati a tutto il team costa altri $0.10 ogni 1,000 richieste, sebbene lo ZDR per singola richiesta sia gratuito su Pro ed Enterprise.
I trace drain aggiungono $0.05 ogni 1,000 trace più $0.50 per GB di traffico in uscita, senza alcuna quota inclusa nel piano Pro. Su un milione di richieste riuscite, una allowlist estesa al team vale $100, lo ZDR esteso al team altri $100 e un milione di trace $50 prima dell'egress. Il gateway può comunque restare l'opzione più economica, ma l'acquirente deve confrontare la fattura configurata, non soltanto la promessa di assenza di ricarico sui token.
Il limite, detto senza giri di parole, è il tempo. Lo sconto su Sol rappresenta un'eccellente finestra per migrare, ma una pessima tesi architetturale permanente. Vercel resta interessante dopo la promozione se routing senza ricarico, budget, failover e osservabilità sostituiscono attività che altrimenti ricadrebbero sul team. Se invece il prodotto usa un solo modello stabile di un provider e non richiede nessuno di questi controlli, allo scadere dello sconto la fatturazione diretta può tornare in vantaggio.
Ideale per: Team piccoli o di fascia media che cercano routing gestito, controllo della spesa e nessun ricarico pubblico sui token.
Punto di forza: L'attuale tariffa Default di GPT-5.6 Sol trasforma il mese normalizzato da $800 diretti a $400 fino al 18 settembre.
Prezzi: Free include $5/mese sui modelli idonei; Paid usa crediti acquistati alle tariffe di listino dei provider senza ricarico; reporting, policy e trace opzionali hanno contatori separati.
Prova gratuita: Un piano Free permanente, non una prova a tempo.
- Nessun ricarico pubblico sui token, sia con Free sia con Paid.
- L'attuale sconto su Sol genera un risparmio misurabile del 50% sul carico normalizzato.
- Paid supporta BYOK senza commissioni del gateway.
- Il filtro dei provider per singola richiesta è disponibile senza il costo della allowlist estesa al team.
- Lo sconto decisivo su Sol termina il 18 settembre 2026.
- L'acquisto di crediti elimina il credito Free ricorrente di $5.
- In caso di richiesta BYOK fallita, il fallback sulle credenziali di sistema può consumare crediti Vercel.
- Reporting, policy estese al team e trace possono creare voci di consumo separate.
Il percorso di adozione più prudente mantiene reversibile il confronto:
Isola un workflow con un esito accettabile
Scegli un'attività con una condizione di superamento misurabile, come un'estrazione strutturata valida o una risposta di assistenza approvata. Assegnale una chiave gateway separata, così spesa ed errori non si confondono con il resto del prodotto.
Fissa il riferimento dell'accesso diretto
Registra una settimana rappresentativa di token in input, token in output, tentativi ripetuti, latenza e risultati accettati sul routing diretto del provider. Il risparmio sul prezzo unitario conta soltanto se il tasso di accettazione non diminuisce.
Instrada un 10% circoscritto
Invia il 10% di quel workflow attraverso Vercel, mantenendo lo stesso modello e livello di servizio. Imposta sulla chiave un budget coerente con il campione, così un errore di configurazione non trasforma il confronto in un conto senza limiti.
Riconcilia tutte e quattro le voci di costo
Somma l'utilizzo del modello, eventuali controlli di reporting o policy a pagamento, i trace e il costo di revisione o dei tentativi ripetuti. Verifica se una richiesta BYOK fallita ha consumato crediti di sistema.
Prendi la decisione di settembre
Mantieni il routing soltanto se il costo per risultato accettato batte l'accesso diretto e i controlli gestiti giustificano il prezzo successivo alla promozione. Segna il 18 settembre sul calendario del budget e ricalcola i costi prima della scadenza.
2. LiteLLM: il miglior gateway self-hosted quando il platform team esiste già
LiteLLM è il miglior gateway self-hosted per un'azienda che gestisce già un'infrastruttura condivisa e vuole una voce di licenza del gateway pari a $0.

Il piano Open Source è gratuito per sempre e self-hosted. Espone 100+ provider attraverso un'unica API compatibile con OpenAI e include chiavi virtuali, utenti e team, monitoraggio della spesa, budget, rate limit, fallback, log e Prometheus. Per il CTO di un'azienda di fascia media il cui platform team gestisce già container, metriche, secret e reperibilità, può accorpare la logica dei provider senza aggiungere una licenza mensile per il gateway.
La parola gratis si ferma al confine della licenza. L'azienda deve comunque fornire capacità di calcolo, un datastore quando necessario, pipeline di deployment, aggiornamenti, verifiche di sicurezza, osservabilità e la persona che interviene quando il gateway si guasta. LiteLLM è l'opzione più conveniente soltanto quando queste attività rientrano già nel carico marginale del platform team o quando il self-hosting è un requisito inderogabile.
Il piano Enterprise è un contratto annuale personalizzato, dimensionato sulla capacità annua di richieste al gateway, sull'architettura di deployment e sulle esigenze di supporto, mai sul volume di token. Aggiunge SSO e SCIM, controlli OIDC o JWT, audit log, integrazione con il secret manager e rotazione delle chiavi, amministrazione dell'organizzazione, opzioni multi-region, supporto formale e deployment air-gapped. La pagina pubblica offre una prova Enterprise di 30 giorni senza carta di credito, ma non indica un prezzo in dollari.
Questa base tariffaria cambia il calcolo del punto di pareggio. Un team con una spesa in token molto alta ma una capacità di richieste moderata può evitare una commissione percentuale sui modelli costosi. Un team con una spesa minima per i modelli e senza una funzione platform può spendere in attenzione del personale più di quanto chiederebbe un gateway gestito. Il criterio di inversione non è soltanto il volume delle richieste: conta se il costo mensile incrementale per gestire LiteLLM è inferiore alle tariffe della piattaforma ospitata e al lavoro operativo che sostituisce.
LiteLLM si adatta anche a un'azienda regolamentata che deve mantenere il data plane nel proprio ambiente. Questo controllo può giustificare la scelta anche quando la sola fattura dei modelli non diminuisce. La riduzione dei costi diventa allora una conseguenza secondaria del routing tra provider, dei budget e dei controlli centralizzati, non la prova che il self-hosting sia economico per definizione.
Ideale per: Team con una funzione platform già esistente, requisiti di self-hosting o una scala sufficiente a rifiutare commissioni del gateway basate su percentuali.
Punto di forza: Una licenza open source da $0 con budget, chiavi virtuali, fallback, log e 100+ provider.
Prezzi: Open Source è $0 per sempre; Enterprise prevede un preventivo annuale personalizzato basato su capacità di richieste, architettura e supporto.
Prova gratuita: 30 giorni per Enterprise senza carta di credito; Open Source è sempre gratuito in self-hosting.
- Nessun costo di licenza open source e nessuna commissione del gateway per token.
- Budget, chiavi, fallback e log centralizzati su 100+ provider.
- Enterprise supporta governance e deployment air-gapped.
- L'utilizzo di modelli costosi non fa aumentare automaticamente la licenza Enterprise in base alla spesa per token.
- Con Open Source, l'acquirente è responsabile di infrastruttura, aggiornamenti, affidabilità e gestione degli incidenti.
- Enterprise non ha un prezzo pubblico, quindi il procurement non può fare una previsione basandosi solo sul sito.
- Un piccolo team senza capacità platform può trasformare una licenza gratuita nella scelta operativa più costosa.
3. Cloudflare AI Gateway: il migliore per traffico ripetuto identico byte per byte
Cloudflare AI Gateway riduce meglio i costi quando una quota significativa delle richieste consiste in ripetizioni sicure e identiche byte per byte e il team può utilizzare BYOK.

Cloudflare rende insolitamente semplice calcolare il costo delle funzioni principali. Analisi della dashboard, cache e rate limiting sono gratuiti con tutti i piani. Workers Free conserva 100,000 log complessivi tra tutti i gateway e consente 10 gateway per account. Workers Paid conserva 10 milioni di log per gateway e ne consente 20; Logpush è riservato a Paid, include 10 milioni di richieste al mese e costa $0.05 per ogni milione aggiuntivo.
La cache è il vero meccanismo di risparmio e il suo limite è ben preciso. La chiave di cache predefinita di Cloudflare comprende provider, endpoint, modello, header di autenticazione del provider e intero corpo della richiesta. Qualsiasi differenza nei messaggi, nei tool o nei parametri del modello genera un'altra voce. Un cache hit evita la chiamata al provider, ma due prompt che esprimono lo stesso concetto con parole diverse non coincidono, a meno che il team non progetti intenzionalmente una chiave personalizzata e sia in grado di dimostrarne la sicurezza.
La durata minima della cache è 60 secondi, quella massima è un mese e una richiesta memorizzabile può pesare al massimo 25 MB. È una soluzione adatta ad attività di classificazione ripetute, spiegazioni statiche condivise o prompt batch deterministici. È invece una scelta predefinita poco indicata per assistenza personalizzata, dati di origine mutevoli o output creativi stocastici, dove una risposta vecchia ma economica può fare più danni di una nuova chiamata al modello.
Il percorso di fatturazione conta quanto il tasso di cache hit. BYOK mantiene gratuito il nucleo del gateway e paga direttamente i provider. Unified Billing trasferisce i prezzi di inferenza dei provider, ma aggiunge il 5% ai crediti acquistati: $100 di crediti costano quindi $105. È inoltre limitato a 200 richieste ogni 60 secondi per gateway; Cloudflare afferma che questo rate limit non si applica a BYOK.
Applichiamo alla fattura normalizzata da $800 un'ipotesi esplicita del 25% di ripetizioni esatte. Se quelle richieste ripetute hanno la stessa distribuzione di token e possono essere riutilizzate in sicurezza, con la cache BYOK restano $600 di spesa per i provider e si risparmiano $200. Unified Billing aggiunge il 5% ai $600 residui, portando il totale a $630 e il risparmio netto a $170. Un tasso di hit inferiore può annullare il vantaggio; uno superiore e sicuro rende Cloudflare difficile da battere.
La scansione DLP è gratuita con tutti i piani e offre due profili predefiniti agli account senza abbonamento Zero Trust. I guardrail non sono gratuiti: la valutazione usa un modello Workers AI e viene fatturata alle tariffe per token di Workers AI. È un altro esempio del corretto perimetro contabile: la cache può essere gratis mentre il livello di sicurezza aggiunge un'inferenza propria.
Ideale per: Utenti Cloudflare con richieste deterministiche e ripetute e un team disposto a misurare la sicurezza della cache.
Punto di forza: Cache gratuita delle risposte esatte, capace di eliminare la chiamata al provider in caso di hit.
Prezzi: Analisi principali, cache e rate limiting sono gratuiti; Unified Billing aggiunge il 5%; log, Logpush e guardrail prevedono limiti o contatori separati.
Prova gratuita: Funzioni principali sempre gratuite e spazio log di Workers Free, non una prova a tempo.
- Analisi principali del gateway, cache e rate limiting costano $0.
- Un cache hit esatto elimina la chiamata al provider, invece di scontare soltanto qualche token del prompt.
- BYOK evita la commissione del 5% di Unified Billing e il suo rate limit sulle credenziali gestite.
- Il comportamento della cache e i limiti rigidi sono documentati con chiarezza.
- La cache predefinita richiede una corrispondenza esatta, quindi le variazioni conversazionali producono miss.
- Unified Billing aggiunge il 5% ed è limitato a 200 richieste ogni 60 secondi per gateway.
- Lo spazio gratuito per i log è condiviso tra i gateway e si ferma a 100,000 record.
- Una chiave personalizzata non sicura può restituire contenuti obsoleti o appartenenti a un altro contesto.
4. TrueFoundry AI Gateway: il migliore per la cache semantica gestita
TrueFoundry AI Gateway è la scelta gestita migliore quando richieste formulate in modo diverso pongono spesso la stessa domanda, la cui risposta può essere riutilizzata in sicurezza.

La differenza sta nella cache semantica. La documentazione della cache di TrueFoundry spiega che la modalità esatta crea un hash dell'intera richiesta, mentre quella semantica genera l'embedding del messaggio finale e ne confronta il significato con le richieste precedenti. Tutti gli altri parametri devono comunque coincidere. Un hit nella cache della risposta completa evita l'invocazione dell'LLM e non genera costi LLM: un servizio di assistenza che riceve molte varianti di "Come reimposto la password?" può quindi riutilizzare una risposta approvata invece di pagare ogni formulazione.
La cache viene isolata automaticamente per utente o account virtuale; namespace opzionali possono separare tenant o ambienti. È un dettaglio essenziale, perché un tasso di hit elevato non vale nulla se la risposta memorizzata di un cliente arriva a un altro. Una cache semantica self-hosted richiede Redis e un modello di embedding; il servizio SaaS gestisce questa infrastruttura.
La pagina pubblica dei prezzi presenta quattro piani. Developer costa $0 al mese per 50,000 richieste e 3 utenti. Pro costa $499 al mese per 1 milione di richieste e 10 utenti. Altri 2 milioni di richieste più 5 chiavi API costano ulteriori $499 al mese. Pro Plus costa $2,999 al mese per 1 milione di richieste e 25 utenti, mentre il consumo aggiuntivo richiede un preventivo commerciale. Enterprise offre prezzi personalizzati in base alla capacità di richieste e utenti e supporta deployment VPC e air-gapped.
La pagina pubblicizza una prova gratuita di 7 giorni, mentre la pagina del gateway offre ogni mese le prime 50,000 richieste gratis e senza carta su 1,600+ modelli. È sufficiente per misurare un tasso di cache hit realistico prima di passare a Pro. Non autorizza però a dedurre un risparmio in produzione da un set sintetico di FAQ.
Con una spesa modesta, la soglia da superare sulla sola fattura dei modelli è alta. Rispetto ai $800 normalizzati del provider, l'abbonamento Pro da $499 deve evitare almeno $499 di spesa per i modelli, circa il 62.4%, prima di risultare più conveniente sul solo costo di inferenza. Governance, isolamento, osservabilità e tempo del personale possono giustificare Pro anche con un tasso di hit inferiore, ma sono vantaggi distinti e vanno dichiarati come tali.
Il vero limite è un riuso errato. Una soglia semantica troppo permissiva può restituire una risposta precedente che sembra pertinente ma viola il contesto o le policy dell'utente corrente. Un test sicuro valuta le risposte in cache e quelle nuove sullo stesso insieme di criteri di accettazione, segmenta per tenant e disabilita la cache per domande legate a conti aggiornati in tempo reale o a contesti legali, medici o di disponibilità variabile.
Ideale per: Workflow di assistenza, knowledge base e FAQ con intenti ripetuti ma formulazioni diverse.
Punto di forza: Cache semantica gestita delle risposte complete, con isolamento automatico degli account e namespace opzionali.
Prezzi: Developer $0; Pro $499/mese; Pro Plus $2,999/mese; Enterprise personalizzato, con i limiti pubblicati di richieste e utenti indicati sopra.
Prova gratuita: Una prova di 7 giorni più un piano Developer permanente da 50,000 richieste/mese.
- La cache semantica può eliminare intere chiamate al modello che una cache esatta non intercetta.
- Le voci in cache sono isolate per utente o account virtuale in modo predefinito.
- Developer offre abbastanza richieste mensili per una valutazione circoscritta del tasso di hit.
- Enterprise offre deployment VPC e air-gapped.
- La soglia mensile di $499 del piano Pro richiede risparmi significativi o un valore concreto di governance.
- Pro Plus costa $2,999 pur indicando ancora 1 milione di richieste mensili.
- I falsi positivi semantici possono trasformare un risparmio in un problema di qualità o di separazione dei dati.
- La cache semantica self-hosted aggiunge la gestione di Redis e del modello di embedding.
5. Portkey: il miglior passo avanti nella governance gestita a $49
Portkey è la migliore opzione gestita con una soglia d'ingresso bassa per un team che ha superato la fase di prototipo ma non può giustificare un gateway di produzione da $499.

La gamma parte da Open Source, che è self-hosted, non impone limiti alle richieste e include API universale, tentativi ripetuti e timeout, routing, guardrail, fallback automatici, dashboard di base, bilanciamento del carico e supporto della community. La pagina non indica un prezzo di licenza per questa opzione, quindi va valutata come LiteLLM: il controllo è elevato, ma i costi dell'infrastruttura e dell'operatore restano a carico dell'acquirente.
Il piano ospitato Developer è Free Forever, consente 10,000 richieste al mese, non prevede eccedenze ed è espressamente pensato per prototipi e proof of concept enterprise, non per la produzione. Production costa $49 al mese, include 100,000 richieste e aggiunge $9 al mese per ogni ulteriore blocco di 100,000 richieste fino a 3 milioni. Comprende cache semplice e semantica, accesso basato sui ruoli, chiavi per service account e supporto per la produzione.
Con un milione di richieste mensili, Production costa $130 prima dell'utilizzo dei modelli: $49 per le 100,000 richieste incluse più nove blocchi aggiuntivi da $9 per le restanti 900,000. Questo è il riferimento utile per il confronto. Portkey deve recuperare più di $130 attraverso cache, routing, applicazione dei budget o lavoro operativo per battere un gateway senza commissioni sul carico normalizzato.
Enterprise adotta prezzi e capacità di richieste personalizzati. Aggiunge SSO, budget e rate limit granulari, opzioni private cloud o VPC e controlli di conformità più estesi. Un'organizzazione regolamentata può acquistare questo piano per la governance anche se la fattura del provider non cambia.
C'è una particolarità nei nomi che vale la pena annotare nei documenti di acquisto. La pagina dei prezzi attuale chiama Production il piano da $49, mentre la documentazione corrente definisce Pro lo stesso piano da $49. La pagina dei prezzi afferma inoltre che Portkey ora si chiama Prisma AIRS AI Gateway. Questi nomi vanno riconciliati nel modulo d'ordine prima che un team automatizzi i controlli sul piano o scriva una policy di rinnovo basata su di essi.
Portkey si colloca dietro TrueFoundry per profondità della cache semantica, perché i suoi materiali pubblici non rendono altrettanto verificabile il meccanismo di risparmio. Supera invece OpenRouter per un team che preferisce una tariffa base ospitata e prevedibile a una percentuale su ogni acquisto di crediti condivisi. Il prezzo d'ingresso di $49 rende finanziariamente leggibile un test controllato in produzione.
Ideale per: Un prodotto AI in crescita che necessita di cache ospitata, ruoli, chiavi, routing e supporto con un budget mensile a tre cifre per il control plane.
Punto di forza: Production parte da $49 e arriva a un milione di richieste mensili per $130, prima dell'utilizzo dei modelli.
Prezzi: Open Source self-hosted; Developer Free Forever; Production $49/mese più $9 per ogni ulteriore blocco di 100,000 richieste; Enterprise personalizzato.
Prova gratuita: Il piano Developer permanente offre 10,000 richieste/mese, ma non è adatto alla produzione.
- Il primo piano ospitato per la produzione parte da $49 al mese.
- Production include cache semplice e semantica.
- Le eccedenze prevedibili per blocchi di richieste sono più facili da mettere a budget rispetto a una percentuale sui token.
- Open Source ed Enterprise coprono esigenze di controllo opposte.
- Con un milione di richieste, il prezzo pubblicizzato di $49 sale a $130 prima dell'inferenza.
- Developer si ferma a 10,000 richieste senza eccedenze e non è un'opzione di produzione.
- L'alternanza dei nomi Production e Pro crea un'ambiguità evitabile per il procurement.
- I costi di Enterprise restano vincolati a un preventivo commerciale.
6. OpenRouter: il miglior marketplace per ordinare il routing dei provider in base al prezzo
OpenRouter è il miglior gateway quando l'obiettivo è scegliere tra molti provider e modelli in base al prezzo, non ridurre la voce del gateway mantenendo invariato il routing.

Il piano Free offre 25+ modelli gratuiti tramite 4 provider gratuiti, con 50 richieste al giorno e supporto della community. Pay-as-you-go apre l'accesso a 500+ modelli e 80+ provider senza spesa minima, ma aggiunge ai crediti condivisi una commissione di piattaforma del 5.5%. La commissione sull'acquisto dei crediti ha un minimo di $0.80 e il finanziamento tramite criptovalute costa il 5%.
Enterprise mantiene il catalogo di 500+ modelli e 80+ provider, aggiunge fatturazione, controlli gestiti, limiti dedicati opzionali, SLA contrattuale e un canale Slack condiviso per il supporto. I prezzi prevedono impegni di volume personalizzati e possono includere sconti sulle commissioni. È un piano da procurement, non un abbonamento pubblico per postazione.
BYOK modifica la decisione. Pay-as-you-go include ogni mese $25,000 di inferenza BYOK al prezzo di listino senza commissioni OpenRouter, poi applica il 5% oltre quella soglia. Enterprise porta la quota senza commissioni a $200,000 al mese, applicando poi il 5%. Un'azienda che possiede già account diretti presso i provider può quindi usare il livello di controllo di OpenRouter senza pagare la percentuale sui crediti condivisi finché resta nella quota inclusa.
La funzione che riduce i costi è la selezione dei provider. OpenRouter può ordinare quelli idonei per prezzo, imporre un prezzo massimo ed eseguire il fallback quando un routing fallisce. La sua cache delle risposte, in beta, restituisce richieste perfettamente corrispondenti senza consumo fatturabile e funziona tra modelli diversi, ma non è una cache semantica. L'ordinamento per prezzo consente di risparmiare soltanto se i provider sono intercambiabili per i requisiti di qualità, policy dei dati, latenza e disponibilità del carico di lavoro.
Su una fattura del provider invariata da $800, i crediti condivisi aggiungono $44 e portano il totale a $844. OpenRouter deve quindi recuperare più di $44 attraverso un provider idoneo più economico, cache hit, minori costi degli errori o operazioni più semplici per battere la fatturazione diretta. Se un solo provider serve già il carico in modo affidabile alla tariffa contrattata, il marketplace è un costo opzionale.
La guida dettagliata ai prezzi di OpenRouter analizza minimi delle commissioni, regole BYOK, rischi dei metodi di finanziamento e confronto del routing. Il verdetto pratico, qui, è più circoscritto: OpenRouter permette di risparmiare quando il team usa attivamente il suo mercato, non quando aggiunge semplicemente un altro URL davanti alla stessa richiesta.
Ideale per: Team che passano davvero tra provider o famiglie di modelli e possono misurare il risparmio prodotto da questa scelta.
Punto di forza: Routing ordinato per prezzo su 500+ modelli e 80+ provider, con ampie quote BYOK senza commissioni.
Prezzi: Free $0; Pay-as-you-go applica i prezzi dei modelli più il 5.5% sui crediti condivisi; Enterprise personalizzato, con possibili sconti sulle commissioni.
Prova gratuita: Un piano Free permanente con 25+ modelli gratuiti e 50 richieste/giorno.
- Il marketplace di provider più ampio di questa selezione.
- Il routing può ordinare per prezzo, fissare un tetto e attivare il fallback.
- BYOK non applica commissioni del gateway fino a $25,000/mese su Pay-as-you-go o $200,000/mese su Enterprise.
- I cache hit esatti delle risposte riportano un utilizzo fatturabile pari a zero.
- I crediti condivisi aggiungono il 5.5% anche se il routing sottostante non cambia.
- Il minimo di $0.80 rende i piccoli acquisti di crediti più costosi rispetto alla percentuale pubblicizzata.
- La cache esatta non intercetta richieste formulate con parole diverse.
- Cambiare provider può modificare latenza, policy o qualità dell'output anche quando il nome del modello coincide.
Quale AI gateway scegliere per ogni scenario
Vercel è la scelta predefinita per un team che vuole routing gestito e nessun ricarico pubblico sui token. La decisione si sposta altrove quando termina l'attuale sconto sul modello e i controlli restanti non fanno più risparmiare rispetto all'accesso diretto, oppure quando la configurazione di policy e trace estesa al team rende rilevante la fattura degli add-on.
LiteLLM è la scelta giusta quando il self-hosting è obbligatorio o un platform team già esistente può assorbire il gateway con un costo marginale basso. Conviene passare a un servizio gestito quando LiteLLM richiede un nuovo responsabile operativo, un nuovo servizio di reperibilità o un preventivo Enterprise superiore alla fattura completa dell'alternativa ospitata.
Cloudflare vince quando i corpi delle richieste si ripetono alla perfezione, la risposta in cache può essere riutilizzata in sicurezza e BYOK è compatibile con il contesto. La scelta passa a TrueFoundry quando formulazioni diverse esprimono lo stesso intento e una cache semantica misurata supera la soglia di qualità. Torna invece a una soluzione senza cache quando aggiornamento dei dati, personalizzazione o contesto del tenant rendono rischioso il riuso.
TrueFoundry è la scelta migliore per il riuso semantico gestito soltanto dopo che una valutazione reale dimostra un numero di cache hit accettati sufficiente a coprire il piano. Portkey vince quando il team ha bisogno di un control plane di produzione ospitato e meno costoso e può rispettarne la struttura per richieste. OpenRouter vince quando l'ordinamento dei provider per prezzo o il consolidamento BYOK fa risparmiare più della sua commissione.

La scelta predefinita più solida potrebbe comunque essere nessun gateway. Un carico stabile e ad alto volume su un solo provider, con buoni budget nativi, costi degli errori contenuti e pochi contenuti ripetuti, non presenta un risparmio evidente legato al gateway. Aggiungi un control plane soltanto quando uno specifico vantaggio di routing, cache, governance o gestione operativa supera il suo costo complessivo.
Come sono stati scelti questi AI gateway
La classifica assegna il peso maggiore ai fattori economici verificabili da un acquirente: 35% al costo pubblico del gateway e alla trasparenza delle commissioni, 30% a un meccanismo credibile capace di eliminare spesa per i modelli, 20% ai limiti che emergono in produzione e 15% all'onere operativo e alla difficoltà della migrazione.
Pagine dei prezzi, confronti tra piani, documentazione delle funzioni, comportamento della cache, limiti delle richieste e aggiornamento di GPT-5.6 Sol sono stati verificati online il 24 agosto 2026. La pipeline di pubblicazione acquisisce una schermata reale della pagina dei prezzi per ogni gateway in classifica. In questa analisi gli strumenti non sono stati provati con traffico di produzione, quindi nessun dato su latenza, uptime, cache hit o qualità dell'output viene presentato come risultato di un test.
Sei gateway sono entrati nella selezione finale perché ciascuno svolge un compito di costo distinto e verificabile. Vercel elimina il ricarico della piattaforma gestita e applica attualmente uno sconto a un modello importante. LiteLLM elimina la voce di licenza tramite self-hosting. Cloudflare evita le chiamate ripetute esatte. TrueFoundry mira alle ripetizioni semantiche. Portkey vende un passaggio gestito dai costi chiari. OpenRouter espone la concorrenza di prezzo tra provider.
Una funzione non è stata conteggiata come risparmio soltanto perché il fornitore la descrive come ottimizzazione. I calcoli usano un carico dichiarato, un prezzo identificabile e un'ipotesi di cache esplicita. Prima di firmare un contratto annuale, ogni azienda dovrebbe sostituire questi valori con la propria combinazione di modelli, il proprio tasso di output accettati e il costo dei propri operatori.
Le opzioni da evitare
Kong AI Gateway in un progetto nuovo che mette i costi al primo posto
Kong AI Gateway non è la prima scelta quando l'unico obiettivo è ridurre i costi di inferenza. Gli attuali prezzi di Kong offrono una prova di Konnect di 30 giorni; in seguito, i plugin AI Gateway a pagamento diventano un add-on del piano Plus e costano $100 al mese per ogni modello univoco utilizzato tramite proxy dai plugin AI, con un limite di cinque modelli. Cinque modelli generano una voce proxy mensile di $500 prima dell'utilizzo per l'inferenza e degli altri costi della piattaforma.
Questo non significa che Kong sia una cattiva piattaforma. Un'azienda che già standardizza API, sicurezza e governance dei servizi su Kong può trovare i controlli AI incrementali più convenienti dell'aggiunta di un altro fornitore. Il consiglio è più circoscritto: non introdurre una piattaforma API generalista in uno stack AI nuovo soltanto per inseguire risparmi sui token, quando esistono gateway senza ricarico e con funzioni principali gratuite.
Un proxy sviluppato internamente senza un responsabile
Un proxy interno minimale sembra gratuito finché non diventa responsabile di tentativi ripetuti, cambiamenti dei provider, budget, log, secret e incidenti. Costruiscilo soltanto quando il carico è abbastanza stabile da mantenere ridotta la superficie e un team ben identificato possiede già il servizio. In caso contrario, il proxy nasconde il proprio costo nelle ore di sviluppo e offre meno controlli delle opzioni gestite.
Qualsiasi gateway con un solo provider e nessuna risposta riutilizzabile
L'ampiezza del routing non ha valore quando il traffico non si sposta mai. Le cache esatte e semantiche non hanno valore quando ogni richiesta richiede una risposta aggiornata. Se i budget e i log nativi del provider sono sufficienti, l'API diretta presenta meno livelli di fatturazione e una superficie di errore più piccola.
Un piano permanente basato sullo sconto di settembre
L'attuale promozione Vercel su Sol è l'offerta immediata migliore della classifica e anche quella più facile da usare male. Considera il 18 settembre una data obbligatoria per ricalcolare i prezzi. L'architettura deve restare sostenibile alle tariffe di listino del provider, anche se la promozione è il motivo per avviare subito il test di migrazione.
La mossa di lunedì: misura un workflow in base al costo per risultato accettato
Scegli un workflow di produzione che la scorsa settimana ha generato una spesa rilevante per i modelli e può essere valutato con una regola di accettazione binaria. Esporta token in input, token in output, spesa per il provider, tentativi ripetuti e risultati accettati. Escludi dati personali, riservati e dei clienti da qualsiasi set di valutazione non approvato per il routing scelto.
Instrada il 10% del traffico della prossima settimana attraverso il gateway il cui meccanismo corrisponde al carico. Usa Vercel per la finestra di prezzo gestita su Sol, Cloudflare per ripetizioni esatte già dimostrate, TrueFoundry per domande equivalenti ma formulate diversamente, LiteLLM per una piattaforma self-hosted esistente, Portkey per un control plane gestito con una soglia d'ingresso bassa oppure OpenRouter per una vera concorrenza di prezzo tra provider.
Imposta un budget rigido sulla chiave isolata e definisci una condizione di arresto prima della prima richiesta. Interrompi il test se il tasso di risultati accettati diminuisce, la sicurezza della cache fallisce, il routing verso un provider viola una policy o la voce totale del gateway supera i risparmi. Alla fine della settimana, dividi per il numero di risultati accettati la somma di spesa per i modelli, tariffe di piattaforma, controlli a pagamento, tentativi ripetuti e costo della revisione.
Il risultato del lunedì è una decisione condivisibile da finanza e ingegneria: mantenere, sostituire o rimuovere il gateway. Se vince Vercel, aggiungi al calendario un nuovo calcolo dei prezzi il 18 settembre. Se vince una cache, distribuiscila soltanto per le classi di richieste che hanno superato il test. Se non vince nessuno, conserva l'accesso diretto ed evita di pagare per complessità facoltativa.
Domande frequenti sugli AI gateway
Quanto costa Cloudflare AI Gateway?
Le funzioni principali di Cloudflare AI Gateway per analisi, cache e rate limiting sono gratuite con tutti i piani. Workers Free conserva 100,000 log complessivi tra tutti i gateway; Workers Paid ne conserva 10 milioni per gateway. Unified Billing aggiunge il 5% ai crediti acquistati, mentre i prezzi dei provider vengono trasferiti senza ricarico. Logpush e l'inferenza dei guardrail possono generare costi separati.
Qual è il miglior AI gateway?
Vercel AI Gateway è la migliore scelta gestita in assoluto al 24 agosto 2026, perché unisce l'assenza di ricarico pubblico sui token a un attuale sconto del 50% su GPT-5.6 Sol fino al 18 settembre. LiteLLM è più adatto ai team che gestiscono già un'infrastruttura self-hosted, Cloudflare alla cache delle ripetizioni esatte, TrueFoundry alla cache semantica gestita, Portkey a un ingresso in produzione da $49 e OpenRouter all'ordinamento dei provider per prezzo.
Cloudflare AI Gateway offre un piano gratuito?
Sì. Analisi principali, cache e rate limiting sono gratuiti, mentre la quota log di Workers Free conserva 100,000 record totali tra tutti i gateway. L'account gratuito è limitato a 10 gateway. L'inferenza del provider resta a pagamento e Unified Billing, guardrail o funzioni di logging a pagamento opzionali possono aggiungere altri costi.
Ottieni la mappa degli strumenti AI per imprenditori
Trasforma la scelta del gateway in uno stack di adozione completo, con una soglia di costo e un livello minimo di qualità per ogni strumento. Iscriviti per ricevere gratis la mappa degli strumenti AI.
2 set 2026



