API AI più economiche: 8 provider e prezzi a confronto
Confronto tra 8 API AI economiche con prezzi verificati ad agosto 2026, piani gratuiti, limiti di produzione e costo reale per 20,000 richieste.

DeepInfra offre il prezzo di listino più basso di questo confronto: Mistral Nemo costa $0.019 per milione di token in input e $0.03 per milione di token in output. Per un uso reale in produzione, però, DeepSeek V4 Flash è la scelta economica più solida: costa $0.14/$0.28 e include JSON, tool calling e una finestra di contesto da 1M di token. Gemini 2.5 Flash-Lite, invece, è la soluzione migliore per un prototipo gratuito. In sostanza, l'API AI più economica davvero utile è quella meno costosa che soddisfa i requisiti minimi di qualità, privacy e latenza del carico di lavoro.
API AI più economiche: il verdetto in breve
DeepSeek V4 Flash è la migliore API AI economica per la maggior parte dei carichi di testo in produzione. La tariffa standard è abbastanza bassa da portare il costo di 10 milioni di token in input e 2 milioni in output a $1.96. Allo stesso tempo, il modello supporta output JSON, chiamate agli strumenti, Responses API e una finestra di contesto da 1M di token. Questa combinazione conta più dell'ultimo centesimo risparmiato.
I vincitori sono tre, perché «più economica» può riferirsi a tre esigenze diverse:
- DeepInfra ha il costo puro per token più basso. Mistral Nemo costa $0.019 per milione di token in input e $0.03 per milione di token in output.
- Google Gemini è la scelta meno costosa per un prototipo. Gemini 2.5 Flash-Lite offre un piano gratuito; nel piano Standard a pagamento costa poi $0.10 in input e $0.40 in output per milione di token.
- DeepSeek è l'opzione più economica come soluzione predefinita e capace per la produzione. V4 Flash costa $0.14 in input e $0.28 in output per milione di token non presenti in cache, includendo le funzionalità API necessarie alla maggior parte dei backend applicativi.
Tutti i prezzi riportati di seguito sono stati verificati sulle pagine ufficiali di prezzi o documentazione dei provider il 10 agosto 2026. Salvo diversa indicazione nella cella, gli importi si riferiscono a 1 milione di token in input/output.
La tabella non è una classifica di qualità. Un modello 3B da $0.10/$0.10 e un modello attuale da produzione a $0.14/$0.28 restano prodotti diversi, anche se entrambi accettano richieste chat-completions. Il prezzo di listino serve a restringere i candidati; il vincitore va scelto con un test di accettazione costruito sul proprio caso d'uso.
Quanto costano 20,000 richieste a un'API AI
Con volumi piccoli e medi, tutti i provider di questo confronto costano così poco che una sola scelta sbagliata nel workflow pesa più dell'intera fattura dei token. Normalizzare il carico resta comunque utile, perché fa emergere le tariffe elevate dell'output e i costi accessori che il solo prezzo dell'input nasconde.
Ipotizziamo un prodotto che effettua 20,000 chiamate al mese. Ogni chiamata contiene 500 token in input e genera 100 token in output. Il totale è quindi di 10 milioni di token in input e 2 milioni in output:
Costo mensile = 10 × prezzo input + 2 × prezzo output.

In percentuale, le differenze sembrano enormi; in dollari, restano minime. Per questo carico, DeepSeek costa $1.71 in più rispetto a Mistral Nemo su DeepInfra. OpenAI Luna costa $2.44 in più di DeepSeek. Se il modello più economico rompe uno schema, ignora una richiesta del cliente o crea una coda di revisione manuale, il risparmio evapora in fretta.
È questa la soglia qualitativa: il comportamento minimo che il modello deve garantire senza generare lavoro compensativo. Un endpoint di classificazione con cinque etichette ammesse ha una soglia bassa. Una risposta di assistenza rivolta al cliente e basata sui dati del suo account richiede molto di più. La soglia sale ancora per un agente autorizzato ad aggiornare record, perché una cattiva azione costa ben più di una nuova chiamata API.
Il prezzo dell'output merita particolare attenzione. Un sistema di sintesi può leggere un documento lungo e restituire un risultato breve, quindi sarà l'input a pesare di più. Un agente di coding, un generatore di email commerciali o un assistente conversazionale può invece produrre molto più output. La tariffa di output di OpenAI Luna, pari a $1.20, è sei volte quella di input da $0.20; per Mistral Small 4, $0.60 in output equivale a quattro volte i $0.15 dell'input. Il prezzo identico per input e output dei modelli più piccoli è invitante nei flussi che generano molto testo, ma solo se quei modelli portano a termine il compito.
1. DeepSeek: la migliore API AI economica per la produzione
DeepSeek è il primo candidato più convincente quando un'applicazione in produzione richiede token economici senza rinunciare a JSON, strumenti o contesto lungo. V4 Flash 0731 costa $0.14 per milione di token in input non presenti in cache e $0.28 per milione di token in output. L'API dichiara un contesto da 1M di token, un output massimo di 384K, output JSON, chiamate agli strumenti, Responses API e una route compatibile con Anthropic. È una dotazione più completa rispetto a quella della maggior parte dei modelli che occupano gli ultimi gradini della scala dei prezzi.

Il punto debole è la prevedibilità del budget. La pagina dei prezzi di DeepSeek annuncia un aumento generale nel prossimo futuro e prevede che sarà significativo. Una startup può approfittare oggi del costo normalizzato di $1.96, ma chi gestisce gli acquisti non dovrebbe inserire questa cifra in una previsione annuale senza un margine o una seconda route.
Ideale per: Estrazione in produzione, generazione strutturata, agenti economici e attività con contesto lungo
Punto di forza: Contesto da 1M, JSON, chiamate agli strumenti, Responses API e supporto Anthropic API
Prezzi: $0.14 in input, $0.0028 per input dalla cache e $0.28 in output per 1M di token con V4 Flash
Prova gratuita: Nessun piano gratuito permanente indicato nella pagina dei prezzi
- $1.96 per il carico normalizzato da 10M di token in input e 2M in output
- Contesto da 1M di token e output fino a 384K
- Output JSON e chiamate agli strumenti anche nella fascia economica
- Limite di concorrenza dichiarato di 2,500 per V4 Flash
- Il provider ha già avvertito che i prezzi aumenteranno in misura significativa
- Non è pubblicato un piano gratuito permanente
- Una route esterna a basso costo richiede comunque una verifica di privacy, affidabilità e disponibilità regionale per il caso d'uso dell'acquirente
Perché DeepSeek conquista il primo posto
DeepSeek prevale quando un modello economico deve fare più che assegnare un'etichetta a un testo. Si consideri un prodotto SaaS B2B che estrae da contratti caricati la data di rinnovo, il valore del contratto, il periodo di preavviso e i rischi indicati. L'output può essere verificato rispetto a uno schema, ma il modello deve avere abbastanza contesto per leggere un documento lungo e seguire le istruzioni abbastanza bene da restituire tutti i campi richiesti. Per una prima valutazione, V4 Flash offre il giusto equilibrio tra costo e funzionalità API.
La tariffa per i dati già in cache è eccezionalmente bassa: $0.0028 per milione di token in input. Diventa rilevante quando si ripetono le stesse istruzioni stabili o lo stesso prefisso di riferimento. Questo non significa che ogni token in input costi $0.0028: la tariffa vale solo per i cache hit. Finché i dati di utilizzo non dimostrano il tasso effettivo di hit, il budget va calcolato sui cache miss a $0.14.
Una valutazione di DeepSeek in una settimana
Scegliere un solo compito circoscritto
Si può iniziare da estrazione, classificazione, sintesi o da un'azione in sola lettura eseguita da un agente. Campi, output ammessi e condizioni di errore vanno definiti prima di inviare traffico.
Creare un set di valutazione da 100 richieste
Occorrono richieste rappresentative e anonimizzate tratte dal carico reale. Il set deve includere input brevi, lunghi, ambigui, malformati e casi limite, così il provider più economico non prevale affrontando solo esempi facili.
Richiedere un output verificabile automaticamente
Quando il compito ha uno schema, va usato l'output JSON. Per ogni chiamata bisogna registrare tasso di conformità allo schema, tasso di risposte accettate, latenza, token in input, token in output e cache hit.
Mantenere il modello attuale come fallback
Le risposte che non superano la validazione, i casi a bassa confidenza e le azioni con conseguenze rilevanti devono passare alla route affidabile già in uso. Il primo rollout deve poter essere annullato.
Impostare un avviso per le variazioni di prezzo
DeepSeek ha dichiarato che i prezzi aumenteranno. Quando il provider pubblicherà la nuova tariffa, bisognerà ricalcolare il carico normalizzato, evitando che un prezzo temporaneo diventi un'ipotesi architetturale.
DeepSeek è la scelta giusta se V4 Flash supera il test sul compito e l'organizzazione può tollerare variazioni di prezzo. Va escluso quando un costo unitario annuale fisso, una specifica area geografica di elaborazione o un rapporto consolidato con un altro provider conta più della differenza sui token.
2. Google Gemini: la migliore API AI gratuita
Google Gemini è la migliore opzione gratuita per prototipi basati su dati anonimizzati. Gemini 2.5 Flash-Lite offre token di input e output gratuiti nel piano Free. Nel passaggio al piano Paid, la tariffa Standard è di $0.10 per milione di token di testo, immagini o video in input e $0.40 per milione di token in output; Batch e Flex dimezzano i prezzi a $0.05/$0.20.

Il piano gratuito comporta una conseguenza per la privacy che va considerata nella decisione, non relegata in nota. La pagina dei prezzi di Google indica che i contenuti del piano Free vengono usati per migliorare i suoi prodotti, mentre quelli del piano Paid no. L'offerta gratuita è adatta a prompt sintetici, documenti pubblici e set di prova dello sviluppatore; non è la scelta predefinita per record dei clienti, documenti riservati o codice non ancora pubblicato.
Ideale per: Prototipi gratuiti, input multimodale, elaborazione batch e workflow documentali sensibili ai costi
Punto di forza: Route gratuita per input/output, più input a pagamento per testo, immagini, video e audio
Prezzi: Piano Free; Paid Standard $0.10 per input di testo/immagini/video e $0.40 per output; Batch/Flex $0.05/$0.20
Prova gratuita: Sì, un piano Free con accesso limitato ai modelli
- Token di input e output gratuiti nel piano Free
- $1.80 per il carico normalizzato con Paid Standard
- $0.90 per lo stesso carico asincrono con Batch o Flex
- Il piano Paid include il context caching e non usa i contenuti per migliorare i prodotti Google
- I contenuti del piano Free vengono usati per migliorare i prodotti Google
- L'accesso gratuito è limitato in base al modello e alla quota
- Nel piano Standard, l'input audio costa $0.30 per milione di token, tre volte l'input di testo/immagini/video
Dal piano gratuito a quello a pagamento
Chi sta validando una funzione per etichettare documenti può usare il piano Free con documenti pubblici o generati, verificare la struttura della risposta e capire il profilo dei token prima di attivare la fatturazione. Quando nel flusso entrano documenti dei clienti, passare al piano Paid non è solo una questione di volume: cambiano le condizioni d'uso dei contenuti e diventano disponibili limiti di produzione più elevati, context caching e accesso Batch.
Per il carico normalizzato, Paid Standard costa $1.80. Batch o Flex costano $0.90. A livello di listino, Gemini diventa quindi più economico di DeepSeek per il lavoro asincrono, anche se la scelta corretta dipende sempre da quale modello supera il test sul compito. Se il risultato non deve arrivare subito, la riduzione del 50% va valutata prima di cambiare provider.
Gemini accetta anche immagini e video in input alla stessa tariffa Standard da $0.10 applicata al testo con 2.5 Flash-Lite. Rispetto ai piccoli modelli solo testuali, è quindi un candidato più forte per workflow che leggono ricevute, screenshot o immagini di prodotto. La pagina dei prezzi presenta Flash-Lite come il modello Google più piccolo ed economico su larga scala: il punto di partenza corretto prima di passare a un modello Gemini superiore.
Gemini conviene quando il progetto richiede una partenza gratuita, input multimodale o elaborazione asincrona a metà prezzo. Il piano Free va evitato con dati sensibili, mentre Flash-Lite va scartato se il test di accettazione dimostra la necessità di un modello più grande.
3. DeepInfra: il prezzo puro per token più basso
DeepInfra vince sul prezzo puro: Mistral Nemo Instruct costa $0.019 in input e $0.03 in output per milione di token. Il carico normalizzato da 20,000 richieste costa $0.25. DeepInfra propone inoltre Meta Llama 3.1 8B a $0.02/$0.04 e DeepSeek V4 Flash a $0.09/$0.18, consentendo di salire di livello tra i modelli dello stesso host senza aprire un altro account di fatturazione.

Il limite è il modello associato a quel prezzo. Mistral Nemo e Llama 3.1 8B costano poco perché sono modelli open piccoli e meno recenti. Per un'attività di etichettatura rigida potrebbero bastare. Un workflow rivolto ai clienti, invece, non dovrebbe beneficiare automaticamente del loro prezzo basso finché una valutazione specifica non dimostra che l'output è accettabile.
Ideale per: Classificazione ad alto volume e basso rischio, tagging, estrazione leggera ed esperimenti sui prezzi dei modelli
Punto di forza: La tariffa pubblica per la generazione testuale più bassa del confronto
Prezzi: Mistral Nemo $0.019 in input/$0.03 in output; Llama 3.1 8B $0.02/$0.04
Prova gratuita: No; DeepInfra richiede una carta o un pagamento anticipato
- $0.25 per il carico normalizzato con Mistral Nemo
- Ampio catalogo di modelli per testo, embedding, immagini, audio e video
- Pianificazione Standard, Priority e Flex a costo inferiore
- Scalabilità automatica con un limite dichiarato di 200 richieste simultanee per account
- La tariffa più bassa acquista un modello piccolo, non una soluzione universale per la produzione
- Sono richiesti una carta o un pagamento anticipato
- Flex può essere più lento e talvolta non disponibile
DeepInfra funziona quando lo spazio delle risposte è ristretto
Un marketplace di servizi locali che classifica i messaggi in arrivo come quote, reschedule, cancel, billing o other ha uno spazio di output ristretto. Può rifiutare qualsiasi valore esterno ai cinque ammessi e inviare i casi ambigui a un fallback. È proprio il tipo di compito per cui un modello da $0.019/$0.03 merita di essere valutato.
Un assistente di supporto che risponde a domande specifiche sull'account è un caso diverso. Deve recuperare il record corretto, rispettare le policy, mantenere le sfumature ed evitare risposte sbagliate ma sicure di sé. Risparmiare $1.71 rispetto a DeepSeek sul carico normalizzato non giustifica il passaggio di questo compito a Mistral Nemo senza un risultato di accettazione più solido.
I livelli di servizio di DeepInfra offrono un'ulteriore leva. Standard corrisponde a 1× la tariffa base; Priority costa 1.5× per ottenere una pianificazione più rapida nei momenti di picco; Flex costa 0.8× in cambio di risposte più lente e occasionali indisponibilità. Flex è adatto a backfill, arricchimenti offline o code notturne che possono essere ritentate. Non va usato per una risposta interattiva al cliente soltanto per tagliare del 20% una fattura che si misura già in centesimi.
DeepInfra conviene quando un compito ristretto e un validatore solido rendono ripetibile il risparmio dei modelli piccoli. La fascia più economica va evitata per scrittura aperta, ragionamento complesso e azioni capaci di modificare dati aziendali o dei clienti.
4. Groq: economica quando conta la latenza
Groq è la scelta a basso costo per le attività interattive che devono sembrare immediate. La route di produzione Llama 3.1 8B Instant è indicata a circa 560 token al secondo, con un costo di $0.05 per milione di token in input e $0.08 per milione di token in output. Il carico normalizzato costa $0.66, appena $0.41 in più rispetto al vincitore sul prezzo puro di DeepInfra.

Il compromesso riguarda la capacità del modello e la stabilità del catalogo. La route meno costosa usa un modello 8B. Groq separa i modelli pronti per la produzione da quelli in preview e avverte che questi ultimi possono essere ritirati con breve preavviso: il prezzo di una riga preview non costituisce quindi un impegno per la produzione.
Ideale per: Classificazione a bassa latenza, completamento automatico, interfacce conversazionali e routing rapido di primo livello
Punto di forza: Circa 560 token in output al secondo sul modello di produzione più economico
Prezzi: Llama 3.1 8B Instant $0.05 in input/$0.08 in output; GPT OSS 20B $0.075/$0.30
Prova gratuita: Le pagine di documentazione esaminate non specificano pubblicamente le condizioni di prova
- $0.66 per il carico normalizzato con Llama 3.1 8B
- Circa 560 token al secondo con Llama 3.1 8B
- URL di base compatibile con OpenAI e struttura API familiare
- Netta separazione tra modelli di produzione e preview
- L'opzione di produzione meno costosa è soltanto un modello 8B
- I rate limit specifici dell'account vanno controllati nella dashboard
- La disponibilità dei modelli preview può cambiare con breve preavviso
Anche la latenza fa parte del costo del prodotto
Un prodotto vocale o di live chat paga i ritardi sotto forma di conversazioni abbandonate e interazioni innaturali, anche quando la fattura API rimane bassa. Groq è una scelta credibile se il modello è adeguato e il vero vincolo è la velocità. Un breve router di intenti che decide quale workflow debba gestire il messaggio è un caso più adatto rispetto a una risposta di assistenza vincolata da policy complesse.
La pagina del modello indica una finestra di contesto da 131,072 token per Llama 3.1 8B, ma capacità e qualità del contesto non sono la stessa cosa. Il fatto che un modello accetti un prompt lungo non garantisce che utilizzi correttamente ogni dettaglio rilevante. Il primo carico affidato a Groq dovrebbe essere breve, circoscritto e verificabile automaticamente.
La route GPT OSS 20B di Groq sale di dimensione e offre circa 1,000 token al secondo a $0.075/$0.30. Il costo normalizzato è $1.35, ancora inferiore ai $1.96 di DeepSeek, ma la decisione va presa sullo stesso set di valutazione. Un prezzo più basso non dimostra una migliore aderenza alle istruzioni, un supporto strumenti superiore o maggiore compatibilità con il caso aziendale.
Groq conviene quando il tempo di risposta è percepibile dall'utente e un piccolo modello di produzione supera il test sul compito. Va evitato se il carico richiede ragionamento di fascia alta o dipende da un modello preview privo di uno stato di produzione stabile.
5. Mistral: il laboratorio diretto più economico per piccoli modelli
Mistral offre il percorso più lineare per accedere direttamente dal produttore a una gamma di modelli piccoli. Ministral 3B parte da $0.10 in input e $0.10 in output per milione di token, il modello 8B costa $0.15/$0.15 e il 14B $0.20/$0.20. Mistral Small 4 costa $0.15/$0.60 e aggiunge funzionalità più ampie per testo, agenti e input multimodale.

La tariffa economica del modello 3B non è il consiglio predefinito per attività aperte rivolte ai clienti. Ha senso dove le dimensioni ridotte rappresentano un vantaggio: classificazione, pre-routing per la moderazione o trasformazione vincolata di campi. Per un'applicazione generica, Mistral Small 4 è il candidato più credibile e porta il costo del carico normalizzato a $2.70.
Ideale per: Accesso diretto a piccoli modelli, preferenza per il produttore, trasformazioni batch e prompt ripetuti con cache
Punto di forza: Prezzo base uniforme di $0.10/$0.10, con sconto Batch del 50% e sconto del 90% sull'input in cache
Prezzi: Ministral 3B $0.10/$0.10; Mistral Small 4 $0.15/$0.60
Prova gratuita: Per i principali modelli di testo non è indicato un piano gratuito generale di produzione; alcuni endpoint Labs o di moderazione sono gratuiti
- Prezzi semplici e diretti dal produttore per le fasce 3B, 8B, 14B e Small
- Sconto batch del 50% per attività asincrone ad alto volume
- Sconto del 90% sull'input in cache per prefissi stabili e ripetuti
- Mistral Small 4 supporta testo, funzioni agentiche e uso multimodale
- Il prezzo di richiamo $0.10/$0.10 appartiene a un modello 3B
- L'output di Mistral Small 4 costa quattro volte l'input
- Per i principali modelli di testo non è indicato un ampio piano gratuito di produzione
Quando la gamma Mistral ripaga
Immaginiamo una piattaforma ecommerce che ogni notte generi tag di catalogo a partire da titoli, attributi e descrizioni. L'elaborazione è asincrona, ogni articolo segue uno schema stabile e una persona può esaminare un campione degli errori prima del successivo aggiornamento del catalogo. Questo workflow può partire con Ministral 3B o 8B, sfruttare Batch per risparmiare il 50% e mantenere in cache il prefisso stabile con le istruzioni della tassonomia.
Per un assistente di chat, i conti cambiano. Sul carico normalizzato, Ministral 3B costa $1.20 e Mistral Small 4 costa $2.70. La differenza di $1.50 permette di usare un modello più grande, pensato per una gamma più ampia di attività. Se Small 4 riduce fallback e revisione, può essere il sistema più economico anche con una tariffa per token superiore.
Mistral conviene quando contano il rapporto diretto con il produttore o una gamma progressiva di piccoli modelli. La tariffa del 3B va ignorata per compiti aperti finché una valutazione non dimostra che il modello resta sopra la soglia qualitativa.
6. SiliconFlow: il nuovo host multimodello a basso costo
SiliconFlow è l'host multimodello meno costoso della selezione quando serve qualcosa di più di una route 8B. GPT OSS 20B costa $0.04 per milione di token in input e $0.18 per milione di token in output, con una finestra di contesto da 131K. Il conto per il carico normalizzato è di $0.76 e i nuovi account ricevono $1 di credito.

La distinzione importante riguarda il nome del modello. GPT OSS 20B è un modello open-weight da 20B, non un accesso diretto alla famiglia GPT-5.6 di OpenAI. SiliconFlow propone anche DeepSeek V4 Flash a $0.13 in input, $0.028 per input in cache e $0.28 in output, così il catalogo offre una route superiore senza dover abbandonare l'account.
Ideale per: Sviluppatori attenti ai costi che vogliono più modelli open sotto un unico account provider
Punto di forza: GPT OSS 20B a $0.04/$0.18 con $1 di credito iniziale
Prezzi: GPT OSS 20B $0.04 in input/$0.18 in output; DeepSeek V4 Flash $0.13/$0.28
Prova gratuita: $1 di credito gratuito e nessun impegno minimo
- $0.76 per il carico normalizzato con GPT OSS 20B
- Al prezzo di listino, $1 di credito copre più dell'intero carico di prova normalizzato
- Nessun impegno minimo nella pagina pubblica dei prezzi
- Route economiche per DeepSeek, Qwen, MiniMax, GPT OSS e altri modelli open
- I prezzi più bassi appartengono a modelli open-weight, non ad API proprietarie di frontiera
- La scelta del modello lascia comunque all'acquirente l'onere della valutazione qualitativa
- Un host multimodello più recente può richiedere verifiche aggiuntive per acquisti e affidabilità
Un budget di valutazione da $1
Il credito iniziale di SiliconFlow è insolitamente concreto. Il carico normalizzato con GPT OSS 20B costa $0.76, quindi il credito di $1 può coprire un'intera esecuzione normalizzata per prezzo, prima di ritentativi o altri modelli. Non equivale a un mese di produzione gratuito: consente invece di misurare struttura dell'output, latenza e conteggio dei token senza impegnare subito un saldo più consistente.
Per una coda di sintesi back-office, si può partire da GPT OSS 20B e inviare i casi falliti o a bassa confidenza a DeepSeek V4 Flash sulla stessa piattaforma. Le tariffe rendono chiara la progressione: $0.04/$0.18 per la route economica, poi $0.13/$0.28 per DeepSeek. L'applicazione deve comunque registrare quale modello ha risposto, perché una fattura mista senza dati di accettazione per modello non permette di capire se la fascia meno costosa stia aiutando davvero.
SiliconFlow conviene quando un solo host a basso costo e un ampio catalogo di modelli open semplificano la valutazione. Va escluso se l'acquirente richiede un contratto diretto con lo sviluppatore del modello o dispone già di un gateway che offre gli stessi modelli a un costo complessivo accettabile.
7. OpenRouter: la soluzione più economica per cambiare modello
OpenRouter è il gateway più conveniente quando poter cambiare modello vale una piccola commissione di fatturazione. Applica i prezzi di inferenza dei provider senza ricarico, offre varianti gratuite e riunisce molti fornitori dietro un'unica chiave API. DeepSeek V4 Flash Latest è indicato a $0.08 in input e $0.252 in output per milione di token: il costo normalizzato del modello è quindi $1.304, prima delle commissioni sull'acquisto del credito.

Il limite sta nel meccanismo di acquisto dei crediti. OpenRouter applica una commissione del 5.5% con un minimo di $0.80. Il minimo smette di incidere a circa $14.55, perché $0.80 diviso 5.5% equivale a $14.5455. Su un acquisto di $10, quindi, la commissione è $0.80, cioè l'8% anziché il 5.5%.
Ideale per: Confrontare modelli, mantenere route di fallback e cambiare provider senza riscrivere l'applicazione
Punto di forza: Prezzi dei provider trasferiti senza ricarico sull'inferenza
Prezzi: Varianti gratuite a $0; modelli a pagamento con tariffe diverse; DeepSeek V4 Flash Latest $0.08/$0.252 prima della commissione sul credito
Prova gratuita: Piccolo credito per i nuovi utenti e varianti gratuite con limiti giornalieri bassi
- Un'unica chiave API per molti provider e modelli
- Nessun ricarico sulla tariffa di inferenza sottostante
- Varianti gratuite per la valutazione
- Il primo 1M di richieste BYOK ogni mese è gratuito
- Gli acquisti di credito costano il 5.5% con un minimo di $0.80
- Le varianti gratuite consentono solo 50 richieste al giorno prima di un acquisto complessivo di almeno $10 in crediti, poi 1,000 al giorno
- I crediti acquistati scadono dopo un anno se non vengono usati
- Il piano di affidabilità deve coprire sia i guasti del gateway sia quelli del provider a monte
Quando la commissione del gateway si ripaga
Chi vuole provare DeepSeek, Gemini e un modello open può impiegare più tempo di sviluppo a gestire autenticazione, fatturazione, tentativi e formati di risposta distinti che nell'inferenza stessa. Con OpenRouter, il passaggio diventa una configurazione di routing. La commissione è ragionevole se questa comodità mantiene pronto un fallback o consente al team di sostituire rapidamente una route debole.
Le ricariche minime alterano i conti. Su $10, il minimo di $0.80 equivale all'8%. Su $100, il 5.5% vale $5.50 e la percentuale si comporta come pubblicizzato. Un piccolo prototipo può accettare il minimo come costo della comodità oppure usare direttamente il piano gratuito di un provider. Non bisogna confrontare la tariffa del modello su OpenRouter con quella diretta dimenticando la commissione sul credito.
La route BYOK segue una regola diversa. Ogni mese, il primo 1M di richieste effettuate con le proprie chiavi dei provider è gratuito; successivamente OpenRouter applica il 5% di quanto sarebbe costato il percorso modello/provider su OpenRouter. BYOK può conservare i limiti diretti del provider centralizzando il routing, ma non elimina la necessità di controllare due superfici di fatturazione e di errore.
OpenRouter conviene quando un'unica integrazione e la possibilità di cambiare rapidamente giustificano la commissione. Va evitato se il prodotto usa un solo provider stabile, l'API diretta soddisfa già i requisiti di uptime e il gateway aggiuntivo non offre alcun vantaggio operativo.
8. OpenAI: il percorso economico con la migrazione meno rischiosa
OpenAI non vince sul costo dei token, ma GPT-5.6 Luna può essere la scelta economica meno rischiosa per un prodotto già costruito su OpenAI. Con Standard, Luna costa $0.20 per milione di token in input a contesto breve, $0.02 per l'input in cache e $1.20 per l'output. Batch e Flex dimezzano le tariffe di input/output a $0.10/$0.60, portando il costo normalizzato da $4.40 a $2.20.

Una migrazione ha un costo anche quando non compare mai in fattura. Schemi, prompt, regole di moderazione, strumenti, tracing, comportamento del fallback e valutazioni già esistenti possono rendere irrilevante una differenza mensile di $2.44 sui token. Se la route OpenAI attuale supera i controlli del prodotto, conviene prima valutare Luna, caching e Batch/Flex, e solo dopo sostituire il provider.
Ideale per: Prodotti OpenAI esistenti, strumenti di sviluppo diffusi, prompt stabili in cache e attività batch asincrone
Punto di forza: GPT-5.6 Luna unisce un modello OpenAI attuale a basso costo alle tariffe Batch/Flex scontate del 50%
Prezzi: Standard $0.20 in input/$0.02 in cache/$1.20 in output; Batch/Flex $0.10/$0.01/$0.60
Prova gratuita: Nessun piano API gratuito permanente indicato
- Costo normalizzato di $2.20 con Batch o Flex
- L'input in cache costa un decimo dell'input standard
- Le applicazioni OpenAI esistenti possono valutare un modello meno costoso senza migrare provider
- Tariffe distinte e chiare per Standard, Batch, Flex e contesto lungo
- Con Standard, l'output costa sei volte l'input
- Il costo normalizzato Standard di $4.40 è il più alto tra le opzioni in classifica
- L'elaborazione regionale idonea comporta un sovrapprezzo del 10%
- Con contesto lungo, Luna applica tariffe superiori di $0.40 in input e $1.80 in output
Ottimizzare OpenAI prima di migrare
L'analisi del routing di GPT-5.6 approfondisce quando scegliere Luna, Terra o Sol. Per ridurre i costi, il primo passo è più semplice: usare Luna per le attività brevi e ripetibili, mettere in cache i prefissi stabili, inviare i lavori non urgenti tramite Batch o Flex e conservare come fallback il modello attuale più capace.
Per 10 milioni di token in input e 2 milioni in output, Luna Standard costa $4.40. Batch o Flex costano $2.20. DeepSeek V4 Flash costa $1.96. Sul carico normalizzato, la differenza tra OpenAI ottimizzato e DeepSeek diretto è di $0.24: troppo poco, da sola, per giustificare una migrazione di provider.
Contesto lungo e impostazioni regionali possono cambiare il risultato. Le tariffe Standard di Luna per il contesto lungo sono $0.40 in input e $1.80 in output; l'elaborazione regionale idonea aggiunge il 10%. Va applicata la tariffa corrispondente alla richiesta e alla modalità di elaborazione scelta, senza estendere il prezzo di richiamo per il contesto breve a ogni token.
OpenAI conviene quando il prodotto funziona già sulla sua piattaforma, è importante un rapporto diretto con un provider mainstream oppure Batch/Flex annulla quasi tutta la differenza di prezzo. Standard va evitato per attività offline ritentabili che possono usare le opzioni a metà prezzo.
Quale API AI scegliere in base al caso d'uso
Prima si sceglie in base alle conseguenze, poi si valuta il modello meno costoso capace di gestirle. Questa sola regola evita gran parte dei falsi risparmi.

Per un prototipo gratuito con dati anonimizzati, scegliere Gemini 2.5 Flash-Lite. È il punto di partenza a costo zero più lineare e consente un passaggio semplice al piano Paid Standard da $0.10/$0.40. I dati dei clienti e quelli riservati devono restare fuori dal piano Free, perché le condizioni d'uso dei contenuti sono diverse da quelle del piano Paid.
Per una produzione live a basso rischio, partire da DeepSeek V4 Flash. JSON, chiamate agli strumenti, contesto da 1M e costo normalizzato di $1.96 ne fanno il miglior candidato complessivo. Il provider ha annunciato un aumento, quindi servono un margine per la variazione di prezzo e un fallback.
Per un classificatore ristretto ad alto volume, valutare prima DeepInfra. Il costo normalizzato di $0.25 conta solo quando gli output ammessi sono vincolati e gli errori sono facili da individuare. Non appena il compito diventa aperto, bisogna salire di fascia.
Quando la latenza è visibile, valutare Groq. La route Llama 3.1 8B da 560 token al secondo può rendere reattiva un'interfaccia a $0.05/$0.08. È meglio usarla come corsia veloce con un fallback più capace, non come sostituto automatico di ogni modello.
Per le code offline, confrontare Gemini Batch/Flex, Mistral Batch e OpenAI Batch/Flex. Tutti documentano uno sconto del 50%. Il provider migliore è quello il cui modello supera il test di accettazione della coda, non quello con la tariffa Standard non scontata più bassa.
Per cambiare modello con facilità, scegliere OpenRouter. La commissione può costare meno della manutenzione di più integrazioni, soprattutto se fallback e ricambio dei modelli sono parte del prodotto. Con un solo provider stabile, la fatturazione diretta resta più semplice.
Per un'applicazione OpenAI esistente, provare Luna prima di migrare. Batch/Flex riduce il costo normalizzato a $2.20, appena $0.24 più di DeepSeek. Valutazioni e operazioni già consolidate possono valere molto più di quella differenza.
La decisione cambia quando la route meno costosa scende sotto la soglia di accettazione del carico. Il modello economico va mantenuto finché validità dello schema, risposte accettate, latenza, condizioni di privacy e gestione del ripristino soddisfano i requisiti. Se uno di questi elementi cede, bisogna salire di livello. Accumulare correzioni nei prompt per risparmiare pochi centesimi non è una soluzione.
Chi offre ai clienti un'esperienza basata su API deve inoltre gestire autenticazione, fatturazione, revisione ed errori. La guida alla creazione di un'API con v0 mostra perché il modello o l'agente sottostante è soltanto uno degli strati del prodotto.
Come sono state selezionate queste API AI
La classifica premia la decisione d'acquisto affidabile più economica, non il singolo prezzo di input più basso. Ogni provider è stato analizzato e quotato sulle sue pagine ufficiali disponibili il 10 agosto 2026. Le API non sono state sottoscritte né presentate come se fossero state provate in produzione.
La valutazione usa questi criteri:
- Prezzo d'ingresso utile: tariffe di input e output per un modello specifico ancora presente a listino
- Soglia qualitativa: adeguatezza plausibile della fascia del modello a un compito vincolato o a un workflow di produzione più ampio
- Funzionalità operative: JSON, strumenti, contesto, batch, caching, rate limit e implicazioni del fallback
- Conseguenze per privacy e contratti: trattamento dei dati nei piani gratuiti, stabilità del prezzo ed eventuale commissione separata del gateway
- Costo del cambiamento: lavoro richiesto per migrare prompt, schemi, set di valutazione, monitoraggio e fatturazione
Sono stati selezionati otto provider perché ciascuno risponde a una decisione d'acquisto distinta. Sono stati esclusi quelli la cui route testuale di produzione più economica era molto al di sopra di questa fascia di costo, il cui prezzo non poteva essere normalizzato per token oppure il cui ruolo duplicava un'altra opzione senza un vantaggio più chiaro. Sono state escluse anche le API specializzate per immagini, video, voce ed embedding, perché le loro unità non sono confrontabili con i token di testo in input/output.
I calcoli dei costi sono un'analisi originale basata su un carico esplicito, non un benchmark. Il costo per risultato accettato può emergere soltanto da richieste rappresentative, validatori e processi di revisione propri.
Le opzioni da evitare
Varianti gratuite di OpenRouter come dipendenza di produzione
Una variante gratuita di OpenRouter non dovrebbe mai essere l'unica route dietro al traffico live dei clienti. L'account dispone di 50 richieste gratuite al giorno finché non ha acquistato almeno $10 di crediti; in seguito il limite sale a 1,000 al giorno. È una disponibilità per la valutazione, non un piano di capacità affidabile.
Gemini Free con dati dei clienti o riservati
I contenuti sensibili non vanno inviati tramite Gemini Free. Google dichiara che i contenuti del piano Free vengono usati per migliorare i suoi prodotti, mentre quelli del piano Paid no. Il conto normalizzato di Paid Standard è $1.80: non è sensato risparmiare questa cifra oltrepassando il confine della privacy.
DeepInfra Mistral Nemo per attività aperte rivolte ai clienti
La route da $0.019/$0.03 non va promossa direttamente a supporto aperto, interpretazione legale o azioni autonome. La tariffa appartiene a un modello piccolo. Va usata per un compito vincolato e validato, mantenendo un fallback più robusto finché i dati di accettazione non ne giustificano un impiego più ampio.
DeepSeek senza fallback per le variazioni di prezzo
La tariffa $0.14/$0.28 non va considerata un prezzo annuale fisso. DeepSeek ha annunciato un aumento significativo. Il modello può comunque restare la migliore scelta attuale, ma budget e architettura devono prevedere una seconda route.
OpenAI Standard per attività offline ritentabili
Non conviene pagare la tariffa Standard di Luna da $0.20/$1.20 per un lavoro che può aspettare. Batch e Flex costano $0.10/$0.60 e riducono il carico normalizzato da $4.40 a $2.20 senza cambiare provider.
La mossa da fare lunedì
La prossima settimana va spostata una sola classe di compiti ben delimitata, non l'intera applicazione. Una valutazione da 100 richieste basta a far emergere evidenti problemi di schema, latenza e routing prima di coinvolgere il traffico di produzione; non sostituisce però il monitoraggio continuo.
Raccogliere 100 richieste rappresentative
Bisogna scegliere un solo compito e campionare input normali, difficili, ambigui e malformati. Prima di usare qualsiasi piano gratuito vanno rimossi dati personali, riservati e dei clienti.
Eseguire il test su tre route
Il confronto deve includere il provider attuale, DeepSeek V4 Flash e Gemini 2.5 Flash-Lite. DeepInfra o Groq vanno aggiunti solo quando l'obiettivo esplicito è il prezzo puro o la latenza.
Valutare quattro risultati
Vanno registrati il tasso di conformità allo schema, il tasso di risposte accettate, la latenza end-to-end e il costo esatto dei token in input/output. Il tempo di revisione umana resta una misura operativa separata.
Instradare una sola classe vincente
Al provider più economico va inviato soltanto il compito circoscritto che ha superato la prova. La route precedente deve restare disponibile per validazioni fallite, input ambigui e azioni con conseguenze maggiori.
Ricalcolare a ogni variazione del provider
Formula e ipotesi sul carico vanno conservate. I conti devono essere aggiornati quando DeepSeek alza i prezzi, un modello viene ritirato oppure cambiano limiti dei piani gratuiti e dei gateway.
Questo passaggio trasforma un elenco di tariffe in una decisione di budget reversibile. Produce anche il dato che nessun listino pubblico può offrire: il costo per risultato accettato nel proprio caso d'uso.
Domande frequenti
Qual è l'API AI più economica?
In questo confronto, DeepInfra offre il prezzo più basso per la generazione testuale: Mistral Nemo a $0.019 per milione di token in input e $0.03 per milione di token in output. Quando servono JSON, strumenti e contesto lungo, DeepSeek V4 Flash è però la migliore scelta economica predefinita per la produzione.
Esistono API AI gratuite?
Sì. Google Gemini offre token gratuiti in input e output nel piano Free, mentre OpenRouter propone varianti gratuite dei modelli. Gemini Free può usare i contenuti per migliorare i prodotti Google; le varianti gratuite di OpenRouter sono limitate a 50 richieste al giorno, oppure 1,000 dopo aver acquistato almeno $10 di crediti complessivi.
Quanto costa un'API AI?
Per 20,000 chiamate mensili, pari a 10M di token in input e 2M in output, le opzioni in classifica vanno da $0.25 con Mistral Nemo su DeepInfra a $4.40 con OpenAI GPT-5.6 Luna Standard. Batch, Flex, caching, commissioni dei gateway, tentativi aggiuntivi e il modello che supera la soglia qualitativa determinano il conto finale.
Quanto costa l'API di ChatGPT?
Gli abbonamenti a ChatGPT e la fatturazione dell'API OpenAI sono separati. Il modello OpenAI economico confrontato qui è GPT-5.6 Luna: $0.20 in input e $1.20 in output per milione di token Standard a contesto breve, oppure $0.10/$0.60 tramite Batch o Flex.
Scarica la checklist per l'audit dei workflow AI aziendali e trasforma questo confronto dei costi in una valutazione dei provider della durata di una settimana.
3 set 2026







