Groq API: prezzi 2026, piano gratis e costi reali
Groq API: prezzi 2026, limiti del piano Free, tariffe per modello e costi degli strumenti. Scopri quando conviene passare al piano Developer.

Groq API costa $0 finché i limiti del piano Free, specifici per ciascun modello, non iniziano a bloccare il flusso di lavoro. Da quel momento, Developer non prevede alcun canone e addebita solo il consumo. Nell'esempio calcolato su GPT-OSS 120B, il tetto giornaliero di token del piano Free equivale ad appena $1.44 al mese di traffico a pagamento: a rendere necessario l'upgrade è quindi il throughput, non la spesa in token.
Groq API: prezzi in breve
Groq non ha un prezzo self-service mensile per postazione da tenere a mente. La scelta è fra un piano Free soggetto a rate limit, un piano Developer a consumo e una capacità Enterprise personalizzata.
Prezzi e limiti sono stati verificati il 15 agosto 2026 sulla pagina prezzi aggiornata di Groq, nell'elenco dei modelli supportati, nelle FAQ sulla fatturazione e nella documentazione sui rate limit.

Il token è l'unità su cui il modello calcola il costo. I token di input comprendono istruzioni, cronologia della conversazione, documenti e definizioni degli strumenti inviati al modello; quelli di output corrispondono a ciò che il modello genera. Groq indica entrambe le tariffe per milione di token, quindi il costo mensile è la somma di input, output, audio e dell'eventuale uso degli strumenti integrati.
Developer non comporta impegni mensili o annuali. Groq richiede un metodo di pagamento, misura il consumo e normalmente fattura a consuntivo. Non esiste una tariffa separata per gli extra: Free blocca il traffico eccedente quando si raggiunge il limite applicabile, mentre Developer continua a fatturare il consumo alle stesse tariffe del modello finché non interviene un blocco dell'account o uno Spend Limit. Enterprise Performance segue una logica diversa: l'acquirente compra capacità di input e output allocata, anziché pagare la tariffa pubblica dei token on demand.
Il piano Free è utile finché un limite condiviso non diventa una dipendenza di produzione
Il piano Free di Groq può sostenere un prototipo, un assistente interno e una quantità sorprendente di automazioni a basso volume. Smette di essere un'infrastruttura gratuita non appena un errore di rate limit si trasforma in un problema visibile al cliente.
I limiti si applicano all'organizzazione, non alla singola chiave API. Creare più chiavi non moltiplica la capacità. Groq impone inoltre più soglie contemporaneamente: richieste al minuto, richieste al giorno, token al minuto e token al giorno. La prima soglia raggiunta blocca la chiamata successiva con HTTP 429.
Per gli attuali modelli testuali di produzione, i limiti Free pubblicati comprendono:
- GPT-OSS 120B e GPT-OSS 20B: 30 RPM, 1,000 RPD, 8,000 TPM e 200,000 TPD.
- Llama 3.3 70B Versatile: 30 RPM, 1,000 RPD, 12,000 TPM e 100,000 TPD.
- Llama 3.1 8B Instant: 30 RPM, 14,400 RPD, 6,000 TPM e 500,000 TPD.
- Compound e Compound Mini: 30 RPM, 250 RPD e 70,000 TPM.
- Whisper Large V3 e Turbo: 20 RPM, 2,000 RPD, 7,200 secondi di audio all'ora e 28,800 secondi di audio al giorno.
Groq presenta questa tabella pubblica come una sintesi generale. La pagina Limits nella Console resta la fonte autorevole per la capacità effettivamente assegnata a ciascuna organizzazione.
Spesso il tetto giornaliero dei token scatta prima di quello delle richieste. Consideriamo una chiamata a GPT-OSS 120B con 2,000 token di input e 500 di output. Con 2,500 token totali, il limite di 200,000 TPD consente 80 richieste simili al giorno. Il tetto di 8,000 TPM ne permette tre in un minuto; una quarta chiamata comparabile supererebbe il limite dei token, nonostante il piano pubblicizzi 30 RPM.
È questo il vero punto di passaggio dal gratuito al pagamento. La stessa richiesta costa $0.0006 su Developer, perciò 80 richieste al giorno per un mese di 30 giorni costano circa $1.44. Non ha molto senso economico piegare un flusso di produzione ai limiti del piano Free: l'upgrade compra capacità quando la spesa per il modello è ancora inferiore a quella della maggior parte degli add-on SaaS.

Chi può non pagare mai
Developer potrebbe non servire mai se Groq viene usato per sviluppo locale, valutazioni occasionali, uno script interno personale o una demo il cui traffico rimane sotto i limiti applicabili di token e richieste. Free ha senso anche quando un 429 può attendere un nuovo tentativo e non è stata promessa a nessuno la continuità del servizio.
È il momento di pagare quando il flusso ha un utente, una scadenza o una coda che non può tollerare il limite condiviso. Developer aggiunge inoltre Batch, Flex, supporto via chat e Spend Limits. Il vero confine operativo sta in questi controlli, non in un catalogo di modelli diverso.
Tutti i prezzi attuali dei modelli Groq
L'attuale catalogo di produzione di Groq è compatto: quattro modelli testuali, due modelli speech-to-text e due sistemi Compound. A parte c'è un catalogo preview, i cui modelli possono sparire con poco preavviso.
Modelli testuali di produzione
- Llama 3.1 8B Instant costa $0.05 in input e $0.08 in output per milione di token. È l'opzione testuale di produzione più economica. Su Developer, la capacità base è di 250,000 TPM e 1,000 RPM, con una finestra di contesto da 131,072 token.
- GPT-OSS 20B costa $0.075 in input e $0.30 in output per milione di token. L'input dalla cache costa $0.0375 per milione. Su Developer, la capacità base è di 250,000 TPM e 1,000 RPM, con una finestra di contesto da 131,072 token.
- GPT-OSS 120B costa $0.15 in input e $0.60 in output per milione di token. L'input dalla cache costa $0.075 per milione. Su Developer, la capacità base è di 250,000 TPM e 1,000 RPM, con una finestra di contesto da 131,072 token.
- Llama 3.3 70B Versatile costa $0.59 in input e $0.79 in output per milione di token. Su Developer, la capacità base è di 300,000 TPM e 1,000 RPM, con una finestra di contesto da 131,072 token.
Quando serve un modello open-weight più grande ma conta anche disporre di un provider alternativo per lo stesso modello, conviene iniziare la valutazione di produzione da GPT-OSS 120B. Si scende a GPT-OSS 20B o Llama 3.1 8B solo se una verifica di accettazione dimostra che il modello più piccolo conserva la qualità del risultato. Si passa invece a Llama 3.3 70B soltanto se i suoi output giustificano una tariffa pari a 3.93 volte quella di GPT-OSS 120B per l'input e a 1.32 volte per l'output.
Questi multipli non dimostrano che un modello sia migliore. Indicano quale ritorno debba produrre: meno tentativi, risposte più brevi, meno lavoro di revisione o una capacità assente nell'opzione più economica.
Modelli speech-to-text
- Whisper Large V3 costa $0.111 per ora di audio. La capacità base di Developer è di 200,000 secondi di audio all'ora e 300 RPM, con una dimensione massima del file di 100 MB.
- Whisper Large V3 Turbo costa $0.04 per ora di audio. La capacità base di Developer è di 400,000 secondi di audio all'ora e 400 RPM.
Su 1,000 ore di audio, le voci di costo sono $111 per Whisper Large V3 e $40 per Turbo, con una differenza di $71. Il prezzo più basso è il punto di partenza, ma un team che lavora sull'audio dovrebbe scegliere il modello che supera la propria soglia di accettazione delle trascrizioni. Una trascrizione meno cara che richiede correzioni non produce un risultato più economico.
Sistemi Compound e modelli preview
Groq Compound e Compound Mini combinano modelli di produzione e strumenti lato server. Non hanno un'unica tariffa fissa per token: Groq ribalta i costi del modello sottostante e degli strumenti. Per questo una bolletta Compound richiede voci separate, non una sola stima per token.
Il catalogo preview attualmente disponibile comprende:
- Qwen3.6 27B: $0.60 in input e $3.00 in output per milione di token.
- Safety GPT-OSS 20B: $0.075 in input e $0.30 in output per milione di token.
- Llama Prompt Guard 2 22M: $0.03 in input e output per milione di token.
- Llama Prompt Guard 2 86M: $0.04 in input e output per milione di token.
- Canopy Labs Orpheus V1 English: $22 per milione di caratteri.
- Canopy Labs Orpheus Arabic Saudi: $40 per milione di caratteri.
- MiniMax M2.7: prezzo Enterprise su richiesta commerciale.
Preview significa valutazione, non promessa di disponibilità in produzione. Groq precisa che questi modelli possono essere ritirati con poco preavviso. Un budget che dipende da Qwen3.6 27B deve quindi includere anche un percorso già collaudato verso un altro provider o modello prima che il sistema arrivi ai clienti.
La pagina Supported Models attuale di Groq non elenca modelli DeepSeek o Kimi. I vecchi articoli e calcolatori che continuano a indicarli come opzioni Groq attive non sono più aggiornati. Se il requisito è DeepSeek, bisogna calcolarne il prezzo presso un provider attuale, senza presumere che resti nel catalogo Groq; l'analisi dei prezzi di DeepSeek approfondisce questa scelta separata.
È il costo per risultato a determinare il modello
Le tariffe per token di Groq sono così basse che, finché i volumi non diventano elevati, la forma del traffico pesa più della scelta del modello. Per un confronto corretto si fissa una richiesta tipo e se ne calcola il costo su ogni opzione.
Prendiamo come riferimento una richiesta con 2,000 token di input e 500 di output. Su 100,000 richieste al mese, prima di cache, Batch, strumenti o tentativi ripetuti, il conto è questo:
- Llama 3.1 8B Instant: $14 totali, ovvero $0.00014 per richiesta.
- GPT-OSS 20B: $30 totali, ovvero $0.0003 per richiesta.
- GPT-OSS 120B: $60 totali, ovvero $0.0006 per richiesta.
- Llama 3.3 70B Versatile: $157.50 totali, ovvero $0.001575 per richiesta.
- Qwen3.6 27B preview: $270 totali, ovvero $0.0027 per richiesta.
Il denominatore utile non è la richiesta, ma il risultato accettato. Se un modello più piccolo deve riprovare, genera output più lunghi o trasferisce più lavoro a un revisore umano, la richiesta economica può trasformarsi nel flusso più costoso. Occorre affiancare ai token il numero di risultati accettati, così il modello si guadagna il proprio posto invece di vincere soltanto sul prezzo di listino.
Non esiste un volume a pagamento oltre il quale un modello Groq diventa automaticamente più economico di un altro. Tutte le tariffe pubbliche on demand sono lineari e non prevedono un canone base. Nell'esempio, GPT-OSS 20B resta pari alla metà del costo di GPT-OSS 120B tanto con una richiesta quanto con un milione di richieste. La scelta cambia solo quando la qualità del risultato o il comportamento operativo modificano la quantità di lavoro necessaria.
Per un founder finanziato, questo può significare usare GPT-OSS 20B per la classificazione e GPT-OSS 120B nei casi ambigui. Per il CTO di un'azienda mid-market, significa conservare modello e token in ogni log delle richieste, così chi gestisce gli acquisti vede il costo per flusso accettato. Per un responsabile operativo senior, significa misurare correzioni e nuovi tentativi, senza scambiare una demo riuscita per la prova definitiva dell'opzione di produzione.
Per il lavoro asincrono Batch batte la cache, e gli sconti non si sommano
Batch di Groq offre la tariffa pubblica più bassa quando il risultato può attendere. Costa il 50% in meno rispetto alle API sincrone, opera al di fuori dei normali limiti per modello e consente di scegliere una finestra di elaborazione da 24 ore a 7 giorni.
Per il carico da 100,000 richieste su GPT-OSS 120B, le alternative sono:
- Sincrono senza cache: $60.
- Sincrono con il 50% dei token di input serviti dalla cache: $52.50.
- Sincrono con l'80% dei token di input serviti dalla cache: $48.
- Batch: $30.
La regola attuale che cambia il budget è inequivocabile: gli sconti Batch e prompt caching non si sommano. Ogni token elaborato in Batch viene fatturato con lo sconto Batch del 50%, indipendentemente dallo stato della cache. Un foglio di calcolo che dimezza di nuovo i $30 di Batch fino a $15 è sbagliato.
Il prompt caching resta utile per il traffico sincrono GPT-OSS. È automatico, non comporta costi aggiuntivi per la funzionalità e riduce del 50% il prezzo dell'input presente in cache. Al momento supporta GPT-OSS 20B, GPT-OSS 120B e GPT-OSS Safeguard 20B. Per ottenere un cache hit serve un prefisso identico; la lunghezza minima memorizzabile varia da 128 a 1,024 token a seconda del modello e i dati inutilizzati scadono dopo due ore. Il cache hit è best effort, non garantito.
Le istruzioni di sistema e le definizioni degli strumenti che non cambiano vanno collocate all'inizio del prompt, seguite dai dati variabili dell'utente. A quel punto si leggono dalle risposte i token recuperati dalla cache. Una percentuale di cache stimata non è un dato valido per il budget finché non viene confermata dall'uso in produzione.
Batch presenta vincoli operativi diversi. Un file JSONL può contenere fino a 50,000 righe e pesare fino a 200 MB. I job che non terminano entro la finestra scelta scadono, anche se Groq addebita soltanto le richieste completate con successo. File e risultati Batch possono restare nei sistemi di Groq fino a 30 giorni: per i carichi sensibili, la conservazione dei dati va quindi valutata prima di lasciare che sia il risparmio a decidere.
$60 di token possono trasformarsi in una fattura Compound da $560
Il costo nascosto di Compound non è il modello, ma il ciclo di utilizzo degli strumenti.
Groq addebita Basic Search a $5 ogni 1,000 richieste, Advanced Search a $8 ogni 1,000, Visit Website a $1 ogni 1,000 e Code Execution a $0.18 l'ora. Queste voci si aggiungono ai token del modello sottostante.
Consideriamo 100,000 richieste standard a GPT-OSS 120B. I token del modello costano $60. Se ogni richiesta effettua una chiamata Basic Search, la ricerca aggiunge $500 e porta il totale a $560. Con una chiamata Advanced Search per richiesta, il conto complessivo sale a $860; con una chiamata Visit Website per richiesta, arriva a $160.

È la voce di budget che rischia maggiormente di sorprendere un team che sviluppa agenti. Ottimizzare i token non può salvare un flusso in cui l'agente esegue una ricerca a ogni passaggio. Il primo controllo è una policy per gli strumenti: stabilire quando la ricerca serve davvero, limitare i cicli degli strumenti, memorizzare i risultati durevoli fuori dal modello e registrare le chiamate per ogni risultato accettato.
La fattura a consumo non impone vincoli annuali, ma ha aspetti operativi da conoscere
Developer viene fatturato a consumo e non nasconde un contratto SaaS annuale. Le condizioni meno evidenti riguardano il momento dell'addebito, il comportamento dei limiti e la sorte dei crediti.
I nuovi account Developer adottano la fatturazione progressiva. Groq può emettere una fattura quando il consumo cumulativo dall'apertura dell'account supera $1, $10, $100, $500 e $1,000. Dopo la soglia di $1,000 subentra la normale fatturazione mensile. Per gli account con indirizzo di fatturazione in India, alle soglie di $1 e $10 seguono incrementi ricorrenti di $100. Groq non richiede il pagamento finché il consumo non raggiunge almeno $0.50.
Questo schema può generare diversi piccoli addebiti sulla carta nelle prime fasi di adozione. Non si tratta di costi aggiuntivi, ma chi segue la contabilità dovrebbe conoscere il meccanismo prima di considerare duplicati quegli addebiti.
Gli Spend Limits bloccano il traffico, con un breve ritardo nei dati
I piani a pagamento permettono di impostare uno Spend Limit mensile unico per l'intera organizzazione. Copre ogni chiave API ed endpoint, si azzera il primo giorno del mese e blocca le nuove richieste quando viene rilevato il superamento del limite. Groq supporta soglie di avviso come il 50%, il 75% e il 90% del tetto.
Il monitoraggio della spesa si aggiorna con un ritardo di 10-15 minuti. Un picco può quindi portare il conto finale leggermente oltre l'importo configurato prima che scatti il blocco. Groq suggerisce di partire da un limite superiore del 20%-30% rispetto al consumo mensile previsto. Per un flusso critico, questo margine riduce anche il rischio che un normale picco di traffico trasformi il controllo del budget in un'interruzione del servizio.
I crediti scadono e le vendite prepagate sono definitive
I Service Credits di Groq scadono un anno dopo l'acquisto o l'emissione, salvo indicazioni diverse. Non sono trasferibili, convertibili in denaro o rimborsabili. La chiusura dell'account fa scadere immediatamente il saldo.
Le FAQ sulla fatturazione di Groq valutano le richieste generiche di rimborso caso per caso tramite l'assistenza. Ciò non sostituisce le condizioni specifiche dei Service Credits: i crediti acquistati e promozionali restano saldi a vendita definitiva. Meglio acquistare un importo legato a una previsione concreta, non a una migrazione futura indefinita.
Flex offre un tetto più alto in cambio di capacità non garantita
Flex è disponibile per i clienti a pagamento allo stesso prezzo per token di On Demand e offre rate limit 10 volte superiori. Il compromesso è una capacità best effort: se Flex è saturo, può fallire rapidamente con HTTP 498 e capacity_exceeded.
Flex è adatto a code che consentono nuovi tentativi, valutazioni e lavori in blocco capaci di assorbire un errore immediato. Non dovrebbe essere l'unico percorso per un'azione del cliente non ripetibile. On Demand offre velocità prevedibile, ma nei picchi può aggiungere latenza in coda. Quando questa variabilità è inaccettabile, Enterprise Performance è l'opzione contrattuale, con uno SLA di disponibilità del 99.9% e una garanzia sulla latenza del 99% nell'accordo Enterprise.
Groq, Together AI e Fireworks hanno lo stesso prezzo sui token GPT-OSS 120B senza cache
Groq non prevale in base al solo prezzo pubblico dei token GPT-OSS 120B. Per lo stesso modello, Groq, Together AI e Fireworks AI indicano tutti $0.15 in input e $0.60 in output per milione di token.
Normalizziamo il confronto su 100 milioni di token di input e 20 milioni di token di output. Senza sconto per la cache, ciascun provider costa $27. È proprio questo pareggio a essere utile: obbliga a scegliere in base a convenienza della cache, rate limit, opzioni di deployment, affidabilità e latenza misurata.
Together AI
Together AI è un provider di inferenza multi-modello; il suo endpoint serverless per GPT-OSS 120B costa $0.15 in input e $0.60 in output per milione di token. Il prodotto serverless non richiede spese minime né costi di provisioning.

La riga attuale di GPT-OSS 120B su Together non pubblica una tariffa per l'input dalla cache. La documentazione chiarisce che, in assenza di un prezzo dedicato alla cache, tutto l'input viene fatturato alla tariffa standard. Sul carico normalizzato, il totale rimane quindi $27 anche se il prompt si ripete. Together offre prezzi Batch inferiori fino al 50% sui modelli serverless supportati, perciò resta una scelta valida per il lavoro asincrono quando quello specifico modello è idoneo.
Together è indicato quando il catalogo di modelli più ampio o un percorso dall'infrastruttura serverless a quella riservata conta più del profilo operativo specifico di Groq. Non conviene passare da un provider all'altro solo per il prezzo finché il carico non evidenzia una differenza, perché la voce GPT-OSS senza cache è identica.
Fireworks AI
Fireworks AI quota GPT-OSS 120B a $0.15 in input, $0.014 per l'input dalla cache e $0.60 in output per milione di token, offrendo $1 di credito serverless all'iscrizione.

Con il 50% dell'input servito dalla cache, il totale normalizzato è $20.20 su Fireworks, $23.25 su Groq e $27 su Together. Fireworks diventa così il vincitore sul prezzo pubblico per input GPT-OSS 120B molto ripetitivo, purché la tariffa cache indicata si applichi al carico misurato. Per il lavoro asincrono, Groq Batch resta ancora più economico: $13.50 sullo stesso traffico normalizzato.
OpenAI ha sviluppato GPT-OSS, ma non lo distribuisce tramite le API OpenAI né nell'app destinata ai consumatori. Un confronto diretto con le API OpenAI cambierebbe quindi sia provider sia modello, rendendo impossibile normalizzare il prezzo. Prima va confrontato lo stesso modello presso provider diversi; in seguito si valutano i modelli proprietari in base al risultato accettato. La selezione delle API AI più economiche copre il panorama più ampio di modelli e provider.
La scelta del provider si può sintetizzare così:
- Scegli Groq quando il throughput sincrono e i suoi controlli operativi prevalgono sul percorso misurato, oppure quando lo sconto Batch del 50% rende più economico il lavoro differibile.
- Scegli Fireworks quando il contesto GPT-OSS ripetuto ottiene con regolarità la tariffa di $0.014 per l'input dalla cache.
- Scegli Together quando conta il suo percorso più ampio dal serverless al dedicato e il carico non trae vantaggio da una tariffa cache per GPT-OSS.
A chi conviene Groq e chi dovrebbe evitarlo
Groq è una scelta valida quando un modello open supera già la soglia qualitativa e la velocità di risposta incide sul prodotto. È meno adatto se il modello richiesto, la capacità garantita o il controllo sul deployment non rientrano nell'attuale catalogo self-service.
- Il piano Free è abbastanza generoso da consentire una valutazione dei modelli di produzione prima di aggiungere un metodo di pagamento.
- Developer non prevede canone base né vincolo annuale.
- Le tariffe pubbliche on demand rimangono inferiori a $1 per milione di token per tutti i modelli testuali di produzione.
- Batch riduce del 50% il costo dei carichi asincroni idonei senza consumare i normali limiti del modello.
- Il prompt caching di GPT-OSS è automatico e dimezza le tariffe dell'input dalla cache.
- Gli Spend Limits possono bloccare il consumo dell'intera organizzazione prima che il budget mensile sfugga al controllo.
- I limiti Free sono condivisi a livello di organizzazione e possono scattare sui token molto prima che sulle richieste.
- Gli sconti di Batch e cache non si sommano.
- Le tariffe degli strumenti Compound possono superare di gran lunga la spesa per i token del modello.
- Il prompt caching supporta soltanto la famiglia GPT-OSS indicata e dipende dal riutilizzo di un prefisso identico.
- Flex può restituire HTTP 498 quando la capacità best effort non è disponibile.
- I modelli preview possono essere rimossi con poco preavviso, quindi non possono sostenere una dipendenza di produzione priva di alternative.
Un founder finanziato dovrebbe scegliere Groq quando un modello open veloce mantiene il prodotto reattivo e il team può predisporre un'alternativa sullo stesso modello. Il CTO di un'azienda mid-market dovrebbe adottare Developer solo dopo aver centralizzato le chiavi, registrato l'uso di modelli e strumenti e impostato un limite per l'organizzazione. Un responsabile operativo senior dovrebbe concentrarsi sul costo per risultato accettato, non sul titolo sensazionale dei token acquistabili con un dollaro.
È meglio non usare Groq come unico provider quando l'applicazione richiede un modello proprietario assente dal catalogo, un percorso best effort garantito o un modello preview senza una sostituzione stabile. Enterprise Performance può offrire capacità contrattuale per i modelli supportati, ma applica prezzi personalizzati basati sulla capacità allocata e non costituisce un piano pubblico più economico.
La regola decisionale esplicita è questa: scegli Groq solo se un modello di produzione attuale supera il test di accettazione e il comportamento operativo sincrono oppure il costo Batch batte l'alternativa sullo stesso modello. Se nessuna delle due condizioni è vera, il prezzo basso dei token non giustifica una migrazione.
L'andamento dei prezzi Groq premia chi verifica i dati aggiornati
I prezzi Groq cambiano a livello di funzionalità e modello, anche quando la struttura di fatturazione resta a consumo. Il lancio di Developer nel febbraio 2025 presentava Batch con uno sconto del 25% rispetto ai prezzi sincroni. La documentazione Batch attuale fissa lo sconto al 50%.
Groq ha inoltre ridotto i prezzi di GPT-OSS e ha iniziato a introdurre il prompt caching nella famiglia nell'ottobre 2025. Oggi GPT-OSS 120B costa $0.15/$0.60 e GPT-OSS 20B $0.075/$0.30, con l'input dalla cache a metà della tariffa standard di input.
Il ricambio del catalogo conta quanto l'andamento dei prezzi. Modelli presenti nei vecchi confronti, comprese opzioni Kimi e DeepSeek, non compaiono più nell'attuale pagina Supported Models. Nel budget vanno quindi annotate data di verifica, ID del modello e alternativa disponibile, senza trattare come permanente un prezzo copiato.
Cosa fare lunedì: calcolare e limitare il costo di un flusso accettato
Lunedì scegli un flusso circoscritto e prepara un budget comprensibile sia all'ingegneria sia alla finanza. Non partire da una migrazione che coinvolga l'intero provider.
Rileva la forma del traffico
Esporta una settimana rappresentativa di richieste, token di input, token di output, token recuperati dalla cache, ID dei modelli, chiamate agli strumenti, nuovi tentativi e risultati accettati. Separa il traffico sincrono dai job che possono attendere.
Calcola il prezzo di tre opzioni
Calcola On Demand alle tariffe correnti del modello, Batch al 50% per i lavori differibili idonei e gli strumenti come voci separate. Non applicare risparmi della cache a Batch e non presumere una percentuale di cache che i dati d'uso non hanno misurato.
Imposta il confine del piano a pagamento
Se i limiti Free interrompono il flusso, spostalo su Developer. Imposta uno Spend Limit mensile superiore del 20%-30% rispetto alla previsione, quindi configura avvisi al 50%, 75% e 90%. Tieni conto del ritardo di aggiornamento di 10-15 minuti.
Mantieni pronta un'alternativa
Esegui lo stesso modello tramite un provider alternativo su un piccolo set di valutazione. Registra endpoint, tasso di accettazione osservato e condizione di reindirizzamento, così un cambio di catalogo o un errore di capacità non diventa una migrazione d'emergenza.
Il risultato è una voce di budget per ogni flusso accettato: token del modello, strumenti, nuovi tentativi e revisione umana. Ripeti il calcolo quando cambiano il catalogo aggiornato dei modelli, i rate limit o la pagina dei prezzi.
Domande frequenti
Quanto costa Groq AI?
Groq Free costa $0. Developer non ha un canone base e addebita il consumo in base al modello. I prezzi attuali dei modelli testuali di produzione vanno da $0.05 in input e $0.08 in output per milione di token per Llama 3.1 8B Instant a $0.59 in input e $0.79 in output per Llama 3.3 70B Versatile.
Groq si può usare gratis?
Sì, entro i limiti per organizzazione specifici di ogni modello. Attualmente, per GPT-OSS 120B e 20B il piano Free indica 30 RPM, 1,000 RPD, 8,000 TPM e 200,000 TPD. Il superamento del limite applicabile restituisce HTTP 429.
Quali modelli Groq AI si possono usare gratis?
Il piano Free mette a disposizione il catalogo supportato con limiti specifici per modello. Per una valutazione destinata a durare, vanno scelti i modelli di produzione. Groq precisa che i modelli preview servono alla valutazione e possono essere ritirati con poco preavviso.
Quanto costa Groq al mese?
Non esiste un abbonamento self-service pubblico mensile o annuale. Il costo mensile deriva dalla somma di input, output, audio, strumenti e livelli di servizio alle tariffe correnti. Nell'esempio con 100,000 richieste su GPT-OSS 120B, il costo sincrono è $60 prima di cache o strumenti.
Groq offre uno sconto per studenti?
Groq non indica uno sconto specifico per studenti nelle pagine sui prezzi e sulla fatturazione verificate ad agosto 2026. Gli studenti e gli altri utenti con carichi leggeri possono utilizzare il piano Free generale da $0 entro i suoi rate limit.
Qual è la politica di rimborso di Groq?
Groq valuta caso per caso le richieste generiche di rimborso legate alla fatturazione tramite l'assistenza. I Service Credits seguono regole più rigide: quelli acquistati e promozionali non sono rimborsabili né trasferibili e scadono dopo un anno, salvo indicazioni diverse.
I prezzi Groq sono cambiati?
Sì. Al lancio, nel febbraio 2025, Batch costava il 25% in meno rispetto all'elaborazione sincrona; oggi lo sconto è del 50%. Groq ha ridotto i prezzi GPT-OSS e aggiunto il caching alla famiglia nell'ottobre 2025. La pagina aggiornata va verificata perché catalogo e tariffe dei modelli cambiano.
Come si confrontano i prezzi di Groq e OpenAI?
OpenAI non distribuisce GPT-OSS tramite le proprie API, quindi un confronto diretto cambierebbe modello. Su un carico normalizzato GPT-OSS 120B, Groq, Together AI e Fireworks AI costano tutti $27 per 100 milioni di token di input e 20 milioni di token di output, prima degli sconti cache.
Ricevi la mappa degli strumenti AI per imprenditori
L'AI Tools Map for Business Owners trasforma i prezzi dei modelli in un percorso di adozione, indicando la soglia di qualità, il ruolo operativo e il punto di costo che ogni strumento deve giustificare. Iscriviti per ricevere gratuitamente la prossima edizione.
3 set 2026







