Groq pricing en 2026 : le débit impose le passage au payant
Groq pricing en 2026 : comparez l’offre Free, les tarifs API par modèle, les limites de débit, Batch, le cache et les coûts cachés des outils.

Groq pricing : la facture reste à $0 tant que les limites Free propres à chaque modèle ne bloquent pas votre workflow. Au-delà, Developer ne facture aucun abonnement, uniquement l’usage. Dans notre scénario GPT-OSS 120B, le plafond quotidien de tokens de l’offre Free ne représente que $1.44 de trafic payant par mois : c’est donc le débit, et non le coût des tokens, qui impose le passage à l’offre supérieure.
Groq pricing : les tarifs en un coup d’œil
Chez Groq, aucun prix mensuel par licence n’est à retenir en libre-service. Le choix se fait entre une offre Free soumise à des limites de débit, une offre Developer facturée à l’usage et une capacité Enterprise sur mesure.
Ces tarifs et limites ont été vérifiés le 15 août 2026 sur la page tarifaire de Groq, la liste des modèles pris en charge, la FAQ sur la facturation et la documentation des limites de débit.

Le token est l’unité de facturation du modèle. Les tokens d’entrée comprennent les instructions, l’historique de conversation, les documents et les définitions d’outils transmis au modèle. Les tokens de sortie correspondent à ce qu’il génère. Groq tarifie les deux par million de tokens : le coût mensuel additionne donc l’entrée, la sortie, l’audio et l’éventuel usage des outils intégrés.
Developer n’impose aucun engagement mensuel ou annuel. Groq demande un moyen de paiement, mesure la consommation et facture normalement à terme échu. Il n’existe pas de tarif de dépassement distinct : Free bloque le trafic excédentaire dès que la limite applicable est atteinte, tandis que Developer poursuit la facturation aux mêmes tarifs par modèle jusqu’à ce qu’une limite de compte ou un Spend Limit l’arrête. Enterprise Performance suit une autre logique : l’acheteur acquiert une capacité d’entrée et de sortie provisionnée au lieu de payer le tarif public à la demande par token.
Groq gratuit : utile jusqu’à ce qu’une limite partagée devienne critique en production
L’offre Free de Groq suffit pour un prototype, un assistant interne et un volume étonnamment utile d’automatisations peu sollicitées. Elle cesse toutefois d’être une infrastructure gratuite dès qu’une erreur de limite de débit se répercute sur un client.
Les limites s’appliquent à l’organisation, pas à chaque clé API. Multiplier les clés n’augmente donc pas la capacité. Groq impose aussi plusieurs plafonds simultanés : requêtes par minute, requêtes par jour, tokens par minute et tokens par jour. Le premier plafond atteint bloque l’appel suivant avec une erreur HTTP 429.
Pour les modèles texte actuellement en production, les limites Free publiées comprennent :
- GPT-OSS 120B et GPT-OSS 20B : 30 RPM, 1,000 RPD, 8,000 TPM et 200,000 TPD.
- Llama 3.3 70B Versatile : 30 RPM, 1,000 RPD, 12,000 TPM et 100,000 TPD.
- Llama 3.1 8B Instant : 30 RPM, 14,400 RPD, 6,000 TPM et 500,000 TPD.
- Compound et Compound Mini : 30 RPM, 250 RPD et 70,000 TPM.
- Whisper Large V3 et Turbo : 20 RPM, 2,000 RPD, 7,200 secondes audio par heure et 28,800 secondes audio par jour.
Groq précise que ce tableau public n’est qu’une vue d’ensemble. Pour connaître la capacité réellement accordée à une organisation, la page Limits de la Console fait foi.
Le plafond quotidien de tokens est souvent atteint avant celui des requêtes. Prenons un appel à GPT-OSS 120B avec 2,000 tokens d’entrée et 500 tokens de sortie. À 2,500 tokens au total, la limite de 200,000 TPD autorise 80 requêtes de ce type par jour. Le plafond de 8,000 TPM en permet trois en une minute ; une quatrième requête comparable dépasserait la limite de tokens alors même que l’offre annonce 30 RPM.
Voilà le véritable seuil de passage du gratuit au payant. Sur Developer, la même requête coûte $0.0006 : à raison de 80 appels par jour pendant un mois de 30 jours, la facture atteint environ $1.44. Il est peu rationnel de contraindre un workflow de production pour rester sous le plafond Free. L’offre supérieure achète surtout de la capacité, alors que la facture du modèle demeure inférieure à celle de la plupart des options SaaS.

Qui peut rester sur l’offre gratuite
Developer peut rester inutile si Groq ne sert qu’au développement local, à des évaluations ponctuelles, à un script interne personnel ou à une démo dont le trafic reste sous les plafonds de tokens et de requêtes concernés. Free convient aussi lorsqu’un appel en erreur 429 peut attendre une nouvelle tentative et qu’aucune continuité de service n’est promise.
Il faut payer dès que le workflow sert un utilisateur, respecte une échéance ou alimente une file d’attente qui ne peut pas subir le plafond partagé. Developer ajoute également Batch, Flex, le support par chat et les Spend Limits. Ces contrôles opérationnels, plutôt qu’un catalogue de modèles différent, matérialisent la frontière entre les deux offres.
Tous les tarifs actuels des modèles de l’API Groq
Le catalogue de production actuel de Groq reste compact : quatre modèles texte, deux modèles de transcription et deux systèmes Compound. Un catalogue preview distinct regroupe des modèles susceptibles de disparaître à bref délai.
Modèles texte en production
- Llama 3.1 8B Instant coûte $0.05 en entrée et $0.08 en sortie par million de tokens. C’est l’option texte de production la moins chère. Sa capacité Developer de base est de 250,000 TPM et 1,000 RPM, avec une fenêtre de contexte de 131,072 tokens.
- GPT-OSS 20B coûte $0.075 en entrée et $0.30 en sortie par million de tokens. L’entrée mise en cache revient à $0.0375 par million. Sa capacité Developer de base est de 250,000 TPM et 1,000 RPM, avec une fenêtre de contexte de 131,072 tokens.
- GPT-OSS 120B coûte $0.15 en entrée et $0.60 en sortie par million de tokens. L’entrée mise en cache revient à $0.075 par million. Sa capacité Developer de base est de 250,000 TPM et 1,000 RPM, avec une fenêtre de contexte de 131,072 tokens.
- Llama 3.3 70B Versatile coûte $0.59 en entrée et $0.79 en sortie par million de tokens. Sa capacité Developer de base est de 300,000 TPM et 1,000 RPM, avec une fenêtre de contexte de 131,072 tokens.
Commencez une évaluation de production avec GPT-OSS 120B si un grand modèle à poids ouverts est nécessaire et qu’une solution de repli chez un autre fournisseur pour ce même modèle compte. Descendez vers GPT-OSS 20B ou Llama 3.1 8B uniquement lorsqu’un test d’acceptation confirme que le plus petit modèle préserve la qualité du résultat. Ne passez à Llama 3.3 70B que si ses réponses justifient un tarif équivalent à 3.93 fois celui de GPT-OSS 120B en entrée et 1.32 fois en sortie.
Ces multiples ne prouvent pas la supériorité d’un modèle. Ils indiquent la valeur que le résultat doit récupérer grâce à moins de tentatives, des réponses plus courtes, moins de travail de validation ou une capacité absente de l’option moins chère.
Modèles de transcription
- Whisper Large V3 coûte $0.111 par heure audio. Sa capacité Developer de base atteint 200,000 secondes audio par heure et 300 RPM, avec une taille de fichier maximale de 100 MB.
- Whisper Large V3 Turbo coûte $0.04 par heure audio. Sa capacité Developer de base atteint 400,000 secondes audio par heure et 400 RPM.
Pour 1,000 heures audio, les montants sont de $111 avec Whisper Large V3 et de $40 avec Turbo, soit un écart de $71. Le tarif inférieur constitue le meilleur point de départ, mais une équipe audio doit conserver le modèle qui satisfait son seuil d’acceptation des transcriptions. Une transcription moins chère qui exige des corrections ne produit pas un résultat moins coûteux.
Systèmes Compound et modèles preview
Groq Compound et Compound Mini associent des modèles de production à des outils côté serveur. Ils n’ont pas de tarif forfaitaire unique par token. Groq répercute le coût du modèle sous-jacent et celui des outils, d’où la nécessité de décomposer une facture Compound au lieu d’appliquer un simple prix par token.
Le catalogue preview disponible actuellement comprend :
- Qwen3.6 27B : $0.60 en entrée et $3.00 en sortie par million de tokens.
- Safety GPT-OSS 20B : $0.075 en entrée et $0.30 en sortie par million de tokens.
- Llama Prompt Guard 2 22M : $0.03 en entrée et en sortie par million de tokens.
- Llama Prompt Guard 2 86M : $0.04 en entrée et en sortie par million de tokens.
- Canopy Labs Orpheus V1 English : $22 par million de caractères.
- Canopy Labs Orpheus Arabic Saudi : $40 par million de caractères.
- MiniMax M2.7 : tarification Enterprise sur demande auprès de l’équipe commerciale.
Un modèle preview sert à l’évaluation, sans garantie pour la production. Groq indique que ces modèles peuvent être retirés à bref délai. Un budget fondé sur Qwen3.6 27B doit donc prévoir un itinéraire testé vers un autre fournisseur ou modèle avant toute exposition aux clients.
La page Supported Models actuelle de Groq ne référence aucun modèle DeepSeek ni Kimi. Les anciens articles et calculateurs qui les présentent encore comme des options Groq actives sont obsolètes. Si DeepSeek constitue une exigence, évaluez son prix chez un fournisseur qui le propose aujourd’hui au lieu de supposer qu’il figure toujours au catalogue de Groq ; l’analyse des tarifs DeepSeek traite cette décision séparément.
C’est le coût par résultat qui doit guider le choix du modèle
Les tarifs par token de Groq sont si bas que la forme du trafic pèse davantage que le choix du modèle, jusqu’à ce que les volumes deviennent importants. Pour comparer proprement, fixez une requête type et calculez le prix de chaque option.
Retenons une requête standard de 2,000 tokens d’entrée et 500 tokens de sortie. Pour 100,000 requêtes par mois, avant le cache, Batch, les outils ou les nouvelles tentatives :
- Llama 3.1 8B Instant : $14 au total, soit $0.00014 par requête.
- GPT-OSS 20B : $30 au total, soit $0.0003 par requête.
- GPT-OSS 120B : $60 au total, soit $0.0006 par requête.
- Llama 3.3 70B Versatile : $157.50 au total, soit $0.001575 par requête.
- Qwen3.6 27B preview : $270 au total, soit $0.0027 par requête.
Le bon dénominateur n’est pas la requête, mais le résultat accepté. Si un petit modèle doit recommencer, génère des sorties plus longues ou augmente la charge d’un réviseur humain, la requête bon marché peut rendre le workflow coûteux. Suivez les résultats acceptés en parallèle des tokens afin que chaque modèle mérite sa place par sa performance réelle, et non par son prix affiché.
Il n’existe aucun seuil de volume payant à partir duquel un modèle Groq devient automatiquement moins cher qu’un autre. Tous les tarifs publics à la demande sont linéaires et sans frais de base. Dans notre scénario, GPT-OSS 20B coûte toujours la moitié du prix de GPT-OSS 120B, qu’il s’agisse d’une requête ou d’un million. La décision ne bascule que lorsque la qualité du résultat ou le comportement opérationnel modifie la quantité de travail nécessaire.
Pour une startup ayant levé des fonds, cela peut signifier GPT-OSS 20B pour la classification et GPT-OSS 120B pour les cas ambigus. Pour le CTO d’une ETI, il s’agit de conserver les champs du modèle et des tokens dans chaque journal de requête afin que les achats puissent calculer le coût par workflow accepté. Pour un responsable opérationnel expérimenté, l’enjeu est de mesurer les corrections et les nouvelles tentatives, au lieu de prendre une démo réussie pour une preuve de viabilité en production.
Pour les tâches asynchrones, Batch bat le cache — et les remises ne se cumulent pas
Batch de Groq affiche le tarif publié le plus bas lorsqu’un résultat peut attendre. Le service coûte 50% de moins que l’API synchrone, fonctionne hors des limites standard de chaque modèle et accepte une fenêtre de traitement de 24 heures à 7 jours.
Pour les 100,000 requêtes de notre scénario GPT-OSS 120B, les options sont les suivantes :
- Mode synchrone sans cache : $60.
- Mode synchrone avec 50% des tokens d’entrée servis depuis le cache : $52.50.
- Mode synchrone avec 80% des tokens d’entrée servis depuis le cache : $48.
- Batch : $30.
La règle actuelle qui change le budget est sans ambiguïté : les remises Batch et prompt caching ne se cumulent pas. Chaque token Batch est facturé au tarif Batch réduit de 50%, quel que soit son statut dans le cache. Un tableur qui divise encore par deux le total Batch de $30 pour arriver à $15 est erroné.
Le prompt caching reste pertinent pour le trafic GPT-OSS synchrone. Automatique et sans frais supplémentaires, il réduit de 50% le prix de l’entrée mise en cache. Il prend actuellement en charge GPT-OSS 20B, GPT-OSS 120B et GPT-OSS Safeguard 20B. Pour obtenir un hit, le préfixe doit correspondre exactement ; sa longueur minimale varie de 128 à 1,024 tokens selon le modèle, et les données inutilisées expirent au bout de deux heures. Un hit de cache reste en best effort, sans garantie.
Placez les instructions système stables et les définitions d’outils au début du prompt, puis les données variables de l’utilisateur. Consultez ensuite le nombre de tokens mis en cache dans les réponses. Un taux de cache prévisionnel ne devient une donnée budgétaire qu’après confirmation par l’usage en production.
Batch présente d’autres contraintes opérationnelles. Un fichier JSONL peut contenir jusqu’à 50,000 lignes et peser jusqu’à 200 MB. Les tâches qui dépassent la fenêtre de traitement choisie expirent, mais Groq ne facture que les requêtes terminées avec succès. Les fichiers Batch et leurs résultats peuvent rester dans les systèmes de Groq jusqu’à 30 jours : les workloads sensibles nécessitent donc une analyse de la conservation des données avant que l’économie ne décide de l’option.
$60 de tokens peuvent produire une facture Compound de $560
Le coût caché de Compound ne vient pas du modèle, mais de la boucle d’outils.
Groq facture Basic Search $5 pour 1,000 requêtes, Advanced Search $8 pour 1,000, Visit Website $1 pour 1,000 et Code Execution $0.18 par heure. Ces coûts s’ajoutent aux tokens du modèle sous-jacent.
Prenons 100,000 requêtes standard adressées à GPT-OSS 120B. Les tokens du modèle coûtent $60. Si chaque requête déclenche un appel Basic Search, la recherche ajoute $500 et porte la facture totale à $560. Un appel Advanced Search par requête donne un total de $860 ; un appel Visit Website par requête, $160.

C’est la ligne budgétaire qui risque le plus de surprendre une équipe qui conçoit des agents. Optimiser les tokens ne sauvera pas un workflow dont l’agent effectue une recherche à chaque tour. Le premier garde-fou est une politique d’usage des outils : définissez quand la recherche est nécessaire, plafonnez les boucles d’outils, mettez les résultats durables en cache hors du modèle et consignez le nombre d’appels d’outils par résultat accepté.
L’offre payante n’impose aucun engagement annuel, mais comporte des contraintes opérationnelles
Developer est facturé à l’usage ; il ne dissimule pas un contrat SaaS annuel. Les conditions moins visibles concernent le moment où le compte est débité, le comportement des limites et le sort des crédits.
Les nouveaux comptes Developer suivent une facturation progressive. Groq peut émettre une facture lorsque la consommation cumulée depuis l’ouverture du compte franchit $1, $10, $100, $500 puis $1,000. Au-delà du seuil de $1,000, la facturation mensuelle habituelle prend le relais. Pour les comptes associés à une adresse de facturation en Inde, les seuils de $1 et $10 sont suivis de tranches récurrentes de $100. Groq n’exige aucun paiement tant que l’usage n’atteint pas au moins $0.50.
Ce calendrier peut générer plusieurs petits débits sur la carte au début de l’adoption. Il ne s’agit pas de frais supplémentaires, mais la finance doit connaître ce fonctionnement avant d’y voir des doublons.
Les Spend Limits bloquent le trafic avec un léger retard de suivi
Les offres payantes permettent de définir un Spend Limit mensuel unique pour toute l’organisation. Il couvre l’ensemble des clés API et des endpoints, est réinitialisé le premier jour du mois et bloque les nouvelles requêtes dès que le plafond est détecté. Groq permet de créer des alertes, par exemple à 50%, 75% et 90% de la limite.
Le suivi des dépenses accuse un retard de 10 à 15 minutes. Une brusque hausse du trafic peut donc pousser la facture finale légèrement au-delà du montant configuré avant que le blocage ne s’active. Groq recommande de commencer avec une limite située 20% à 30% au-dessus de l’usage mensuel prévu. Sur un parcours critique, cette marge réduit aussi le risque qu’un pic normal transforme le contrôle budgétaire en panne.
Les crédits expirent et les achats prépayés sont définitifs
Les Service Credits de Groq expirent un an après leur achat ou leur attribution, sauf condition différente. Ils ne sont ni transférables, ni convertibles en espèces, ni remboursables. La fermeture du compte entraîne l’expiration immédiate du solde.
La FAQ de facturation de Groq traite les demandes générales de remboursement au cas par cas via le support. Cela ne supplante pas les conditions propres aux Service Credits : les crédits achetés et les crédits promotionnels restent définitivement non remboursables. Achetez un montant adossé à une prévision, et non à un vague projet de migration.
Flex échange une capacité garantie contre un plafond plus élevé
Flex est proposé aux clients payants au même tarif par token qu’On Demand, avec une limite de débit 10 fois supérieure. En contrepartie, la capacité fonctionne en best effort. Lorsqu’elle est saturée, Flex peut échouer rapidement avec une erreur HTTP 498 et capacity_exceeded.
Utilisez Flex pour les files d’attente réessayables, les évaluations et les traitements en volume qui peuvent absorber un échec rapide. N’en faites pas l’unique option pour une action client impossible à répéter. On Demand offre une vitesse prévisible, mais peut ajouter de l’attente lors des pics. Enterprise Performance est l’option contractualisée lorsque cette variabilité est inacceptable, avec un SLA de disponibilité de 99.9% et une garantie de latence de 99% dans le cadre du contrat Enterprise.
Groq, Together AI et Fireworks sont à égalité sur les tokens GPT-OSS 120B hors cache
Groq ne gagne pas la bataille tarifaire de GPT-OSS 120B sur le seul prix public des tokens. Groq, Together AI et Fireworks AI affichent tous $0.15 en entrée et $0.60 en sortie par million de tokens pour ce même modèle.
Normalisons la comparaison avec 100 millions de tokens d’entrée et 20 millions de tokens de sortie. Sans remise liée au cache, chaque fournisseur facture $27. Cette égalité est instructive : le choix dépend alors de l’économie du cache, des limites de débit, des options de déploiement, de la fiabilité et de la latence observée.
Together AI
Together AI est un fournisseur d’inférence multi-modèles dont l’offre serverless GPT-OSS 120B coûte $0.15 en entrée et $0.60 en sortie par million de tokens. Son produit serverless ne comporte ni minimum de facturation ni coût de provisionnement.

La ligne actuelle consacrée à GPT-OSS 120B chez Together ne publie aucun tarif pour l’entrée mise en cache. Sa documentation précise qu’un modèle dépourvu de tarif d’entrée en cache facture toute l’entrée au tarif standard. Dans notre scénario normalisé, le total reste donc de $27 même si le prompt se répète. Together propose une réduction Batch pouvant atteindre 50% sur les modèles serverless compatibles : l’offre reste pertinente pour un traitement asynchrone lorsque ce modèle précis y est éligible.
Choisissez Together si l’étendue du catalogue de modèles ou la possibilité de passer du serverless à une infrastructure réservée compte davantage que le profil opérationnel propre à Groq. N’engagez pas une migration entre les deux pour une simple question de prix tant que le workload ne révèle aucune différence, car la ligne GPT-OSS hors cache est identique.
Fireworks AI
Fireworks AI affiche GPT-OSS 120B à $0.15 en entrée, $0.014 pour l’entrée mise en cache et $0.60 en sortie par million de tokens, avec $1 de crédit serverless à l’inscription.

Avec 50% des tokens d’entrée servis depuis le cache, le total normalisé atteint $20.20 chez Fireworks, $23.25 chez Groq et $27 chez Together. Fireworks devient ainsi le moins cher au tarif public pour les entrées GPT-OSS 120B très répétitives, à condition que son tarif d’entrée en cache s’applique bien au workload mesuré. Pour un traitement asynchrone, Batch de Groq reste moins cher avec $13.50 sur le même trafic normalisé.
OpenAI a développé GPT-OSS, mais ne le propose ni via l’API OpenAI ni dans son application grand public. Une comparaison directe avec l’API OpenAI changerait donc à la fois de fournisseur et de modèle, ce qui invalide la normalisation tarifaire. Comparez d’abord un même modèle chez plusieurs hébergeurs, puis évaluez les modèles propriétaires différents en fonction du résultat accepté. La sélection des API IA les moins chères couvre l’ensemble du marché des modèles et des fournisseurs.
Le choix du fournisseur est assez simple :
- Choisissez Groq lorsque son débit synchrone et ses contrôles opérationnels l’emportent sur le parcours mesuré, ou lorsque la remise Batch de 50% rend le traitement différé moins cher.
- Choisissez Fireworks lorsque la répétition du contexte GPT-OSS permet réellement d’obtenir le tarif annoncé de $0.014 pour l’entrée mise en cache.
- Choisissez Together lorsque sa passerelle plus large entre serverless et infrastructure dédiée est déterminante et que le workload ne profite pas d’un tarif GPT-OSS dédié aux entrées en cache.
À qui Groq convient-il, et qui devrait s’en passer ?
Groq constitue un excellent choix lorsqu’un modèle ouvert satisfait déjà le seuil de qualité et que la vitesse de réponse influe sur le produit. Il est moins adapté si les exigences de modèle, de capacité garantie ou de contrôle du déploiement dépassent son catalogue actuel en libre-service.
- L’offre Free permet d’évaluer utilement les modèles de production avant même d’ajouter un moyen de paiement.
- Developer n’impose ni abonnement de base ni engagement annuel.
- Pour tous les modèles texte de production, les tarifs publics à la demande restent inférieurs à $1 par million de tokens.
- Batch réduit de 50% le coût des tâches asynchrones éligibles sans consommer les limites standard des modèles.
- Le prompt caching de GPT-OSS est automatique et divise par deux le tarif des entrées mises en cache.
- Les Spend Limits peuvent bloquer l’usage à l’échelle de l’organisation avant que le budget mensuel ne dérape.
- Les limites Free sont partagées au niveau de l’organisation et peuvent être atteintes sur les tokens bien avant les requêtes.
- Les remises Batch et cache ne se cumulent pas.
- Le coût des outils Compound peut largement dépasser celui des tokens du modèle.
- Le prompt caching ne prend en charge que la famille GPT-OSS indiquée et exige une réutilisation exacte du préfixe.
- Flex peut renvoyer une erreur HTTP 498 lorsque la capacité en best effort est indisponible.
- Les modèles preview peuvent être retirés à bref délai et ne doivent donc pas devenir une dépendance de production impossible à déplacer.
Une startup ayant levé des fonds devrait choisir Groq si un modèle ouvert rapide préserve la réactivité du produit et si l’équipe peut maintenir une solution de repli sur ce même modèle. Le CTO d’une ETI ne devrait adopter Developer qu’après avoir centralisé les clés, journalisé l’usage des modèles et des outils, puis fixé une limite à l’échelle de l’organisation. Un responsable opérationnel expérimenté doit suivre le coût par résultat accepté, et non se laisser séduire par un spectaculaire nombre de tokens par dollar.
Évitez de faire de Groq votre fournisseur unique si l’application exige un modèle propriétaire absent du catalogue, une capacité garantie plutôt qu’un mode best effort ou un modèle preview sans remplacement stable. Enterprise Performance peut apporter une capacité contractualisée pour les modèles pris en charge, mais sa tarification repose sur un provisionnement sur mesure, et non sur une offre publique moins chère.
La règle de décision est explicite : choisissez Groq uniquement si un modèle de production actuel réussit le test d’acceptation et si son comportement synchrone ou le coût de Batch bat la solution de repli utilisant le même modèle. Dans le cas contraire, le faible tarif des tokens ne justifie pas une migration.
L’historique des prix Groq impose une vérification en direct
Chez Groq, les tarifs évoluent au niveau des fonctionnalités et des modèles, même si la facturation demeure à l’usage. Lors du lancement de Developer en février 2025, Batch était présenté avec une remise de 25% sur le prix synchrone. La documentation Batch actuelle porte cette réduction à 50%.
Groq a également baissé les prix de GPT-OSS et commencé à intégrer le prompt caching à cette famille en octobre 2025. Les tarifs actuels sont de $0.15/$0.60 pour GPT-OSS 120B et de $0.075/$0.30 pour GPT-OSS 20B, l’entrée mise en cache étant facturée à la moitié du prix standard.
Les changements de catalogue comptent autant que l’historique tarifaire. Certains modèles présents dans d’anciens comparatifs, notamment les options Kimi et DeepSeek, ne figurent plus sur la page Supported Models actuelle. Un budget doit donc conserver sa date de vérification, l’ID du modèle et une solution de repli, au lieu de considérer un tarif copié comme permanent.
L’action du lundi : chiffrer un workflow accepté et le plafonner
Dès lundi, choisissez un workflow bien délimité et construisez un budget que l’ingénierie et la finance pourront toutes deux examiner. Ne commencez pas par une migration globale de fournisseur.
Décrire la forme du trafic
Exportez une semaine représentative avec le nombre de requêtes, les tokens d’entrée et de sortie, les tokens servis depuis le cache, les ID de modèles, les appels d’outils, les nouvelles tentatives et les résultats acceptés. Séparez le trafic synchrone des tâches qui peuvent attendre.
Chiffrer trois options
Calculez On Demand aux tarifs actuels des modèles, Batch avec une réduction de 50% pour les tâches différées éligibles et les outils sur des lignes distinctes. N’appliquez pas les économies du cache à Batch et ne supposez aucun taux de cache que les données d’usage n’ont pas mesuré.
Fixer la limite payante
Si les limites Free interrompent le parcours, transférez-le vers Developer. Définissez un Spend Limit mensuel 20% à 30% supérieur aux prévisions, puis placez des alertes à 50%, 75% et 90%. Conservez une marge pour le retard de suivi de 10 à 15 minutes.
Maintenir une solution de repli opérationnelle
Testez le même modèle chez un autre fournisseur sur un petit jeu d’évaluation. Consignez l’endpoint, le taux d’acceptation observé et le déclencheur du basculement afin qu’un changement de catalogue ou une erreur de capacité ne se transforme pas en migration d’urgence.
Vous obtenez ainsi une ligne budgétaire par workflow accepté, couvrant les tokens du modèle, les outils, les nouvelles tentatives et la validation humaine. Reprenez le calcul chaque fois que le catalogue actif, les limites de débit ou la page tarifaire évoluent.
Questions fréquentes
Combien coûte Groq AI ?
Groq Free coûte $0. Developer n’a pas d’abonnement de base et facture l’usage selon le modèle. Les tarifs actuels des modèles texte de production vont de $0.05 en entrée et $0.08 en sortie par million de tokens pour Llama 3.1 8B Instant à $0.59 en entrée et $0.79 en sortie pour Llama 3.3 70B Versatile.
Groq est-il gratuit ?
Oui, dans la limite des plafonds propres à chaque modèle et partagés par l’organisation. GPT-OSS 120B et 20B affichent actuellement 30 RPM, 1,000 RPD, 8,000 TPM et 200,000 TPD sur Free. Le dépassement d’une limite applicable renvoie une erreur HTTP 429.
Quels modèles Groq AI sont accessibles gratuitement ?
L’offre Free donne accès au catalogue pris en charge, avec des plafonds propres à chaque modèle. Pour une évaluation durable, privilégiez les modèles de production. Groq précise que les modèles preview servent à l’évaluation et peuvent être retirés à bref délai.
Quel est le prix mensuel de Groq ?
Il n’existe aucun abonnement public mensuel ou annuel en libre-service. Additionnez chaque mois les tokens d’entrée et de sortie, l’audio, les outils et le niveau de service aux tarifs en vigueur. Dans notre scénario de 100,000 requêtes sur GPT-OSS 120B, le coût synchrone atteint $60 avant le cache ou les outils.
Groq propose-t-il un tarif étudiant ?
Groq ne mentionne aucune remise réservée aux étudiants sur les pages de prix et de facturation vérifiées en août 2026. Les étudiants, comme les autres utilisateurs occasionnels, peuvent utiliser l’offre Free générale à $0 dans la limite de ses plafonds.
Quelle est la politique de remboursement de Groq ?
Groq examine au cas par cas les demandes générales de remboursement liées à la facturation par l’intermédiaire du support. Les Service Credits sont soumis à des règles plus strictes : les crédits achetés ou promotionnels ne sont ni remboursables ni transférables et expirent après un an, sauf condition différente.
Les tarifs Groq ont-ils changé ?
Oui. Lors de son lancement en février 2025, Batch offrait une réduction de 25% sur le prix synchrone ; elle atteint aujourd’hui 50%. Groq a baissé les tarifs GPT-OSS et ajouté le cache à cette famille en octobre 2025. Vérifiez la page actuelle, car le catalogue et les prix par modèle évoluent.
Comment les tarifs Groq se comparent-ils à ceux d’OpenAI ?
OpenAI ne propose pas GPT-OSS via sa propre API : une comparaison directe change donc de modèle. Pour un scénario GPT-OSS 120B normalisé, Groq, Together AI et Fireworks AI facturent tous $27 pour 100 millions de tokens d’entrée et 20 millions de tokens de sortie avant les remises de cache.
Recevez la carte des outils IA destinée aux dirigeants
La carte des outils IA destinée aux dirigeants transforme les prix des modèles en parcours d’adoption, avec le niveau de qualité minimal, le rôle opérationnel et le seuil de coût que chaque outil doit justifier. Inscrivez-vous pour recevoir gratuitement la prochaine édition.
3 sept. 2026







