Grok 4.5 : avis sur le modèle agentique à $2/$6

Grok 4.5 coûte $2/$6 par million de tokens. Découvrez ses benchmarks, le seuil tarifaire à 200K, son coût dans Cursor et à qui il convient vraiment.

Thursday, September 3, 2026Omid Saffari
Grok 4.5 : avis sur le modèle agentique à $2/$6

Grok 4.5 coûte $2 par million de tokens en entrée et $6 par million de tokens en sortie, mais ce n’est pas le nouveau leader du code. C’est le modèle à privilégier lorsque le coût des agents et l’efficacité en tokens comptent davantage qu’une première place à chaque benchmark, à condition que vos prompts restent sous le seuil tarifaire des 200K.

Grok 4.5 : le verdict en un tableau

Grok 4.5 est le choix rentable entre le modèle de code le moins cher et le champion des benchmarks. Il coûte plus que Composer 2.5 de Cursor, reste derrière Claude Fable 5 sur la plupart des tests du propre graphique d’ingénierie de SpaceXAI, mais demeure très convaincant pour les agents qui tournent longtemps : dans Cursor, ses sorties sont facturées $6 contre $50 pour Fable.

Documentation du modèle SpaceXAI Grok 4.5 présentant ses tarifs, ses capacités et ses modes d’accès
Documentation du modèle Grok 4.5

La grille tarifaire actuelle de Cursor offre la comparaison la plus lisible, car elle place les modèles maison et les solutions de pointe sur le même barème. Tous les prix ci-dessous s’entendent par million de tokens.

Modèle dans CursorIdéal pourEntréeLecture du cacheSortieVerdict
Grok 4.5Agents longs et sensibles au coût$2$0.50$6Le meilleur équilibre entre capacités de pointe et coût agentique
Composer 2.5Tâches de code courantes au coût minimal$0.50$0.20$2.50À choisir lorsque le prix prime sur les capacités maximales
Claude Fable 5Meilleur taux de réussite sur les tests de code affichés$10$1$50Le surcoût se justifie lorsque les échecs coûtent plus cher que les tokens
GPT-5.6 SolEnvironnements de production centrés sur OpenAI$5$0.50$30Une meilleure intégration à l’écosystème peut compenser le tarif supérieur

Pour une charge mensuelle de 10 millions de nouveaux tokens en entrée et de 2 millions de tokens en sortie, le calcul est simple : $32 pour Grok 4.5, $10 pour Composer 2.5, $200 pour Claude Fable 5 et $110 pour GPT-5.6 Sol. Sur les offres Teams et Enterprise, Cursor ajoute aussi $0.25 par million de tokens aux modèles tiers, tandis que ses modèles maison Grok et Composer en sont exonérés.

C’est donc dans Cursor que le positionnement de Grok 4.5 saute aux yeux : ni le moins cher ni le mieux classé, mais la soupape économique entre les deux.

Page des modèles et tarifs Cursor avec les coûts en tokens de Grok 4.5 et de ses concurrents
Tarifs des modèles dans Cursor

Voilà pour le verdict. Il reste à vérifier si votre charge de travail se situe du bon côté de cette équation.

Qu’est-ce que Grok 4.5 et où peut-on l’utiliser ?

Grok 4.5 est un modèle de raisonnement conçu pour le code, les tâches agentiques et le travail intellectuel, et non une simple nouvelle option de chat. Cursor et SpaceXAI le présentent comme un modèle mixture-of-experts entraîné conjointement : à chaque token, seul un sous-ensemble de composants spécialisés est activé, au lieu de mobiliser tout le réseau à chaque étape.

Le lancement s’est déroulé en deux temps. Cursor a lancé Grok 4.5 le 8 juillet, puis SpaceXAI a publié l’annonce complète le 16 juillet. D’après Cursor, le corpus d’entraînement mêlait des milliers de milliards de tokens issus d’interactions entre développeurs et agents, des tâches STEM, des articles de recherche et des travaux intellectuels plus généraux.

L’identifiant actuel du modèle est grok-4.5. Il accepte du texte et des images, renvoie du texte, dispose d’une fenêtre de contexte de 500,000 tokens et propose un effort de raisonnement low, medium ou high, ce dernier étant appliqué par défaut. Ses outils natifs couvrent les appels de fonction, la recherche web, la recherche sur X et l’exécution de code via la Responses API ou Chat Completions.

Pour un modèle aussi récent, sa diffusion est exceptionnellement large. Il est accessible via l’API SpaceXAI, sert de modèle par défaut dans Grok Build, fonctionne dans Cursor avec toutes les offres, alimente des compléments Word, PowerPoint et Excel, et figure aux catalogues d’OpenRouter, Vercel, Cloudflare, Snowflake et Databricks Mosaic. Dans Cursor, il est disponible sur desktop, web, iOS, CLI et dans le SDK.

Cette couverture réduit les obstacles à l’adoption, sans pour autant effacer les différences entre le modèle et les produits qui l’intègrent. Le cache de Grok 4.5 dans l’API directe n’est pas facturé de la même façon que celui de Grok 4.5 dans Cursor, tandis que Grok Build ajoute une boucle agentique au-dessus du modèle. L’analyse précédente de l’économie de Grok Build reposait surtout sur un abonnement forfaitaire. Grok 4.5 change la donne, puisque le modèle comme l’agent disposent désormais de parcours facturés plus clairement à l’usage.

Les benchmarks parlent de rentabilité, pas de domination

Grok 4.5 remporte un des cinq benchmarks d’ingénierie affichés par SpaceXAI, frôle les leaders sur un autre et reste derrière Claude Fable 5 sur les trois derniers. Pour en faire le nouveau champion du code, il faut donc passer sous silence les propres chiffres de son fournisseur.

BenchmarkGrok 4.5Meilleur score affichéPosition de GrokEnseignement pratique
DeepSWE 1.062.0%Fable 5 à 66.1%TroisièmeCompétitif, mais pas premier
DeepSWE 1.153%Fable 5 à 70%QuatrièmeÉcart de fiabilité significatif
SWE Marathon29.0%Grok 4.5 à 29.0%PremierMeilleur résultat sur la résolution à long horizon
Terminal Bench 2.183.3%Fable 5 à 84.3%Troisième, à 0.1 de GPT-5.5Dans les faits, au contact du groupe de tête
SWE Bench Pro64.7%Fable 5 à 80.4%TroisièmeUtile, mais nettement derrière le leader

Le graphique de lancement de SpaceXAI indique que les chiffres des concurrents proviennent de leurs system cards ou des classements des benchmarks. Ce tableau donne donc une direction, mais ne remplace pas une évaluation adaptée à votre charge de travail. En modifiant l’environnement d’exécution, le réglage de raisonnement, le nombre de nouvelles tentatives ou le budget de tokens, le score de code peut évoluer au point de changer une décision d’achat.

Les écarts sont précis. Grok accuse un retard de 4.1 points sur Fable 5 dans DeepSWE 1.0, de 17 points dans DeepSWE 1.1, de 1 point dans Terminal Bench 2.1 et de 15.7 points dans SWE Bench Pro. Sa victoire incontestable arrive sur SWE Marathon, où ses 29.0% dépassent les 26.0% d’Opus 4.8 et les 24.0% de Fable 5.

L’argument de l’efficacité est plus solide. SpaceXAI annonce une moyenne de 15,954 tokens de sortie pour Grok par tâche SWE Bench Pro, contre 67,020 pour Opus 4.8 max, soit environ 4.2 fois moins. Ces données viennent du fournisseur, mais elles pointent vers la bonne unité économique : une tâche achevée, et non le prix affiché d’un token.

Les mesures indépendantes permettent de garder les pieds sur terre. Artificial Analysis attribue à Grok 4.5 le solide score de 54, contre 55 pour GPT-5.5 xhigh. Avec la pondération 7:2:1 entre cache, entrée et sortie, le prix agrégé atteint $1.35 par million de tokens pour Grok, contre $4.35 pour GPT-5.5. Cette même comparaison en direct a mesuré environ 70 tokens de sortie par seconde pour Grok et environ 76 pour GPT-5.5.

SpaceXAI annonce 80 tokens de sortie par seconde. La mesure indépendante tourne autour de 70. Cet écart ne constitue pas un échec, mais rappelle que la vitesse réellement servie varie et que le débit annoncé au lancement n’est pas une garantie de niveau de service.

Le constat est sans détour : Grok 4.5 s’approche suffisamment des performances de pointe pour devenir économiquement intéressant, mais pas assez pour remplacer un contrôle qualité par une grille tarifaire.

Le vrai prix de Grok 4.5

Le tarif phare de Grok 4.5, $2/$6, n’est exact qu’en dessous de 200,000 tokens de contexte. Dès que ce seuil est franchi, SpaceXAI double les tarifs des nouvelles entrées, des entrées en cache et des sorties pour l’ensemble de la requête.

API SpaceXAI directeNouvelle entréeEntrée en cacheSortie
Moins de 200K de contexte$2$0.30$6
200K de contexte ou plus$4$0.60$12

La nuance est capitale : une fenêtre de contexte de 500,000 tokens indique une capacité, pas une capacité bon marché. Une requête comprenant 250K tokens en entrée et produisant 50K tokens en sortie coûte $1.60 au tarif long contexte. Avec les tarifs du contexte court, les mêmes volumes auraient coûté $0.80. Le franchissement du seuil double la facture des tokens avant même de compter les recherches web, l’exécution de code ou les nouvelles tentatives.

Seuil tarifaire de Grok 4.5 en dessous et au-dessus de 200K tokens de contexte
Le seuil des 200K double tous les tarifs directs en tokens de la requête.

Le cache peut au contraire réduire la note. Une charge composée de 10 millions de nouveaux tokens en entrée et de 2 millions de tokens en sortie revient à $32. Si la moitié des entrées est fournie par le cache de l’API directe, la facture tombe à $23.50 : une économie de $8.50, soit environ 26.6%.

Cette économie n’a rien d’automatique. SpaceXAI recommande de définir prompt_cache_key dans la Responses API, ou x-grok-conv-id avec Chat Completions, afin qu’une conversation soit renvoyée vers le même serveur. Sans ce réglage, un serveur dont le cache est froid peut transformer les accès au cache attendus en entrées facturées au prix fort.

L’usage des outils ajoute un second compteur. La recherche web, la recherche sur X et l’exécution de code coûtent chacune $5 pour 1,000 appels. Une exécution qui effectue 25 appels de ce type ajoute $0.125, sans compter les tokens consommés par le modèle derrière ces appels. La recherche dans les pièces jointes coûte $10 pour 1,000 appels, contre $2.50 pour 1,000 recherches dans les collections.

Ce qui casse en production

Le premier incident en production vient d’une hausse tarifaire silencieuse, pas de l’intelligence du modèle. Un prompt à l’échelle d’un dépôt dépasse peu à peu les 200K, tous les tokens de la requête basculent vers le tarif long contexte, et le budget fondé sur le prix phare de $2/$6 devient immédiatement faux.

Le deuxième piège est l’optimisme autour du cache. Les tours successifs d’un agent semblent propices à la mise en cache, mais ils ne bénéficient du tarif direct de $0.30 que si le routage permet de réutiliser le préfixe précédent. La recommandation explicite de SpaceXAI sur la clé de cache doit faire partie de la conception de la facturation dès la première requête.

Le troisième problème est l’accumulation du contexte. Les agents qui tournent longtemps relisent sans cesse les plans, les sorties d’outils, les diffs, les tests et les explications précédentes. La fenêtre de 500,000 tokens retarde l’échec ; elle ne rend pas judicieux le transport de chaque ancien échange. Pour les boucles longues, SpaceXAI recommande de compacter le contexte, autrement dit de remplacer les détails périmés par un état de travail plus court avant que l’agent n’atteigne le seuil tarifaire ou ne se perde dans son propre historique.

Le quatrième écueil consiste à transformer les benchmarks du fournisseur en critère de mise en production. Les résultats publiés de Grok 4.5 vont d’une première place sur SWE Marathon à un retard de 17 points sur Fable 5 dans DeepSWE 1.1. En pratique, la qualité dépendra de votre dépôt, de l’environnement d’exécution, de la couverture des tests, des autorisations accordées aux outils et de votre définition de la réussite.

Cinquième point : la disponibilité selon la plateforme. La page actuelle de Grok 4.5 dans Cursor précise que le modèle n’est pas encore accessible dans l’Union européenne via Cursor. Cette restriction propre à Cursor ne prouve pas que toutes les voies d’accès à SpaceXAI sont bloquées, mais elle suffit aujourd’hui à empêcher une équipe européenne de bâtir sa migration vers Cursor autour de ce modèle.

À qui s’adresse Grok 4.5, et qui devrait l’éviter ?

Grok 4.5 convient aux boucles agentiques sensibles au coût, qui restent sous 200K et savent vérifier leur propre travail. Mieux vaut s’en passer lorsque le meilleur taux de réussite affiché en code justifie le supplément, lorsque Composer 2.5 suffit déjà ou lorsque les utilisateurs de Cursor se trouvent dans l’Union européenne.

Votre situationChoixPourquoiCe qui ferait basculer la décision
Agent API longue durée, prompts sous 200KGrok 4.5$2 en entrée, $0.30 pour l’entrée en cache, $6 en sortieFable réduit assez les échecs pour amortir son surcoût
Code courant dans Cursor avec un plafond budgétaire strictComposer 2.5$0.50 en entrée et $2.50 en sortieLe taux de réussite de Grok réduit assez les nouvelles tentatives pour compenser son tarif supérieur
Un échec coûte bien plus cher que les tokensClaude Fable 5En tête de quatre des cinq benchmarks affichésGrok l’égale sur votre échantillon de tâches représentatives
Vous avez besoin de la variante Fast nommée dans CursorGrok 4.5 FastDisponible à $4 en entrée et $18 en sortieGrok standard atteint l’objectif de latence
Une requête dépasse régulièrement 200KCompactez ou redirigez d’abordLes tarifs directs de Grok doublent pour toute la requêteLe contexte long évite assez de coûts de recherche documentaire ou d’orchestration pour compenser l’écart
Les utilisateurs de Cursor sont dans l’UEAttendez ou choisissez un modèle disponibleCursor indique que Grok 4.5 n’y est pas accessibleCursor modifie sa disponibilité régionale
Arbre de décision pour choisir Grok 4.5, Fable 5, Composer 2.5 ou attendre
Le choix dépend du coût agentique, de la valeur du taux de réussite, du niveau de vitesse, de la taille du contexte et de la région.
Les atouts
Ce qu'il fait bien
8 points

  • Les tarifs de $2 en entrée et $6 en sortie rendent le travail agentique proche du meilleur niveau nettement moins cher qu’avec Fable 5 ou GPT-5.6 Sol dans Cursor.
  • Une fenêtre de contexte de 500,000 tokens laisse de la place pour des dépôts volumineux et de longs historiques de tâches.
  • Les appels de fonction, la recherche web, la recherche sur X, l’exécution de code, les sorties structurées et deux interfaces API standard réduisent le travail d’intégration.
  • Les données du fournisseur montrent une vraie victoire sur SWE Marathon et une consommation de tokens de sortie nettement inférieure à celle d’Opus 4.8 max sur SWE Bench Pro.
  • Grok 4.5 n’arrive pas en tête de quatre des cinq benchmarks d’ingénierie du propre graphique de SpaceXAI.
  • Les tarifs de l’API directe doublent pour chaque token dès que la requête atteint 200K de contexte.
  • Pour économiser de façon fiable grâce au cache, le routage doit être rigoureusement configuré.
  • La vitesse indépendante reste sous les 80 tokens par seconde annoncés par le fournisseur, et Cursor a signalé une contamination dans un benchmark désormais exclu.

Un plan d’évaluation sûr

Le bon test d’adoption compare des travaux terminés selon un niveau de qualité maîtrisé, et non des prompts pris isolément. Conservez exactement le même jeu de tâches, le même moteur agentique, les mêmes autorisations d’outils et les mêmes critères d’acceptation pour chaque modèle.

  1. Figez un jeu de tâches représentatif

    Sélectionnez des missions réelles parmi celles que vous comptez déléguer : la correction d’un bug avec ses tests, une modification à l’échelle d’un dépôt, une recherche faisant appel à des outils, ainsi qu’un livrable sous forme de document ou de feuille de calcul si cela compte pour vous. Définissez la réussite et l’échec avant qu’un modèle ne voie ces tâches.

  2. Maîtrisez le raisonnement et le contexte

    Appliquez le même réglage de raisonnement à chaque exécution de Grok, consignez la taille exacte du prompt et séparez les tâches sous 200K des tâches en contexte long. N’accordez pas à un modèle des fichiers supplémentaires ou un budget d’outils différent.

  3. Rendez le cache mesurable

    Définissez prompt_cache_key ou x-grok-conv-id pour les conversations répétées. Comptabilisez séparément les nouvelles entrées et celles issues du cache, afin que la comparaison reflète une facture reproductible.

  4. Décidez selon l’économie des tâches achevées

    Mesurez le taux de réussite, les corrections humaines, les nouvelles tentatives, le total de tokens, les appels d’outils et le temps écoulé. N’adoptez Grok que si le coût par résultat accepté bat celui du modèle en place sans abaisser le niveau exigé pour la mise en production.

Pour un fondateur ayant levé des fonds, ce critère peut être le temps de revue des développeurs. Pour le CTO d’une entreprise de taille intermédiaire, il peut s’agir des défauts passés en production et de l’auditabilité. Pour un cadre opérationnel expérimenté, la question sera plutôt de savoir si un livrable Excel ou une recherche résiste à une vérification factuelle. Quant au développeur technique indépendant, il doit surtout déterminer si le tarif inférieur produit davantage de travail achevé sans lui imposer un deuxième métier : corriger l’agent.

Questions fréquentes

Grok 4.5 est-il performant ?

Oui, si vous recherchez de solides capacités agentiques à moindre coût en tokens. Ce n’est pas le choix par défaut le plus sûr pour maximiser la précision en code : Fable 5 arrive en tête de quatre des cinq benchmarks d’ingénierie présentés par SpaceXAI, tandis que Grok s’impose surtout sur les travaux longs et économes.

Combien coûte Grok 4.5 ?

Sous 200K de contexte, l’API SpaceXAI directe coûte $2 par million de nouveaux tokens en entrée, $0.30 par million de tokens d’entrée en cache et $6 par million de tokens en sortie. À partir de 200K, ces tarifs passent à $4, $0.60 et $12 pour toute la requête. Dans son catalogue maison, Cursor affiche $2 en entrée, $0.50 pour la lecture du cache et $6 en sortie.

Où peut-on utiliser Grok 4.5 ?

SpaceXAI documente un accès par son API, Grok Build, Cursor, Word, PowerPoint, Excel, OpenRouter, Vercel, Cloudflare, Snowflake et Databricks Mosaic. Cursor le prend en charge sur desktop, web, iOS, CLI et dans son SDK, mais le signale actuellement comme indisponible dans l’Union européenne.

Vous voulez la checklist de configuration Claude Code + Codex ? Recevez-la avec la newsletter.

Dernière mise à jour

3 sept. 2026

CatégorieAI

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.