Gateway IA : les meilleurs choix pour réduire les coûts d’inférence en 2026

Comparatif des meilleurs gateways IA pour réduire les coûts d’inférence en 2026 : Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey et OpenRouter.

Wednesday, September 2, 2026Omid Saffari
Gateway IA : les meilleurs choix pour réduire les coûts d’inférence en 2026

Vercel AI Gateway est actuellement le meilleur gateway IA managé pour réduire les coûts d’inférence : pour une charge mensuelle GPT-5.6 Sol de 100 millions de tokens en entrée et 20 millions en sortie, la facture passe de $800 au tarif direct actuel d’OpenAI à $400 avec le tarif Default actuellement proposé par Vercel. Ces $400 d’économie constituent une fenêtre d’achat, pas une promesse annuelle, car la remise de 50% de Vercel prend fin le 18 septembre 2026.

L’enseignement durable dépasse cette promotion. Un gateway IA ne réduit la facture que si le routage, le cache de réponses ou les budgets imposés éliminent davantage de dépenses fournisseur que la passerelle n’ajoute de frais et de charge d’exploitation. Vercel est le choix managé par défaut, LiteLLM celui de l’auto-hébergement, Cloudflare celui du cache pour les requêtes strictement identiques, TrueFoundry celui du cache sémantique managé, Portkey celui de la gouvernance à $49 et OpenRouter celui de la marketplace de fournisseurs.

Gateway IA : le comparatif en bref

Tous les noms d’offres, tarifs publics et plafonds ci-dessous ont été vérifiés sur les pages actives des éditeurs le 24 août 2026. La colonne « Essai gratuit » distingue une formule gratuite permanente d’une période d’évaluation : un prototype gratuit peut devenir une coûteuse dépendance en production si sa véritable limite reste invisible.

OutilIdéal pourPrix d’entréeEssai gratuit
Vercel AI GatewayLe coût de plateforme managée le plus bas et la remise actuelle sur GPT-5.6 SolFree inclut $5/mois ; Paid repose sur des crédits d’usage sans margeFormule Free permanente
LiteLLML’auto-hébergement avec une équipe plateforme déjà en placeOpen Source $0 ; Enterprise sur devis annuelEssai Enterprise de 30 jours
Cloudflare AI GatewayLe cache des requêtes strictement identiques dans une stack CloudflareFonctions essentielles du gateway à $0 ; usage fournisseur en supplémentCœur gratuit permanent
TrueFoundry AI GatewayLe cache sémantique managé et les contrôles d’entrepriseDeveloper $0 ; Pro $499/moisEssai de 7 jours et formule Developer
PortkeyLes contrôles de production managés à partir de $49/moisDeveloper $0 ; Production $49/moisFormule Developer permanente
OpenRouterLe routage des fournisseurs par prix et une marketplace de modèlesFree $0 ; les crédits mutualisés ajoutent 5.5%Formule Free permanente

Le prix d’entrée ne suffit pas à désigner le vainqueur. La licence LiteLLM peut être gratuite tandis que son plan de contrôle mobilise de vraies ressources d’ingénierie. Le cœur de Cloudflare peut ne rien coûter alors qu’Unified Billing ajoute 5%. TrueFoundry peut supprimer des appels complets au modèle grâce à la réutilisation sémantique, mais son premier niveau de production coûte $499 par mois. La comparaison pertinente porte sur le montant total qui reste à payer une fois le gateway à l’œuvre.

Avant le classement : l’équation des économies

La bonne équation budgétaire est la suivante : dépenses fournisseur restantes + frais du gateway + contrôles payants + coût d’exploitation. Une passerelle ne mérite sa place que si ce total reste inférieur à l’accès direct pour un même nombre de résultats acceptés. Le nombre de modèles, la qualité du dashboard et l’étendue du failover sont des atouts, mais ne deviennent des économies que lorsqu’ils éliminent une dépense ou une défaillance coûteuse du workflow.

Partons d’une facture normalisée pour faire apparaître les écarts. OpenAI affiche actuellement GPT-5.6 Sol à $4 par million de tokens en entrée et $20 par million en sortie. Un workflow consommant 100 millions de tokens en entrée et 20 millions en sortie coûte donc $800, avant les remises sur les entrées mises en cache, les outils ou les multiplicateurs de contexte long : $400 pour l’entrée et $400 pour la sortie.

La mise à jour tarifaire d’août de Vercel affiche le même modèle à $2 en entrée et $10 en sortie sur son niveau de service Default remisé jusqu’au 18 septembre. Le mois normalisé revient alors à $400, soit une baisse de 50%. Flex est actuellement facturé $1 en entrée et $5 en sortie, tandis que Priority coûte $4 en entrée et $20 en sortie, toujours par million de tokens pour les requêtes inférieures ou égales à 272,000 tokens.

Deux réservoirs de serre comparent une facture directe GPT-5.6 Sol de $800 à une facture Vercel de $400 pour 100 millions de tokens en entrée et 20 millions en sortie
La remise actuelle de Vercel divise par deux cette facture mensuelle Sol normalisée jusqu’au 18 septembre 2026

Le tarif du modèle n’est que le premier levier. Un hit de cache exact peut éviter entièrement l’appel au fournisseur. Le routage vers un modèle moins cher peut réduire le prix unitaire, à condition que les réponses franchissent toujours le seuil d’acceptation. Un plafond budgétaire peut arrêter un agent qui s’emballe : ce n’est pas une remise sur les tokens, mais cela peut représenter la plus grosse économie du mois. La métrique d’exploitation à suivre est le coût par résultat accepté, nouvelles tentatives et revue comprises, et non le coût par token pris isolément.

Pour comparer d’abord les prix des fournisseurs, consultez le comparatif des API IA les moins chères. Ce classement se place un niveau au-dessus et cherche à savoir si un gateway peut réellement abaisser ces tarifs fournisseur.

1. Vercel AI Gateway : le meilleur choix global pour réduire les coûts en mode managé

Vercel AI Gateway est le meilleur choix global pour une équipe qui cherche un gateway managé, sans marge sur les tokens et capable de produire une économie réelle dès maintenant.

Page tarifaire de Vercel AI Gateway présentant les formules Free et Paid ainsi que les suppléments
Tarifs de Vercel AI Gateway vérifiés le 24 août 2026

Son meilleur argument est particulièrement concret. La page tarifaire active indique que Free comme Paid appliquent les prix catalogue des fournisseurs sans marge ; la promotion actuelle sur GPT-5.6 Sol réduit ensuite de 50% supplémentaires le tarif du modèle en Default. Une jeune entreprise financée peut migrer un workflow d’extraction ou de support à fort volume et ramener la ligne modèle normalisée de $800 à $400 sans devoir exploiter son propre proxy.

La formule Free comprend $5 de crédit mensuel, couvre une sélection de modèles éligibles, applique des limites de débit inférieures propres à chaque modèle et n’autorise pas le bring-your-own-key. La formule Paid utilise des crédits achetés, ouvre tous les modèles disponibles, relève les limites et active BYOK sans frais de gateway Vercel ni engagement. L’achat de crédits fait passer l’équipe sur Paid : le crédit Free mensuel de $5 ne s’applique alors plus.

BYOK présente une subtilité de facturation qui mérite de figurer dans la procédure d’exploitation. Lorsqu’une requête utilisant les identifiants fournisseur du client échoue, Vercel peut la relancer avec ses propres identifiants pour préserver la fiabilité ; ce fallback est débité du solde de crédits gateway de l’équipe. Une équipe qui s’attend à maintenir toutes ses requêtes sur un compte fournisseur négocié doit surveiller ce solde et rapprocher le trafic de fallback, plutôt que de considérer BYOK comme la garantie que les crédits Vercel ne bougeront jamais.

La promesse « sans marge » exclut également les contrôles payants. Custom Reporting coûte $0.075 pour 1,000 écritures de tags, d’identifiants utilisateur ou d’entités de quota, et $5 pour 1,000 requêtes de reporting. Une liste blanche de fournisseurs à l’échelle de l’équipe coûte $0.10 pour 1,000 requêtes réussies sur Pro et Enterprise, tandis qu’un filtre fournisseur appliqué requête par requête n’entraîne aucun surcoût. L’application de la zero-data-retention à toute l’équipe ajoute $0.10 pour 1,000 requêtes, même si la ZDR par requête reste gratuite sur Pro et Enterprise.

Les drains de traces ajoutent $0.05 pour 1,000 traces et $0.50 par GB de sortie, sans quota inclus sur Pro. Pour un million de requêtes réussies, la liste blanche globale représente $100, la ZDR globale $100 supplémentaires et un million de traces $50 avant le trafic sortant. Le gateway peut toujours rester l’option la moins chère, mais l’acheteur doit comparer la facture configurée, pas seulement l’absence de marge sur les tokens.

La limite la plus franche est temporelle. La remise Sol offre une excellente fenêtre de migration, mais ne constitue pas une thèse d’architecture pérenne. Après la promotion, Vercel reste intéressant si son routage sans marge, ses budgets, son failover et son observabilité remplacent des tâches que l’équipe devrait autrement assumer. Si le produit repose sur un seul modèle fournisseur stable et n’a besoin d’aucun de ces contrôles, la facturation directe peut reprendre l’avantage à l’expiration de la remise.

Idéal pour : une petite entreprise ou une ETI qui souhaite un routage managé, des contrôles de dépenses et aucune marge publique sur les tokens.
Point fort : avec le tarif Default actuel de GPT-5.6 Sol, le mois normalisé passe de $800 en direct à $400 jusqu’au 18 septembre.
Tarifs : Free inclut $5/mois sur les modèles éligibles ; Paid utilise des crédits achetés aux prix catalogue des fournisseurs, sans marge ; le reporting, les politiques et les traces optionnels sont facturés séparément.
Essai gratuit : une formule Free permanente, pas un essai limité dans le temps.

Les atouts
Ce qu'il fait bien
4 points

  • Aucune marge publique sur les tokens, en Free comme en Paid.
  • La remise Sol actuelle produit une économie mesurable de 50% sur la charge normalisée.
  • Paid prend en charge BYOK sans frais de gateway.
  • Le filtrage des fournisseurs par requête est disponible sans le compteur de la liste blanche globale.
Les limites
Là où il pèche
4 points

  • La remise décisive sur Sol prend fin le 18 septembre 2026.
  • L’achat de crédits supprime le crédit Free récurrent de $5.
  • Le fallback sur les identifiants système peut consommer des crédits Vercel après l’échec d’une requête BYOK.
  • Le reporting, les politiques globales et les traces peuvent générer des lignes d’usage distinctes.

La trajectoire d’adoption la plus sûre garde la comparaison réversible :

  1. Isolez un workflow assorti d’un critère d’acceptation

    Choisissez une tâche dont la réussite se compte clairement, par exemple une extraction structurée valide ou une réponse de support approuvée. Attribuez-lui une clé de gateway distincte afin que ses dépenses et ses échecs ne se fondent pas dans le reste du produit.

  2. Figez la référence en accès direct

    Consignez une semaine représentative de tokens en entrée et en sortie, de nouvelles tentatives, de latence et de résultats acceptés sur la route directe du fournisseur. L’économie unitaire actuelle ne compte que si le taux d’acceptation ne baisse pas.

  3. Routez un volume plafonné à 10%

    Envoyez 10% de ce workflow vers Vercel en conservant le même modèle et le même niveau de service. Fixez sur la clé un budget correspondant à l’échantillon pour qu’une erreur de configuration ne transforme pas la comparaison en dépense sans limite.

  4. Rapprochez les quatre lignes de coût

    Additionnez l’usage du modèle, les éventuels contrôles de reporting ou de politique payants, les traces et le coût de revue ou de nouvelle tentative. Vérifiez aussi si l’échec d’une requête BYOK a consommé des crédits système.

  5. Prenez la décision de septembre

    Ne gardez cette route que si son coût par résultat accepté bat l’accès direct et si les contrôles managés justifient leur prix après la promotion. Inscrivez le 18 septembre au calendrier budgétaire et refaites les calculs avant l’échéance.

2. LiteLLM : le meilleur gateway auto-hébergé quand l’équipe plateforme existe déjà

LiteLLM est le meilleur gateway auto-hébergé pour une entreprise qui exploite déjà une infrastructure partagée et veut maintenir la ligne de licence du gateway à $0.

Page tarifaire de LiteLLM présentant les formules Open Source et Enterprise
Tarifs de LiteLLM vérifiés le 24 août 2026

La formule Open Source, gratuite à vie et auto-hébergée, expose 100+ fournisseurs au travers d’une API compatible OpenAI. Elle comprend les clés virtuelles, la gestion des utilisateurs et équipes, le suivi des dépenses, les budgets, les limites de débit, les fallbacks, les logs et Prometheus. Pour le CTO d’une ETI dont l’équipe plateforme gère déjà conteneurs, métriques, secrets et astreintes, cette solution peut centraliser la logique fournisseur sans nouvelle licence mensuelle de gateway.

Le mot gratuit s’arrête à la frontière de la licence. L’entreprise doit toujours fournir la puissance de calcul, un datastore si nécessaire, les pipelines de déploiement, les mises à jour, la revue de sécurité, l’observabilité et la personne qui intervient quand le gateway tombe. LiteLLM ne gagne sur les coûts que si ces tâches font déjà partie de la charge marginale de l’équipe plateforme ou si l’auto-hébergement est une exigence non négociable.

La formule Enterprise est un contrat annuel sur mesure, dimensionné selon la capacité annuelle de requêtes du gateway, l’architecture de déploiement et les besoins de support, jamais selon le volume de tokens. Elle ajoute SSO et SCIM, des contrôles OIDC ou JWT, des journaux d’audit, l’intégration d’un gestionnaire de secrets et la rotation des clés, l’administration de l’organisation, des options multirégions, un support formel et le déploiement air-gapped. La page publique propose un essai Enterprise de 30 jours sans carte bancaire, mais n’affiche aucun montant.

Ce mode de tarification change le seuil de rentabilité. Une équipe qui dépense beaucoup en tokens mais traite un volume de requêtes modéré peut éviter une taxe proportionnelle sur des modèles chers. À l’inverse, une petite dépense modèle sans fonction plateforme peut coûter davantage en attention humaine que ne facturerait un gateway managé. Le point de bascule n’est donc pas seulement le nombre de requêtes : il faut savoir si le coût mensuel incrémental d’exploitation de LiteLLM reste inférieur aux frais de plateforme hébergée et au travail opérationnel qu’il remplace.

LiteLLM convient aussi à une entreprise réglementée qui doit conserver le plan de données dans son propre environnement. Ce contrôle peut suffire à justifier le choix même si la facture modèle ne diminue pas. La réduction des coûts devient alors une conséquence secondaire du routage fournisseur, des budgets et des contrôles centralisés, et non la preuve que l’auto-hébergement est bon marché par nature.

Idéal pour : les équipes disposant déjà d’une fonction plateforme, soumises à des impératifs d’auto-hébergement ou assez grandes pour refuser des frais de gateway indexés sur un pourcentage.
Point fort : une licence open source à $0 avec budgets, clés virtuelles, fallbacks, logs et 100+ fournisseurs.
Tarifs : Open Source est à $0 pour toujours ; Enterprise repose sur un devis annuel personnalisé selon la capacité de requêtes, l’architecture et le support.
Essai gratuit : 30 jours pour Enterprise sans carte bancaire ; Open Source reste gratuit en auto-hébergement.

Les atouts
Ce qu'il fait bien
4 points

  • Aucun coût de licence open source ni taxe du gateway par token.
  • Budgets, clés, fallbacks et logs centralisés pour 100+ fournisseurs.
  • Enterprise couvre la gouvernance et les déploiements air-gapped.
  • Un usage important de modèles coûteux ne gonfle pas automatiquement la licence Enterprise selon les dépenses en tokens.
Les limites
Là où il pèche
3 points

  • Avec Open Source, l’acheteur assume l’infrastructure, les mises à jour, la fiabilité et la réponse aux incidents.
  • Enterprise n’affiche aucun prix public, ce qui empêche les achats de le modéliser à partir du seul site.
  • Une petite équipe sans capacité plateforme peut transformer une licence gratuite en option d’exploitation la plus chère.

3. Cloudflare AI Gateway : le meilleur choix pour les requêtes identiques au byte près

Cloudflare AI Gateway est le meilleur levier de réduction lorsque beaucoup de requêtes se répètent à l’identique, peuvent être réutilisées sans risque et passent par BYOK.

Documentation tarifaire de Cloudflare AI Gateway présentant les fonctions gratuites, les limites de logs, Unified Billing et Logpush
Tarifs de Cloudflare AI Gateway vérifiés le 24 août 2026

Cloudflare rend son cœur de service particulièrement simple à chiffrer. Les analytics du dashboard, le cache et la limitation de débit sont gratuits sur toutes les formules. Workers Free stocke 100,000 logs pour l’ensemble des gateways et autorise 10 gateways par compte. Workers Paid stocke 10 millions de logs par gateway et en autorise 20, tandis que Logpush est réservé à Paid, avec 10 millions de requêtes mensuelles incluses puis $0.05 par million supplémentaire.

Le cache constitue le véritable mécanisme d’économie, avec une limite très précise. La clé de cache par défaut de Cloudflare inclut le fournisseur, l’endpoint, le modèle, l’en-tête d’authentification du fournisseur et le corps complet de la requête. La moindre différence dans les messages, les outils ou les paramètres du modèle crée une nouvelle entrée. Un hit de cache évite l’appel fournisseur, mais deux prompts de même sens formulés différemment ne correspondent pas, sauf si l’équipe conçoit volontairement une clé de cache personnalisée et peut en garantir la sûreté.

La durée minimale du cache est de 60 secondes, la maximale d’un mois, et une requête mise en cache ne peut pas dépasser 25 MB. Le dispositif convient très bien aux tâches de classification répétitives, aux explications statiques partagées ou aux prompts batch déterministes. Il constitue en revanche un mauvais choix par défaut pour le support personnalisé, les données sources changeantes ou la création stochastique, où une réponse obsolète bon marché peut faire plus de dégâts qu’un nouvel appel au modèle.

Le mode de facturation compte autant que le taux de hit. BYOK maintient le cœur du gateway gratuit et règle directement les fournisseurs. Unified Billing répercute les prix d’inférence fournisseur mais ajoute 5% aux crédits achetés : $100 de crédits coûtent donc $105. Il est aussi limité à 200 requêtes par tranche de 60 secondes et par gateway ; selon Cloudflare, cette limite ne concerne pas BYOK.

Appliquons à la facture normalisée de $800 une hypothèse explicite de 25% de répétitions exactes. Si ces requêtes répétées conservent le même mix de tokens et peuvent être réutilisées sans risque, le cache avec BYOK laisse $600 de dépenses fournisseur et économise $200. Unified Billing ajoute 5% aux $600 restants, soit $630 au total et $170 d’économie nette. Un taux de hit inférieur peut annuler l’avantage ; un taux supérieur et sûr rend Cloudflare difficile à battre.

L’analyse DLP est gratuite sur toutes les formules, avec deux profils prédéfinis pour les comptes sans abonnement Zero Trust. Les guardrails ne sont pas gratuits : leur évaluation utilise un modèle Workers AI facturé aux tarifs par token de Workers AI. Voilà encore pourquoi il faut tracer la bonne frontière comptable : le cache peut être gratuit tandis que la couche de sécurité ajoute sa propre inférence.

Idéal pour : les utilisateurs de Cloudflare qui exécutent des requêtes déterministes et répétitives et acceptent de mesurer la sûreté du cache.
Point fort : un cache gratuit des réponses exactes qui peut supprimer l’appel fournisseur lors d’un hit.
Tarifs : analytics, cache et limitation de débit sont gratuits ; Unified Billing ajoute 5% ; les logs, Logpush et guardrails ont leurs propres limites ou compteurs.
Essai gratuit : des fonctions essentielles et un stockage de logs Workers Free gratuits en permanence, pas un essai limité dans le temps.

Les atouts
Ce qu'il fait bien
4 points

  • Les analytics, le cache et la limitation de débit du gateway coûtent $0.
  • Un hit exact supprime l’appel fournisseur au lieu de réduire seulement quelques tokens de prompt.
  • BYOK évite les 5% d’Unified Billing et sa limite de débit liée aux identifiants managés.
  • Le comportement du cache et ses limites strictes sont clairement documentés.
Les limites
Là où il pèche
4 points

  • Le cache par défaut exige une correspondance exacte : les variations conversationnelles produisent des misses.
  • Unified Billing ajoute 5% et plafonne à 200 requêtes par tranche de 60 secondes et par gateway.
  • Le stockage gratuit des logs est partagé entre les gateways et s’arrête à 100,000 enregistrements.
  • Une clé personnalisée mal sécurisée peut renvoyer un contenu obsolète ou issu d’un autre contexte.

4. TrueFoundry AI Gateway : le meilleur cache sémantique IA managé

TrueFoundry AI Gateway est le meilleur choix managé lorsque des requêtes formulées différemment posent souvent la même question et que la réponse peut être réutilisée sans risque.

Page tarifaire de TrueFoundry présentant les formules Developer, Pro, Pro Plus et Enterprise
Tarifs de TrueFoundry AI Gateway vérifiés le 24 août 2026

La différence vient du cache sémantique. La documentation du cache de TrueFoundry précise que le mode exact hache la requête complète, tandis que le mode sémantique transforme le dernier message en embedding et compare son sens aux requêtes antérieures. Tous les autres paramètres de la requête doivent rester identiques. Un hit sur une réponse complète évite l’appel au LLM et n’entraîne aucun coût LLM : un service support qui reçoit de nombreuses variantes de « Comment réinitialiser mon mot de passe ? » peut donc réutiliser une réponse approuvée au lieu de payer chaque formulation.

Le cache est automatiquement isolé par utilisateur ou compte virtuel, et des namespaces facultatifs peuvent séparer les tenants ou les environnements. Ce point est essentiel : un taux de hit élevé ne vaut rien si la réponse mise en cache d’un client parvient à un autre. Un cache sémantique auto-hébergé exige Redis et un modèle d’embedding ; l’offre SaaS prend cette infrastructure en charge.

La page tarifaire publique compte quatre niveaux. Developer coûte $0 par mois pour 50,000 requêtes et 3 utilisateurs. Pro coûte $499 par mois pour 1 million de requêtes et 10 utilisateurs. Un supplément de 2 millions de requêtes et 5 clés API coûte encore $499 par mois. Pro Plus coûte $2,999 par mois pour 1 million de requêtes et 25 utilisateurs, l’usage supplémentaire étant chiffré par l’équipe commerciale. Enterprise est personnalisé selon la capacité de requêtes et le nombre d’utilisateurs, avec prise en charge des déploiements VPC et air-gapped.

La page annonce un essai gratuit de 7 jours, tandis que la page du gateway offre gratuitement les 50,000 premières requêtes de chaque mois, sans carte, sur 1,600+ modèles. Ce volume suffit à mesurer un taux de hit réaliste avant de passer à Pro. Il ne permet pas de déduire une économie en production à partir d’un jeu de FAQ synthétique.

Le seuil à franchir sur la seule facture modèle est élevé lorsque les dépenses restent modestes. Face aux $800 normalisés de dépenses fournisseur, l’abonnement Pro à $499 doit empêcher au moins $499 de consommation modèle, soit environ 62.4%, pour gagner sur le seul coût d’inférence. La gouvernance, l’isolation, l’observabilité et le temps humain peuvent tout de même justifier Pro avec un taux de hit plus faible, mais ce sont des bénéfices distincts qu’il faut nommer comme tels.

Le vrai risque est la fausse réutilisation. Un seuil sémantique trop permissif peut renvoyer une ancienne réponse qui semble pertinente mais ne respecte ni le contexte ni les règles du nouvel utilisateur. Un test sûr évalue les réponses en cache et les réponses fraîches sur le même jeu d’acceptation, segmente par tenant et refuse le cache pour les questions liées à un compte en temps réel, au droit, à la médecine ou à un stock changeant.

Idéal pour : les workflows de support, de connaissance et de FAQ où une même intention revient sous des formulations différentes.
Point fort : un cache sémantique managé de réponses complètes, isolé automatiquement par compte et complété par des namespaces facultatifs.
Tarifs : Developer $0 ; Pro $499/mois ; Pro Plus $2,999/mois ; Enterprise sur mesure, avec les limites de requêtes et d’utilisateurs publiées ci-dessus.
Essai gratuit : un essai de 7 jours et une formule Developer permanente avec 50,000 requêtes/mois.

Les atouts
Ce qu'il fait bien
4 points

  • Le cache sémantique peut éliminer des appels complets que les caches exacts ne détectent pas.
  • Les entrées du cache sont isolées par utilisateur ou compte virtuel par défaut.
  • Developer fournit assez de requêtes mensuelles pour une évaluation bornée du taux de hit.
  • Enterprise propose des déploiements VPC et air-gapped.
Les limites
Là où il pèche
4 points

  • Le plancher mensuel de $499 de Pro exige des économies substantielles ou une vraie valeur de gouvernance.
  • Pro Plus coûte $2,999 tout en affichant toujours 1 million de requêtes mensuelles.
  • Les faux positifs sémantiques peuvent transformer un gain financier en problème de qualité ou de séparation des données.
  • Le cache sémantique auto-hébergé ajoute l’exploitation de Redis et d’un modèle d’embedding.

5. Portkey : la meilleure montée en gamme managée pour la gouvernance à $49

Portkey est la meilleure option managée à faible coût d’entrée pour une équipe qui a dépassé le stade du prototype sans pouvoir justifier un gateway de production à $499.

Page tarifaire de Portkey présentant les formules Open Source, Developer, Production et Enterprise
Tarifs de Portkey vérifiés le 24 août 2026

La gamme commence par Open Source, auto-hébergée sans limite de requêtes, qui inclut une API universelle, les nouvelles tentatives et timeouts, le routage, les guardrails, les fallbacks automatiques, un dashboard basique, l’équilibrage de charge et le support communautaire. La page ne précise aucun prix de licence pour cette option ; il faut donc l’évaluer comme LiteLLM : le contrôle est élevé, mais l’infrastructure et le coût de l’opérateur restent à la charge de l’acheteur.

La formule hébergée Developer est Free Forever, autorise 10,000 requêtes par mois sans dépassement possible et vise explicitement les prototypes et proofs of concept d’entreprise, pas la production. Production coûte $49 par mois, inclut 100,000 requêtes, puis ajoute $9 par mois pour chaque tranche supplémentaire de 100,000 requêtes jusqu’à 3 millions. Elle comprend le cache simple et sémantique, le contrôle des accès par rôle, les clés de comptes de service et le support de production.

Pour un million de requêtes mensuelles, Production coûte $130 avant l’usage du modèle : $49 pour les 100,000 requêtes incluses, plus neuf tranches de dépassement à $9 pour les 900,000 restantes. C’est le bon point de comparaison. Portkey doit récupérer plus de $130 grâce au cache, au routage, à l’application des budgets ou au travail opérationnel évité pour battre un gateway sans frais sur la charge normalisée.

Enterprise applique un prix et une capacité de requêtes sur mesure. Cette formule ajoute SSO, des budgets et limites de débit granulaires, des options de cloud privé ou VPC et des contrôles de conformité étendus. Une organisation réglementée peut la choisir pour sa gouvernance même si sa facture fournisseur ne bouge pas.

Une subtilité de nom mérite une note dans le dossier d’achat. La page tarifaire active appelle l’offre à $49 Production, alors que la documentation actuelle nomme cette même offre à $49 Pro. La page tarifaire indique également que Portkey s’appelle désormais Prisma AIRS AI Gateway. Ces appellations doivent être harmonisées dans le bon de commande avant d’automatiser les contrôles de formule ou d’écrire une politique de renouvellement autour de ces noms.

Portkey se classe derrière TrueFoundry sur la profondeur du cache sémantique, car ses ressources publiques rendent le mécanisme d’économie moins facile à auditer. Il passe devant OpenRouter pour une équipe qui préfère une base tarifaire hébergée prévisible à un pourcentage prélevé sur chaque achat de crédits mutualisés. Le point d’entrée à $49 rend un essai contrôlé en production financièrement lisible.

Idéal pour : un produit IA en croissance qui a besoin de cache hébergé, de rôles, de clés, de routage et de support avec un budget mensuel à trois chiffres pour le plan de contrôle.
Point fort : Production commence à $49 et atteint un million de requêtes mensuelles pour $130 avant l’usage du modèle.
Tarifs : Open Source en auto-hébergement ; Developer Free Forever ; Production à $49/mois plus $9 par tranche supplémentaire de 100,000 requêtes ; Enterprise sur mesure.
Essai gratuit : la formule Developer permanente fournit 10,000 requêtes/mois, mais ne convient pas à la production.

Les atouts
Ce qu'il fait bien
4 points

  • Le premier niveau de production hébergé commence à $49 par mois.
  • Le cache simple et le cache sémantique sont inclus dans Production.
  • Un dépassement prévisible par blocs de requêtes se budgète plus facilement qu’un pourcentage sur les tokens.
  • Open Source et Enterprise répondent à des besoins de contrôle opposés.
Les limites
Là où il pèche
4 points

  • À un million de requêtes, le prix d’appel de $49 monte à $130 avant l’inférence.
  • Developer s’arrête à 10,000 requêtes sans dépassement possible et n’est pas une option de production.
  • L’alternance des noms Production et Pro crée une ambiguïté d’achat évitable.
  • L’économie d’Enterprise reste cachée derrière un devis commercial.

6. OpenRouter : la meilleure marketplace pour router les fournisseurs par prix

OpenRouter est le meilleur gateway lorsque l’enjeu consiste à choisir entre de nombreux fournisseurs et modèles selon leur prix, et non à minimiser les frais du gateway sur une route inchangée.

Page tarifaire d’OpenRouter présentant les formules Free, Pay-as-you-go et Enterprise
Tarifs d’OpenRouter vérifiés le 24 août 2026

La formule Free donne accès à 25+ modèles gratuits via 4 fournisseurs gratuits, avec 50 requêtes par jour et un support communautaire. Pay-as-you-go ouvre 500+ modèles et 80+ fournisseurs sans dépense minimale, mais les crédits mutualisés ajoutent 5.5% de frais de plateforme. Les frais d’achat de crédits ont un minimum de $0.80, et l’approvisionnement en cryptomonnaie coûte 5%.

Enterprise conserve le catalogue de 500+ modèles et 80+ fournisseurs, puis ajoute la facturation sur facture, des contrôles managés, des limites dédiées en option, un SLA contractuel et un canal de support Slack partagé. Les tarifs reposent sur des engagements de volume personnalisés et peuvent inclure des remises sur les frais. Il s’agit d’un niveau destiné aux achats, pas d’un abonnement public par siège.

BYOK change l’arbitrage. Pay-as-you-go inclut chaque mois $25,000 d’inférence BYOK au prix catalogue sans frais OpenRouter, puis facture 5% au-delà. Enterprise relève le plafond sans frais à $200,000 par mois avant d’appliquer 5%. Une entreprise déjà titulaire de comptes directs chez les fournisseurs peut donc utiliser le plan de contrôle d’OpenRouter sans payer le pourcentage sur les crédits mutualisés tant qu’elle reste sous cette franchise.

La fonction d’économie réside dans la sélection des fournisseurs. OpenRouter peut trier les fournisseurs éligibles par prix, imposer un prix maximum et basculer vers une autre route en cas d’échec. Son cache de réponses en bêta restitue les requêtes strictement identiques sans usage facturable et fonctionne entre les modèles, mais ce n’est pas un cache sémantique. Le tri par prix n’économise de l’argent que si les fournisseurs restent interchangeables au regard de la qualité, de la politique de données, de la latence et de la disponibilité exigées par le workflow.

Sur une facture fournisseur inchangée de $800, les crédits mutualisés ajoutent $44 pour un total de $844. OpenRouter doit donc récupérer plus de $44 grâce à un fournisseur éligible moins cher, aux hits de cache, à la baisse du coût des défaillances ou à une exploitation simplifiée pour battre la facturation directe. Si un seul fournisseur sert déjà le workflow de façon fiable au tarif négocié, la marketplace devient un intermédiaire facultatif et coûteux.

Le détail des frais minimaux, des règles BYOK, des risques de financement et du routage figure dans l’analyse des tarifs OpenRouter. Ici, le verdict pratique est plus étroit : OpenRouter devient un outil d’économie lorsque l’équipe exploite réellement son marché, pas lorsqu’elle place la même requête derrière une URL supplémentaire.

Idéal pour : les équipes qui passent réellement d’un fournisseur ou d’une famille de modèles à l’autre et savent mesurer l’économie associée.
Point fort : le routage par prix sur 500+ modèles et 80+ fournisseurs, avec de larges franchises BYOK sans frais.
Tarifs : Free $0 ; Pay-as-you-go au prix des modèles plus 5.5% sur les crédits mutualisés ; Enterprise sur mesure avec remises possibles sur les frais.
Essai gratuit : une formule Free permanente avec 25+ modèles gratuits et 50 requêtes/jour.

Les atouts
Ce qu'il fait bien
4 points

  • La marketplace de fournisseurs la plus large de ce comparatif.
  • Le routage sait trier par prix, plafonner le prix et basculer en cas d’échec.
  • BYOK ne supporte aucun frais de gateway jusqu’à $25,000/mois sur Pay-as-you-go ou $200,000/mois sur Enterprise.
  • Les hits exacts du cache de réponses n’affichent aucun usage facturable.
Les limites
Là où il pèche
4 points

  • Les crédits mutualisés ajoutent 5.5% même lorsque la route sous-jacente ne change pas.
  • Le minimum de $0.80 renchérit les petits achats de crédits au-delà du pourcentage affiché.
  • Le cache exact ne couvre pas les requêtes formulées différemment.
  • Changer de fournisseur peut modifier la latence, la politique ou la qualité des réponses, même si le nom du modèle reste identique.

Quel gateway IA choisir selon votre situation ?

Vercel est le choix par défaut pour une équipe qui veut un routage managé sans marge publique sur les tokens. Il faut s’en détourner lorsque la remise actuelle sur le modèle expire et que les autres contrôles n’économisent plus davantage que l’accès direct, ou lorsque les politiques à l’échelle de l’équipe et la configuration des traces rendent les suppléments significatifs.

LiteLLM s’impose lorsque l’auto-hébergement est obligatoire ou qu’une équipe plateforme existante peut absorber le gateway à faible coût marginal. Le choix bascule vers une offre managée si LiteLLM crée un nouveau responsable opérationnel, une nouvelle astreinte ou un devis Enterprise supérieur à la facture complète de l’alternative hébergée.

Cloudflare gagne lorsque les corps de requêtes se répètent à l’identique, que la réponse en cache peut être réutilisée en toute sécurité et que BYOK convient. Le choix bascule vers TrueFoundry lorsque des formulations variées expriment la même intention et qu’un cache sémantique mesuré franchit le seuil de qualité. Il revient à l’absence de cache lorsque la fraîcheur, la personnalisation ou le contexte du tenant rendent la réutilisation dangereuse.

TrueFoundry ne gagne sur la réutilisation sémantique managée qu’après une évaluation réelle prouvant assez de hits acceptés pour couvrir son niveau tarifaire. Portkey s’impose lorsqu’une équipe cherche un plan de contrôle de production hébergé moins cher et peut respecter son économie par requête. OpenRouter l’emporte quand le tri des fournisseurs par prix ou la consolidation BYOK économise davantage que ses frais.

Un arbre de décision dans une serre oriente les workflows vers Vercel, LiteLLM, Cloudflare, TrueFoundry, Portkey ou OpenRouter selon leurs besoins d’exploitation et de cache
Choisissez le gateway selon le mécanisme d’économie que votre workflow peut réellement exploiter

Le meilleur choix par défaut peut encore être aucun gateway. Une charge stable et volumineuse sur un seul fournisseur, avec de bons budgets natifs, un faible coût d’échec et peu de contenu répété, ne présente aucune économie évidente liée à une passerelle. N’ajoutez un plan de contrôle que lorsqu’un bénéfice précis de routage, de cache, de gouvernance ou d’exploitation dépasse son coût complet.

Méthode de sélection

Le classement pondère les critères économiques qu’un acheteur peut vérifier : 35% pour le coût public du gateway et la transparence des frais, 30% pour un mécanisme crédible de réduction des dépenses modèle, 20% pour la limite rencontrée en production et 15% pour la charge d’exploitation et la friction de migration.

Les pages tarifaires, comparatifs de formules, documentations fonctionnelles, comportements du cache, limites de requêtes et la modification tarifaire de GPT-5.6 Sol ont été vérifiés en ligne le 24 août 2026. Le pipeline de publication capture une véritable image de la page tarifaire de chaque gateway classé. Les outils n’ont pas été testés avec du trafic de production lors de cette analyse : aucun résultat de latence, de disponibilité, de taux de hit ou de qualité des réponses n’est donc présenté comme un test.

Six gateways ont été retenus, chacun pour une fonction économique distincte et vérifiable. Vercel supprime la marge de la plateforme managée et remise actuellement un modèle majeur. LiteLLM élimine la ligne de licence grâce à l’auto-hébergement. Cloudflare supprime les appels répétés à l’identique. TrueFoundry vise les répétitions sémantiques. Portkey propose une montée en gamme managée au prix lisible. OpenRouter met les fournisseurs en concurrence sur les prix.

Une fonction n’a pas été comptée comme une économie au seul motif que son éditeur la présente comme une optimisation. Les calculs reposent sur une charge annoncée, un prix nommé et une hypothèse explicite de cache. Toute entreprise qui applique ce classement doit remplacer ces données par son propre mix de modèles, son taux de résultats acceptés et son coût d’opérateur avant de signer un contrat annuel.

Les options à éviter

Kong AI Gateway pour un nouveau déploiement centré uniquement sur les coûts

Kong AI Gateway n’est pas le premier choix lorsque la réduction du coût d’inférence constitue le seul objectif. Les tarifs actuels de Kong accordent 30 jours d’essai à Konnect, puis réservent les plugins AI Gateway payants à un supplément de Plus et facturent $100 par mois pour chaque modèle unique relayé par les plugins IA, avec une limite de cinq modèles. Cinq modèles créent donc une ligne proxy mensuelle de $500 avant l’usage d’inférence et les autres coûts de plateforme.

Cela ne fait pas de Kong une mauvaise plateforme. Une entreprise qui standardise déjà ses API, sa sécurité et la gouvernance de ses services sur Kong peut juger les contrôles IA supplémentaires moins chers que l’ajout d’un autre fournisseur. Le conseil est plus précis : n’introduisez pas une vaste plateforme API dans une nouvelle stack IA uniquement pour chasser des économies sur les tokens alors qu’il existe des gateways sans marge ou au cœur gratuit.

Un proxy maison sans responsable identifié

Un proxy interne minimal semble gratuit jusqu’à ce qu’il doive gérer les nouvelles tentatives, les évolutions des fournisseurs, les budgets, les logs, les secrets et les incidents. Ne le construisez que si le workflow est assez stable pour conserver une surface réduite et qu’une équipe clairement désignée exploite déjà le service. Dans le cas contraire, le proxy dissimule son coût dans le temps d’ingénierie tout en offrant moins de contrôles que les options managées.

Tout gateway pour une charge mono-fournisseur sans réponses réutilisables

La diversité du routage ne vaut rien si le trafic ne bouge jamais. Les caches exacts et sémantiques ne servent à rien lorsque chaque requête exige une nouvelle réponse. Si les budgets et logs natifs du fournisseur suffisent, l’API directe présente le moins de couches de facturation et la surface de défaillance la plus petite.

Un plan pérenne fondé sur la remise de septembre

La promotion Sol actuelle de Vercel est la meilleure offre immédiate de ce classement et la plus facile à mal employer. Traitez le 18 septembre comme une réévaluation obligatoire des prix. L’architecture doit rester viable aux tarifs catalogue du fournisseur, même si la promotion motive le test de migration aujourd’hui.

L’action du lundi : mesurer un workflow au coût par résultat accepté

Choisissez un workflow de production qui a généré une facture modèle significative la semaine dernière et dont la réussite peut être jugée selon un critère binaire. Exportez ses tokens en entrée, ses tokens en sortie, ses dépenses fournisseur, ses nouvelles tentatives et ses résultats acceptés. Excluez les données personnelles, confidentielles et client de tout jeu d’évaluation qui n’est pas approuvé pour la route choisie.

Faites passer 10% du trafic de la semaine suivante par le gateway dont le mécanisme correspond à la charge. Utilisez Vercel pour la fenêtre tarifaire managée de Sol, Cloudflare pour les répétitions exactes avérées, TrueFoundry pour les questions différentes mais équivalentes, LiteLLM pour une plateforme auto-hébergée existante, Portkey pour un plan de contrôle managé à faible coût d’entrée ou OpenRouter pour une véritable mise en concurrence des fournisseurs.

Fixez un budget strict sur la clé isolée et définissez une condition d’arrêt avant la première requête. Arrêtez si le taux de résultats acceptés baisse, si la sûreté du cache échoue, si une route fournisseur enfreint une règle ou si la facture totale du gateway dépasse les économies. À la fin de la semaine, divisez les dépenses modèle, les frais de plateforme, les contrôles payants, les nouvelles tentatives et le coût de revue par le nombre de résultats acceptés.

Le livrable du lundi tient en une décision partagée par la finance et l’ingénierie : garder, changer ou retirer le gateway. Si Vercel gagne, inscrivez une réévaluation tarifaire au 18 septembre dans le calendrier. Si un cache gagne, ne le déployez que pour les catégories de requêtes qui ont réussi le test. Si aucun ne gagne, conservez l’accès direct et évitez de payer pour une complexité facultative.

Questions fréquentes

Combien coûte Cloudflare AI Gateway ?

Les analytics, le cache et la limitation de débit du cœur de Cloudflare AI Gateway sont gratuits sur toutes les formules. Workers Free stocke 100,000 logs pour l’ensemble des gateways ; Workers Paid en stocke 10 millions par gateway. Unified Billing ajoute 5% aux crédits achetés, tandis que les tarifs fournisseur sont répercutés sans marge. Logpush et l’inférence des guardrails peuvent générer des frais séparés.

Quel est le meilleur gateway IA ?

Vercel AI Gateway est le meilleur choix managé global au 24 août 2026, car il associe l’absence de marge publique sur les tokens à une remise actuelle de 50% sur GPT-5.6 Sol jusqu’au 18 septembre. LiteLLM convient mieux aux équipes qui exploitent déjà une infrastructure auto-hébergée, Cloudflare au cache des répétitions exactes, TrueFoundry au cache sémantique managé, Portkey à un accès production à $49 et OpenRouter au tri des fournisseurs par prix.

Cloudflare AI Gateway propose-t-il une formule gratuite ?

Oui. Les analytics, le cache et la limitation de débit du cœur sont gratuits, et le quota de logs Workers Free stocke 100,000 enregistrements au total pour l’ensemble des gateways. Un compte gratuit est limité à 10 gateways. L’inférence fournisseur reste payante, et Unified Billing, les guardrails ou les fonctions de logs payantes optionnelles peuvent ajouter des frais.

Recevez la carte des outils IA pour dirigeants

Transformez ce choix de gateway en stack d’adoption complète, avec un seuil de coût et un plancher de qualité pour chaque outil. Inscrivez-vous pour recevoir gratuitement la carte des outils IA.

Dernière mise à jour

2 sept. 2026

CatégorieAI

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.