LLM gateway : les 6 meilleures solutions pour les agents de code

Comparez Vercel, Requesty, LiteLLM, OpenRouter, Portkey et Cloudflare pour choisir le LLM gateway adapté à vos agents de code, votre budget et vos règles.

Thursday, September 3, 2026Omid Saffari
LLM gateway : les 6 meilleures solutions pour les agents de code

Côté LLM gateway, Vercel AI Gateway s’impose pour la plupart des équipes qui utilisent des agents de code : une seule commande configure désormais neuf agents, sans aucune marge sur la couche de jetons de base. Pour une facture mensuelle de modèles de $2,000, les frais de gateway sont de $0 chez Vercel, de $100 chez Requesty et de $110 chez OpenRouter, avant les contrôles optionnels. Ce choix relève donc désormais du budget d’ingénierie, plus d’une simple enveloppe d’expérimentation.

LLM gateway : quelle solution choisir ?

Choisissez Vercel AI Gateway, sauf si vos contraintes de déploiement, d’attribution des coûts ou de gouvernance imposent une autre solution. C’est aujourd’hui le moyen le plus direct de réunir des configurations Claude Code, Codex, Cursor et OpenCode distinctes derrière une seule facture de modèles, un même jeu de fallbacks et une vue unifiée des dépenses.

OutilIdéal pourPrix de départEssai gratuit
Vercel AI GatewayConfiguration rapide de plusieurs agents$0 de marge sur les jetons ; $5 de crédit mensuelOffre gratuite
RequestyCoûts par branche, dépôt et développeur$0 en gratuit ; 5% de marge en Pay as you goOffre gratuite, sans carte
LiteLLMContrôle en auto-hébergement$0 en open sourceEssai Enterprise de 30 jours
OpenRouterExpérimentation sur un vaste choix de modèles$0 en gratuit ; frais Pay as you go de 5.5%Offre gratuite
PortkeyRoutage et gouvernance managés$0 en Developer ; $49/month en ProductionOffre Developer gratuite
Cloudflare AI GatewayStacks déjà fondées sur WorkersFonctionnalités de base à $0 ; 5% de frais Unified BillingFonctionnalités de base gratuites

Cinq situations précises font pencher la balance ailleurs que chez Vercel. Prenez Requesty si la question financière consiste à savoir quel dépôt, quelle branche ou quel développeur a généré la dépense. Préférez LiteLLM si le trafic des modèles et les clés des fournisseurs doivent rester dans votre propre infrastructure. Retenez OpenRouter si l’accès au catalogue de modèles et de fournisseurs le plus large compte davantage qu’une configuration propre à chaque agent. Choisissez Portkey si le budget porte explicitement sur les garde-fous, les disjoncteurs et les politiques managés. Enfin, optez pour Cloudflare AI Gateway si Workers, les logs Cloudflare et la sécurité Cloudflare constituent déjà votre plan de contrôle.

Une gateway IA est la couche de contrôle placée entre un agent de code et les fournisseurs de modèles. L’agent continue de planifier, de modifier des fichiers, d’exécuter des commandes et d’appeler des outils. La gateway détermine vers où partent les requêtes, combien elles peuvent coûter, quel fournisseur les reçoit, ce qui se passe après un timeout et ce qui est journalisé.

Cette distinction est essentielle. Une gateway n’améliore pas un modèle de code médiocre, ne corrige pas un mauvais fichier d’instructions de dépôt et ne révise pas du code dangereux. En revanche, elle peut empêcher qu’une panne fournisseur interrompe une longue exécution, plafonner une clé qui s’emballe et montrer qu’une branche de migration a consommé quatre fois le budget modèle d’une correction ordinaire. Achetez du contrôle, pas de l’intelligence.

LLM gateway et agents de code : pourquoi le coût change d’échelle

Avec les agents de code, une petite décision de routage devient une décision de coût d’exploitation, car une seule tâche peut déclencher toute une chaîne d’appels aux modèles. Une réponse de chat peut tenir en un échange. Un agent de code peut inspecter un dépôt, rechercher des symboles, proposer un patch, lancer les tests, lire les échecs, revoir son patch, puis demander à un modèle plus puissant de contrôler le résultat.

L’indice de production de Vercel a constaté que 22.2% des requêtes concentraient 58.9% des jetons : les requêtes utilisant des outils consommaient ainsi environ 2.6 fois plus de jetons que le reste du trafic. Le même jeu de données indique que les fallbacks ont sauvé 3.5% des requêtes. Si une charge de 10,000 requêtes suivait cette moyenne, environ 350 requêtes aboutiraient grâce à un fallback au lieu d’échouer chez le premier fournisseur. Il s’agit d’une illustration, pas d’un taux de sauvetage garanti pour une autre charge, mais elle montre pourquoi la fiabilité doit être évaluée au même titre que le prix des modèles.

Les frais de base sont plus simples à comparer si la facture des modèles en amont reste fixe. Pour $2,000 par mois d’inférence facturée au tarif fournisseur :

  • Vercel ajoute $0 de marge sur les jetons.
  • La marge de 5% de Requesty ajoute $100.
  • Les frais Pay as you go de 5.5% d’OpenRouter ajoutent $110.
  • Cloudflare Unified Billing ajoute $100 lorsque les crédits sont achetés par son intermédiaire.
  • Portkey démarre à $49 par mois pour 100,000 logs enregistrés, un compteur différent de la dépense en jetons.
  • La licence open source de LiteLLM ajoute $0, mais l’hébergement et le temps d’exploitation restent à votre charge.
Comparaison concrète du coût de six gateways IA pour deux mille dollars de dépenses mensuelles en modèles
Coût de la couche gateway pour $2,000 de dépenses mensuelles en modèles, d’après les tarifs en vigueur vérifiés le 15 août 2026

Le pourcentage ne décide pas tout. Les $100 supplémentaires de Requesty peuvent être bon marché si l’attribution par branche empêche un dépôt sans contrôle de consommer bien davantage. Les $49 de Portkey peuvent l’être aussi si un disjoncteur préserve un workflow de livraison. Quant à la licence gratuite de LiteLLM, elle peut coûter cher si un ingénieur plateforme devient l’astreinte permanente du proxy.

La gateway doit réduire le coût d’un changement de modèle, de fournisseur ou d’agent. Si elle se contente de remplacer six factures fournisseurs par une septième, elle ne mérite pas sa place.

Comment ces gateways IA ont été sélectionnées

Les six solutions ont été évaluées selon le travail réel produit par les agents de code, et non à partir d’une checklist générique de fonctionnalités API. Les prix et les pages produit ont été vérifiés le 15 août 2026. Les outils n’ont pas été testés en production lors de cette analyse : le classement repose donc sur la documentation disponible, une comparaison normalisée des coûts et les conséquences de chaque périmètre produit.

Six critères déterminent l’ordre :

  1. Configuration des agents de code : une gateway qui documente Claude Code, Codex, Cursor et les agents apparentés présente moins de risques d’intégration qu’une solution qui promet seulement un endpoint compatible OpenAI.
  2. Fiabilité du routage : ordre des fournisseurs, timeouts, nouvelles tentatives, fallbacks de modèles et disjoncteurs sont déterminants, car un agent peut perdre une longue chaîne lors du tout dernier appel au modèle.
  3. Visibilité des coûts : la dépense modèle doit pouvoir être rattachée à une clé, un agent, un dépôt, un développeur, une équipe ou une politique, au lieu d’apparaître comme un total de jetons indifférencié.
  4. Contrôle des politiques : listes de fournisseurs et de modèles approuvés, budgets, règles de conservation des données et journaux d’audit déterminent si une équipe peut dépasser le stade de l’expérimentation individuelle.
  5. Charge de déploiement : les gateways managées sont payantes parce qu’elles retirent du travail d’exploitation. Les solutions auto-hébergées suppriment les frais de plateforme, mais rendent à l’acheteur la disponibilité, les mises à niveau, le stockage et la gestion des incidents.
  6. Prix actuel : chaque offre et chaque limite proviennent de la page fournisseur en vigueur. Les prix d’inférence sont exclus du classement, car ils varient selon le modèle et le fournisseur, et parce que cette comparaison maintient la facture amont constante.

Helicone a été étudié, mais pas classé. C’est un solide produit d’observabilité doté de fonctions de gateway, dont l’avantage le plus net reste toutefois le traçage et l’analyse, plutôt qu’une configuration étendue des agents de code. Les gateways API génériques ont également été écartées. Elles savent relayer du trafic HTTP, mais les agents de code ont besoin de fallbacks conscients des modèles, de budgets de jetons, de contrôles sur les prompts et les réponses, ainsi que d’une compatibilité avec plusieurs protocoles.

Il en ressort une liste plus courte, assortie d’une règle de décision plus stricte. Chaque produit ci-dessous gagne sur un besoin précis et atteint une limite à partir de laquelle une autre solution devient le meilleur achat.

1. Vercel AI Gateway : le meilleur choix global pour les agents de code

Vercel AI Gateway est le meilleur choix par défaut, car il élimine le travail de configuration qui empêchait jusqu’ici les gateways d’entrer dans les workflows individuels des agents de code. Son CLI actuel peut créer une clé, prévisualiser les changements de configuration et paramétrer neuf agents pris en charge avec vercel ai-gateway coding-agents setup.

Documentation Vercel AI Gateway consacrée aux agents de code
Vercel AI Gateway

La matrice de compatibilité actuelle cite Claude Code, Cline, OpenAI Codex, Cursor, Hermes, Kilo Code, OpenClaw, OpenCode et Pi. Vercel documente aussi des procédures manuelles pour d’autres outils. Claude Code, Codex et Cursor disposent d’endpoints de compatibilité dédiés, car leur protocole exige davantage que l’interface OpenAI générique. Voilà la fonction qui change réellement la décision d’achat : la gateway n’est plus seulement une infrastructure placée derrière une application développée en interne. Elle peut aussi servir les outils de code que vos ingénieurs utilisent déjà.

Pour une équipe produit de 12 personnes, le résultat est concret : un budget et une politique de fallback uniques malgré des habitudes de travail différentes. Un ingénieur peut rester sur Claude Code, un autre lancer Codex dans le terminal et un troisième utiliser Cursor. Leurs requêtes apparaissent toujours dans une vue commune des dépenses, sans obliger l’entreprise à imposer un éditeur ou un laboratoire de modèles.

Idéal pour : les équipes qui utilisent plusieurs agents de code et recherchent la configuration managée la plus rapide
Point fort : un workflow CLI unique pour neuf agents pris en charge, avec des endpoints dédiés à Claude Code, Codex et Cursor
Tarif : $5 de crédit gratuit mensuel ; inférence payante au tarif catalogue des fournisseurs, sans marge sur les jetons
Essai gratuit : offre gratuite permanente sur les modèles éligibles, et non essai limité dans le temps

La tarification de base est particulièrement lisible. La page tarifaire actuelle de Vercel indique qu’aucune marge ni commission de plateforme ne s’applique aux jetons. L’offre gratuite comprend $5 de crédit mensuel, un sous-ensemble de modèles éligibles et des limites inférieures par modèle. L’achat de crédits fait passer le compte en Pay as you go et met fin au crédit mensuel gratuit. Le Bring Your Own Key n’est disponible qu’après passage à l’offre payante, sans frais BYOK supplémentaires chez Vercel.

Deux réserves s’imposent. Premièrement, l’absence de marge concerne la couche de jetons, pas tous les contrôles. La liste de fournisseurs autorisés et la conservation zéro des données à l’échelle de l’équipe coûtent chacune $0.10 pour 1,000 requêtes. L’export de traces coûte $0.05 pour 1,000 traces, plus $0.50 par GB de trafic sortant. Le reporting personnalisé possède ses propres compteurs d’écriture et de requêtes. Une petite équipe peut ignorer la plupart de ces options ; une équipe réglementée doit les chiffrer avant de qualifier la gateway de gratuite.

Deuxièmement, une requête BYOK en échec peut être retentée avec les identifiants système de Vercel, puis facturée sur le solde de crédits de la gateway. C’est un bon réglage de fiabilité par défaut, mais aussi un cas limite côté budget. Si la finance exige que chaque requête reste couverte par un contrat fournisseur existant, il faut examiner ce chemin de fallback au lieu de le supposer.

Les contrôles de routage suffisent à la plupart des équipes produit. Vercel documente le filtrage, l’ordre et le tri des fournisseurs, la mise en cache automatique, les timeouts fournisseurs et les fallbacks de modèles. Vous pouvez envoyer le trafic normal de complétion de code vers le fournisseur préféré, déclencher un basculement rapide si la latence dépasse le seuil toléré et conserver un modèle plus coûteux comme dernier recours.

La principale limite tient à la maîtrise du déploiement. Vercel AI Gateway est une solution managée. Elle ne convient pas aux équipes qui exigent que le processus de gateway, la base de données, les clés et les logs s’exécutent dans leur propre réseau. Dans ce cas, LiteLLM s’impose avant même toute comparaison fonctionnelle.

Les atouts
Ce qu'il fait bien
5 points

  • Une commande de configuration documentée pour neuf agents de code
  • Des endpoints de compatibilité dédiés pour Claude Code, Codex et Cursor
  • Aucune marge ni commission de plateforme sur les jetons
  • Ordre des fournisseurs, timeouts, cache et fallbacks de modèles
  • Une facture et une vue des dépenses pour 200+ modèles
Les limites
Là où il pèche
4 points

  • Pas de déploiement auto-hébergé de la gateway
  • BYOK nécessite l’offre payante
  • Reporting avancé, traces, listes d’autorisation et ZDR à l’échelle de l’équipe utilisent des compteurs distincts
  • Cursor demande encore quelques clics dans les paramètres du compte après la création de la clé par le CLI

Configurer Vercel AI Gateway sans transformer la migration en projet

La méthode la plus sûre conserve un retour direct vers le fournisseur et commence par un seul dépôt. Ne modifiez pas tous les développeurs et tous les agents en une fois.

  1. Créer une clé pilote à périmètre limité

    Créez une clé de gateway pour le dépôt pilote et associez-lui un budget hebdomadaire ou mensuel. Ne réutilisez pas une clé d’application commune à toute l’entreprise : les boucles des agents de code ont besoin de leur propre seuil d’arrêt.

  2. Exécuter la commande de configuration documentée

    Exécutez vercel ai-gateway coding-agents setup. Laissez le CLI détecter les agents installés, ne sélectionnez que les outils du pilote et relisez le diff affiché avant d’accepter toute écriture de configuration.

  3. Conserver un modèle principal et un fallback

    Commencez avec le modèle auquel l’équipe fait déjà confiance. Ajoutez un seul fallback de fournisseur ou de modèle offrant un comportement comparable avec les outils. Un vaste arbre de routage rend les échecs plus difficiles à expliquer.

  4. Vérifier l’identité et les libellés de dépense

    Lancez une tâche circonscrite depuis chaque agent configuré. Vérifiez que le tableau de bord identifie l’agent, le modèle, le fournisseur, les jetons, le coût, la latence et le statut du fallback comme l’acheteur s’y attend.

  5. Préserver la route directe

    Conservez l’ancienne configuration fournisseur dans un fichier de rollback documenté. Si la gateway modifie l’appel d’outils, la découverte des modèles ou la latence, le pilote doit pouvoir revenir en arrière en quelques minutes.

2. Requesty : le meilleur pour attribuer les coûts par branche, dépôt et développeur

Requesty est la meilleure gateway quand le responsable de l’ingénierie doit relier la dépense modèle au travail qui l’a provoquée. Son intégration Claude Code peut étiqueter les requêtes par branche, dépôt, développeur et version de l’agent, transformant ainsi une facture de jetons en information exploitable par l’équipe.

Page tarifaire de la gateway IA Requesty
Requesty

Cette attribution est plus utile qu’un faible tarif pour les équipes qui mènent en parallèle des migrations, des branches de fonctionnalités et des revues automatisées. Une équipe SaaS B2B pourrait découvrir que les revues en arrière-plan coûtent peu, tandis que la boucle test-correction d’un seul dépôt absorbe l’essentiel du budget mensuel. La réponse devient alors ciblée : ajuster la politique de ce dépôt ou de ce modèle, plutôt que réduire l’accès de tous les développeurs.

Idéal pour : les équipes qui veulent ventiler le coût des agents de code par branche, dépôt ou développeur
Point fort : les tags analytiques Claude Code, complétés par des politiques de routage, la résidence des données dans l’UE et une gateway MCP
Tarif : $0 sur les modèles gratuits ; Pay as you go ajoute 5% au coût de base des modèles ; Enterprise sur devis
Essai gratuit : offre gratuite de 200 requêtes par jour, sans carte bancaire

La page tarifaire actuelle de Requesty annonce 600+ modèles auprès de 20+ fournisseurs. Pay as you go ne comporte ni abonnement, ni prix par siège, ni dépense minimale, ni supplément distinct pour le routage, le cache, les fallbacks ou la résidence des données dans l’UE. Pour $2,000 d’inférence mensuelle au tarif fournisseur, la marge de 5% représente $100.

Ces $100 se justifient facilement si les métadonnées empêchent une exécution incontrôlée plus coûteuse ou rendent possible la refacturation. Ils sont moins convaincants pour un développeur seul qui cherche uniquement une autre URL de base. OpenRouter revendique un catalogue plus large, tandis que Vercel offre un parcours sans marge plus simple pour les agents de code pris en charge.

L’offre Enterprise de Requesty ajoute SSO, RBAC, journaux d’audit, politiques de modèles approuvés, détection des PII, budgets par groupe, comptes de service pour CI/CD et SLA personnalisés. Ces fonctions en font une option crédible pour une grande organisation d’ingénierie, mais le prix est sur devis. Impossible de comparer Enterprise sans demander une proposition fondée sur un profil de requêtes représentatif.

Une incohérence documentaire mérite d’être signalée. La page tarifaire commerciale indique 600+ modèles, alors que la page d’intégration Claude Code, modifiée le 10 août 2026, mentionne encore 300+ modèles. Le nombre le plus élevé est retenu ici pour le catalogue payant, car la page tarifaire en vigueur définit l’offre commerciale. Cette divergence oblige néanmoins l’acheteur à vérifier les modèles dont il a besoin dans la bibliothèque du compte, au lieu de considérer l’un ou l’autre chiffre comme une garantie.

La configuration Claude Code est plus étroite que le CLI multi-agent de Vercel, mais plus poussée pour l’attribution. Le CLI de Requesty peut écrire la configuration Claude et sauvegarder le fichier existant. Un wrapper shell facultatif injecte au démarrage de la session les en-têtes du dépôt, de la branche, de l’utilisateur et de la version de l’agent. Le wrapper reste visible dans la configuration du shell, et les en-têtes sont retirés avant transmission au fournisseur du modèle.

La limite vient du compteur en pourcentage. La marge de 5% augmente avec la dépense modèle, même lorsque le travail effectué par le plan de contrôle ne change pas. À $20,000 par mois, elle atteint $1,000. Un acheteur plus important doit comparer cette facture à l’abonnement de Portkey, au coût d’exploitation de LiteLLM et à un devis Enterprise personnalisé de Requesty.

Les atouts
Ce qu'il fait bien
5 points

  • Attribution des coûts par branche, dépôt, développeur et version de l’agent
  • 200 requêtes gratuites par jour sur les modèles gratuits
  • Routage, cache, fallbacks, plafonds de dépense et résidence des données dans l’UE avec Pay as you go
  • Gateway MCP et comptes de service pour CI/CD
  • Aucun abonnement, coût par siège ou minimum de dépense avec Pay as you go
Les limites
Là où il pèche
4 points

  • La marge de 5% augmente directement avec la dépense d’inférence
  • Le tarif Enterprise nécessite un devis
  • La configuration multi-agent est moins unifiée que le CLI de Vercel pour neuf agents
  • Les pages en vigueur ne s’accordent pas sur un catalogue de 300+ ou 600+ modèles

3. LiteLLM : le meilleur LLM gateway auto-hébergé

LiteLLM est le meilleur choix lorsque la maîtrise du déploiement et des données prime sur la simplicité. Son proxy open source peut être auto-hébergé gratuitement en production et réunit 100+ fournisseurs derrière une seule API compatible OpenAI.

Page tarifaire de la gateway auto-hébergée LiteLLM
LiteLLM

Pour le CTO d’une entreprise de taille intermédiaire soumise à un périmètre réseau privé, l’intérêt est immédiat : clés des modèles, trafic des requêtes, clés virtuelles, budgets, logs et métriques Prometheus restent dans l’infrastructure exploitée par l’entreprise. LiteLLM indique que son produit auto-hébergé ne voit ni les données ni le trafic du client. Une gateway managée disparaît ainsi du chemin emprunté par les données des modèles.

Idéal pour : les équipes plateforme qui exigent un accès aux modèles auto-hébergé ou isolé du réseau
Point fort : un proxy open source gratuit avec 100+ fournisseurs, des clés virtuelles, des budgets, des fallbacks et Prometheus
Tarif : $0 en open source ; Enterprise est annuel, sur devis selon la capacité et le déploiement
Essai gratuit : essai Enterprise de 30 jours sans carte bancaire ; l’open source reste gratuit

Le prix du logiciel est le chiffre le plus simple de ce comparatif, et celui qui risque le plus d’être mal interprété. La gateway open source coûte $0, y compris pour un usage en production. Elle comprend les utilisateurs et les équipes, le suivi des dépenses, les limites de débit, la journalisation des requêtes et des réponses, ainsi que les fallbacks LLM. LiteLLM ne facture aucun coût de licence par jeton.

Le coût d’exploitation, lui, n’est pas de $0. Il faut déployer le proxy, administrer sa base de données et ses secrets, le dimensionner, le superviser, le mettre à niveau lorsque les fournisseurs modifient leurs API, conserver les logs, tester les fallbacks et intervenir quand la gateway devient le point de défaillance commun. LiteLLM convertit une facture fournisseur en responsabilité d’infrastructure. L’échange peut être avantageux pour une équipe plateforme, beaucoup moins pour une startup de cinq personnes.

Enterprise ajoute SSO, SCIM, authentification OIDC ou JWT, journaux d’audit, intégrations aux gestionnaires de secrets, rotation des clés, contrôles au niveau de l’organisation, plan de contrôle multirégion, support, SLA et déploiement isolé. La tarification est annuelle et dépend de la capacité de requêtes, de l’architecture de déploiement et du support, pas des jetons. Cette frontière compte : une entreprise réglementée peut commencer en open source, puis avoir besoin d’Enterprise dès que l’identité, les audits ou le support permanent deviennent obligatoires.

LiteLLM propose aussi deux surfaces produit que les acheteurs confondent souvent. Le SDK Python est une bibliothèque applicative. Le Proxy Server constitue la gateway centralisée, avec authentification, dépenses multi-tenant, clés virtuelles et tableau de bord d’administration. Un déploiement d’agents de code exigeant une politique commune doit évaluer le proxy, et non se contenter d’ajouter le SDK à quelques scripts.

La limite propre aux agents de code concerne la documentation et la responsabilité d’exploitation. LiteLLM fournit l’endpoint compatible que de nombreux agents peuvent utiliser, mais pas l’installateur unique et actuel de Vercel pour neuf agents nommément pris en charge. Il reste donc à valider, agent par agent, les variables d’environnement, le format des réponses, la découverte des modèles et l’appel d’outils. Le comportement de l’API Responses de Codex et le protocole Anthropic de Claude Code méritent des tests pilotes séparés.

Les atouts
Ce qu'il fait bien
5 points

  • Licence open source à $0 pour l’auto-hébergement en production
  • 100+ fournisseurs derrière une API compatible OpenAI
  • Clés virtuelles, budgets, limites de débit, fallbacks, logs et métriques Prometheus
  • Trafic et clés conservés dans l’infrastructure exploitée par le client
  • Parcours Enterprise pour l’identité, l’audit, l’isolation réseau, le support et le multirégion
Les limites
Là où il pèche
4 points

  • L’acheteur prend en charge la disponibilité, les mises à niveau, le stockage, la montée en charge et les incidents
  • Le tarif Enterprise n’est pas public
  • La configuration propre aux agents est moins intégrée que chez Vercel
  • Déployé sans rigueur, un proxy central peut devenir un nouveau domaine de panne interne

4. OpenRouter : le meilleur pour l’étendue du catalogue et les tests rapides

OpenRouter est la meilleure gateway pour comparer un vaste marché de modèles depuis un compte unique. Sa page Pay as you go en vigueur annonce 500+ modèles issus de 80+ fournisseurs, le catalogue publié le plus large de cette sélection.

Page tarifaire de la gateway OpenRouter
OpenRouter

Cette ampleur profite au développeur technique indépendant comme à la petite équipe très orientée recherche. Un agent de code peut comparer un modèle de pointe pour planifier un dépôt, un modèle plus rapide pour la recherche et la classification, puis un modèle ouvert pour les transformations courantes, sans créer un compte de facturation chez chaque fournisseur.

Idéal pour : comparer rapidement des modèles et accéder à un vaste marché de fournisseurs
Point fort : 500+ modèles, 80+ fournisseurs et un Auto Router sensible au type de tâche
Tarif : $0 en gratuit ; Pay as you go prélève 5.5% de frais de plateforme ; remises Enterprise sur devis
Essai gratuit : offre gratuite avec 25+ modèles, 4 fournisseurs et 50 requêtes par jour

Le compromis commercial est explicite. L’offre Pay as you go d’OpenRouter n’impose aucune dépense minimale, mais applique 5.5% de frais de plateforme. Sur $2,000 de crédits achetés, cela représente $110. Bring Your Own Key inclut actuellement jusqu’à $25,000 d’inférence au prix catalogue chaque mois avant l’application de 5% de frais. Enterprise porte ce seuil à $200,000 et propose des remises tarifaires sur devis.

L’offre gratuite permet de confirmer la compatibilité, mais convient mal à un travail soutenu avec des agents. Cinquante requêtes quotidiennes peuvent disparaître au cours d’une seule longue boucle de code. Considérez-la comme un test de connexion, pas comme un budget d’équipe.

L’Auto Router d’OpenRouter est plus intéressant que le simple nombre de modèles. La documentation de routage actuelle indique qu’il classe les prompts dans environ 30 types de tâches, dont le débogage de code et la planification multi-étapes d’agents, puis ordonne les modèles selon les dépenses cumulées sur une fenêtre glissante de sept jours. Il tient compte des capacités, de la prise en charge des outils, du coût, des restrictions du compte et des possibilités de fallback.

Ce signal de marché simplifie l’expérimentation, au prix d’une reproductibilité moindre. Le routeur peut sélectionner un modèle différent à chaque tour. L’affinité de session privilégie le modèle précédent s’il reste parmi les meilleurs candidats, mais un changement de tâche peut encore modifier le choix. Pour un agent de code qui construit un patch sur plusieurs tours, changer de modèle en pleine session peut affecter la syntaxe des outils, le style de raisonnement ou la rigueur des sorties.

La solution n’est pas d’abandonner le routage, mais de choisir où le routage dynamique a sa place. Utilisez-le pour l’évaluation, la classification à faible risque ou une étape d’arrière-plan bien délimitée. Pour un patch critique destiné à une livraison, verrouillez un modèle approuvé et une politique fournisseur, sauf si l’équipe a testé la continuité entre modèles.

OpenRouter expose également un routage fondé sur des politiques et des fallbacks entre fournisseurs. C’est utile lorsqu’un même modèle est commercialisé par plusieurs hébergeurs d’inférence. Cela l’est moins si l’acheteur a besoin de refacturation par dépôt, de contrôle auto-hébergé ou de garde-fous Enterprise managés. Requesty, LiteLLM et Portkey sont plus solides sur ces besoins respectifs.

Les atouts
Ce qu'il fait bien
5 points

  • Le catalogue publié le plus large de la sélection, avec 500+ modèles et 80+ fournisseurs
  • Un moyen rapide de comparer les modèles sans comptes fournisseurs séparés
  • Auto Router fondé sur la tâche actuelle et les signaux du marché
  • Fallbacks fournisseurs, contrôles de dépense et routage par politiques
  • Offre gratuite pour vérifier la compatibilité
Les limites
Là où il pèche
4 points

  • Les frais Pay as you go de 5.5% augmentent avec la dépense
  • La limite gratuite de 50 requêtes quotidiennes est trop faible pour des boucles d’agents soutenues
  • Le routage dynamique peut changer de modèle entre deux tours
  • Moins de configuration propre aux agents et d’attribution aux dépôts que les deux premiers choix

5. Portkey : la meilleure couche de gouvernance managée

Portkey est le meilleur choix quand le besoin financé porte sur un plan de contrôle managé, et pas seulement sur un endpoint unifié. Sa gateway réunit fallbacks, routage conditionnel, nouvelles tentatives, disjoncteur, répartition de charge, tests canary, prise en charge de MCP, budgets, limites de débit, caches et garde-fous.

Page tarifaire de la gateway IA Portkey
Portkey

Cet ensemble convient à une équipe plateforme de taille intermédiaire qui passe de clés individuelles à un accès approuvé pour ses agents. Une politique peut limiter les modèles, un budget plafonner une équipe et un disjoncteur interrompre les appels répétés vers un fournisseur défaillant. Le produit vise précisément le moment où « donner une clé de gateway aux développeurs » devient un problème d’identité, de politique et de gestion des incidents.

Idéal pour : le routage, les garde-fous et la gouvernance managés d’une équipe plateforme en croissance
Point fort : disjoncteurs, tests canary, contrôles MCP, routage conditionnel et gateway locale open source
Tarif : $0 en Developer, $49/month en Production, Enterprise sur devis
Essai gratuit : l’offre Developer reste gratuite, mais est explicitement inadaptée à la production

Les frontières entre les offres sont particulièrement franches. L’offre Developer de Portkey enregistre 10,000 logs par mois, conserve les logs pendant trois jours et les métriques pendant 30 jours. La page précise explicitement qu’elle ne convient pas à la production.

Production coûte $49 par mois et enregistre 100,000 logs, avec $9 facturés pour chaque tranche supplémentaire de 100,000 requêtes jusqu’au seuil publié. Les logs sont conservés pendant 30 jours et les métriques pendant 90 jours. Pour 200,000 logs enregistrés, l’abonnement atteint $58 avant l’inférence en amont. La même page indique que Production n’est pas recommandé si des contrôles de sécurité personnalisés ou des garanties de résidence des données sont nécessaires.

Enterprise devient alors indispensable. Cette offre sur devis ajoute plus de 10 millions de logs enregistrés, une conservation personnalisée, SSO, des budgets et limites de débit granulaires, un hébergement en cloud privé et en VPC, l’export vers un lac de données ainsi que des fonctions avancées de conformité. Le passage d’une carte à $49 à un processus d’achat est conséquent.

Portkey publie aussi une gateway locale open source, exécutable avec npx @portkey-ai/gateway. Elle permet de tester l’interface de routage ou d’auto-héberger le chemin des données. L’acheteur doit néanmoins la distinguer de l’observabilité managée, des politiques, du support et des contrôles Enterprise qui justifient ici le classement de Portkey.

La transition actuelle du produit mérite attention. La documentation de Portkey indique désormais qu’il s’agit de Prisma AIRS AI Gateway. Les pages consacrées à la gateway et les tarifs restent en ligne, mais l’acheteur doit demander quel nom de produit figurera au contrat, quelle feuille de route s’applique et comment les comptes Portkey autonomes s’intègrent au portefeuille de Palo Alto Networks. C’est une précaution d’achat, pas une raison d’écarter l’outil.

La limite pour les agents de code tient à la configuration. Portkey peut servir des agents grâce à des protocoles compatibles et apporte un plan de contrôle général plus profond que Vercel. Il ne propose pas aujourd’hui la même expérience en une commande pour neuf agents. Choisissez-le si la politique justifie l’intégration, pas simplement parce que sa liste de fonctionnalités est plus longue.

Les atouts
Ce qu'il fait bien
5 points

  • Routage managé riche, avec disjoncteurs, nouvelles tentatives, fallbacks et tests canary
  • Prise en charge de MCP, garde-fous, budgets et limites de débit
  • Offre Production publique à $49, avec un compteur clair de logs enregistrés
  • Option de gateway locale open source
  • Parcours Enterprise pour SSO, déploiement privé, résidence des données et conformité
Les limites
Là où il pèche
5 points

  • L’offre gratuite est explicitement inadaptée à la production
  • L’offre Production à $49 n’est explicitement pas destinée aux besoins personnalisés de sécurité ou de résidence
  • Le prix d’Enterprise est sur devis
  • La configuration des agents de code est moins intégrée que chez Vercel
  • La transition vers Prisma AIRS soulève des questions de contrat et de feuille de route

6. Cloudflare AI Gateway : le meilleur choix pour les équipes déjà sur Workers

Cloudflare AI Gateway est l’option la plus simple lorsque Cloudflare gère déjà l’edge, les logs et la sécurité de l’application. Ses fonctions de gateway de base sont actuellement gratuites dans toutes les offres, notamment l’analytique, le cache et la limitation du débit.

Documentation tarifaire de Cloudflare AI Gateway
Cloudflare AI Gateway

Le produit est convaincant pour une équipe dont l’agent ou la plateforme interne de développement fonctionne déjà sur Workers. Le même compte peut appeler des modèles tiers et des modèles hébergés par Cloudflare via une interface REST compatible OpenAI, enregistrer coûts et erreurs, mettre en cache les requêtes répétées sans risque, appliquer des limites de débit, rechercher des données sensibles et retenter les appels en échec.

Idéal pour : les équipes qui utilisent déjà Workers, les logs Cloudflare ou les contrôles de sécurité Cloudflare
Point fort : gateway de base gratuite, intégration à l’edge, DLP, cache et accès compatible OpenAI à des modèles tiers
Tarif : fonctions de base à $0 ; 5% de frais sur les achats de crédits Unified Billing ; garde-fous au tarif Workers AI
Essai gratuit : les fonctions essentielles de la gateway sont gratuites, sans limite de durée

La page tarifaire définit précisément les limites de l’offre gratuite. Workers Free conserve 100,000 logs au total pour toutes les gateways. Workers Paid conserve 10 millions de logs par gateway. Logs persistants, analytique, cache et limitation du débit sont disponibles dans toutes les offres.

Unified Billing ajoute 5% de frais lorsque les crédits sont achetés auprès de Cloudflare. Un achat de $2,000 de crédits coûte donc $2,100, tandis que l’inférence fournisseur continue d’être refacturée sans marge. La nuance est importante : le prix du modèle ne change pas, mais la consolidation des identifiants et de la facturation est payante.

L’analyse Data Loss Prevention est gratuite dans toutes les offres. Les comptes dépourvus d’abonnement Zero Trust disposent de deux profils DLP prédéfinis, tandis que l’accès à davantage de profils dépend de l’abonnement Cloudflare One. Les garde-fous ne font pas partie des fonctions essentielles gratuites : Cloudflare facture leur évaluation des prompts et des réponses comme de l’inférence Workers AI.

Cloudflare expose également des contrôles de requête utiles. Sa documentation REST autorise des timeouts par requête, plusieurs méthodes de nouvelle tentative, jusqu’à cinq essais et jusqu’à 5,000 millisecondes de délai entre eux. Ces contrôles évitent qu’un fournisseur lent ne bloque indéfiniment une boucle d’agent.

La limite tient à l’ergonomie pour les agents de code. Cloudflare explique comment les applications appellent la gateway, mais n’offre pas une couche de configuration comparable, agent par agent, à celle de Vercel ou au workflow Claude Code de Requesty. Il faut vérifier pour chaque agent la modification de l’URL de base, l’authentification, la découverte des modèles et le protocole. La ligne logicielle peut être à $0, tandis que l’intégration retombe sur l’équipe d’ingénierie.

Les atouts
Ce qu'il fait bien
5 points

  • Analytique, cache et limitation du débit gratuits dans l’offre de base
  • Accès compatible OpenAI aux modèles Cloudflare et tiers
  • Analyse DLP gratuite dans toutes les offres
  • Excellente intégration à Workers, aux logs Cloudflare et aux produits de sécurité
  • Contrôles explicites des nouvelles tentatives et des timeouts
Les limites
Là où il pèche
5 points

  • Unified Billing ajoute 5% aux achats de crédits
  • Le stockage gratuit est limité à 100,000 logs pour l’ensemble du compte
  • Les garde-fous génèrent des frais d’inférence Workers AI distincts
  • Pas de configuration comparable en une commande pour les agents de code
  • Les profils DLP complets peuvent nécessiter un abonnement Zero Trust séparé

LLM gateway : quelle solution choisir selon votre besoin ?

La meilleure gateway est celle qui supprime le coût de coordination actuel de l’équipe sans créer une charge d’exploitation plus lourde. Commencez par la contrainte non négociable, puis comparez les frais.

Choisissez Vercel AI Gateway pour une équipe mixte qui utilise Claude Code, Codex, Cursor, OpenCode et des agents apparentés. Le choix change dès que l’auto-hébergement est obligatoire ou que les coûts doivent être rattachés au dépôt et au développeur, plutôt qu’au seul agent, à la clé et au modèle.

Choisissez Requesty pour une agence, un cabinet de conseil ou une organisation produit qui a besoin d’une attribution par branche, dépôt et développeur. Le choix change si ces métadonnées ne modifient aucune décision budgétaire, car la marge de 5% achète alors une information que personne n’utilise.

Choisissez LiteLLM pour une équipe plateforme déjà équipée de pratiques solides en matière de conteneurs, bases de données, secrets, logs et astreinte. Une gateway managée reprend l’avantage si le proxy risque d’être confié de manière informelle à un ingénieur produit.

Choisissez OpenRouter tant qu’un développeur seul ou une équipe de recherche compare encore les modèles et les fournisseurs. Le choix change après stabilisation de la sélection, quand les frais récurrents de 5.5% dépassent la valeur d’un vaste catalogue.

Choisissez Portkey si modèles approuvés, garde-fous, disjoncteurs, tests canary et gouvernance managée constituent le motif d’achat. Le choix change si l’organisation n’a besoin que d’un endpoint et d’un tableau des dépenses.

Choisissez Cloudflare AI Gateway si Workers et la sécurité Cloudflare sont déjà payés et maîtrisés. Le choix change si l’adoption de la plateforme environnante crée plus de travail d’intégration que la gateway n’en retire.

Arbre de décision reliant les besoins des agents de code à six gateways IA
Commencez par la contrainte non négociable, puis comparez les frais de gateway

Une dernière règle : dissociez le choix de la gateway de celui de l’agent. Claude Code, Codex et Cursor répondent à des besoins d’ingénierie différents, tandis que la gateway contrôle leur trafic vers les modèles. Une entreprise peut standardiser la gateway sans imposer le même éditeur. C’est souvent la frontière de contrôle la plus utile.

Pour élargir la sélection, comparez les meilleurs agents IA de codage. Pour les questions de SSO, de conservation, d’audit et de déploiement qui dépassent la gateway, consultez le comparatif des agents de code pour l’entreprise.

Les solutions à éviter pour cet usage

Évitez de faire d’Helicone votre premier achat si le problème immédiat est la configuration des agents de code. Son offre Hobby est gratuite pour 10,000 requêtes, Pro coûte $79 par mois et Team $799 par mois. Ses fonctions d’observabilité, de sessions, de prompts et d’analyse peuvent être précieuses. Le classement ne change que si la visibilité constitue le problème principal. Pour cette requête, Helicone ne dépasse ni le parcours de configuration actuel de Vercel, ni l’attribution par dépôt de Requesty, ni le contrôle du déploiement offert par LiteLLM.

Évitez une gateway API générique choisie uniquement parce que l’entreprise la possède déjà. Les gateways traditionnelles comprennent les routes, l’authentification et les politiques HTTP. Le trafic des agents de code ajoute les modèles propres aux fournisseurs, le calcul des jetons, la compatibilité avec l’appel d’outils, le cache des prompts, les fallbacks de modèles et plusieurs protocoles de réponse. Étendre une gateway généraliste peut se justifier pour une équipe plateforme, mais « nous avons déjà Kong » n’est pas un plan d’implémentation.

Évitez un simple proxy développé en interne dès que plusieurs agents en dépendent. Changer une URL de base est facile. Maintenir les adaptateurs fournisseurs, des nouvelles tentatives sûres, les réponses en streaming, les compteurs budgétaires, l’isolation des clés, la conservation des logs et les dépréciations de modèles est un produit à part entière. Ne le construisez que si une politique ou une contrainte de déploiement unique justifie cette responsabilité permanente.

Évitez le routage dynamique des modèles à chaque étape d’une boucle d’agent critique pour une livraison tant que la continuité entre modèles n’a pas été évaluée. Un routeur peut sélectionner un modèle efficace pour chaque tâche tout en rendant un long patch plus difficile à reproduire. Verrouillez le modèle pour les étapes qui produisent le changement, puis utilisez le routage dynamique pour des travaux d’assistance circonscrits.

Enfin, évitez de migrer tous les développeurs dès le premier jour. Une gateway peut modifier l’authentification, la découverte des modèles, le cache, la gestion des erreurs et la sélection des fallbacks tout en laissant l’interface de l’agent de code apparemment inchangée. Voilà pourquoi un pilote délimité et un retour direct vers le fournisseur font partie du déploiement.

Questions fréquentes

Quelle est la meilleure solution de LLM gateway ?

Vercel AI Gateway est le meilleur choix par défaut pour les agents de code, car il combine une configuration en une commande pour neuf agents pris en charge et aucune marge sur les jetons. LiteLLM est préférable si l’auto-hébergement est obligatoire, Requesty si l’attribution au dépôt et au développeur prime, et Portkey si la gouvernance managée motive l’achat.

Quels sont les tarifs et frais d’OpenRouter en 2026 ?

L’offre Pay as you go actuelle d’OpenRouter prélève 5.5% de frais de plateforme, donne accès à 500+ modèles et 80+ fournisseurs, sans dépense minimale. L’offre gratuite est limitée à 25+ modèles, 4 fournisseurs et 50 requêtes par jour. L’allocation BYOK actuelle de Pay as you go couvre $25,000 d’inférence au prix catalogue par mois avant l’application de 5% de frais.

Combien coûte Cloudflare AI Gateway en 2026 ?

Les fonctions essentielles de Cloudflare AI Gateway sont gratuites. Les achats de crédits Unified Billing ajoutent 5%, Workers Free conserve 100,000 logs pour l’ensemble du compte, Workers Paid en conserve 10 millions par gateway et les garde-fous sont facturés séparément comme de l’inférence Workers AI.

Une même gateway peut-elle router Claude Code et Codex ?

Oui. La gateway doit prendre en charge les protocoles attendus par chaque agent ou fournir des endpoints de compatibilité dédiés. Vercel documente des endpoints distincts pour Claude Code et Codex, tandis que les solutions auto-hébergées et les gateways généralistes imposent à l’acheteur de valider la configuration de chaque agent.

Votre prochaine action lundi

Ne consacrez pas votre lundi à migrer toute l’entreprise. Utilisez-le pour vérifier qu’une gateway peut réduire l’ambiguïté des coûts et le risque fournisseur sur un dépôt représentatif.

Lundi : définir le périmètre de contrôle

Choisissez un dépôt, un petit groupe de développeurs et les deux agents de code qu’ils utilisent déjà. Résumez en une phrase le besoin financé : consolider la facturation, survivre aux pannes fournisseurs, attribuer les dépenses, imposer les modèles approuvés ou conserver le trafic dans un déploiement privé. Si la phrase mentionne trois objectifs sans rapport, réduisez le périmètre du pilote.

Créez une clé de gateway dédiée avec un plafond de dépense strict. Choisissez un modèle principal et un fallback dont la prise en charge des outils est comparable. Conservez la configuration directe du fournisseur dans un fichier de rollback et relevez la facture fournisseur actuelle avant de déplacer le moindre trafic.

Mardi : connecter, puis examiner le diff

Pour Vercel, exécutez la commande de configuration documentée et relisez chaque changement avant toute écriture. Pour Requesty, sauvegardez les paramètres Claude Code et n’activez que les en-têtes d’attribution que l’équipe utilisera. Pour LiteLLM, déployez le proxy par le circuit d’infrastructure habituel, pas depuis un ordinateur portable. Quelle que soit la gateway, confirmez que les secrets rejoignent le stockage approuvé.

Lancez un ticket bien délimité depuis chaque agent. Vérifiez le choix du modèle, les appels d’outils, le streaming, les erreurs, le comportement du cache, le coût et l’identité associée à la requête. Obtenir une réponse correcte ne suffit pas si le tableau de bord ne peut pas expliquer qui a dépensé l’argent ou quel fallback a répondu.

Mercredi et jeudi : provoquer le chemin d’échec

Déclenchez un timeout contrôlé ou utilisez une route de test qui envoie la requête principale vers un fournisseur indisponible. Vérifiez que le fallback conserve le format de protocole attendu par l’agent de code. Contrôlez si la tentative en échec est facturée, si le fallback utilise un autre identifiant et si la trace identifie les deux tentatives.

Soumettez au pilote une correction ordinaire, une modification de plusieurs fichiers, une boucle test-correction et une tâche de revue. Relevez le coût par tâche terminée, les pannes fournisseurs, les requêtes sauvées, le temps passé à modifier la configuration et les frictions signalées par les développeurs. Ne comparez pas le nombre de prompts sans tenir compte du résultat obtenu.

Vendredi : acheter le contrôle qui a changé une décision

N’adoptez la gateway que si ses informations ou sa fiabilité modifient une décision d’exploitation. Une requête sauvée compte. Un dépassement de budget par dépôt compte. Une violation de politique fournisseur compte. Un tableau rempli de courbes de jetons que personne ne consulte ne compte pas.

Pour la plupart des équipes qui combinent plusieurs agents, le choix du lundi est Vercel AI Gateway, avec une clé pilote, un modèle principal, un fallback et aucun module payant tant qu’une politique ne l’exige pas. Requesty prend le relais si la responsabilité des coûts doit descendre au niveau du dépôt et du développeur. LiteLLM s’impose si le chemin des données doit rester dans l’infrastructure de l’entreprise.

Versionnez la configuration de la gateway, documentez le rollback et gardez une politique de modèles réduite. L’objectif n’est pas de multiplier les fournisseurs derrière lesquels router. Il est de faire de la prochaine panne fournisseur, sortie de modèle ou revue budgétaire un changement de configuration plutôt qu’une migration à l’échelle de l’entreprise.

Dernière mise à jour

3 sept. 2026

CatégorieBuild

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.