Gateway LLM : les 10 meilleures passerelles IA en 2026

Comparez 10 gateways LLM pour applications multi-modèles : tarifs, routage, gouvernance et stratégie de sortie afin de choisir sans verrouillage.

Thursday, September 3, 2026Omid Saffari
Gateway LLM : les 10 meilleures passerelles IA en 2026

LiteLLM s’impose comme le meilleur gateway LLM généraliste pour une application multi-modèles dès lors qu’un responsable plateforme peut l’exploiter ; Vercel AI Gateway est le choix managé par défaut. L’accord à plus de $8 milliards qui permettrait à Stripe d’acquérir OpenRouter met en lumière le critère décisif : en production, une application doit pouvoir contourner sa passerelle sans réécriture.

Selon une information publiée par Axios le 17 août 2026, Stripe aurait accepté d’acquérir OpenRouter pour plus de $8 milliards, en numéraire et en actions. Axios précisait aussi que les entreprises n’avaient pas commenté et qu’une annonce officielle restait attendue. La nuance compte, mais l’enseignement opérationnel ne dépend pas de la finalisation de l’opération : une passerelle ne libère du verrouillage par les fournisseurs de modèles que si elle ne devient pas elle-même le verrou suivant.

Réponse courte : quel gateway LLM choisir ?

Choisissez LiteLLM pour garder la main, Vercel AI Gateway pour la simplicité d’un service managé, Portkey pour la gouvernance d’entreprise, et OpenRouter seulement si l’étendue du catalogue justifie une commission en pourcentage et une dépendance fournisseur supplémentaire. Une passerelle IA forme la couche de requêtes entre l’application et les fournisseurs de modèles. Elle peut normaliser les API, conserver les identifiants, router le trafic, relancer les appels en échec, suivre les coûts et appliquer des règles.

Les tarifs et limites ci-dessous ont été vérifiés sur les pages en ligne de chaque fournisseur le 18 août 2026. Le classement porte sur 10 produits et juge chacun sur la première limite réellement rencontrée en production, pas sur le nombre de fonctionnalités affichées dans une fiche commerciale.

OutilIdéal pourTarif de départEssai gratuit
LiteLLMPlan de contrôle maîtrisé par l’application$0 OSS ; Enterprise sur devisEssai Enterprise de 30 jours
Vercel AI GatewayÉquipes produit voulant un service managéCrédit gratuit de $5 par mois ; aucune marge sur les tokensOffre Free permanente
PortkeyGouvernance d’entreprise managéeDeveloper à $0 ; Production à $49/moOffre Developer gratuite
Cloudflare AI GatewayContrôle edge dans l’écosystème CloudflareFonctionnalités cœur à $0 ; Unified Billing ajoute 5%Fonctionnalités cœur gratuites
OpenRouterLarge choix de modèles et fournisseursFree à $0 ; Pay as you go ajoute 5.5%Offre Free
BifrostContrôle explicite des retries en OSSOSS à $0 ; Enterprise sur devisEssai Enterprise de 14 jours
HeliconeÉquipes privilégiant l’observabilitéHobby à $0 ; Pro à $79/moEssai Pro et Team de 7 jours
Braintrust GatewayDécisions de release pilotées par les évaluationsStarter à $0 ; Pro à $249/moGateway gratuit pendant la bêta
RequestyRoutage managé simpleFree à $0 ; Pay as you go ajoute 5%Offre Free, sans carte
Kong AI GatewayInfrastructures déjà standardisées sur KongPlan de contrôle serverless à $25/mo, plus $100/modelEssai de 30 jours

La première question n’est pas le nombre de features, mais qui maîtrise le chemin des requêtes. Avec une passerelle auto-hébergée, processus, identifiants, base de données, logs et règles restent dans votre environnement — tout comme l’astreinte. Un service managé supprime cette charge d’exploitation, mais chaque appel de modèle dépend alors de ses pannes, de ses changements tarifaires, de ses acquisitions et de sa roadmap.

Le seuil économique est plus lisible que ne le suggèrent les pages produit. Supposons qu’une passerelle auto-hébergée mobilise huit heures de plateforme par mois, à un coût complet de $150 par heure. Cela représente un coût d’exploitation mensuel indicatif de $1,200, et non un tarif fournisseur. Une commission de 5.5% atteint $1,200 à $21,818 de dépenses mensuelles en modèles ; pour une commission de 5%, le seuil est de $24,000.

Frais des passerelles pour vingt mille dollars de dépenses mensuelles en modèles
À $20,000, les commissions proportionnelles restent sous le coût indicatif de l’auto-hébergement, mais l’écart se referme vite

Ce calcul ne couvre que la ligne budgétaire. Une contrainte de déploiement, un circuit de données réglementé, un contrat fournisseur ou une piste d’audit obligatoire peuvent justifier l’auto-hébergement bien avant le seuil de rentabilité. À l’inverse, une petite startup n’a aucun intérêt à créer une mission de plateforme interne pour économiser moins qu’une journée d’ingénieur.

Pourquoi la passerelle IA devient à la fois un budget et un plan de sortie

Une passerelle est précieuse parce que les modèles évoluent vite ; elle devient risquée dès que l’application ne peut plus fonctionner sans elle. L’information sur OpenRouter paraît moins de trois mois après que Palo Alto Networks a finalisé l’acquisition de Portkey, en annonçant que Portkey deviendrait un composant central de Prisma AIRS. En un trimestre, deux plans de contrôle indépendants peuvent rejoindre de plus grandes plateformes. Dans cette catégorie, les acheteurs doivent considérer les changements d’actionnariat comme une évolution probable, et non comme une exception.

La conséquence métier tient à la concentration. Une application multi-modèles peut appeler OpenAI pour un workflow, Anthropic pour un autre et un modèle ouvert pour une tâche de fond à fort volume. Placer les trois derrière une seule passerelle simplifie le code, la facturation, les règles et l’observabilité. Mais un seul changement de prix ou de politique peut alors les toucher tous simultanément.

L’architecture prudente comporte trois couches :

  • Un client de modèles interne définit le petit nombre d’opérations dont l’application a besoin : génération de texte, sorties structurées, embeddings et appels d’outils, par exemple.
  • Un adaptateur de passerelle traduit ces opérations pour la solution retenue sans disséminer ses headers propriétaires dans toute la base de code.
  • Un adaptateur direct vers le fournisseur reste configuré et documenté, même s’il ne reçoit aucun trafic de production en temps normal.

Cette structure rend possible ce que ce guide appelle la sortie en 10 minutes : un opérateur doit pouvoir détourner un workflow de production de la passerelle par configuration et déploiement contrôlé, sans toucher à la logique métier. Les dix minutes sont un objectif opérationnel éditorial, pas un SLA fournisseur. S’il faut réécrire le client, revoir l’identité ou migrer tous les noms de modèles pour contourner la passerelle, celle-ci contrôle davantage l’application que les fournisseurs de modèles.

C’est aussi la raison pour laquelle un fallback automatique mérite d’être examiné de près. Il n’est utile que s’il préserve le protocole de réponse, le schéma des outils, la politique de données et le cadre de coûts attendus par l’application. Une réponse HTTP réussie provenant d’un autre modèle peut tout de même constituer un échec applicatif si la sortie structurée change ou si l’appel d’outil devient incompatible.

Pour approfondir la couche d’inférence sous la passerelle, notre comparatif des API IA les moins chères distingue le prix du modèle des frais de routage. Si le besoin immédiat concerne les outils de développement plutôt qu’une application destinée aux clients, le guide plus ciblé des passerelles IA pour agents de code couvre la configuration des agents et l’attribution par dépôt.

Comment avons-nous sélectionné ces gateways LLM ?

Le classement privilégie la réversibilité et l’adéquation opérationnelle avant la taille du catalogue. Avoir accès à des centaines de modèles est utile pendant l’exploration, puis perd l’essentiel de son intérêt une fois que l’application de production a standardisé trois routes approuvées.

Chaque passerelle a été évaluée selon cinq critères :

  1. Portabilité : l’application peut-elle conserver ses comptes fournisseurs, ses noms de modèles, ses règles et sa route directe ?
  2. Résilience déterministe : les opérateurs maîtrisent-ils les retries, l’ordre des fournisseurs, le comportement des fallbacks et les conditions d’arrêt d’une requête ?
  3. Lisibilité des coûts : les dépenses peuvent-elles être attribuées à une application, un client, une équipe ou une clé, et les frais peuvent-ils être prévus à partir des tarifs publics ?
  4. Périmètre de gouvernance : la passerelle répond-elle aux exigences de l’acheteur en matière de déploiement, d’identité, de conservation, d’audit et de résidence des données ?
  5. Maturité opérationnelle : la solution est-elle disponible de façon générale, exploitable, observable et proposée à un tarif adapté à son stade d’utilisation ?

Ce travail vérifie les tarifs et la documentation ; ce n’est pas un essai produit déguisé. Nous ne prétendons ni avoir déployé ces solutions, ni les avoir soumises à des tests de charge, ni y avoir souscrit. Chaque offre, limite et fonctionnalité précise provient d’une page fournisseur consultée le 18 août 2026 ; les comparaisons de coûts ne sont que des calculs appliqués à ces données.

La sélection se limite aux produits capables de se placer aujourd’hui sur le chemin des requêtes d’une application multi-modèles. Le catalogue d’un cloud unique peut être la bonne plateforme, mais il ne constitue pas un routage neutre. Quant à une fonction encore cantonnée à une roadmap, elle ne peut devancer une passerelle qu’un acheteur sait déjà déployer et chiffrer.

1. LiteLLM : le meilleur choix global pour maîtriser son plan de contrôle

LiteLLM est le meilleur gateway LLM généraliste lorsqu’un responsable plateforme clairement désigné peut l’exploiter. Ce proxy open source place 100+ fournisseurs derrière une API compatible OpenAI et inclut clés virtuelles, équipes, suivi des dépenses, budgets, limites de débit, fallbacks, logs de requêtes et de réponses, ainsi que des métriques Prometheus.

Comparatif des tarifs et offres LiteLLM
LiteLLM

Idéal pour : les éditeurs qui ont besoin d’une passerelle auto-hébergée et maîtrisée par l’application
Point fort : une large couverture des fournisseurs, avec budgets, clés, fallbacks et métriques dans l’offre OSS à $0
Tarifs : Open Source à $0 ; Enterprise annuel et sur mesure selon la capacité, l’architecture et le support
Essai gratuit : 30 jours d’Enterprise sans carte bancaire ; l’OSS reste gratuit

LiteLLM définit clairement la frontière logicielle sur sa page tarifaire en ligne. Open Source est gratuit en production lorsqu’il est auto-hébergé. Enterprise n’est pas facturé au token : le devis annuel dépend de la capacité de requêtes, de l’architecture de déploiement et du niveau de support. Enterprise ajoute SSO et SCIM, authentification OIDC ou JWT, journaux d’audit, intégrations aux gestionnaires de secrets, rotation des clés, plan de contrôle multirégion, déploiement air-gapped et support jusqu’à 24/7.

L’étiquette $0 est juste, mais incomplète. Votre équipe assume le proxy, Postgres, les secrets, le scaling, les mises à niveau, les changements d’API fournisseurs, le stockage des logs, les dashboards et les incidents. Avec l’hypothèse indicative de huit heures à $150, cette responsabilité coûte $1,200 par mois avant l’infrastructure. Face à une commission de 5.5%, LiteLLM devient financièrement avantageux au-delà de $21,818 de dépenses mensuelles en modèles ; un déploiement réglementé peut toutefois le choisir bien plus tôt pour le contrôle, et non pour les économies.

Le quickstart Docker documenté lance la passerelle et Postgres avec curl -sSL https://docs.litellm.ai/docker-compose.yml | docker compose -f - up -d, puis expose l’interface d’administration sur le port 4000. C’est une bonne voie d’évaluation, pas une architecture de production complète. Le même guide avertit qu’il faut remplacer la valeur factice LITELLM_SALT_KEY avant d’ajouter des identifiants persistants, puis ne plus la modifier : les clés fournisseurs chiffrées avec l’ancienne valeur ne peuvent pas être récupérées avec une nouvelle.

La vraie limite en production est l’ambiguïté de la responsabilité. LiteLLM constitue un excellent composant de plateforme, mais un mauvais projet annexe. Si le proxy appartient à « la personne qui l’a ajouté », une évolution fournisseur peut transformer un ingénieur applicatif en équipe passerelle, sans budget, sans astreinte et sans politique de mise à niveau.

  1. Commencer par un déploiement jetable

    Utilisez le quickstart Docker Compose documenté dans un compte hors production. Vérifiez que la passerelle et Postgres démarrent, remplacez les secrets factices et isolez cet environnement du trafic client.

  2. Exposer deux routes nommées

    N’ajoutez que le modèle principal et un fallback compatible. Employez des alias internes stables comme support-primary et support-fallback, afin que le code applicatif ne dépende pas du nom public choisi par chaque fournisseur.

  3. Émettre une clé virtuelle applicative

    Créez une clé virtuelle pour un service, avec ses propres accès aux modèles, budget mensuel et limite de débit. Ne distribuez pas la clé maître LiteLLM aux workloads applicatifs.

  4. Conserver un adaptateur direct

    Configurez le même service pour appeler directement le fournisseur principal derrière un feature flag. La passerelle reste la route par défaut ; la route fournisseur constitue le contournement testé.

  5. Provoquer l’échec du modèle principal

    Déclenchez de façon contrôlée l’indisponibilité d’une route, vérifiez que le fallback apparaît dans les logs, puis activez l’adaptateur direct et chronométrez la bascule. Si le contournement ne respecte pas l’objectif de sortie en 10 minutes, corrigez l’abstraction avant d’ajouter du trafic.

Les atouts
Ce qu'il fait bien
5 points

  • Licence OSS de production à $0, sans frais de passerelle par token
  • 100+ fournisseurs derrière une API compatible OpenAI
  • Clés virtuelles, budgets d’équipe, limites de débit, fallbacks, logs et Prometheus en OSS
  • Circuit de données auto-hébergé, avec options Enterprise air-gapped et multirégions
  • Tarif Enterprise indexé sur la capacité plutôt que sur les dépenses en modèles
Les limites
Là où il pèche
4 points

  • L’acheteur assume disponibilité, mises à niveau, santé de la base de données, secrets et incidents
  • Le tarif Enterprise n’est pas public
  • La simplicité du quickstart peut masquer le travail de durcissement avant production
  • Un proxy partagé crée un nouveau domaine de panne interne

2. Vercel AI Gateway : le meilleur choix managé par défaut

Vercel AI Gateway est le meilleur choix managé par défaut pour une équipe produit qui veut un endpoint unique sans marge sur les tokens. Ses contrôles de routage couvrent le filtrage et l’ordre des fournisseurs, les fallbacks de modèles, ainsi qu’une sélection du fournisseur fondée sur la disponibilité et la latence récentes.

Documentation tarifaire en ligne de Vercel AI Gateway
Vercel AI Gateway

Idéal pour : les startups et équipes produit qui privilégient une adoption managée rapide
Point fort : des tokens au tarif catalogue du fournisseur, sans marge de la passerelle
Tarifs : Free comprend $5 de crédit mensuel ; Paid utilise des crédits achetés aux tarifs catalogue des fournisseurs
Essai gratuit : offre Free permanente sur les modèles éligibles, avec des limites plus basses par modèle

La page tarifaire actuelle distingue clairement les états gratuit et payant. Free comprend $5 de crédit chaque mois. L’achat de crédits fait passer le compte en Pay as you go, ouvre tous les modèles disponibles, relève les limites et met fin à ce crédit mensuel de $5. Dans les deux offres, les tokens sont facturés au tarif catalogue du fournisseur, sans marge.

Bring Your Own Key n’est disponible qu’après le passage du compte à Paid. Vercel ne prélève aucuns frais de passerelle en BYOK, mais une requête en échec avec votre identifiant peut être retentée avec les identifiants système de Vercel ; le fallback est alors débité du solde de crédits de la passerelle. Ce comportement améliore la disponibilité, mais peut contredire l’hypothèse financière selon laquelle toute la consommation reste couverte par un contrat fournisseur existant. Vérifiez-le avant de considérer BYOK comme un raccourci d’achat.

Les tokens ne subissent aucune marge ; ce n’est pas le cas de tous les contrôles. Custom Reporting coûte $0.075 pour 1,000 écritures et $5 pour 1,000 requêtes de reporting. Une liste blanche de fournisseurs à l’échelle de l’équipe coûte $0.10 pour 1,000 requêtes réussies, tandis qu’un filtre only au niveau de la requête n’ajoute aucun coût. La zero data retention appliquée à toute l’équipe coûte elle aussi $0.10 pour 1,000 requêtes. Les trace drains sont facturés $0.05 pour 1,000 traces, plus $0.50 par GB sortant.

Pour un million de requêtes, activer la liste blanche d’équipe, la ZDR d’équipe et une trace par requête ajoute $250 plus les frais de sortie liés aux traces. La somme reste modeste face aux dépenses en modèles de nombreuses applications, mais « sans marge » ne signifie pas « tous les contrôles sont gratuits ».

La limite tient au contrôle du déploiement. Vercel exploite la passerelle : son data plane ne tourne pas dans votre cluster. Choisissez-la si ce périmètre managé est acceptable et si la vitesse opérationnelle prime. Préférez LiteLLM ou Bifrost lorsqu’un déploiement privé est une exigence, pas une simple préférence.

Les atouts
Ce qu'il fait bien
5 points

  • Aucune marge sur les tokens avec Free, Paid ou BYOK
  • Crédit Free de $5 par mois pour un pilote bien délimité
  • Ordre et filtrage des fournisseurs, fallbacks et accès managé aux modèles
  • Aucune passerelle ni base de données à exploiter
  • Des contrôles de fournisseur et de ZDR par requête peuvent éviter les surcoûts à l’échelle de l’équipe
Les limites
Là où il pèche
4 points

  • Aucun processus de passerelle auto-hébergé
  • BYOK nécessite l’achat de crédits
  • Les appels BYOK en échec peuvent basculer sur des identifiants Vercel facturables
  • Reporting, règles d’équipe et trace drains possèdent leurs propres compteurs

3. Portkey : le meilleur choix pour une gouvernance d’entreprise managée

Portkey est la meilleure option managée lorsque l’achat repose sur les règles, les guardrails, les budgets et les possibilités de déploiement privé. Sa passerelle combine API universelle, retries, timeouts, fallbacks, équilibrage de charge, cache, clés virtuelles et observabilité.

Offres tarifaires de la passerelle IA Portkey
Portkey

Idéal pour : les entreprises et ETI qui achètent une gouvernance managée
Point fort : une offre Production publique et une voie Enterprise vers l’hébergement en cloud privé ou VPC
Tarifs : Open Source auto-hébergé ; Developer à $0 ; Production à $49/month ; Enterprise sur devis
Essai gratuit : Developer reste gratuit pour toujours, pour les prototypes et l’évaluation

La page tarifaire est particulièrement claire sur la frontière entre les offres. Developer enregistre 10,000 logs par mois, les conserve trois jours, garde les métriques pendant 30 jours et est explicitement inadapté à la production. Production coûte $49 par mois, comprend 100,000 logs enregistrés, puis facture $9 pour chaque tranche supplémentaire de 100,000 jusqu’à trois millions ; les logs sont conservés 30 jours et les métriques 90 jours.

Avec un million de logs enregistrés, Production coûte $130 par mois : $49 de base, plus neuf tranches supplémentaires à $9. Le niveau reste accessible pour une application en croissance. La même page déconseille Production lorsque des contrôles de sécurité sur mesure ou des garanties de résidence des données sont nécessaires. Ces acheteurs passent à Enterprise, avec 10 millions de logs enregistrés ou plus, conservation personnalisée, SSO, budgets et limites granulaires, cloud privé, hébergement VPC, exports vers un data lake et conformité avancée.

La limite du produit ne réside pas dans ses capacités, mais dans l’ampleur du besoin. Une startup qui cherche seulement une URL de base et un fallback tire moins de valeur organisationnelle que Portkey n’est conçu pour en fournir. Une équipe plateforme responsable de plusieurs applications, d’une politique de modèles approuvés, de contrôles PII et d’exigences d’audit peut, elle, exploiter ces fonctions chaque semaine.

L’actionnariat mérite aussi une question lors de l’achat. Palo Alto Networks a finalisé l’acquisition de Portkey le 29 mai 2026 et indiqué que Portkey deviendrait une AI Gateway centrale de Prisma AIRS. Cela peut renforcer l’intégration sécurité et le support Enterprise, mais aussi faire évoluer le packaging et les priorités de roadmap. Demandez quel nom de produit figurera au contrat, comment les comptes autonomes seront rattachés à Prisma AIRS et quelle voie d’export subsisterait après une future consolidation.

Les atouts
Ce qu'il fait bien
5 points

  • Une voie Open Source, une offre Developer gratuite, une offre Production publique à $49 et une voie Enterprise privée
  • Fallbacks, retries, timeouts, équilibrage de charge, cache, clés et observabilité
  • Limites de logs et de conservation explicites dans les offres self-service
  • Options Enterprise de déploiement et de conformité
  • Exemple prévisible à $130 pour un million de logs enregistrés
Les limites
Là où il pèche
4 points

  • Developer n’est explicitement pas une offre de production
  • Production ne convient pas aux exigences de sécurité personnalisée ou aux garanties de résidence
  • Le tarif Enterprise exige un devis
  • L’intégration consécutive à l’acquisition soulève des questions de packaging et de roadmap

4. Cloudflare AI Gateway : le meilleur contrôle edge à petit prix

Cloudflare AI Gateway est le meilleur choix économique lorsque Cloudflare gère déjà l’edge, la sécurité ou le runtime Workers de l’application. Les fonctions essentielles d’analyse, de cache et de limitation de débit sont gratuites dans toutes les offres.

Documentation tarifaire de Cloudflare AI Gateway
Cloudflare AI Gateway

Idéal pour : les applications qui utilisent déjà le réseau et les contrôles de sécurité Cloudflare
Point fort : le cœur de la passerelle à $0, avec analyse DLP gratuite
Tarifs : fonctionnalités essentielles à $0 ; l’achat de crédits via Unified Billing ajoute 5% ; les guardrails suivent les tarifs Workers AI
Essai gratuit : les fonctions cœur restent gratuites, sans date d’expiration

La documentation tarifaire en ligne de Cloudflare fixe des limites de stockage concrètes à l’offre gratuite. Workers Free conserve 100,000 logs pour l’ensemble des passerelles du compte. Workers Paid en conserve 10 millions par passerelle. L’analyse DLP est gratuite, même si un compte sans abonnement Zero Trust ne reçoit que deux profils DLP prédéfinis. L’évaluation des guardrails est facturée séparément comme de l’inférence de tokens Workers AI.

Unified Billing prélève 5% lors de l’achat de crédits, tandis que les tarifs d’inférence tiers sont répercutés sans marge sur les tokens. Pour $20,000 de crédits achetés chaque mois, les frais atteignent $1,000. Ces 5% concernent les crédits acquis via Unified Billing, pas la passerelle cœur à $0.

Une limite de débit doit être repérée avant le lancement. La page actuelle des limites plafonne le trafic Unified Billing à 200 requêtes par tranche de 60 secondes et par passerelle, puis renvoie une erreur 429 au-delà. La limite ne s’applique pas au trafic BYOK. Cloudflare limite aussi les logs stockés à 500 par seconde et par passerelle, la taille des requêtes mises en cache à 25 MB, la durée de cache à un mois et les métadonnées personnalisées à cinq entrées par requête.

Le point de rupture est l’adéquation avec le reste de la plateforme. Cloudflare devient convaincant quand l’équipe maîtrise déjà son modèle de comptes, ses logs, la DLP, Workers et le comportement de l’edge. Il l’est moins s’il faut adopter tous ces concepts uniquement pour éviter un abonnement de passerelle à $49. La solution affichée comme la moins chère peut entraîner la facture d’intégration la plus élevée.

Les atouts
Ce qu'il fait bien
5 points

  • Analytics, cache et limitation de débit au cœur de l’offre à $0
  • Analyse DLP gratuite dans toutes les offres
  • Excellente intégration aux opérations edge et sécurité Cloudflare existantes
  • Volume de logs élevé dans l’offre payante
  • BYOK évite la limite de débit propre à Unified Billing
Les limites
Là où il pèche
4 points

  • Unified Billing ajoute 5% aux achats de crédits
  • Unified Billing est plafonné à 200 requêtes par tranche de 60 secondes et par passerelle
  • L’offre gratuite s’arrête à 100,000 logs sur l’ensemble du compte
  • Les guardrails et profils DLP étendus peuvent générer des coûts dans des produits adjacents

5. OpenRouter : la meilleure marketplace de modèles, mais pas la route unique la plus sûre

OpenRouter est le meilleur gateway LLM tant que le choix des modèles et des fournisseurs reste ouvert. Son offre Pay as you go réunit 400+ modèles auprès de 80+ fournisseurs derrière un compte unique.

Offres tarifaires et commissions de la passerelle OpenRouter
OpenRouter

Idéal pour : explorer rapidement les modèles, comparer les fournisseurs et accéder à un vaste catalogue
Point fort : routage fin des fournisseurs selon le prix, le débit, la latence, les règles et la disponibilité
Tarifs : Free à $0 ; Pay as you go avec 5.5% de frais de plateforme ; Enterprise sur devis avec remises
Essai gratuit : offre Free avec 25+ modèles, 4 fournisseurs et 50 requêtes par jour

La page tarifaire en ligne présente trois offres. Free donne accès à 25+ modèles gratuits de quatre fournisseurs, avec 50 requêtes quotidiennes. Pay as you go ajoute 400+ modèles, 80+ fournisseurs, des limites globales élevées et aucun minimum de dépense, contre 5.5% de frais de plateforme. Enterprise conserve le catalogue et ajoute des remises sur les frais, la facturation, SSO ou SAML, des SLA contractuels et un SLA de support avec un canal Slack partagé.

BYOK déplace la frontière tarifaire. Pay as you go inclut chaque mois $25,000 d’inférence au prix catalogue sans frais BYOK, puis prélève 5%. Enterprise porte cette franchise à $200,000, puis facture 5%. Un acheteur engagé directement auprès de fournisseurs doit modéliser cette franchise BYOK séparément des crédits OpenRouter achetés.

La profondeur du routage est le grand atout d’OpenRouter. Sa documentation sur la sélection des fournisseurs indique que le comportement par défaut écarte les fournisseurs ayant subi des indisponibilités significatives durant les 30 dernières secondes, puis favorise les fournisseurs stables et peu coûteux en pondérant selon l’inverse du carré du prix ; les autres servent de fallbacks. Les opérateurs peuvent à la place trier par prix, débit ou latence, imposer l’ordre de fournisseurs nommés, désactiver les fallbacks, exiger la prise en charge de paramètres, exclure les fournisseurs qui collectent des données, imposer des endpoints zero data retention ou plafonner le prix.

Ces contrôles peuvent améliorer à la fois la disponibilité et l’économie. Ils font aussi du comportement par défaut une partie du contrat de production. Si l’application dépend de sorties structurées ou d’outils, définissez require_parameters et une liste blanche au lieu de supposer que tous les endpoints d’un même slug de modèle se comportent de façon identique.

Pour $20,000 de crédits achetés, 5.5% représentent $1,100 par mois. Cela reste inférieur au coût mensuel indicatif de $1,200 pour l’auto-hébergement. Mais le pourcentage continue de croître alors que la charge d’exploitation d’une passerelle auto-hébergée stable peut se tasser : il faut donc refaire le calcul au-delà de $21,818 de dépenses mensuelles en modèles.

L’accord Stripe rapporté augmente le coût de la dépendance ; il ne justifie pas une migration précipitée. OpenRouter reste la marketplace la plus vaste de ce classement. La réponse raisonnable consiste à maintenir un adaptateur direct vers un fournisseur, à exporter les règles et à tester le contournement. Notre analyse complète des tarifs OpenRouter détaille les commissions et les limites du BYOK.

Les atouts
Ce qu'il fait bien
5 points

  • 400+ modèles et 80+ fournisseurs dans les offres payantes
  • Contrôles poussés sur l’ordre, le tri, les règles et les fallbacks des fournisseurs
  • Aucun minimum de dépense avec Pay as you go
  • Franchises BYOK utiles avant le début des frais de 5%
  • La voie la plus rapide pour garder l’exploration des modèles ouverte
Les limites
Là où il pèche
4 points

  • Les frais de 5.5% sur les crédits achetés augmentent directement avec les dépenses
  • Les 50 requêtes quotidiennes de l’offre Free ne suffisent pas à la production
  • Sans règles explicites, le comportement par défaut peut router vers plusieurs fournisseurs
  • Le changement d’actionnariat rapporté accroît le travail de préparation aux aléas fournisseur

6. Bifrost : la meilleure alternative OSS pour maîtriser précisément les retries

Bifrost est la meilleure alternative open source pour une équipe qui cherche un comportement de retry explicite, OpenTelemetry et une surface de passerelle plus compacte. L’offre OSS reste gratuite et se déploie avec Docker, Kubernetes ou sous forme de binaire Go.

Tarifs des offres OSS et Enterprise de la passerelle Bifrost
Bifrost

Idéal pour : les équipes plateforme qui veulent auto-héberger avec des mécanismes de résilience transparents
Point fort : comportement imbriqué des retries et fallbacks, avec historique de routage par requête
Tarifs : OSS à $0 ; Enterprise sur devis
Essai gratuit : 14 jours pour Enterprise

La page tarifaire de Bifrost inclut dans l’OSS une API unique compatible OpenAI pour 1,000+ modèles, des métriques et traces OTel, l’observabilité, des budgets et limites par clé virtuelle, le routage personnalisé, les fallbacks automatiques, le cache et une passerelle MCP. Enterprise ajoute les déploiements VPC, on-prem et air-gapped, le mode cluster, l’équilibrage de charge adaptatif, SAML et OIDC, les intégrations aux coffres-forts, les logs d’audit, RBAC et un support adossé à un SLA.

La documentation Bifrost sur les retries et fallbacks est particulièrement précise. Les erreurs réseau et réponses 5xx déclenchent un nouvel essai chez le même fournisseur. Une limite de débit ou un échec propre à une clé peut provoquer une rotation des identifiants. La requête ne passe au fallback suivant qu’après épuisement du budget de retries du fournisseur principal, puis chaque fallback reçoit à son tour son budget complet.

Cette clarté fait apparaître la limite : les tentatives peuvent se multiplier. Avec trois retries sur le fournisseur principal et deux fallbacks disposant chacun de trois retries, une requête peut produire jusqu’à 12 tentatives avant de renvoyer une erreur. Dans une application interactive, l’incident d’un fournisseur peut alors devenir un incident de latence doublé d’une facture plus élevée. Fixez un budget de latence total et faites en sorte que les erreurs de sécurité ou de conformité interrompent la chaîne plutôt que de la laisser continuer.

Bifrost affronte surtout LiteLLM. LiteLLM l’emporte par la familiarité de son écosystème et l’étendue de son plan de contrôle établi. Bifrost prend l’avantage lorsque son empreinte native Go, son historique de routage explicite ou sa sémantique de retry correspondent mieux au modèle d’exploitation de l’équipe plateforme. Les deux perdent leur intérêt si aucun responsable n’est financé pour exploiter le proxy.

Les atouts
Ce qu'il fait bien
5 points

  • Offre OSS à $0
  • Déploiement avec Docker, Kubernetes ou un binaire Go
  • OTel, budgets, limites, cache, routage et fallbacks inclus dans l’OSS
  • Sémantique précise pour les retries, la rotation des clés et les fallbacks
  • Déploiement privé et contrôles d’identité avec Enterprise
Les limites
Là où il pèche
4 points

  • L’acheteur assume la passerelle et son domaine de panne
  • Le tarif Enterprise est sur devis
  • Des budgets de retries imbriqués peuvent amplifier la latence et les dépenses
  • Écosystème plus restreint que celui de LiteLLM

7. Helicone : la meilleure passerelle centrée sur l’observabilité

Helicone est le meilleur choix quand le débogage des sessions et l’explication des dépenses comptent autant que le routage. La solution réunit une passerelle sans marge, l’observabilité, le cache, les limites de débit, les fallbacks automatiques, la gestion des prompts et la recherche dans les requêtes.

Tarifs et limites de la passerelle Helicone
Helicone

Idéal pour : les équipes dont le principal problème est de comprendre le comportement des modèles en production
Point fort : le trafic de la passerelle alimente directement un produit d’observabilité et de débogage
Tarifs : Hobby gratuit ; Pro à $79/month ; Team à $799/month ; Enterprise sur devis
Essai gratuit : 7 jours pour Pro et Team

La page tarifaire rend visibles les seuils de montée en gamme. Hobby comprend 10,000 requêtes, 1 GB de stockage, un siège, une organisation, sept jours de conservation et 10 logs par minute. Pro coûte $79 par mois et comprend un nombre illimité de sièges, une organisation, un mois de conservation, 1,000 logs par minute et 10 appels API par minute, avec une tarification à l’usage au-delà des volumes de requêtes et de stockage inclus.

Team coûte $799 par mois et passe à cinq organisations, trois mois de conservation, 15,000 logs par minute, 60 appels API par minute, une prise en charge SOC 2 et HIPAA et un canal Slack dédié. Enterprise est sur devis et ajoute un nombre illimité d’organisations, une conservation permanente, 30,000 logs par minute, 1,000 appels API par minute, SAML SSO, un déploiement on-prem et des conditions commerciales personnalisées.

La documentation de la plateforme décrit deux modes d’exploitation : des crédits répercutés sur 100+ modèles sans marge, ou BYOK pour les équipes qui conservent la facturation fournisseur. Dans les deux cas, l’observabilité reste disponible à l’échelle de la requête. C’est l’avantage de Helicone sur un proxy minimaliste : une interaction utilisateur en échec peut être retracée sur toute une session au lieu d’être réduite à un compteur d’erreurs fournisseur.

La limite de Hobby se voit immédiatement. Dix logs par minute suffisent pour examiner un prototype, mais pas pour de nombreuses applications en production. Avec 1,000 logs par minute, Pro constitue le premier seuil réaliste pour un trafic modéré. L’acheteur choisit à la fois une offre d’observabilité et une passerelle : il faut en comparer la valeur combinée, plutôt que de considérer le routage comme gratuit.

Les atouts
Ce qu'il fait bien
5 points

  • Crédits sans marge ou BYOK
  • Passerelle, fallbacks, cache, limites et observabilité dans un même système
  • Offres et plafonds d’ingestion publics
  • Sièges illimités à partir de Pro
  • Option Enterprise on-prem
Les limites
Là où il pèche
4 points

  • La limite d’ingestion de Hobby à 10 logs par minute est étroite
  • Pro et Team ajoutent des frais à l’usage au-delà des volumes inclus
  • Le tarif bondit de $79 à $799 par mois en passant de Pro à Team
  • L’étendue de l’observabilité peut dépasser les besoins d’une application simple

8. Braintrust Gateway : le meilleur choix quand les évaluations décident des releases

Braintrust Gateway est le meilleur choix lorsque les traces doivent alimenter évaluations, jeux de données, scores et contrôles de release. La passerelle prend en charge OpenAI, Anthropic, Google, AWS et d’autres fournisseurs dans une API unifiée, avec cache, observabilité et prise en charge multi-fournisseurs.

Documentation et quickstart de Braintrust Gateway
Braintrust Gateway

Idéal pour : les équipes produit IA dont les changements de routage sont encadrés par les résultats d’évaluation
Point fort : les traces de la passerelle alimentent directement une plateforme d’évaluation
Tarifs : Starter à $0 ; Pro à $249/month ; Enterprise sur devis ; Gateway hébergé gratuit pendant la bêta
Essai gratuit : Starter ne demande aucune carte bancaire ; Gateway reste gratuit pendant la bêta

La tarification de la plateforme Braintrust commence avec Starter à $0. L’offre inclut 1 GB de données traitées, puis $4 par GB ; 10,000 scores, puis $2.50 pour 1,000 ; 14 jours de conservation ; et un nombre illimité d’utilisateurs, projets, jeux de données, playgrounds et expériences. Pro coûte $249 par mois, avec 5 GB de données traitées, puis $3 par GB ; 50,000 scores, puis $1.50 pour 1,000 ; et 30 jours de conservation, les données conservées au-delà étant facturées $0.50 par GB et par mois. Enterprise est sur devis.

Le statut de la passerelle est différent. La documentation Gateway de Braintrust indique que l’endpoint hébergé est en bêta et gratuit, avec un tarif qui sera annoncé avant la disponibilité générale. L’endpoint global utilise un routage DNS fondé sur la latence et des health checks entre les régions hébergées. La journalisation peut enregistrer les traces de la passerelle dans le data plane configuré par l’organisation.

Cette intégration change le motif d’achat. Lorsqu’une équipe échantillonne les traces de production, attribue des scores aux réponses, constitue des jeux de régression et bloque les releases en cas de baisse de qualité, la passerelle supprime des étapes d’instrumentation et rattache les preuves au trafic. Si l’équipe ne cherche que des retries et des plafonds de dépense, la plateforme Pro à $249 se justifie difficilement face à une passerelle plus simple.

La limite tient au futur tarif et au statut bêta. Une bêta gratuite peut être conçue pour la production sans encore disposer d’un compteur commercial stable. Utilisez-la avec un contournement direct vers le fournisseur, fixez un plafond de prix interne avant la GA et ne laissez pas un prix provisoire de $0 dicter une architecture permanente.

Les atouts
Ce qu'il fait bien
5 points

  • Les traces de la passerelle alimentent évaluations, jeux de données, scores et workflows de release
  • Accès unifié aux principales familles de fournisseurs
  • Gateway hébergé gratuit pendant la bêta
  • Routage global par latence et health checks
  • Utilisateurs illimités dans les offres Starter et Pro de la plateforme
Les limites
Là où il pèche
4 points

  • Gateway hébergé toujours en bêta
  • La tarification de Gateway changera avant la disponibilité générale
  • Pro coûte $249 par mois avant les dépassements d’usage
  • Une plateforme trop riche pour les équipes qui veulent seulement du routage

9. Requesty : le meilleur plan de contrôle simple facturé au pourcentage

Requesty est la meilleure option managée facturée au pourcentage pour une petite équipe qui veut routage, cache, fallbacks, budgets et résidence des données dans l’UE sans abonnement. Pay as you go donne accès à 600+ modèles auprès de 20+ fournisseurs.

Comparatif des tarifs et offres de Requesty AI Gateway
Requesty

Idéal pour : les startups qui préfèrent des frais directement liés à leur consommation de modèles
Point fort : ni abonnement, ni frais par siège, ni minimum de dépense, ni facturation distincte des contrôles de routage essentiels
Tarifs : Free à $0 ; Pay as you go ajoute 5% ; Enterprise sur devis
Essai gratuit : offre Free avec 200 requêtes quotidiennes sur les modèles gratuits, sans carte bancaire

La page tarifaire accorde à Free 200 requêtes par jour sur les modèles gratuits, avec routage, cache, fallbacks, analyse des dépenses et résidence des données dans l’UE. Pay as you go prélève une marge de 5% sur le coût de base des modèles et comprend BYOK, règles de routage, cache, fallbacks, limites de dépense, MCP Gateway, observabilité avancée et support par e-mail. Enterprise ajoute SSO, RBAC, logs d’audit, règles sur les modèles approuvés, budgets d’équipe, guardrails, détection des PII, comptes de service, support dédié et SLA personnalisés.

Le pourcentage simplifie le budget initial. Pour $2,000 de dépenses en modèles, les frais sont de $100. À $20,000, ils atteignent $1,000. À $24,000, ils égalent le coût mensuel indicatif de l’auto-hébergement, soit $1,200. Une startup peut éviter un chantier plateforme tant que son trafic reste incertain, puis rouvrir le choix une fois l’usage stabilisé.

La limite vient précisément de cette simplicité. Les frais progressent avec les dépenses en modèles, même si le travail d’exploitation de la passerelle n’augmente pas. Une entreprise qui consomme beaucoup de tokens, dispose d’une équipe plateforme et possède déjà des contrats fournisseurs devrait comparer le devis Enterprise de Requesty ou un proxy auto-hébergé avant d’accepter 5% indéfiniment.

Requesty arrive derrière Helicone parce que son argument principal est un contrôle managé efficace, plutôt qu’un cycle différenciant de validation par les données de production. Il peut néanmoins être le meilleur achat lorsque l’absence d’abonnement et un pourcentage prévisible priment sur une évaluation plus poussée ou des règles d’entreprise.

Les atouts
Ce qu'il fait bien
5 points

  • Aucun abonnement, frais par siège ou minimum avec Pay as you go
  • 600+ modèles auprès de 20+ fournisseurs
  • Routage, cache, fallbacks, budgets, MCP et résidence dans l’UE
  • L’offre Free ne demande aucune carte bancaire
  • Une voie Enterprise pour l’identité, l’audit, les règles et les contrôles PII
Les limites
Là où il pèche
4 points

  • Les frais de 5% augmentent directement avec les dépenses en modèles
  • Le tarif Enterprise est sur devis
  • Le trafic Free se limite aux modèles gratuits et à 200 requêtes par jour
  • Moins intéressant dès qu’une équipe plateforme financée peut exploiter un proxy

10. Kong AI Gateway : le meilleur choix dans un environnement déjà équipé de Kong

Kong AI Gateway est le meilleur choix lorsque Kong gouverne déjà les API de l’entreprise et que le trafic IA doit hériter de ce modèle opérationnel. Plus comprend une API LLM universelle, jusqu’à cinq modèles distincts placés derrière un proxy, un trafic agent-à-agent illimité, un nombre illimité de proxies de serveurs MCP, la neutralisation des PII, des guardrails, le contrôle d’accès, des limites de débit par token, le cache sémantique et l’analyse des coûts.

Tarification de Kong Konnect et AI Gateway
Kong AI Gateway

Idéal pour : les entreprises qui exploitent déjà Kong Konnect ou Kong Gateway
Point fort : des règles IA au sein d’une plateforme plus large couvrant API, identité, portail et gouvernance des services
Tarifs : essai de 30 jours à $0 ; Plus facturé à l’usage ; Enterprise annuel sur devis
Essai gratuit : 30 jours sans carte bancaire ni limite sur les passerelles

La page tarifaire en ligne de Kong expose les compteurs de Plus. Un plan de contrôle Serverless coûte $25 par mois, Hybrid $200 et Dedicated Cloud $500 plus $0.15 par GB. Plus comprend un million de requêtes API, puis facture $200 par million supplémentaire jusqu’à un maximum mensuel de 10 millions de requêtes.

Le proxy des modèles IA coûte encore $100 par mois pour chaque modèle LLM distinct, dans la limite de cinq avec Plus. Une application à quatre modèles sur un plan de contrôle Serverless démarre donc à $425 par mois avant la facturation des tokens de modèles : $25 pour le plan de contrôle et $400 pour les quatre proxies de modèles. Les plugins IA payants sont des options distinctes dans Plus et sont inclus avec Enterprise.

Enterprise supprime les limites de passerelles et de modèles, permet d’auto-héberger entièrement les passerelles API et ajoute logs d’audit, SSO, support dédié, services professionnels et SLA supérieurs. Le tarif, personnalisé, est facturé annuellement.

La limite est le poids de la plateforme. Kong est cohérent lorsque gouvernance des API, plans de contrôle, identité, analytics, catalogue de services et support figurent déjà au budget. Pour une application multi-modèles créée de zéro, payer par plan de contrôle, modèle et requête ajoute des concepts avant même que le produit ait prouvé leur nécessité. Vercel, Cloudflare, Requesty ou un proxy OSS réduisent plus vite le périmètre de la décision.

Les atouts
Ce qu'il fait bien
5 points

  • S’intègre à un modèle Kong de contrôle et de support déjà en place
  • API LLM universelle avec règles, cache, guardrails et analyse des coûts
  • Déploiements serverless, hybride, cloud dédié et auto-hébergé avec Enterprise
  • Les compteurs publics de Plus permettent de chiffrer une configuration de base
  • Solide parcours Enterprise pour l’identité et l’audit
Les limites
Là où il pèche
4 points

  • $100 par modèle placé derrière un proxy avec Plus
  • L’exemple serverless à quatre modèles démarre à $425 avant l’inférence
  • Plus limite le proxy IA à cinq modèles et le trafic à 10 millions de requêtes
  • Surdimensionné et coûteux comme choix par défaut pour une nouvelle application

Quel gateway LLM choisir selon votre contexte ?

Partez de la contrainte qui empêcherait le lancement, puis comparez les frais. Un routage sophistiqué ne compense pas un mauvais périmètre de déploiement ; un tarif bas ne remplace ni les contrôles d’audit ni la capacité de rollback.

Choisissez Vercel AI Gateway pour une startup qui lance une application client avec un petit ensemble de modèles approuvés et sans exigence de déploiement privé. Cloudflare prend l’avantage si la couche edge et sécurité lui appartient déjà ; Requesty, si une commission d’usage de 5% est plus facile à financer qu’un abonnement de plateforme.

Choisissez LiteLLM pour un éditeur doté d’un responsable plateforme, de standards existants pour les conteneurs et les bases de données, et soit d’une contrainte forte sur le circuit des données, soit de dépenses mensuelles en modèles qui dépassent environ $22,000 à $24,000 selon l’hypothèse d’exploitation retenue. Bifrost devient préférable si sa sémantique de retry, son déploiement Go ou son approche centrée sur OTel correspond mieux à l’équipe.

Choisissez Portkey pour une ETI ou une entreprise qui a besoin d’identité managée, de guardrails, de budgets, de conservation, d’options de déploiement privé et de support. Kong prend l’avantage si l’entreprise l’utilise déjà comme plateforme API et si la consolidation du contrôle justifie son compteur par modèle.

Choisissez Helicone lorsque l’analyse des requêtes, le débogage des sessions et l’attribution des dépenses rythment le quotidien. Choisissez Braintrust Gateway lorsque ces mêmes traces doivent alimenter les évaluations et les contrôles de release. Le statut bêta de Braintrust rend indispensables le contournement direct et un plafond de prix interne.

Choisissez OpenRouter tant qu’une petite équipe technique compare de nombreux modèles ou a besoin de la profondeur d’une marketplace de fournisseurs. Conservez une route directe vers un fournisseur. Dès que l’application se stabilise sur un petit nombre de modèles approuvés, comparez les frais de 5.5% sur les crédits à l’absence de marge sur les tokens de Vercel, aux 5% de Requesty ou à un auto-hébergement financé.

Arbre de décision pour choisir une passerelle IA auto-hébergée, managée, gouvernée ou de type marketplace
Commencez par la responsabilité et la gouvernance, puis départagez les options par le routage et les frais

La condition de bascule est simple : changez de passerelle lorsque le coût actuel — ou la valeur du contrôle manquant — dépasse la charge de migration et d’exploitation de l’option suivante. Ne migrez pas parce qu’un concurrent affiche une liste de features plus longue. Migrez quand la passerelle actuelle ne respecte plus un budget de latence mesuré, un périmètre de déploiement, une exigence d’audit, un plafond de frais ou un objectif de sortie.

Les passerelles à éviter comme route de production unique

N’utilisez aucune passerelle comme seule route lorsque ses limites commerciales ou opérationnelles évoluent encore. Trois solutions nommées appellent cette prudence, pour des raisons différentes.

Évitez OpenRouter comme unique route de production pendant la transition d’actionnariat rapportée. Son catalogue et son routage restent excellents, et rien ne permet d’affirmer que ses conditions vont se dégrader. Le problème est la concentration : accès aux modèles, règles fournisseurs, crédits et comportement des fallbacks dépendent tous du même compte. Gardez une clé fournisseur directe et un adaptateur testé, indépendant d’OpenRouter.

Évitez Braintrust Gateway comme route unique tant que le produit reste en bêta. Braintrust présente la passerelle hébergée comme conçue pour la production, suit publiquement sa disponibilité et la propose gratuitement pendant la bêta. L’entreprise indique aussi que le tarif sera annoncé avant la disponibilité générale. Considérez $0 comme un prix pilote, fixez le seuil tarifaire qui déclencherait un départ et maintenez le contournement prêt.

Évitez Kong AI Gateway comme choix par défaut pour une nouvelle application si l’entreprise n’exploite pas déjà Kong. Quatre modèles derrière un proxy sur un plan de contrôle Serverless Plus démarrent à $425 par mois avant l’inférence, et l’acheteur hérite aussi des concepts de plan de contrôle et de programme API propres à Kong. Cela peut offrir une excellente consolidation à un client Kong existant et un poids de plateforme inutile à une nouvelle application.

Évitez également un simple passthrough développé en interne dès que plusieurs applications en dépendent. Un proxy d’URL de base est facile à créer. En revanche, streaming correct, normalisation des erreurs, paramètres propres aux fournisseurs, fallbacks, budgets, isolation des clés, logs et gestion des dépréciations de modèles forment un produit à maintenir. Ne le développez que si une règle singulière justifie cette responsabilité permanente.

Votre action de lundi : prouver que la passerelle est réversible

Ne commencez pas la semaine prochaine par une migration à l’échelle de l’entreprise. Prenez une seule route représentative de la production et démontrez la sortie en 10 minutes. Il faut obtenir une décision opérationnelle mesurée, pas seulement un diagramme d’architecture plus propre.

  1. Inventorier une route

    Choisissez un workflow destiné aux clients et consignez son fournisseur actuel, son modèle, sa méthode d’authentification, ses dépenses mensuelles, son objectif de latence p95, ses exigences de sortie structurée ou d’appel d’outils et sa politique de données. La route doit être assez représentative pour révéler les difficultés, mais assez limitée pour permettre un rollback.

  2. Placer la passerelle derrière un client interne

    N’insérez que l’adaptateur de passerelle dans le chemin des requêtes. Gardez les headers propres aux fournisseurs, les alias de modèles et la politique de fallback hors de la logique métier. Conservez l’ancienne configuration directe à côté de celle de la passerelle.

  3. Définir un modèle principal et un fallback compatible

    Ne commencez pas par un arbre de routage. Choisissez un fallback qui prend en charge le même protocole de réponse, les mêmes sorties structurées, les mêmes outils et le même périmètre de données. Appliquez un plafond de latence total à toute la chaîne de retries.

  4. Provoquer la panne

    Désactivez le modèle principal ou routez-le volontairement vers une mauvaise destination pendant une fenêtre contrôlée. Vérifiez quelles tentatives ont eu lieu, lesquelles ont été facturées, quel fournisseur a répondu, combien de temps la chaîne a pris et si l’application a reçu le schéma attendu.

  5. Exécuter la sortie en 10 minutes

    Contournez la passerelle par configuration et déploiement contrôlé. Si le service ne peut pas revenir à sa route fournisseur directe en moins de 10 minutes, consignez la dépendance bloquante et corrigez-la avant d’étendre le déploiement.

  6. Acheter le contrôle qui a réellement changé une décision

    N’adoptez la passerelle que si elle a récupéré des requêtes en échec, appliqué une règle, révélé l’origine des dépenses, respecté un périmètre de déploiement ou réduit un coût d’exploitation mesurable. Un dashboard que personne ne consulte n’est pas un résultat de production.

Pour la plupart des petites équipes produit, le pilote du lundi devrait utiliser Vercel AI Gateway, sans option payante tant qu’aucune exigence ne la justifie. Une équipe plateforme soumise à une frontière privée stricte devrait choisir LiteLLM et nommer le responsable avant d’y envoyer du trafic. Pour un projet de gouvernance d’entreprise, lancez achat et validation technique ensemble : conservation, identité, déploiement, support et conditions de sortie influencent tous l’architecture.

L’acquisition rapportée est le déclencheur de la réflexion, pas la décision. La vraie question est de savoir si le prochain changement de modèle, de fournisseur ou de passerelle se fera par une mise à jour de configuration contrôlée, plutôt que par une réécriture accompagnée d’une demande de budget urgente.

Questions fréquentes

Quel est le meilleur gateway LLM ?

LiteLLM est le meilleur choix global lorsqu’un responsable plateforme peut exploiter la passerelle et que l’entreprise privilégie la maîtrise du déploiement. Vercel AI Gateway est le meilleur choix managé par défaut. Portkey est plus adapté à la gouvernance d’entreprise managée ; OpenRouter, à l’exploration d’un vaste catalogue de modèles.

Quels sont les principaux exemples de passerelles IA ?

Les solutions actuelles comprennent LiteLLM, Vercel AI Gateway, Portkey, Cloudflare AI Gateway, OpenRouter, Bifrost, Helicone, Braintrust Gateway, Requesty et Kong AI Gateway. Elles couvrent les proxies auto-hébergés, les passerelles managées, les marketplaces de modèles, les plateformes centrées sur l’observabilité et les plateformes API d’entreprise.

Quelle est la meilleure passerelle IA open source ?

LiteLLM est le meilleur choix open source par défaut, car son offre à $0 réunit 100+ fournisseurs, clés virtuelles, budgets, limites de débit, fallbacks, logs et Prometheus. Bifrost devient préférable si un comportement de retry imbriqué explicite, un binaire Go ou son implémentation d’OpenTelemetry constitue le critère décisif.

Quelle passerelle IA choisir pour une startup ou une entreprise ?

Une startup devrait généralement commencer avec Vercel, Cloudflare ou Requesty afin de ne pas créer une mission de plateforme interne. Une entreprise doit choisir selon sa gouvernance et son périmètre de déploiement : Portkey pour les contrôles managés, LiteLLM ou Bifrost pour une infrastructure maîtrisée, et Kong si l’organisation y standardise déjà son trafic API.

Dernière mise à jour

3 sept. 2026

CatégorieBuild

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.