API intelligence artificielle : 8 solutions dès $0.019

Comparez 8 API d’IA parmi les moins chères, de DeepInfra à OpenAI, et choisissez le bon modèle selon le coût, la qualité, la latence et la confidentialité.

Thursday, September 3, 2026Omid Saffari
API intelligence artificielle : 8 solutions dès $0.019

DeepInfra affiche le prix catalogue le plus bas de ce comparatif d’API intelligence artificielle : Mistral Nemo coûte $0.019 par million de tokens en entrée et $0.03 par million de tokens en sortie. Mais pour la production à petit prix, DeepSeek V4 Flash constitue un meilleur choix par défaut à $0.14/$0.28, avec JSON, appels d’outils et fenêtre de contexte de 1M de tokens, tandis que Gemini 2.5 Flash-Lite s’impose pour un prototype gratuit. L’API réellement la moins chère est le premier niveau qui respecte les exigences minimales de qualité, de confidentialité et de latence de votre workload.

API intelligence artificielle : le verdict en bref

DeepSeek V4 Flash est la meilleure API IA abordable pour la plupart des traitements de texte en production. Son tarif standard reste assez bas pour que 10 millions de tokens en entrée et 2 millions en sortie reviennent à $1.96. Le même modèle prend en charge les sorties JSON, les appels d’outils, une Responses API et une fenêtre de contexte de 1M de tokens. Cet ensemble compte davantage que les derniers centimes économisés.

Il y a trois vainqueurs, car « la moins chère » ne désigne pas le même besoin :

  • DeepInfra remporte le prix brut au token. Mistral Nemo coûte $0.019 par million de tokens en entrée et $0.03 par million en sortie.
  • Google Gemini est le moins cher pour un prototype. Gemini 2.5 Flash-Lite propose un niveau gratuit, puis passe à $0.10 en entrée et $0.40 en sortie par million de tokens sur le niveau Standard payant.
  • DeepSeek est le moins cher comme choix par défaut performant en production. V4 Flash coûte $0.14 en entrée et $0.28 en sortie par million de tokens hors cache, avec les fonctions d’API dont la plupart des backends applicatifs ont besoin.

Tous les prix ci-dessous ont été vérifiés sur la page de tarification ou la documentation en ligne du fournisseur le 10 août 2026. Ils s’entendent par 1 million de tokens en entrée/sortie, sauf indication contraire dans la cellule.

OutilIdéal pourTarif de départEssai gratuit
DeepSeekChoix économique par défaut en production$0.14 / $0.28Aucun niveau permanent indiqué
Google GeminiPrototypes gratuits et entrées multimodalesGratuit ; payant $0.10 / $0.40Oui, niveau gratuit
DeepInfraPrix brut au token le plus bas$0.019 / $0.03Non, carte ou prépaiement obligatoire
GroqRéponses rapides et peu coûteuses$0.05 / $0.08Non précisé publiquement
MistralAPI directe de petits modèles$0.10 / $0.10Quelques endpoints gratuits seulement
SiliconFlowCatalogue multimodèle à bas coût$0.04 / $0.18$1 de crédits
OpenRouterUne seule clé et changement de modèle facileVariantes gratuites à $0 ; tarif selon le modèlePetit quota et variantes gratuites
OpenAIMigration vers un acteur établi$0.20 / $1.20Aucun niveau API permanent indiqué

Ce tableau n’est pas un classement qualitatif. Un modèle 3B à $0.10/$0.10 et un modèle de production actuel à $0.14/$0.28 sont deux produits différents, même s’ils acceptent tous deux une requête de chat completions. Pour une API LLM, le prix catalogue sert à présélectionner ; votre propre test d’acceptation désigne le vainqueur.

Combien coûtent 20,000 requêtes sur une API intelligence artificielle ?

Aux petits et moyens volumes, tous les fournisseurs présentés ici sont suffisamment abordables pour qu’une seule mauvaise décision de workflow coûte plus cher que la facture de tokens. Une charge normalisée reste néanmoins utile : elle révèle le prix élevé des sorties et les frais qu’un simple tarif d’entrée masque.

Prenons un produit qui effectue 20,000 appels par mois. Chaque appel contient 500 tokens en entrée et renvoie 100 tokens en sortie. Cela représente 10 millions de tokens en entrée et 2 millions en sortie :

Coût mensuel = 10 × prix d’entrée + 2 × prix de sortie.

RouteModèle économiqueCoût mensuelLimite à connaître
DeepInfraMistral Nemo$0.25Prix catalogue minimal, mais petit modèle plus ancien
GroqLlama 3.1 8B Instant$0.66La vitesse et le prix priment sur la profondeur
SiliconFlowGPT OSS 20B$0.76Le tarif bas repose sur un modèle open weight
OpenRouterDeepSeek V4 Flash Latest$1.304 plus frais sur les créditsUne seule facture, frais de 5.5% avec minimum de $0.80
Google GeminiGemini 2.5 Flash-Lite$1.80 Standard ; $0.90 Batch/FlexLe contenu du niveau gratuit peut améliorer les produits Google
DeepSeekDeepSeek V4 Flash$1.96Le fournisseur annonce une forte hausse de prix prochaine
MistralMistral Small 4$2.70Surface produit supérieure au niveau 3B, sortie plus chère
OpenAIGPT-5.6 Luna$4.40 Standard ; $2.20 Batch/FlexPratique, mais la sortie coûte six fois l’entrée
Échelle de coûts de quatre API IA : prix brut, vitesse, choix par défaut et acteur établi
Pour la même charge de 10M de tokens en entrée et 2M en sortie, le coût va de $0.25 à $4.40 avant les nouvelles tentatives liées à la qualité ou la validation humaine.

L’écart paraît immense en pourcentage et minuscule en valeur absolue. Pour cette charge, DeepSeek coûte $1.71 de plus que Mistral Nemo chez DeepInfra. OpenAI Luna coûte $2.44 de plus que DeepSeek. Si le modèle moins cher casse un schéma, manque une demande client ou crée une file de contrôles manuels, l’économie disparaît vite.

C’est le seuil de qualité : le comportement minimal que la tâche peut accepter sans travail compensatoire. Un endpoint de classification limité à cinq libellés a un seuil bas. Une réponse de support destinée au client et fondée sur les données de son compte place la barre bien plus haut. Un agent autorisé à modifier des enregistrements exige davantage encore, car une mauvaise action ne coûte pas seulement un nouvel appel d’API.

Le prix des sorties mérite une attention particulière. Un outil de synthèse peut lire un long document et produire un résultat court : l’entrée domine alors la facture. Un agent de code, un générateur d’e-mails commerciaux ou un assistant conversationnel peut générer beaucoup plus de sortie. Chez OpenAI Luna, le tarif de sortie de $1.20 vaut six fois celui d’entrée à $0.20 ; chez Mistral Small 4, la sortie à $0.60 vaut quatre fois l’entrée à $0.15. Un tarif identique en entrée et en sortie sur un modèle minuscule séduit pour les usages riches en génération, à condition que le modèle termine réellement la tâche.

1. DeepSeek : le meilleur choix économique pour la production

DeepSeek est le premier candidat à tester lorsqu’une application en production cherche un faible coût au token sans renoncer au JSON, aux outils ni au contexte long. V4 Flash 0731 coûte $0.14 par million de tokens en entrée hors cache et $0.28 par million en sortie. L’API annonce un contexte de 1M de tokens, une sortie maximale de 384K, le JSON, les appels d’outils, la Responses API et une route compatible Anthropic. Peu de modèles proches du bas de l’échelle tarifaire offrent une surface de production aussi large.

Page des modèles et des tarifs de l’API DeepSeek
DeepSeek

La limite tient à la stabilité du budget. La page de tarification de DeepSeek annonce une hausse globale prochaine, qui devrait être importante. Une startup peut profiter du coût normalisé actuel de $1.96, mais une équipe chargée des achats ne devrait pas inscrire ce montant dans une prévision annuelle sans marge ni seconde route.

Idéal pour : Extraction en production, génération structurée, agents économiques et traitements à contexte long
Point fort : Contexte de 1M, JSON, appels d’outils, Responses API et prise en charge de l’API Anthropic
Tarifs : $0.14 en entrée, $0.0028 en entrée depuis le cache et $0.28 en sortie par 1M de tokens pour V4 Flash
Essai gratuit : Aucun niveau gratuit permanent indiqué sur la page de tarification

Les atouts
Ce qu'il fait bien
4 points

  • $1.96 pour la charge normalisée de 10M de tokens en entrée et 2M en sortie
  • Contexte de 1M de tokens et jusqu’à 384K en sortie
  • Sorties JSON et appels d’outils dès ce niveau économique
  • Limite publiée de 2,500 requêtes simultanées pour V4 Flash
Les limites
Là où il pèche
3 points

  • Le fournisseur a déjà prévenu que les tarifs augmenteraient fortement
  • Aucun niveau gratuit permanent n’est publié
  • Une route externe bon marché exige tout de même une analyse de la confidentialité, de la fiabilité et des régions pour le cas d’usage de l’acheteur

Pourquoi DeepSeek arrive en tête

DeepSeek l’emporte lorsqu’un modèle économique doit faire davantage qu’étiqueter du texte. Prenons un SaaS B2B qui extrait de contrats téléversés la date de renouvellement, la valeur du contrat, le délai de préavis et les risques nommés. La sortie peut être validée contre un schéma, mais le modèle doit conserver assez de contexte pour lire un long document et suivre suffisamment bien les consignes pour renvoyer tous les champs requis. V4 Flash réunit le coût et la surface d’API qu’il faut pour une première évaluation.

Le tarif des lectures depuis le cache est particulièrement bas : $0.0028 par million de tokens en entrée. C’est utile lorsque les mêmes instructions stables ou le même préfixe de référence reviennent. Cela ne ramène pas chaque token d’entrée à $0.0028 : seuls les hits de cache bénéficient de ce tarif. Tant que les données d’usage n’ont pas établi le taux de hit, budgétez les misses à $0.14.

Évaluer DeepSeek en une semaine

  1. Choisir une tâche bien délimitée

    Commencez par l’extraction, la classification, la synthèse ou une action d’agent en lecture seule. Définissez les champs, les sorties autorisées et les conditions d’échec avant d’envoyer du trafic.

  2. Constituer un jeu d’évaluation de 100 requêtes

    Utilisez des requêtes représentatives et nettoyées issues du workload. Incluez des entrées courtes, longues, ambiguës, mal formées et des cas limites afin que la route la moins chère ne gagne pas uniquement sur des exemples faciles.

  3. Exiger une sortie vérifiable par une machine

    Utilisez une sortie JSON lorsque la tâche possède un schéma. Pour chaque appel, consignez le taux de schémas valides, le taux de réponses acceptées, la latence, les tokens d’entrée et de sortie ainsi que les hits de cache.

  4. Conserver le modèle actuel en fallback

    Envoyez les échecs de validation, les cas peu fiables et toute action aux conséquences importantes vers la route de confiance existante. Le premier déploiement doit rester réversible.

  5. Créer une alerte de changement de prix

    DeepSeek a annoncé une hausse de prix. Recalculez la charge normalisée lorsque le fournisseur publiera son nouveau tarif, sans laisser un prix temporaire devenir une hypothèse d’architecture.

Retenez DeepSeek si V4 Flash réussit la tâche et si l’organisation peut absorber une évolution tarifaire. Écartez-le si un prix unitaire annuel fixe, une région de traitement précise ou une relation fournisseur déjà établie pèse davantage que l’écart de tokens.

2. Google Gemini : la meilleure API IA gratuite

Google Gemini est la meilleure route gratuite pour prototyper avec des données nettoyées. Gemini 2.5 Flash-Lite fournit gratuitement les tokens d’entrée et de sortie sur le niveau Free. Une fois l’application passée au niveau Paid, le tarif Standard atteint $0.10 par million de tokens texte, image ou vidéo en entrée et $0.40 par million en sortie ; Batch et Flex divisent ces montants par deux, à $0.05/$0.20.

Page de tarification de l’API Google Gemini Developer
Google Gemini

Le niveau gratuit a une conséquence sur la confidentialité qui doit peser dans la décision, pas rester en note de bas de page. La page de tarification de Google indique que le contenu du niveau Free sert à améliorer ses produits, contrairement au contenu du niveau Paid. Le gratuit convient aux prompts synthétiques, aux documents publics et au jeu de tests d’un développeur ; ce n’est pas le choix par défaut pour des dossiers clients, des documents confidentiels ou du code inédit.

Idéal pour : Prototypes gratuits, entrées multimodales, traitements batch et workflows documentaires sensibles au coût
Point fort : Entrées et sorties gratuites, puis entrées texte, image, vidéo et audio sur l’offre payante
Tarifs : Niveau Free ; Paid Standard à $0.10 pour les entrées texte/image/vidéo et $0.40 en sortie ; Batch/Flex à $0.05/$0.20
Essai gratuit : Oui, un niveau Free avec un accès limité aux modèles

Les atouts
Ce qu'il fait bien
4 points

  • Tokens d’entrée et de sortie gratuits sur le niveau Free
  • $1.80 pour la charge normalisée sur Paid Standard
  • $0.90 pour la même charge asynchrone via Batch ou Flex
  • Le niveau Paid inclut la mise en cache du contexte et n’utilise pas le contenu pour améliorer les produits Google
Les limites
Là où il pèche
3 points

  • Le contenu du niveau Free sert à améliorer les produits Google
  • L’accès gratuit est limité selon le modèle et le quota
  • L’entrée audio coûte $0.30 par million de tokens en Standard, soit trois fois l’entrée texte/image/vidéo

Passer du gratuit au payant

Pour valider une fonction d’étiquetage de documents, un fondateur peut utiliser le niveau Free avec des documents publics ou générés, vérifier le format des réponses et mesurer le profil de tokens avant d’activer la facturation. Dès que des documents clients entrent dans le flux, le passage à Paid ne relève pas seulement du volume. Il modifie la règle d’utilisation du contenu et donne accès à des limites de production supérieures, à la mise en cache du contexte et à Batch.

Sur la charge normalisée, Paid Standard coûte $1.80 ; Batch ou Flex, $0.90. Gemini revient donc moins cher que DeepSeek pour une tâche asynchrone selon le prix catalogue, même si le bon choix reste le modèle qui franchit le seuil de qualité. Lorsque le résultat n’a pas besoin d’être immédiat, la réduction de 50% mérite d’être testée avant tout changement de fournisseur.

Gemini accepte aussi les images et la vidéo au même tarif Standard de $0.10 en entrée que le texte pour 2.5 Flash-Lite. Il devient ainsi plus intéressant que les petits modèles uniquement textuels lorsqu’un workflow lit des reçus, des captures d’écran ou des visuels produits. La page de tarification présente Flash-Lite comme le modèle Google le plus petit et le plus rentable à grande échelle : c’est le bon point de départ avant de passer à un modèle Gemini plus grand.

Choisissez Gemini si le projet demande un démarrage gratuit, une entrée multimodale ou un traitement asynchrone à moitié prix. Évitez le niveau Free avec des données sensibles, et Flash-Lite si le test d’acceptation montre qu’un modèle plus grand est indispensable.

3. DeepInfra : le prix brut au token le plus bas

DeepInfra remporte le prix brut avec Mistral Nemo Instruct à $0.019 en entrée et $0.03 en sortie par million de tokens. La charge normalisée de 20,000 requêtes coûte $0.25. DeepInfra affiche aussi Meta Llama 3.1 8B à $0.02/$0.04 et DeepSeek V4 Flash à $0.09/$0.18 : il est donc possible de monter dans la gamme de modèles du même hébergeur sans ouvrir un autre compte de facturation.

Page de tarification des modèles de génération de texte DeepInfra
DeepInfra

La limite vient du modèle derrière le prix. Mistral Nemo et Llama 3.1 8B sont bon marché parce qu’il s’agit de petits modèles ouverts plus anciens. Une tâche d’étiquetage rigide n’a peut-être besoin de rien de plus. Un workflow visible par le client ne doit toutefois pas hériter de leur bas prix avant qu’une évaluation dédiée n’ait validé la qualité des sorties.

Idéal pour : Classification à grand volume et faible risque, tagging, extraction légère et tests de prix entre modèles
Point fort : Le tarif publié le plus bas de ce comparatif pour la génération de texte
Tarifs : Mistral Nemo à $0.019 en entrée/$0.03 en sortie ; Llama 3.1 8B à $0.02/$0.04
Essai gratuit : Non ; DeepInfra exige une carte ou un prépaiement

Les atouts
Ce qu'il fait bien
4 points

  • $0.25 pour la charge normalisée avec Mistral Nemo
  • Vaste catalogue couvrant modèles de texte, embeddings, image, audio et vidéo
  • Planification Standard, Priority et Flex à moindre coût
  • Mise à l’échelle automatique avec une limite publiée de 200 requêtes simultanées par compte
Les limites
Là où il pèche
3 points

  • Le tarif minimal achète un petit modèle, pas un choix universel pour la production
  • Carte ou prépaiement obligatoire
  • Flex peut être plus lent et parfois indisponible

Quand DeepInfra convient à un espace de réponses étroit

Une marketplace de services locaux qui classe les messages entrants en quote, reschedule, cancel, billing ou other travaille avec un espace de réponses restreint. Elle peut rejeter toute valeur située hors de ces cinq choix et envoyer les cas ambigus vers un fallback. C’est précisément le type de tâche sur lequel un modèle à $0.019/$0.03 mérite d’être évalué.

Un assistant de support qui répond à des questions propres à un compte est un tout autre cas. Il doit récupérer le bon dossier, appliquer la politique, préserver les nuances et éviter une réponse fausse formulée avec assurance. Économiser $1.71 face à DeepSeek sur la charge normalisée ne justifie pas de confier ce travail à Mistral Nemo sans un résultat d’acceptation plus solide.

Les niveaux de service de DeepInfra offrent un autre levier. Standard correspond au tarif de base 1×. Priority coûte 1.5× pour accélérer la planification aux heures de pointe. Flex passe à 0.8× en contrepartie de réponses plus lentes et d’une indisponibilité ponctuelle. Réservez Flex aux backfills, à l’enrichissement hors ligne ou à une file nocturne autorisant les nouvelles tentatives. Ne lui confiez pas une réponse client interactive pour rogner 20% sur une facture déjà comptée en centimes.

Retenez DeepInfra lorsqu’une tâche étroite et un validateur robuste rendent reproductibles les économies d’un petit modèle. Évitez le premier prix pour la rédaction ouverte, le raisonnement complexe et toute action susceptible de modifier les données d’un client ou de l’entreprise.

4. Groq : petit prix et faible latence

Groq est le choix économique pour les usages interactifs qui doivent sembler instantanés. Sa route de production Llama 3.1 8B Instant est annoncée à environ 560 tokens par seconde, $0.05 par million de tokens en entrée et $0.08 par million en sortie. La charge normalisée coûte $0.66, soit seulement $0.41 de plus que le vainqueur au prix brut chez DeepInfra.

Tableau des modèles Groq avec vitesse, prix et contexte
Groq

Le compromis porte sur la profondeur du modèle et la stabilité du catalogue. La route la moins chère repose sur un modèle 8B. Groq distingue les modèles prêts pour la production et prévient que les modèles en preview peuvent disparaître rapidement : le prix d’une ligne preview ne constitue donc pas un engagement de production.

Idéal pour : Classification à faible latence, autocomplétion, interfaces conversationnelles et routage rapide de premier niveau
Point fort : Environ 560 tokens de sortie par seconde sur le modèle de production le moins cher
Tarifs : Llama 3.1 8B Instant à $0.05 en entrée/$0.08 en sortie ; GPT OSS 20B à $0.075/$0.30
Essai gratuit : Les pages de documentation consultées ne précisent pas publiquement les conditions d’essai

Les atouts
Ce qu'il fait bien
4 points

  • $0.66 pour la charge normalisée avec Llama 3.1 8B
  • Environ 560 tokens par seconde sur Llama 3.1 8B
  • URL de base compatible OpenAI et format d’API familier
  • Séparation explicite entre modèles de production et modèles en preview
Les limites
Là où il pèche
3 points

  • L’option de production la moins chère n’est qu’un modèle 8B
  • Les limites de débit propres au compte doivent être consultées dans le dashboard
  • La disponibilité des modèles en preview peut changer rapidement

La latence fait partie du coût produit

Dans un produit vocal ou un live chat, le délai se paie en tours abandonnés et en interactions maladroites, même lorsque la facture d’API reste basse. Groq est crédible si le modèle est suffisamment bon et si la vitesse constitue la contrainte principale. Un routeur d’intentions court qui décide du workflow chargé d’un message convient mieux qu’une réponse de support soumise à de nombreuses règles.

La page des modèles indique une fenêtre de contexte de 131,072 tokens pour Llama 3.1 8B, mais capacité de contexte ne signifie pas qualité du contexte. Accepter un long prompt ne garantit pas que le modèle exploitera correctement chaque détail pertinent. Le premier workload confié à Groq doit rester court, délimité et vérifiable par une machine.

La route GPT OSS 20B de Groq permet de monter en taille avec environ 1,000 tokens par seconde et un tarif de $0.075/$0.30. Son coût normalisé atteint $1.35, toujours inférieur aux $1.96 de DeepSeek, mais le même jeu d’évaluation doit trancher. Un chiffre plus bas ne prouve ni une meilleure compréhension des consignes, ni de meilleurs outils, ni une meilleure adéquation au métier.

Choisissez Groq lorsque l’utilisateur ressent le temps de réponse et qu’un petit modèle de production réussit la tâche. Écartez-le si le workload réclame un raisonnement premium ou dépend d’un modèle en preview sans statut de production stable.

5. Mistral : le laboratoire direct le moins cher pour les petits modèles

Mistral offre la gamme directe la plus lisible parmi les petits modèles. Ministral 3B commence à $0.10 en entrée et $0.10 en sortie par million de tokens, le modèle 8B à $0.15/$0.15 et le 14B à $0.20/$0.20. Mistral Small 4 coûte $0.15/$0.60 et ajoute une surface produit plus large pour le texte, les agents et le multimodal.

Page de tarification des modèles de l’API Mistral
Mistral

Le premier prix du modèle 3B n’en fait pas le choix par défaut pour un usage client ouvert. Il convient aux tâches où un modèle minuscule a un avantage : classification, pré-routage de modération ou transformation de champs sous contraintes. Mistral Small 4 paraît plus crédible pour une application généraliste et porte le coût normalisé à $2.70.

Idéal pour : Accès direct à de petits modèles, préférence pour le fournisseur direct, transformations batch et prompts répétés mis en cache
Point fort : Tarif d’entrée uniforme à $0.10/$0.10, réduction Batch de 50% et remise de 90% sur les entrées en cache
Tarifs : Ministral 3B à $0.10/$0.10 ; Mistral Small 4 à $0.15/$0.60
Essai gratuit : Aucun niveau gratuit général de production n’est indiqué pour les principaux modèles de texte ; quelques endpoints Labs ou de modération sont gratuits

Les atouts
Ce qu'il fait bien
4 points

  • Tarification directe et simple du même fournisseur pour les niveaux 3B, 8B, 14B et Small
  • Remise batch de 50% pour les traitements asynchrones à grand volume
  • Remise de 90% sur les entrées en cache pour les préfixes stables et répétés
  • Mistral Small 4 prend en charge le texte, les usages agentiques et le multimodal
Les limites
Là où il pèche
3 points

  • Le tarif d’appel de $0.10/$0.10 correspond à un modèle 3B
  • La sortie de Mistral Small 4 coûte quatre fois le prix de son entrée
  • Aucun vaste niveau gratuit de production n’est indiqué pour les principaux modèles de texte

Quand la gamme Mistral devient rentable

Imaginons une plateforme e-commerce qui génère chaque nuit des tags de catalogue à partir de titres, d’attributs et de descriptions. Le traitement est asynchrone, chaque article suit un schéma stable et un humain peut examiner un échantillon d’erreurs avant la prochaine mise à jour du catalogue. Ce workflow peut démarrer sur Ministral 3B ou 8B, profiter de Batch à -50% et placer les consignes stables de taxonomie derrière un préfixe mis en cache.

L’économie change pour un assistant conversationnel. Sur la charge normalisée, Ministral 3B coûte $1.20 contre $2.70 pour Mistral Small 4. L’écart de $1.50 donne accès à un modèle plus grand, positionné sur un éventail d’usages plus large. Si Small 4 réduit les fallbacks et les contrôles, le système peut revenir moins cher malgré une ligne de tokens plus élevée.

Retenez Mistral si l’accès direct à un laboratoire de modèles ou une gamme de petits modèles compte. Ignorez le tarif d’appel du 3B pour une tâche ouverte tant que l’évaluation n’a pas prouvé qu’il restait au-dessus du seuil de qualité.

6. SiliconFlow : le nouveau catalogue multimodèle à bas coût

SiliconFlow est l’hébergeur multimodèle le moins cher de cette sélection dès qu’il faut dépasser une route 8B. Son GPT OSS 20B coûte $0.04 par million de tokens en entrée et $0.18 par million en sortie, avec une fenêtre de contexte de 131K. La charge normalisée revient ainsi à $0.76, et les nouveaux comptes reçoivent $1 de crédits.

Page de tarification des modèles serverless de SiliconFlow
SiliconFlow

Le nom du modèle est ici essentiel. GPT OSS 20B est un modèle open weight de 20B, pas un accès direct à la famille GPT-5.6 d’OpenAI. SiliconFlow affiche également DeepSeek V4 Flash à $0.13 en entrée, $0.028 pour les entrées en cache et $0.28 en sortie. Le catalogue permet donc de passer à une route plus robuste sans quitter le compte.

Idéal pour : Développeurs attentifs aux coûts qui veulent plusieurs modèles ouverts derrière un même compte fournisseur
Point fort : GPT OSS 20B à $0.04/$0.18 avec $1 de crédits au démarrage
Tarifs : GPT OSS 20B à $0.04 en entrée/$0.18 en sortie ; DeepSeek V4 Flash à $0.13/$0.28
Essai gratuit : $1 de crédits gratuits, sans engagement minimal

Les atouts
Ce qu'il fait bien
4 points

  • $0.76 pour la charge normalisée avec GPT OSS 20B
  • Au prix catalogue, le crédit de $1 couvre plus que cette charge de test normalisée
  • Aucun engagement minimal sur la page publique de tarification
  • Routes économiques vers DeepSeek, Qwen, MiniMax, GPT OSS et d’autres modèles ouverts
Les limites
Là où il pèche
3 points

  • Les tarifs les plus bas concernent des modèles à poids ouverts, pas des API propriétaires de pointe
  • Le choix du modèle laisse toujours à l’acheteur la responsabilité de l’évaluation qualitative
  • Un hébergeur multimodèle plus récent peut exiger un examen supplémentaire côté achats et fiabilité

Ce que permet le budget d’évaluation de $1

Le crédit de départ de SiliconFlow est particulièrement concret. La charge normalisée de GPT OSS 20B coûte $0.76 : $1 suffit donc à couvrir une exécution complète de ce test tarifaire avant les nouvelles tentatives ou l’usage d’autres modèles. Cela ne correspond pas à un mois de production gratuit. Cela permet de mesurer le format des sorties, la latence et le décompte des tokens sans précharger un solde plus important.

Pour une file de synthèses back-office, commencez avec GPT OSS 20B et envoyez les échecs ou les cas peu fiables vers DeepSeek V4 Flash sur la même plateforme. Les tarifs rendent cette montée en gamme lisible : $0.04/$0.18 pour la route économique, puis $0.13/$0.28 pour DeepSeek. L’application doit malgré tout journaliser le modèle qui a répondu, car une facture agrégée sans données d’acceptation par modèle ne permet pas de savoir si le niveau le moins cher est réellement utile.

Choisissez SiliconFlow si un hébergeur à bas coût et un large catalogue de modèles ouverts simplifient l’évaluation. Écartez-le si l’acheteur exige un contrat direct avec le créateur du modèle ou dispose déjà d’une passerelle proposant les mêmes modèles à un coût total acceptable.

7. OpenRouter : la solution la moins chère pour changer souvent de modèle

OpenRouter est la meilleure passerelle économique lorsque la souplesse de changer de modèle justifie de petits frais de facturation. La plateforme répercute les prix d’inférence des fournisseurs sans marge, donne accès à des variantes gratuites et regroupe de nombreux fournisseurs derrière une seule clé d’API. DeepSeek V4 Flash Latest est affiché à $0.08 en entrée et $0.252 en sortie par million de tokens, soit $1.304 pour la charge normalisée avant les frais d’achat de crédits.

Catalogue OpenRouter affichant les prix par token en temps réel
OpenRouter

La limite vient du financement des crédits. OpenRouter facture 5.5% avec un minimum de $0.80 à chaque achat de crédits. Ce minimum cesse de s’appliquer autour de $14.55, puisque $0.80 divisé par 5.5% donne $14.5455. L’achat de $10 de crédits entraîne donc $0.80 de frais, soit 8%, et non 5.5%.

Idéal pour : Comparer des modèles, garder des routes de fallback et changer de fournisseur sans réécrire l’application
Point fort : Prix des fournisseurs répercutés sans marge sur l’inférence
Tarifs : Variantes gratuites à $0 ; modèles payants à prix variables ; DeepSeek V4 Flash Latest à $0.08/$0.252 avant les frais sur les crédits
Essai gratuit : Petit quota pour les nouveaux utilisateurs et variantes gratuites soumises à de faibles limites quotidiennes

Les atouts
Ce qu'il fait bien
4 points

  • Une seule clé d’API pour de nombreux fournisseurs et modèles
  • Aucune marge sur le tarif d’inférence sous-jacent
  • Variantes gratuites pour l’évaluation
  • Les 1M premières requêtes BYOK de chaque mois sont gratuites
Les limites
Là où il pèche
4 points

  • L’achat de crédits coûte 5.5% avec un minimum de $0.80
  • Les variantes gratuites sont limitées à 50 requêtes par jour avant un achat cumulé de $10 de crédits, puis à 1,000 par jour
  • Les crédits payants expirent après un an s’ils restent inutilisés
  • Le plan de fiabilité doit couvrir les pannes de la passerelle comme celles du fournisseur en amont

Quand les frais de passerelle sont rentabilisés

Un développeur qui veut essayer DeepSeek, Gemini et un modèle ouvert peut consacrer davantage de temps d’ingénierie à multiplier l’authentification, la facturation, les politiques de retry et les formats de réponse qu’à l’inférence elle-même. Avec OpenRouter, le changement devient un simple réglage de routage. Les frais restent raisonnables si cette commodité maintient un fallback disponible ou permet à l’équipe de remplacer rapidement une route insuffisante.

Les petites recharges faussent l’économie. À $10, le minimum de $0.80 représente 8% de frais. À $100, 5.5% vaut $5.50 et le pourcentage annoncé s’applique réellement. Pour un petit prototype, il faut soit accepter ce minimum comme prix de la commodité, soit utiliser le niveau gratuit direct d’un fournisseur. Ne comparez pas le tarif modèle d’OpenRouter au tarif direct en oubliant les frais sur les crédits.

La route BYOK suit une autre règle. Chaque mois, le premier 1M de requêtes effectuées avec vos propres clés fournisseur est gratuit ; au-delà, OpenRouter facture 5% de ce que la combinaison modèle/fournisseur aurait coûté sur OpenRouter. BYOK peut conserver les limites directes du fournisseur tout en centralisant le routage, mais impose toujours de surveiller deux surfaces de facturation et de panne.

Retenez OpenRouter si une intégration unique et des changements rapides valent les frais. Préférez l’accès direct si le produit utilise un fournisseur stable, que son API répond déjà aux exigences de disponibilité et qu’une passerelle supplémentaire n’apporte aucun bénéfice opérationnel.

8. OpenAI : la migration la moins risquée vers une API reconnue

OpenAI ne remporte pas le prix au token, mais GPT-5.6 Luna peut être la route économique la moins risquée pour un produit déjà construit autour d’OpenAI. Luna coûte $0.20 par million de tokens en entrée avec contexte court, $0.02 pour les entrées en cache et $1.20 en sortie sur Standard. Batch et Flex divisent les tarifs d’entrée et de sortie par deux, à $0.10/$0.60, ce qui ramène la charge normalisée de $4.40 à $2.20.

Tableau des tarifs de l’API OpenAI pour GPT-5.6 Luna
OpenAI

Une migration a un coût même s’il n’apparaît jamais sur la facture de l’API. Les schémas, prompts, règles de modération, outils, traces, comportements de fallback et évaluations de workload déjà en place peuvent rendre négligeable un écart mensuel de $2.44 sur les tokens. Si la route OpenAI actuelle d’un produit réussit ses contrôles, il faut d’abord évaluer Luna, le cache et Batch/Flex avant de remplacer le fournisseur.

Idéal pour : Produits OpenAI existants, outillage développeur grand public, prompts stables mis en cache et tâches batch asynchrones
Point fort : GPT-5.6 Luna associe un modèle OpenAI économique actuel à des tarifs Batch/Flex réduits de 50%
Tarifs : Standard à $0.20 en entrée/$0.02 en cache/$1.20 en sortie ; Batch/Flex à $0.10/$0.01/$0.60
Essai gratuit : Aucun niveau API gratuit permanent indiqué

Les atouts
Ce qu'il fait bien
4 points

  • Coût normalisé de $2.20 via Batch ou Flex
  • L’entrée en cache coûte dix fois moins que l’entrée standard
  • Une application OpenAI existante peut tester un modèle moins cher sans changer de fournisseur
  • Tarifs distincts et explicites pour Standard, Batch, Flex et les contextes longs
Les limites
Là où il pèche
4 points

  • Sur Standard, la sortie coûte six fois l’entrée
  • À $4.40, le coût normalisé Standard est le plus élevé des routes classées ici
  • Le traitement régional éligible entraîne une majoration de 10%
  • Avec un contexte long, Luna passe aux tarifs supérieurs de $0.40 en entrée et $1.80 en sortie

Optimiser chez OpenAI avant de migrer

Le guide de routage GPT-5.6 détaille les cas d’usage de Luna, Terra et Sol. Pour cette décision de coût, le premier geste est plus simple : confiez à Luna les tâches courtes et répétables, mettez en cache les préfixes stables, envoyez les traitements non urgents dans Batch ou Flex et gardez le modèle actuel plus puissant en fallback.

Pour 10 millions de tokens en entrée et 2 millions en sortie, Luna Standard coûte $4.40. Batch ou Flex revient à $2.20. DeepSeek V4 Flash coûte $1.96. Sur la charge normalisée, l’écart entre OpenAI optimisé et DeepSeek en direct n’est que de $0.24. Il est trop faible pour justifier à lui seul une migration de fournisseur.

Les réglages de contexte long et de région peuvent changer le résultat. Sur un contexte long en Standard, Luna coûte $0.40 en entrée et $1.80 en sortie ; le traitement régional éligible ajoute 10%. Appliquez le tarif correspondant à la requête et au mode de traitement choisi, au lieu d’étendre le prix d’appel du contexte court à chaque token.

Choisissez OpenAI si le produit y fonctionne déjà, si une relation directe avec un acteur établi compte ou si Batch/Flex résorbe l’essentiel de l’écart de prix. Pour les tâches hors ligne réessayables éligibles aux routes à moitié prix, évitez Standard.

Quelle API IA choisir selon votre usage ?

Commencez par les conséquences du workload, puis chiffrez le modèle le moins cher qui les maîtrise. Cette règle unique évite la plupart des fausses économies.

Arbre de décision reliant tests gratuits, production à faible risque et workloads grand public à Gemini, DeepSeek et OpenAI
Les conséquences du workload déterminent le premier niveau de prix qu’il est prudent d’évaluer.

Pour un prototype gratuit sur des données nettoyées, choisissez Gemini 2.5 Flash-Lite. C’est le démarrage à zéro dollar le plus simple, avec un passage clair vers Paid Standard à $0.10/$0.40. N’envoyez aucune donnée client ou confidentielle sur Free, car ses règles d’utilisation du contenu diffèrent de celles de Paid.

Pour une production live à faible risque, commencez par DeepSeek V4 Flash. JSON, appels d’outils, contexte de 1M et coût normalisé de $1.96 en font le meilleur candidat général. Prévoyez une marge tarifaire et un fallback, puisque le fournisseur a annoncé une hausse prochaine.

Pour un classifieur étroit à grand volume, évaluez d’abord DeepInfra. Le coût normalisé de $0.25 n’a de valeur que si les sorties autorisées sont contraintes et les échecs faciles à détecter. Montez immédiatement en gamme dès que la tâche devient ouverte.

Lorsque la latence se voit, évaluez Groq. La route Llama 3.1 8B à 560 tokens par seconde peut rendre une interface réactive pour $0.05/$0.08. Utilisez-la comme voie rapide avec un fallback plus profond, pas comme remplacement automatique de tous les modèles.

Pour les files hors ligne, comparez Gemini Batch/Flex, Mistral Batch et OpenAI Batch/Flex. Chacun annonce une réduction de 50%. Le bon fournisseur est celui dont le modèle réussit le test d’acceptation de la file, et non celui qui affiche le tarif Standard non remisé le plus bas.

Pour changer facilement, choisissez OpenRouter. Ses frais peuvent coûter moins cher que le maintien de plusieurs intégrations, surtout si le fallback et la rotation des modèles font partie du produit. Pour un fournisseur unique et stable, la facturation directe reste plus simple.

Pour une application OpenAI existante, essayez Luna avant de migrer. Batch/Flex ramène le coût normalisé à $2.20, soit seulement $0.24 de plus que DeepSeek. Les évaluations et opérations déjà en place peuvent aisément valoir davantage que cet écart.

La décision bascule dès que la route la moins chère passe sous le seuil d’acceptation du workload. Conservez le modèle économique tant que la validité des schémas, les réponses acceptées, la latence, les conditions de confidentialité et le comportement de reprise répondent aux exigences. Montez d’un niveau si l’un de ces critères cède. Inutile d’empiler les rustines de prompts pour économiser quelques centimes.

Tout développeur qui propose à ses clients une expérience pilotée par API doit également prendre en charge l’authentification, la facturation, la validation et les échecs. Le guide de création avec l’API v0 montre pourquoi le modèle ou l’agent sous-jacent ne constitue qu’une couche du produit.

Comment ces API ont-elles été sélectionnées ?

Ce classement valorise la décision d’achat fiable la moins chère, pas le plus petit chiffre d’entrée pris isolément. Chaque fournisseur a été tarifé et analysé à partir de ses pages officielles en ligne le 10 août 2026. Ces API n’ont pas fait l’objet d’un abonnement ni été présentées comme si elles avaient été testées en production.

La décision repose sur les critères suivants :

  • Prix d’entrée exploitable : tarifs d’entrée et de sortie d’un modèle nommé et actuellement proposé
  • Seuil de qualité : capacité plausible du niveau de modèle à traiter une tâche contrainte ou un workflow de production plus large
  • Surface opérationnelle : JSON, outils, contexte, batch, cache, limites de débit et implications des fallbacks
  • Conséquences contractuelles et de confidentialité : traitement des données gratuites, stabilité du prix et éventuels frais de passerelle distincts
  • Coût du changement : travail nécessaire pour migrer prompts, schémas, jeux d’évaluation, supervision et facturation

Huit fournisseurs ont été retenus parce que chacun répond à une décision d’achat distincte. Un fournisseur a été écarté lorsque sa route de texte de production la moins chère dépassait nettement cette fourchette de prix, lorsque son tarif ne pouvait pas être ramené au token ou lorsque son rôle doublonnait une autre option sans bénéfice plus clair. Les API spécialisées dans l’image, la vidéo, la voix et les embeddings ont également été exclues, car leurs unités ne se comparent pas aux tokens de texte en entrée et en sortie.

Le calcul des coûts est une analyse originale fondée sur un workload explicite. Ce n’est pas un benchmark. Seuls vos propres requêtes représentatives, validateurs et processus de contrôle peuvent établir votre coût par sortie acceptée.

Les options à éviter

Les variantes gratuites d’OpenRouter comme dépendance de production

Évitez de faire d’une variante gratuite d’OpenRouter l’unique route derrière le trafic client réel. Le compte reçoit 50 requêtes gratuites par jour jusqu’à l’achat cumulé d’au moins $10 de crédits, puis 1,000 par jour. Il s’agit d’un quota d’évaluation, pas d’un plan de capacité fiable.

Gemini Free avec des données clients ou confidentielles

N’envoyez pas de contenu sensible via Gemini Free. Google indique que le contenu du niveau Free sert à améliorer ses produits, contrairement à celui du niveau Paid. La facture normalisée de Paid Standard est de $1.80 : économiser ce montant ne justifie pas de franchir cette frontière de confidentialité.

DeepInfra Mistral Nemo pour un usage client sans contraintes

Ne faites pas passer directement la route à $0.019/$0.03 en production pour du support ouvert, de l’interprétation juridique ou des actions autonomes. Ce tarif correspond à un petit modèle. Réservez-le à une tâche contrainte et validée, puis conservez un fallback plus robuste jusqu’à ce que les données d’acceptation autorisent un périmètre plus large.

DeepSeek sans fallback face aux hausses de prix

Ne traitez pas $0.14/$0.28 comme un tarif annuel fixe. DeepSeek annonce une hausse importante. Le modèle peut rester le meilleur choix actuel par défaut, mais le budget et l’architecture ont besoin d’une seconde route.

OpenAI Standard pour les tâches hors ligne réessayables

Ne payez pas le tarif Standard de Luna à $0.20/$1.20 pour un traitement qui peut attendre. Batch et Flex coûtent $0.10/$0.60 et font passer la charge normalisée de $4.40 à $2.20 sans changer de fournisseur.

Le plan d’action pour lundi

La semaine prochaine, migrez une catégorie de tâches bien délimitée, pas toute l’application. Une évaluation sur 100 requêtes suffit à révéler les défauts évidents de schéma, de latence et de routage avant d’introduire du trafic de production ; elle ne remplace pas une supervision continue.

  1. Sélectionner 100 requêtes représentatives

    Choisissez une seule tâche et échantillonnez des entrées normales, difficiles, ambiguës et mal formées. Retirez les données personnelles, confidentielles et clients avant d’utiliser un niveau gratuit.

  2. Tester trois routes

    Comparez le fournisseur actuel, DeepSeek V4 Flash et Gemini 2.5 Flash-Lite. N’ajoutez DeepInfra ou Groq que si le prix brut ou la latence constitue l’objectif explicite.

  3. Mesurer quatre résultats

    Consignez le taux de schémas valides, le taux de réponses acceptées, la latence de bout en bout et le coût exact des tokens en entrée/sortie. Mesurez séparément le temps de validation humaine.

  4. Router une seule catégorie gagnante

    N’envoyez au fournisseur moins cher que la tâche délimitée qui a réussi. Gardez l’ancienne route pour les échecs de validation, les entrées ambiguës et les actions aux conséquences plus fortes.

  5. Recalculer à chaque changement fournisseur

    Conservez la formule et les hypothèses de charge. Recalculez lorsque DeepSeek augmente ses tarifs, qu’un modèle est abandonné ou que les limites des niveaux gratuits et des passerelles évoluent.

Cette démarche transforme une liste de tarifs en décision budgétaire réversible. Elle fournit aussi le seul chiffre qu’un tableau public ne peut pas donner : votre coût par résultat accepté.

Questions fréquentes

Quelle IA propose l’API la moins chère ?

DeepInfra affiche le prix brut de génération de texte le plus bas de ce comparatif : Mistral Nemo à $0.019 par million de tokens en entrée et $0.03 par million en sortie. DeepSeek V4 Flash reste le meilleur choix économique par défaut en production lorsque le workload exige JSON, outils et contexte long.

Existe-t-il une API IA gratuite ?

Oui. Google Gemini fournit gratuitement les tokens d’entrée et de sortie sur son niveau Free, tandis qu’OpenRouter propose des variantes de modèles gratuites. Gemini Free peut utiliser le contenu pour améliorer les produits Google ; les variantes gratuites d’OpenRouter sont limitées à 50 requêtes par jour, ou 1,000 après au moins $10 d’achats cumulés de crédits.

Combien coûte une API d’intelligence artificielle ?

Pour 20,000 appels mensuels totalisant 10M de tokens en entrée et 2M en sortie, les routes classées vont de $0.25 sur DeepInfra Mistral Nemo à $4.40 sur OpenAI GPT-5.6 Luna Standard. Batch, Flex, cache, frais de passerelle, nouvelles tentatives et modèle capable de franchir le seuil de qualité déterminent la facture finale.

Combien coûte l’API ChatGPT ?

Les abonnements ChatGPT et la facturation de l’API OpenAI sont distincts. Le modèle OpenAI économique comparé ici est GPT-5.6 Luna à $0.20 en entrée et $1.20 en sortie par million de tokens Standard avec contexte court, ou $0.10/$0.60 via Batch ou Flex.

Téléchargez la checklist d’audit des workflows IA en entreprise pour transformer cette échelle de coûts en évaluation fournisseur sur une semaine.

Dernière mise à jour

3 sept. 2026

CatégorieBuild

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.