Prix Claude API : Fable 5.1 baisse le coût du cache
Claude Fable 5.1 réduit le prix des lectures en cache, mais impose des règles d’API plus strictes. Découvrez comment migrer sans erreur en production.

Claude Fable 5.1 mérite d’être testé pour les longues exécutions d’agents, mais ce n’est pas une mise à niveau que l’on peut substituer telle quelle dans chaque intégration Claude. Côté prix Claude API, Anthropic l’a lancé le 1er septembre 2026 avec des lectures de cache à $0.25 par million de tokens, ainsi que des règles d’API susceptibles de casser les appels d’outils forcés et les historiques de conversation modifiés.
À quoi correspond vraiment Claude Fable 5.1
Fable 5.1 est le modèle d’Anthropic destiné aux tâches qui s’inscrivent dans la durée : un agent de code qui remonte une panne à travers plusieurs services, un agent de recherche qui suit les preuves dans différentes sources ou un agent documentaire qui transforme un vaste ensemble de fichiers en livrable finalisé. Son identifiant dans l’API est claude-fable-5-1. Il est proposé à tous les clients de l’API Claude, ainsi que sur Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry.
Le mot important ici est modèle. Il ne s’agit ni d’une nouvelle application ni d’un remplacement de tout le produit Claude. Anthropic recommande toujours à la plupart des développeurs d’API de commencer par Claude Opus 5. Fable 5.1 devient pertinent lorsque les tâches de raisonnement exigeantes ou de longue haleine échouent encore à vos propres évaluations d’Opus. Claude Mythos 5.1 repose sur le même modèle, avec des garde-fous différents, mais reste réservé aux clients Project Glasswing approuvés. Le guide actuel des modèles Anthropic explicite cette distinction.
La fenêtre de contexte atteint 1M de tokens par défaut, avec jusqu’à 128k tokens en sortie. Cette fenêtre constitue la mémoire de travail du modèle pour la requête en cours : instructions, messages, fichiers, outils, résultats, réflexion et réponse produite. Un million de tokens permet d’embarquer beaucoup d’informations, sans pour autant rendre chacune d’elles utile. Le propre guide d’Anthropic sur le contexte alerte sur la dégradation du contexte : le rappel et la précision peuvent reculer à mesure que les éléments non pertinents s’accumulent.
La réflexion adaptative est toujours active. Cinq niveaux d’effort permettent d’ajuster le travail du modèle : low, medium, high, xhigh et max. Commencez par high, la valeur par défaut de l’API. Ne descendez que si vos évaluations confirment que la qualité tient, car les tokens de réflexion sont facturés comme des tokens de sortie, même lorsque le raisonnement reste masqué.
Ce guide s’adresse aux développeurs qui intègrent l’API. Si vous utilisez uniquement Claude dans le chat, le modèle peut améliorer une tâche que vous lui confiez, mais vous n’avez aucune migration à réaliser.
Prix Claude API : une baisse plus ciblée qu’il n’y paraît
Fable 5.1 n’est pas devenu moins cher sur toute la ligne. Ses tarifs de base en entrée et en sortie restent identiques à ceux de Fable 5, et tous deux coûtent deux fois plus cher qu’Opus 5 sur ces postes. La forte baisse concerne le contexte réutilisé.
Un cache de prompts conserve un préfixe déjà traité, par exemple vos instructions système, les définitions d’outils, la cartographie d’un dépôt ou un ensemble de documents. Lorsque la requête suivante commence par un préfixe strictement identique, Claude peut relire ce travail mis en cache au lieu de le retraiter au plein tarif d’entrée.
Prenons un préfixe de 1M de tokens relu dix fois. Avec Fable 5, ces lectures en cache coûtent $10. Avec Fable 5.1, elles reviennent à $2.50. À contexte répété identique, l’économie atteint $7.50, soit 75%, avant même de compter les nouvelles entrées ou sorties. D’après quatre semaines d’utilisation observées en août 2026, Anthropic estime l’économie totale à environ 25% pour les workloads typiques facturés au token, et jusqu’à environ 45% pour les usages fortement agentiques. Ce sont des estimations du fournisseur, mais le tarif unitaire sur lequel elles reposent est sans ambiguïté. La grille tarifaire actuelle détaille chaque opération de cache.

Il y a toutefois un piège. L’écriture d’un cache de cinq minutes coûte $12.50 par million de tokens, et celle d’un cache d’une heure $20. Par défaut, le cache expire après cinq minutes. Le préfixe doit contenir au moins 512 tokens et correspondre exactement ; la première réponse doit aussi avoir commencé avant que les requêtes parallèles suivantes puissent profiter du cache. Selon Anthropic, l’option cinq minutes devient rentable après une lecture, et l’option une heure après deux. Vérifiez cache_creation_input_tokens, cache_read_input_tokens et input_tokens au lieu de supposer que le cache a fonctionné.
Cette évolution change peu de choses pour les prompts courts et ponctuels, les préfixes qui varient constamment ou les agents dont le coût vient surtout de la sortie. À $50 par million de tokens de sortie, une réflexion superflue et des réponses trop longues peuvent encore dominer la facture.
Les benchmarks de lancement vont dans le bon sens, sans suffire à justifier un achat. Anthropic annonce 55.8% pour Fable 5.1 contre 42.0% pour Fable 5 sur Terminal-Bench 4.0, et 31.4% contre 17.1% sur AutomationBench. Ces tests ont été réalisés avec les garde-fous de production d’Anthropic et proviennent du fournisseur. Voyez-y une raison d’évaluer vos propres tâches, pas la preuve que chaque workload progressera. Le rapport de lancement publie les notes de test et les comparaisons.
Qui devrait l’utiliser, et comment ?
Un fondateur en solo face à une tâche difficile dans un dépôt
Ne transférez pas toutes les tâches de code vers Fable 5.1. Gardez les modifications courantes sur le modèle qui atteint déjà votre niveau d’exigence, puis réservez Fable aux dossiers récalcitrants : migration entre plusieurs services, analyse d’une cause racine ou revue devant relier des décisions à l’échelle d’une grande base de code. Mettez en cache les instructions stables du dépôt et les définitions d’outils. Vous augmentez ainsi vos chances de réussir la tâche coûteuse sans payer le tarif Fable pour chaque petite intervention.
Un ingénieur de plateforme d’agents qui déploie une boucle d’outils
Changer de modèle ne représente que la moitié du travail. Vérifiez si votre orchestrateur d’agents impose un outil, réécrit le prompt système de premier niveau, modifie le tableau d’outils, supprime d’anciens messages ou insère un résumé produit côté client tout en conservant les blocs de réflexion ultérieurs. Chacun de ces schémas peut transformer une session ordinaire en erreur 400. L’enjeu n’est pas d’obtenir une démo plus séduisante, mais un déploiement qui continue de fonctionner aux tours suivants.
Un responsable de recherche confronté à un vaste corpus de fichiers
Utilisez Fable 5.1 lorsque la tâche exige réellement de relier des éléments dispersés dans un long historique, et non simplement parce que le chiffre 1M est disponible. Commencez avec l’effort high, comparez la réponse à des conclusions connues, puis redescendez progressivement vers medium. Anthropic indique que medium atteint approximativement le niveau de Fable 5 à moindre coût ; vos propres contrôles de récupération d’information et de citations détermineront si ce compromis se vérifie.
Un responsable de la sécurité ou des données en entreprise
Examinez les règles avant les capacités. Fable 5.1 est un Covered Model assorti d’une obligation de conservation des données pendant 30 jours. Il n’est pas disponible en régime de conservation nulle des données, sauf autorisation expresse d’Anthropic. Il ne prend pas non plus en charge Priority Tier. Si l’une de ces conditions n’est pas négociable, arrêtez l’évaluation à ce stade et conservez un modèle éligible dans votre routage.
Migrer vers Fable 5.1 en toute sécurité
L’appel minimal est simple. Une migration en production exige quatre vérifications.
Établir une référence sur une vraie tâche
Exécutez la même tâche représentative sur votre modèle actuel et relevez la réussite, le temps écoulé, l’entrée, la création du cache, ses lectures, la sortie et tout refus éventuel. Choisissez la tâche qui justifie le tarif supérieur de Fable, pas un prompt jouet.
Appeler le modèle épinglé avec l’effort high
Définissez la clé d’API, installez la version actuelle du SDK Python et enregistrez le bloc Python sous
test_fable.py.Bashpython3 -m venv .venv source .venv/bin/activate pip install anthropic export ANTHROPIC_API_KEY="your-api-key-here"Pythonimport anthropic client = anthropic.Anthropic() message = client.messages.create( model="claude-fable-5-1", max_tokens=4096, output_config={"effort": "high"}, messages=[ { "role": "user", "content": "Map the risks in moving this service from SQLite to PostgreSQL.", } ], ) for block in message.content: if block.type == "text": print(block.text) print(message.usage.model_dump_json())Lancez-le avec
python test_fable.py. Cette syntaxe correspond au SDK actuel d’Anthropic et à son réglage d’effort. En production, le prompt doit être la tâche de votre évaluation.Supprimer les deux schémas qui provoquent des erreurs
Recherchez dans vos requêtes les valeurs
anyou le nom d’untoolimposés àtool_choice. Les deux renvoient désormais une erreur HTTP 400. Laissez ce réglage surauto, ajoutezstrict: trueau schéma de l’outil lorsque les arguments doivent être valides, puis indiquez au modèle quel outil le tour exige.Rendez ensuite l’historique strictement additif. Renvoyez les tours de l’assistant exactement tels qu’ils ont été reçus, blocs de réflexion compris. Ajoutez les nouvelles instructions sous forme de messages système au milieu de la conversation. Préférez la compaction côté serveur ou l’édition du contexte à la réécriture des tours précédents.
Activer les diagnostics avant d’envoyer du trafic
Exécutez une session multitour normale avec l’en-tête bêta
thinking-binding-controls-2026-08-01etprefix_mismatch_behavior: "drop_block". Journalisezinput_transformations. Une erreurprefix_binding_mismatchindique que votre intégration a modifié l’historique. Une erreurmodel_binding_mismatchaprès routage vers un modèle plus ancien est attendue.Une fois l’historique stabilisé, ajoutez
cache_control: {"type": "ephemeral"}au premier niveau d’une requête comprenant un préfixe réutilisable d’au moins 512 tokens. Confirmez qu’une requête ultérieure indique une valeur decache_read_input_tokenssupérieure à zéro.
Le constat sans détour : un contexte moins cher impose un état plus strict
Fable 5.1 lie chaque bloc de réflexion au prompt système, aux outils et aux messages qui le précèdent. Pour les comptes créés à partir du 31 août 2026, modifier ce préfixe puis rejouer le bloc déclenche l’erreur The block is bound to a different conversation. Les comptes plus anciens peuvent déjà activer le même contrôle, et Anthropic précise que les futurs modèles l’appliqueront plus largement.

Le comportement du modèle évolue aussi sans nécessairement produire d’erreur. Dans les boucles d’agents implicites, il peut lancer un seul appel d’outil là où Fable 5 en regroupait plusieurs. Il publie moins de points d’avancement, effectue moins de recherches avec l’effort low, peut rédiger une prose plus dense et parfois réécrire un fichier entier pour une petite modification. Ces écarts peuvent multiplier les tours, allonger la latence et augmenter la sortie, même si le tarif du cache baisse. Anthropic propose des ajustements de prompt pour chaque comportement, mais il vous faut toujours une évaluation qui mesure précisément le comportement recherché.
La promesse de 128k tokens en sortie cache une autre limite. Les SDK imposent le streaming lorsque max_tokens dépasse 21,333. La réflexion puise dans le même budget de sortie : une requête à effort élevé peut donc en consommer une grande partie avant même le début de la réponse visible. Prévoyez une limite généreuse pour les tâches réellement difficiles, sans confondre plafond élevé et objectif à atteindre.
Les utilisateurs de Claude Code ont moins de travail d’intégration. Depuis la version 2.1.257, Fable 5.1 est le modèle Fable par défaut, à compter du 1er septembre 2026. Il reste nécessaire de surveiller l’usage, de relire le diff et de réserver le modèle aux tâches dont le résultat justifie son tarif. Le changelog de Claude Code consigne ce changement de modèle.
Que faire maintenant ?
Agissez cette semaine si vous exploitez déjà de longs agents Fable 5, renvoyez souvent un contexte stable et pouvez accepter les conditions de conservation. Placez Fable 5.1 sur une petite part du trafic, lancez le diagnostic d’historique, remplacez les outils forcés et comparez le coût par tâche réussie avec les efforts medium et high.
Attendez si Opus 5 ou votre modèle actuel réussit déjà le workload, si la plupart des appels sont ponctuels ou si vous ne disposez pas d’une évaluation représentative. Les entrées et sorties de Fable coûtent toujours deux fois plus cher que celles d’Opus 5. Une ligne de cache moins chère ne compense pas une mauvaise décision de routage.
Vous n’êtes pas concerné si vous utilisez seulement le chat Claude sans contrôler l’intégration de l’API. Laissez le produit choisir le modèle, puis jugez le résultat. Les entreprises qui exigent une conservation nulle des données dans les conditions habituelles ou Priority Tier doivent également rester sur un routage éligible, sauf autorisation écrite d’Anthropic.
Pour recevoir la prochaine sortie sous la forme d’une décision de mise en œuvre concrète, inscrivez-vous à la newsletter.
2 sept. 2026



