Prix Claude API : Fable 5.1 baisse le coût du cache

Claude Fable 5.1 réduit le prix des lectures en cache, mais impose des règles d’API plus strictes. Découvrez comment migrer sans erreur en production.

Wednesday, September 2, 2026Omid Saffari
Prix Claude API : Fable 5.1 baisse le coût du cache

Claude Fable 5.1 mérite d’être testé pour les longues exécutions d’agents, mais ce n’est pas une mise à niveau que l’on peut substituer telle quelle dans chaque intégration Claude. Côté prix Claude API, Anthropic l’a lancé le 1er septembre 2026 avec des lectures de cache à $0.25 par million de tokens, ainsi que des règles d’API susceptibles de casser les appels d’outils forcés et les historiques de conversation modifiés.

À quoi correspond vraiment Claude Fable 5.1

Fable 5.1 est le modèle d’Anthropic destiné aux tâches qui s’inscrivent dans la durée : un agent de code qui remonte une panne à travers plusieurs services, un agent de recherche qui suit les preuves dans différentes sources ou un agent documentaire qui transforme un vaste ensemble de fichiers en livrable finalisé. Son identifiant dans l’API est claude-fable-5-1. Il est proposé à tous les clients de l’API Claude, ainsi que sur Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry.

Le mot important ici est modèle. Il ne s’agit ni d’une nouvelle application ni d’un remplacement de tout le produit Claude. Anthropic recommande toujours à la plupart des développeurs d’API de commencer par Claude Opus 5. Fable 5.1 devient pertinent lorsque les tâches de raisonnement exigeantes ou de longue haleine échouent encore à vos propres évaluations d’Opus. Claude Mythos 5.1 repose sur le même modèle, avec des garde-fous différents, mais reste réservé aux clients Project Glasswing approuvés. Le guide actuel des modèles Anthropic explicite cette distinction.

La fenêtre de contexte atteint 1M de tokens par défaut, avec jusqu’à 128k tokens en sortie. Cette fenêtre constitue la mémoire de travail du modèle pour la requête en cours : instructions, messages, fichiers, outils, résultats, réflexion et réponse produite. Un million de tokens permet d’embarquer beaucoup d’informations, sans pour autant rendre chacune d’elles utile. Le propre guide d’Anthropic sur le contexte alerte sur la dégradation du contexte : le rappel et la précision peuvent reculer à mesure que les éléments non pertinents s’accumulent.

La réflexion adaptative est toujours active. Cinq niveaux d’effort permettent d’ajuster le travail du modèle : low, medium, high, xhigh et max. Commencez par high, la valeur par défaut de l’API. Ne descendez que si vos évaluations confirment que la qualité tient, car les tokens de réflexion sont facturés comme des tokens de sortie, même lorsque le raisonnement reste masqué.

Ce guide s’adresse aux développeurs qui intègrent l’API. Si vous utilisez uniquement Claude dans le chat, le modèle peut améliorer une tâche que vous lui confiez, mais vous n’avez aucune migration à réaliser.

Prix Claude API : une baisse plus ciblée qu’il n’y paraît

Fable 5.1 n’est pas devenu moins cher sur toute la ligne. Ses tarifs de base en entrée et en sortie restent identiques à ceux de Fable 5, et tous deux coûtent deux fois plus cher qu’Opus 5 sur ces postes. La forte baisse concerne le contexte réutilisé.

ModèleEntrée par 1M de tokensLecture du cache par 1M de tokensSortie par 1M de tokensContexte
Claude Fable 5.1$10$0.25$501M
Claude Fable 5$10$1$501M
Claude Opus 5$5$0.50$251M

Un cache de prompts conserve un préfixe déjà traité, par exemple vos instructions système, les définitions d’outils, la cartographie d’un dépôt ou un ensemble de documents. Lorsque la requête suivante commence par un préfixe strictement identique, Claude peut relire ce travail mis en cache au lieu de le retraiter au plein tarif d’entrée.

Prenons un préfixe de 1M de tokens relu dix fois. Avec Fable 5, ces lectures en cache coûtent $10. Avec Fable 5.1, elles reviennent à $2.50. À contexte répété identique, l’économie atteint $7.50, soit 75%, avant même de compter les nouvelles entrées ou sorties. D’après quatre semaines d’utilisation observées en août 2026, Anthropic estime l’économie totale à environ 25% pour les workloads typiques facturés au token, et jusqu’à environ 45% pour les usages fortement agentiques. Ce sont des estimations du fournisseur, mais le tarif unitaire sur lequel elles reposent est sans ambiguïté. La grille tarifaire actuelle détaille chaque opération de cache.

Comparaison en pâte à modeler sous forme d’écluse : dix lectures d’un préfixe en cache d’un million de tokens coûtent dix dollars avec Fable 5, contre deux dollars cinquante avec Fable 5.1
Fable 5.1 réduit de 75% la facture des préfixes réutilisés ; le prix des nouvelles entrées et sorties ne baisse pas.

Il y a toutefois un piège. L’écriture d’un cache de cinq minutes coûte $12.50 par million de tokens, et celle d’un cache d’une heure $20. Par défaut, le cache expire après cinq minutes. Le préfixe doit contenir au moins 512 tokens et correspondre exactement ; la première réponse doit aussi avoir commencé avant que les requêtes parallèles suivantes puissent profiter du cache. Selon Anthropic, l’option cinq minutes devient rentable après une lecture, et l’option une heure après deux. Vérifiez cache_creation_input_tokens, cache_read_input_tokens et input_tokens au lieu de supposer que le cache a fonctionné.

Cette évolution change peu de choses pour les prompts courts et ponctuels, les préfixes qui varient constamment ou les agents dont le coût vient surtout de la sortie. À $50 par million de tokens de sortie, une réflexion superflue et des réponses trop longues peuvent encore dominer la facture.

Les benchmarks de lancement vont dans le bon sens, sans suffire à justifier un achat. Anthropic annonce 55.8% pour Fable 5.1 contre 42.0% pour Fable 5 sur Terminal-Bench 4.0, et 31.4% contre 17.1% sur AutomationBench. Ces tests ont été réalisés avec les garde-fous de production d’Anthropic et proviennent du fournisseur. Voyez-y une raison d’évaluer vos propres tâches, pas la preuve que chaque workload progressera. Le rapport de lancement publie les notes de test et les comparaisons.

Qui devrait l’utiliser, et comment ?

Un fondateur en solo face à une tâche difficile dans un dépôt

Ne transférez pas toutes les tâches de code vers Fable 5.1. Gardez les modifications courantes sur le modèle qui atteint déjà votre niveau d’exigence, puis réservez Fable aux dossiers récalcitrants : migration entre plusieurs services, analyse d’une cause racine ou revue devant relier des décisions à l’échelle d’une grande base de code. Mettez en cache les instructions stables du dépôt et les définitions d’outils. Vous augmentez ainsi vos chances de réussir la tâche coûteuse sans payer le tarif Fable pour chaque petite intervention.

Un ingénieur de plateforme d’agents qui déploie une boucle d’outils

Changer de modèle ne représente que la moitié du travail. Vérifiez si votre orchestrateur d’agents impose un outil, réécrit le prompt système de premier niveau, modifie le tableau d’outils, supprime d’anciens messages ou insère un résumé produit côté client tout en conservant les blocs de réflexion ultérieurs. Chacun de ces schémas peut transformer une session ordinaire en erreur 400. L’enjeu n’est pas d’obtenir une démo plus séduisante, mais un déploiement qui continue de fonctionner aux tours suivants.

Un responsable de recherche confronté à un vaste corpus de fichiers

Utilisez Fable 5.1 lorsque la tâche exige réellement de relier des éléments dispersés dans un long historique, et non simplement parce que le chiffre 1M est disponible. Commencez avec l’effort high, comparez la réponse à des conclusions connues, puis redescendez progressivement vers medium. Anthropic indique que medium atteint approximativement le niveau de Fable 5 à moindre coût ; vos propres contrôles de récupération d’information et de citations détermineront si ce compromis se vérifie.

Un responsable de la sécurité ou des données en entreprise

Examinez les règles avant les capacités. Fable 5.1 est un Covered Model assorti d’une obligation de conservation des données pendant 30 jours. Il n’est pas disponible en régime de conservation nulle des données, sauf autorisation expresse d’Anthropic. Il ne prend pas non plus en charge Priority Tier. Si l’une de ces conditions n’est pas négociable, arrêtez l’évaluation à ce stade et conservez un modèle éligible dans votre routage.

Migrer vers Fable 5.1 en toute sécurité

L’appel minimal est simple. Une migration en production exige quatre vérifications.

  1. Établir une référence sur une vraie tâche

    Exécutez la même tâche représentative sur votre modèle actuel et relevez la réussite, le temps écoulé, l’entrée, la création du cache, ses lectures, la sortie et tout refus éventuel. Choisissez la tâche qui justifie le tarif supérieur de Fable, pas un prompt jouet.

  2. Appeler le modèle épinglé avec l’effort high

    Définissez la clé d’API, installez la version actuelle du SDK Python et enregistrez le bloc Python sous test_fable.py.

    Bash
    python3 -m venv .venv
    source .venv/bin/activate
    pip install anthropic
    export ANTHROPIC_API_KEY="your-api-key-here"
    Python
    import anthropic
    
    client = anthropic.Anthropic()
    
    message = client.messages.create(
        model="claude-fable-5-1",
        max_tokens=4096,
        output_config={"effort": "high"},
        messages=[
            {
                "role": "user",
                "content": "Map the risks in moving this service from SQLite to PostgreSQL.",
            }
        ],
    )
    
    for block in message.content:
        if block.type == "text":
            print(block.text)
    
    print(message.usage.model_dump_json())

    Lancez-le avec python test_fable.py. Cette syntaxe correspond au SDK actuel d’Anthropic et à son réglage d’effort. En production, le prompt doit être la tâche de votre évaluation.

  3. Supprimer les deux schémas qui provoquent des erreurs

    Recherchez dans vos requêtes les valeurs any ou le nom d’un tool imposés à tool_choice. Les deux renvoient désormais une erreur HTTP 400. Laissez ce réglage sur auto, ajoutez strict: true au schéma de l’outil lorsque les arguments doivent être valides, puis indiquez au modèle quel outil le tour exige.

    Rendez ensuite l’historique strictement additif. Renvoyez les tours de l’assistant exactement tels qu’ils ont été reçus, blocs de réflexion compris. Ajoutez les nouvelles instructions sous forme de messages système au milieu de la conversation. Préférez la compaction côté serveur ou l’édition du contexte à la réécriture des tours précédents.

  4. Activer les diagnostics avant d’envoyer du trafic

    Exécutez une session multitour normale avec l’en-tête bêta thinking-binding-controls-2026-08-01 et prefix_mismatch_behavior: "drop_block". Journalisez input_transformations. Une erreur prefix_binding_mismatch indique que votre intégration a modifié l’historique. Une erreur model_binding_mismatch après routage vers un modèle plus ancien est attendue.

    Une fois l’historique stabilisé, ajoutez cache_control: {"type": "ephemeral"} au premier niveau d’une requête comprenant un préfixe réutilisable d’au moins 512 tokens. Confirmez qu’une requête ultérieure indique une valeur de cache_read_input_tokens supérieure à zéro.

Le constat sans détour : un contexte moins cher impose un état plus strict

Fable 5.1 lie chaque bloc de réflexion au prompt système, aux outils et aux messages qui le précèdent. Pour les comptes créés à partir du 31 août 2026, modifier ce préfixe puis rejouer le bloc déclenche l’erreur The block is bound to a different conversation. Les comptes plus anciens peuvent déjà activer le même contrôle, et Anthropic précise que les futurs modèles l’appliqueront plus largement.

Chemin de conversation en pâte à modeler : les tours ajoutés sans réécriture produisent une sortie valide, tandis qu’un ancien tour modifié aboutit à une erreur 400 et à un contournement bêta par suppression du bloc
Fable 5.1 favorise un historique d’agent strictement additif ; réécrire le passé peut invalider tous les blocs de réflexion ultérieurs.

Le comportement du modèle évolue aussi sans nécessairement produire d’erreur. Dans les boucles d’agents implicites, il peut lancer un seul appel d’outil là où Fable 5 en regroupait plusieurs. Il publie moins de points d’avancement, effectue moins de recherches avec l’effort low, peut rédiger une prose plus dense et parfois réécrire un fichier entier pour une petite modification. Ces écarts peuvent multiplier les tours, allonger la latence et augmenter la sortie, même si le tarif du cache baisse. Anthropic propose des ajustements de prompt pour chaque comportement, mais il vous faut toujours une évaluation qui mesure précisément le comportement recherché.

La promesse de 128k tokens en sortie cache une autre limite. Les SDK imposent le streaming lorsque max_tokens dépasse 21,333. La réflexion puise dans le même budget de sortie : une requête à effort élevé peut donc en consommer une grande partie avant même le début de la réponse visible. Prévoyez une limite généreuse pour les tâches réellement difficiles, sans confondre plafond élevé et objectif à atteindre.

Les utilisateurs de Claude Code ont moins de travail d’intégration. Depuis la version 2.1.257, Fable 5.1 est le modèle Fable par défaut, à compter du 1er septembre 2026. Il reste nécessaire de surveiller l’usage, de relire le diff et de réserver le modèle aux tâches dont le résultat justifie son tarif. Le changelog de Claude Code consigne ce changement de modèle.

Que faire maintenant ?

Agissez cette semaine si vous exploitez déjà de longs agents Fable 5, renvoyez souvent un contexte stable et pouvez accepter les conditions de conservation. Placez Fable 5.1 sur une petite part du trafic, lancez le diagnostic d’historique, remplacez les outils forcés et comparez le coût par tâche réussie avec les efforts medium et high.

Attendez si Opus 5 ou votre modèle actuel réussit déjà le workload, si la plupart des appels sont ponctuels ou si vous ne disposez pas d’une évaluation représentative. Les entrées et sorties de Fable coûtent toujours deux fois plus cher que celles d’Opus 5. Une ligne de cache moins chère ne compense pas une mauvaise décision de routage.

Vous n’êtes pas concerné si vous utilisez seulement le chat Claude sans contrôler l’intégration de l’API. Laissez le produit choisir le modèle, puis jugez le résultat. Les entreprises qui exigent une conservation nulle des données dans les conditions habituelles ou Priority Tier doivent également rester sur un routage éligible, sauf autorisation écrite d’Anthropic.

Pour recevoir la prochaine sortie sous la forme d’une décision de mise en œuvre concrète, inscrivez-vous à la newsletter.

Dernière mise à jour

2 sept. 2026

CatégorieExplained

Préférez ce site dans Google

Ajouter omidsaffari.com comme source préférée dans la recherche Google

Marquez omidsaffari.com comme source préférée et Google le met en avant pour vous dans Top Stories, AI Overviews et AI Mode.

Newsletter

Une lettre, chaque dimanche. Des systèmes qui tournent, pas des hot takes.

Build logs, systèmes en production et notes de terrain d'un portefeuille de ventures IA.

Hebdomadaire. Pas de spam. Désabonnement à tout moment.