Anthropic a lancé Fable 5.1 et Mythos 5.1 le 1er septembre 2026. Le prix par million de tokens ne bouge pas (10 $ en entrée, 50 $ en sortie), mais un chiffre change tout : le cache read passe à 0,25 $ le million, contre 1 $ auparavant. Divisé par quatre. Pour un entrepreneur qui pilote un budget API, c'est le genre d'information qui mérite qu'on refasse ses calculs avant de continuer à payer comme avant. Si tu débutes avec ces modèles, le guide complet pour apprendre Claude couvre les bases, ici on rentre direct dans les chiffres.
Ce qui suit : ce que sont vraiment ces deux modèles, la grille de prix détaillée, trois simulations de facture mensuelle avant/après, le seuil à partir duquel activer le cache, et comment structurer un prompt pour capter l'économie sans changer ta qualité.
Fable 5.1 et Mythos 5.1 : ce que sont vraiment ces deux modèles
Les deux modèles partagent le même moteur. La différence tient aux garde-fous. Fable 5.1 embarque les classifieurs anti-abus qu'Anthropic déploie sur ses modèles publics (cybersécurité, biologie, chimie, distillation). Mythos 5.1 tourne sans ces mesures additionnelles, et reste réservé aux participants du programme Glasswing, plus quelques chercheurs sélectionnés. En pratique, si tu n'es pas dans Glasswing, ton choix se fait entre Fable 5.1 et les autres modèles de la gamme (Opus 5, Sonnet 5), pas entre Fable et Mythos.
Fable 5.1 est le haut de gamme d'Anthropic, tier Mythos, au-dessus d'Opus. Contexte de 1 million de tokens, 128k tokens de sortie maximum. Anthropic recommande explicitement Opus 5 par défaut, et réserve Fable 5.1 aux tâches de raisonnement long et de travail agentique long format. Concrètement : un agent qui explore une codebase de plusieurs centaines de fichiers, une analyse de dossier juridique de 400 pages, un pipeline de recherche qui enchaîne dix étapes sans intervention humaine.
Pour un solo entrepreneur, ça se traduit en deux usages typiques. Un chatbot qui doit connaître ton catalogue produit et répondre vite : Sonnet 5 suffit largement, ne va pas dépenser 5x plus pour rien. Un audit trimestriel de tes contrats fournisseurs avec extraction structurée et détection d'incohérences : Fable 5.1 (ou Opus 5, moins cher) devient pertinent. La règle simple : si tu peux faire la tâche avec Sonnet 5 sans qu'elle échoue, tu la fais avec Sonnet 5.
Le tarif détaillé : input, output, et surtout le cache
Voici la grille officielle pour Fable 5.1 et Mythos 5.1, en dollars par million de tokens :
| Type de token | Fable 5 (avant) | Fable 5.1 |
|---|---|---|
| Input standard | 10 $ | 10 $ |
| Output | 50 $ | 50 $ |
| Cache write (5 min) | 12,50 $ | 12,50 $ |
| Cache write (1h) | 20 $ | 20 $ |
| Cache read | 1 $ | 0,25 $ |
Sur les autres modèles Claude, le cache read est facturé à 10 % du prix input standard. Sur Fable 5.1, c'est 2,5 %. Un token relu depuis le cache coûte 40 fois moins cher qu'un token input frais, et 200 fois moins cher qu'un token output. C'est la seule ligne qui change avec cette mise à jour, mais c'est celle qui pèse le plus lourd dans une facture d'agent ou de pipeline qui réutilise du contexte.
Les tarifs Anthropic sont fixés en dollars : convertis-les au taux du jour pour ton budget plutôt que de te fier à un taux figé, qui devient vite faux.
Ce que ça change concrètement sur une facture mensuelle
Trois cas typiques, calculés avec les tarifs Fable 5.1. Les volumes sont des ordres de grandeur, ajuste avec tes propres logs.
Cas 1 : chatbot support avec contexte produit stable. Ton contexte produit fait 20 000 tokens (docs, FAQ, catalogue). Tu reçois 3 000 conversations par mois, chacune consomme en moyenne 4 appels au modèle avec le contexte complet. Sans cache : 3 000 × 4 × 20 000 = 240 millions de tokens input, soit 2 400 $. Avec cache (write toutes les heures pendant les heures ouvrées, disons 200 writes dans le mois, le reste en reads) : 200 × 20 000 tokens en write à 12,50 $/M plus 11 800 × 20 000 en read à 0,25 $/M, soit 50 $ + 59 $ = 109 $. La facture input passe de 2 400 $ à environ 110 $. Sur l'ancien tarif de cache (1 $/M), tu étais à 286 $. Le nouveau prix te fait économiser 60 % supplémentaires par rapport à l'ancien cache.
Cas 2 : pipeline de rédaction SEO avec brief éditorial réutilisé. Ton brief (guidelines de marque, ton, structure type, exemples d'articles réussis) fait 15 000 tokens. Tu génères 80 articles par mois. Sans cache : 80 × 15 000 = 1,2 million de tokens input rien que pour le brief, soit 12 $. Petit volume, l'économie du cache est marginale ici. En revanche, si tu ajoutes le contexte SEO (mots-clés, brief client, articles concurrents) qui monte à 40 000 tokens par article, et que tu enchaînes plusieurs itérations par article, tu peux dépasser 200 $ mensuels d'input. Avec cache bien placé sur la partie stable : autour de 40 $. Pour construire ce genre de pipeline, la structure d'un pipeline de blog SEO avec Claude détaille où placer les breakpoints.
Cas 3 : assistant juridique sur corpus stable. Corpus de 200 000 tokens (jurisprudences, contrats types, documentation interne). 500 requêtes par mois. Sans cache : 500 × 200 000 = 100 millions de tokens input, soit 1 000 $. Avec cache write toutes les 5 minutes pendant les heures d'usage (mettons 400 writes) et le reste en reads : 400 × 200 000 en write à 12,50 $/M plus 100 × 200 000 en read à 0,25 $/M, soit 1 000 $ + 5 $ = 1 005 $. Attention, ici le gain dépend fortement du ratio reads/writes. Si tu utilises le cache 1h au lieu de 5 min : 50 writes à 20 $/M plus 450 reads à 0,25 $/M, soit 200 $ + 22,50 $ = 222,50 $. C'est là que le cache 1h devient rentable pour les corpus lourds à faible fréquence d'usage.
Quand le cache devient rentable, et quand il ne l'est pas
Le cache write coûte 1,25x le prix input standard sur 5 minutes, ou 2x sur une heure. Le cache read coûte 0,025x le prix input sur Fable 5.1. Formule simple pour le seuil de rentabilité en 5 minutes : le premier read est gratuit dans le calcul (il compense le surcoût d'écriture), et à partir du deuxième read sur la même entrée cachée, tu es gagnant.
Plus précisément : un write à 12,50 $/M coûte 2,50 $/M de plus qu'un input frais à 10 $/M. Un read à 0,25 $/M économise 9,75 $/M par rapport à un input frais. Il te faut donc environ 0,26 read pour rentabiliser l'écriture. Dès le premier réutilisation du contexte, tu es dans le vert. Pour le cache 1h, le surcoût write est de 10 $/M, il faut donc environ 1,03 read pour rentabiliser, soit deux appels minimum sur la même heure.
Les cas où le cache ne sert à rien :
- Prompts uniques à chaque appel, sans contexte partagé (traduction ponctuelle, réponse à une question isolée)
- Contextes courts (moins de 1 024 tokens, la limite minimale d'Anthropic pour cacher un bloc)
- Faible volume : si tu fais 10 appels par mois sur un corpus, le cache write s'amortit à peine
- Prompt système qui change à chaque appel (mauvaise architecture, à corriger avant de penser au cache)
Fable ou Mythos : lequel choisir pour vos usages
Mythos n'est pas accessible hors programme Glasswing, donc la vraie question pour un entrepreneur est : Fable 5.1, Opus 5, ou Sonnet 5 ? Opus 5 coûte 5 $/25 $ le million (moitié prix de Fable), Sonnet 5 est à 2 $/10 $. Le tarif Sonnet 5 est d'ailleurs devenu permanent depuis août 2026 (voir Sonnet 5 : le prix définitif).
| Usage | Modèle recommandé | Raison |
|---|---|---|
| Chatbot support, classification, extraction | Sonnet 5 | Rapide, contexte 1M, largement suffisant |
| Génération de contenu, code standard | Sonnet 5 ou Opus 5 | Sonnet suffit dans 80 % des cas |
| Analyse de contrat, audit, raisonnement long | Opus 5 | Bon rapport intelligence/prix |
| Agent code long format, exploration codebase | Fable 5.1 | Le tier au-dessus, cache 4x moins cher |
| Tâche où Opus 5 échoue en effort xhigh | Fable 5.1 | Seule justification du surcoût |
Pour une petite équipe qui automatise, le pattern gagnant est un routage : Sonnet 5 pour le volume, Opus 5 pour l'analyse, Fable 5.1 pour les tâches agentiques longues où le cache va s'amortir. Si tu configures Claude Code, la page pour configurer Claude et choisir son abonnement couvre les réglages de base.
Adapter vos prompts et votre architecture pour profiter du nouveau tarif
Une seule règle : la partie stable en tête, la variable en fin. Anthropic cache par préfixe, donc tout ce qui change en début de prompt casse le cache. Structure type :
[SYSTÈME] ← stable, cache_control ici
[INSTRUCTIONS] ← stable, cache_control ici
[DOCUMENTS RÉF.] ← stable, cache_control ici (dernier breakpoint)
---
[REQUÊTE UTILISATEUR] ← variable, hors cacheDans l'API Anthropic, tu marques un breakpoint en ajoutant "cache_control": {"type": "ephemeral"} sur le dernier bloc à cacher. Tu peux poser jusqu'à 4 breakpoints. Anthropic conserve le cache 5 minutes par défaut, extensible à 1 heure via "ttl": "1h".
Deux erreurs classiques : injecter la date du jour ou un ID de session en début de prompt (ça casse tout), et changer l'ordre des documents entre deux appels. Fige l'ordre, même si un document n'est pas utile pour la requête en cours.
Si tu utilises Claude sans passer par l'API, Projects et Artifacts réutilisent automatiquement le contexte du projet entre les conversations. Tu ne vois pas le prix du cache directement, mais Anthropic l'applique en coulisses sur les plans payants. Pour suivre tes coûts côté Claude Code, l'article sur le suivi de coût et cache dans Claude Code détaille les nouvelles commandes /cost et /usage.
Ce que je surveillerais dans les prochains mois
Trois points à garder à l'œil. D'abord, la durée de vie du cache. Aujourd'hui 5 minutes par défaut, 1h en option payante. Anthropic pourrait allonger ce TTL, ce qui rendrait rentable des usages à fréquence plus basse (un utilisateur qui revient toutes les 30 minutes, par exemple).
Ensuite, l'évolution des prix. Sonnet 5 devait augmenter au 1er septembre 2026, la hausse a été annulée. La pression concurrentielle de GPT-5.6 Terra (2 $/12 $) et Gemini 3.7 Flash (0,75 $/3,75 $ jusqu'à fin 2026) tire les tarifs vers le bas sur le milieu de gamme. Fable 5.1 reste sur son palier haut, mais Opus 5 pourrait bouger.
Enfin, l'arrivée de modèles plus petits et spécialisés. Si tu fais de la classification de leads, Haiku 4.5 à 1 $/5 $ est probablement le bon choix, pas Fable. Réévalue ton routage tous les trimestres : la gamme change vite.
Le vrai levier pour un entrepreneur qui gère un budget, c'est de comprendre où va son argent. Ouvre ton dashboard Anthropic, regarde la répartition input/output/cache sur le mois passé, et applique la structure préfixe stable là où tu vois du gaspillage. Pour aller plus loin sur l'usage quotidien de Claude, la formation Maîtriser Claude au quotidien couvre le setup, les projets, l'automatisation et les pipelines éditoriaux, avec un projet livré par module.
