Sonnet 5 : la hausse de prix du 1er septembre 2026 qu'il faut anticiper

Le 1er septembre 2026, Claude Sonnet 5 passe à 3 $ / 15 $ par million de tokens, plus un nouveau tokenizer qui produit environ 30 % de tokens en plus. Voici les chiffres officiels, la méthode pour projeter ta facture et les quatre leviers à activer avant la bascule.

Le 1er septembre 2026, le tarif API de Claude Sonnet 5 passe de 2 $ / 10 $ à 3 $ / 15 $ par million de tokens (entrée/sortie). Ce n'est pas une hausse anodine : +50 % sur les deux flux, et elle se cumule avec un changement technique passé plus discrètement, un nouveau tokenizer qui produit environ 30 % de tokens en plus pour le même texte. Si tu tournes déjà à plusieurs centaines d'euros d'API par mois, la facture de septembre risque de te surprendre. Cet article te donne les chiffres officiels, une méthode pour projeter ton propre cas, et les leviers à activer avant la bascule. Pour situer le contexte plus large de Claude côté abonnement et API, jette un œil au guide complet pour apprendre Claude.

Ce qui change concrètement le 1er septembre 2026

Claude Sonnet 5 (identifiant modèle : claude-sonnet-5) a été lancé le 30 juin 2026 avec un tarif de lancement promotionnel : 2 $ le million de tokens en entrée, 10 $ en sortie. Ce tarif court jusqu'au 31 août 2026 à 23h59. À partir du 1er septembre 2026, le tarif standard s'applique : 3 $ en entrée, 15 $ en sortie.

Pour comparer, Claude Sonnet 4.6 est à 3 $ / 15 $ également, donc au même tarif standard que Sonnet 5 post-septembre. Le vrai delta, c'est entre le tarif de lancement (2 $ / 10 $) et le standard (3 $ / 15 $) : +50 % sur les deux dimensions.

Ce qui ne bouge pas au 1er septembre :

  • Le prompt caching reste facturé à 10 % du prix input standard en lecture (soit 90 % d'économie sur le contexte répété).
  • Les écritures de cache : 1,25x le tarif input pour 5 minutes, 2x pour 1 heure.
  • Les tarifs de Claude Haiku 4.5 (1 $ / 5 $) et Opus 4.7 (5 $ / 25 $) ne sont pas concernés par ce changement de tarif Sonnet.
  • Les abonnements grand public Claude.ai (Pro à environ 20 €/mois, Max à environ 100 €/mois, Team à environ 25 €/utilisateur/mois) sont indépendants du tarif API et ne bougent pas ici.

Si tu utilises Claude uniquement via l'interface web ou l'app desktop dans un plan Pro ou Max, ce sujet ne te concerne pas directement. Il concerne ceux qui appellent l'API depuis un backend, un pipeline, un agent, ou Claude Code en usage API.

Pourquoi Anthropic augmente : le tokenizer et le coût réel

Anthropic n'a pas détaillé publiquement la logique tarifaire ligne par ligne. Ce qui est documenté officiellement, c'est le changement de tokenizer, et c'est le point aveugle qui fausse toutes les projections naïves.

Claude Sonnet 5 utilise un nouveau tokenizer qui produit environ 30 % de tokens en plus pour un même texte source, comparé aux tokenizers utilisés avant Claude Opus 4.7. Ce n'est pas propre à Sonnet 5 : Fable 5, Mythos 5 et Opus 4.7 utilisent déjà ce tokenizer depuis avril 2026. Anthropic précise que le chiffre exact varie selon le contenu (langue, structure, code vs prose), 30 % est une moyenne indicative officielle, pas une constante.

Concrètement, si tu envoyais un prompt de 4 000 tokens à Sonnet 4.5 pour une note interne en français, le même texte peut compter environ 5 200 tokens sur Sonnet 5. Multiplie par le nombre d'appels mensuels et l'effet est loin d'être marginal.

La règle pratique : n'estime jamais tes coûts en te fiant à un ratio générique. Passe l'API de comptage de tokens d'Anthropic sur un échantillon représentatif de tes prompts réels et mesure le décalage. C'est le seul chiffre qui compte.

Calculer l'impact réel sur tes workflows

Prenons trois cas types d'entrepreneur, avec des ordres de grandeur pour poser la méthode. Ces montants sont indicatifs, tu dois les recalculer sur ta propre consommation.

Cas 1 : pipeline SEO, 20 articles/mois. Un article demande environ 15 000 tokens input (brief, structure, sources) et 8 000 tokens output. Volume mensuel : 300 000 tokens input, 160 000 tokens output.

  • Tarif de lancement Sonnet 5 : 300 000 × 2 $/M + 160 000 × 10 $/M = 0,60 $ + 1,60 $ = 2,20 $
  • Tarif standard au 1er septembre : 0,90 $ + 2,40 $ = 3,30 $

À cette échelle, la hausse absolue est faible. Elle devient sensible sur des pipelines industriels. Si tu passes à 200 articles/mois avec un multi-agent qui itère plusieurs passes, tu es facilement à 15 M tokens input et 8 M output. Là on parle de 110 $/mois passant à 165 $/mois, sans compter l'effet tokenizer.

Cas 2 : assistant support qui traite 500 tickets/mois. Un ticket demande en moyenne 3 000 tokens input (historique client + question) et 500 tokens output (réponse). Volume : 1,5 M input, 250 K output.

  • Tarif de lancement : 3 $ + 2,50 $ = 5,50 $
  • Tarif standard : 4,50 $ + 3,75 $ = 8,25 $

Là encore, l'ordre de grandeur reste raisonnable. Ce qui change tout, c'est quand tu ajoutes du contexte long (base de connaissances, historique produit) dans chaque appel sans caching : tu peux facilement multiplier le volume input par 10.

Cas 3 : agent code qui tourne en continu. Un agent qui édite du code sur une base moyenne consomme facilement 50 M tokens input et 5 M output par mois (les modèles agentiques relisent beaucoup de code).

  • Tarif de lancement : 100 $ + 50 $ = 150 $/mois
  • Tarif standard : 150 $ + 75 $ = 225 $/mois

Et si tu ajoutes le facteur tokenizer sur un code qui migrait avant depuis Sonnet 4.5 : compte environ 30 % de tokens facturés en plus à texte identique. Un budget de 400 €/mois peut monter à 550 ou 600 € sans que tu changes un seul prompt.

Les leviers pour amortir la hausse avant septembre 2026

Quatre leviers concrets, classés par ratio effort/économie.

1. Prompt caching. C'est le plus rentable. Toute portion de contexte répétée d'un appel à l'autre (instructions système, documentation produit, exemples few-shot) peut être mise en cache. Lecture facturée à 10 % du tarif input, soit 90 % d'économie sur cette partie. Coût : une écriture facturée 1,25x pour un cache de 5 minutes, 2x pour 1 heure. Rentabilisé dès la deuxième requête sur le même contexte. Cas d'usage typique : un assistant support avec 20 000 tokens de doc produit répétés à chaque ticket, tu divises la facture input par 8 à 10.

2. Batch API. 50 % de remise sur les jobs non temps réel (résultats sous 24h). Parfait pour l'enrichissement de base de données, le tagging de contenus, la génération d'articles programmée la nuit. Si ton pipeline de blog SEO peut tolérer un délai, bascule-le en batch.

3. Routing hybride Haiku / Sonnet. Haiku 4.5 est à 1 $ / 5 $, soit trois fois moins cher que Sonnet 5. Toutes les tâches simples (classification, extraction structurée, réponses factuelles courtes, routage) n'ont pas besoin de Sonnet. Un routeur en amont qui bascule 60 % du trafic sur Haiku divise la facture par environ 1,7.

4. Compression de contexte via Projects. Sur Claude.ai, les Projects gardent instructions et fichiers de référence hors des tokens de conversation. Côté API, l'équivalent est de mettre en cache ces éléments et de ne laisser dans le message user que ce qui varie.

Faut-il rester sur Sonnet 4.6 ou passer à Sonnet 5

SituationRecommandationRaison
Agent code, workflow longSonnet 5Le gain de performance agentique justifie l'écart
Chatbot support stable, prompts courtsSonnet 4.6 tant qu'il est dispoPas de gain qualité mesuré, budget serré
Pipeline SEO complexe multi-passesSonnet 5 avec caching agressifMeilleur raisonnement, caching absorbe la hausse
Extraction/classification simpleHaiku 4.5Sonnet est surdimensionné pour ces tâches
Volume massif non temps réelSonnet 5 + Batch APIRemise 50 % ramène le coût sous celui de 4.6 en direct

Point à surveiller : Anthropic déprécie régulièrement les anciens modèles. Sonnet 4.6 est encore disponible, mais aucun calendrier public ne garantit une disponibilité indéfinie. Documente toujours la version modèle dans ton code (pas d'alias flottant en production) et suis les release notes.

Plan d'action avant le 1er septembre 2026

Checklist en cinq étapes, avec dates suggérées.

  1. Avant le 10 août : audite ta consommation actuelle. Exporte les logs API des 30 derniers jours. Sépare input, output, cache read, cache write, par modèle et par workflow. Tu dois avoir un tableau qui te dit "pipeline X = Y tokens input et Z tokens output par jour".
  2. Avant le 17 août : mesure l'effet tokenizer sur tes prompts. Prends un échantillon représentatif (10 à 20 prompts types) et passe-les dans l'API de comptage de tokens d'Anthropic sur Sonnet 5. Compare avec le compte facturé actuel. Note l'écart réel, pas la moyenne théorique de 30 %.
  3. Avant le 24 août : active le prompt caching là où c'est pertinent. Identifie toute portion de contexte répétée sur plus de deux appels dans la même session ou heure. Mets-la en cache. C'est le levier avec le meilleur ratio effort/gain.
  4. Avant le 31 août : ajuste ton budget mensuel. Projette la facture de septembre avec les nouveaux tarifs, le tokenizer, et les leviers appliqués. Prévois une marge de 20 % le premier mois, le temps de mesurer le réel.
  5. Le 1er septembre : documente la version modèle en production. Fixe explicitement claude-sonnet-5 (ou l'ID exact de la version choisie) dans ton code. Pas d'alias flottant. Configure un monitoring de coût par requête pour détecter tout dépassement anormal.

Si tu veux aller plus loin sur le setup API, la structure de ton compte et le choix des modèles selon les usages, la page pilier Claude Setup couvre tout le cadre. Et pour passer d'un usage bricolé à un pipeline API stable, avec caching, routing, et intégrations MCP côté n8n ou HubSpot, la formation Maîtriser Claude au quotidien te donne les cinq modules et les cinq projets concrets pour opérationnaliser tout ça avant que la facture de septembre ne te force la main.

Pilier 1 · Mastery

Maîtriser Claude au quotidien : configuration, abonnements, premiers prompts

Choisir son plan Claude, configurer son environnement, comprendre la différence entre Claude.ai, Projects et Artifacts.

Découvrir le pilier complet →