OpenAI a baissé le prix de deux de ses trois modèles GPT-5.6 le 30 juillet 2026. Luna passe à 0,20 $ / 1,20 $ le million de tokens (input/output), Terra à 2 $ / 12 $. Sol, le haut de gamme, ne bouge pas. La question qui compte pour un opérateur qui paie ses factures API : est-ce que ça change ton calcul face à Claude Haiku, Sonnet ou Opus ? Réponse courte : sur certains workloads oui, sur la majorité pas vraiment. Si tu cherches d'abord à cadrer ton usage global, le guide complet pour apprendre Claude couvre le contexte plus large ; ici on regarde la facture.
Ce texte est chiffré, sans camp. On prend les prix officiels, on calcule trois scénarios réels, et on regarde où la bascule est rationnelle.
Les nouveaux prix de GPT-5.6 Luna et Terra en clair
Voici les tarifs OpenAI après la baisse du 30 juillet 2026, avec le prix précédent en référence. Tous les chiffres sont en dollars par million de tokens.
| Modèle | Input (avant) | Input (après 30/07/2026) | Output (avant) | Output (après 30/07/2026) |
|---|---|---|---|---|
| GPT-5.6 Luna | 1,00 $ | 0,20 $ | 6,00 $ | 1,20 $ |
| GPT-5.6 Terra | 2,50 $ | 2,00 $ | 15,00 $ | 12,00 $ |
| GPT-5.6 Sol | 5,00 $ | 5,00 $ (inchangé) | 30,00 $ | 30,00 $ (inchangé) |
Luna baisse de 80 %, Terra de 20 %. Sol ne bouge pas. La justification officielle d'OpenAI parle de gains d'efficacité (environ 20 % de coût de service en moins, plus de 15 % d'amélioration de génération de tokens). La lecture presse évoque aussi la pression concurrentielle : à prendre comme analyse, pas comme fait annoncé.
Ce qui saute aux yeux : l'output reste 6x plus cher que l'input sur Luna, 6x sur Terra aussi. Le prix affiché quand tu regardes une grille est presque toujours l'input. C'est trompeur. Si tu génères beaucoup, c'est l'output qui te coûte. On y revient au scénario 1.
Ce que coûtent les mêmes prix côté Claude (Haiku, Sonnet, Opus)
Grille Anthropic à jour, en dollars par million de tokens.
| Modèle | Input | Output | Équivalent OpenAI |
|---|---|---|---|
| Claude Haiku 4.5 | 1,00 $ | 5,00 $ | Luna (entrée de gamme volume) |
| Claude Sonnet 5 | 3,00 $ | 15,00 $ | Terra (travail quotidien) |
| Claude Opus 4.7 | 5,00 $ | 25,00 $ | Sol (haut de gamme) |
| Claude Fable 5 | 10,00 $ | 50,00 $ | au-dessus de Sol, classe Mythos |
Deux observations. Un, Luna est maintenant 5x moins cher que Haiku sur l'input et 4x moins cher sur l'output. C'est un vrai écart. Deux, Terra reste moins cher que Sonnet sur les deux axes : 2 $ contre 3 $ en input, 12 $ contre 15 $ en output. L'écart s'est resserré après la baisse du 30 juillet 2026, mais Terra reste devant sur toute la ligne.
Le vrai game-changer côté Anthropic, ce n'est pas la grille nominale mais le prompt caching : les tokens en cache-hit sont facturés environ 10 % du prix input normal. Sur des workflows où tu réutilises le même long prompt système, le même contexte de projet, ou les mêmes fichiers de référence à chaque appel, la facture réelle chute de 60 à 80 %. OpenAI a aussi un cache (lectures à -90 %, écritures à 1,25x le tarif input, durée minimum 30 minutes). Match nul sur le principe, mais le caching effectif dépend de comment tu structures tes appels, pas du fournisseur.
Combien coûte une vraie tâche : 3 scénarios chiffrés
Trois cas concrets, calculs bout en bout. Hypothèses volontairement simples pour que tu puisses recalculer avec tes propres volumes.
Scénario 1 : générer 20 articles de blog de 1500 mots
Un article de 1500 mots ≈ 2 200 tokens en sortie. Un brief détaillé + KB + exemples : compte 8 000 tokens en entrée par article. Total pour 20 articles : 160 000 tokens input, 44 000 tokens output.
| Modèle | Coût input | Coût output | Total 20 articles |
|---|---|---|---|
| Luna | 0,032 $ | 0,053 $ | 0,085 $ |
| Haiku 4.5 | 0,16 $ | 0,22 $ | 0,38 $ |
| Terra | 0,32 $ | 0,53 $ | 0,85 $ |
| Sonnet 5 | 0,48 $ | 0,66 $ | 1,14 $ |
La différence entre Luna et Sonnet sur 20 articles : environ 1 $. Si Sonnet t'évite une relance sur 3 articles parce que la qualité est meilleure, l'économie Luna s'annule. Pour un vrai pipeline de blog SEO avec Claude, le poste qui pèse n'est pas le coût des tokens : c'est ton temps de brief et de relecture.
Scénario 2 : agent qui traite 500 emails clients par jour
Un email entrant ≈ 300 tokens, une réponse ≈ 400 tokens, plus 1 500 tokens de prompt système et 500 tokens de contexte produit. Total par email : 2 300 input, 400 output. Sur 500 emails/jour, 30 jours : 34,5 M input, 6 M output par mois.
| Modèle | Coût mensuel (sans cache) | Avec cache 70 % |
|---|---|---|
| Luna | 14 $ | ~7 $ |
| Haiku 4.5 | 65 $ | ~30 $ |
| Terra | 141 $ | ~70 $ |
| Sonnet 5 | 194 $ | ~90 $ |
Là, la baisse Luna fait mal. 14 $ vs 65 $ sur Haiku, c'est 50 $ par mois pour un support niveau 1. Sur un an, 600 $. Mais Luna n'est pas multimodal (texte seul) et sa qualité de raisonnement est en dessous d'Haiku sur les cas ambigus. Si 5 % de tes emails partent en mauvaise réponse, tu ré-injectes du temps humain de correction qui coûte plus que la différence.
Scénario 3 : session de pair-programming de 2 heures
Session typique dans Claude Code ou équivalent : 40 échanges, contexte cumulatif qui grossit à 80 000 tokens en fin de session, ~1 500 tokens de sortie par échange. Estimation : 1,5 M input, 60 000 output.
| Modèle | Coût session |
|---|---|
| Sonnet 5 | 5,4 $ |
| Terra | 3,7 $ |
| Opus 4.7 | 9 $ |
| Sol | 9,3 $ |
Sur du code, tu ne descends pas sur Luna ou Haiku sauf pour de la génération triviale. Terra est un peu moins cher que Sonnet, mais l'écart est mince et le comportement dans un agent de code n'est pas équivalent. Sur des tâches longues, Sonnet et Opus gardent l'avantage en agentic coding (SWE-Bench Pro à 80 % pour Fable 5, 64,6 % pour Sol). Pour cadrer ce type de setup, voir Claude Code pour débutants.
Prix ne veut pas dire coût total
Le prix par token cache trois choses.
La verbosité. Un modèle 30 % moins cher qui produit 40 % de tokens en plus coûte plus. Certains modèles OpenAI récents ont tendance à générer des réponses plus longues, en particulier avec le raisonnement activé. Mesure la longueur moyenne de tes sorties avant de comparer.
Le taux de relance. Si tu relances 1 fois sur 4 pour qualité insuffisante, tu payes 25 % de plus. Sur des tâches à enjeu (email client, article éditorial, code en prod), c'est le facteur qui domine. Le calcul brut d'un scénario suppose zéro relance : c'est faux dans la vraie vie.
Le coût de switch. Réécrire les prompts qui marchent, refaire les évals, mettre à jour la doc interne, former l'équipe : compte plusieurs jours de travail. Économiser 50 $/mois pour 3 jours de dev perdus, le ROI arrive en 2027.
Un scénario illustratif pour fixer les idées : sur un batch de 200 fiches produit, une équipe migre de Sonnet vers Terra pour économiser environ 30 % sur la facture API. Si le taux d'erreur factuelle grimpe ne serait-ce que de quelques points et que chaque erreur coûte 30 à 40 minutes de correction manuelle, l'économie sur les tokens est mangée en quelques jours de relecture. Le calcul n'est valable que si tu mesures réellement ce taux d'erreur, pas si tu le supposes.
Quand switcher vers Luna ou Terra a du sens
Cas où la bascule est rationnelle :
- Gros volume de classification (routage de tickets, tri d'emails, tagging) où la sortie est courte et le format prévisible
- Extraction structurée depuis des documents (nom, date, montant, catégorie) avec schéma JSON strict
- Batch offline sans contrainte de latence : résumés de logs, prétraitement de dataset, enrichissement de CRM
- Workflows où tu as déjà des évals automatiques qui te disent si la qualité tient
Cas où rester sur Claude reste le bon call :
- Code long et agentique (Claude Code, sessions de dev sérieuses)
- Rédaction éditoriale où la voix et la nuance comptent
- Tout ce qui tourne dans un environnement Claude déjà en place : Projects et Artifacts pour réduire les tokens répétés font baisser ton coût effectif plus qu'un switch de fournisseur
- Workflows où le prompt caching Claude est activé et fonctionne (cache-hit rate élevé)
Une stratégie multi-modèles réaliste pour un solo ou une TPE
Le routing intelligent, ce n'est pas un projet à 3 mois. C'est une règle de bon sens : chaque tâche va au modèle le moins cher qui la fait proprement. Une matrice rapide.
| Type de tâche | Modèle recommandé | Fallback |
|---|---|---|
| Classification, extraction, routage | Luna ou Haiku 4.5 | Terra si structure complexe |
| Rédaction éditoriale, emails clients, contenu marketing | Sonnet 5 | Terra pour volume, Opus pour enjeu fort |
| Code, agents, raisonnement long | Sonnet 5 ou Opus 4.7 | Fable 5 sur les tâches vraiment dures |
| Analyse documentaire, RAG | Sonnet 5 avec caching | Terra si les docs sont courts |
Côté outillage, tu as trois options : (1) deux clés API dans le même script avec un simple if qui route par type de tâche, (2) LiteLLM comme proxy unifié qui te laisse changer le modèle par variable d'environnement, (3) OpenRouter si tu veux tester rapidement plusieurs modèles avec une seule facturation. Un exemple minimal :
if task_type in ["classify", "extract", "tag"]:
model = "gpt-5.6-luna"
elif task_type in ["write", "email", "summarize"]:
model = "claude-sonnet-5"
else: # code, reasoning
model = "claude-opus-4-7"Rappel utile : la vraie économie sur ta facture API vient d'abord de trois choses. Un prompt court et précis (chaque token système inutile est facturé à chaque appel). Le caching activé et bien utilisé. Et surtout ne pas relancer trois fois parce que le prompt était vague. Le fournisseur passe en quatrième. Pour aller plus loin sur le cadrage global de ton setup et de tes coûts, la page pilier setup couvre le choix d'abonnement et le contexte tarifaire.
Passer à la pratique
La baisse Luna/Terra change ton calcul sur les workloads à haut volume et faible enjeu. Sur tout le reste (code, rédaction, agents sérieux), elle ne bouge pas grand-chose. Le vrai levier reste la qualité de ton prompt, le caching, et le routing par type de tâche. Si tu veux monter en compétence sur ce type de raisonnement, savoir router tes tâches et construire des workflows qui tiennent la charge sans exploser ta facture, la formation Maîtriser Claude au quotidien couvre le setup complet, les projets concrets et l'automatisation via MCP en cinq semaines.