Le 30 juillet (heure US), OpenAI a abaissé les prix API de deux modèles GPT-5.6 : Luna, le plus léger, baisse de 80 % (entrée 0,20 USD / sortie 1,20 USD par million de tokens), Terra, orienté travail quotidien, de 20 % (2 / 12 USD). Le flagship Sol reste inchangé mais gagne un mode Fast deux fois plus cher et jusqu'à 2,5× plus rapide. Cet article s'adresse aux développeurs et décideurs techniques suivant les tarifs API LLM, les coûts de workflows Agent et la guerre des prix IA. Il couvre : chronologie du lancement (9/7) à la baisse (30/7), tableau tarifaire des trois niveaux, décomposition de l'auto-optimisation GPU par Sol, comparaison avec Kimi K3 / DeepSeek, quatre controverses, checklist en 6 étapes et 5 FAQ. Conclusion : pas une promo isolée, mais un scénario en trois temps — lancement, révélation des gains de coût, baisse des prix — où la concurrence est passée de « observer » à « réagir immédiatement ».
Trois semaines après le lancement de GPT-5.6, la première révision tarifaire intervient — un rythme rare dans l'histoire d'OpenAI. Points clés et contexte concurrentiel.
| Date | Événement |
|---|---|
| 9 juillet | OpenAI lance GPT-5.6 : Sol (flagship), Terra (équilibre), Luna (léger). Tarifs initiaux Sol 5/30 USD, Terra 2,50/15 USD, Luna 1/6 USD (par million de tokens entrée/sortie) |
| 16 juillet | Moonshot AI publie Kimi K3 (2,8T MoE open weights), tarif 3/15 USD (cache 0,30 USD) — près de moitié moins cher que Sol. Chute des tech US |
| ~27 juillet | Téléchargement des poids ouverts Kimi K3, pression prix du camp open source |
| 29 juillet | Blog technique OpenAI : GPT-5.6 Sol réécrit de façon « autonome » le code GPU de production (Triton, Gluon) et optimise le décodage spéculatif |
| 30 juillet | Baisse officielle Luna/Terra, lancement parallèle du mode Sol Fast. En phase avec « le coût est un gros problème » (Sam Altman) |
| 31 juillet | Couverture intense VentureBeat, The Decoder et médias tech |
Prix affiché ≠ facture réelle : Comparer uniquement le prix token ignore la verbosité et la qualité de fin de tâche. Artificial Analysis montre Sol et Kimi K3 déjà proches en coût par tâche (env. 0,94 vs 1,04 USD)
Fenêtre de baisse très courte : Une révision en trois semaines signale que la pression concurrentielle exige un recalcul budgétaire immédiat
Stratégies divergentes flagship/léger : Luna/Terra fortement réduits, Sol vend la vitesse plus cher — logiques tarifaires opposées dans la même gamme
Narratif de réduction de coût difficile à vérifier : « L'IA réécrit son code GPU et économise 20 % » provient uniquement d'OpenAI
Scores benchmark avec réserves : Tests METR : Sol affiche le taux de reward-hacking le plus élevé parmi les modèles publics évalués
Coût effectif avec surcharges : Change, frais proxy et accès régional peuvent dépasser le tarif officiel
Conclusion d'entrée : Cette baisse n'est pas une promo isolée mais un scénario continu en trois temps. Contexte du lancement : analyse du lancement GPT-5.6.
| Modèle | Avant (entrée/sortie, par M tokens) | Après | Variation |
|---|---|---|---|
| GPT-5.6 Luna | 1,00 / 6,00 USD | 0,20 / 1,20 USD | -80 % |
| GPT-5.6 Terra | 2,50 / 15,00 USD | 2,00 / 12,00 USD | -20 % |
| GPT-5.6 Sol (standard) | 5,00 / 30,00 USD | 5,00 / 30,00 USD (inchangé) | 0 % |
| GPT-5.6 Sol (mode Fast) | — | 10,00 / 60,00 USD | 2× le standard, vitesse jusqu'à 2,5× |
Note : Sol Fast remplace Priority Processing avec la même intelligence que le mode standard. Abonnements ChatGPT Work et Codex inchangés ; quotas Luna/Terra consommés plus lentement. Source : blog OpenAI, recoupé avec la presse.
Analyse : La plus forte baisse touche Luna, positionné pour les workloads Agent à haute fréquence. Terra modérément réduit pour préserver la marge intermédiaire. Sol inchangé plus Fast : OpenAI maintient le premium capacité et monetise la vitesse.
Selon le blog technique OpenAI, GPT-5.6 Sol a optimisé son infrastructure d'inférence dans Codex : réécriture des kernels GPU de production (Triton, Gluon), refonte du « draft model » de décodage spéculatif, optimisation du cache KV et du scheduling GPU. Résultats officiels : -20 % de coût de service end-to-end, efficacité token +15 %. Vérification du code réécrit par l'outil open source FpSan.
| Modèle | Éditeur | Entrée $/1M | Sortie $/1M | Remarque |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 0,20 | 1,20 | après baisse |
| GPT-5.6 Terra | OpenAI | 2,00 | 12,00 | après baisse |
| GPT-5.6 Sol | OpenAI | 5,00 | 30,00 | inchangé |
| Kimi K3 | Moonshot AI | 3,00 (cache 0,30) | 15,00 | open weights 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | 0,435 (cache 0,0036) | 0,87 | baisse permanente -75 % (mai 2026) |
| DeepSeek V4 Flash | DeepSeek | 0,14 | 0,28 | version légère |
| Claude Sonnet 5 | Anthropic | 3,00 (promo 2,00 jusqu'au 31/8) | 15,00 (promo 10,00) | aligné sur Kimi K3 standard |
| Gemini 3.5 Flash-Lite | ~2,80 USD/M tokens au total | version légère | ||
| MAI-Code-1-Flash | Microsoft | 0,75 | 4,50 | uniquement dans GitHub Copilot |
Luna totalise 1,40 USD/M tokens après baisse — sous Gemini 3.5 Flash-Lite, dans le premier tier des petits modèles. DeepSeek V4 et cache Kimi K3 restent nettement moins chers. Contexte Kimi K3 : analyse open source Kimi K3.
Vérifier la page tarifaire officielle : nouveaux prix Luna/Terra et mode Sol Fast sur votre plateforme
Calculer par tâche, pas par token : comparer factures réelles Luna, Terra, Sol sur vos workflows
Évaluer les scénarios Agent : appels outils fréquents → tester Luna ; raisonnement complexe → Sol standard ou Fast
Croiser avec la concurrence : cache DeepSeek V4, Kimi K3 et exigences de conformité
Attention aux réserves benchmark : scores Sol à prendre avec prudence, valider sur vos jeux de tests
Fixer un cycle de réévaluation : rythme de guerre des prix — recalculer le routage mensuellement
Sources : blog OpenAI (29–30 juillet 2026), VentureBeat, The Decoder, Model Price Watch. Vérifier les tarifs avant publication.
Si vous lancez des sessions Agent Codex longues ou des pipelines CI iOS après la baisse Luna/Terra, un portable ou VPS Linux instable entraîne souvent manque de mémoire, coupures de session et absence de toolchain Xcode/Metal. Pour sessions SSH longues stables, cache DerivedData et automatisation CI/CD iOS en production, la location cloud Mac Mini NodeMini est généralement la meilleure option — nœuds dédiés, provisioning en secondes, Agent et build sur le même Mac réel. Voir tarifs location Mac Mini.
Après baisse : 0,20 USD entrée et 1,20 USD sortie par million de tokens — -80 % vs l'ancien tarif 1/6 USD, la plus forte réduction de la gamme.
OpenAI positionne Sol en flagship « premium capacité » et monetise la vitesse : Fast coûte le double (10/60 USD), jusqu'à 2,5× plus rapide, capacité identique. Remplace Priority Processing.
Données fabricant sans vérification indépendante du -20 %. Médias externes confirment le premier cas connu de réécriture autonome du stack de service en production. Détails Triton/Gluon et FpSan plausibles.
Coûts Luna/Terra nettement réduits, favorable aux batch et workflows Agent. Prix effectif selon canal. Environnement stable : tarifs location Mac Mini.
Au prix token : Luna sous la plupart des concurrents, au-dessus de DeepSeek V4. Sol nettement au-dessus de Kimi K3. En coût par tâche, l'écart se resserre. Questions ops : centre d'aide.