Hausse DeepSeek
la guerre des prix de l'IA open weight en Chine (août 2026)

En cinq jours, trois des principaux laboratoires d'IA chinois ont fait des gestes qui, à première vue, se contredisent. DeepSeek a relevé ses tarifs API jusqu'à ~1100% sur certaines tranches. Alibaba a ouvert les poids d'un flagship à 2.4T paramètres qu'il n'avait jamais publié. Zhipu a livré GLM-5.3 et fait progresser les benchmarks de code d'environ 6x sur le même modèle de base — sans réentraînement. Ce texte guide développeurs et acheteurs à travers la chronologie, la grille tarifaire, les trois stratégies, le face-à-face, les affirmations contestées et la FAQ. Le signal commun : les labs chinois ne se battent plus seulement sur le prix, mais sur le pouvoir de le fixer.

01

Chronologie : ce qui s'est passé, et quand

L'erreur la plus simple consiste à traiter ~1100% comme la facture entière. On commence par les dates, puis on sépare dimension de facturation, type de licence et source des benchmarks.

DateÉvénement
16 juillet 2026Moonshot AI ouvre les poids de Kimi K3 (2.8T paramètres), ce qui attire l'attention des autorités de sécurité américaines
2–3 août 2026Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée
10 août 2026Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le flagship Muse Spark 1.2
12 août 2026Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6
13 août 2026DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit
14 août 2026Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2
17 août 2026, 00:00 heure de PékinLes nouveaux tarifs DeepSeek entrent en vigueur

En reculant d'un cran : le 30 juillet, OpenAI a baissé les prix de son palier le moins cher (GPT-5.6 Luna, −80 %), puis les 6–7 août a fait de Luna le défaut gratuit, avec des chats texte illimités. Pendant que les labs chinois relevaient leurs tarifs et ouvraient les poids de leurs flagships, les labs américains baissaient les leurs et passaient au gratuit côté grand public — au même moment. Ce sont les deux faces d'une même guerre des prix.

Six lectures à écarter avant de citer un titre

  1. 01

    Prendre ~1100% pour la facture entière. Ce chiffre concerne l'entrée cache-hit en heures de pointe, le palier qui était le plus proche de la gratuité.

  2. 02

    Ignorer les fenêtres de pointe de Pékin. Les heures de pointe sont 9–12 et 14–18, heure de Pékin. L'annonce vous demande de déplacer la charge.

  3. 03

    Qualifier tout checkpoint ouvert d'Apache 2.0. Qwen3.8-Max sort sous une licence propriétaire. Muse Glimmer est un autre pari.

  4. 04

    Répéter la rumeur d'interdiction géographique. La licence publiée n'a aucune clause territoriale USA / UE / Royaume-Uni / Corée.

  5. 05

    Lire GLM-5.3 comme un nouveau modèle de fondation. Même base 743B que la 5.2. Le saut vient de l'échelle du RL en post-training.

  6. 06

    Supposer qu'un modèle chinois reste le moins cher. DeepSeek hors pointe sous-cote encore Claude Opus 5. Luna et Qwen international sous-cotent désormais DeepSeek.

02

Les chiffres : ce qui a réellement changé

Les tarifs ci-dessous viennent de l'annonce officielle de DeepSeek, recoupée avec Wall Street CN, IT Home et V2EX. Les scores GLM sont ceux déclarés par Zhipu. Aucun rejeu indépendant n'a encore été publié.

La hausse DeepSeek, palier par palier

Effective le 17 août 2026, 00:00 heure de Pékin. Heures de pointe : 9–12 et 14–18, heure de Pékin. Unité : par 1M tokens.

Poste de facturationAncien tarifNouveau hors pointeNouveau pointeHausse en pointe
V4-Flash cache hit (entrée)¥0.02¥0.05¥0.10~400%
V4-Flash cache miss (entrée)¥1.0¥1.5¥3.0200%
V4-Flash sortie¥2.0¥4.5¥9.0350%
V4-Pro cache hit (entrée)¥0.025¥0.15¥0.30~1100%
V4-Pro cache miss (entrée)¥3.0¥4.5¥9.0200%
V4-Pro sortie¥6.0¥13.5¥27.0350%
info

Contexte : Le chiffre ~1100% en une s'applique à l'entrée cache-hit en heures de pointe. Les tarifs de sortie, qui dominent la plupart des factures réelles, ont augmenté de 350%. Une modélisation indépendante d'une charge lourde réaliste (environ 84M tokens/mois, surtout hors pointe, moitié de cache hits) aboutit à une hausse de facture plus proche de 1.8x.

Qwen3.8-2.4T-A95B (poids ouverts de Qwen3.8-Max)

SpécificationDétail
Paramètres2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routed + 1 shared)
Fenêtre de contexte262,144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; la version Max hébergée est à 1M par défaut
Cadence de sortieAperçu le 2 août → API le 3 août → poids ouverts le 12 août
Tarif API (international)$2/M en entrée, $6/M en sortie
LicencePas Apache 2.0 — une licence Qwen3.8-Max spécifique
Pourquoi cela comptePremière fois qu'Alibaba ouvre les poids d'un flagship de rang Max ; Qwen3.5 / 3.6 / 3.7 Max sont restés API only

GLM-5.3 face à GLM-5.2 : même base, post-training seul

BenchmarkGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04.6%28.3%+23.7 pts
DeepSWE v1.146.2%66.9%+20.7 pts
Agents' Last Exam (CLI)23.8%28.5%+4.7 pts
CyberGym77.2%84.5%+7.3 pts
AutomationBench26.2%48.2%+22.0 pts
warning

Réserve : Ce sont les chiffres déclarés par Zhipu. GLM-5.3 reste derrière GPT-5.6 Sol (34.6%) et Claude Fable 5 (33.7%) sur Terminal-Bench 3.0. C'est un résultat de premier plan en open weight, pas une victoire frontier sans appel.

03

Décryptage des trois stratégies

Trois laboratoires. Trois jeux. Une question en dessous : lorsque l'usage croît plus vite que les GPU et que les rendements du préentraînement s'aplatissent, qui conserve encore le pouvoir de fixer les prix.

DeepSeek : tarifer selon l'heure, c'est exposer un problème de capacité

La lecture la plus commode serait : « le modèle chinois le moins cher a fini par céder à la pression sur les marges ». La structure tarifaire dit plutôt l'inverse : une entreprise rend visibles, dans la grille, des contraintes de calcul. Un prix plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait. Une fois l'usage devenu exponentiel et la capacité stagnante, quelque chose devait devenir explicite. « Encourager une planification plus souple des charges » est le langage corporate de « le compute de pointe est désormais rare, déplacez vous-même votre charge ».

Un détail que la couverture internationale a largement manqué : aux heures de pointe, le tarif API officiel de DeepSeek dépasse désormais plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres affichent aujourd'hui V4 Pro sous le nouveau tarif de pointe DeepSeek). L'idée que l'API officielle soit toujours le moyen le moins cher d'exécuter DeepSeek est rompue pour la première fois.

Alibaba : les poids ouverts achètent l'attention ; une licence sur mesure protège le plafond

Alibaba a fait deux choses à la fois. Il a publié le checkpoint complet à 2.4T paramètres en téléchargement libre, et il y a attaché une licence spécifique — pas l'Apache 2.0 permissif des plus petits Qwen. Toute activité Model-as-a-Service ou AI Work Assistant dépassant $50M de revenus sur une période de 12 mois doit négocier une licence commerciale séparée. Les produits à 100M MAU ou $20M de revenus mensuels doivent afficher le nom du modèle de façon proéminente.

Offrir les poids pour gagner l'esprit des développeurs, surtout à l'international. Garder un levier tarifaire sur la poignée d'entreprises capables de bâtir un métier d'inférence concurrent par-dessus. C'est un pari nettement différent de celui de Muse Glimmer, qui sort sous Apache 2.0 sans restriction.

info

Rumeur à éteindre : Les affirmations selon lesquelles la licence d'Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié ne contient aucune clause géographique ou territoriale. Lire le fichier LICENSE, pas le fil d'annonce.

GLM-5.3 : pas de nouvelle base, seulement un pari plus large sur le post-training

Le fait le plus intéressant est la méthode : même base à 743B paramètres que GLM-5.2, pas de réentraînement, et un saut d'environ 6x sur Terminal-Bench 3.0 (4.6% → 28.3%) obtenu en élargissant les environnements d'apprentissage par renforcement pendant le post-training. À mesure que les lois d'échelle du préentraînement montrent des rendements décroissants, l'échelle du RL en post-training devient un levier de performance autonome, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. Des labs de rang intermédiaire, sans budget de calcul à l'échelle d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agentiques et de code.

Les laboratoires d'IA chinois passent d'une concurrence sur le seul prix à une concurrence sur le pouvoir de le fixer.

04

Face-à-face : DeepSeek reste-t-il le modèle frontier le moins cher ?

Conversion RMB-USD autour de ¥7.15/$1, à titre indicatif. En cas d'écart, les annonces officielles l'emportent.

ModèleEntrée (par 1M tokens)Sortie (par 1M tokens)Poids ouverts ?
DeepSeek V4-Pro (pointe)¥9.0 (~$1.26)¥27.0 (~$3.78)Non
DeepSeek V4-Pro (hors pointe)¥4.5 (~$0.63)¥13.5 (~$1.89)Non
Qwen3.8-Max (API internationale)$2.00$6.00Oui (licence spécifique)
OpenAI GPT-5.6 Luna$0.20$1.20Non
Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba)~$5.00~$25.00Non

La réponse courte : non. Le tarif hors pointe de DeepSeek V4-Pro reste bien en dessous de Claude Opus 5, mais ce n'est plus l'option la moins chère sans discussion. Le tarif international de Qwen3.8-Max et Luna d'OpenAI sous-cotent désormais le hors pointe DeepSeek. « Modèle chinois = modèle le moins cher » a été vrai pendant l'essentiel de 2025 et le début de 2026. Ce n'est plus une hypothèse sûre.

Six étapes après la hausse : facture, routage, licence

  1. 01

    Découper la facture en trois colonnes. Entrée cache-hit, entrée cache-miss, et sortie. Ne pas budgéter à partir d'un seul titre à ~1100%.

  2. 02

    Projeter les jobs sur les heures de pointe de Pékin. 9–12 et 14–18, heure de Pékin, sont facturés en pointe. Déplacer ce qui peut l'être vers les 17 autres heures.

  3. 03

    Mesurer le taux de cache-hit. Une charge lourde modélisée (~84M tokens/mois, surtout hors pointe, moitié de hits) se situe près de 1.8x, pas 12x.

  4. 04

    Comparer le pic officiel aux revendeurs. GMI Cloud et Novita affichent aujourd'hui V4 Pro sous le nouveau pic DeepSeek. L'officiel n'est plus automatiquement le moins cher.

  5. 05

    Lire le fichier LICENSE avant tout usage commercial. Les seuils Qwen sont $50M de revenus MaaS / AI Work Assistant et 100M MAU ou $20M de revenus mensuels pour l'attribution. Pas d'interdiction géographique.

  6. 06

    Accepter GLM-5.3 comme levier de post-training. Terminal-Bench 3.0 officiel : 28.3% contre 4.6%. Toujours derrière Sol 34.6% et Fable 5 à 33.7%. Valider sur cette base.

text
# DeepSeek V4-Pro sortie (par 1M tokens, carte officielle)
Ancien tarif plat : ¥6.0
Nouveau hors pointe : ¥13.5   (+125% vs ancien ; moitié du pic)
Nouveau pic :         ¥27.0   (+350% vs ancien)

# Trois questions avant de citer un titre
1) Entrée cache-hit, entrée cache-miss, ou sortie ?
2) Pointe ou hors pointe ?
3) Quel est mon vrai taux de cache-hit ?
05

Ce qui est contesté, pourquoi cela compte, et trois chiffres citables

Ce qui reste contesté ou non vérifié

  • Le titre à ~1100% est techniquement exact, mais trompeur sans contexte. Il ne s'applique qu'à l'entrée cache-hit en heures de pointe. Les tarifs de sortie ont augmenté de 350%. Plusieurs médias ont cité des paliers différents comme s'ils racontaient toute l'histoire.
  • Les affirmations selon lesquelles Qwen3.8-Max tournerait sur les puces internes Zhenwu M890 d'Alibaba (et des supernodes « Pangu AL128 »), relayées par plusieurs médias financiers chinois, n'ont pas été confirmées de façon indépendante par la documentation technique d'Alibaba ni par des benchmarks tiers. À traiter comme un reporting proche du vendeur, non vérifié.
  • La découverte rapportée par GLM-5.3 d'une « faille grave » dans Cursor vient de VentureBeat et de la disclosure de Zhipu. Les détails techniques précis n'ont pas été rendus publics. À lire comme une finding d'origine vendeur, non auditée de façon indépendante.
  • Les informations selon lesquelles le ministère chinois du Commerce préparerait des contrôles à l'exportation de rétorsion sur les technologies d'IA et de semi-conducteurs restent spéculatives et s'appuient sur des articles non confirmés, pas sur une annonce officielle.

Deux guerres des prix en parallèle

Sur le mois écoulé, les principaux labs chinois ont enchaîné des sorties majeures à un rythme que la presse financière intérieure commence à appeler « trois mises à jour de modèles par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2.8T paramètres) et MiniMax H3. La couverture chinoise présente largement cela comme des sorties open weight chinoises qui forcent une revalorisation mondiale de l'industrie de l'IA.

Les labs américains jouent le mouvement inverse côté grand public : OpenAI a baissé de 80% le tarif de son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité une semaine plus tard (6–7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur sorti trois semaines plus tôt (13 août). Les labs chinois ouvrent les poids de leurs flagships et introduisent une tarification étagée, plus élevée, là où le compute manque. Les labs américains courent vers le gratuit et le bon marché à l'extrémité consommateur.

Il y a aussi une couche géopolitique qu'il faut nommer avec soin. L'ouverture des poids de Kimi K3 par Moonshot en juillet a déjà attiré l'attention des autorités de sécurité américaines. Qu'Alibaba choisisse précisément cette fenêtre pour ouvrir un flagship 2.4T a été lu par certains analystes comme une manière de verrouiller l'attention internationale et un récit de « parité technologique » avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — et elle passe facilement inaperçue si l'on ne lit que les posts produit en anglais.

Chiffres citables (à la date de publication)

  • Sortie de pointe DeepSeek V4-Pro : ¥27.0 par 1M tokens, en hausse de 350% depuis ¥6.0. Entrée cache-hit : ¥0.025 → ¥0.30, soit environ ~1100%.
  • Qwen3.8-2.4T-A95B : 2.4T au total / 95B actifs, MoE 512 experts (10 routed + 1 shared), checkpoint ouvert natif de 262,144 tokens.
  • GLM-5.3 Terminal-Bench 3.0 : 28.3% officiels (5.2 était à 4.6%), toujours sous GPT-5.6 Sol 34.6% et Claude Fable 5 à 33.7%.

Sources : annonce tarifaire officielle de DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX ; dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et South China Morning Post sur les termes de licence ; page technique GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn ; blog officiel de Meta AI Research ; médias financiers chinois (Yicai, Sohu Finance) sur le rythme des sorties. Vérifier les derniers tarifs et termes de licence officiels avant toute republication. Les détails signalés ci-dessus comme non vérifiés n'ont pas été confirmés de façon indépendante.

Une tarification API pointe / hors pointe rend l'inférence flagship en continu plus chère et plus difficile à prévoir. Héberger soi-même un MoE 2.4T est un problème de datacenter, pas d'ordinateur portable. Les revendeurs peuvent raboter le tarif de pointe, mais garer des agents de production, des builds Xcode et de longues sessions sur une file d'inférence partagée laisse une isolation faible. Pour un environnement de production plus stable, adapté à la CI/CD iOS et à l'automatisation d'agents IA, la location cloud de Mac Mini NodeMini est en général le meilleur choix — Apple Silicon dédié, facturation à l'échelle du nœud, sans se battre pour les mêmes heures de pointe de Pékin sur la même facture GPU.

FAQ

Questions fréquentes

Son tarif hors pointe reste inférieur à Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'ensemble. GPT-5.6 Luna d'OpenAI ($0.20/$1.20 par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba ($2/$6) sous-cotent désormais les nouveaux tarifs hors pointe de DeepSeek sur au moins une dimension. Pour sortir les agents de code de la file partagée des heures de pointe, comparer les tarifs de location Mac Mini.

Oui, dans la plupart des cas. Les projets personnels et l'usage interne en entreprise ne sont pas concernés. La restriction ne s'applique que si vous exploitez une activité Model-as-a-Service ou AI Work Assistant ayant généré plus de $50M sur une période glissante de 12 mois.

Non. Cette affirmation a circulé en ligne, mais elle est fausse. La licence publiée ne contient aucune restriction géographique. Les limites sont liées au chiffre d'affaires, pas au lieu où vous ou vos utilisateurs vous trouvez.

Aucune au niveau du modèle de base. Les deux s'appuient sur le même modèle de fondation à 743B paramètres. Les gains (environ 6x sur Terminal-Bench 3.0) viennent entièrement de l'amplification de l'apprentissage par renforcement pendant le post-training.

Pas encore. Muse Glimmer est un modèle distillé de 30B, pas le vrai flagship de Meta. Mark Zuckerberg a annoncé que les poids ouverts de Muse Spark 1.2 arriveraient bientôt. À l'heure où nous écrivons, cette publication n'a pas eu lieu. Notes d'isolation et d'accès dans le centre d'aide.