En cinq jours, trois des principaux laboratoires d'IA chinois ont fait des gestes qui, à première vue, se contredisent. DeepSeek a relevé ses tarifs API jusqu'à ~1100% sur certaines tranches. Alibaba a ouvert les poids d'un flagship à 2.4T paramètres qu'il n'avait jamais publié. Zhipu a livré GLM-5.3 et fait progresser les benchmarks de code d'environ 6x sur le même modèle de base — sans réentraînement. Ce texte guide développeurs et acheteurs à travers la chronologie, la grille tarifaire, les trois stratégies, le face-à-face, les affirmations contestées et la FAQ. Le signal commun : les labs chinois ne se battent plus seulement sur le prix, mais sur le pouvoir de le fixer.
L'erreur la plus simple consiste à traiter ~1100% comme la facture entière. On commence par les dates, puis on sépare dimension de facturation, type de licence et source des benchmarks.
| Date | Événement |
|---|---|
| 16 juillet 2026 | Moonshot AI ouvre les poids de Kimi K3 (2.8T paramètres), ce qui attire l'attention des autorités de sécurité américaines |
| 2–3 août 2026 | Alibaba prévisualise puis lance Qwen3.8-Max en API hébergée |
| 10 août 2026 | Meta publie Muse Glimmer (30B, Apache 2.0) et évoque des poids ouverts pour le flagship Muse Spark 1.2 |
| 12 août 2026 | Alibaba publie les poids ouverts de Qwen3.8-2.4T-A95B sur Hugging Face / ModelScope ; xAI livre Grok 4.6 |
| 13 août 2026 | DeepSeek-V4-Pro passe en GA et annonce une hausse effective le 17 août ; Google livre Gemini 3.7 Flash à tarif réduit |
| 14 août 2026 | Zhipu livre GLM-5.3 en réutilisant la base 743B de GLM-5.2 |
| 17 août 2026, 00:00 heure de Pékin | Les nouveaux tarifs DeepSeek entrent en vigueur |
En reculant d'un cran : le 30 juillet, OpenAI a baissé les prix de son palier le moins cher (GPT-5.6 Luna, −80 %), puis les 6–7 août a fait de Luna le défaut gratuit, avec des chats texte illimités. Pendant que les labs chinois relevaient leurs tarifs et ouvraient les poids de leurs flagships, les labs américains baissaient les leurs et passaient au gratuit côté grand public — au même moment. Ce sont les deux faces d'une même guerre des prix.
Prendre ~1100% pour la facture entière. Ce chiffre concerne l'entrée cache-hit en heures de pointe, le palier qui était le plus proche de la gratuité.
Ignorer les fenêtres de pointe de Pékin. Les heures de pointe sont 9–12 et 14–18, heure de Pékin. L'annonce vous demande de déplacer la charge.
Qualifier tout checkpoint ouvert d'Apache 2.0. Qwen3.8-Max sort sous une licence propriétaire. Muse Glimmer est un autre pari.
Répéter la rumeur d'interdiction géographique. La licence publiée n'a aucune clause territoriale USA / UE / Royaume-Uni / Corée.
Lire GLM-5.3 comme un nouveau modèle de fondation. Même base 743B que la 5.2. Le saut vient de l'échelle du RL en post-training.
Supposer qu'un modèle chinois reste le moins cher. DeepSeek hors pointe sous-cote encore Claude Opus 5. Luna et Qwen international sous-cotent désormais DeepSeek.
Les tarifs ci-dessous viennent de l'annonce officielle de DeepSeek, recoupée avec Wall Street CN, IT Home et V2EX. Les scores GLM sont ceux déclarés par Zhipu. Aucun rejeu indépendant n'a encore été publié.
Effective le 17 août 2026, 00:00 heure de Pékin. Heures de pointe : 9–12 et 14–18, heure de Pékin. Unité : par 1M tokens.
| Poste de facturation | Ancien tarif | Nouveau hors pointe | Nouveau pointe | Hausse en pointe |
|---|---|---|---|---|
| V4-Flash cache hit (entrée) | ¥0.02 | ¥0.05 | ¥0.10 | ~400% |
| V4-Flash cache miss (entrée) | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro cache hit (entrée) | ¥0.025 | ¥0.15 | ¥0.30 | ~1100% |
| V4-Pro cache miss (entrée) | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Contexte : Le chiffre ~1100% en une s'applique à l'entrée cache-hit en heures de pointe. Les tarifs de sortie, qui dominent la plupart des factures réelles, ont augmenté de 350%. Une modélisation indépendante d'une charge lourde réaliste (environ 84M tokens/mois, surtout hors pointe, moitié de cache hits) aboutit à une hausse de facture plus proche de 1.8x.
| Spécification | Détail |
|---|---|
| Paramètres | 2.4T au total, 95B actifs par token (MoE, 512 experts, 10 routed + 1 shared) |
| Fenêtre de contexte | 262,144 tokens natifs (checkpoint ouvert), extensible à ~1.01M ; la version Max hébergée est à 1M par défaut |
| Cadence de sortie | Aperçu le 2 août → API le 3 août → poids ouverts le 12 août |
| Tarif API (international) | $2/M en entrée, $6/M en sortie |
| Licence | Pas Apache 2.0 — une licence Qwen3.8-Max spécifique |
| Pourquoi cela compte | Première fois qu'Alibaba ouvre les poids d'un flagship de rang Max ; Qwen3.5 / 3.6 / 3.7 Max sont restés API only |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 pts |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 pts |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 pts |
| CyberGym | 77.2% | 84.5% | +7.3 pts |
| AutomationBench | 26.2% | 48.2% | +22.0 pts |
Réserve : Ce sont les chiffres déclarés par Zhipu. GLM-5.3 reste derrière GPT-5.6 Sol (34.6%) et Claude Fable 5 (33.7%) sur Terminal-Bench 3.0. C'est un résultat de premier plan en open weight, pas une victoire frontier sans appel.
Trois laboratoires. Trois jeux. Une question en dessous : lorsque l'usage croît plus vite que les GPU et que les rendements du préentraînement s'aplatissent, qui conserve encore le pouvoir de fixer les prix.
La lecture la plus commode serait : « le modèle chinois le moins cher a fini par céder à la pression sur les marges ». La structure tarifaire dit plutôt l'inverse : une entreprise rend visibles, dans la grille, des contraintes de calcul. Un prix plat, toujours bas, fonctionnait comme outil d'acquisition tant que la capacité GPU suivait. Une fois l'usage devenu exponentiel et la capacité stagnante, quelque chose devait devenir explicite. « Encourager une planification plus souple des charges » est le langage corporate de « le compute de pointe est désormais rare, déplacez vous-même votre charge ».
Un détail que la couverture internationale a largement manqué : aux heures de pointe, le tarif API officiel de DeepSeek dépasse désormais plusieurs revendeurs tiers (GMI Cloud, Novita et d'autres affichent aujourd'hui V4 Pro sous le nouveau tarif de pointe DeepSeek). L'idée que l'API officielle soit toujours le moyen le moins cher d'exécuter DeepSeek est rompue pour la première fois.
Alibaba a fait deux choses à la fois. Il a publié le checkpoint complet à 2.4T paramètres en téléchargement libre, et il y a attaché une licence spécifique — pas l'Apache 2.0 permissif des plus petits Qwen. Toute activité Model-as-a-Service ou AI Work Assistant dépassant $50M de revenus sur une période de 12 mois doit négocier une licence commerciale séparée. Les produits à 100M MAU ou $20M de revenus mensuels doivent afficher le nom du modèle de façon proéminente.
Offrir les poids pour gagner l'esprit des développeurs, surtout à l'international. Garder un levier tarifaire sur la poignée d'entreprises capables de bâtir un métier d'inférence concurrent par-dessus. C'est un pari nettement différent de celui de Muse Glimmer, qui sort sous Apache 2.0 sans restriction.
Rumeur à éteindre : Les affirmations selon lesquelles la licence d'Alibaba interdirait les téléchargements depuis les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud sont fausses. Le texte publié ne contient aucune clause géographique ou territoriale. Lire le fichier LICENSE, pas le fil d'annonce.
Le fait le plus intéressant est la méthode : même base à 743B paramètres que GLM-5.2, pas de réentraînement, et un saut d'environ 6x sur Terminal-Bench 3.0 (4.6% → 28.3%) obtenu en élargissant les environnements d'apprentissage par renforcement pendant le post-training. À mesure que les lois d'échelle du préentraînement montrent des rendements décroissants, l'échelle du RL en post-training devient un levier de performance autonome, avec un plancher de coût bien plus bas que le réentraînement d'un nouveau modèle de fondation. Des labs de rang intermédiaire, sans budget de calcul à l'échelle d'OpenAI, peuvent encore refermer l'écart sur les benchmarks agentiques et de code.
Les laboratoires d'IA chinois passent d'une concurrence sur le seul prix à une concurrence sur le pouvoir de le fixer.
Conversion RMB-USD autour de ¥7.15/$1, à titre indicatif. En cas d'écart, les annonces officielles l'emportent.
| Modèle | Entrée (par 1M tokens) | Sortie (par 1M tokens) | Poids ouverts ? |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9.0 (~$1.26) | ¥27.0 (~$3.78) | Non |
| DeepSeek V4-Pro (hors pointe) | ¥4.5 (~$0.63) | ¥13.5 (~$1.89) | Non |
| Qwen3.8-Max (API internationale) | $2.00 | $6.00 | Oui (licence spécifique) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Non |
| Claude Opus 5 (implicite, selon le ratio de comparaison d'Alibaba) | ~$5.00 | ~$25.00 | Non |
La réponse courte : non. Le tarif hors pointe de DeepSeek V4-Pro reste bien en dessous de Claude Opus 5, mais ce n'est plus l'option la moins chère sans discussion. Le tarif international de Qwen3.8-Max et Luna d'OpenAI sous-cotent désormais le hors pointe DeepSeek. « Modèle chinois = modèle le moins cher » a été vrai pendant l'essentiel de 2025 et le début de 2026. Ce n'est plus une hypothèse sûre.
Découper la facture en trois colonnes. Entrée cache-hit, entrée cache-miss, et sortie. Ne pas budgéter à partir d'un seul titre à ~1100%.
Projeter les jobs sur les heures de pointe de Pékin. 9–12 et 14–18, heure de Pékin, sont facturés en pointe. Déplacer ce qui peut l'être vers les 17 autres heures.
Mesurer le taux de cache-hit. Une charge lourde modélisée (~84M tokens/mois, surtout hors pointe, moitié de hits) se situe près de 1.8x, pas 12x.
Comparer le pic officiel aux revendeurs. GMI Cloud et Novita affichent aujourd'hui V4 Pro sous le nouveau pic DeepSeek. L'officiel n'est plus automatiquement le moins cher.
Lire le fichier LICENSE avant tout usage commercial. Les seuils Qwen sont $50M de revenus MaaS / AI Work Assistant et 100M MAU ou $20M de revenus mensuels pour l'attribution. Pas d'interdiction géographique.
Accepter GLM-5.3 comme levier de post-training. Terminal-Bench 3.0 officiel : 28.3% contre 4.6%. Toujours derrière Sol 34.6% et Fable 5 à 33.7%. Valider sur cette base.
# DeepSeek V4-Pro sortie (par 1M tokens, carte officielle) Ancien tarif plat : ¥6.0 Nouveau hors pointe : ¥13.5 (+125% vs ancien ; moitié du pic) Nouveau pic : ¥27.0 (+350% vs ancien) # Trois questions avant de citer un titre 1) Entrée cache-hit, entrée cache-miss, ou sortie ? 2) Pointe ou hors pointe ? 3) Quel est mon vrai taux de cache-hit ?
Sur le mois écoulé, les principaux labs chinois ont enchaîné des sorties majeures à un rythme que la presse financière intérieure commence à appeler « trois mises à jour de modèles par semaine » (一周三更) — DeepSeek, Alibaba et Zhipu, plus Kimi K3 de Moonshot (poids ouverts le 16 juillet, 2.8T paramètres) et MiniMax H3. La couverture chinoise présente largement cela comme des sorties open weight chinoises qui forcent une revalorisation mondiale de l'industrie de l'IA.
Les labs américains jouent le mouvement inverse côté grand public : OpenAI a baissé de 80% le tarif de son palier le moins cher (30 juillet) puis a rendu ce modèle gratuit et illimité une semaine plus tard (6–7 août) ; Google a livré un modèle orienté code à la moitié du prix de son prédécesseur sorti trois semaines plus tôt (13 août). Les labs chinois ouvrent les poids de leurs flagships et introduisent une tarification étagée, plus élevée, là où le compute manque. Les labs américains courent vers le gratuit et le bon marché à l'extrémité consommateur.
Il y a aussi une couche géopolitique qu'il faut nommer avec soin. L'ouverture des poids de Kimi K3 par Moonshot en juillet a déjà attiré l'attention des autorités de sécurité américaines. Qu'Alibaba choisisse précisément cette fenêtre pour ouvrir un flagship 2.4T a été lu par certains analystes comme une manière de verrouiller l'attention internationale et un récit de « parité technologique » avant un éventuel durcissement réglementaire. C'est une interprétation informée, pas un fait confirmé — et elle passe facilement inaperçue si l'on ne lit que les posts produit en anglais.
Sources : annonce tarifaire officielle de DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX ; dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et South China Morning Post sur les termes de licence ; page technique GLM-5.3 de Zhipu (Z.ai), plus VentureBeat et StableLearn ; blog officiel de Meta AI Research ; médias financiers chinois (Yicai, Sohu Finance) sur le rythme des sorties. Vérifier les derniers tarifs et termes de licence officiels avant toute republication. Les détails signalés ci-dessus comme non vérifiés n'ont pas été confirmés de façon indépendante.
Une tarification API pointe / hors pointe rend l'inférence flagship en continu plus chère et plus difficile à prévoir. Héberger soi-même un MoE 2.4T est un problème de datacenter, pas d'ordinateur portable. Les revendeurs peuvent raboter le tarif de pointe, mais garer des agents de production, des builds Xcode et de longues sessions sur une file d'inférence partagée laisse une isolation faible. Pour un environnement de production plus stable, adapté à la CI/CD iOS et à l'automatisation d'agents IA, la location cloud de Mac Mini NodeMini est en général le meilleur choix — Apple Silicon dédié, facturation à l'échelle du nœud, sans se battre pour les mêmes heures de pointe de Pékin sur la même facture GPU.
Son tarif hors pointe reste inférieur à Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'ensemble. GPT-5.6 Luna d'OpenAI ($0.20/$1.20 par million de tokens) et le tarif international Qwen3.8-Max d'Alibaba ($2/$6) sous-cotent désormais les nouveaux tarifs hors pointe de DeepSeek sur au moins une dimension. Pour sortir les agents de code de la file partagée des heures de pointe, comparer les tarifs de location Mac Mini.
Oui, dans la plupart des cas. Les projets personnels et l'usage interne en entreprise ne sont pas concernés. La restriction ne s'applique que si vous exploitez une activité Model-as-a-Service ou AI Work Assistant ayant généré plus de $50M sur une période glissante de 12 mois.
Non. Cette affirmation a circulé en ligne, mais elle est fausse. La licence publiée ne contient aucune restriction géographique. Les limites sont liées au chiffre d'affaires, pas au lieu où vous ou vos utilisateurs vous trouvez.
Aucune au niveau du modèle de base. Les deux s'appuient sur le même modèle de fondation à 743B paramètres. Les gains (environ 6x sur Terminal-Bench 3.0) viennent entièrement de l'amplification de l'apprentissage par renforcement pendant le post-training.
Pas encore. Muse Glimmer est un modèle distillé de 30B, pas le vrai flagship de Meta. Mark Zuckerberg a annoncé que les poids ouverts de Muse Spark 1.2 arriveraient bientôt. À l'heure où nous écrivons, cette publication n'a pas eu lieu. Notes d'isolation et d'accès dans le centre d'aide.