Alibaba Qwen3.8-Max :
2,4 billions de paramètres dans le top 5 Arena, open source la semaine prochaine

Le 3 août 2026, Alibaba a officiellement lancé son nouveau modèle flagship Qwen3.8-Max (2,4 billions de paramètres totaux, 95 milliards activés, contexte de 1 million de tokens), accompagné de l'agent produit « Qwen Office ». Cet article s'adresse aux développeurs qui évaluent le choix de modèle et le coût des workflows agent. Il couvre : la chronologie juillet–août, les benchmarks et grilles tarifaires, une analyse approfondie de l'architecture MoE, une comparaison avec Kimi K3 / DeepSeek V4 / Claude, la controverse du label open source, le contexte sectoriel, une checklist d'évaluation en six étapes et une FAQ. Point clé : la 5e place sur Arena Text (1496 points, Preliminary) reste le seul signal tiers vérifiable ; les autres scores proviennent des tests internes d'Alibaba, et la promesse de publication des poids « la semaine prochaine » n'était pas concrétisée à la date de rédaction.

01

Chronologie : de la preview à la GA, un rythme soutenu en deux semaines

Juillet–août 2026 marque une fenêtre dense de lancements chinois au seuil du trillion de paramètres. Le calendrier ci-dessous recense les événements confirmés et les déclarations officielles, pour situer Qwen3.8-Max face à Kimi K3 et DeepSeek V4-Flash.

DateÉvénement
16 juilletMoonshot AI lance Kimi K3 — 2,8 billions de paramètres (16 experts activés sur 896), avec évaluations indépendantes et rapport technique transparent
19 juilletQwen3.8-Max ouvert en « preview » via Token Plan / Qoder / QoderWork à 10 % du tarif GA prévu ; paramètres activés et benchmarks non publiés ; les CGU interdisent les appels automatisés en production
27 juilletKimi K3 publie ses poids sur Hugging Face comme promis, avec noyaux d'attention et bibliothèques MoE open source
31 juilletDeepSeek sort V4-Flash en GA : taille inchangée, gains marqués sur les benchmarks agent et code par rapport à V4-Pro preview
3 aoûtQwen3.8-Max en GA avec tableau complet de benchmarks ; l'agent « Qwen Office » est lancé en parallèle ; l'action Alibaba +7 % à Hong Kong et +4,5 % à Wall Street
Vers le 10 août (estimé)Publication prévue des poids Qwen3.8-Max et de la version allégée Qwen3.8-27B sur Hugging Face et ModelScope — à la rédaction, date exacte et licence non annoncées

Six pièges d'information que les développeurs doivent éviter

  1. 01

    Confondre le label Open-Source avec une publication effective : le site affiche open source dès le jour GA, mais Hugging Face / ModelScope n'ont ni dépôt ni licence

  2. 02

    Paramètres totaux ≠ coût d'inférence : sur 2,4T totaux, seuls 95 milliards sont activés — la facture se rapproche d'un modèle cent milliard

  3. 03

    Benchmarks majoritairement auto-évalués : PaperBench, RecreationBench, etc. relèvent du framework interne d'Alibaba ; la GA n'a pas encore été reproduite par des tiers

  4. 04

    Classement Arena marqué Preliminary : 1496 points et 5e place Text restent provisoires, pas un verdict final

  5. 05

    Transparence insuffisante en preview : en juillet, paramètres activés, model card et évaluation sécurité absents ; plusieurs organismes déconseillaient la migration prod

  6. 06

    Notes de bas de tableau contestables : la comparaison suggère un possible fallback sur les scores Fable 5, alors que la méthodologie d'Alibaba n'est pas non plus entièrement publique

warning

Vérification : les données de cet article sont arrêtées au 4 août 2026. Date de publication des poids, classement Arena définitif et retests indépendants peuvent évoluer — avant toute migration prod, consultez les annonces officielles d'Alibaba et les évaluations tierces.

02

Données clés : spécifications officielles et benchmarks Qwen3.8-Max

ÉlémentQwen3.8-Max
Date de sortie3 août 2026 (GA)
Paramètres totaux / activés2,4 billions / 95 milliards
ArchitectureMoE sparse basé sur Qwen3.5 + attention hybride
Fenêtre de contexte1 million de tokens (mode réflexion ~983 000 ; plafond sortie 131 000)
Modalités d'entréeTexte / image / vidéo
Tarif APIEntrée 2 $/M tokens, sortie 6 $/M (cache implicite hit 0,25 $ ; cache explicite écriture 2,5 $, lecture 0,17 $)
Tarif ChineEntrée 12 ¥/M tokens, sortie 36 ¥/M ; cache hit dès 1,5 ¥
Arena Text (snapshot 01/08)5e place, 1496 points (Preliminary) ; seul modèle non-Anthropic dans le top 8
Arena Vision2e place, derrière Claude Fable 5
PaperBench (test Alibaba)93,0 (+28,2 vs génération précédente)
OSWorld-Verified (test Alibaba)86,1
SWE-bench Pro (test Alibaba)67,7 (vs 80,0 pour Fable 5)
HLE (test Alibaba)43,6 (plus bas des modèles flagship ; Fable 5 : 53,3)
Statut open weightsPromis « la semaine prochaine » — non publiés à la rédaction

Note : les lignes marquées « test Alibaba » proviennent des documents officiels de lancement ; Artificial Analysis, Arena.ai et autres n'ont pas encore reproduit indépendamment la version GA.

03

Analyse : que cherche à résoudre Alibaba derrière 2,4 billions de paramètres ?

Pourquoi MoE + attention hybride plutôt qu'un simple empilement de paramètres ?

Qwen3.8-Max prolonge la ligne Qwen3.5 : le MoE sparse porte les paramètres totaux à 2,4 billions tout en limitant l'activation à 95 milliards — le coût d'inférence se rapproche d'un modèle cent milliard, pas d'un appel à 2,4T. C'est aussi ce qui permet une tarification API à 2 $/6 $, nettement en dessous de Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $) : l'efficacité architecturale achetée en compétitivité prix.

Trois niveaux reasoning_effort : contrôle des coûts par défaut

Le modèle propose trois intensités de raisonnement — low / medium / xhigh (xhigh par défaut) — pour ajuster vitesse et profondeur selon la tâche. Paramètre enable_thinking ou champ reasoning.effort via l'interface compatible Anthropic.

Tâches autonomes longues : promesse et méthode de validation

Les cas cités par Alibaba incluent un projet de code autonome sur 16 jours sans intervention humaine, une optimisation de conception de puce en plus de 500 étapes, et RecreationBench (reproduction d'applications réelles en boîte noire, guidée par interaction et retour visuel). Une partie des traces est consultable sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.

Positionnement écosystème : du modèle à l'agent produit

Qwen3.8-Max est intégré à « Qwen Office » ; l'API est compatible OpenAI et Anthropic, et se branche directement sur Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw et autres chaînes agent mainstream — migration facilitée.

Checklist d'évaluation en six étapes (mise en production)

  1. 01

    Séparer API et poids : l'API QwenCloud est disponible ; pour un déploiement local, attendre Qwen3.8-27B open source ou confirmer la licence Max

  2. 02

    Établir une baseline de coût : estimer la facture mensuelle à 2 $/6 $ et cache hit 0,25 $, comparer à Kimi K3 (3 $/15 $)

  3. 03

    Configurer reasoning_effort : medium/low pour les tâches sensibles à la latence ; xhigh pour les agents complexes

  4. 04

    Tester en A/B sur cas réels : ne pas migrer sur les seuls benchmarks officiels ; comparer en aveugle avec Kimi K3 sur votre codebase

  5. 05

    Suivre les retests tiers : Artificial Analysis, classement Arena définitif, annonce Hugging Face des poids

  6. 06

    Examiner conformité et flux de données : en entreprise, évaluer CGU cloud Alibaba, rétention des logs et exigences d'audit des sorties modèle

04

Comparaison : Qwen3.8-Max, Kimi K3, DeepSeek V4 et Claude

ModèleÉditeurTotal / activésContexteTarif (entrée/sortie, par M tokens)Open weightsÉval. indép.
Qwen3.8-MaxAlibaba2,4T / 95 Mrd1 M2 $ / 6 $Non (promis)Aucune
Kimi K3Moonshot AI2,8T / ~50 Mrd~1,048 M3 $ / 15 $Oui (27/07)AA Index ≈ 57,11
DeepSeek V4-ProDeepSeek1,6T / 49 Mrd1 MGrille incomplèteOuiSWE-bench Verified 80,6 %
DeepSeek V4-FlashDeepSeekInchangé1 MGrille incomplèteOui9 benchmarks agent/code > V4-Pro
Claude Opus 5AnthropicNon divulgué1 M5 $ / 25 $FerméTête de file Arena
Claude Fable 5AnthropicNon divulgué1 M10 $ / 50 $Fermé1er Arena Text

Détail souvent négligé : Kimi K3 et DeepSeek ont publié tôt leurs paramètres activés ; Alibaba n'a communiqué « 95 milliards » qu'à la GA — le manque de transparence en preview a alimenté les critiques des évaluateurs indépendants en juillet. Le seul test aveugle comparable (269 fichiers, tâche d'architecture projet réel) donne Kimi K3 83 points et Qwen3.8-Max preview 80 — même catégorie, résultats alternés.

« Rejoindre la première ligue mondiale » et « devancer GPT-5.6 Sol et Fable 5 » restent pour l'instant surtout des affirmations d'Alibaba — la validation passera par la publication des poids et les benchmarks tiers.

05

Controverses et contexte sectoriel : le label open source avant les poids

  • Site marqué Open-Source, poids absents : label posé le jour GA, sans dépôt Hugging Face / ModelScope, licence ni date ferme
  • Benchmarks issus de frameworks internes : QwenSWEBench, CoWorkBench, RecreationBench, etc. — les plateformes neutres n'ont pas reproduit la GA
  • Notes de bas de tableau sur les concurrents : « les résultats Fable 5 pourraient impliquer un fallback » sans détail technique ; la méthodologie Alibaba n'est pas non plus entièrement publique
  • Preview interdisant la prod : CGU du 19 juillet limitant l'automatisation en environnement de production, sans model card ni évaluation sécurité

2026 : la course au trillion entre dans une nouvelle phase

  • Course aux paramètres vs efficacité architecturale : DeepSeek V4-Flash montre qu'on peut fortement améliorer les capacités agent sans grossir le modèle ; Qwen3.8-Max prolonge le récit « grande capacité, faible activation »
  • Retour rare d'Alibaba à l'open source : première promesse de poids au niveau Max, aux côtés de Kimi K3 et DeepSeek dans un paysage chinois largement ouvert
  • Déploiement grand public : Qwen compressé comme moteur d'Apple Intelligence en Chine, jusqu'à des centaines de millions d'iPhone au niveau système
  • Réaction des marchés : +7 % à Hong Kong et +4,5 % à Wall Street le jour du lancement
  • Contraste réglementaire sino-américain : la Maison Blanche réunit OpenAI, Anthropic et autres sur un cadre de tests cybersécurité pour agents — accélération open source d'un côté, resserrement des contrôles agent de l'autre

Référence rapide des chiffres clés

  • Spécifications : 2,4T total / 95 Mrd activés / 1M contexte / entrée multimodale
  • Tarification : API 2 $/6 $ ; Chine 12/36 ¥ par million de tokens
  • Arena : Text 5e (1496, Preliminary) ; Vision 2e
  • Test aveugle indépendant : Kimi K3 83 vs Qwen preview 80 (architecture)
  • Promesse open source : Qwen3.8-Max + Qwen3.8-27B, vers le 10 août

Si vous envisagez d'intégrer Qwen3.8-Max dans Claude Code, Qoder ou OpenClaw pour des sessions agent longues, faire tourner des CLI sur un portable ou un VPS Linux instable entraîne souvent manque de mémoire, sessions interrompues et absence de la toolchain Xcode/Metal. Pour les environnements de production nécessitant des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS, la location cloud Mac Mini de NodeMini est généralement la meilleure option — nœuds dédiés, provisionnement en quelques secondes, agents et builds sur le même matériel Mac réel. Voir les tarifs de location Mac Mini.

Sources : blog et communiqués officiels Alibaba Cloud, classement Arena.ai (snapshot 2026-08-01), analyses Apidog / Yotta Labs / TechNode, couverture Apple Intelligence Chine. Vérifier les annonces officielles avant toute décision.

FAQ

Questions fréquentes

L'API est accessible via QwenCloud, compatible OpenAI et Anthropic. Les poids ne sont pas encore publiés : le site affiche Open-Source, mais dépôts Hugging Face / ModelScope et licence sont attendus « la semaine prochaine » (vers le 10 août). Pour l'environnement d'intégration, voir les tarifs de location Mac Mini.

Pas d'évaluation unifiée reconnue. Le seul test aveugle indépendant montre des scores très proches (Kimi K3 : 83, Qwen preview : 80) — même catégorie. Kimi K3 a l'avantage des poids ouverts et des données tierces ; Qwen3.8-Max offre une API moins chère et un multimodal plus complet.

Distinguez total et activés : 95 milliards activés, coût API proche d'un modèle cent milliard. Un déploiement privé complet exige un datacenter multi-nœuds ; l'option réaliste pour la plupart est d'attendre Qwen3.8-27B open source.

Référence utile, pas verdict. Données issues du framework interne ; les plateformes neutres n'ont pas reproduit la GA. Suivez les retests indépendants ou menez des A/B sur vos cas métier.

Au-delà d'une API flagship moins chère, Apple Intelligence en Chine s'appuie sur un Qwen compressé exécuté localement — les utilisateurs iPhone en bénéficient au niveau système. Autres questions : centre d'aide.