Le 3 août 2026, Alibaba a officiellement lancé son nouveau modèle flagship Qwen3.8-Max (2,4 billions de paramètres totaux, 95 milliards activés, contexte de 1 million de tokens), accompagné de l'agent produit « Qwen Office ». Cet article s'adresse aux développeurs qui évaluent le choix de modèle et le coût des workflows agent. Il couvre : la chronologie juillet–août, les benchmarks et grilles tarifaires, une analyse approfondie de l'architecture MoE, une comparaison avec Kimi K3 / DeepSeek V4 / Claude, la controverse du label open source, le contexte sectoriel, une checklist d'évaluation en six étapes et une FAQ. Point clé : la 5e place sur Arena Text (1496 points, Preliminary) reste le seul signal tiers vérifiable ; les autres scores proviennent des tests internes d'Alibaba, et la promesse de publication des poids « la semaine prochaine » n'était pas concrétisée à la date de rédaction.
Juillet–août 2026 marque une fenêtre dense de lancements chinois au seuil du trillion de paramètres. Le calendrier ci-dessous recense les événements confirmés et les déclarations officielles, pour situer Qwen3.8-Max face à Kimi K3 et DeepSeek V4-Flash.
| Date | Événement |
|---|---|
| 16 juillet | Moonshot AI lance Kimi K3 — 2,8 billions de paramètres (16 experts activés sur 896), avec évaluations indépendantes et rapport technique transparent |
| 19 juillet | Qwen3.8-Max ouvert en « preview » via Token Plan / Qoder / QoderWork à 10 % du tarif GA prévu ; paramètres activés et benchmarks non publiés ; les CGU interdisent les appels automatisés en production |
| 27 juillet | Kimi K3 publie ses poids sur Hugging Face comme promis, avec noyaux d'attention et bibliothèques MoE open source |
| 31 juillet | DeepSeek sort V4-Flash en GA : taille inchangée, gains marqués sur les benchmarks agent et code par rapport à V4-Pro preview |
| 3 août | Qwen3.8-Max en GA avec tableau complet de benchmarks ; l'agent « Qwen Office » est lancé en parallèle ; l'action Alibaba +7 % à Hong Kong et +4,5 % à Wall Street |
| Vers le 10 août (estimé) | Publication prévue des poids Qwen3.8-Max et de la version allégée Qwen3.8-27B sur Hugging Face et ModelScope — à la rédaction, date exacte et licence non annoncées |
Confondre le label Open-Source avec une publication effective : le site affiche open source dès le jour GA, mais Hugging Face / ModelScope n'ont ni dépôt ni licence
Paramètres totaux ≠ coût d'inférence : sur 2,4T totaux, seuls 95 milliards sont activés — la facture se rapproche d'un modèle cent milliard
Benchmarks majoritairement auto-évalués : PaperBench, RecreationBench, etc. relèvent du framework interne d'Alibaba ; la GA n'a pas encore été reproduite par des tiers
Classement Arena marqué Preliminary : 1496 points et 5e place Text restent provisoires, pas un verdict final
Transparence insuffisante en preview : en juillet, paramètres activés, model card et évaluation sécurité absents ; plusieurs organismes déconseillaient la migration prod
Notes de bas de tableau contestables : la comparaison suggère un possible fallback sur les scores Fable 5, alors que la méthodologie d'Alibaba n'est pas non plus entièrement publique
Vérification : les données de cet article sont arrêtées au 4 août 2026. Date de publication des poids, classement Arena définitif et retests indépendants peuvent évoluer — avant toute migration prod, consultez les annonces officielles d'Alibaba et les évaluations tierces.
| Élément | Qwen3.8-Max |
|---|---|
| Date de sortie | 3 août 2026 (GA) |
| Paramètres totaux / activés | 2,4 billions / 95 milliards |
| Architecture | MoE sparse basé sur Qwen3.5 + attention hybride |
| Fenêtre de contexte | 1 million de tokens (mode réflexion ~983 000 ; plafond sortie 131 000) |
| Modalités d'entrée | Texte / image / vidéo |
| Tarif API | Entrée 2 $/M tokens, sortie 6 $/M (cache implicite hit 0,25 $ ; cache explicite écriture 2,5 $, lecture 0,17 $) |
| Tarif Chine | Entrée 12 ¥/M tokens, sortie 36 ¥/M ; cache hit dès 1,5 ¥ |
| Arena Text (snapshot 01/08) | 5e place, 1496 points (Preliminary) ; seul modèle non-Anthropic dans le top 8 |
| Arena Vision | 2e place, derrière Claude Fable 5 |
| PaperBench (test Alibaba) | 93,0 (+28,2 vs génération précédente) |
| OSWorld-Verified (test Alibaba) | 86,1 |
| SWE-bench Pro (test Alibaba) | 67,7 (vs 80,0 pour Fable 5) |
| HLE (test Alibaba) | 43,6 (plus bas des modèles flagship ; Fable 5 : 53,3) |
| Statut open weights | Promis « la semaine prochaine » — non publiés à la rédaction |
Note : les lignes marquées « test Alibaba » proviennent des documents officiels de lancement ; Artificial Analysis, Arena.ai et autres n'ont pas encore reproduit indépendamment la version GA.
Qwen3.8-Max prolonge la ligne Qwen3.5 : le MoE sparse porte les paramètres totaux à 2,4 billions tout en limitant l'activation à 95 milliards — le coût d'inférence se rapproche d'un modèle cent milliard, pas d'un appel à 2,4T. C'est aussi ce qui permet une tarification API à 2 $/6 $, nettement en dessous de Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $) : l'efficacité architecturale achetée en compétitivité prix.
Le modèle propose trois intensités de raisonnement — low / medium / xhigh (xhigh par défaut) — pour ajuster vitesse et profondeur selon la tâche. Paramètre enable_thinking ou champ reasoning.effort via l'interface compatible Anthropic.
Les cas cités par Alibaba incluent un projet de code autonome sur 16 jours sans intervention humaine, une optimisation de conception de puce en plus de 500 étapes, et RecreationBench (reproduction d'applications réelles en boîte noire, guidée par interaction et retour visuel). Une partie des traces est consultable sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.
Qwen3.8-Max est intégré à « Qwen Office » ; l'API est compatible OpenAI et Anthropic, et se branche directement sur Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw et autres chaînes agent mainstream — migration facilitée.
Séparer API et poids : l'API QwenCloud est disponible ; pour un déploiement local, attendre Qwen3.8-27B open source ou confirmer la licence Max
Établir une baseline de coût : estimer la facture mensuelle à 2 $/6 $ et cache hit 0,25 $, comparer à Kimi K3 (3 $/15 $)
Configurer reasoning_effort : medium/low pour les tâches sensibles à la latence ; xhigh pour les agents complexes
Tester en A/B sur cas réels : ne pas migrer sur les seuls benchmarks officiels ; comparer en aveugle avec Kimi K3 sur votre codebase
Suivre les retests tiers : Artificial Analysis, classement Arena définitif, annonce Hugging Face des poids
Examiner conformité et flux de données : en entreprise, évaluer CGU cloud Alibaba, rétention des logs et exigences d'audit des sorties modèle
| Modèle | Éditeur | Total / activés | Contexte | Tarif (entrée/sortie, par M tokens) | Open weights | Éval. indép. |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | Alibaba | 2,4T / 95 Mrd | 1 M | 2 $ / 6 $ | Non (promis) | Aucune |
| Kimi K3 | Moonshot AI | 2,8T / ~50 Mrd | ~1,048 M | 3 $ / 15 $ | Oui (27/07) | AA Index ≈ 57,11 |
| DeepSeek V4-Pro | DeepSeek | 1,6T / 49 Mrd | 1 M | Grille incomplète | Oui | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | DeepSeek | Inchangé | 1 M | Grille incomplète | Oui | 9 benchmarks agent/code > V4-Pro |
| Claude Opus 5 | Anthropic | Non divulgué | 1 M | 5 $ / 25 $ | Fermé | Tête de file Arena |
| Claude Fable 5 | Anthropic | Non divulgué | 1 M | 10 $ / 50 $ | Fermé | 1er Arena Text |
Détail souvent négligé : Kimi K3 et DeepSeek ont publié tôt leurs paramètres activés ; Alibaba n'a communiqué « 95 milliards » qu'à la GA — le manque de transparence en preview a alimenté les critiques des évaluateurs indépendants en juillet. Le seul test aveugle comparable (269 fichiers, tâche d'architecture projet réel) donne Kimi K3 83 points et Qwen3.8-Max preview 80 — même catégorie, résultats alternés.
« Rejoindre la première ligue mondiale » et « devancer GPT-5.6 Sol et Fable 5 » restent pour l'instant surtout des affirmations d'Alibaba — la validation passera par la publication des poids et les benchmarks tiers.
Si vous envisagez d'intégrer Qwen3.8-Max dans Claude Code, Qoder ou OpenClaw pour des sessions agent longues, faire tourner des CLI sur un portable ou un VPS Linux instable entraîne souvent manque de mémoire, sessions interrompues et absence de la toolchain Xcode/Metal. Pour les environnements de production nécessitant des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS, la location cloud Mac Mini de NodeMini est généralement la meilleure option — nœuds dédiés, provisionnement en quelques secondes, agents et builds sur le même matériel Mac réel. Voir les tarifs de location Mac Mini.
Sources : blog et communiqués officiels Alibaba Cloud, classement Arena.ai (snapshot 2026-08-01), analyses Apidog / Yotta Labs / TechNode, couverture Apple Intelligence Chine. Vérifier les annonces officielles avant toute décision.
L'API est accessible via QwenCloud, compatible OpenAI et Anthropic. Les poids ne sont pas encore publiés : le site affiche Open-Source, mais dépôts Hugging Face / ModelScope et licence sont attendus « la semaine prochaine » (vers le 10 août). Pour l'environnement d'intégration, voir les tarifs de location Mac Mini.
Pas d'évaluation unifiée reconnue. Le seul test aveugle indépendant montre des scores très proches (Kimi K3 : 83, Qwen preview : 80) — même catégorie. Kimi K3 a l'avantage des poids ouverts et des données tierces ; Qwen3.8-Max offre une API moins chère et un multimodal plus complet.
Distinguez total et activés : 95 milliards activés, coût API proche d'un modèle cent milliard. Un déploiement privé complet exige un datacenter multi-nœuds ; l'option réaliste pour la plupart est d'attendre Qwen3.8-27B open source.
Référence utile, pas verdict. Données issues du framework interne ; les plateformes neutres n'ont pas reproduit la GA. Suivez les retests indépendants ou menez des A/B sur vos cas métier.
Au-delà d'une API flagship moins chère, Apple Intelligence en Chine s'appuie sur un Qwen compressé exécuté localement — les utilisateurs iPhone en bénéficient au niveau système. Autres questions : centre d'aide.