Le soir du 27 juillet, Moonshot AI a publié les poids complets de Kimi K3 et son rapport technique, en open source simultané de MoonEP, FlashKDA et AgentEnv — le premier modèle de classe 3 billions entièrement ouvert au monde. Les poids Hugging Face (~ 1,56 To) ont atteint la 1re place des tendances en 30 minutes. Pour les développeurs intéressés par la licence open weight, l'innovation MoE et la faisabilité d'auto-hébergement, cet article couvre : la chronologie des 11 jours entre lancement API et publication des poids, l'architecture KDA/AttnRes/Per-Head Muon, les trois composants Infra open source, les comparatifs SWE-bench et AA Index, les deux seuils commerciaux de licence, les prix API et la réalité du self-hosting 64 GPU, une checklist en six étapes et une FAQ. Conclusion : K3 est le plafond de performance open weight, pas le meilleur rapport qualité-prix — Moonshot parle toujours d'open weight, jamais d'open source.
Trois questions fréquentes : L'API existait déjà le 16/7 — qu'a changé le 27/7 ? Quelle différence entre « open source » et « open weight » ? Combien de GPU pour l'auto-hébergement ? La chronologie ci-dessous clarifie tout.
| Date | Événement |
|---|---|
| 16/7, soir | Lancement de Kimi K3 sur kimi.com, Kimi Work, Kimi Code et API — poids non publics |
| 17/7 | Xinhua le qualifie de « plus grand modèle open source au monde » ; analyses d'architecture |
| 22–23/7 | Les États-Unis accusent Moonshot de « distillation industrielle » d'Anthropic Fable et menacent de sanctions |
| 27/7, 23h | Poids complets et rapport technique ; MoonEP et AgentEnv open source (FlashKDA déjà publié) |
| 28/7 | Le ministère chinois du Commerce répond au conflit IA sino-américain ; médias sur les détails open weight |
Risque de mauvaise lecture de licence : la presse écrit « open source », Moonshot n'utilise jamais open source — licence custom avec seuils MaaS et affichage
Illusion d'auto-hébergement : 1,56 To + MoE 896 experts — GPU grand public impossibles ; achat matériel aveugle = coût caché majeur
Abus de benchmarks : écarts importants entre chiffres éditeur et retests indépendants — privilégier Vals AI, Artificial Analysis
Piège tarifaire cache : entrée affichée $3/M, mais architecture Mooncake > 90 % de hit cache en coding — coût effectif ~ $0,30/M
Conformité géopolitique : conflit « distillation de modèles » sino-américain + fenêtre WAIC 2026 — poids publics ≠ processus d'entraînement auditable
Environnement Agent : agents de code longue session exigent compute stable et toolchain — laptop ou VPS faible insuffisants en production
| Élément | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) |
| Paramètres actifs | ~ 104 milliards |
| Architecture | Mixture of Experts (MoE), 896 experts routés, 16 activés par token |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (Gated MLA) |
| Contexte | 1 million de tokens |
| Multimodal | Vision native (ViT-V2, 27 couches) |
| Format des poids | Poids MXFP4 + activations MXFP8 (quantization-aware training) |
| Volume des poids | ~ 1,56 To (Hugging Face) |
| Licence | Licence custom (officiel : open weight, pas open source) |
Le Gated DeltaNet classique utilise une porte d'oubli scalaire ; KDA passe à un gating par canal — chaque dimension de feature décroît indépendamment. Formule chunkwise DPLR pour récurrence en temps linéaire, alternée avec quelques couches Gated MLA : contexte 1M tokens et KV cache minimal.
Les connexions résiduelles classiques accumulent uniformément — les couches profondes diluent l'information initiale. AttnRes agrège dynamiquement selon l'entrée ; par couche, seulement RMSNorm et un pseudo-vecteur requête. Gain d'efficacité d'entraînement ~ 25 %, overhead < 2 %.
Per-Head Muon optimise chaque tête d'attention séparément ; MoE choisit 16 experts sur 896 (sparsité ~ 1,8 %). Quantile Balancing et MoonEP prouvent la borne supérieure théorique des experts redondants et résolvent le déséquilibre de charge MoE.
Moonshot a repensé attention, connexions résiduelles et optimiseur — voilà ce qui distingue K3 du simple empilement de paramètres, pas seulement l'échelle 2,8T.
Cette release ne se limite pas aux poids : trois infrastructures clés de l'efficacité d'entraînement de K3 sont aussi open source — une raison de l'accueil positif de la communauté.
| Technologie | Rôle | Capacité clé |
|---|---|---|
| MoonEP | Bibliothèque MoE fine-grain à très grande échelle | Réplication temporaire d'experts surchargés ; tokens égaux par nœud ; borne supérieure théorique des experts redondants |
| FlashKDA | Opérateur KDA haute perf basé sur CUTLASS | Prefill sur H20 1,72–2,22× plus rapide ; remplacement direct du backend chunk_kda |
| AgentEnv | Sandbox agent Firecracker microVM | Latence checkpoint 133 ms, recovery 49 ms, surcommit mémoire jusqu'à 6,5× (données officielles) |
Confirmer le chemin d'usage : la plupart des équipes passent par l'API (`https://api.moonshot.ai/v1`, ID modèle `kimi-k3`) ; auto-hébergement seulement pour résidence des données, fine-tuning ou inférence hyperscale
Lire la LICENSE ligne par ligne : seuil MaaS 20 M$ de revenus annuels et obligation d'affichage MAU 100 M / revenus mensuels 20 M$
Vérifier l'intégrité Hugging Face : ~ 1,56 To, format MXFP4 et liste des shards
Évaluer le seuil matériel : recommandation officielle supernode 64+ GPU — ne pas planifier avec GPU grand public
Intégrer FlashKDA : le projet flash-linear-attention peut basculer le backend chunk_kda sans friction
Comparer benchmarks indépendants : Vals AI SWE-bench Verified (K3 93,4 %) et AA Index (~ 57, 3e mondial) comme critères — pas seulement les chiffres éditeur
| Modèle | Score | Date |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| GLM-5.2 (ex-#1 open weight) | — | AA Index 51 |
| Dimension | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | ~ 57 (3e mondial, #1 open weight) | 60 | 51 |
| Coût par tâche | ~ $0,95 | ~ $2,4 | ~ $0,47 |
| Contexte | 1 M tokens | plus court | plus court |
| Poids téléchargeables | Oui (1,56 To) | Non | Oui |
| Positionnement | Plafond open weight | Closed source haut de gamme | Meilleur rapport qualité-prix open weight |
Deux seuils commerciaux de licence (absents à l'ère K2) : ① MaaS avec revenus > 20 M$ sur 12 mois consécutifs — accord commercial séparé avec Moonshot ; ② MAU > 100 M ou revenus mensuels > 20 M$ — afficher « Kimi K3 » de façon visible. Sans impact pour la plupart des PME ; revue juridique si concurrence directe avec kimi.com.
| Type de token | Prix |
|---|---|
| Entrée (cache hit) | $0,30 |
| Entrée (cache miss) | $3,00 |
| Sortie (reasoning inclus) | $15,00 |
La publication open weight de Kimi K3 coïncide avec WAIC 2026 et le conflit sino-américain sur la « distillation de modèles » — Washington accuse Moonshot d'avoir distillé industriellement Anthropic Fable et menace de sanctions ; le ministère chinois du Commerce répond le 28 juillet en dénonçant « l'hégémonie IA ». Publier poids, rapport technique et trois Infra en totalité envoie un signal d'indépendance technique via le détail d'ingénierie. Trois jours plus tard, Alibaba annonce Qwen3.8-Max-Preview (24 billions de paramètres) — la compétition chinoise entre dans le « club 3T ».
Pour intégrer K3 dans des agents longue session type Kimi Code ou des pipelines CI iOS, un laptop ou VPS Linux instable entraîne souvent manque de mémoire, coupures de session et absence de toolchain Xcode/Metal. Pour la production avec sessions SSH stables, cache DerivedData et automatisation CI/CD iOS, la location cloud Mac Mini NodeMini est généralement le meilleur choix — nœud dédié, provisionnement en secondes, agent et builds sur un vrai Mac. Voir tarifs location Mac Mini.
Strictement non. C'est un modèle open weight : poids, rapport technique et outils Infra partiels publics, mais pas les données ni le code d'entraînement complet — hors définition OSI. Moonshot n'utilise jamais open source dans ses documents officiels.
Dans la plupart des cas commerciaux, sans restriction. Au-delà de 20 M$ de revenus MaaS annuels, ou 100 M MAU / 20 M$ de revenus mensuels, des clauses spécifiques s'appliquent. Environnement de déploiement : tarifs location Mac Mini.
Recommandation officielle : cluster supernode de 64 GPU ou plus. Pour particuliers et la plupart des entreprises, API officielle ou plateformes tierces comme OpenRouter (7 hébergeurs actuellement) est plus réaliste.
#1 open weight en capacité globale : AA Index 3e mondial derrière Claude Fable 5 et GPT-5.6 Sol. Plus cher que GLM-5.2 — plafond maximal, pas le meilleur rapport qualité-prix. Autres questions : centre d'aide.
K3 a ~ 3× les paramètres de K2.5, ajoute Attention Residuals et Per-Head Muon, contexte et multimodalité nettement améliorés. Licence passée de Modified MIT à custom avec seuil revenus MaaS.