Kimi K3 en open weight complet
2,8T MoE, 1M de contexte — le pari de Moonshot AI

Le soir du 27 juillet, Moonshot AI a publié les poids complets de Kimi K3 et son rapport technique, en open source simultané de MoonEP, FlashKDA et AgentEnv — le premier modèle de classe 3 billions entièrement ouvert au monde. Les poids Hugging Face (~ 1,56 To) ont atteint la 1re place des tendances en 30 minutes. Pour les développeurs intéressés par la licence open weight, l'innovation MoE et la faisabilité d'auto-hébergement, cet article couvre : la chronologie des 11 jours entre lancement API et publication des poids, l'architecture KDA/AttnRes/Per-Head Muon, les trois composants Infra open source, les comparatifs SWE-bench et AA Index, les deux seuils commerciaux de licence, les prix API et la réalité du self-hosting 64 GPU, une checklist en six étapes et une FAQ. Conclusion : K3 est le plafond de performance open weight, pas le meilleur rapport qualité-prix — Moonshot parle toujours d'open weight, jamais d'open source.

01

De l'API à la publication complète en 11 jours : chronologie et points de friction

Trois questions fréquentes : L'API existait déjà le 16/7 — qu'a changé le 27/7 ? Quelle différence entre « open source » et « open weight » ? Combien de GPU pour l'auto-hébergement ? La chronologie ci-dessous clarifie tout.

DateÉvénement
16/7, soirLancement de Kimi K3 sur kimi.com, Kimi Work, Kimi Code et API — poids non publics
17/7Xinhua le qualifie de « plus grand modèle open source au monde » ; analyses d'architecture
22–23/7Les États-Unis accusent Moonshot de « distillation industrielle » d'Anthropic Fable et menacent de sanctions
27/7, 23hPoids complets et rapport technique ; MoonEP et AgentEnv open source (FlashKDA déjà publié)
28/7Le ministère chinois du Commerce répond au conflit IA sino-américain ; médias sur les détails open weight

Six coûts cachés pour les entreprises

  1. 01

    Risque de mauvaise lecture de licence : la presse écrit « open source », Moonshot n'utilise jamais open source — licence custom avec seuils MaaS et affichage

  2. 02

    Illusion d'auto-hébergement : 1,56 To + MoE 896 experts — GPU grand public impossibles ; achat matériel aveugle = coût caché majeur

  3. 03

    Abus de benchmarks : écarts importants entre chiffres éditeur et retests indépendants — privilégier Vals AI, Artificial Analysis

  4. 04

    Piège tarifaire cache : entrée affichée $3/M, mais architecture Mooncake > 90 % de hit cache en coding — coût effectif ~ $0,30/M

  5. 05

    Conformité géopolitique : conflit « distillation de modèles » sino-américain + fenêtre WAIC 2026 — poids publics ≠ processus d'entraînement auditable

  6. 06

    Environnement Agent : agents de code longue session exigent compute stable et toolchain — laptop ou VPS faible insuffisants en production

02

Paramètres clés et innovations : KDA, AttnRes, Stable LatentMoE

ÉlémentValeur
Paramètres totaux2,8 billions (2,8T)
Paramètres actifs~ 104 milliards
ArchitectureMixture of Experts (MoE), 896 experts routés, 16 activés par token
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (Gated MLA)
Contexte1 million de tokens
MultimodalVision native (ViT-V2, 27 couches)
Format des poidsPoids MXFP4 + activations MXFP8 (quantization-aware training)
Volume des poids~ 1,56 To (Hugging Face)
LicenceLicence custom (officiel : open weight, pas open source)

Kimi Delta Attention (KDA) : oubli fin par canal

Le Gated DeltaNet classique utilise une porte d'oubli scalaire ; KDA passe à un gating par canal — chaque dimension de feature décroît indépendamment. Formule chunkwise DPLR pour récurrence en temps linéaire, alternée avec quelques couches Gated MLA : contexte 1M tokens et KV cache minimal.

Attention Residuals (AttnRes) : agrégation résiduelle sélective

Les connexions résiduelles classiques accumulent uniformément — les couches profondes diluent l'information initiale. AttnRes agrège dynamiquement selon l'entrée ; par couche, seulement RMSNorm et un pseudo-vecteur requête. Gain d'efficacité d'entraînement ~ 25 %, overhead < 2 %.

Per-Head Muon et Stable LatentMoE

Per-Head Muon optimise chaque tête d'attention séparément ; MoE choisit 16 experts sur 896 (sparsité ~ 1,8 %). Quantile Balancing et MoonEP prouvent la borne supérieure théorique des experts redondants et résolvent le déséquilibre de charge MoE.

Moonshot a repensé attention, connexions résiduelles et optimiseur — voilà ce qui distingue K3 du simple empilement de paramètres, pas seulement l'échelle 2,8T.

03

MoonEP, FlashKDA, AgentEnv : Infra open source et checklist en six étapes

Cette release ne se limite pas aux poids : trois infrastructures clés de l'efficacité d'entraînement de K3 sont aussi open source — une raison de l'accueil positif de la communauté.

TechnologieRôleCapacité clé
MoonEPBibliothèque MoE fine-grain à très grande échelleRéplication temporaire d'experts surchargés ; tokens égaux par nœud ; borne supérieure théorique des experts redondants
FlashKDAOpérateur KDA haute perf basé sur CUTLASSPrefill sur H20 1,72–2,22× plus rapide ; remplacement direct du backend chunk_kda
AgentEnvSandbox agent Firecracker microVMLatence checkpoint 133 ms, recovery 49 ms, surcommit mémoire jusqu'à 6,5× (données officielles)

Checklist pratique en six étapes

  1. 01

    Confirmer le chemin d'usage : la plupart des équipes passent par l'API (`https://api.moonshot.ai/v1`, ID modèle `kimi-k3`) ; auto-hébergement seulement pour résidence des données, fine-tuning ou inférence hyperscale

  2. 02

    Lire la LICENSE ligne par ligne : seuil MaaS 20 M$ de revenus annuels et obligation d'affichage MAU 100 M / revenus mensuels 20 M$

  3. 03

    Vérifier l'intégrité Hugging Face : ~ 1,56 To, format MXFP4 et liste des shards

  4. 04

    Évaluer le seuil matériel : recommandation officielle supernode 64+ GPU — ne pas planifier avec GPU grand public

  5. 05

    Intégrer FlashKDA : le projet flash-linear-attention peut basculer le backend chunk_kda sans friction

  6. 06

    Comparer benchmarks indépendants : Vals AI SWE-bench Verified (K3 93,4 %) et AA Index (~ 57, 3e mondial) comme critères — pas seulement les chiffres éditeur

python
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_MOONSHOT_KEY",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(resp.choices[0].message.content)
04

Benchmarks, licence et tarifs : K3 vs GPT-5.6, Claude, GLM-5.2

SWE-bench Verified (retest indépendant Vals AI, juillet 2026)

ModèleScoreDate
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
GLM-5.2 (ex-#1 open weight)AA Index 51

Matrice coût vs capacité

DimensionKimi K3Claude Fable 5GLM-5.2
AA Intelligence Index~ 57 (3e mondial, #1 open weight)6051
Coût par tâche~ $0,95~ $2,4~ $0,47
Contexte1 M tokensplus courtplus court
Poids téléchargeablesOui (1,56 To)NonOui
PositionnementPlafond open weightClosed source haut de gammeMeilleur rapport qualité-prix open weight
warning

Deux seuils commerciaux de licence (absents à l'ère K2) : ① MaaS avec revenus > 20 M$ sur 12 mois consécutifs — accord commercial séparé avec Moonshot ; ② MAU > 100 M ou revenus mensuels > 20 M$ — afficher « Kimi K3 » de façon visible. Sans impact pour la plupart des PME ; revue juridique si concurrence directe avec kimi.com.

Tarifs API (par million de tokens)

Type de tokenPrix
Entrée (cache hit)$0,30
Entrée (cache miss)$3,00
Sortie (reasoning inclus)$15,00
05

Contexte géopolitique et données citables : le signal open weight de K3

La publication open weight de Kimi K3 coïncide avec WAIC 2026 et le conflit sino-américain sur la « distillation de modèles » — Washington accuse Moonshot d'avoir distillé industriellement Anthropic Fable et menace de sanctions ; le ministère chinois du Commerce répond le 28 juillet en dénonçant « l'hégémonie IA ». Publier poids, rapport technique et trois Infra en totalité envoie un signal d'indépendance technique via le détail d'ingénierie. Trois jours plus tard, Alibaba annonce Qwen3.8-Max-Preview (24 billions de paramètres) — la compétition chinoise entre dans le « club 3T ».

Données clés citables

  • Échelle : 2,8T total, 896 experts / 16 actifs, ~ 104 Mrd actifs, contexte 1M tokens
  • Benchmarks : SWE-bench Verified 93,4 % (Vals AI) ; AA Index ~ 57, 3e mondial, #1 open weight
  • Coût : ~ $0,95 par tâche — ~ 60 % moins cher que Fable 5, plus cher que GLM-5.2 ($0,47)
  • Code : #1 Frontend Code Arena ; hit cache Mooncake > 90 % en coding
  • Auto-hébergement : 1,56 To, supernode 64+ GPU recommandé ; OpenRouter et six autres tiers
  • Licence : open weight custom, pas OSI open source ; seuils MaaS et affichage

Pour intégrer K3 dans des agents longue session type Kimi Code ou des pipelines CI iOS, un laptop ou VPS Linux instable entraîne souvent manque de mémoire, coupures de session et absence de toolchain Xcode/Metal. Pour la production avec sessions SSH stables, cache DerivedData et automatisation CI/CD iOS, la location cloud Mac Mini NodeMini est généralement le meilleur choix — nœud dédié, provisionnement en secondes, agent et builds sur un vrai Mac. Voir tarifs location Mac Mini.

FAQ

Questions fréquentes

Strictement non. C'est un modèle open weight : poids, rapport technique et outils Infra partiels publics, mais pas les données ni le code d'entraînement complet — hors définition OSI. Moonshot n'utilise jamais open source dans ses documents officiels.

Dans la plupart des cas commerciaux, sans restriction. Au-delà de 20 M$ de revenus MaaS annuels, ou 100 M MAU / 20 M$ de revenus mensuels, des clauses spécifiques s'appliquent. Environnement de déploiement : tarifs location Mac Mini.

Recommandation officielle : cluster supernode de 64 GPU ou plus. Pour particuliers et la plupart des entreprises, API officielle ou plateformes tierces comme OpenRouter (7 hébergeurs actuellement) est plus réaliste.

#1 open weight en capacité globale : AA Index 3e mondial derrière Claude Fable 5 et GPT-5.6 Sol. Plus cher que GLM-5.2 — plafond maximal, pas le meilleur rapport qualité-prix. Autres questions : centre d'aide.

K3 a ~ 3× les paramètres de K2.5, ajoute Attention Residuals et Per-Head Muon, contexte et multimodalité nettement améliorés. Licence passée de Modified MIT à custom avec seuil revenus MaaS.