Il reste 5 jours avant le 27 juillet 2026 : Moonshot AI (月之暗面) publiera sur Hugging Face, sous licence Modified MIT, les poids complets de Kimi K3 — 2,8 billions de paramètres, premier modèle open weights au seuil des 3T. Pour les équipes qui évaluent le téléchargement des poids K3, la faisabilité d'un déploiement local et la prime des modèles fermés, cet article couvre : le calendrier API du 16 juillet vs open weights du 27, les spécifications et benchmarks, la tarification API et le coût réel avec cache, la distinction open weights / open source, la réalité matérielle 1,4 To, une checklist en six étapes pour le jour J, le contexte sectoriel et une FAQ. Conclusion : K3 n'est pas le « tueur de Fable 5 » — troisième en intelligence globale — mais il approche la frontière pour environ un tiers du coût, avec deux atouts que le closed source ne peut offrir : poids ouverts + contexte d'un million de tokens.
La confusion la plus fréquente : « K3 est déjà utilisable — que sort le 27 juillet ? » Réponse : le 16 juillet 2026 a marqué l'API et la suite produits Kimi ; le 27 juillet apporte les poids téléchargeables et le rapport technique.
| Date | Événement |
|---|---|
| 2026-07-16 | Kimi K3 via API, Kimi App, Kimi Work, Kimi Code ; benchmark indépendant Artificial Analysis |
| 2026-07-17 | Ouverture du WAIC Shanghai ; Xinhua qualifie K3 de jalon national |
| 2026-07-27 | Poids complets (Hugging Face, Modified MIT) + rapport technique (architecture, entraînement, évaluation) |
| Élément | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions (2,8T) — plus vaste modèle open weights au monde |
| Architecture | MoE sparse : Stable LatentMoE, 896 experts, 16 activés par token |
| Attention | Kimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA |
| Contexte | 1 048 576 tokens (environ 1M) |
| Modalité | Vision native (texte + image ; vidéo côté produit), sortie texte |
| Format des poids | MXFP4 + activations MXFP8 (quantification 4-bit proche de la précision d'entraînement) |
| Efficacité de scale | Environ 2,5× par rapport à K2 à compute équivalent |
| Stabilité d'entraînement | Quantile Balancing, optimiseur Per-Head Muon, activation SiTU |
| Décodage long contexte | KDA : jusqu'à 6,3× d'accélération de décodage à 1M tokens |
K3 n'est pas le « tueur de Fable 5 » — troisième en intelligence globale, mais à environ un tiers du coût il frôle la frontière, avec des poids ouverts et un million de tokens de contexte que le closed source ne peut pas livrer.
Résidence des données : les scénarios de conformité exigent des poids on-prem plutôt que des appels API
Fine-tuning : poursuivre l'entraînement sur vos données nécessite les poids complets
Volume extrême : à très grande échelle, l'inférence auto-hébergée peut coûter moins cher
Écosystème : le support vLLM pour KDA / prefix caching suivra la publication des poids
Quantification : des versions Ollama et GGUF sont attendues, comme pour la série K2
Licence : vérifier le texte Modified MIT le jour J — ne pas présumer des termes
L'Artificial Analysis Intelligence Index (évaluation indépendante du 16 juillet) établit ce classement global :
| Modèle | AA Intelligence Index | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | 1 |
| GPT-5.6 Sol | 58,9 | 2 |
| Kimi K3 | 57,1 | 3 / 189 |
Transparence officielle (à citer) : Moonshot reconnaît rarement aussi franchement un retard global face à Fable 5 et GPT-5.6 Sol — sensibilité au contenu de raisonnement renvoyé par le harness, trop proactif sur des intents flous. Chaque modèle utilise son propre harness de raisonnement ; la reproduction indépendante est en cours.
| Poste | Prix (par million de tokens) |
|---|---|
| Entrée (cache miss) | 3,00 $ |
| Entrée (cache hit, automatique) | 0,30 $ |
| Sortie | 15,00 $ |
K3 se positionne sur la qualité plutôt que le prix bas — tarifs API les plus élevés parmi les éditeurs chinois, mais nettement inférieurs au coût par tâche de Claude Opus 4.8. Artificial Analysis mesure 0,94 $ par tâche : 9,4 % de moins que GPT-5.6 Sol, 65,8 % de moins que Claude Fable 5. Sur les charges de code, le taux de cache hit dépasserait 90 % — le coût effectif reste bien sous le tarif affiché.
| Option | Public cible | Avant le 27.7. | Après le 27.7. |
|---|---|---|---|
| API (3 $ / 15 $) | Majorité des développeurs et entreprises | Disponible | Toujours recommandée |
| Auto-hébergement (64+ accélérateurs) | Résidence données / fine-tuning / volume massif | Poids indisponibles | Trois scénarios seulement |
| GPU grand public local | Expérimentation personnelle | Non | Non — 4-bit environ 1,4 To |
La communauté anglophone distingue open weights (poids seuls) de open source (code et données d'entraînement inclus). Kimi K3 relève du premier — le 27 juillet verra les poids complets sous Modified MIT (termes à confirmer), pas la stack complète.
Réalité de l'auto-hébergement (ne pas se laisser tromper par le clickbait « modèle local ») : poids 4-bit environ 1,4 To ; Moonshot recommande un supernœud 64+ accélérateurs avec parallélisme expert + tensor. Référence : K2.7 Code (1T) requiert INT4 environ 577 Go de VRAM ; K3 est 2,8× plus grand. Pour la majorité : l'API (3 $ / 15 $).
Dépôt HF : vérifier la liste complète des fichiers dans l'org Moonshot sur Hugging Face
LICENSE : lire ligne par ligne les clauses Modified MIT — usage commercial et redistribution
Quantifications : suivre les packs MXFP4/NVFP4 officiels ou communautaires
vLLM / SGLang : comparer les commandes de démarrage KDA et prefix caching à la doc
Matériel minimum : exigences d'inférence distribuée du rapport — ne pas planifier sur GPU grand public
Tests long contexte indépendants : suivre benchmarks communautaires et discussions r/LocalLLaMA
Écart frontier qui se referme : de « centaines de points » à « deux ou trois » — la performance seule ne justifie plus la prime
Géopolitique : sortie avant le WAIC ; retrait temporaire US des modèles Anthropic Fable/Mythos (1er juillet, rétablis) — « la régulation peut couper le closed source, pas les poids open weights déjà publiés »
Vague des éditeurs chinois : Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 en est le sommet
Le retour de Moonshot : chute au 7e rang en Chine début 2025 après DeepSeek R1 — route open weights K2 (07/2025) → K2.5 (01/2026) → K3
Sources : Officiel blog technique kimi.com, platform.kimi.ai ; indépendant Artificial Analysis (16 juil.) ; VentureBeat, Northflank ; communauté r/LocalLLaMA, Hacker News. Détails d'architecture : test approfondi Kimi K3.
Si vous intégrez K3 après le 27 juillet dans des agents longue session type Kimi Code ou des pipelines CI iOS, un MacBook ou un VPS Linux instable expose souvent des limites mémoire, des coupures de session et l'absence de Xcode/Metal — freins réels pour les workflows créatifs Apple. Pour des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS en production, la location cloud Mac Mini NodeMini est généralement la meilleure option : nœud dédié, provisioning en secondes, agent et build sur la même machine Mac réelle. Voir tarifs location Mac Mini.
Les poids complets 2,8T sont prévus le 27 juillet 2026 sur l'organisation Hugging Face de Moonshot, avec le rapport technique. L'API et la suite Kimi sont en ligne depuis le 16 juillet.
Précision : open weights, pas fully open source. Intelligence globale : K3 devant (2,8T vs DeepSeek V4 Pro 1,6T ; 1M vs 128K contexte). DeepSeek ne facture que 3,48 $/M en sortie — bien moins cher. Budget serré : DeepSeek ; long code et documents : K3.
Compte gratuit kimi.com inclut K3 ; API : 3 $/15 $ par M tokens, cache hit 0,30 $/M. Pour un environnement agent stable : tarifs location Mac Mini.
Poids 4-bit environ 1,4 To ; Moonshot recommande 64+ accélérateurs en supernœud. GPU grand public exclu. Auto-hébergement seulement pour résidence données, fine-tuning ou volume massif ; sinon API.
Intelligence globale : K3 rang 3 (57,1), derrière Fable 5 (59,9) et GPT-5.6 Sol (58,9). K3 mène sur Frontend Code Arena, SWE Marathon, BrowseComp ; raisonnement long terme et hallucinations en retrait. Ops : centre d'aide.
Modified MIT — texte original à vérifier le 27 juillet. Lire le fichier LICENSE ligne par ligne le jour J.