Kimi K3 open weights
27 juillet 2026 : 2,8 billions de paramètres — la prime des modèles fermés tient-elle ?

Il reste 5 jours avant le 27 juillet 2026 : Moonshot AI (月之暗面) publiera sur Hugging Face, sous licence Modified MIT, les poids complets de Kimi K3 — 2,8 billions de paramètres, premier modèle open weights au seuil des 3T. Pour les équipes qui évaluent le téléchargement des poids K3, la faisabilité d'un déploiement local et la prime des modèles fermés, cet article couvre : le calendrier API du 16 juillet vs open weights du 27, les spécifications et benchmarks, la tarification API et le coût réel avec cache, la distinction open weights / open source, la réalité matérielle 1,4 To, une checklist en six étapes pour le jour J, le contexte sectoriel et une FAQ. Conclusion : K3 n'est pas le « tueur de Fable 5 » — troisième en intelligence globale — mais il approche la frontière pour environ un tiers du coût, avec deux atouts que le closed source ne peut offrir : poids ouverts + contexte d'un million de tokens.

01

Calendrier Kimi K3 : API en ligne vs open weights — deux dates à ne pas confondre

La confusion la plus fréquente : « K3 est déjà utilisable — que sort le 27 juillet ? » Réponse : le 16 juillet 2026 a marqué l'API et la suite produits Kimi ; le 27 juillet apporte les poids téléchargeables et le rapport technique.

DateÉvénement
2026-07-16Kimi K3 via API, Kimi App, Kimi Work, Kimi Code ; benchmark indépendant Artificial Analysis
2026-07-17Ouverture du WAIC Shanghai ; Xinhua qualifie K3 de jalon national
2026-07-27Poids complets (Hugging Face, Modified MIT) + rapport technique (architecture, entraînement, évaluation)

Spécifications clés de Kimi K3

ÉlémentValeur
Paramètres totaux2,8 billions (2,8T) — plus vaste modèle open weights au monde
ArchitectureMoE sparse : Stable LatentMoE, 896 experts, 16 activés par token
AttentionKimi Delta Attention (KDA) + Attention Residuals (AttnRes) + Gated MLA
Contexte1 048 576 tokens (environ 1M)
ModalitéVision native (texte + image ; vidéo côté produit), sortie texte
Format des poidsMXFP4 + activations MXFP8 (quantification 4-bit proche de la précision d'entraînement)
Efficacité de scaleEnviron 2,5× par rapport à K2 à compute équivalent
Stabilité d'entraînementQuantile Balancing, optimiseur Per-Head Muon, activation SiTU
Décodage long contexteKDA : jusqu'à 6,3× d'accélération de décodage à 1M tokens

K3 n'est pas le « tueur de Fable 5 » — troisième en intelligence globale, mais à environ un tiers du coût il frôle la frontière, avec des poids ouverts et un million de tokens de contexte que le closed source ne peut pas livrer.

Pourquoi anticiper la sortie du 27 juillet

  1. 01

    Résidence des données : les scénarios de conformité exigent des poids on-prem plutôt que des appels API

  2. 02

    Fine-tuning : poursuivre l'entraînement sur vos données nécessite les poids complets

  3. 03

    Volume extrême : à très grande échelle, l'inférence auto-hébergée peut coûter moins cher

  4. 04

    Écosystème : le support vLLM pour KDA / prefix caching suivra la publication des poids

  5. 05

    Quantification : des versions Ollama et GGUF sont attendues, comme pour la série K2

  6. 06

    Licence : vérifier le texte Modified MIT le jour J — ne pas présumer des termes

02

Benchmarks Kimi K3 : où mène-t-il Claude Fable 5 et GPT-5.6 ?

L'Artificial Analysis Intelligence Index (évaluation indépendante du 16 juillet) établit ce classement global :

ModèleAA Intelligence IndexRang
Claude Fable 559,91
GPT-5.6 Sol58,92
Kimi K357,13 / 189

Benchmarks où K3 mène ou égale

  • Frontend Code Arena : 1er (test aveugle : les développeurs préfèrent son code UI à Fable et Sol)
  • Automation Bench, SpreadsheetBench 2 : 1er
  • BrowseComp : 91,2 (1er ; avec contexte 1M sans compression, 90,4+)
  • SWE Marathon (sessions de code ultra-longues) : 42,0 — nettement devant GPT-5.5 / GLM-5.2
  • Terminal Bench 2.1 : 88,3 — quasi égal à GPT-5.6 Sol (88,8)
  • Program Bench : 77,8 — légèrement au-dessus de Sol (77,6)
  • FrontierSWE : 81,2 vs Sol 71,3 (derrière Fable 5 à 86,6)

Domaines où K3 reste en retrait

  • GDPval v2 Elo : 1668–1687 vs Fable 5 (1760), Sol (1748) — le jugement long terme reste le territoire de Fable
  • DeepSWE : 67,5 vs Sol 73,0
  • Taux d'hallucination : en hausse vs K2.6 (admis officiellement) ; retours Reddit sur plus d'hallucinations que les modèles fermés de tête en self-hosting
  • Finition conversationnelle et stabilité : variance par session plus élevée que Fable 5 / Sol
info

Transparence officielle (à citer) : Moonshot reconnaît rarement aussi franchement un retard global face à Fable 5 et GPT-5.6 Sol — sensibilité au contenu de raisonnement renvoyé par le harness, trop proactif sur des intents flous. Chaque modèle utilise son propre harness de raisonnement ; la reproduction indépendante est en cours.

03

Tarifs API Kimi K3 : prix affiché vs coût réel avec cache

PostePrix (par million de tokens)
Entrée (cache miss)3,00 $
Entrée (cache hit, automatique)0,30 $
Sortie15,00 $

K3 se positionne sur la qualité plutôt que le prix bas — tarifs API les plus élevés parmi les éditeurs chinois, mais nettement inférieurs au coût par tâche de Claude Opus 4.8. Artificial Analysis mesure 0,94 $ par tâche : 9,4 % de moins que GPT-5.6 Sol, 65,8 % de moins que Claude Fable 5. Sur les charges de code, le taux de cache hit dépasserait 90 % — le coût effectif reste bien sous le tarif affiché.

OptionPublic cibleAvant le 27.7.Après le 27.7.
API (3 $ / 15 $)Majorité des développeurs et entreprisesDisponibleToujours recommandée
Auto-hébergement (64+ accélérateurs)Résidence données / fine-tuning / volume massifPoids indisponiblesTrois scénarios seulement
GPU grand public localExpérimentation personnelleNonNon — 4-bit environ 1,4 To
04

Kimi K3 est-il open source ? Open weights vs open source

La communauté anglophone distingue open weights (poids seuls) de open source (code et données d'entraînement inclus). Kimi K3 relève du premier — le 27 juillet verra les poids complets sous Modified MIT (termes à confirmer), pas la stack complète.

Ce qui se passe concrètement le 27 juillet

  • Poids 2,8T complets sur l'organisation Hugging Face de Moonshot
  • Rapport technique synchronisé (architecture, entraînement, évaluation)
  • Support vLLM pour KDA / prefix caching avec les poids
  • Attendu : quantifications Ollama et GGUF comme pour K2
warning

Réalité de l'auto-hébergement (ne pas se laisser tromper par le clickbait « modèle local ») : poids 4-bit environ 1,4 To ; Moonshot recommande un supernœud 64+ accélérateurs avec parallélisme expert + tensor. Référence : K2.7 Code (1T) requiert INT4 environ 577 Go de VRAM ; K3 est 2,8× plus grand. Pour la majorité : l'API (3 $ / 15 $).

Checklist en six étapes pour le jour J du 27 juillet

  1. 01

    Dépôt HF : vérifier la liste complète des fichiers dans l'org Moonshot sur Hugging Face

  2. 02

    LICENSE : lire ligne par ligne les clauses Modified MIT — usage commercial et redistribution

  3. 03

    Quantifications : suivre les packs MXFP4/NVFP4 officiels ou communautaires

  4. 04

    vLLM / SGLang : comparer les commandes de démarrage KDA et prefix caching à la doc

  5. 05

    Matériel minimum : exigences d'inférence distribuée du rapport — ne pas planifier sur GPU grand public

  6. 06

    Tests long contexte indépendants : suivre benchmarks communautaires et discussions r/LocalLLaMA

05

Pourquoi la sortie du 27 juillet remet en cause la prime des modèles fermés

Quatre angles d'analyse

  1. 01

    Écart frontier qui se referme : de « centaines de points » à « deux ou trois » — la performance seule ne justifie plus la prime

  2. 02

    Géopolitique : sortie avant le WAIC ; retrait temporaire US des modèles Anthropic Fable/Mythos (1er juillet, rétablis) — « la régulation peut couper le closed source, pas les poids open weights déjà publiés »

  3. 03

    Vague des éditeurs chinois : Z.ai GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 en est le sommet

  4. 04

    Le retour de Moonshot : chute au 7e rang en Chine début 2025 après DeepSeek R1 — route open weights K2 (07/2025) → K2.5 (01/2026) → K3

Données clés citables

  • Échelle : 2,8T paramètres, 896 experts / 16 actifs, contexte 1M (1 048 576)
  • Intelligence globale : AA Index 57,1 / Sol 58,9 / Fable 5 59,9 (rang 3/189)
  • Coût par tâche : K3 0,94 $ — 65,8 % sous Fable 5
  • API : 3 $ entrée / 0,30 $ cache / 15 $ sortie par M tokens
  • Auto-hébergement : 4-bit environ 1,4 To ; 64+ accélérateurs recommandés
  • Code : Frontend Code Arena 1er ; SWE Marathon 42,0
  • Limites connues : derrière Fable 5 / Sol ; hallucinations en hausse vs K2.6

Sources : Officiel blog technique kimi.com, platform.kimi.ai ; indépendant Artificial Analysis (16 juil.) ; VentureBeat, Northflank ; communauté r/LocalLLaMA, Hacker News. Détails d'architecture : test approfondi Kimi K3.

Si vous intégrez K3 après le 27 juillet dans des agents longue session type Kimi Code ou des pipelines CI iOS, un MacBook ou un VPS Linux instable expose souvent des limites mémoire, des coupures de session et l'absence de Xcode/Metal — freins réels pour les workflows créatifs Apple. Pour des sessions SSH stables, un cache DerivedData et une automatisation CI/CD iOS en production, la location cloud Mac Mini NodeMini est généralement la meilleure option : nœud dédié, provisioning en secondes, agent et build sur la même machine Mac réelle. Voir tarifs location Mac Mini.

FAQ

Questions fréquentes

Les poids complets 2,8T sont prévus le 27 juillet 2026 sur l'organisation Hugging Face de Moonshot, avec le rapport technique. L'API et la suite Kimi sont en ligne depuis le 16 juillet.

Précision : open weights, pas fully open source. Intelligence globale : K3 devant (2,8T vs DeepSeek V4 Pro 1,6T ; 1M vs 128K contexte). DeepSeek ne facture que 3,48 $/M en sortie — bien moins cher. Budget serré : DeepSeek ; long code et documents : K3.

Compte gratuit kimi.com inclut K3 ; API : 3 $/15 $ par M tokens, cache hit 0,30 $/M. Pour un environnement agent stable : tarifs location Mac Mini.

Poids 4-bit environ 1,4 To ; Moonshot recommande 64+ accélérateurs en supernœud. GPU grand public exclu. Auto-hébergement seulement pour résidence données, fine-tuning ou volume massif ; sinon API.

Intelligence globale : K3 rang 3 (57,1), derrière Fable 5 (59,9) et GPT-5.6 Sol (58,9). K3 mène sur Frontend Code Arena, SWE Marathon, BrowseComp ; raisonnement long terme et hallucinations en retrait. Ops : centre d'aide.

Modified MIT — texte original à vérifier le 27 juillet. Lire le fichier LICENSE ligne par ligne le jour J.