Am Abend des 27. Juli veröffentlichte Moonshot AI die vollständigen Kimi-K3-Modellgewichte und den Technikbericht sowie gleichzeitig die drei Kern-Infrastrukturen MoonEP, FlashKDA und AgentEnv als Open Source — das weltweit erste vollständig freigegebene Modell in der 3-Billionen-Parameter-Klasse. Die Hugging-Face-Gewichte umfassen ca. 1,56 TB und erreichten innerhalb von 30 Minuten Platz 1 der Trendcharts. Für Entwickler mit Fokus auf Open-Weight-Lizenzierung, MoE-Architektur und Self-Hosting-Feasibility deckt dieser Artikel ab: die 11-Tage-Zeitlinie von API-Launch bis vollständiger Gewichtsfreigabe, KDA/AttnRes/Per-Head-Muon-Architektur, drei offene Infra-Komponenten, SWE-bench- und AA-Index-Vergleiche, zwei kommerzielle Lizenzschwellen, API-Preise und die 64-GPU-Self-Hosting-Realität, eine Sechs-Schritte-Evaluierungsliste sowie FAQ. Kernergebnis: K3 ist die Leistungsobergrenze im Open-Weight-Lager, aber nicht die kosteneffizienteste Wahl — Moonshot spricht konsequent von open weight, nie von Open Source.
Die drei häufigsten Fragen: Am 16.7. gab es schon eine API — was änderte sich am 27.7.? Wo liegt der Unterschied zwischen „Open Source" und „Open Weight"? Wie viele GPUs braucht Self-Hosting? Die folgende Zeitlinie ordnet alles.
| Datum | Ereignis |
|---|---|
| 16.7., Abend | Kimi K3 startet auf kimi.com, Kimi Work, Kimi Code und per API — Gewichte noch nicht öffentlich |
| 17.7. | Xinhua berichtet über das „weltweit größte Open-Source-Modell"; Branche analysiert die Architektur |
| 22.–23.7. | USA wirft Moonshot AI „industrielle Destillation" von Anthropic Fable vor und droht mit Sanktionen |
| 27.7., 23:00 | Vollständige Gewichte und Technikbericht; MoonEP und AgentEnv Open Source (FlashKDA bereits zuvor) |
| 28.7. | Chinesisches Handelsministerium reagiert auf den US-China-KI-Streit; Medien berichten Open-Weight-Details |
Lizenz-Missverständnis: Medien schreiben „Open Source", Moonshot nutzt nie open source — Custom-Lizenz mit MaaS-Umsatz- und Anzeigepflicht-Schwellen
Self-Hosting-Illusion: 1,56 TB Gewichte + 896-Experten-MoE — Consumer-GPUs scheitern; blindes Hardware-Budget ist der größte versteckte Kostenfaktor
Benchmark-Missbrauch: Herstellerangaben und unabhängige Retests weichen stark ab — Vals AI, Artificial Analysis bevorzugen
Cache-Preisfalle: Listenpreis Eingabe $3/M, aber Mooncake-Architektur erreicht bei Coding-Workloads über 90 % Cache-Hit — effektiv näher $0,30/M
Geopolitische Compliance: US-China-Destillationsstreit plus WAIC-2026-Fenster — Gewichtsfreigabe bedeutet nicht auditierbaren Trainingsprozess
Agent-Laufzeit: Langsession-Coding-Agents brauchen stabile Compute und Toolchains — Laptop oder schwacher VPS reicht für Produktions-Pipelines nicht
| Merkmal | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) |
| Aktive Parameter | ca. 104 Mrd. |
| Architektur | Mixture of Experts (MoE), 896 Routing-Experten, 16 pro Token aktiv |
| Attention | Kimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (Gated MLA) |
| Kontextfenster | 1 Mio. Token |
| Multimodal | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4-Gewichte + MXFP8-Aktivierungen (quantization-aware training) |
| Gewichtsvolumen | ca. 1,56 TB (Hugging Face) |
| Lizenz | Custom-Lizenz (offiziell: open weight, nicht open source) |
Klassisches Gated DeltaNet nutzt skalare Vergessens-Gates; KDA setzt auf kanalweise Gating — jede Feature-Dimension decayed unabhängig. Mit chunkwise-DPLR-Formel linearzeitliche Rekursion, abwechselnd mit wenigen Gated-MLA-Layern: 1M Token Kontext bei minimalem KV-Cache.
Klassische Residuals summieren Layer-Outputs gleichmäßig — tiefe Layer verwässern frühe Information. AttnRes aggregiert input-abhängig dynamisch; pro Layer nur RMSNorm plus ein Pseudo-Query-Vektor. Ca. 25 % Trainings-Effizienzgewinn, unter 2 % Parameter-Overhead.
Per-Head Muon optimiert jeden Attention-Head separat; MoE wählt 16 von 896 Experten (Sparsity ca. 1,8 %). Quantile Balancing plus MoonEP beweisen theoretische Obergrenzen redundanter Experten und lösen MoE-Load-Imbalance.
Moonshot hat Attention, Residual-Verbindung und Optimizer neu gedacht — das unterscheidet K3 von bloßem Parameter-Stacking, nicht nur die 2,8T-Skala.
Der Release liefert nicht nur Gewichte, sondern auch die drei Infrastrukturen, die K3s Trainingseffizienz tragen — ein Grund für das positive Feedback in der Developer-Community.
| Technologie | Rolle | Kernfähigkeit |
|---|---|---|
| MoonEP | Feingranulare MoE-Kommunikation im Supernode-Maßstab | Temporäres Replizieren überlasteter Experten; gleiche Token-Anzahl pro Node; theoretische Obergrenze redundanter Experten |
| FlashKDA | CUTLASS-basierter KDA-Hochleistungsoperator | Prefill auf H20 1,72–2,22× schneller als Baseline; direkter chunk_kda-Backend-Ersatz |
| AgentEnv | Firecracker-microVM-Agent-Sandbox | Checkpoint-Latenz 133 ms, Recovery 49 ms, Memory-Overcommit bis 6,5× (Herstellerangaben) |
Nutzungspfad klären: Die meisten Teams nutzen die API (`https://api.moonshot.ai/v1`, Modell-ID `kimi-k3`); Self-Hosting nur bei Data Residency, Fine-Tuning oder Hyperscale-Inferenz
LICENSE Zeile für Zeile: MaaS-Jahresumsatz 20 Mio. USD und MAU 100 Mio./Monatsumsatz 20 Mio. USD Anzeigepflicht prüfen
Hugging-Face-Integrität: ca. 1,56 TB, MXFP4-Format und Shard-Liste verifizieren
Hardware-Schwelle: Offiziell 64+ GPUs Supernode — nicht mit Consumer-GPUs planen
FlashKDA anbinden: flash-linear-attention kann chunk_kda-Backend nahtlos wechseln
Unabhängige Benchmarks: Vals AI SWE-bench Verified (K3 93,4 %) und AA Index (ca. 57, weltweit #3) als Auswahlgrundlage — nicht nur Herstellerangaben
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| GLM-5.2 (bisher #1 Open Weight) | — | AA Index 51 |
| Dimension | Kimi K3 | Claude Fable 5 | GLM-5.2 |
|---|---|---|---|
| AA Intelligence Index | ca. 57 (weltweit #3, Open Weight #1) | 60 | 51 |
| Kosten pro Task | ca. $0,95 | ca. $2,4 | ca. $0,47 |
| Kontext | 1 Mio. Token | kürzer | kürzer |
| Gewichte downloadbar | Ja (1,56 TB) | Nein | Ja |
| Positionierung | Open-Weight-Leistungsobergrenze | Closed Source Spitzenklasse | Open-Weight-Preis-Leistungs-Sieger |
Zwei kommerzielle Lizenzschwellen (neu gegenüber K2): ① MaaS-Umsatz über 20 Mio. USD in 12 aufeinanderfolgenden Monaten — separate Vereinbarung mit Moonshot erforderlich; ② MAU über 100 Mio. oder Monatsumsatz über 20 Mio. USD — „Kimi K3" prominent in der UI anzeigen. Für die meisten KMU irrelevant; bei direkter Konkurrenz zu kimi.com juristisch prüfen.
| Token-Typ | Preis |
|---|---|
| Eingabe (Cache-Hit) | $0,30 |
| Eingabe (Cache-Miss) | $3,00 |
| Ausgabe (inkl. Reasoning) | $15,00 |
Die Kimi-K3-Freigabe fällt in das WAIC-2026-Fenster und den eskalierenden US-China-Streit um „Model Distillation" — Washington wirft Moonshot vor, Anthropic Fable industrialisiert destilliert zu haben und droht mit Sanktionen; Chinas Handelsministerium antwortete am 28. Juli mit Kritik an „KI-Hegemonie". Die vollständige Veröffentlichung von Gewichten, Technikbericht und drei Infra-Komponenten ist ein Signal technischer Unabhängigkeit durch Engineering-Details. Drei Tage später kündigte Alibaba Qwen3.8-Max-Preview mit 24 Billionen Parametern an — der Wettbewerb chinesischer Foundation Models tritt in die „3T-Club"-Phase ein.
Wer K3 in Kimi-Code-ähnliche Langsession-Agents oder iOS-CI-Pipelines integriert, stößt auf Laptop oder instabilem Linux-VPS schnell an Speicherlimits, Session-Abbrüche und fehlende Xcode/Metal-Toolchains. Für Produktion mit stabiler SSH-Langsession, DerivedData-Cache und iOS-CI/CD-Automatisierung ist NodeMini Mac Mini Cloud-Miete meist die bessere Wahl — dedizierter Node, Provisionierung in Sekunden, Agent und Build auf derselben echten Mac-Hardware. Details: Mac Mini Mietpreise.
Streng genommen nein. Es ist ein Open-Weight-Modell: Gewichte, Technikbericht und Teile der Infra sind öffentlich, Trainingsdaten und vollständiger Trainingscode nicht — es erfüllt nicht die OSI-Definition. Moonshot verwendet in offiziellen Materialien nie open source.
In den meisten kommerziellen Szenarien ohne Einschränkung. Bei MaaS-Jahresumsatz über 20 Mio. USD oder MAU über 100 Mio./Monatsumsatz über 20 Mio. USD gelten zusätzliche Lizenzbedingungen. Deployment-Umgebung: Mac Mini Mietpreise.
Offiziell ein Supernode-Cluster mit 64 oder mehr GPUs. Für Privatpersonen und die meisten Unternehmen sind API oder Drittplattformen wie OpenRouter (derzeit sieben Anbieter) realistischer.
Stärkstes Open-Weight-Modell: AA Index weltweit #3 hinter Claude Fable 5 und GPT-5.6 Sol. Teurer als GLM-5.2 — Spitzenleistung, nicht bestes Preis-Leistungs-Verhältnis. Weitere Fragen: Hilfezentrum.
K3 hat etwa das Dreifache der K2.5-Parameter, neue Attention Residuals und Per-Head Muon, deutlich mehr Kontext und Multimodalität. Lizenz wechselte von Modified MIT zu Custom mit MaaS-Umsatzschwelle.