Kimi K3 vollständig als Open Weights
2,8 Billionen Parameter, 1M Kontext — Moonshot AIs großer Wurf

Am Abend des 27. Juli veröffentlichte Moonshot AI die vollständigen Kimi-K3-Modellgewichte und den Technikbericht sowie gleichzeitig die drei Kern-Infrastrukturen MoonEP, FlashKDA und AgentEnv als Open Source — das weltweit erste vollständig freigegebene Modell in der 3-Billionen-Parameter-Klasse. Die Hugging-Face-Gewichte umfassen ca. 1,56 TB und erreichten innerhalb von 30 Minuten Platz 1 der Trendcharts. Für Entwickler mit Fokus auf Open-Weight-Lizenzierung, MoE-Architektur und Self-Hosting-Feasibility deckt dieser Artikel ab: die 11-Tage-Zeitlinie von API-Launch bis vollständiger Gewichtsfreigabe, KDA/AttnRes/Per-Head-Muon-Architektur, drei offene Infra-Komponenten, SWE-bench- und AA-Index-Vergleiche, zwei kommerzielle Lizenzschwellen, API-Preise und die 64-GPU-Self-Hosting-Realität, eine Sechs-Schritte-Evaluierungsliste sowie FAQ. Kernergebnis: K3 ist die Leistungsobergrenze im Open-Weight-Lager, aber nicht die kosteneffizienteste Wahl — Moonshot spricht konsequent von open weight, nie von Open Source.

01

Vom API-Launch zur vollständigen Freigabe in 11 Tagen: Zeitlinie und Pain Points

Die drei häufigsten Fragen: Am 16.7. gab es schon eine API — was änderte sich am 27.7.? Wo liegt der Unterschied zwischen „Open Source" und „Open Weight"? Wie viele GPUs braucht Self-Hosting? Die folgende Zeitlinie ordnet alles.

DatumEreignis
16.7., AbendKimi K3 startet auf kimi.com, Kimi Work, Kimi Code und per API — Gewichte noch nicht öffentlich
17.7.Xinhua berichtet über das „weltweit größte Open-Source-Modell"; Branche analysiert die Architektur
22.–23.7.USA wirft Moonshot AI „industrielle Destillation" von Anthropic Fable vor und droht mit Sanktionen
27.7., 23:00Vollständige Gewichte und Technikbericht; MoonEP und AgentEnv Open Source (FlashKDA bereits zuvor)
28.7.Chinesisches Handelsministerium reagiert auf den US-China-KI-Streit; Medien berichten Open-Weight-Details

Sechs versteckte Kosten für Unternehmen

  1. 01

    Lizenz-Missverständnis: Medien schreiben „Open Source", Moonshot nutzt nie open source — Custom-Lizenz mit MaaS-Umsatz- und Anzeigepflicht-Schwellen

  2. 02

    Self-Hosting-Illusion: 1,56 TB Gewichte + 896-Experten-MoE — Consumer-GPUs scheitern; blindes Hardware-Budget ist der größte versteckte Kostenfaktor

  3. 03

    Benchmark-Missbrauch: Herstellerangaben und unabhängige Retests weichen stark ab — Vals AI, Artificial Analysis bevorzugen

  4. 04

    Cache-Preisfalle: Listenpreis Eingabe $3/M, aber Mooncake-Architektur erreicht bei Coding-Workloads über 90 % Cache-Hit — effektiv näher $0,30/M

  5. 05

    Geopolitische Compliance: US-China-Destillationsstreit plus WAIC-2026-Fenster — Gewichtsfreigabe bedeutet nicht auditierbaren Trainingsprozess

  6. 06

    Agent-Laufzeit: Langsession-Coding-Agents brauchen stabile Compute und Toolchains — Laptop oder schwacher VPS reicht für Produktions-Pipelines nicht

02

Kimi K3: Kernparameter und Architektur — KDA, AttnRes, Stable LatentMoE

MerkmalWert
Gesamtparameter2,8 Billionen (2,8T)
Aktive Parameterca. 104 Mrd.
ArchitekturMixture of Experts (MoE), 896 Routing-Experten, 16 pro Token aktiv
AttentionKimi Delta Attention (KDA) + Gated Multi-Head Latent Attention (Gated MLA)
Kontextfenster1 Mio. Token
MultimodalNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4-Gewichte + MXFP8-Aktivierungen (quantization-aware training)
Gewichtsvolumenca. 1,56 TB (Hugging Face)
LizenzCustom-Lizenz (offiziell: open weight, nicht open source)

Kimi Delta Attention (KDA): kanalweise präzises Vergessen

Klassisches Gated DeltaNet nutzt skalare Vergessens-Gates; KDA setzt auf kanalweise Gating — jede Feature-Dimension decayed unabhängig. Mit chunkwise-DPLR-Formel linearzeitliche Rekursion, abwechselnd mit wenigen Gated-MLA-Layern: 1M Token Kontext bei minimalem KV-Cache.

Attention Residuals (AttnRes): selektive Residual-Aggregation

Klassische Residuals summieren Layer-Outputs gleichmäßig — tiefe Layer verwässern frühe Information. AttnRes aggregiert input-abhängig dynamisch; pro Layer nur RMSNorm plus ein Pseudo-Query-Vektor. Ca. 25 % Trainings-Effizienzgewinn, unter 2 % Parameter-Overhead.

Per-Head Muon und Stable LatentMoE

Per-Head Muon optimiert jeden Attention-Head separat; MoE wählt 16 von 896 Experten (Sparsity ca. 1,8 %). Quantile Balancing plus MoonEP beweisen theoretische Obergrenzen redundanter Experten und lösen MoE-Load-Imbalance.

Moonshot hat Attention, Residual-Verbindung und Optimizer neu gedacht — das unterscheidet K3 von bloßem Parameter-Stacking, nicht nur die 2,8T-Skala.

03

MoonEP, FlashKDA, AgentEnv: drei Infra-Releases und Sechs-Schritte-Checkliste

Der Release liefert nicht nur Gewichte, sondern auch die drei Infrastrukturen, die K3s Trainingseffizienz tragen — ein Grund für das positive Feedback in der Developer-Community.

TechnologieRolleKernfähigkeit
MoonEPFeingranulare MoE-Kommunikation im Supernode-MaßstabTemporäres Replizieren überlasteter Experten; gleiche Token-Anzahl pro Node; theoretische Obergrenze redundanter Experten
FlashKDACUTLASS-basierter KDA-HochleistungsoperatorPrefill auf H20 1,72–2,22× schneller als Baseline; direkter chunk_kda-Backend-Ersatz
AgentEnvFirecracker-microVM-Agent-SandboxCheckpoint-Latenz 133 ms, Recovery 49 ms, Memory-Overcommit bis 6,5× (Herstellerangaben)

Sechs Schritte: Evaluierung und Integration

  1. 01

    Nutzungspfad klären: Die meisten Teams nutzen die API (`https://api.moonshot.ai/v1`, Modell-ID `kimi-k3`); Self-Hosting nur bei Data Residency, Fine-Tuning oder Hyperscale-Inferenz

  2. 02

    LICENSE Zeile für Zeile: MaaS-Jahresumsatz 20 Mio. USD und MAU 100 Mio./Monatsumsatz 20 Mio. USD Anzeigepflicht prüfen

  3. 03

    Hugging-Face-Integrität: ca. 1,56 TB, MXFP4-Format und Shard-Liste verifizieren

  4. 04

    Hardware-Schwelle: Offiziell 64+ GPUs Supernode — nicht mit Consumer-GPUs planen

  5. 05

    FlashKDA anbinden: flash-linear-attention kann chunk_kda-Backend nahtlos wechseln

  6. 06

    Unabhängige Benchmarks: Vals AI SWE-bench Verified (K3 93,4 %) und AA Index (ca. 57, weltweit #3) als Auswahlgrundlage — nicht nur Herstellerangaben

python
from openai import OpenAI
client = OpenAI(
    api_key="YOUR_MOONSHOT_KEY",
    base_url="https://api.moonshot.ai/v1"
)
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
print(resp.choices[0].message.content)
04

Benchmarks, Lizenz und Preise: K3 vs. GPT-5.6, Claude, GLM-5.2

SWE-bench Verified (Vals AI, unabhängig, Juli 2026)

ModellScoreRelease
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
GLM-5.2 (bisher #1 Open Weight)AA Index 51

Entscheidungsmatrix: Kosten vs. Fähigkeit

DimensionKimi K3Claude Fable 5GLM-5.2
AA Intelligence Indexca. 57 (weltweit #3, Open Weight #1)6051
Kosten pro Taskca. $0,95ca. $2,4ca. $0,47
Kontext1 Mio. Tokenkürzerkürzer
Gewichte downloadbarJa (1,56 TB)NeinJa
PositionierungOpen-Weight-LeistungsobergrenzeClosed Source SpitzenklasseOpen-Weight-Preis-Leistungs-Sieger
warning

Zwei kommerzielle Lizenzschwellen (neu gegenüber K2): ① MaaS-Umsatz über 20 Mio. USD in 12 aufeinanderfolgenden Monaten — separate Vereinbarung mit Moonshot erforderlich; ② MAU über 100 Mio. oder Monatsumsatz über 20 Mio. USD — „Kimi K3" prominent in der UI anzeigen. Für die meisten KMU irrelevant; bei direkter Konkurrenz zu kimi.com juristisch prüfen.

API-Preise (pro Million Token)

Token-TypPreis
Eingabe (Cache-Hit)$0,30
Eingabe (Cache-Miss)$3,00
Ausgabe (inkl. Reasoning)$15,00
05

Geopolitik und zitierbare Daten: Was K3s Open-Weight-Signal bedeutet

Die Kimi-K3-Freigabe fällt in das WAIC-2026-Fenster und den eskalierenden US-China-Streit um „Model Distillation" — Washington wirft Moonshot vor, Anthropic Fable industrialisiert destilliert zu haben und droht mit Sanktionen; Chinas Handelsministerium antwortete am 28. Juli mit Kritik an „KI-Hegemonie". Die vollständige Veröffentlichung von Gewichten, Technikbericht und drei Infra-Komponenten ist ein Signal technischer Unabhängigkeit durch Engineering-Details. Drei Tage später kündigte Alibaba Qwen3.8-Max-Preview mit 24 Billionen Parametern an — der Wettbewerb chinesischer Foundation Models tritt in die „3T-Club"-Phase ein.

Zitierbare Kerndaten

  • Skala: 2,8T Gesamtparameter, 896 Experten / 16 aktiv, ca. 104 Mrd. aktiv, 1M Token Kontext
  • Benchmarks: SWE-bench Verified 93,4 % (Vals AI); AA Index ca. 57, weltweit #3, Open Weight #1
  • Kosten: ca. $0,95 pro Task — ca. 60 % günstiger als Fable 5, teurer als GLM-5.2 ($0,47)
  • Coding: Frontend Code Arena #1; Mooncake Cache-Hit bei Coding über 90 %
  • Self-Hosting: 1,56 TB Gewichte, offiziell 64+ GPU Supernode; OpenRouter u. a. sieben Drittanbieter
  • Lizenz: Custom open weight, nicht OSI Open Source; MaaS-Umsatz- und Anzeigepflicht-Schwellen

Wer K3 in Kimi-Code-ähnliche Langsession-Agents oder iOS-CI-Pipelines integriert, stößt auf Laptop oder instabilem Linux-VPS schnell an Speicherlimits, Session-Abbrüche und fehlende Xcode/Metal-Toolchains. Für Produktion mit stabiler SSH-Langsession, DerivedData-Cache und iOS-CI/CD-Automatisierung ist NodeMini Mac Mini Cloud-Miete meist die bessere Wahl — dedizierter Node, Provisionierung in Sekunden, Agent und Build auf derselben echten Mac-Hardware. Details: Mac Mini Mietpreise.

FAQ

Häufig gestellte Fragen

Streng genommen nein. Es ist ein Open-Weight-Modell: Gewichte, Technikbericht und Teile der Infra sind öffentlich, Trainingsdaten und vollständiger Trainingscode nicht — es erfüllt nicht die OSI-Definition. Moonshot verwendet in offiziellen Materialien nie open source.

In den meisten kommerziellen Szenarien ohne Einschränkung. Bei MaaS-Jahresumsatz über 20 Mio. USD oder MAU über 100 Mio./Monatsumsatz über 20 Mio. USD gelten zusätzliche Lizenzbedingungen. Deployment-Umgebung: Mac Mini Mietpreise.

Offiziell ein Supernode-Cluster mit 64 oder mehr GPUs. Für Privatpersonen und die meisten Unternehmen sind API oder Drittplattformen wie OpenRouter (derzeit sieben Anbieter) realistischer.

Stärkstes Open-Weight-Modell: AA Index weltweit #3 hinter Claude Fable 5 und GPT-5.6 Sol. Teurer als GLM-5.2 — Spitzenleistung, nicht bestes Preis-Leistungs-Verhältnis. Weitere Fragen: Hilfezentrum.

K3 hat etwa das Dreifache der K2.5-Parameter, neue Attention Residuals und Per-Head Muon, deutlich mehr Kontext und Multimodalität. Lizenz wechselte von Modified MIT zu Custom mit MaaS-Umsatzschwelle.